读懂一条 FASTQ 记录
读懂一条 FASTQ 记录教程2026-10-06
FASTQ:序列和对序列的信心
先读懂输入,再决定后续需要什么分析。示例是人工构造的四行记录,不是真实实验数据。
Read the complete English edition →
1. 一条典型的四行记录
1 | @practice_read_001 |
第一行以 @ 开头,是读段标识;第二行是碱基序列;第三行以 + 开头;第四行编码每个碱基的质量。序列长度和质量字符数量必须对应。格式要求见 NCBI SRA 的 FASTQ 说明。
2. 质量分数不是“百分比”
Phred 分数定义为:
$$Q=-10\log_{10}(P_{\mathrm{error}})$$
由定义直接可算出:Q20 对应 0.01 的错误概率;Q30 对应 0.001。它描述单个碱基判读的置信度,不等同于整条 read 或整个样本的可靠性。
常见现代 FASTQ 使用 Phred+33:质量字符的 ASCII 数值减去 33 得到 Q。示例中的 I 对应 73−33=40。不要对来源不明的旧数据自动假定编码;先查数据说明。
3. 安全预览,不解压整个大文件
1 | gzip -cd sample_R1.fastq.gz | head -n 8 |
这个命令仅用于预览两条典型四行记录。它不验证整个文件,也不是统计 read 数的通用办法。某些 shell 配置下,head 提前结束可能使上游出现 broken pipe 提示;这不等同于文件损坏。
4. 预览后还要检查什么
- 样本编号和实验元数据是否对应;
- 单端还是双端,R1/R2 是否正确配对;
- 读段长度、质量和接头是否需要进一步检查;
- 相同实验条件的样本是否存在明显离群。
不要只凭文件前八行判断测序质量。使用完整质控报告,并结合文库类型解释。工具及模块说明见 FastQC 官方项目。
小练习
把示例序列删去一个碱基但不改变质量行:为什么这条记录不再一致?再根据公式独立计算 Q10 的错误概率。
继续阅读
返回 生物信息学手册,继续阅读概念流程与质量控制章节。