读懂一条 FASTQ 记录

BIOINFORMATICS HANDBOOK / 01

FASTQ:序列和对序列的信心

先读懂输入,再决定后续需要什么分析。示例是人工构造的四行记录,不是真实实验数据。

1. 一条典型的四行记录

1
2
3
4
@practice_read_001
ACGTACGT
+
IIIIIIII

第一行以 @ 开头,是读段标识;第二行是碱基序列;第三行以 + 开头;第四行编码每个碱基的质量。序列长度和质量字符数量必须对应。格式要求见 NCBI SRA 的 FASTQ 说明。

2. 质量分数不是“百分比”

Phred 分数定义为:

$$Q=-10\log_{10}(P_{\mathrm{error}})$$

由定义直接可算出:Q20 对应 0.01 的错误概率;Q30 对应 0.001。它描述单个碱基判读的置信度,不等同于整条 read 或整个样本的可靠性。

常见现代 FASTQ 使用 Phred+33:质量字符的 ASCII 数值减去 33 得到 Q。示例中的 I 对应 73−33=40。不要对来源不明的旧数据自动假定编码;先查数据说明。

3. 安全预览,不解压整个大文件

1
gzip -cd sample_R1.fastq.gz | head -n 8

这个命令仅用于预览两条典型四行记录。它不验证整个文件,也不是统计 read 数的通用办法。某些 shell 配置下,head 提前结束可能使上游出现 broken pipe 提示;这不等同于文件损坏。

4. 预览后还要检查什么

  • 样本编号和实验元数据是否对应;
  • 单端还是双端,R1/R2 是否正确配对;
  • 读段长度、质量和接头是否需要进一步检查;
  • 相同实验条件的样本是否存在明显离群。

不要只凭文件前八行判断测序质量。使用完整质控报告,并结合文库类型解释。工具及模块说明见 FastQC 官方项目。

小练习

把示例序列删去一个碱基但不改变质量行:为什么这条记录不再一致?再根据公式独立计算 Q10 的错误概率。

继续阅读

返回 生物信息学手册,继续阅读概念流程与质量控制章节。

引用到评论
随便逛逛博客分类文章标签
复制地址关闭热评深色模式轉為繁體