从 FASTQ 到表达矩阵:生物信息学流程在做什么

从 FASTQ 到表达矩阵:生物信息学流程在做什么文章生物信息学2026-08-12
从 FASTQ 到表达矩阵:生物信息学流程在做什么
Perry刚接触转录组分析时,最容易被大量工具名称淹没。与其先背命令,不如先理解数据在每一步发生了什么变化。
1. FASTQ:测序仪输出的读段
FASTQ 文件通常以四行为一组记录一条 read:
1 | @read_001 |
四行依次对应 read 标识、碱基序列、分隔符和质量字符。质量字符经过编码后表示每个碱基被正确识别的可信程度。
这一阶段最重要的问题不是“有多少文件”,而是:
- 数据是单端还是双端;
- 每个样本对应哪些文件;
- read 长度是否一致;
- 接头和低质量碱基是否明显;
- 是否存在异常的碱基组成或重复序列。
2. 质控:先判断数据能不能用
质控报告是一张体检表。常看的指标包括每碱基质量、GC 分布、接头污染、重复比例和序列长度分布。
指标出现警告并不等于数据一定失败。比如高表达转录本可能自然带来较高重复率。正确做法是结合实验类型、文库构建方式和所有样本的整体分布判断。
3. 比对与定量:回答 reads 来自哪里
常见思路有两类:
- 将 reads 比对到参考基因组,再根据注释统计到基因或转录本;
- 直接对参考转录本进行快速定量。
两条路线都在解决同一件事:把海量短序列转换为每个基因或转录本的丰度估计。选择哪条路线取决于研究问题,而不是工具排行榜。
4. 表达矩阵:进入统计分析的入口
最终常见结果是一张矩阵:行是基因,列是样本,单元格是计数或丰度。
| gene | sample_A | sample_B | sample_C |
|---|---|---|---|
| gene_1 | 132 | 98 | 141 |
| gene_2 | 0 | 3 | 1 |
| gene_3 | 842 | 910 | 765 |
这张表还不是结论。接下来通常需要检查样本关系、过滤低表达特征、选择合适的归一化方式,并根据实验设计建立统计模型。
5. 每一步都要留下记录
一个可复现流程至少应保存:
- 输入文件及其校验信息;
- 参考序列和注释版本;
- 软件版本与参数;
- 样本信息表;
- 每一步的质控报告;
- 从原始输入到最终图表的脚本。
理解数据如何变化,比记住某一条命令更重要。工具会更新,但“输入是什么、转换做了什么、输出能回答什么”这三个问题一直有效。

