18.scGPT:原图、模型逻辑与研究范式

论文题名: scGPT: toward building a foundation model for single-cell multi-omics using generative AI

期刊与年份: Nature Methods,2024。论文原文。

范围为正文全部编号主图及其子图,包含流程示意图。Extended Data 和 Supplementary Figures 不在本次范围。页码指阅读时所用 PDF 的文件页码。

返回专题总目录

阅读来源说明: Nature Methods,2024;以当前 PDF 为准。

研究瓶颈怎样转化为问题

单细胞输入不是自然有顺序的文字,既包含基因身份又包含表达和实验条件。scGPT 研究如何为这种数据设计生成式预训练,使同一表征可适配注释、整合和扰动。依据设计逻辑推断,idea 是用特殊注意力遮罩及多层嵌入处理非顺序组学,而不是直接把表达矩阵当普通文本。预训练覆盖约 33 百万正常人细胞,疾病任务还需要具体数据和微调。

输入、目标与结构

scGPT 同时输入基因身份、表达数值和实验条件。基因名字映射成词表编号;表达在每个细胞内部按分位区间分箱,最高箱表示该细胞里表达最高的一部分基因;扰动等条件再有自己的编号。这三份嵌入相加后进入 Transformer。与 Geneformer 主要以排序承载数值不同,scGPT 保留一个单独的数值通道,但分箱值仍是相对尺度。示意而言,同一基因 A 可以输入为“A+高表达箱+未扰动”或“A+低表达箱+被扰动”,身份相同而状态信息不同;箱号不是 RNA 分子数。

预训练的关键是已知基因身份,遮住一部分表达值,再预测这些值。它没有自然语言中的固定“下一个基因”:细胞中的基因顺序可以交换。作者设计注意力遮罩,让待预测基因读取已知表达的基因、细胞 token 和自身身份,不能偷看其他未知基因的隐藏答案。输出头用均方误差对照真正的表达分箱值。gene-prompt 用已知基因值提供上下文;cell-prompt 进一步让上一阶段形成的细胞表示承载生成信息。推理可迭代补全高置信表达并将其加入下一轮上下文。预训练约 33 百万正常人细胞,训练学的是表达模式的统计关系。

下游目标有实质区别:注释用细胞表示与真实类别训练分类头;整合加入表达重建、表示及批次相关约束;扰动预测则输入对照表达和扰动标记,以真实扰动后表达监督全部基因。预训练并未见过每个 CRISPR 效应,不能省掉这一步。本文的网络探索再利用 token 相似性或注意力变化,与通路、ChIP-Atlas 对照。模型输入仍为组学状态,不直接读取致病 DNA 序列。

Figure 1:scGPT 的预训练框架

Figure 1

原图来源:所用 PDF 文件第 3 页,Figure 1。点击图片可查看原图。

子图 讲什么,以及怎样理解
a 大规模细胞图谱预训练 Transformer,之后针对注释、批次、组学、扰动和网络任务微调,展示应用流程。
b 输入由基因 token、表达值及模态/批次/扰动条件三层嵌入构成,说明细胞信息如何编码。
c 特殊注意力遮罩支持掩码/生成预训练,展示 Transformer 层内部结构。
d 33 百万正常人细胞的数量与器官来源,说明预训练覆盖范围。
e 预训练细胞嵌入的 UMAP 按大类细胞着色,检查表征是否保留细胞身份。

a 区分“图谱预训练”和“新数据微调”,意味着共用的是起始表征,任务最终怎么评分取决于具体训练头。b 把 gene、expression、condition 分成通道,使同一个基因的身份与当前值不会混为一枚名字;c 的遮罩决定训练时哪些信息可见,是防止表达补全偷看目标的关键。d 的器官数量显示脑和血液占比较大,不能由总数推断每种稀有细胞同样充分。e 是预训练细胞表示的 UMAP,邻近表示统计上相似,坐标轴没有解剖距离或病理时间单位。后续注释、扰动与整合分别检验这份表征能否被不同监督使用,e 的分群仅是第一层合理性检查。

Figure 2:细胞类型注释

Figure 2

原图来源:所用 PDF 文件第 4 页,Figure 2。点击图片可查看原图。

子图 讲什么,以及怎样理解
a 胰腺实测注释与预测注释 UMAP 对照,直观检查细胞群归类。
b 胰腺混淆矩阵定量显示哪些类别正确、哪些容易混淆。
c 胰腺 512 维细胞嵌入热图,展示类别相关表征。
d 髓系参考/查询数据按癌症来源着色,说明查询包含训练未见癌种。
e 查询髓系细胞原始/预测注释 UMAP,检验跨癌症背景泛化。
f 多发性硬化数据的注释混淆矩阵,检验另一疾病场景。
g 多发性硬化细胞嵌入热图,检查类别分离。
h 髓系数据混淆矩阵,量化 e 中注释误差。
i 髓系细胞嵌入热图,说明学到的细胞特征。
j 三数据集五次划分的测试性能均值及误差,与其他方法比较整体表现。

a/e 的原注释与预测着色回答“有没有把主要细胞群认出来”;b/f/h 的混淆矩阵更具体地显示哪些相近类别混淆。c/g/i 的热图横向展开 512 维表示,它不是 512 个可直接命名的标记基因。d 将髓系参考和查询按癌症来源画出,查询含参考未见的癌种,因此检验了背景变化下细胞身份能否保留。j 分开画 accuracy、precision、recall 和 macro-F1:accuracy 可能受多数类支配,macro-F1 对各类别等权,更能发现稀有类别没有被识别。图里的五次划分误差体现内部稳定性;对 AD 的迁移应继续按供体/研究留出,而非把同一供体细胞分散到训练和测试。

Figure 3:扰动预测及反向寻找扰动

Figure 3

原图来源:所用 PDF 文件第 5 页,Figure 3。点击图片可查看原图。

子图 讲什么,以及怎样理解
a 比较预测与实测表达变化的 Pearson 相关,分全基因及主要差异基因,评价真实响应。
b KCTD16、DAD1 扰动的前 20 个差异基因真实/预测变化分布,检验方向、幅度及细胞异质性。
c 模型模拟训练未见的扰动响应示意。
d 预测扰动条件的表达 UMAP,按聚类及主要扰动基因标记,展示表型空间。
e 在扰动 UMAP 上显示 KLF1/CNN1 表达,解释不同表型群的基因模式。
f 20 基因组合空间中标出训练、验证、测试及未见组合,以及反向搜索的候选,说明从目标表达寻找可能扰动。
g 比较 scGPT、GEARS 和简单差异基因基准的 top-1 到 top-8 命中率,区分完全正确与至少一个基因相关的候选。

a 比较的不是治疗后表达原值,而是相对对照的变化量 Δexpression;全基因和最明显的 20 个差异基因分开评价,防止不响应的大量基因抬高相关。b 的纵轴同样是表达变化,DAD1/KCTD16 实测与预测的小提琴帮助发现方向正确但幅度偏小的情况。c–e 把多个扰动组合的预测表达投到 UMAP,并以 KLF1/CNN1 模式解释表型群,它们是模拟的响应集合。f/g 的反向任务更具体:20 个基因形成 210 种单/双扰动候选,用真实留出响应作查询,在预测响应库中按表达距离搜索并由细胞投票排序。完整找回两个基因和只找回其中一个,分别作为 exact/relevant 命中率,不能合并成“成功恢复机制”。该设计把生成模型变成可评价的检索系统,范围仍限定给定候选库。

Figure 4:批次及多组学整合

Figure 4

原图来源:所用 PDF 文件第 7 页,Figure 4。点击图片可查看原图。

子图 讲什么,以及怎样理解
a PBMC 10k 的细胞嵌入 UMAP,比较细胞群聚类保留情况。
b 在配对 RNA/ATAC 的 PBMC 比较 scGPT、scGLUE 和 Seurat,检查联合模态能否恢复细胞类别。
c 在配对 RNA/蛋白 BMMC 比较 scGPT 和 Seurat,检验另一组学组合。
d 在镶嵌 RNA/ATAC/蛋白数据中按批次和类别着色,检查批次混合与生物类别保留能否兼顾。

a 比较 PBMC 表示的生物类别保留,b/c 分别换成同细胞配对 RNA/ATAC 与 RNA/蛋白;同细胞测量提供直接的跨模态对应。d 则为镶嵌数据,需利用部分模态重叠连接不同批次,难度和监督信息都不同。图中的 AvgBIO 衡量生物结构保留,AvgBATCH 衡量批次消除,两者需要一起看:把所有细胞揉成一团能提高混合,却毁掉类型差异。scGPT 在这些图中是经过任务微调的模型,不是直接使用原始预训练 UMAP。用于 AD,应让模型保留与病理相关且可重复的状态,同时消除技术批次;图中免疫数据的成功并不自动给出该判别。

Figure 5:基因 token 表示中的功能程序

Figure 5

原图来源:所用 PDF 文件第 8 页,Figure 5。点击图片可查看原图。

子图 讲什么,以及怎样理解
a 零样本基因嵌入中 HLA 关系网络,检查预训练是否捕捉免疫基因关联。
b 微调前后 CD 基因网络对比,显示任务数据改变相关结构。
c 免疫细胞中基因程序的平均表达,检验提取模块是否具有细胞类型特异活性。
d 与共表达方法比较不同聚类分辨率下的富集通路数量,评价模块的功能一致性。
e 通路交集及差异,列出 scGPT 独有的适应性免疫相关通路;更多通路代表互补信息,并非自动证明调控因果。

a 将 HLA 基因 token 的相似性连成网络,检查共享免疫功能是否在预训练中留下结构;b 比较微调前后的 CD 基因,检查任务资料怎样更新该结构。c 将模块基因的实测平均表达放回不同免疫细胞,连接“表示聚成一组”与“在某类细胞活跃”两个层面。d 横轴改变 Leiden 分辨率,纵轴为富集通路数,考察结果是否只是一次任意聚类的产物;e 显示与共表达方法重叠和互补的通路。更多富集可以提示较完整程序,也会受模块数量、基因数与数据库重叠影响,所以最可迁移的验证是留出数据中该模块仍有对应表达,而不是挑选最多通路的分辨率。

Figure 6:注意力与扰动相关网络

Figure 6

原图来源:所用 PDF 文件第 9 页,Figure 6。点击图片可查看原图。

子图 讲什么,以及怎样理解
a 比较对照、扰动及两者差异的注意力排名,筛选最受影响基因,作为网络探索流程。
b DDIT3 抑制后的基因连接热图、ChIP-Atlas 靶网络、基因集合交集和 Reactome 富集;多种视角对应不同状态网络。
c BHLHE40 抑制的同类分析,检查方法对另一 TF 的适用性。

a 从对照和扰动状态分别提取注意力,再做行、列排名,选择对照、扰动及两者差异下最受影响的基因。差异策略更关注“扰动改变了谁”,对照策略更接近“原本关注谁”。b/c 的连接热图看前 20 个基因的变化,网络图以紫色标出 ChIP-Atlas 支持的靶;Venn 改用前三种策略各前 100 个基因,通路热图颜色是与 Reactome 的基因重叠比例。这些面板各自的分母不同,不能把热图颜色当成靶基因数。DDIT3 与 BHLHE40 两例表明选择策略会改变得到的程序,外部 ChIP 证据使假说可核查;注意力变化仍不等于 TF 结合强度变化,应据此安排有具体基因和读出的后续验证。

我的理解与可迁移设计

我会把 scGPT 用作可比较的表达表征,而不以基础模型名义省略标签和基线。AD 项目先固定供体切分、细胞类型、目标病理或扰动终点,再比较简单 pseudobulk/线性模型与微调,确认收益不来自批次。若要连接 DNA 或 TE,需另行输入序列并有真实等位功能数据,不能从免疫通路嵌入直接推出哪个位点导致变化。所有生成或反向搜索结果应标为候选,并保留失败类别;网络漂亮与机制证实之间,还需要指定实验。

继续阅读与公开资源