52.SCFM-ZeroShot:原图、模型逻辑与研究范式

52.SCFM-ZeroShot:原图、模型逻辑与研究范式
Perry论文题名: Zero-shot evaluation reveals limitations of single-cell foundation models
期刊与年份: Genome Biology,2025。论文原文。
范围为正文全部编号主图及其子图,包含流程示意图。Extended Data 和 Supplementary Figures 不在本次范围。页码指阅读时所用 PDF 的文件页码。
研究问题: 不做任务微调时,Geneformer 和 scGPT 的单细胞表示、批次整合及表达重建是否优于较简单方法?
为什么这篇评估值得单独读
单细胞基础模型常把预训练细胞数量作为潜力的证据,但探索性分析没有现成的细胞类别标签,使用者可能只想直接提取表征。论文因此检验一个具体承诺:未经任务微调的表征,是否能保留生物差异并降低批次影响。我的推测是,构思的关键在于把“基础模型有用”拆成可否定的问题:若预训练学到可迁移结构,冻结后的细胞嵌入应能帮助探索;若没有,继续检查预训练重建任务,区分目标与用途不匹配和目标本身没有学好。
这篇提出的还有一个容易被忽视的接口问题:预训练网络输出大量基因嵌入,怎样变成一个细胞向量本身就是设计选择。平均所有基因可能强调共有背景,分箱又会改变表达距离。若下游信号恰好被汇总或离散化削弱,增加预训练数据未必解决。应当检验这种转换是否保留目标所需的信息,而不是把网络内部任意一层都视为“生物表征”。
对疾病探索尤其如此。批次校正的目标不是让所有供者彻底混在一起:真实的供者病理差异可能是研究对象。若疾病严重程度与实验批次重合,单凭混合度无法知道校正去掉了技术噪声还是病理。需要独立设计、平衡抽样或外部病理指标来判断。本文评价粗细胞类别和来源,有助于建立最低要求;进一步的疾病应用仍需另外设置供者层面的真值,不能直接沿用一个聚类分数作为全部证据。
模型接口与比较条件
Geneformer将细胞表达转成基因排序序列,以掩码任务恢复被遮蔽基因,再平均基因嵌入得到细胞表征。scGPT联合表示基因身份和分箱表达,用掩码表达预测及细胞嵌入参与的重建训练。它们通过自监督目标学习,没有在这次细胞类别任务上使用标签微调。类别标签在此用于评价表征,不能因为计算了类别分离分数就把预训练改称监督分类。
比较对象包括2000个高变基因、Harmony和scVI。一个必须保留的条件是:基础模型冻结使用,而Harmony、scVI在每个评价数据集上拟合。论文比较的是现成零样本基础表征与常规数据分析流程的实际效用,并非所有方法拥有完全相同的训练预算。若研究者本来就能在新数据上无监督拟合,后者是合理而强的实用基线;若目标是完全不再训练,还需另外约束比较条件。
五个数据集覆盖胰腺、不同规模PBMC、免疫资料和Tabula Sapiens。这里存在部分预训练重叠:例如部分胰腺资料对Geneformer可见,Tabula Sapiens及免疫资料进入过scGPT预训练。已经见过并不保证表征领先,而见过后表现好也不能独立证明新组织泛化。模型版本、提取嵌入的方法和预处理均属于结论条件,不能从本评估推出未来所有基础模型都无效。
如何理解“好表征”
细胞类别保留与批次混合必须一起看。混合很好可能只是抹去生物差异,类别分开很好可能只是不同实验恰好含不同细胞。论文同时看BIO指标和批次指标,并用同一胰腺嵌入分别按细胞类别与批次着色。这是一个有力的控制:读者不必从单张漂亮UMAP自行猜测分群原因。
更深的难点在于无监督任务的评价需要外部真值,但真值也有粒度。粗细胞类别可以检验基本组织结构,不能证明模型已保留细胞内的病理响应;标签又可能依赖已有聚类流程。因而分数差异需要在多种资料与指标下解释。作者对预训练集规模比较也保留限制:较小模型常用组织专属数据,规模与组成同时变化,不能只把差异归因于多了多少细胞。
Figure 1|零样本细胞嵌入与批次效应
原图来源:所用 PDF 文件第 2 页,Figure 1。点击图片可查看原图。
A定义比较范围,B显示基础嵌入在细胞类型保留上没有一致超过常规方法;C、D把胰腺的同一空间分别按类型和来源着色,发现一些结构仍主要受批次驱动。E再用批次指标量化,部分复杂资料上的scGPT有相对优势,但这些资料的预训练重叠限制了独立泛化解释。这个图的动机是把“有嵌入”提升到“嵌入对用途有帮助”的检查,而非只比较压缩后的可视化效果。
读图时不应把每个数据集的第一名累加成模型排行榜。BIO与batch指标存在取舍,完整维度和降维后评价也可能出现不同排序。对于基础模型,零样本表现较差意味着不能直接假设它适合作发现底座,并不否定标签充足时的微调效果。对于scVI和Harmony,良好表现支持常规拟合流程的价值,却不能宣称其冻结后也能直接跨组织应用。
| 子图 | 讲解 |
|---|---|
| A | 在五个数据集上比较 Geneformer、scGPT 与 HVG、Harmony、scVI,任务是不额外微调的细胞类型分离和批次整合。 |
| B | 平均 BIO 分数衡量保留细胞类型生物结构;两个基础模型未稳定超过简单方法,个别数据集表现例外。 |
| C | 胰腺数据的 UMAP 按细胞类型着色,查看不同细胞是否形成清楚的群。 |
| D | 同一 UMAP 按批次着色;基础模型的主要结构仍受技术批次影响,结合 C 可判断分群是否真是细胞类型。 |
| E | 批次整合分数量化可视观察,Geneformer 较差,scGPT 随数据集变化;整合和保留生物差异需同时评价。 |
Figure 2|表达重建与简单平均基线
原图来源:所用 PDF 文件第 5 页,Figure 2。点击图片可查看原图。
A、B对scGPT分别检查不依赖和依赖细胞嵌入的表达重建,后者有所改善,前者容易接近平均分箱值;C看Geneformer恢复基因排序时的误差与异常预测。D、E加入平均表达或平均排序的朴素预测,使“重建有相关”不再自动成为复杂模型学到结构的证据。如果平均值本来就强,模型需要证明它利用细胞特异的上下文提高了预测。
这组实验是在两个候选解释之间寻找证据。即使掩码重建准确,也不能保证平均基因嵌入适合细胞聚类,因为目标和汇总方式可能不一致;重建不够好则说明预训练接口本身仍有改进空间。它没有直接分析扰动因果或AD进展,也没有证明所有注意力关系是假信号。更准确的结论是,这些版本在测试设置下的重建与零样本表征能力不足以支撑未经验证的通用生物知识宣称。
| 子图 | 讲解 |
|---|---|
| A | scGPT 的 MLM 直接基因表达预测 GEP 对不同真实分箱倾向输出平均值,难以还原表达变化。 |
| B | 利用细胞嵌入的 GEPC 重建稍好,尤其较高真实表达值,说明细胞信息提供一定帮助。 |
| C | Geneformer 的预测排名对真实排名散点;存在部分一致性,也有预测输入中不存在基因等困难。 |
| D | 不同数据集 MSE 对比简单平均表达基线;scGPT 不用嵌入更差,用嵌入仅有限改善。 |
| E | Geneformer 真实与预测排名的 Pearson 相关与平均排名基线比较,显示重建质量在数据集间不稳定。 |
阅读说明
- 结论限定于论文测试的模型版本、五个数据集和零样本任务;不等同否定其微调后能力。部分评价数据曾参与预训练,是作者指出的泛化解释限制。
依据:对应主图、完整图注及正文 Results;实验结果只按本文给出的对象和条件解释。
我从证据链得到的启发
我会把这篇作为AD无监督项目的起点约束:先让PCA、高变基因、scVI或PeakVI建立可解释基线,再问冻结基础嵌入是否增加病理相关信息。训练时不输入诊断标签,评价时可用独立供者的病理、细胞组成和批次信息检验表征。还要检查同细胞类型内部是否保留与病理有关的变化,不能只靠大类细胞分得开证明疾病机制。
一种可复用的负对照是打乱细胞上下文、只用平均表达或随机初始化嵌入,观察模型的优势是否仍存在。若依赖的主要是基因全局频率,就应诚实描述为有效压缩,而非发现了调控网络。若预训练表征只在微调后有用,应报告微调所需标签与资源,并与同样标签预算的轻量模型比较。对16GB显存设备,这也提供实用路径:不用先训练巨型模型,而是明确表征目标、建立负对照和外部验证,以较小模型研究真实的病理结构。

