22.State:原图、模型逻辑与研究范式

22.State:原图、模型逻辑与研究范式
Perry论文题名: Predicting cellular responses to perturbation across diverse contexts with State
期刊与年份: Cell,2026。论文原文。
范围为正文全部编号主图及其子图,包含流程示意图。Extended Data 和 Supplementary Figures 不在本次范围。页码指阅读时所用 PDF 的文件页码。
阅读来源说明: Cell,2026;以当前 PDF 为准。
研究瓶颈怎样转化为问题
单个细胞噪声很大,平均又会丢掉异质性;很多扰动模型因此预测总体表达好,却不能恢复真正变化的基因。State 把细胞集合而非单个细胞或唯一均值作为输入单位,同时建立 Cell-Eval 多终点评价。依据设计逻辑推断,idea 是让模型在集合中学习条件共享信号与细胞差异,并把‘好预测’改为实际差异分析可复现,而不只跨基因高相关。
输入、目标与结构
State Transition 以匹配背景/批次的对照细胞集和扰动标签为输入,通过自注意力预测扰动后细胞群;可直接使用表达,也可使用 State Embedding 再解码。SE 从约 167 百万观测细胞学习共享表示,ST 仍需真实扰动训练。集合中的输出细胞不是每个输入细胞的实测纵向后代。对新背景的泛化与完全新药物/基因冷启动要分开;药物转遗传模态更是额外近似。
Figure 1:State 的集合建模
原图来源:所用 PDF 文件第 3 页,Figure 1。点击图片可查看原图。
| 子图 | 讲什么,以及怎样理解 |
|---|---|
| A | 说明细胞异质性、批次与噪声混杂扰动信号,需要对总体和个体联合建模。 |
| B | State Embedding(SE)从观测资料学习细胞表示,State Transition(ST)建模基因、细胞及细胞群的扰动变化,输出可做差异分析的转录组。 |
| C | ST 输入按条件匹配的未扰动细胞集合与扰动标签,直接预测表达或预测 SE 嵌入再解码。 |
| D | 改变集合大小比较验证损失;Tahoe 中约 768 细胞最好,自注意力集合模型优于均值池化、单细胞或去注意力变体。 |
集合大小与去注意力/均值变体消融检验为什么需要群体信息。约 768 最好是特定 Tahoe 数据和预算下的结果,不应当通用默认。细胞集合增加信息也可能把批次和细胞组成编码进去,匹配协变量与留出研究很重要。集合内数百细胞不代表数百独立供体,数据单位必须随目标区分。
Figure 2:跨细胞背景的扰动预测
原图来源:所用 PDF 文件第 5 页,Figure 2。点击图片可查看原图。
| 子图 | 讲什么,以及怎样理解 |
|---|---|
| A | 在少代表目标背景留出大部分扰动,介绍扰动均值与背景均值两简单参照。 |
| B | 化学、信号及基因扰动资料分别训练/测试,比较线性、GEARS、CPA、scVI、scGPT 等。 |
| C | Cell-Eval 同时评价表达与差异基因,避免仅靠基线表达相关判断预测质量。 |
| D | 扰动判别的标准化排名,检验预测是否能区分不同扰动。 |
| E | 预测/真实扰动后表达变化 Pearson 相关,检验响应方向。 |
| F | DEG 分类 AUPRC,检验是否识别真正变化的基因。 |
| G | 完整 DEG 精确率—召回曲线,展示阈值变化的权衡。 |
| H | 显著 DEG 的 log fold-change Spearman 相关,检验效应排序;遗传扰动中优势较有限。 |
| I | 预测显著与真实显著基因的重叠比例,检查实际差异分析的复现。 |
| J | 总体扰动效应大小的 Spearman 相关,以 DEG 数量评价强弱排序。 |
| K | 真实/预测 DEG 数量的混淆矩阵,展示弱到强扰动的量级恢复。 |
两个简单均值参照很关键:模型需超越‘该扰动平均怎样’和‘该背景平均怎样’。变化相关、DEG AUPRC、LFC 与效应大小评价各有不同分母,不能用其中一个替代全部。遗传扰动优势较有限也应保留;显著性受细胞数和方差影响,预测显著基因多并不自然更好。Cell-Eval 的价值在于使常被终点相关掩盖的失败显现。
Figure 3:SE 与零样本迁移
原图来源:所用 PDF 文件第 7 页,Figure 3。点击图片可查看原图。
| 子图 | 讲什么,以及怎样理解 |
|---|---|
| A | 控制细胞先经 SE 嵌入,ST 预测分布位移,再解码回基因表达,构成跨资料可用的表示。 |
| B | 分别以真实嵌入的分类准确率、ST 预测嵌入的分类准确率评价表示内在及预测用途。 |
| C | 在两留出扰动数据比较 SE 与 scFoundation、scGPT、UCE、Transcriptformer 等,SE 在两评价上较强。 |
| D | 目标背景完全未见扰动时,SE+ST 与高变基因直接 ST 比较,多数指标改善。 |
| E | 将 trametinib 模拟药物响应与遗传扰动嵌入匹配,找出 PTPN11、RAF1、SHOC2 等 MEK 相关成员,提供机制线索。 |
| F | Tahoe 预训练后在新查询数据微调,并完全留出其中一个背景的扰动,展示跨实验评估设计。 |
| G | 五查询数据未见背景中的总体效应排序表现,检查迁移学习是否有效。 |
真实嵌入可分性与预测嵌入可分性分开,检验 SE 不只是聚类好看,而是否帮助 ST。目标背景无扰动仍有观测对照,其‘零样本’范围应清楚;新查询研究微调与留出又不同。trametinib 和 MEK 相关遗传嵌入匹配为机制线索,不能单凭向量邻近证明相同靶点。跨实验验证比随机留出细胞更接近真实使用。
Figure 4:细胞特异响应及实际表型
原图来源:所用 PDF 文件第 10 页,Figure 4。点击图片可查看原图。
| 子图 | 讲什么,以及怎样理解 |
|---|---|
| A | 用预测寻找同一扰动在不同细胞中的特异变化,说明应用目标。 |
| B | 与背景均值、扰动均值比较 DEG 重叠,检查能否预测两种均值无法解释的特异响应。 |
| C | 比较 DEG log fold-change 的 Spearman 相关,trametinib 留出例子体现优势。 |
| D | trametinib 0.5 μM 后 2,000 高变基因的真实/预测显著性,State 更贴合变化强度。 |
| E | 同一处理的真实显著基因 log fold-change 比较,检验方向及幅度。 |
| F | 五留出细胞系前 100 差异基因真实/预测模式,说明每个细胞系的特有反应。 |
| G | 预测细胞周期评分与真实值比较,State 比扰动均值更好恢复 G2/M 和 S 相。 |
| H | 跨药物浓度的表达响应相似性热图,与真实聚类 ARI 对比;State 更好捕捉扰动之间关系。 |
| I | 用预测表达回归细胞存活率,与实测活性比较,说明转录组预测对表型的可用性。 |
细胞特异 DEGs、细胞周期和存活率使表达模型接近功能解释。存活回归还需要相应真实标签,不能把 RNA 模型称作直接无监督存活预测。0.5 μM 示例应与各背景汇总一起读;异常程序可能依赖剂量和细胞遗传状态。不同药物关系的聚类改善说明有响应结构,不证明所有药理机制均已准确复原。
Figure 5:计算实验与跨模态探索
原图来源:所用 PDF 文件第 12 页,Figure 5。点击图片可查看原图。
| 子图 | 讲什么,以及怎样理解 |
|---|---|
| A | 从留出实验提取细胞系特异基因程序,比较真实与预测的程序活性变化。 |
| B | 不同通路的程序效应一致性,检验模型捕捉协调响应而非孤立基因。 |
| C | 与两个均值参照比较程序级表现,展示上下文建模的收益。 |
| D | 给定目标表达状态,评价正确扰动出现在前 k 候选的比例,检验反向实验设计。 |
| E | 把第一药物预测状态再输入模型模拟第二药,减去单药相加得到非加性效应。 |
| F | COLO205 的 abiraterone 组合及 HS578T 的 celecoxib 组合与 DrugComb 协同指标相关,提供组合预测的外部证据。 |
| G | 把遗传扰动近似为药物嵌入线性组合,无需再训练模拟新的扰动模态。 |
| H | 2,024 遗传扰动在 50 细胞系的预测效应热图,出现功能基因与组织/突变背景相关聚类。 |
| I | 模拟遗传扰动的存活效应与 DepMap CRISPR 必需性比较,检验从药物训练信息转移到遗传干预;此类模拟仍是近似。 |
反向寻找扰动、顺序药物模拟和药物近似遗传是更强外推。第二药输入第一药预测状态,可能累积误差;减单药相加的表达非加性与 DrugComb 协同终点相关,是外部支持而非完全同一标签。50 细胞系×2,024 基因地图仍为预测;DepMap 一致性支持部分模态迁移,不能将每条候选关系视作实测必需性。
我的理解与可迁移设计
最可迁移的是评价框架和对简单均值的警惕。AD 观察数据很容易让模型凭细胞类型、年龄或批次预测终点,却没预测病理增量。应按供体/研究留出,报告差异方向、幅度和不确定性。State 的大规模 SE 训练不适合首轮单卡复制,可用已有表示或小集合基线。DNA×AD 若缺真实等位或环境配对,细胞集合模型不会自动填补这些标签;先有明确功能终点,再选择能够解释该终点的输入与验证。




