24.DrugCell:原图、模型逻辑与研究范式

24.DrugCell:原图、模型逻辑与研究范式
Perry论文题名: Predicting Drug Response and Synergy Using a Deep Learning Model of Human Cancer Cells
期刊与年份: Cancer Cell,2020。论文原文。
范围为正文全部编号主图及其子图,包含流程示意图。Extended Data 和 Supplementary Figures 不在本次范围。页码指阅读时所用 PDF 的文件页码。
阅读来源说明: Cancer Cell,2020;以当前 PDF 为准。
研究瓶颈怎样转化为问题
药物反应模型可预测但常难说明应该怎样联用。DrugCell 将肿瘤突变输入可见生物层级网络,药物结构输入常规网络,再从重要子系统提出平行通路组合。依据设计逻辑推断,idea 是把解释本身作为实验设计工具,让模型不只输出单药分数,还提出可被双基因/双药验证的机制。
输入、目标与结构
1,235 细胞系和 684 药物提供训练;0/1 突变经基因—子系统层级,Morgan 指纹经药物 ANN,融合后预测剂量–反应曲线 AUC。该 AUC 不等于分类 ROC-AUC,基因突变字典也不能代表所有表达/微环境。RLIPP 衡量子系统相对下级的增量预测能力,仍是模型解释。临床回顾性生存、细胞联用和 PDX 是不同层的外部检查,不能都称作同一疗效验证。
Figure 1:DrugCell 如何将基因型与药物结构联合建模
原图来源:所用 PDF 文件第 3 页,Figure 1。点击图片可查看原图。
| 子图 | 讲解 |
|---|---|
| A | 总体结构:基因型进入可见神经网络 VNN,药物进入常规神经网络 ANN,两路嵌入合并后预测药物反应。模型同时保留细胞通路层级,供后续解释。 |
| B | 将各基因有无突变编码为 0/1,沿细胞子系统的层级传递;每个子系统对应多个神经元。网络结构受生物知识约束,隐藏节点可以对应具体通路。 |
| C | 把药物化学结构转为 Morgan 分子指纹,经 ANN 学习药物嵌入;用于区分不同化合物及其活性特点。 |
两分支让药物化学与细胞遗传状态形成交互,生物层级使候选有可解释名称。但先验层级不保证真实通路激活被正确重建,隐藏神经元也不是直接测量分子量。实际输入只有指定突变与药物指纹,不能把示意用途扩展成包括所有肿瘤组学的模型。
Figure 2:药物反应预测有多准确
原图来源:所用 PDF 文件第 4 页,Figure 2。点击图片可查看原图。
| 子图 | 讲解 |
|---|---|
| A | 比较全部细胞系–药物配对的真实反应与预测值,箱线图显示每个预测区间的实测分布;二者总体随同变化,说明模型捕获反应强弱。这里药物反应 AUC 是剂量–反应曲线面积。 |
| B | 每点为一个药物,用真实与预测反应的 Spearman 相关比较 DrugCell 和弹性网络;对角线上方表示 DrugCell 更好,整体支持其优于线性基线。 |
| C | 同样比较 DrugCell 与参数规模匹配的黑箱神经网络;两者整体性能接近,说明引入生物层级并未明显损失预测能力。 |
| D | 与仅输入组织类型和药物的网络比较,DrugCell 明显更好;突变信息提供了组织来源之外的预测信息。 |
| E | 按相关性排序展示每个药物的预测表现,红色为相关性大于 0.5 的高置信药物;插图列出前十名。不同药物表现差异较大,不能用总体准确度替代逐药物评估。 |
逐药物相关与总体配对相关要分开;总体可被药物平均敏感度支撑。参数匹配黑箱比较检验可解释结构是否牺牲性能,组织基线则检验突变增量。高置信药物子集不能代表全部 684 药物;后续解释优先在预测可靠的药物上进行更有理由。
Figure 3:模型学到了哪些癌细胞状态及紫杉醇相关通路
原图来源:所用 PDF 文件第 6 页,Figure 3。点击图片可查看原图。
| 子图 | 讲解 |
|---|---|
| A | 把细胞基因型嵌入投影到前两个主成分,并标出 BRAF 突变;突变细胞的分布说明嵌入能够保留与药物敏感性有关的遗传状态。 |
| B | 在相同嵌入上用 selumetinib 反应着色;与 A 对照,可看到 BRAF 相关状态与 MEK 抑制剂反应相联系。 |
| C | 标出 EGFR、BRAF 或 LKB1 突变细胞,检查另一组耐药相关基因型是否在表示空间中被区分。 |
| D | 用 JQ-1 反应着色,与 C 对照说明相关突变状态对应 BET 抑制剂反应差异。灰色为未检测药物反应的细胞。 |
| E | 药物嵌入的主成分投影,按靶点类别着色;不同作用机制形成一定分层,说明化学分支学到了与药效有关的结构信息。 |
| F | 细胞嵌入按紫杉醇反应着色,展示模型表示与紫杉醇敏感/耐受状态的联系。 |
| G | 按 RLIPP 排序列出紫杉醇反应最重要的前 5% 子系统;红色突出代谢通路,提示代谢状态可能影响紫杉醇作用。RLIPP 衡量子系统相对其下级节点增加的局部预测能力。 |
| H | 将重要子系统放回层级网络,红色分支指向糖酵解相关调控;把抽象重要性排名转成可供实验检验的生物机制。 |
| I | 仅展示“响应 cAMP”子系统的嵌入并按紫杉醇反应着色;这个局部状态也能区分不同反应,支持该子系统包含相关信息。 |
| J | A427 细胞分别接受溶剂、紫杉醇、糖酵解抑制剂 2-DG 或联合处理;联合用药降低存活更明显,实验支持由代谢通路解释提出的组合。 |
PCA 与机制着色检查表征合理性,RLIPP 再定位紫杉醇相关代谢支路。糖酵解抑制和紫杉醇联用提供真实功能检验,但一个细胞例子不证明所有代谢重要节点均会协同。嵌入与通路都是候选解释,真正证据来自对应药物和细胞背景中的实际测量。
Figure 4:用双基因 CRISPR 验证重要通路
原图来源:所用 PDF 文件第 7 页,Figure 4。点击图片可查看原图。
| 子图 | 讲解 |
|---|---|
| A | 先选择预测可靠的药物,再找重要子系统,最后以双基因敲除检查这些机制是否影响细胞存活。 |
| B | 热图记录 176 个癌症基因分别与 MAP2K1、PARP1、TP53 联合敲除后的适应度曲线面积;展示用于检验通路重要性的系统性实验数据。 |
| C | trametinib 反应中排名前五的子系统及 RLIPP 分数,用于确定联合 MAP2K1 敲除的候选基因。 |
| D | olaparib 反应中排名前五的子系统,用于确定联合 PARP1 敲除的候选基因。 |
| E | nutlin-3 反应中排名前五的子系统,构成 TP53 相关验证候选。 |
| F | MAP2K1 与模型优选通路中的基因联合敲除,比与随机通路基因组合产生更低适应度;支持 trametinib 相关重要子系统具有功能意义。 |
| G | PARP1 双敲除重复同样比较,优选基因组适应度更低,支持 olaparib 相关通路的功能关联。 |
| H | TP53 双敲除的优选组与随机组无显著差异。作者指出敲除 TP53 与 nutlin-3 激活 p53 的作用方向不同,因此不能把这个阴性结果等同于药物机制不存在。 |
双基因 CRISPR 与随机通路背景比较,使‘重要’能被独立适应度实验检验。TP53 阴性提示基因敲除和药物激活方向不能互换;遗传模拟药理需核对作用方向、剂量和脱靶。MAP2K1 等结果支持对应机制,但仍限于所用细胞/实验,不是全网络每个节点都确证。
Figure 5:从重要通路提出并验证协同用药
原图来源:所用 PDF 文件第 8 页,Figure 5。点击图片可查看原图。
| 子图 | 讲解 |
|---|---|
| A | 平行通路理论:药物 A 抑制一条支路,药物 B 抑制另一条共同维持必要功能的支路,二者可能协同。 |
| B | 将该理论对应到 DrugCell:药物分支表示直接药物作用,基因型分支中的重要子系统提示可同时干预的平行通路。 |
| C | 对 25 个药物的重要子系统排序,提出成对组合,再与 DeepSynergy 的已测组合数据核对。 |
| D | 比较预测协同、预测非协同及随机组合的实测协同分数;优选组分数更高,支持模型解释能帮助筛选组合。 |
| E | 展示 etoposide 相关的重要 PI3K/ERK 子系统和阴性对照分支;它们给出 AKT、MEK 抑制剂等具体联用方向。 |
| F | 比较 etoposide 分别与 MK2206、PD325901、bortezomib 联用的 Loewe 协同分数;AKT/MEK 抑制组合总体呈协同,蛋白酶体对照没有同样效果。 |
| G | A549 细胞中以 TOP2 与 PIK3CA 或 MAP2K1 联合敲除模拟双靶点抑制;较单敲除更强地抑制生长,而 APC 阴性对照不呈相同模式。 |
| H | 以布尔电路近似六个基因的突变如何汇聚到 PI3K、ERK 状态,再影响 etoposide 反应;这是模型关系的简化解释。 |
| I | 真值表对照不同通路状态下实际敏感/耐受细胞比例;检验简化电路是否对应观察到的药物反应。 |
| J | 比较整模型、通路逻辑组合和单基因标志物的反应预测优势比;组合通路信息强于单一低频突变,显示多基因汇聚解释的价值。 |
平行通路假说通过已测组合、药理 Loewe 与双靶 CRISPR逐层检查。布尔电路是多基因汇聚的简化说明,不能代表全部连续生物过程。协同依赖采用的零假设,强抑制不必自动是协同;阴性组合和 APC 等背景控制使故事更有可证伪性。
Figure 6:联合用药预测能否延伸到 PDX 肿瘤
原图来源:所用 PDF 文件第 10 页,Figure 6。点击图片可查看原图。
| 子图 | 讲解 |
|---|---|
| A | 向模型输入患者来源异种移植 PDX 的基因型,识别单药反应的重要通路,再提出并评价联合用药。 |
| B | ROC 曲线评价区分有效与无效组合的能力,曲线下面积为 0.75;这里的 auROC 与 Figure 2 的剂量–反应 AUC 含义不同。 |
| C | 选定阈值后的混淆矩阵列出正确和错误分类,补充 B 中汇总指标在具体决策点的表现。 |
| D | 模型预测有效的两个组合,BKM120+encorafenib 和 abraxane+gemcitabine,较相应单药延长无进展生存;是在 PDX 中的验证。 |
| E | 模型预测无效的组合,如 paclitaxel+LCL161、INC280+trastuzumab,未显著改善无进展生存;展示模型对阴性组合也有一定区分能力。 |
PDX 用真实肿瘤背景增加验证层,但鼠中无进展生存不等于患者临床 PFS。ROC-AUC 0.75 是有效组合分类,与单药剂量曲线 AUC不同;混淆矩阵明确阈值错误。阴性组合展示模型有筛除作用,仍需更大及不同背景检验。
Figure 7:ER 阳性乳腺癌患者的回顾性分层
原图来源:所用 PDF 文件第 11 页,Figure 7。点击图片可查看原图。
| 子图 | 讲解 |
|---|---|
| A | 在接受 CDK4/6 或 mTOR 抑制剂的患者中,模型预测敏感组的总生存较长,支持预测与临床结局存在关联;这是回顾性患者分析。 |
| B | 列出模型用于 mTOR 抑制剂敏感性判断的重要子系统,包括 ER 及相关信号,解释该预测依赖哪些通路。 |
| C | 列出 CDK4/6 抑制剂敏感性的重要子系统,与 B 对照展示细胞周期和其他共享通路信息。 |
| D | 横纵轴分别是两类患者基因突变频率的绝对和百分比差异,点大小为总体突变频率;AKT1 等更偏向预测敏感组,ESR1、RB1、PTEN 等偏向预测不敏感组。 |
| E | 只按 AKT1 突变分组的生存曲线不呈显著差异;与 A 对照,说明单基因分层不能替代模型整合的多基因信息。 |
阅读提醒
- Figure 4 原文段落出现 MAPK1/MAP2K1 写法差异;此处按主图坐标和图注使用 MAP2K1。
- 临床生存关联和模型重要性本身不能确立每个基因的因果作用;药物组合的细胞/PDX验证与患者回顾性分析分别阅读。
回顾性接受治疗患者的敏感分层与 OS 相关,不证明用模型选择治疗会改善 OS;治疗选择、既往疗程和病情可能混杂。单 AKT1 分组不显著说明多基因整合有信息,并不独自证明模型捕捉全部原因。机制通路仍需各自实验支持。
我的理解与可迁移设计
我会借鉴先限制预测可靠范围,再从模型解释推出可失败的具体实验。AD 序列研究同样不能用高分网络自动宣称治疗;真实 MPRA 先验证 cis 效应,内源靶基因和细胞表型是后续层。模型子系统关联可帮助提出通路,但不替代 enhancer–gene 证据。资源有限时适合小模型与固定先验,成功标准应是外部功能标签和具体机制边界,而不是一次总体相关或漂亮的通路图。






