24.DrugCell:原图、模型逻辑与研究范式

论文题名: Predicting Drug Response and Synergy Using a Deep Learning Model of Human Cancer Cells

期刊与年份: Cancer Cell,2020。论文原文。

范围为正文全部编号主图及其子图,包含流程示意图。Extended Data 和 Supplementary Figures 不在本次范围。页码指阅读时所用 PDF 的文件页码。

返回专题总目录

阅读来源说明: Cancer Cell,2020;以当前 PDF 为准。

研究瓶颈怎样转化为问题

药物反应模型可预测但常难说明应该怎样联用。DrugCell 将肿瘤突变输入可见生物层级网络,药物结构输入常规网络,再从重要子系统提出平行通路组合。依据设计逻辑推断,idea 是把解释本身作为实验设计工具,让模型不只输出单药分数,还提出可被双基因/双药验证的机制。

输入、目标与结构

1,235 细胞系和 684 药物提供训练;0/1 突变经基因—子系统层级,Morgan 指纹经药物 ANN,融合后预测剂量–反应曲线 AUC。该 AUC 不等于分类 ROC-AUC,基因突变字典也不能代表所有表达/微环境。RLIPP 衡量子系统相对下级的增量预测能力,仍是模型解释。临床回顾性生存、细胞联用和 PDX 是不同层的外部检查,不能都称作同一疗效验证。

Figure 1:DrugCell 如何将基因型与药物结构联合建模

Figure 1

原图来源:所用 PDF 文件第 3 页,Figure 1。点击图片可查看原图。

子图 讲解
A 总体结构:基因型进入可见神经网络 VNN,药物进入常规神经网络 ANN,两路嵌入合并后预测药物反应。模型同时保留细胞通路层级,供后续解释。
B 将各基因有无突变编码为 0/1,沿细胞子系统的层级传递;每个子系统对应多个神经元。网络结构受生物知识约束,隐藏节点可以对应具体通路。
C 把药物化学结构转为 Morgan 分子指纹,经 ANN 学习药物嵌入;用于区分不同化合物及其活性特点。

两分支让药物化学与细胞遗传状态形成交互,生物层级使候选有可解释名称。但先验层级不保证真实通路激活被正确重建,隐藏神经元也不是直接测量分子量。实际输入只有指定突变与药物指纹,不能把示意用途扩展成包括所有肿瘤组学的模型。

Figure 2:药物反应预测有多准确

Figure 2

原图来源:所用 PDF 文件第 4 页,Figure 2。点击图片可查看原图。

子图 讲解
A 比较全部细胞系–药物配对的真实反应与预测值,箱线图显示每个预测区间的实测分布;二者总体随同变化,说明模型捕获反应强弱。这里药物反应 AUC 是剂量–反应曲线面积。
B 每点为一个药物,用真实与预测反应的 Spearman 相关比较 DrugCell 和弹性网络;对角线上方表示 DrugCell 更好,整体支持其优于线性基线。
C 同样比较 DrugCell 与参数规模匹配的黑箱神经网络;两者整体性能接近,说明引入生物层级并未明显损失预测能力。
D 与仅输入组织类型和药物的网络比较,DrugCell 明显更好;突变信息提供了组织来源之外的预测信息。
E 按相关性排序展示每个药物的预测表现,红色为相关性大于 0.5 的高置信药物;插图列出前十名。不同药物表现差异较大,不能用总体准确度替代逐药物评估。

逐药物相关与总体配对相关要分开;总体可被药物平均敏感度支撑。参数匹配黑箱比较检验可解释结构是否牺牲性能,组织基线则检验突变增量。高置信药物子集不能代表全部 684 药物;后续解释优先在预测可靠的药物上进行更有理由。

Figure 3:模型学到了哪些癌细胞状态及紫杉醇相关通路

Figure 3

原图来源:所用 PDF 文件第 6 页,Figure 3。点击图片可查看原图。

子图 讲解
A 把细胞基因型嵌入投影到前两个主成分,并标出 BRAF 突变;突变细胞的分布说明嵌入能够保留与药物敏感性有关的遗传状态。
B 在相同嵌入上用 selumetinib 反应着色;与 A 对照,可看到 BRAF 相关状态与 MEK 抑制剂反应相联系。
C 标出 EGFR、BRAF 或 LKB1 突变细胞,检查另一组耐药相关基因型是否在表示空间中被区分。
D 用 JQ-1 反应着色,与 C 对照说明相关突变状态对应 BET 抑制剂反应差异。灰色为未检测药物反应的细胞。
E 药物嵌入的主成分投影,按靶点类别着色;不同作用机制形成一定分层,说明化学分支学到了与药效有关的结构信息。
F 细胞嵌入按紫杉醇反应着色,展示模型表示与紫杉醇敏感/耐受状态的联系。
G 按 RLIPP 排序列出紫杉醇反应最重要的前 5% 子系统;红色突出代谢通路,提示代谢状态可能影响紫杉醇作用。RLIPP 衡量子系统相对其下级节点增加的局部预测能力。
H 将重要子系统放回层级网络,红色分支指向糖酵解相关调控;把抽象重要性排名转成可供实验检验的生物机制。
I 仅展示“响应 cAMP”子系统的嵌入并按紫杉醇反应着色;这个局部状态也能区分不同反应,支持该子系统包含相关信息。
J A427 细胞分别接受溶剂、紫杉醇、糖酵解抑制剂 2-DG 或联合处理;联合用药降低存活更明显,实验支持由代谢通路解释提出的组合。

PCA 与机制着色检查表征合理性,RLIPP 再定位紫杉醇相关代谢支路。糖酵解抑制和紫杉醇联用提供真实功能检验,但一个细胞例子不证明所有代谢重要节点均会协同。嵌入与通路都是候选解释,真正证据来自对应药物和细胞背景中的实际测量。

Figure 4:用双基因 CRISPR 验证重要通路

Figure 4

原图来源:所用 PDF 文件第 7 页,Figure 4。点击图片可查看原图。

子图 讲解
A 先选择预测可靠的药物,再找重要子系统,最后以双基因敲除检查这些机制是否影响细胞存活。
B 热图记录 176 个癌症基因分别与 MAP2K1、PARP1、TP53 联合敲除后的适应度曲线面积;展示用于检验通路重要性的系统性实验数据。
C trametinib 反应中排名前五的子系统及 RLIPP 分数,用于确定联合 MAP2K1 敲除的候选基因。
D olaparib 反应中排名前五的子系统,用于确定联合 PARP1 敲除的候选基因。
E nutlin-3 反应中排名前五的子系统,构成 TP53 相关验证候选。
F MAP2K1 与模型优选通路中的基因联合敲除,比与随机通路基因组合产生更低适应度;支持 trametinib 相关重要子系统具有功能意义。
G PARP1 双敲除重复同样比较,优选基因组适应度更低,支持 olaparib 相关通路的功能关联。
H TP53 双敲除的优选组与随机组无显著差异。作者指出敲除 TP53 与 nutlin-3 激活 p53 的作用方向不同,因此不能把这个阴性结果等同于药物机制不存在。

双基因 CRISPR 与随机通路背景比较,使‘重要’能被独立适应度实验检验。TP53 阴性提示基因敲除和药物激活方向不能互换;遗传模拟药理需核对作用方向、剂量和脱靶。MAP2K1 等结果支持对应机制,但仍限于所用细胞/实验,不是全网络每个节点都确证。

Figure 5:从重要通路提出并验证协同用药

Figure 5

原图来源:所用 PDF 文件第 8 页,Figure 5。点击图片可查看原图。

子图 讲解
A 平行通路理论:药物 A 抑制一条支路,药物 B 抑制另一条共同维持必要功能的支路,二者可能协同。
B 将该理论对应到 DrugCell:药物分支表示直接药物作用,基因型分支中的重要子系统提示可同时干预的平行通路。
C 对 25 个药物的重要子系统排序,提出成对组合,再与 DeepSynergy 的已测组合数据核对。
D 比较预测协同、预测非协同及随机组合的实测协同分数;优选组分数更高,支持模型解释能帮助筛选组合。
E 展示 etoposide 相关的重要 PI3K/ERK 子系统和阴性对照分支;它们给出 AKT、MEK 抑制剂等具体联用方向。
F 比较 etoposide 分别与 MK2206、PD325901、bortezomib 联用的 Loewe 协同分数;AKT/MEK 抑制组合总体呈协同,蛋白酶体对照没有同样效果。
G A549 细胞中以 TOP2 与 PIK3CA 或 MAP2K1 联合敲除模拟双靶点抑制;较单敲除更强地抑制生长,而 APC 阴性对照不呈相同模式。
H 以布尔电路近似六个基因的突变如何汇聚到 PI3K、ERK 状态,再影响 etoposide 反应;这是模型关系的简化解释。
I 真值表对照不同通路状态下实际敏感/耐受细胞比例;检验简化电路是否对应观察到的药物反应。
J 比较整模型、通路逻辑组合和单基因标志物的反应预测优势比;组合通路信息强于单一低频突变,显示多基因汇聚解释的价值。

平行通路假说通过已测组合、药理 Loewe 与双靶 CRISPR逐层检查。布尔电路是多基因汇聚的简化说明,不能代表全部连续生物过程。协同依赖采用的零假设,强抑制不必自动是协同;阴性组合和 APC 等背景控制使故事更有可证伪性。

Figure 6:联合用药预测能否延伸到 PDX 肿瘤

Figure 6

原图来源:所用 PDF 文件第 10 页,Figure 6。点击图片可查看原图。

子图 讲解
A 向模型输入患者来源异种移植 PDX 的基因型,识别单药反应的重要通路,再提出并评价联合用药。
B ROC 曲线评价区分有效与无效组合的能力,曲线下面积为 0.75;这里的 auROC 与 Figure 2 的剂量–反应 AUC 含义不同。
C 选定阈值后的混淆矩阵列出正确和错误分类,补充 B 中汇总指标在具体决策点的表现。
D 模型预测有效的两个组合,BKM120+encorafenib 和 abraxane+gemcitabine,较相应单药延长无进展生存;是在 PDX 中的验证。
E 模型预测无效的组合,如 paclitaxel+LCL161、INC280+trastuzumab,未显著改善无进展生存;展示模型对阴性组合也有一定区分能力。

PDX 用真实肿瘤背景增加验证层,但鼠中无进展生存不等于患者临床 PFS。ROC-AUC 0.75 是有效组合分类,与单药剂量曲线 AUC不同;混淆矩阵明确阈值错误。阴性组合展示模型有筛除作用,仍需更大及不同背景检验。

Figure 7:ER 阳性乳腺癌患者的回顾性分层

Figure 7

原图来源:所用 PDF 文件第 11 页,Figure 7。点击图片可查看原图。

子图 讲解
A 在接受 CDK4/6 或 mTOR 抑制剂的患者中,模型预测敏感组的总生存较长,支持预测与临床结局存在关联;这是回顾性患者分析。
B 列出模型用于 mTOR 抑制剂敏感性判断的重要子系统,包括 ER 及相关信号,解释该预测依赖哪些通路。
C 列出 CDK4/6 抑制剂敏感性的重要子系统,与 B 对照展示细胞周期和其他共享通路信息。
D 横纵轴分别是两类患者基因突变频率的绝对和百分比差异,点大小为总体突变频率;AKT1 等更偏向预测敏感组,ESR1、RB1、PTEN 等偏向预测不敏感组。
E 只按 AKT1 突变分组的生存曲线不呈显著差异;与 A 对照,说明单基因分层不能替代模型整合的多基因信息。

阅读提醒

  • Figure 4 原文段落出现 MAPK1/MAP2K1 写法差异;此处按主图坐标和图注使用 MAP2K1。
  • 临床生存关联和模型重要性本身不能确立每个基因的因果作用;药物组合的细胞/PDX验证与患者回顾性分析分别阅读。

回顾性接受治疗患者的敏感分层与 OS 相关,不证明用模型选择治疗会改善 OS;治疗选择、既往疗程和病情可能混杂。单 AKT1 分组不显著说明多基因整合有信息,并不独自证明模型捕捉全部原因。机制通路仍需各自实验支持。

我的理解与可迁移设计

我会借鉴先限制预测可靠范围,再从模型解释推出可失败的具体实验。AD 序列研究同样不能用高分网络自动宣称治疗;真实 MPRA 先验证 cis 效应,内源靶基因和细胞表型是后续层。模型子系统关联可帮助提出通路,但不替代 enhancer–gene 证据。资源有限时适合小模型与固定先验,成功标准应是外部功能标签和具体机制边界,而不是一次总体相关或漂亮的通路图。

继续阅读与公开资源