32.Halicin:原图、模型逻辑与研究范式

论文题名: A Deep Learning Approach to Antibiotic Discovery

期刊与年份: Cell,2020。论文原文。

范围为正文全部编号主图及其子图,包含流程示意图。Extended Data 和 Supplementary Figures 不在本次范围。页码指阅读时所用 PDF 的文件页码。

返回专题总目录

研究问题: 分子图深度学习能否在巨大化学库中找到结构不同于已知抗生素的候选,并通过抗菌、机制和动物实验验证?

研究难点:怎样从已有筛选走向不同的化学结构

抗生素发现经常遇到一个矛盾:化学库越来越大,真正可做的细菌实验仍有限;而大量候选与已知抗生素相近,容易重复已有耐药机制。本文的切入点,是先用相对小规模的真实生长实验训练一个结构到活性的映射,再把计算筛选扩展到远大于实验规模的化合物库。根据引言与实验顺序,我推测idea的核心不是让网络“理解细菌”,而是利用训练中分散的结构规律,把有限实验预算集中到值得验证的分子。这个推测基于研究设计,不能当作作者个人构思过程的记录。

模型输入、输出与实验标签

不同规模搜索对应不同的评估问题:留出集评价模型排序,少量购入分子评价筛选策略,大库扫描评价发现机会。三者的分母不同,命中率不能互相代换。

输入为分子图及计算得到的分子描述符;图网络通过有方向的化学键消息传递汇总局部结构,最后输出抑制大肠杆菌生长的分数。主要训练筛选去重后为2335种分子,其中120种达到活性阈值。这是监督二分类,标签对应给定条件下的生长抑制,并不直接代表杀菌性、最小抑菌浓度、作用靶点或人体疗效。图结构适合这项任务,是因为官能团的作用往往取决于相邻连接关系;额外描述符则补充整体物化属性,但这些选择仍需用留出性能和前瞻实验检验。

后续流程有两个尺度:先在6111种Drug Repurposing Hub分子中寻找高分候选,再扫描超过一亿个ZINC15分子。Halicin属于从已有化合物中发现新的抗菌用途,而不是模型从零生成分子。真正的证据链也不在最高预测分,而在候选被购买、培养条件被改变、耐药性被检验以及感染模型被测试之后。规模庞大的计算搜索提供发现机会,同时增加候选筛选规则及实验选择偏倚的重要性。

Figure 1|机器学习扩大抗生素搜索空间

Figure 1

原图来源:所用 PDF 文件第 3 页,Figure 1。点击图片可查看原图。

图1建立全文的工作流:真实抗菌实验产生标签,网络学习分子结构,随后对未实验的大库排序,最后返回实验室确认。它要解决的是“该测谁”的问题,因此计算筛选的一亿规模不能被读成已经完成一亿次抗菌实验。训练、验证、候选库之间需要避免相同分子图重复,才能使前瞻命中有解释力。流程图中的细菌及机制图标是任务示意;模型本身仅接受化学结构,既没有细菌转录组输入,也没有直接学习药物与靶蛋白的结合过程。

子图 讲解
左侧:图消息传递 以原子和键构成分子图,通过有向消息传递学习与抑菌性质有关的分子表示,而非手工指定某一种抗生素骨架。
中央:训练与迭代筛选 用实测小分子活性训练、预测和验证,候选实验结果可再加入训练;最终发现线索还需实验和优化。
右侧:与传统筛选的规模比较 传统实验筛选通常受可购和实验规模限制,模型可快速给更大的化学空间评分;本文搜索超过一亿个分子。

Figure 2|模型训练与 halicin 的发现

Figure 2

原图来源:所用 PDF 文件第 5 页,Figure 2。点击图片可查看原图。

图2把训练与首次发现放在同一证据框架里。训练集的活性率较低,测试集ROC表现说明模型具有排序信息,但不能单凭AUC判断购买候选的阳性率。作者进一步检测高分99种候选,其中51种达到实验活性标准,并以低分63种作为对照,才把预测变成前瞻结果。Halicin与已有抗生素的低结构相似性支持化学结构差异,而t-SNE只是描述所选空间;二维分离不会自动证明新的作用机制。单浓度生长阈值适于初筛,后续剂量实验才回答效力有多强。

子图 讲解
A 2,560 个批准药物/天然产物的初筛,以大肠杆菌生长抑制为标签;去重等整理后用于模型训练。
B 六次试验的 ROC-AUC 和平均曲线评价模型区分抑菌与不抑菌分子的能力。
C 将未出现在训练集的 Drug Repurposing Hub 分子按预测分数排序,选出前瞻性候选。
D 验证 99 个高分候选,51 个达到 OD600<0.2 的活性阈值,显示高分能富集实际命中。
E 比较生长 OD 与预测分数的比值;预测越高,出现强抑菌的概率总体越高。
F 验证 63 个低分分子作为反向对照,检验高分筛选是否有实际区分度。
G 训练集与再利用药物库的 t-SNE,标出 halicin 的化学位置,观察其与既有分子的关系。
H halicin 与所有训练分子的 Tanimoto 相似度较低;与最近抗生素的相似度约 0.21,支持其结构新颖性。
I halicin 对大肠杆菌的浓度–生长曲线,直接确认预测候选具有抑菌作用。

Figure 3|广谱杀菌及耐受细胞清除

Figure 3

原图来源:所用 PDF 文件第 6 页,Figure 3。点击图片可查看原图。

图3的动机是把一个大肠杆菌初筛命中扩展成可讨论的抗菌候选。富营养培养基、PBS以及氨苄青霉素处理后的持留菌,分别改变生理状态或残存群体;若只有一种培养条件有效,普适杀菌的主张就会受限。耐药基因背景、结核分枝杆菌及临床菌株进一步检验模型训练终点之外的泛化。读图时要注意各菌种与条件的差异,尤其铜绿假单胞菌活性较弱:广谱不是对所有病原体等效。计算模型提供候选,跨物种效应是在此处由生物实验发现的,不能反向说它已在训练时预测所有这些性质。

子图 讲解
A 营养充足 LB 中不同浓度、时间的菌落数下降,说明 halicin 可杀菌而不只是阻止生长。
B 营养缺乏 PBS 中仍有杀菌作用,说明对代谢受抑制状态的细胞也有效。
C 先用氨苄西林留下持留菌,再加入 halicin;存活菌下降,验证对抗生素耐受亚群的清除。
D 携带多种耐药基因的大肠杆菌的 halicin MIC 没有明显升高,说明这些既有机制未产生同等交叉耐药。
E 结核分枝杆菌的浓度–生长曲线,展示另一类病原菌的抑制作用。
F 结核分枝杆菌的时间–菌量曲线,进一步确认杀菌而非仅生长抑制。
G 耐碳青霉烯肠杆菌科、鲍曼不动杆菌及铜绿假单胞菌临床株 MIC;前两类多有活性,铜绿假单胞菌活性较差,界定广谱的实际边界。

Figure 4|质子动力势中 ΔpH 的扰动

Figure 4

原图来源:所用 PDF 文件第 8 页,Figure 4。点击图片可查看原图。

图4尝试区分“能杀菌”与“怎样杀菌”。连续传代比较耐药上升,转录组观察应激反应,培养基pH和膜电位探针检验质子动力势相关解释,药物联用则检查功能关系。多个读数方向一致,比单个富集通路更能约束假说。DiSC3(5)信号涉及膜电位及跨膜pH的耦合,不能简单把荧光变化等同于细胞膜破裂;与其他药物以及铁离子相关的相互作用也需要在相应条件下解读。这些结果支持一种生物物理作用机制,尚不是直接的蛋白结合位点鉴定。

子图 讲解
A 30 天传代对比 halicin 与环丙沙星的 MIC 升高;halicin 难以在此条件下演化出显著耐药。
B 处理后转录组聚类显示运动、核糖体和膜复合物相关基因响应,为机制寻找生理线索。
C 培养基 pH 越高,halicin 效力越弱,符合对跨膜 ΔpH 产生作用的预期。
D DiSC3(5) 荧光在 halicin 后降低,而膜破坏对照多黏菌素 B 使其升高;前者符合 ΔpH 消散后补偿性膜电位增强的解释。
E 棋盘实验显示与四环素拮抗、与卡那霉素协同,且 Fe3+ 增强药效;共同支持 ΔpH 相关机制,并提出铁参与的假说。

Figure 5|小鼠感染的体内验证

Figure 5

原图来源:所用 PDF 文件第 9 页,Figure 5。点击图片可查看原图。

图5让候选面对感染环境,而不再只面对培养皿。鲍曼不动杆菌创面局部给药以及艰难梭菌肠道感染覆盖不同病原体、部位与给药方式,菌量随时间和终点的变化是核心读数。部分创面样本低于检出限,要读成在该检测尺度下未检出,而不是保证组织彻底无菌。样本量和小鼠宿主背景限制外推,局部有效也不直接意味着口服或全身给药安全有效。它证明的是候选在具体动物感染实验中具有作用,为后续药理与临床开发增加依据,并未越过人体疗效这一阶段。

子图 讲解
A halicin 抑制泛耐药鲍曼不动杆菌 CDC288 生长,确认动物感染用菌株敏感。
B 该菌在无营养 PBS 中的杀菌实验显示对低代谢状态仍有效。
C 小鼠伤口感染后局部给药 24 小时,药物组菌量显著降低,6 只中 5 只低于检测限。
D halicin 抑制艰难梭菌 630 的体外生长,提出第二种感染模型。
E 艰难梭菌感染、扰动肠道定植抗性及连续治疗的时间轴,解释粪便菌量取样安排。
F 比较载体、甲硝唑、halicin 的粪便菌量;halicin 组从治疗 72 小时出现清除,96 小时 4/4 无检出感染。

Figure 6|超过一亿分子的预测与新候选验证

Figure 6

原图来源:所用 PDF 文件第 10 页,Figure 6。点击图片可查看原图。

图6把方法推广到更大的搜索空间。作者对超过一亿分子预测后选择23种实验,其中8种对至少一种受测菌有效;命中数量要与选择规则一起读,不能以这23种的结果估计整个化学库的精度。分数、结构相似性、MIC以及耐药和杀菌实验分别承担排序、结构差异、效力与机制层面的任务。新结构候选显示网络可从训练集迁移,但代表性受库的构成、可购买性和物化条件限制。该图最强的价值是第二轮前瞻发现,而不是漂亮的化学空间可视化。

子图 讲解
A 按理化性质划分 ZINC15 区块,以训练活性比例筛选适合抗菌搜索的区块。
B 选定区块的预测分数直方图,显示一亿级候选中高分命中只是小部分。
C 23 个实测候选的预测分数与最近抗生素结构相似度,黄色为至少对一种菌有活性的分子,检查新颖性与实际活性。
D 八个活性候选的结构和五种病原菌 MIC,显示新命中的抗菌谱差异。
E ZINC000100032716 对携带耐药基因大肠杆菌的 MIC,大多机制未显著改变敏感性,但某些基因有小幅影响。
F 对 ZINC000225434673 做同类耐药基因测试,检查另一候选的交叉耐药情况。
G ZINC000100032716 在 0 和 4 小时的存活菌量比较,判断是否具杀菌作用。
H ZINC000225434673 的对应杀菌验证。
I 把多个库、高分预测、真阳性、假阳性放到同一化学空间,展示算法跨库探索及命中的结构分布。

阅读说明

  • 已核对为 Stokes 等 2020 年原文。Figure 3 和 Figure 6 的图注分别续到第 7、11 页;所有续页子图均已纳入。

依据:对应主图、完整图注及正文 Results;实验结果只按本文给出的对象和条件解释。

我从证据链中得到的启发

这篇文章的成功依赖“模型—实验—机制—感染环境”连续推进。二分类网络没有承担所有任务,作者也没有等到机制完全明确才进行候选实验。对自己的研究,最可迁移的是把模型定位为选择下一批昂贵验证对象的工具,然后预先定义命中标准和对照,防止只展示高分成功案例。

若移到AD公共组学,我会把模型输出限定为某类元件或细胞状态的优先级,并在外部donor或独立数据类型中验证,而不会把高分直接命名为致病机制。训练标签的浓度和条件相当于组学研究中的细胞类型、脑区和病理背景;脱离这些上下文谈泛化,容易高估结果。非深度学习的指纹模型或简单结构相似性模型也应进入同一候选选择比较,帮助确认复杂模型贡献何在。

我的主要保留意见是,发现新结构、观察杀菌和推测作用机制是三种不同的主张,需要分别有证据。本文很有启发的地方正在于逐层补足,而不是一次预测将所有结论包办。Halicin尚有后续安全性、药代及人体疗效问题,本文动物结果应保持在其实际实验范围内。

继续阅读与公开资源