9.PrimateAI-3D:原图、模型逻辑与研究范式

论文题名: The landscape of tolerated genetic variation in humans and primates

期刊与年份: Science,2023。论文原文。

范围为正文全部编号主图及其子图,包含流程示意图。Extended Data 和 Supplementary Figures 不在本次范围。页码指阅读时所用 PDF 的文件页码。

返回专题总目录

阅读来源说明: Science,2023;以当前 PDF 为准。

研究瓶颈怎样转化为问题

人类可容忍错义变异观察有限,临床标注又更偏向已知病基因。该研究先扩大自然数据:809 个个体、233 个灵长类物种提供数百万常见变异。近缘物种中能达到常见频率的替换,往往已通过选择筛选,可作为偏良性证据。依据设计逻辑推断,idea 是用物种多样性增加训练信息,再通过三维结构邻域把少数已见可容忍变异的信息传播到未见替换。它并没有直接测量灵长类 AD 易感性。

输入与模型选择

映射先要求人类与物种间明确 1:1 对应,并排除邻近碱基导致翻译结果不一致的情况。PrimateAI-3D 在体素化结构上整合序列比对和自然变异,3D 卷积让序列上远离但空间相邻的残基共享上下文;训练还涉及结构补全和语言模型信息。目标以常见自然变异与匹配背景形成半监督区分,而非全靠 ClinVar。空间表征适合蛋白界面/核心约束,不能直接挪作 DNA enhancer 的三维模型。

Figure 1:灵长类变异在人的可容忍性

Figure 1

原图来源:所用 PDF 文件第 4 页,Figure 1。点击图片可查看原图。

子图 讲什么,以及怎样理解
A 比较灵长类与 gnomAD 中错义/同义变异数及比例;显示跨物种资料扩展可容忍变异的覆盖。
B 统计所有可能人类同义及错义变异中,已在灵长类观察到的比例。
C 比较全部 ClinVar、gnomAD 已见及灵长类已见变异的良性/致病比例;灵长类常见变异大多数对应良性临床标签。
D CACNA1A 上展示人/灵长类已见变异、临床致病位置及 PrimateAI-3D 分数,显示可容忍位置与敏感区域不同。
E MYO7A 剪接基序例子:同一变化在人形成异常剪接,而其他物种邻位碱基阻止该基序形成,说明序列背景能造成例外。
F 比较不同物种类群已见变异的 ClinVar 良性/致病比例;检查进化距离与代理良性证据的关系。
G 比较人类不同频率层的错义/同义比例与人和灵长类共有变异;负选择使常见变异更偏向可容忍。

C 与 F 是代理良性假设的实证检查:近缘灵长类与人临床标签高度一致,远缘物种一致性较弱。E 刻意展示剪接背景例外,说明‘另一个物种有这个氨基酸’仍受邻近序列与机制约束。A/B 的覆盖增益来自独立变异空间,不是简单复制人类样本。G 以同义背景对照选择效应,但突变率和序列可比性仍必须保留。常见不等于对晚发复杂病完全无效,尤其不能排除小效应或环境依赖风险。

Figure 2:人类与灵长类基因约束

Figure 2

原图来源:所用 PDF 文件第 5 页,Figure 2。点击图片可查看原图。

子图 讲什么,以及怎样理解
A 每点一个基因,比较两类群错义/同义比例,以 pLI 着色;判断敏感基因的约束是否跨物种一致。
B 分别展示 gnomAD 和灵长类每基因同义/错义观察与预期数;错义缺失反映选择约束。
C 比较两数据来源的观察/预期比例分布;同义作背景、错义反映整体负选择。
D 突出在人类约束更强或更弱且统计显著的基因,说明少数基因的约束可能具有物种差异。

观察/预期比将原始变异数转成约束分析,同义作为背景可减少基因长度和可突变性影响。A–C 的跨物种一致性支持共享蛋白功能,但 D 显示并非所有基因相同。物种采样、群体史、映射质量和测序覆盖均可影响差异,因此显著差异提供后续机制候选,不能自动称作人类适应。若借此讨论 AD,应先明确比较的是蛋白约束还是调控序列,二者所需对齐和零假设不同。

Figure 3:PrimateAI-3D 与独立基准

Figure 3

原图来源:所用 PDF 文件第 7 页,Figure 3。点击图片可查看原图。

子图 讲什么,以及怎样理解
A 蛋白结构和比对体素化后输入 3D 卷积网络,结合自然变异、结构补全及语言模型排名训练,输出目标残基替换分数。
B 在 STK11 结构中显示自然可容忍与临床致病变异及模型分数;关键三维区域更敏感。
C 在所有方法有预测的共同变异上比较 DDD 与 UK Biobank 两个临床基准表现。
D 六组柱状图分别为 DMS、UKBB、ClinVar、DDD、ASD、先天心脏病基准,检验性能改善的跨数据来源一致性。

A 将 3D 邻域与自然耐受数据结合,B 用 STK11 解释敏感结构,C/D 再在多种独立任务上评价。共同有预测的变异集避免方法覆盖差异扭曲比较;DDD、ASD 等新生变异与 UKBB 性状是不同终点,跨任务一致性比一个 ClinVar 总体 AUC 更有力。即使所有基准更好,也不能把分数视作确定疾病概率;各基准的阴性背景、阈值和人群选择不同。

Figure 4:训练规模的作用

Figure 4

原图来源:所用 PDF 文件第 8 页,Figure 4。点击图片可查看原图。

子图 讲什么,以及怎样理解
A 增加常见人/灵长类训练变异,比较归一化分类表现;更多自然变异使预测提高。
B 逐步加入 234 种灵长类,统计所有可能人类变异的覆盖比例;显示新增物种仍可扩大训练信息。

A 的数据规模实验回答一个可执行问题:改进来自更多可容忍标签还是仅来自结构模型?B 展示新增物种持续扩大可能变异的覆盖,但覆盖增长不保证等比例的临床增益。物种越多,质量控制和同源映射越关键,不能将错配变异当作新的良性标签。有限资源研究可借用已释放预测和特征,重点比较增量信息,而不需重新收集或训练数百物种模型。

Figure 5:神经发育障碍中的新生变异富集

Figure 5

原图来源:所用 PDF 文件第 9 页,Figure 5。点击图片可查看原图。

子图 讲什么,以及怎样理解
A 以观察/预期比比较同义、全部错义、蛋白截断及按 0.821 阈值分层的错义;预测有害错义的疾病富集更明显。
B 改变有害分数阈值,观察良性/有害错义的富集;更严格筛选增强信号,可帮助疾病基因发现,但会减少纳入变异数量。

A/B 把功能分数转成病例富集,观察/预期比使分析依赖正确的新生突变背景。提高阈值让剩余错义变异更像强效候选,同时减少数量,可能提高富集却降低总体发现能力。固定 0.821 阈值的含义属于此研究校准,不能未经重估搬到不同疾病和样本选择。神经发育障碍的强效新生变异证据也不能直接解释 AD 的常见非编码 GWAS 架构。

我的理解与可迁移设计

这篇让我更重视自然标签的边界:能用进化扩大数据,但必须说明哪些序列背景保持可比。对 DNA×AD,最稳妥的是在人类真实 MPRA 标签上评估进化特征能否增加预测,再对同源增强子提出待检验假说。不能把某个灵长类不患某种临床疾病、或某个位点在灵长类出现,直接写成该等位基因对 AD 良性。若研究 TE,还应区分可比的正交位点与物种特异插入,无法对齐本身不证明新功能;基因组可比性应先于生物学故事。

继续阅读与公开资源