88.PersonalTranscriptome-Huang:原图、模型逻辑与研究范式

论文题名: Personal transcriptome variation is poorly explained by current genomic deep learning models

期刊与年份: Nature Genetics,2023。论文原文。

范围为正文全部编号主图及其子图,包含流程示意图。Extended Data 和 Supplementary Figures 不在本次范围。页码指阅读时所用 PDF 的文件页码。

返回专题总目录

本篇问题: 当前序列到表达模型的跨基因能力是否能够解释个人转录组变异?

同一个问题,换队列与模型检验是否仍成立

我对研究问题形成的推测是:序列到表达模型已经能解释参考基因组上不同基因的强弱,可这并不直接证明它读懂了个人遗传差异。作者选择有配对个人基因组和转录组的Geuvadis,把同一问题扩展到四个架构、不同输入范围和不同训练读数。这与ROSMAP皮层基准互补:若LCL中也出现相似落差,就不容易把失败仅归于老年脑组织或某一个模型。

本篇使用421位供体的分相WGS与淋巴母细胞系RNA,关注已具有显著cis-eQTL的3,259基因。每人两条单倍型分别替换SNV后输入,预测取平均,不包含indel。Enformer与Basenji2直接输出CAGE等多轨迹,ExPecto先预测染色质再线性映射到RNA,Xpresso是较短启动子上下文的CNN表达模型。它们都未以本文421人的个体表达重新训练,因而检验的是既有参考序列模型的迁移能力。

基准同时计算参考序列对跨基因中位表达、每人跨基因,以及每基因跨供体的相关。这样的设计把统计问题清楚分开。PrediXcan式弹性网在本文数据上按供体交叉验证训练,限制输入范围与Enformer相近,提供“这些DNA差异中至少有多少可预测信号”的对照;它不承担未见基因或任意新变异的泛化。论文不是新疾病分类网络,而是以任务对齐为核心的监督模型能力审计。

Figure 1:跨基因与跨个体表达预测的落差

Figure 1

原图来源:所用 PDF 文件第 2 页,Figure 1。点击图片可查看原图。

a用矩阵行列说明两个评估方向,是理解全部结果的前提。不同基因之间平均表达差距很大,模型只要学到启动子类别就可能获得良好跨基因相关;同一基因内供体差异较小,且由遗传、环境和测量混合影响,是另一项更细任务。b在相同队列比较四模型与线性基线,c展示相关分布,不只用均值遮住正负两端。跨个体均值接近零并不意味着每个基因都完全没有信号,但显著负向预测同样不能称“方向正确”。

d中的SLFN5与SNHG5分别展示成功与相反方向实例,避免只用成功案例替代总体基准。四个模型虽都含卷积,其训练RNA或CAGE读数、输入范围与输出汇总不同;读数匹配对照说明这些差异没有消除主要落差,却也不支持单凭绝对成绩归因某一个架构最差。图中误差线表示供体或基因集合上的分布,不是独立重复训练造成的不确定性,不能拿来当每个预测值的置信区间。

分析集合预先选择有显著eQTL的基因,相当于富集存在遗传表达信号的任务。因而即使在这样的有利集合表现有限,也构成有意义警示;但它不是全转录组任意基因的无偏总体平均。只把SNV纳入个人序列还意味着结构变异或indel贡献不在本次直接检验范围。

子图 讲的是什么,以及如何理解
a 同一人的不同基因对同一基因的不同个人评估,明确两种相关性回答不同问题。
b 四种深度模型的参考、跨基因、跨个体表现,以及PrediXcan个体预测,深度模型跨基因强但跨个体有限。
c Enformer跨基因相关和跨个体相关分布,展示个体预测可接近零甚至为负。
d SLFN5正相关与SNHG5负相关实例,说明不能只看相关绝对值判断变异效应正确。

Figure 2:模型之间及与实测的效应方向不一致

Figure 2

原图来源:所用 PDF 文件第 3 页,Figure 2。点击图片可查看原图。

a按SNHG5主要eQTL剂量给个人点着色,并列四模型。三个模型给出与实测相反的趋势,Xpresso却为正,说明某个基因失败并不一定意味着它本身无法从序列预测。参考和替代等位的虚线又把个体预测压缩成具体遗传对照,但top eQTL可能与真正功能变异处于LD;这张图显示方向问题,并未逐一完成因果定位。

b看模型间逐基因相关,沿正对角与负对角都出现密集点。模型可能共同发现有遗传差异的基因,却对方向分歧。因此“多个模型都认为重要”可以帮助优先排序,却不能省略效应方向验证。平均模型只有轻微改善,也不表示再加入任意模型就能消除错误;相关模型的共享训练偏差可能一起保留。

c分别检查eQTL显著性、TSS距离、实际表达和预测变异幅度,排查失败是否只发生于弱遗传信号或低表达基因。强eQTL仍可能负相关,近端位点也有错误,意味着远程调控建模与方向正确是两个需要分别改进的问题。图里的趋势不足以证明失败源头完全是哪一个分子过程,作者将局部TF作用还是增强子到基因映射提出为后续可区分假说,而非已经确定结论。

子图 讲的是什么,以及如何理解
a 四模型对SNHG5的个人预测按主要eQTL剂量着色,三个模型方向与实测相反而Xpresso为正。
b Enformer对其他模型的逐基因个体相关散点,既有同方向也有反方向模式,说明模型间并非一致。
c Enformer相关与eQTL强度、TSS距离、实际表达及预测变异系数的四组关系,即使强eQTL基因也可能负相关。

阅读说明:本篇正文仅Figure 1和Figure 2;全文出现的Extended Data Fig. 3/4等不属于正文主图,候选自动提取中的3和4已排除。

对我的研究:把错误分解到哪一层

我会将这篇与ROSMAP基准并读,形成两步诊断。第一步,TE附近变异是否被模型预测为改变局部可及性或结合,而且方向被外部caQTL、等位数据或MPRA支持?第二步,这个局部变化是否能被正确映射到目标基因表达?若第一步好、第二步差,需要改进调控连线;若第一步也差,就不能只扩大远端上下文来解释失败。

这一分解可以转成纯计算课题:固定未见供体和未见基因组区域,分别比较TE与匹配非TE候选在局部效应方向和目标表达方向上的表现。匹配需包含家族、GC、距离、可及性及可比对性,且不应先看疾病关联再选最有利子集。结果若发现某类TE序列共享方向错误,可进一步以motif与上下文扰动定位计算失败来源;它首先是模型机制问题,只有经独立生物数据支持后才上升到AD调控机制。

公开Geuvadis可作为流程开发基准,但LCL中的规则不能原样称为脑细胞证据。论文按欧洲人群eQTL选基因,供体却覆盖欧洲及非洲背景;祖源、LD和细胞系状态可能影响泛化,迁移研究应分层核对。把同一供体的两个单倍型或相邻窗口随机切到训练与测试会泄漏个人与序列背景,不能用大批预测样本数掩盖只有数百独立供体的事实。

我的感悟是,基准论文的深度来自一个简单而必要的问题:模型的目标是否就是我们最终想解释的变化?对AD,我们也应区分遗传造成的风险、病理造成的表达改变,以及细胞比例变化。一个能够预测bulk表达的模型不一定解释病因,更不一定预测疾病进展;每跨一层都需要与该层对应的新证据。

关于研究资源,我会先下载作者公开的预测表与脚本复现评估,再选择少量基因做自己的前向推理,而不是一开始重复四模型全部大规模计算。核对TSS、链方向、参考组装和分相是第一步;Xpresso的非对称输入尤其需要按负链正确反向互补。公开结果可降低试验成本,但用于最终新模型评价时仍要明确哪些数据曾用于方法选择。

最后,方向错误并不能靠人为翻转所有负相关基因的模型输出来解决。那样已经使用实测表达挑选基因与符号,变成监督校准;若要提出校准方法,应在开发供体学习规则,在独立测试供体评估,并报告未见基因能否泛化。读者看到相关绝对值时需要知道其符号是否事后选择,这直接关系到模型有没有预测增减的实际能力。

另一个必要记录是每个基因实际可测表达的噪声上限,避免把不同读数可靠性的差别全归为模型失效。

继续阅读与公开资源