14.Evo2:原图、模型逻辑与研究范式

14.Evo2:原图、模型逻辑与研究范式
Perry论文题名: Genome modelling and design across all domains of life with Evo 2
期刊与年份: Nature,2026。论文原文。
范围为正文全部编号主图及其子图,包含流程示意图。Extended Data 和 Supplementary Figures 不在本次范围。页码指阅读时所用 PDF 的文件页码。
阅读来源说明: Nature,2026;以当前 PDF 为准。
研究瓶颈怎样转化为问题
DNA 包含编码、RNA 和非编码调控,并横跨巨大距离;Evo 2 询问能否用同一种长上下文语言任务学习跨生命域的可复用规律。依据设计逻辑推断,idea 是以自然基因组为共同表示空间,再把预测与生成作为两类用途。它不是对每种疾病专门训练,而是检验自然序列分布是否含有可迁移的功能约束。
输入、目标与结构
模型按单碱基 token 预测后续序列,使用 OpenGenome2、多阶段短→长上下文训练及 StripedHyena 2 的不同尺度算子。7B 与 40B 的训练量和成本不同;长上下文达到百万 token,但完整推理或训练并非单卡 16 GB 的首轮方案。似然差形成零样本变异分数,嵌入加轻量头是监督用途;生成加外部 Enformer/Borzoi 评分和搜索是另一个设计系统。必须区分这些用途所用标签与计算。
Figure 1:Evo 2 的数据、架构与长上下文
原图来源:所用 PDF 文件第 2 页,Figure 1。点击图片可查看原图。
| 子图 | 讲什么,以及怎样理解 |
|---|---|
| a | 图示 DNA 模型覆盖从分子到基因组、跨中心法则和生命域的应用。 |
| b | 按基因组 k-mer 频率的 UMAP 展示训练物种多样性,每点一个基因组,强调不仅包含原核物种。 |
| c | 短序列预训练后扩展到最长一百万碱基的训练,逐阶段学习局部与长程规律。 |
| d | 功能元件加权及长序列增强流程,说明训练采样如何保留有用生物信号。 |
| e | 比较 40B/7B 模型在两个训练阶段所见 token 数,解释规模差异。 |
| f | StripedHyena 2 的短、中、长程算子布局,说明高效处理超长序列的架构。 |
| g | 在同等 1,024 GPU、40B 规模比较迭代时间,量化架构吞吐优势。 |
| h | 按模型大小和上下文长度比较验证困惑度,规模与长上下文降低序列预测误差。 |
| i | 最长一百万 token 的检索任务评估长程记忆,检验模型能否在很长上下文找回信息。 |
数据多样性、采样和吞吐决定模型能看见什么,长检索任务则检查是否保留远距离信息。困惑度与检索能力都不是功能实验,它们为模型能力提供基础检查。功能元件加权有利于保留稀疏生物信号,也改变了训练分布,因此似然分数不宜简单解释为自然发生概率或真实物种适应度。
Figure 2:多种分子及适应度效应
原图来源:所用 PDF 文件第 4 页,Figure 2。点击图片可查看原图。
| 子图 | 讲什么,以及怎样理解 |
|---|---|
| a | 野生型与突变序列的似然差作为零样本效应分数,可用于蛋白、RNA 或整体适应度。 |
| b | 在不同物种基因起始位点进行突变并测量似然变化,检查对功能边界的识别。 |
| c | 原核生物不同元件与突变类型的似然变化,检验对编码及 RNA 元件的区分。 |
| d | 在真核生物重复 c 的分析,考察跨生命域适用性。 |
| e | 比较不同物种使用的终止密码子突变,检验模型是否识别物种特异遗传密码规则。 |
| f | 以 DMS 实验比较零样本分数的 Spearman 相关,检验真实功能效应。 |
| g | 用模型嵌入训练碱基级外显子分类器的示意。 |
| h | 在八个留出物种比较外显子识别 AUROC,检验嵌入的跨物种迁移。 |
| i | 人 STOML2 位点的外显子预测轨迹,直观对照基因注释。 |
| j | 计算提前终止突变的似然效应,区分实验中的必需/非必需基因,覆盖细菌、古菌及噬菌体。 |
边界、遗传密码、DMS、外显子探测与必需性分别检验不同层的语义。似然变化是模型分数,真正的功能可信度依赖 DMS 等外部实验。g/h 的分类头已经使用标签,不能与 a 的零样本混称。跨物种成功要求可比注释和留出设计,不能因为基因组来源广泛就假定人类每类机制均同样准确。
Figure 3:人类变异效应
原图来源:所用 PDF 文件第 5 页,Figure 3。点击图片可查看原图。
| 子图 | 讲什么,以及怎样理解 |
|---|---|
| a | 图示用参考/替代序列似然比较编码与非编码变异,不需任务专门标签。 |
| b | 比较编码区 ClinVar SNV 和非 SNV 的良性/致病 AUROC、AUPRC。Evo 2 在编码 SNV 上有竞争力但未超过所有基准;对插入、缺失等非 SNV,两个版本超过图中测试的方法,且部分蛋白变异模型不能直接评价这些类型。 |
| c | 在非编码区重复分类评估。Evo 2 40B 对 SNV 在无监督模型中领先,但仍落后于部分监督方法;对非编码非 SNV 则超过所有测试模型,说明优势取决于变异类型。 |
| d | 按外显子/内含子比较 SpliceVarDB 剪接改变变异的预测。 |
| e | 以 BRCA1 饱和突变实验比较编码/非编码 LoF 分类表现。 |
| f | 展示 BRCA1 真正 LoF 与功能正常/中间变异的零样本分数分布,检验类别分离。 |
| g | 提取并拼接 Evo 2 嵌入训练轻量监督分类器的流程。 |
| h | 留出 BRCA1 变异的监督分类分数分布,检查训练后类别分离。 |
| i | 比较监督嵌入模型与零样本基准,说明少量任务标签可进一步改善预测。 |
编码/非编码、SNV/非 SNV 的分开评估防止总体结论掩盖优势边界。模型对非 SNV 的优势与专用蛋白模型无法直接处理某些类型有关,应明确共同可评集合。BRCA1 饱和实验给出真实终点,轻量监督头进一步改善是标签贡献;这些数据仍主要代表该基因实验,而非全蛋白组或 AD 调控风险。
Figure 4:可解释的模型内部特征
原图来源:所用 PDF 文件第 7 页,Figure 4。点击图片可查看原图。
| 子图 | 讲什么,以及怎样理解 |
|---|---|
| a | 用稀疏自编码器 SAE 从模型激活提取特征,用于生物注释和生成引导。 |
| b | 噬菌体相关特征在大肠杆菌前噬菌体及 CRISPR 中噬菌体来源 spacer 激活,显示序列来源识别。 |
| c | 100 kb 区域内 ORF、基因间、tRNA、rRNA 特征的激活,说明内部表示含功能类别。 |
| d | 在 tufB/tRNA 与 rpoB/rpoC 位点显示二级结构/tRNA 特征,并映射到预测结构,联系 DNA 表示与蛋白/RNA 结构。 |
| e | 人类移码突变后特定特征更强激活,说明模型察觉阅读框破坏。 |
| f | 激活序列对应 TF 结合基序,展示非编码调控语义。 |
| g | 外显子、内含子、边界特征泛化到猛犸象基因组片段,检验跨物种可解释性。 |
SAE 将内部激活拆成稀疏特征,有助于找出基序、边界和阅读框语义,但一个特征与注释关联不证明其是唯一机制。映射到结构或猛犸象序列检查解释可迁移性,仍依赖注释和模型推断。干预该内部特征改变输出,也只说明计算因果,不能直接等同生物体内因果。
Figure 5:基因组尺度的生成
原图来源:所用 PDF 文件第 9 页,Figure 5。点击图片可查看原图。
| 子图 | 讲什么,以及怎样理解 |
|---|---|
| a | 用人线粒体、支原体及酵母染色体片段为提示,生成类似长度的 DNA。 |
| b | 提示基因上下文和保守蛋白部分序列,比较生成补全部分与自然基因恢复程度。 |
| c | 比较生成与自然线粒体的 rRNA、CDS、tRNA 注释数,检查内容完整性。 |
| d | 生成线粒体与数据库序列的 BLAST 覆盖/一致性散点,评估新颖性及自然相似程度。 |
| e | 可视化不同生成线粒体的基因顺序,显示多样序列保留一定共线性。 |
| f | 生成线粒体蛋白复合体的 AlphaFold3 结构,检验潜在结构一致性。 |
| g | 约 600 kb 生成原核 DNA 的基因注释,颜色表示与自然蛋白的显著匹配。 |
| h | 比较 Evo 2 和 Evo 1 生成基因中匹配已知蛋白的比例。 |
| i | 比较生成与自然支原体基因分布,检查整体基因组组成。 |
| j | 比较生成与自然蛋白的二级结构组成。 |
| k | 生成蛋白与自然蛋白结构实例对比,说明序列多样化同时可能保留折叠。 |
| l | 酵母染色体 III 的自然与生成序列及基因/外显子/启动子/tRNA 注释对照;注释和结构预测并不等于整个生成基因组已能存活。 |
注释完整、基因顺序合理、BLAST 新颖性和结构预测共同检验生成序列的自然性;它们不能证明整个生成基因组可以复制、存活或产生目标表型。尤其结构相似并不保证表达、调控和组装都正确。生成示例应被称为候选设计,不能把大量计算产物写成已经实验成立的生命系统。
Figure 6:按目标设计染色质可及性
原图来源:所用 PDF 文件第 10 页,Figure 6。点击图片可查看原图。
| 子图 | 讲什么,以及怎样理解 |
|---|---|
| a | 目标是控制长 DNA 上开放峰的位置和宽度,展示设计规格。 |
| b | 每次生成 128 bp 候选,用 Enformer/Borzoi 评分与目标峰的匹配,束搜索选择片段后继续生成。 |
| c | 比较设计匹配 AUROC 与每碱基采样 token 成本,计算越多通常越好匹配。 |
| d | 不同计算预算下的两种峰图案,展示峰形随搜索改善。 |
| e | 合成/组装并定位整合 DNA,再 ATAC-seq 实测的实验流程。 |
| f | 在小鼠细胞设计并验证表示 EVO2 的摩斯码开放峰。 |
| g | 以 LO 摩斯码重复位置和峰宽控制,检验不同目标图案。 |
| h | 以 ARC 摩斯码展示更复杂的可及性图案。 |
| i | 在 HEK293T 和 K562 设计相同模式,检查跨细胞共享目标。 |
| j | 设计两种细胞特异的不同模式,显示对细胞背景的控制。 |
| k | 汇总实验 ATAC-seq 对目标开放/关闭位置的 AUROC,评价实际设计效果。 |
| l | 概括生成模型加准确评分器的通用设计范式,提出可扩展的应用逻辑。 |
本图有真实 ATAC-seq,是生成部分最关键的正交验证。生成器提出候选,外部评分器与束搜索选择符合开放图案的序列,因此成功是整套系统的结果,不能全部归功于 Evo 2 似然。预算曲线显示搜索成本影响收益;细胞共享与特异图案区分环境目标。染色质开放符合目标也不等于特定基因表达或疾病改善。
我的理解与可迁移设计
我会借鉴‘自然序列表征+小标签任务+正交实验’的路线,避免首轮复制巨大模型。DNA 演化×AD 可用真实人类双等位 MPRA 检验模型是否预测背景依赖,并将祖先/其他物种序列替换作为待验证反事实。没有相应构建实验,就不能把反事实分数当跨物种功能标签。生成型设计需独立评分与实验;纯计算第一篇更适合明确的效应预测和机制候选,而非宣称设计出可治疗 AD 的长 DNA。





