11.GET:原图、模型逻辑与研究范式

11.GET:原图、模型逻辑与研究范式
Perry论文题名: A foundation model of transcription across human cell types
期刊与年份: Nature,2025。论文原文。
范围为正文全部编号主图及其子图,包含流程示意图。Extended Data 和 Supplementary Figures 不在本次范围。页码指阅读时所用 PDF 的文件页码。
阅读来源说明: Nature,2025;以当前 PDF 为准。
研究瓶颈怎样转化为问题
只从 DNA 预测固定实验轨迹的模型,通常把细胞背景藏在训练过的任务头中,遇到新细胞类型需要额外适配。GET 改用可及性描述‘哪些元件在此细胞中可被利用’,再用序列基序描述‘这些元件能被哪些因子识别’。依据设计逻辑推断,其 idea 是把细胞状态作为可测输入,从跨细胞共享的调控语法推导表达,而不是为每个细胞另建完全独立模型。
输入、目标与结构
模型把大于 2 Mb 区域的开放峰表示成峰×基序矩阵,跨 213 类胎儿/成人细胞进行掩码预训练,再以配对 ATAC/RNA 微调表达目标。峰级 token 压缩长序列,Transformer 整合远端元件与基序组合;它因此依赖真实可及性和峰定义,并非只靠任意 DNA 就能零样本知道新环境。表达预测之后,基序贡献、元件贡献和相互作用分析形成可验证假说,最后以编辑及蛋白邻近标记验证。疾病连接不只来自性能数字,而是落到具体癌症相关 PAX5 变异与相互作用。
Figure 1:GET 模型与跨细胞预测
原图来源:所用 PDF 文件第 2 页,Figure 1。点击图片可查看原图。
| 子图 | 讲什么,以及怎样理解 |
|---|---|
| a | 输入大于 2 Mb 区域的“开放峰 × TF 基序”矩阵,先跨 200 多种细胞掩码预训练,再用配对 ATAC/RNA 数据微调,学习从可及性和调控基序到表达的映射。 |
| b | 展示下游用途:预测表达、调控元件重要性以及转录因子相互关系,说明同一模型如何支持不同调控问题。 |
| c | 以未见胎儿星形胶质细胞为例,比较基因表达预测与实测,及基因活性/相近细胞/平均细胞等参照;检验留出细胞类型的泛化。 |
c 用未见胎儿星形胶质细胞及简单基因活性、相近/平均细胞等参照,检验模型是否提供超出可及性总量的表达信息。留出细胞类型不必然等于留出所有供体、组织或平台,若迁移到新研究要逐项注明。a 的预训练与表达微调也必须分开:未见细胞有 ATAC 输入,缺的是表达标签,不能描述为没有该细胞任何数据。峰集合和基序扫描的可比性决定输入契约,尤其在疾病样本和 TE 重复区域。
Figure 2:体外序列活性的模拟
原图来源:所用 PDF 文件第 3 页,Figure 2。点击图片可查看原图。
| 子图 | 讲什么,以及怎样理解 |
|---|---|
| a | 图示 lentiMPRA 实验及 K562 微调 GET 的计算对应过程,将序列元素活性转为表达预测。 |
| b | 在随机抽取的元素上比较 GET 和 Enformer 预测与 lentiMPRA 的 log2 RNA/DNA 读数;按元素类别展示,考察活性排序及不同调控状态。 |
lentiMPRA 用 RNA/DNA 比值测元素活性,K562 微调和特定构建模拟使模型接近此实验条件。b 的不同元件类别能检查预测是否只把开放元素与关闭元素分开,而不能区分同一类别中的强弱。报告插入位置和构建与内源背景不同,所以该验证支持体外活性模拟,不直接说明所有原生 enhancer 的目标基因。与 Enformer 比较也应交代各自使用了哪些输入和微调信息,不能把额外 ATAC 或任务适配收益全部归为架构。
Figure 3:长程顺式调控元件
原图来源:所用 PDF 文件第 5 页,Figure 3。点击图片可查看原图。
| 子图 | 讲什么,以及怎样理解 |
|---|---|
| a | 以胎儿血红蛋白量为表型,说明寻找影响表型的元件和调控因子的路径。 |
| b | BCL11A 红系特异增强子中,模型贡献定位 GATA 基序;与碱基编辑 gRNA 富集及 ATAC 信号比较,支持它对 HbF 抑制因子的调控作用。 |
| c | 在 BCL11A 和 NFIX 位点比较 GET、其他模型、ABC、编辑数据和染色质接触轨迹,直观看远端候选是否具有独立实验支持。 |
| d | 用红系编辑及 K562 CRISPRi 两数据比较增强子—启动子联系的 AUPRC,包含超过 100 kb 的联系和模型组件消融。 |
HbF 是可以实验测量的终点,BCL11A/NFIX 的编辑数据将预测元件与功能读出连起来。b 对 GATA 基序的定位提供具体突变设计,c 的位点轨迹帮助核对远端联系,d 在更广集合及组件消融上检验普遍性。长距离优势有明确预测场景,但梯度仍不是接触测量或敲除效应;编辑改变 HbF 也可能经过多步机制。对未知靶基因,需通过表达、内源扰动或独立联系证据避免只选择最近 TSS。
Figure 4:推断转录因子间关系
原图来源:所用 PDF 文件第 6 页,Figure 4。点击图片可查看原图。
| 子图 | 讲什么,以及怎样理解 |
|---|---|
| a | 从基序贡献矩阵推断有向相互作用网络;边颜色为正/负估计效应,节点颜色为功能社区,展示模型产生的调控关系假设。 |
| b | 改变保留关系阈值,比较其与 STRING 物理相互作用的重叠比例,以及贡献相关/基序共定位等方法;独立数据库一致性支持这些关系具有生物意义。 |
贡献矩阵中推断有向正负关系,是模型响应的有向假说,不必等同物理蛋白结合。与 STRING 及替代共定位方法比较说明有生物学一致性,但数据库覆盖依赖研究程度;两个 TF 共享基序或共表达也可能贡献相关。阈值提高增加关系可信度会降低覆盖。真正值得实验的是具体 TF 对与具体细胞背景,而不是将整个网络每条边都写成已确认调控。
Figure 5:癌症相关 PAX5 变异的相互作用
原图来源:所用 PDF 文件第 7 页,Figure 5。点击图片可查看原图。
| 子图 | 讲什么,以及怎样理解 |
|---|---|
| a | PAX5 的结构置信度曲线标出突变热点,特别是 G183 附近无序区域,提出待研究位置。 |
| b | B 细胞特异 PAX/2 基序网络提示 PAX5 与核受体相关的相互作用。 |
| c | AlphaFold3 预测 PAX5 无序区与 NR2C2 的复合体,显示 G183 周围可能接触,为实验提供结构假设。 |
| d | 用 BioID 邻近标记及蛋白检测比较野生型 PAX5、G183S 及 RHOA 对照的相互作用蛋白;检验突变对复合体关系的影响。 |
| e | 对 d 中 NR2C2 富集及总蛋白标准化结果定量,展示 PAX5–NR2C2 相互作用随突变改变。 |
这幅图从序列/可及性模型跨到蛋白机制,因此需要结构预测和 BioID 两种额外证据。G183S 位于 PAX5 无序区,AlphaFold3 提出与 NR2C2 的接触假说;REH 细胞的邻近标记支持相互作用,并显示突变增强该关联。BioID 测邻近,不独自证明直接结合界面或因果转录效应;总蛋白标准化和 RHOA 对照降低表达量/非特异性解释。图的强项是逐步收窄机制,仍不能以一个相互作用变化解释全部白血病风险。
我的理解与可迁移设计
GET 提醒我,一个可测的环境输入可能比再加大 DNA 模型更有用。AD 中可及性可描述疾病细胞状态,但若训练和验证都来自同一批供体,会高估跨人泛化;应按供体/研究留出。把 TE 当作峰级元件时,还需检查基序族、mapping 和开放峰是否能可靠测量,不能把难比对的缺失峰直接当关闭标签。资源有限时可用固定基序×可及性特征训练小模型,与纯序列模型比较增量收益。蛋白网络推断和结构验证则适合作为升级步骤,首轮不应同时宣称远端靶基因与 TF 复合体均已确定。




