28.crossNN:原图、模型逻辑与研究范式

论文题名: crossNN is an explainable framework for cross-platform DNA methylation-based classification of tumors

期刊与年份: Nature Cancer,2025。论文原文。

范围为正文全部编号主图及其子图,包含流程示意图。Extended Data 和 Supplementary Figures 不在本次范围。页码指阅读时所用 PDF 的文件页码。

返回专题总目录

阅读来源说明: Nature Cancer,2025;以当前 PDF 为准。

研究瓶颈怎样转化为问题

跨甲基化平台的困难不仅是值的批次不同,更是 CpG 覆盖集合不同。crossNN 用缺失与甲基化状态分开的编码及极高随机遮蔽训练,让同一分类器适应不同稀疏测量。依据设计逻辑推断,idea 是把平台差异的一部分变成训练中可见的缺失条件,再用多种真实平台检查。甲基化类别是监督终点,分类标记不是自动的致癌位点。

输入、目标与模型选择

缺失 0、未甲基化 −1、甲基化 1 的二值化输入,避免把缺失当生物学未甲基化;99.75% 遮蔽和 1,000 epoch 通过重采样提供稀疏训练。随机遮蔽提供冗余学习,但真实平台可能有非随机覆盖、噪声和细胞混合,所以独立验证不可省。分类置信的 MC 与家族 MCF 层级、芯片与测序阈值各不同,不能只报一个总体精确率。

Figure 1:随机遮蔽训练与内部分类表现

Figure 1

原图来源:所用 PDF 文件第 3 页,Figure 1。点击图片可查看原图。

子图 讲解
a 模型将缺失位点编码为 0、未甲基化为 −1、甲基化为 1,并在训练中反复随机遮蔽位点;通过学习稀疏输入适应不同平台的覆盖。
b 五折交叉验证的混淆矩阵;主要混淆发生在同一家族的近似亚型,具体类 MC 与家族 MCF 层级应分别评估。

编码和随机遮蔽是模型泛化的重要设计,混淆矩阵则检验哪些细分类别仍相近。MCF 正确不等于 MC 正确,家族层更高准确率反映目标放宽。仿真稀疏性支持方法,但不代替真实平台验证;缺失与未甲基化分开也不消除二值化损失的连续信息。

Figure 2:七个平台的独立脑肿瘤验证

Figure 2

原图来源:所用 PDF 文件第 4 页,Figure 2。点击图片可查看原图。

子图 讲解
a 450K 芯片 的 610 个样本输入 CpG 数分布;记录该平台实际覆盖了多少模型特征,用于比较不同实验平台的信息稀疏程度。
b 450K 芯片 样本按置信分数排序的瀑布图;颜色区分具体甲基化类别 MC 正确、仅类别家族 MCF 正确及误判,虚线为诊断阈值。显示哪些预测可接受、哪些应保留为低置信。
c 450K 芯片 中用置信分数识别分类是否正确的 ROC,分别评价 MC 与 MCF 层级;曲线反映分数区分可靠预测的能力,并非肿瘤/健康筛查 ROC。
d EPICv1 芯片 的 554 个样本输入 CpG 数分布;记录该平台实际覆盖了多少模型特征,用于比较不同实验平台的信息稀疏程度。
e EPICv1 芯片 样本按置信分数排序的瀑布图;颜色区分具体甲基化类别 MC 正确、仅类别家族 MCF 正确及误判,虚线为诊断阈值。显示哪些预测可接受、哪些应保留为低置信。
f EPICv1 芯片 中用置信分数识别分类是否正确的 ROC,分别评价 MC 与 MCF 层级;曲线反映分数区分可靠预测的能力,并非肿瘤/健康筛查 ROC。
g EPICv2 芯片 的 133 个样本输入 CpG 数分布;记录该平台实际覆盖了多少模型特征,用于比较不同实验平台的信息稀疏程度。
h EPICv2 芯片 样本按置信分数排序的瀑布图;颜色区分具体甲基化类别 MC 正确、仅类别家族 MCF 正确及误判,虚线为诊断阈值。显示哪些预测可接受、哪些应保留为低置信。
i EPICv2 芯片 中用置信分数识别分类是否正确的 ROC,分别评价 MC 与 MCF 层级;曲线反映分数区分可靠预测的能力,并非肿瘤/健康筛查 ROC。
j 纳米孔 R9 的 415 个样本输入 CpG 数分布;记录该平台实际覆盖了多少模型特征,用于比较不同实验平台的信息稀疏程度。
k 纳米孔 R9 样本按置信分数排序的瀑布图;颜色区分具体甲基化类别 MC 正确、仅类别家族 MCF 正确及误判,虚线为诊断阈值。显示哪些预测可接受、哪些应保留为低置信。
l 纳米孔 R9 中用置信分数识别分类是否正确的 ROC,分别评价 MC 与 MCF 层级;曲线反映分数区分可靠预测的能力,并非肿瘤/健康筛查 ROC。
m 纳米孔 R10 的 129 个样本输入 CpG 数分布;记录该平台实际覆盖了多少模型特征,用于比较不同实验平台的信息稀疏程度。
n 纳米孔 R10 样本按置信分数排序的瀑布图;颜色区分具体甲基化类别 MC 正确、仅类别家族 MCF 正确及误判,虚线为诊断阈值。显示哪些预测可接受、哪些应保留为低置信。
o 纳米孔 R10 中用置信分数识别分类是否正确的 ROC,分别评价 MC 与 MCF 层级;曲线反映分数区分可靠预测的能力,并非肿瘤/健康筛查 ROC。
p 靶向甲基化测序 的 124 个样本输入 CpG 数分布;记录该平台实际覆盖了多少模型特征,用于比较不同实验平台的信息稀疏程度。
q 靶向甲基化测序 样本按置信分数排序的瀑布图;颜色区分具体甲基化类别 MC 正确、仅类别家族 MCF 正确及误判,虚线为诊断阈值。显示哪些预测可接受、哪些应保留为低置信。
r 靶向甲基化测序 中用置信分数识别分类是否正确的 ROC,分别评价 MC 与 MCF 层级;曲线反映分数区分可靠预测的能力,并非肿瘤/健康筛查 ROC。
s 全基因组亚硫酸氢盐测序 WGBS 的 125 个样本输入 CpG 数分布;记录该平台实际覆盖了多少模型特征,用于比较不同实验平台的信息稀疏程度。
t 全基因组亚硫酸氢盐测序 WGBS 样本按置信分数排序的瀑布图;颜色区分具体甲基化类别 MC 正确、仅类别家族 MCF 正确及误判,虚线为诊断阈值。显示哪些预测可接受、哪些应保留为低置信。
u 全基因组亚硫酸氢盐测序 WGBS 中用置信分数识别分类是否正确的 ROC,分别评价 MC 与 MCF 层级;曲线反映分数区分可靠预测的能力,并非肿瘤/健康筛查 ROC。

七平台各三面板依次回答覆盖量、预测正确性与置信排序。这里 ROC 是置信分数识别自身分类是否正确,不能称肿瘤/健康筛查。芯片 >0.4、测序 >0.2 的阈值在相应验证中校准;高精确率须连同接受覆盖率读,不保证新平台任意样本同样可靠。

Figure 3:权重如何指向分类标志位点

Figure 3

原图来源:所用 PDF 文件第 6 页,Figure 3。点击图片可查看原图。

子图 讲解
a IDH 突变、1p/19q 共缺失少突胶质瘤的特征权重分布;高绝对权重位点被突出,正/负权重表示对分类分数不同方向的贡献,这里的分布阴影不是分类 ROC。
b 91 个甲基化类别各自最高正权重 CpG 的甲基化水平热图;显示模型的重要位点具有类别相关的模式。
c 不同髓母细胞瘤亚型的前 200 个高权重特征聚类,并标出 Wnt 相关基因;将亚型判别与已知通路背景联系。
d 各类别前 1,000 个正、负权重位点所覆盖的调控元件注释;比较重要特征在启动子、基因体等背景中的分布。
e 少突胶质瘤与其余参考样本的 LDHA 区域平均甲基化对照;模型挑出的位点对应启动子差异,给出可定位的分类线索。
f HGNET-MN1 与其余样本的 MUM1/PWWP3A 区域甲基化;差异主要在基因体,近端 CpG 岛没有同样差异,说明不能只检查启动子 CpG 岛。

权重、类别甲基化和基因区域显示可解释分类线索。高权重可能来自与真实驱动共变的标记,LDHA/MUM1 等局部差异不能单独证明表达方向或致癌。正负权重表示模型分类作用,基因体和启动子甲基化也不能统一解读为转录抑制。

Figure 4:扩展到泛癌分型的验证

Figure 4

原图来源:所用 PDF 文件第 7 页,Figure 4。点击图片可查看原图。

子图 讲解
a 8,382 个泛癌训练样本的 UMAP,展示甲基化参考图谱中的肿瘤分布。
b 把 a 中样本按癌、造血淋巴系统、神经上皮和肉瘤等大组着色,说明训练集覆盖多个组织谱系。
c 内部验证混淆矩阵,检查泛癌模型对具体类别及更大分组的识别情况和混淆来源。
d 泛癌独立验证中 450K 的输入 CpG 特征数分布;显示跨组织后该平台所提供的特征覆盖。
e 泛癌 450K 队列按分数排序的预测,颜色区分 MC、MCF 层级正确及错误;阈值以上的预测可与实际类别核对。
f 泛癌 450K 队列的置信分数 ROC,同时比较具体类与家族类的正确性;检验模型在该平台能否识别自身预测的可靠程度。
g 泛癌独立验证中 EPIC 的输入 CpG 特征数分布;显示跨组织后该平台所提供的特征覆盖。
h 泛癌 EPIC 队列按分数排序的预测,颜色区分 MC、MCF 层级正确及错误;阈值以上的预测可与实际类别核对。
i 泛癌 EPIC 队列的置信分数 ROC,同时比较具体类与家族类的正确性;检验模型在该平台能否识别自身预测的可靠程度。
j 泛癌独立验证中 纳米孔 R9 的输入 CpG 特征数分布;显示跨组织后该平台所提供的特征覆盖。
k 泛癌 纳米孔 R9 队列按分数排序的预测,颜色区分 MC、MCF 层级正确及错误;阈值以上的预测可与实际类别核对。
l 泛癌 纳米孔 R9 队列的置信分数 ROC,同时比较具体类与家族类的正确性;检验模型在该平台能否识别自身预测的可靠程度。
m 泛癌独立验证中 纳米孔 R10 的输入 CpG 特征数分布;显示跨组织后该平台所提供的特征覆盖。
n 泛癌 纳米孔 R10 队列按分数排序的预测,颜色区分 MC、MCF 层级正确及错误;阈值以上的预测可与实际类别核对。
o 泛癌 纳米孔 R10 队列的置信分数 ROC,同时比较具体类与家族类的正确性;检验模型在该平台能否识别自身预测的可靠程度。
p 泛癌独立验证中 靶向甲基化测序 的输入 CpG 特征数分布;显示跨组织后该平台所提供的特征覆盖。
q 泛癌 靶向甲基化测序 队列按分数排序的预测,颜色区分 MC、MCF 层级正确及错误;阈值以上的预测可与实际类别核对。
r 泛癌 靶向甲基化测序 队列的置信分数 ROC,同时比较具体类与家族类的正确性;检验模型在该平台能否识别自身预测的可靠程度。
s 泛癌独立验证中 WGBS 的输入 CpG 特征数分布;显示跨组织后该平台所提供的特征覆盖。
t 泛癌 WGBS 队列按分数排序的预测,颜色区分 MC、MCF 层级正确及错误;阈值以上的预测可与实际类别核对。
u 泛癌 WGBS 队列的置信分数 ROC,同时比较具体类与家族类的正确性;检验模型在该平台能否识别自身预测的可靠程度。
v 跨全部平台,分别统计四个肿瘤大组的准确率;评估泛癌覆盖是否在每个组织大类都保持效果,且各组验证样本量不同。
w 四个大组的精确率,考察预测为该类的病例中有多少真正属于该类;它与 v 的准确率含义不同。
x 肾嫌色、肾透明细胞和肾乳头状癌的独立分类混淆矩阵;列为真实亚型、行为模型预测,展示相近器官内亚型的区分及其错误。

阅读提醒

  • MC 为具体甲基化类别,MCF 为甲基化类别家族。瀑布图中的两级正确性不能互相替代;跨平台置信阈值也不同。权重分析提供分类关联线索,不自动证明甲基化位点驱动肿瘤发生。

泛癌扩展重新学习更多类别,并在多个平台复核;UMAP 和内部混淆之后的独立面板才检验外推。不同器官大组样本量和精确率不同,不能以总体 97.8%代表每类。肾亚型列为真实、行为预测,读错轴会反转错误含义;近似类别应逐项检查。

我的理解与可迁移设计

可迁移的是先定义测量缺失,再设计真实跨平台验证。AD ATAC/TE 区低信号可能来自不开放、低覆盖或不可唯一比对,不能统统编码同一种阴性。缺失mask能帮助模型鲁棒,却不能补出正式功能标签。资源有限的小模型也可做有效研究,前提是输入契约、置信阈值和外部研究分母清楚;分类解释仍需与实际等位序列机制分开。

继续阅读与公开资源