Recon3D上图神经网络代谢反应活性评分的基准有效性:检测标签泄漏、记忆化噪声与输入不变模型

root 提交于 周二, 09/08/2026 - 02:47
情境特异性全基因组规模代谢建模始于评估约 10,600 个人类反应中哪些反应在患者肿瘤中处于活跃状态。该领域的方法通常以对输入模型的同一转录组矩阵进行阈值化所得的活性标签作为基准进行评测。我们报告了对自身图注意力评分器 MetaGNN 的一次自审计,并在 TCGA 结直肠癌(n=624)、乳腺癌(n=1,095)和肺腺癌(n=517)队列上进行了评估。在此过程中,我们发现了两种相互独立的失效模式:它们分别造成了近乎理论上限的基准分数和一个看似积极的架构结果,但经检查后均无法成立。首先,在基于表达阈值化标签的监督设置下,该框架在 TCGA-BRCA 上达到 AUROC 0.9864 +/- 0.0008。该数值可分解为两部分:其中 5,925 个反应的标签是模型自身输入的确定性阈值函数,仅依据队列平均输入进行排序即可得到 AUROC 1.000;另有 4,675 个反应的已存储标签可由带种子的伪随机数生成器逐位复现,但模型仍达到 0.9291 +/- 0.0030,因为它记住了一个患者不变的标签向量,而患者级别的数据划分并未阻止该向量在训练期间完全可见。其次,在标签独立于输入的队列上,存档模型实际上从未接收到任何患者数据。其发布的特征张量均为全零;独立训练的模型在判断哪些患者在哪些位置发生偏离这一点上也没有表现出一致性(逐患者输出残差的 |r|

情境特异性基因组尺度代谢建模始于对约10,600个反应进行评分,以判断哪些反应在患者肿瘤中处于活跃状态。该领域的方法通常以对输入模型的同一转录组矩阵进行阈值处理所得的活性标签作为基准进行评估。我们报告了对自身图注意力评分器 MetaGNN 的一次自审计结果。该模型在 TCGA 结直肠癌(n=624)、乳腺癌(n=1,095)和肺腺癌(n=517)队列上进行了评估。在这一过程中,两个相互独立的失效模式共同产生了近乎满分的基准评测结果以及一个看似积极的架构结论,但经检查后发现二者均无法成立。首先,在基于表达阈值的监督设定下,该框架在 TCGA-BRCA 上达到 AUROC 0.9864 +/- 0.0008。该数值可拆分为两部分:其中5,925个反应的标签是模型自身输入的确定性阈值函数,仅依据队列平均输入进行排序即可得到 AUROC 1.000;另外4,675个反应的已存储标签,则可通过带种子的伪随机数生成器逐位复现,而模型仍达到 0.9291 +/- 0.0030,其原因在于模型记住了一个患者不变的标签向量,而按患者进行的数据划分并未阻止该向量在训练期间被完全观察到。其次,在独立于输入数据进行监督的队列上,所存档的模型实际上从未接收任何患者数据。其发布的特征张量全部为零;独立训练的模型在判断哪些患者于何处出现偏离方面也不存在一致性(逐患者输出残差的 |r|


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.09.02.748315v1?rss=1

🏷️ 情境特异性代谢建模 图神经网络 标签泄漏 模型记忆化 肿瘤转录组 基准评估