- 2 次围观
深度学习序列到功能(sequence-to-function,S2F)模型在对与性状和疾病相关的因果变异进行功能精细定位方面展现出巨大潜力。然而,这些模型在该任务中的实际有效性究竟如何,仍不明确。总体而言,S2F模型在分类推定因果的表达数量性状位点(expression quantitative trait loci,eQTL)单核苷酸变异(single-nucleotide variants,SNVs)方面表现良好,但在根据个体的全基因组序列对不同个体的基因表达值进行排序时,其性能却显著低于线性基线模型。这一结果直接质疑了S2F模型通过适当加权变异对基因表达的影响来对位点进行精细定位的能力。在本研究中,我们利用当前最先进的S2F模型AlphaGenome,将精细定位的eQTL与邻近的推定非因果SNV进行系统比较,分析其预测效应大小。我们发现,AlphaGenome普遍低估了大多数因果变异的效应,并因此在大多数位点上无法成功对eQTL进行精细定位。我们进一步表明,在S2F表达建模中被广泛认为是主要挑战的偏离方向的变异效应预测和个体间负相关,并非严重错误,而是在因果变异效应被低估时,弱且噪声较大的归因结果所导致的偶然现象。我们的结果表明,未能检测到变异对增强子活性的局部影响,是导致效应低估的原因之一。此外,我们发现,被低估的变异富集于远离其靶基因的位置,这提示即使局部效应能够被良好检测,增强子—基因连接不足仍会导致效应低估。最后,我们的结果阐明了S2F模型在精细定位任务中的可靠适用范围:尽管这些模型普遍低估大多数因果变异,对大多数位点的精细定位效用有限,但预测效应最显著的前0.1%变异显著富集于因果变异,其预测方向正确,并且在不同模型重复实验之间具有一致性,表明极强的预测结果总体上是可信的。我们的研究表明,因果变异效应低估是S2F表达预测模型面临的核心问题;未来的改进将取决于对局部活性的更佳检测能力以及更准确的增强子—基因连接。
深度学习序列到功能(sequence-to-function,S2F)模型在对与性状和疾病相关的因果变异进行功能精细定位方面展现出巨大的潜力。然而,这些模型在该任务中的实际有效性究竟如何,目前仍不清楚。总体而言,S2F模型在分类推定的因果表达数量性状位点(expression quantitative trait loci,eQTL)单核苷酸变异(single-nucleotide variants,SNVs)方面表现良好,但在根据不同个体的全基因组序列对其基因表达值进行排序时,却显著逊于线性基线模型;这一点直接质疑了它们通过恰当地加权变异对基因表达的影响来对位点进行精细定位的能力。在本研究中,我们利用当前最先进的S2F模型AlphaGenome,将经过精细定位的eQTL与邻近的推定非因果SNVs进行系统比较,分析其预测效应大小。我们发现,AlphaGenome普遍低估了大多数因果变异的效应,并因此无法在大多数位点上成功对eQTL进行精细定位。我们进一步表明,在S2F表达建模中被广泛认为是主要挑战的误导性变异效应预测和个体间负相关,并非严重错误,而是在因果变异效应被低估时,由微弱且含噪的归因结果偶然造成的后果。我们的结果表明,未能检测到局部变异对增强子活性的影响,是导致效应低估的原因之一。此外,我们发现,被低估的变异富集于远离其靶基因的位置,这提示即使局部效应能够被良好检测,增强子—基因连接不足仍会导致效应低估。最后,我们的结果阐明了S2F模型在精细定位目标上的可靠适用范围:尽管这些模型普遍低估大多数因果变异,因此对大多数位点的精细定位效用有限,但预测效应最显著的前0.1%变异中,因果变异显著富集,且其预测方向正确,并在不同模型重复运行之间保持一致,这表明极强的预测结果总体上是可信的。我们的研究结果表明,因果变异效应低估是S2F表达预测模型面临的核心问题;未来的改进将取决于对局部活性的更好检测以及对增强子—基因连接关系的更准确建立。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.09.08.750172v1?rss=1
🏷️ 序列到功能模型 因果变异 eQTL精细定位 深度学习 增强子—基因连接