- 5 次围观
背景。变异效应预测器越来越多地采用多重变异效应测定(multiplexed assays of variant effect,MAVEs)而非临床标签进行基准评估,这消除了标签循环性,却引入了一个新问题:与某项测量结果的相关性不可能超过该测量自身的可重复性,而不同比较区域的精确度差异可能十分显著。 结果。我们在一个冻结的图谱中,对19种预测器进行了评分;该图谱包含来自7个癌症易感基因的64,178个饱和基因组编辑变异,并划分为16个层级。根据已发表的重复测量评分和标准误,我们估计了每个区域的可靠性上限,并通过模拟表明:当上限约为0.45以上时,校正可降低误差;而当上限低于该值时,校正反而会放大误差。不同区域之间的上限差异大于不同预测器之间的差异;对其进行校正后,剪接极端区域的表现图谱也随之重绘。经典剪接位点处的性能崩塌在很大程度上是测定本身的属性:相对于编码区的中位性能差距由1.7倍缩小至1.4倍;去除BARD1或PALB2后,这种趋同性仍然存在,但去除BRCA1后则发生反转。因此,我们报告了三种“逐基因留一”交叉验证结果,而不是声称结果具有基因独立性;此外,前沿区域的性能平衡依赖于一个数据存档。真正的预测失败发生在进入内含子11–50 bp的区域,而未经校正的图谱将其呈现为仅有中等程度的失败。在MaveDB中,2,803个评分数据集中的2,452个至少在上限意义上包含可靠性估计所需的信息,然而,采用传统的列名搜索只能找到其中约十分之一;在674个人类数据存档中,凡是能够计算可靠性上限者,有29.9%–51.8%的上限低于0.90。在三个基因中,将预测结果按照测定自身的功能判定进行分类评估时,同一组预测器区分有害变异与耐受变异的能力优于其相关性所显示的水平,但在95%特异度的工作点上,没有任何预测器达到最强证据等级。 结论。按区域解析的基准评估应报告每个层级的可靠性估计,或明确说明该测定无法提供此类估计。这不会给数据存档提交者增加任何要求,并且在上限意义上,现已适用于MaveDB中的大多数数据集(87%)。
背景。变异效应预测器越来越多地依据多重变异效应测定(multiplexed assays of variant effect,MAVEs)而非临床标签进行基准评估;这消除了标签循环性,但也引入了一个新问题:相对于某项测量的相关性不可能超过该测量自身的可重复性,而不同被比较区域的精确度差异可能非常显著。
结果。我们在一个包含7个癌症易感基因、64,178个饱和基因组编辑变异的冻结图谱中,对16个分层中的19种预测器进行了评分。我们根据已发表的重复测量评分和标准误,估计了各区域的可靠性上限,并通过模拟表明:当上限约为0.45以上时,校正可降低误差;而低于该值时,校正反而会放大误差。不同区域之间的上限差异大于不同预测器之间的差异;对其进行校正后,剪接极端区域的表现图谱发生了重绘。规范剪接位点处的性能塌缩很大程度上是测定本身的属性:相对于编码区的中位数差距由1.7倍缩小至1.4倍;删除BARD1或PALB2后,这种趋同仍然存在,但删除BRCA1后则发生反转。因此,我们报告了三种“每次剔除一个基因”的交叉结果,而不声称结果与基因无关;此外,前沿区域的相当性仅建立在一次数据提交之上。真正的预测失败发生在进入内含子11–50 bp的区域,而未经校正的图谱将其呈现为程度有限的失败。在MaveDB中,2,803个评分数据集中的2,452个至少在上限意义上包含估计可靠性所需的信息,尽管采用传统的列名搜索只能找到其中约十分之一;在674个能够计算可靠性上限的人类数据提交中,有29.9%–51.8%的数据集低于0.90。对于其中3个基因,将预测结果按照测定自身给出的功能判定进行分类评估时,同一组预测器区分有害变异与耐受变异的能力优于其相关性所显示的水平;然而,在特异性为95%的工作点上,没有任何预测器达到最强证据等级。
结论。按区域分辨率进行基准评估时,应报告每个分层的可靠性估计,或明确说明该测定无法提供此类估计。这不会给数据提交者增加任何要求,并且目前在上限意义上适用于MaveDB中的大多数数据集(87%)。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.09.14.751496v1?rss=1
🏷️ 变异效应预测 多重变异效应测定 测量可靠性 功能基准评估 癌症易感基因 交叉验证