- 2 次围观
长上下文序列到功能模型能够以核苷酸分辨率预测调控变异效应,从而推动了在广泛基因组背景下开展全面突变分析。然而,传统的计算机模拟饱和突变(in silico saturation mutagenesis,ISM)逐一评估突变,因此对单个基因就需要进行数百万次模型评估,在全基因组尺度上则需要数十亿至数万亿次评估。在此,我们提出 Multi-ISM,一种可扩展框架,将 ISM 重新表述为稀疏恢复问题。与穷举式单变异 ISM 相比,Multi-ISM 仅需其 1/45 的模型评估次数即可生成突变图谱,并且在变异效应基准测试中的准确性达到或超过前者。Multi-ISM 与模型架构无关,可迁移应用于大规模序列到功能模型。 我们将 Multi-ISM 应用于 5,000 个蛋白质编码基因,其中包括 3,317 个 OMIM 疾病基因,在 500 kb 窗口范围内生成了碱基对分辨率、组织分辨的归因图谱。这些图谱支持增强子—基因优先级排序,并有助于识别细胞类型特异性的调控元件。对图谱进行基因水平汇总后,可以刻画调控复杂性,并显示约束性更强的基因具有更小的预测突变效应。将 Multi-ISM 预测结果聚合为基因水平的罕见变异负荷后,相较于基于常见变异的弹性网络模型,个体化表达预测性能得到提升,其中在表达离群值处的增益最大。Multi-ISM 使长上下文序列模型的核苷酸分辨率解释从一项需要专门投入的工作变成常规计算,从而能够随着新架构、功能读出和细胞环境的出现,对其进行系统图谱化。
可扩展的饱和突变揭示基因调控架构与稀有变异效应 | bioRxiv
跳转至主要内容 主页 关于 投稿 提醒 / RSS 搜索此关键词 高级搜索 最新结果
可扩展的饱和突变揭示基因调控架构与稀有变异效应
查看 ORCID 个人资料
Han Yuan, Xingfan Huang, Benjamin Auerbach, Johannes Linder, Divyanshi Srivastava, 查看 ORCID 个人资料 David R Kelley
doi: https://doi.org/10.64898/2026.09.30.755794
Han Yuan 1 Calico Life Sciences LLC; 在 Google Scholar 中查找该作者 在 PubMed 中查找该作者 在本网站搜索该作者 Han Yuan 的 ORCID 记录
Xingfan Huang 1 Calico Life Sciences LLC; 在 Google Scholar 中查找该作者 在 PubMed 中查找该作者 在本网站搜索该作者
Benjamin Auerbach 1 Calico Life Sciences LLC; 在 Google Scholar 中查找该作者 在 PubMed 中查找该作者 在本网站搜索该作者
Johannes Linder 2 慕尼黑工业大学 在 Google Scholar 中查找该作者 在 PubMed 中查找该作者 在本网站搜索该作者
Divyanshi Srivastava 1 Calico Life Sciences LLC; 在 Google Scholar 中查找该作者 在 PubMed 中查找该作者 在本网站搜索该作者
David R Kelley 1 Calico Life Sciences LLC; 在 Google Scholar 中查找该作者 在 PubMed 中查找该作者 在本网站搜索该作者 David R Kelley 的 ORCID 记录
通讯作者: drk{at}calicolabs.com
摘要
信息/历史 指标 预览 PDF
摘要
长上下文序列到功能模型能够在核苷酸分辨率上预测调控变异的效应,从而推动了在广泛基因组背景下开展全面突变分析。然而,传统的计算机模拟饱和突变(in silico saturation mutagenesis,ISM)逐一对突变进行评分;针对单个基因就需要进行数百万次模型评估,而在全基因组尺度上则需要数十亿至数万亿次评估。在此,我们提出 Multi-ISM,这是一种可扩展框架,将 ISM 重新表述为稀疏恢复问题。与穷举式单变异 ISM 相比,Multi-ISM 仅需其 1/45 的模型评估次数即可生成突变图谱,并且在变异效应基准测试中的准确性达到或超过后者。Multi-ISM 不依赖特定模型架构,并且能够迁移应用于大规模序列到功能模型。
我们将 Multi-ISM 应用于 5,000 个蛋白质编码基因,其中包括 3,317 个 OMIM 疾病基因,在 500 kb 窗口内生成了具有碱基对分辨率和组织分辨能力的归因图谱。这些图谱支持增强子—基因优先级排序以及细胞类型特异性调控元件的鉴定。图谱的基因层面汇总结果刻画了调控复杂性,并显示约束性更强的基因具有更小的预测突变效应。将 Multi-ISM 预测聚合为基因层面的稀有变异负荷后,相较于基于常见变异的弹性网络模型,个体化表达预测性能得到提升,其中在表达离群值处的增益最大。Multi-ISM 使长上下文序列模型的核苷酸分辨率解释成为一项常规计算,而不再需要专门投入,因此,随着新的模型架构、功能读出和细胞环境不断出现,均可对其进行映射。
利益冲突声明
D.R.K.、H.Y.、X.H.、B.A. 和 D.S. 为 Calico Life Sciences LLC 的员工。J.L. 为 Calico Life Sciences LLC 的顾问。
已声明的资助方信息
本研究由 Calico Life Sciences LLC 资助。
版权
本预印本的。
该预印本依据 CC-BY-NC-ND 4.0 国际许可协议 提供。
返回顶部
上一篇
下一篇
发布于 2026 年 10 月 1 日。
下载 PDF
电子邮件
感谢您有兴趣传播 bioRxiv 的相关信息。
您的电子邮件地址
*
您的姓名
*
发送至
*
请输入多个地址,每行一个,或以逗号分隔。
您即将发送以下内容
可扩展的饱和诱变揭示基因调控架构和稀有变异效应
(您的姓名)已从 bioRxiv 向您转发了一个页面
邮件正文
(您的姓名)认为您可能会对 bioRxiv 网站上的这一页面感兴趣。
您的个人留言
验证码
此问题用于测试您是否为人类访客,并防止自动垃圾邮件提交。
分享
可扩展的饱和诱变揭示基因调控架构和稀有变异效应
Han Yuan
、
Xingfan Huang
、
Benjamin Auerbach
、
Johannes Linder
、
Divyanshi Srivastava
、
David R Kelley
bioRxiv
2026.09.30.755794;
DOI:
https://doi.org/10.64898/2026.09.30.755794
分享本文:
复制
引文工具
可扩展的饱和诱变揭示基因调控架构和稀有变异效应
Han Yuan
、
Xingfan Huang
、
Benjamin Auerbach
、
Johannes Linder
、
Divyanshi Srivastava
、
David R Kelley
bioRxiv
2026.09.30.755794;
DOI:
https://doi.org/10.64898/2026.09.30.755794
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.09.30.755794v1?rss=1
🏷️ 饱和诱变 调控变异效应 稀疏恢复 基因调控架构 长上下文序列模型 罕见变异负荷