- 13 次围观
许多基因组学检测始于单个DNA片段,但标准分析流程很快会将这些分子压缩为基因组区间上的计数。在这一过程中,每个片段所携带的丰富信息——包括其序列、片段主体、切割边界以及局部侧翼背景——都会丢失。这种信息损失在混合来源和异质性样本中尤为明显,因为其中的单个片段来源于不同的细胞类型,并且能够保留其来源细胞的信息。 为应对这一问题,我们提出了LEAF-1,这是一种片段级基础模型,基于约580亿个片段进行预训练,涵盖bulk ATAC-seq、单细胞ATAC-seq和无细胞DNA图谱,并将每个DNA分子表示为学习得到的语义空间中的一个点,该语义空间由序列背景、检测模态以及显式切割边界标记所定义。在稀疏的scATAC-seq数据集中,经均值池化的LEAF-1嵌入能够仅凭每个细胞约1,000个片段便高效地对人类细胞类型进行分类,且高评分片段与细胞类型相关的转录因子程序相关联。类似地,在无细胞DNA图谱分析中,LEAF-1在癌症检测任务中优于最先进的基于坐标分箱的策略以及通用DNA语言模型基线。将基于注意力的多实例学习应用于LEAF-1嵌入后,癌症检测性能进一步提升,受试者工作特征(ROC)曲线下面积(AUC)达到0.95。该泛癌模型能够泛化至其未接受训练的癌症类型;我们通过对透明细胞肾细胞癌患者和健康志愿者的血浆样本进行图谱分析,并在不重新训练的情况下应用冻结分类器,证明了这一点,获得了0.83的AUC。 这些结果表明,对单个DNA片段进行语义学习能够保留原本会在基于坐标的聚合过程中丢失的生物化学信号、细胞相关信号和疾病相关信号。
hamed.najafabadi{at}mcgill.ca
摘要
信息/历史
指标
补充材料
预览 PDF
摘要
许多基因组学检测始于单个 DNA 片段,但标准分析流程很快便将这些分子压缩为基因组区间上的计数。在这一过程中,每个片段所携带的丰富信息——包括其序列、片段持有人为作者/资助方,其已授予 bioRxiv 永久展示该预印本的许可。
本文依据 CC-BY-NC-ND 4.0 国际许可协议 发布。
返回顶部
上一篇
下一篇
发布于 2026 年 7 月 10 日。
下载 PDF
补充材料
电子邮件
感谢您有兴趣传播 bioRxiv 的内容。
您的电子邮件 *
您的姓名 *
发送至 *
请输入多个地址,每行一个,或用逗号分隔。
您将要通过电子邮件发送以下内容
用于无坐标基因组学数据分析的语义片段表示
邮件主题
(您的姓名)从 bioRxiv 转发了一个页面给您
邮件正文
(您的姓名)认为您可能会希望查看 bioRxiv 网站上的此页面。
您的个人留言
验证码
此问题用于测试您是否为人类访问者,并防止自动垃圾信息提交。
分享
用于无坐标基因组学数据分析的语义片段表示
Hamed Heydari , Jing Zhao , Madeleine Arseneault , Leila Younesian , Simon Tanguay , Yasser Riazalhosseini , Hani Goodarzi , Hamed S Najafabadi
bioRxiv 2026.07.09.737627; doi: https://doi.org/10.64898/2026.07.09.737627
分享本文:
复制
引文工具
用于无坐标基因组学数据分析的语义片段表示
Hamed Heydari , Jing Zhao , Madeleine Arseneault , Leila Younesian , Simon Tanguay , Yasser Riazalhosseini , Hani Goodarzi , Hamed S Najafabadi
bioRxiv 2026.07.09.737627; doi: https://doi.org/10.64898/2026.07.09.737627
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.07.09.737627v1?rss=1
🏷️ 基因组学 ATAC-seq 单细胞分析 基础模型 癌症检测 无坐标表示