一种基础模型可根据生物合成基因簇序列预测天然产物的分子性质、生物活性和结构相似性

root 提交于 周三, 07/08/2026 - 20:47
基因组挖掘是天然产物发现中的一项强大技术,其中通过生物信息学分析识别可能产生新型或理想天然产物的生物合成基因簇。预测得到的生物合成基因簇数量远多于能够轻易通过实验表征的数量。若能增加基于产物生物活性、结构特性或新颖性对生物合成基因簇进行优先级排序的计算方法,将使基因组挖掘更加高效。已经开发出多种机器学习/人工智能模型,用于根据生物合成基因簇序列预测产物性质,但其受到训练数据量较小的限制。利用无标签数据进行模型预训练,是一种能够开发出在有限标注训练数据条件下仍可学习的模型的强有力技术。生物合成基因簇非常适合这一策略,因为存在大量预测得到的基因簇,而其中只有很小一部分已被表征。本文报告了BGC-MLM,这是一种基础模型,先在预测得到的生物合成基因簇上通过掩码语言任务进行预训练,然后针对下游应用进行微调,这些应用包括产物结构类别、生物活性、化学性质、官能团计数以及化学指纹的预测。与未经过预训练的模型相比,结果表明预训练通常能够提升性能。BGC-MLM在这些任务上的表现优于或接近现有专门方法,证明了其作为天然产物基因组挖掘基础模型的实用性。

一种基础模型可基于生物合成基因簇序列预测天然产物的分子性质、生物活性和结构相似性 | bioRxiv

跳转至主要内容

首页 关于 投稿 提醒 / RSS 搜索该关键词 高级搜索 新结果

一种基础模型可基于生物合成基因簇序列预测天然产物的分子性质、生物活性和结构相似性

查看 ORCID 个人主页

Allison Walker

doi: https://doi.org/10.64898/2026.07.05.736569

Allison Walker 范德堡大学

在 Google Scholar 上查找该作者 在 PubMed 上查找该作者 在持有人为作者/资助方,其已授予 bioRxiv 永久展示该预印本的许可。 本文依据 CC-BY 4.0 国际许可协议 公开提供。

返回顶部

上一篇 下一篇

发布于 2026 年 7 月 7 日。

下载 PDF 补充材料 数据/代码 电子邮件

感谢您有兴趣传播 bioRxiv 上的信息。 您的电子邮件 * 您的姓名 * 发送至 * 输入多个地址时,请分行填写或使用逗号分隔。

您将要通过电子邮件发送以下内容

一种基础模型可基于生物合成基因簇序列预测天然产物的分子性质、生物活性和结构相似性

邮件主题

(您的姓名)已从 bioRxiv 转发一个页面给您

邮件正文

(您的姓名)认为您会希望查看 bioRxiv 网站上的这个页面。

您的个人留言

验证码

此问题用于测试您是否为人工访客,并防止自动化垃圾信息提交。

分享

一种基础模型可基于生物合成基因簇序列预测天然产物的分子性质、生物活性和结构相似性

Allison Walker bioRxiv 2026.07.05.736569; doi: https://doi.org/10.64898/2026.07.05.736569

分享本文: 复制

引文工具

一种基础模型可基于生物合成基因簇序列预测天然产物的分子性质、生物活性和结构相似性

Allison Walker bioRxiv 2026.07.05.736569; doi: https://doi.org/10.64898/2026.07.05.736569


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.07.05.736569v1?rss=1

🏷️ 生物合成基因簇 天然产物发现 基因组挖掘 基础模型 掩码语言模型 生物活性预测