- 4 次围观
随着生物人工智能模型变得更加强大,需要切实可行的生物安全方法,在支持有益应用的同时降低误用风险。基于序列相似性的筛查方法已不足以保障生物人工智能模型的安全,因为这些模型能够设计具有新颖序列和结构的分子。因此,需要一种将功能纳入考量的筛查方法。 为满足这一需求,我们提出了一种面向人工智能赋能的蛋白质结合物设计工具的新型筛查方法。我们的框架筛查的是蛋白质结合靶标——重点关注人类蛋白质组——而非结合物分子本身。我们从人类蛋白质组中构建了一个包含14,541个潜在有害蛋白质形式靶标的数据库(占全部人类蛋白质形式的7.1%),并按生物安全风险等级进行分类。为识别结构和功能特征,我们采用基于嵌入的筛查方法,利用ESM-C蛋白质语言模型对相关构建体进行了评估。ESM-C在检测已知靶标变体方面实现了较高准确率(F1分数>97%),其性能与BLASTP相近。然而,ESM-C在捕捉功能关系方面表现更为有效,能够区分良性突变与有害突变,而BLASTP则无法做到这一点。 为表征该筛查方法将如何影响生物科学研究,我们测量了不同蛋白质数据集中的标记率。对于按论文发表频率加权的哺乳动物蛋白质,标记率较高(人类为23%,小鼠为20%);而对于与人类亲缘关系较远的生物体,标记率则极低(细菌、真菌、植物和病毒均低于1.1%)。在具有商业相关性的靶标中,63%的抗体专利靶标被归类为双重用途,这反映出具有治疗重要性的蛋白质往往也承担关键生物学功能。 为了在不给科学研究与创新施加过度负担的情况下,从蛋白质结合物设计工具中识别并标记高风险用户请求,必须以一种能够应对我们分析所揭示的“需关注靶标”与“治疗性靶标”之间重叠问题的方式部署这种筛查方法——可能需要与分级可信访问框架协同实施。这一新方法为生物人工智能模型建立了适度的安全保障基础,既能降低误用风险,又能保留其对合法研究的益处,并展示了一个可推广至其他蛋白质设计工具和生物人工智能模型的具体概念验证。
随着生物人工智能模型变得愈发强大,为了在支持有益应用的同时降低被滥用的风险,亟需切实可行的生物安全方法。基于序列相似性的筛查方法已不足以保障生物人工智能模型的安全,因为这类模型能够设计具有全新序列和结构的分子。因此,需要一种将功能因素纳入考量的筛查方法。
为满足这一需求,我们提出了一种面向人工智能赋能蛋白结合体设计工具的新型筛查方法。我们的框架筛查的是蛋白结合靶标,重点关注人类蛋白质组,而非结合体分子本身。我们构建了一个包含14,541个潜在有害蛋白质形式靶标的数据库,这些靶标来源于人类蛋白质组(占全部人类蛋白质形式的7.1%),并按生物安全风险等级进行了分类。
为辨别结构和功能特征,我们采用基于嵌入的筛查方法,并使用ESM-C蛋白语言模型对相关构建进行评估。ESM-C在检测已知靶标变体方面实现了很高的准确性(F1分数>97%),其性能与BLASTP相近。然而,ESM-C在捕捉功能关系方面被证明更为有效,能够区分良性突变与有害突变,而BLASTP则未能做到这一点。
为表征该筛查方法将如何影响生物科学研究,我们测量了不同蛋白数据集中的标记率。对于按发表频率加权的哺乳动物蛋白,标记率较高(人类为23%,小鼠为20%);而对于与人类亲缘关系较远的生物,其标记率极低(细菌、真菌、植物和病毒均
为了在不过度增加科学研究与创新负担的前提下,从蛋白结合体设计工具中识别并标记存在风险的用户请求,必须以能够应对我们分析所显示的“受关注靶标”与治疗靶标之间重叠问题的方式部署这种筛查方法——这可能需要与分级可信访问框架协同实施。
这种新方法为生物人工智能模型提供了适度且相称的安全保障基础,既能降低滥用风险,又能保留其对合法研究的益处;同时,它也展示了一个可推广至其他蛋白设计工具和生物人工智能模型的具体概念验证。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.08.04.740855v1?rss=1
🏷️ 蛋白质设计 生物安全 输入筛查 蛋白质语言模型 人类蛋白质组 双重用途风险