- 1次围观
从实验数据中推断生物学功能,是理解新出现的病原体并制定有效防控措施的核心环节;然而,对这些数据的解读仍然缓慢且高度依赖专家。人工智能代理能够通过综合分析序列、结构和生物物理学证据,帮助加速这一过程。我们提出了 BioSecBench-Function,这是一个可验证的基准,用于评估从真实生物学数据中恢复与生物安全相关功能的能力。该基准包含基于已发表数据集构建的 111 项评估,并依据真实情况以确定性方式进行评分。我们沿两个维度组织这些评估:威胁轴(涵盖七类与生物安全相关的问题类型)和生物学问题(指明解决方案主要依赖序列数据、结构数据,还是生物物理学实验数据)。 在来自 22 种模型—工具框架配置的 7,326 次运行中,Claude Code 下的 Opus 5 以 50.3% 的端点通过率居首;在将拒答计为失败的情况下,Grok Build 下的 Grok 4.6 以 44.1% 的总体通过率领先。不同模型—工具框架配置以及不同任务类别之间的性能差异均十分显著。不同服务提供商的拒答率存在明显差异,而成本并不能很好地预测准确性:若干低成本配置的通过率超过了 40%。BioSecBench-Function 为衡量智能体是否值得信赖提供了一项标准,用于评估当下一次疫情暴发时,智能体能否准确解读一种新病原体或变异株的生物学作用。
BioSecBench-Function:基于实验数据推理生物学功能的可验证基准 | bioRxiv
跳转至主要内容
主页
关于
投稿
提醒 / RSS
搜索此关键词
高级搜索
最新结果
BioSecBench-Function:基于实验数据推理生物学功能的可验证基准
查看 ORCID 个人资料
Dianzhuo Wang
、
Qian Xu
、
Arjun Banerjee
、
Rishi Jain
、
Aakarsh Vermani
、
Jonathan Felix
、
Gage Moreno
、
Faisal AlZaben
、
Nicholas Keul
、
Evan Seeyave
、
Harmon Bhasin
doi:
https://doi.org/10.64898/2026.09.03.749010
Dianzhuo Wang
LatchBio
在 Google Scholar 中查找该作者
在 PubMed 中查找该作者
在本网站搜索该作者
Dianzhuo Wang 的 ORCID 记录
通讯作者:
johnwang{at}g.harvard.edu
Qian Xu
LatchBio
在 Google Scholar 中查找该作者
在 PubMed 中查找该作者
在本网站搜索该作者
Arjun Banerjee
LatchBio
在 Google Scholar 中查找该作者
在 PubMed 中查找该作者
在本网站搜索该作者
Rishi Jain
LatchBio
在 Google Scholar 中查找该作者
在 PubMed 中查找该作者
在本网站搜索该作者
Aakarsh Vermani
LatchBio
在 Google Scholar 中查找该作者
在 PubMed 中查找该作者
在本网站搜索该作者
Jonathan Felix
LatchBio
在 Google Scholar 中查找该作者
在 PubMed 中查找该作者
在本网站搜索该作者
Gage Moreno
LatchBio
在 Google Scholar 中查找该作者
在 PubMed 中查找该作者
在本网站搜索该作者
Faisal AlZaben
LatchBio
在 Google Scholar 中查找该作者
在 PubMed 中查找该作者
在本网站搜索该作者
Nicholas Keul
LatchBio
在 Google Scholar 中查找该作者
在 PubMed 中查找该作者
在本网站搜索该作者
Evan Seeyave
LatchBio
在 Google Scholar 中查找该作者
在 PubMed 中查找该作者
在本网站搜索该作者
Harmon Bhasin
LatchBio
在 Google Scholar 中查找该作者
在 PubMed 中查找该作者
在本网站搜索该作者
摘要
信息/历史
指标
预览 PDF
摘要
从实验数据中推断生物学功能,是理解新兴病原体和开发有效应对措施的核心环节;然而,对这些数据进行解读仍然缓慢且高度依赖专家。人工智能代理可以通过综合分析序列、结构和生物物理学证据,帮助加速这一过程。我们提出了 BioSecBench-Function,这是一个用于从真实生物学数据中恢复与生物安全相关功能的可验证基准。该基准包含 111 项评测,基于已发表的数据集构建,并依据真实结果进行确定性评分。我们沿两个维度组织这些评测:威胁轴,涵盖七类与生物安全相关的问题类型;生物学问题,表明解决方案主要依赖序列数据、结构数据还是生物物理学检测数据。在来自 22 种模型—工具配置的 7,326 次运行中,当使用 Claude Code 时,Opus 5 以 50.3% 的端点评测通过率领先;当拒答被计为失败时,使用 Grok Build 的 Grok 4.6 以 44.1% 的总体通过率领先。不同模型—工具配置之间以及不同任务类别之间的性能差异均十分显著。不同提供商的拒答率差异悬殊,而成本并不能很好地预测准确率:有若干低成本配置的通过率超过了 40%。BioSecBench-Function 为衡量人工智能代理是否值得信赖提供了一项标准,即当下一次疫情暴发时,这些代理能否正确解读一种新病原体或变异体的作用。
利益冲突声明
版权
本预印本的。
本预印本依据
CC-BY 4.0 国际许可协议
向公众提供。
返回顶部
上一页
下一页
发布于 2026 年 9 月 8 日。
下载 PDF
电子邮件
感谢您有意帮助传播 bioRxiv 上的内容。
您的电子邮件地址
*
您的姓名
*
发送至
*
请在不同地址之间换行或使用逗号分隔。
您将要发送以下内容
BioSecBench-Function:基于实验数据推理生物学功能的可验证基准
邮件主题
(您的姓名)从 bioRxiv 网站转发了一个页面给您
邮件正文
(您的姓名)认为您可能会对 bioRxiv 网站上的此页面感兴趣。
您的个人留言
验证码
此问题用于测试您是否为人类访客,并防止自动化垃圾信息提交。
分享
BioSecBench-Function:基于实验数据推理生物学功能的可验证基准
Dianzhuo Wang
、
Qian Xu
、
Arjun Banerjee
、
Rishi Jain
、
Aakarsh Vermani
、
Jonathan Felix
、
Gage Moreno
、
Faisal AlZaben
、
Nicholas Keul
、
Evan Seeyave
、
Harmon Bhasin
bioRxiv
2026.09.03.749010;
doi:
https://doi.org/10.64898/2026.09.03.749010
分享本文:
复制
引文工具
BioSecBench-Function:基于实验数据推理生物学功能的可验证基准
Dianzhuo Wang
、
Qian Xu
、
Arjun Banerjee
、
Rishi Jain
、
Aakarsh Vermani
、
Jonathan Felix
、
Gage Moreno
、
Faisal AlZaben
、
Nicholas Keul
、
Evan Seeyave
、
Harmon Bhasin
bioRxiv
2026.09.03.749010;
doi:
https://doi.org/10.64898/2026.09.03.749010
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.09.03.749010v1?rss=1
🏷️ 生物安全 生物学功能推断 人工智能代理 基准测试 病原体分析