BioSecBench-Function:一个用于基于实验数据推理生物学功能的可验证基准测试

root 提交于 周三, 09/09/2026 - 12:47
从实验数据中推断生物学功能,是理解新出现的病原体并制定有效防控措施的核心环节;然而,对这些数据的解读仍然缓慢且高度依赖专家。人工智能代理能够通过综合分析序列、结构和生物物理学证据,帮助加速这一过程。我们提出了 BioSecBench-Function,这是一个可验证的基准,用于评估从真实生物学数据中恢复与生物安全相关功能的能力。该基准包含基于已发表数据集构建的 111 项评估,并依据真实情况以确定性方式进行评分。我们沿两个维度组织这些评估:威胁轴(涵盖七类与生物安全相关的问题类型)和生物学问题(指明解决方案主要依赖序列数据、结构数据,还是生物物理学实验数据)。 在来自 22 种模型—工具框架配置的 7,326 次运行中,Claude Code 下的 Opus 5 以 50.3% 的端点通过率居首;在将拒答计为失败的情况下,Grok Build 下的 Grok 4.6 以 44.1% 的总体通过率领先。不同模型—工具框架配置以及不同任务类别之间的性能差异均十分显著。不同服务提供商的拒答率存在明显差异,而成本并不能很好地预测准确性:若干低成本配置的通过率超过了 40%。BioSecBench-Function 为衡量智能体是否值得信赖提供了一项标准,用于评估当下一次疫情暴发时,智能体能否准确解读一种新病原体或变异株的生物学作用。

BioSecBench-Function:基于实验数据推理生物学功能的可验证基准 | bioRxiv

跳转至主要内容

主页

关于

投稿

提醒 / RSS

搜索此关键词

高级搜索

最新结果

BioSecBench-Function:基于实验数据推理生物学功能的可验证基准

查看 ORCID 个人资料

Dianzhuo Wang

Qian Xu

Arjun Banerjee

Rishi Jain

Aakarsh Vermani

Jonathan Felix

Gage Moreno

Faisal AlZaben

Nicholas Keul

Evan Seeyave

Harmon Bhasin

doi:

https://doi.org/10.64898/2026.09.03.749010

Dianzhuo Wang

LatchBio

在 Google Scholar 中查找该作者

在 PubMed 中查找该作者

在本网站搜索该作者

Dianzhuo Wang 的 ORCID 记录

通讯作者:

johnwang{at}g.harvard.edu

Qian Xu

LatchBio

在 Google Scholar 中查找该作者

在 PubMed 中查找该作者

在本网站搜索该作者

Arjun Banerjee

LatchBio

在 Google Scholar 中查找该作者

在 PubMed 中查找该作者

在本网站搜索该作者

Rishi Jain

LatchBio

在 Google Scholar 中查找该作者

在 PubMed 中查找该作者

在本网站搜索该作者

Aakarsh Vermani

LatchBio

在 Google Scholar 中查找该作者

在 PubMed 中查找该作者

在本网站搜索该作者

Jonathan Felix

LatchBio

在 Google Scholar 中查找该作者

在 PubMed 中查找该作者

在本网站搜索该作者

Gage Moreno

LatchBio

在 Google Scholar 中查找该作者

在 PubMed 中查找该作者

在本网站搜索该作者

Faisal AlZaben

LatchBio

在 Google Scholar 中查找该作者

在 PubMed 中查找该作者

在本网站搜索该作者

Nicholas Keul

LatchBio

在 Google Scholar 中查找该作者

在 PubMed 中查找该作者

在本网站搜索该作者

Evan Seeyave

LatchBio

在 Google Scholar 中查找该作者

在 PubMed 中查找该作者

在本网站搜索该作者

Harmon Bhasin

LatchBio

在 Google Scholar 中查找该作者

在 PubMed 中查找该作者

在本网站搜索该作者

摘要

信息/历史

指标

预览 PDF

摘要

从实验数据中推断生物学功能,是理解新兴病原体和开发有效应对措施的核心环节;然而,对这些数据进行解读仍然缓慢且高度依赖专家。人工智能代理可以通过综合分析序列、结构和生物物理学证据,帮助加速这一过程。我们提出了 BioSecBench-Function,这是一个用于从真实生物学数据中恢复与生物安全相关功能的可验证基准。该基准包含 111 项评测,基于已发表的数据集构建,并依据真实结果进行确定性评分。我们沿两个维度组织这些评测:威胁轴,涵盖七类与生物安全相关的问题类型;生物学问题,表明解决方案主要依赖序列数据、结构数据还是生物物理学检测数据。在来自 22 种模型—工具配置的 7,326 次运行中,当使用 Claude Code 时,Opus 5 以 50.3% 的端点评测通过率领先;当拒答被计为失败时,使用 Grok Build 的 Grok 4.6 以 44.1% 的总体通过率领先。不同模型—工具配置之间以及不同任务类别之间的性能差异均十分显著。不同提供商的拒答率差异悬殊,而成本并不能很好地预测准确率:有若干低成本配置的通过率超过了 40%。BioSecBench-Function 为衡量人工智能代理是否值得信赖提供了一项标准,即当下一次疫情暴发时,这些代理能否正确解读一种新病原体或变异体的作用。

利益冲突声明

版权

本预印本的。

本预印本依据

CC-BY 4.0 国际许可协议

向公众提供。

返回顶部

上一页

下一页

发布于 2026 年 9 月 8 日。

下载 PDF

电子邮件

感谢您有意帮助传播 bioRxiv 上的内容。

您的电子邮件地址

*

您的姓名

*

发送至

*

请在不同地址之间换行或使用逗号分隔。

您将要发送以下内容

BioSecBench-Function:基于实验数据推理生物学功能的可验证基准

邮件主题

(您的姓名)从 bioRxiv 网站转发了一个页面给您

邮件正文

(您的姓名)认为您可能会对 bioRxiv 网站上的此页面感兴趣。

您的个人留言

验证码

此问题用于测试您是否为人类访客,并防止自动化垃圾信息提交。

分享

BioSecBench-Function:基于实验数据推理生物学功能的可验证基准

Dianzhuo Wang

Qian Xu

Arjun Banerjee

Rishi Jain

Aakarsh Vermani

Jonathan Felix

Gage Moreno

Faisal AlZaben

Nicholas Keul

Evan Seeyave

Harmon Bhasin

bioRxiv

2026.09.03.749010;

doi:

https://doi.org/10.64898/2026.09.03.749010

分享本文:

复制

引文工具

BioSecBench-Function:基于实验数据推理生物学功能的可验证基准

Dianzhuo Wang

Qian Xu

Arjun Banerjee

Rishi Jain

Aakarsh Vermani

Jonathan Felix

Gage Moreno

Faisal AlZaben

Nicholas Keul

Evan Seeyave

Harmon Bhasin

bioRxiv

2026.09.03.749010;

doi:

https://doi.org/10.64898/2026.09.03.749010


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.09.03.749010v1?rss=1

🏷️ 生物安全 生物学功能推断 人工智能代理 基准测试 病原体分析