ASAREE:用于智能体人工智能研究、工程与实验的分析型沙盒

root 提交于 周三, 08/26/2026 - 10:47
摘要:Agentic AI 平台能够支持自主工作流的工程化构建,但其设计初衷并非用于实验与假设检验。ASAREE(用于 Agentic AI 研究、工程与实验的分析沙箱)是一个旨在弥补这一空白的开源平台。ASAREE 可通过可视化界面或 Python SDK 创建智能体、连接 MCP 服务器与工具,并设计析因实验。它为每次运行记录完整的溯源轨迹,并通过一个与提供商无关的桥接层路由所有模型调用,该桥接层支持本地部署,从而确保数据隐私。 作为一个应用案例,我们使用 ASAREE 评估多智能体机器学习流水线中的关键设计选择。在一个 2 × 2 × 2 的析因设计中,更先进的模型、更高的推理强度以及评论者智能体的使用,均显著增加了计算时间、token 使用量、成本和特征数量,但并未提升预测性能。成本最低的基线方案——采用中等推理强度且不使用评论者的 Claude Sonnet 5——取得了最高的平均 PR AUC;而采用超高推理强度并使用评论者智能体的 Claude Opus 5,其成本(美元)高出 15.5 倍、运行时间延长 13.1 倍,但平均表现反而更差。这些发现表明,ASAREE 是一个用于评估 agentic 系统性能与资源效率的稳健框架。

摘要:Agentic AI 平台能够支持自主工作流的工程化构建,但其设计目标并非用于实验与假设检验。ASAREE(用于 Agentic AI 研究、工程与实验的分析沙盒,Analytical Sandbox for Agentic AI Research, Engineering, and Experimentation)是一个旨在弥补这一空白的开源平台。ASAREE 可通过可视化界面或 Python SDK 创建智能体、连接至 MCP 服务器与工具,并设计析因实验。它为每次运行记录完整的溯源轨迹,并通过与提供商无关的桥接层路由所有模型调用,同时支持本地部署,以确保数据隐私。

作为一个应用案例,我们使用 ASAREE 评估多智能体机器学习流水线中的关键设计选择。在一个 2 × 2 × 2 的析因设计中,更先进的模型、更高的推理强度以及评论者智能体的使用,均显著增加了计算时间、令牌使用量、成本和特征数量,但并未提升预测性能。成本最低的基线配置——采用中等推理强度且不使用评论者的 Claude Sonnet 5——取得了最高的平均 PR AUC;而采用超高推理强度并配备评论者智能体的 Claude Opus 5,成本高出 15.5 倍(美元),运行时间延长 13.1 倍,而其平均表现反而更差。这些发现表明,ASAREE 是一个用于评估 Agentic 系统性能与资源效率的稳健框架。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.08.20.746074v1?rss=1

🏷️ 智能体人工智能 实验平台 析因设计 多智能体系统 性能评估 资源效率