利用 Karenina 将领域专业知识转化为对生物医学人工智能的多维度评估

root 提交于 周六, 09/05/2026 - 22:47
语言模型和智能体正日益应用于生物医学领域,但当前的基准测试往往只奖励正确答案,即使其背后的推理过程存在缺陷。为此,我们提出了 Karenina,一个开源框架,可将专家知识转化为针对问题、对话和自主智能体的多维度评估。通过问题—答案对、多轮对话以及自主数据分析等示例,这些维度共同推动评估超越单一评分,从而支持在生物医学领域利用人工智能进行可信赖的决策。

语言模型和智能体日益广泛地应用于生物医学领域,但当前的基准测试即使在底层推理存在缺陷的情况下,也往往仍会对正确答案给予奖励。在此,我们介绍 Karenina,这是一种开源框架,能够将专家知识转化为针对问题、对话和自主智能体的多维度评估。通过问答对、多轮对话和自主数据分析等示例,这些维度共同推动评估超越单纯的评分,从而实现生物医学领域基于人工智能的可信决策。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.09.01.748513v1?rss=1

🏷️ 生物医学人工智能 多维度评估 大语言模型 智能体评测 领域专业知识 可信赖人工智能