Awesome Auto Research Hub 论文 · 数据集 · 项目
← 返回论文列表

OpenBioRQ:面向代理的未解决生物医学研究问题

arXiv 2026 51 benchmark

TLDR

OpenBioRQ: 12,553个未解生物医学问题,测试代理引用忠实性,发现15.9%错误链接。

评分理由

Strengths: Novel benchmark addressing a critical failure mode (citation misattribution) with real-world verification and empirical difficulty anchoring. Weaknesses: Limited to biomedical domain; no direct evaluation of full scientific discovery pipeline (e.g., experimentation or paper writing).

Read-first 评分解释

综合优先阅读分 51,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 38。

近期性 8%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

方法质量 25%
80

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基准、评估、指标

可复现性 25%
38

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:复现

主题相关性 42%
31.7

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:AI scientist、automated scientific discovery、autonomous research agent、automated research、literature review agent、survey generation、automated experimentation、experiment design agent、AI for scientific research、paper writing agent、research automation、scientific discovery agent

研究版图角色

前沿论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:72。

关键词评分

autonomous research agent
6
literature review agent
5
AI for scientific research
5
automated research
4
research automation
4
scientific discovery agent
4
automated scientific discovery
3
AI scientist
2
survey generation
2
automated experimentation
1
experiment design agent
1
paper writing agent
1

深度分析

创新点

  • 提出OpenBioRQ,一个基于检索的代理基准,包含12,553个跨12个领域的未解决生物医学研究问题,设计为无答案键的忠实性与弃权探针。
  • 首个将代理设置(多次工具调用)与未解决问题相结合的生物医学基准,开放性通过真实后续证据而非参数知识验证。
  • 经验性难度锚定:基于三个开放权重参考模型失败的问题选择,避免主观难度标签。
  • 发现最难问题上的代理崩溃,即代理停止使用工具,并证明对于最易崩溃的模型,阻止工具访问几乎不改变其得分。
  • 使用冻结的每问题检查清单将评估者间一致性从Spearman 0.35提高到0.82。

方法

该基准包含12,553个未解决的生物医学问题,要求代理在基于检索的设置中执行多次工具调用。难度通过选择三个开放权重参考模型无法回答的问题来经验性确定。评估使用冻结的每问题检查清单判断答案正确性,开放性通过真实后续证据验证。

关键结果

在最难子集上,与难度锚点同系列的保留模型解决约17%,而前沿代理(Gemini-3-Pro、Opus-4.7、GPT-5.5)达到29-60%,最佳代理仍有33-40%未解决。最难问题上出现代理崩溃,对于最易崩溃的模型,阻止工具访问几乎不改变其得分。

局限性

  • 基准仅限于生物医学领域,可能不泛化到其他领域。
  • 难度锚定依赖于三个特定开放权重模型,可能使最难子集产生偏差,不反映普遍难度。
  • 代理崩溃观察具有模型特异性,崩溃程度可能因不同代理架构而异。
  • 基于检查清单的评估虽提高一致性,但仍可能遗漏细微的正确性或引入检查清单特定偏差。
  • 未解决问题的性质意味着不存在真实答案,因此基于后续证据的验证可能不完美。

标签