OpenBioRQ:面向代理的未解决生物医学研究问题
TLDR
OpenBioRQ: 12,553个未解生物医学问题,测试代理引用忠实性,发现15.9%错误链接。
评分理由
Strengths: Novel benchmark addressing a critical failure mode (citation misattribution) with real-world verification and empirical difficulty anchoring. Weaknesses: Limited to biomedical domain; no direct evaluation of full scientific discovery pipeline (e.g., experimentation or paper writing).
Read-first 评分解释
综合优先阅读分 51,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 38。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:72。
关键词评分
深度分析
创新点
- 提出OpenBioRQ,一个基于检索的代理基准,包含12,553个跨12个领域的未解决生物医学研究问题,设计为无答案键的忠实性与弃权探针。
- 首个将代理设置(多次工具调用)与未解决问题相结合的生物医学基准,开放性通过真实后续证据而非参数知识验证。
- 经验性难度锚定:基于三个开放权重参考模型失败的问题选择,避免主观难度标签。
- 发现最难问题上的代理崩溃,即代理停止使用工具,并证明对于最易崩溃的模型,阻止工具访问几乎不改变其得分。
- 使用冻结的每问题检查清单将评估者间一致性从Spearman 0.35提高到0.82。
方法
该基准包含12,553个未解决的生物医学问题,要求代理在基于检索的设置中执行多次工具调用。难度通过选择三个开放权重参考模型无法回答的问题来经验性确定。评估使用冻结的每问题检查清单判断答案正确性,开放性通过真实后续证据验证。
关键结果
在最难子集上,与难度锚点同系列的保留模型解决约17%,而前沿代理(Gemini-3-Pro、Opus-4.7、GPT-5.5)达到29-60%,最佳代理仍有33-40%未解决。最难问题上出现代理崩溃,对于最易崩溃的模型,阻止工具访问几乎不改变其得分。
局限性
- 基准仅限于生物医学领域,可能不泛化到其他领域。
- 难度锚定依赖于三个特定开放权重模型,可能使最难子集产生偏差,不反映普遍难度。
- 代理崩溃观察具有模型特异性,崩溃程度可能因不同代理架构而异。
- 基于检查清单的评估虽提高一致性,但仍可能遗漏细微的正确性或引入检查清单特定偏差。
- 未解决问题的性质意味着不存在真实答案,因此基于后续证据的验证可能不完美。