Awesome Auto Research Hub 论文 · 数据集 · 项目
← 返回论文列表

SoundnessBench:你的AI科学家真的能区分好的和坏的研究想法吗?

arXiv 2026 56 method

TLDR

提出SoundnessBench测试LLM判断研究想法合理性的能力,发现普遍乐观偏差和不可靠性。

评分理由

Strengths include a novel, carefully curated benchmark with real ICLR submissions and multiple controls. Weaknesses are the narrow focus on ML proposals and lack of evaluation on full research pipeline automation.

Read-first 评分解释

综合优先阅读分 56,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 45。

近期性 8%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

方法质量 25%
90

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基准、评估、实验、结果

可复现性 25%
38

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:工件

主题相关性 42%
37.5

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:AI scientist、automated scientific discovery、autonomous research agent、automated research、literature review agent、survey generation、automated experimentation、experiment design agent、AI for scientific research、paper writing agent、research automation、scientific discovery agent

研究版图角色

前沿论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:77。

关键词评分

AI for scientific research
8
autonomous research agent
7
AI scientist
6
automated scientific discovery
5
automated research
5
scientific discovery agent
5
research automation
4
literature review agent
1
survey generation
1
automated experimentation
1
experiment design agent
1
paper writing agent
1

深度分析

创新点

  • 提出了SoundnessBench,这是一个精心策划的基准,包含从ICLR投稿中重构的1,099个机器学习研究提案,并标注了评审者的合理性子分数,且对照原始论文进行了审计。
  • 发现了前沿LLM中普遍的乐观偏差:在标准提示下,低合理性的提案经常被评分为合理。
  • 证明了激进提示将错误从假阳性转移到假阴性,但并未提高整体评估可靠性。
  • 进行了针对公共语料污染、论文识别短语、表面特征和人工审计质量的严格控制实验,排除了单一混杂因素的解释。

方法

SoundnessBench基于1,099个ICLR投稿构建,重构研究提案并标注评审者的合理性子分数,然后对照原始论文进行审计。在标准和激进提示下评估了12个前沿LLM,测量乐观偏差和错误类型转移。额外控制实验测试了污染、表面特征和审计质量等混杂因素。

关键结果

LLM表现出强烈的乐观偏差,经常将不合理的提案评为合理;激进提示减少了假阳性但增加了假阴性,且没有单一混杂因素能解释该行为,表明LLM作为科学严谨性的独立第一关评估者不可靠。

局限性

  • SoundnessBench衡量的是可恢复的提案阶段合理性,而非对完整论文评审结果的精确预测。
  • 该基准仅限于来自ICLR的机器学习研究提案,因此发现可能不适用于其他科学领域。
  • 激进提示仅改变了错误类型(从假阳性到假阴性),并未提高整体可靠性。
  • 从投稿中重构的提案可能引入原始提案阶段不存在的伪影。

标签

LG