Awesome Auto Research Hub 论文 · 数据集 · 项目
← 返回论文列表

LLMs是否准备好进行科学发现?面向AI科学家能力导向的基准测试

arXiv 2026 52.7 method

TLDR

SDABench在五个领域评估LLMs的六种科学数据分析能力,发现其在描述性分析方面表现良好,但在假设选择和机制推理方面存在不足。

评分理由

The paper introduces a well-structured benchmark with real and synthetic data, and a five-stage error analysis framework, which are strengths. However, it focuses narrowly on data analysis capabilities rather than full scientific discovery, and does not address autonomous research agents or experimentation.

Read-first 评分解释

综合优先阅读分 52.7,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 50。

近期性 8%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

方法质量 25%
70

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:分析、基准、评估

主题相关性 42%
41.7

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:AI scientist、automated scientific discovery、autonomous research agent、automated research、literature review agent、survey generation、automated experimentation、experiment design agent、AI for scientific research、paper writing agent、research automation、scientific discovery agent

可复现性 25%
38

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:代码

研究版图角色

前沿论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:39。

关键词评分

AI scientist
9
AI for scientific research
9
automated scientific discovery
7
scientific discovery agent
6
automated research
5
research automation
4
autonomous research agent
3
automated experimentation
2
experiment design agent
2
literature review agent
1
survey generation
1
paper writing agent
1

深度分析

创新点

  • 面向能力的评估框架,围绕六种不同的主张类型(descriptive, exploratory, inferential, predictive, causal, mechanistic)在五个领域重新组织科学分析。
  • 大规模基准测试,包含真实(527个)和合成(6000个)数据实例,采用多项选择和开放式格式,通过自动化流程构建。
  • 五阶段错误分析框架,精确定位LLM科学推理中的特定失败阶段(范围/变量识别、分析程序选择、变量关系建模、结论得出)。

方法

SDABench在五个领域(生物学、化学、环境、地理、物理学)使用527个真实数据和6000个合成实例评估LLMs的六种科学分析能力(descriptive, exploratory, inferential, predictive, causal, mechanistic)。多项选择和开放式两种格式评估了15个代表性LLMs,并应用五阶段错误分析框架来识别模型在推理过程中失败的位置。

关键结果

LLMs在描述性分析方面表现良好,但在需要假设选择、潜在过程建模或机制推理的任务上性能急剧下降;更先进的模型能识别范围和变量,但在选择分析程序、建模变量关系和得出有效结论方面存在困难。

标签