LLMs是否准备好进行科学发现?面向AI科学家能力导向的基准测试
TLDR
SDABench在五个领域评估LLMs的六种科学数据分析能力,发现其在描述性分析方面表现良好,但在假设选择和机制推理方面存在不足。
评分理由
The paper introduces a well-structured benchmark with real and synthetic data, and a five-stage error analysis framework, which are strengths. However, it focuses narrowly on data analysis capabilities rather than full scientific discovery, and does not address autonomous research agents or experimentation.
Read-first 评分解释
综合优先阅读分 52.7,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 50。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:39。
关键词评分
深度分析
创新点
- 面向能力的评估框架,围绕六种不同的主张类型(descriptive, exploratory, inferential, predictive, causal, mechanistic)在五个领域重新组织科学分析。
- 大规模基准测试,包含真实(527个)和合成(6000个)数据实例,采用多项选择和开放式格式,通过自动化流程构建。
- 五阶段错误分析框架,精确定位LLM科学推理中的特定失败阶段(范围/变量识别、分析程序选择、变量关系建模、结论得出)。
方法
SDABench在五个领域(生物学、化学、环境、地理、物理学)使用527个真实数据和6000个合成实例评估LLMs的六种科学分析能力(descriptive, exploratory, inferential, predictive, causal, mechanistic)。多项选择和开放式两种格式评估了15个代表性LLMs,并应用五阶段错误分析框架来识别模型在推理过程中失败的位置。
关键结果
LLMs在描述性分析方面表现良好,但在需要假设选择、潜在过程建模或机制推理的任务上性能急剧下降;更先进的模型能识别范围和变量,但在选择分析程序、建模变量关系和得出有效结论方面存在困难。