Awesome Auto Research Hub 论文 · 数据集 · 项目
← 返回论文列表

ScienceAgentBench:面向数据驱动科学发现的语言代理严格评估

arXiv 2024 56.4 method

TLDR

一个从真实出版物中严格评估语言代理在数据驱动科学发现任务上的基准。

评分理由

The paper's strength lies in its rigorous methodology: extracting tasks from peer-reviewed papers, expert validation, and contamination mitigation. Weaknesses include low agent success rates (32.4%) and focus only on data-driven tasks, limiting generalizability.

Read-first 评分解释

综合优先阅读分 56.4,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 45。

方法质量 25%
100

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基准、评估、指标、结果、验证

近期性 8%
75.1

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2024

可复现性 25%
38

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:代码

主题相关性 42%
37.5

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:AI scientist、automated scientific discovery、autonomous research agent、automated research、literature review agent、survey generation、automated experimentation、experiment design agent、AI for scientific research、paper writing agent、research automation、scientific discovery agent

研究版图角色

桥接论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:80。

关键词评分

AI for scientific research
7
automated scientific discovery
6
research automation
6
scientific discovery agent
6
autonomous research agent
5
automated research
5
AI scientist
3
automated experimentation
2
experiment design agent
2
literature review agent
1
survey generation
1
paper writing agent
1

深度分析

创新点

  • 创建了ScienceAgentBench基准,包含从四个学科的44篇同行评审出版物中提取的102个任务,并由九位领域专家验证。
  • 统一任务输出为自包含的Python程序,能够评估生成的代码、执行结果和计算成本。
  • 通过标注员和专家进行多轮手动验证,确保标注质量和科学合理性。
  • 在基准设计中采用两种策略来缓解数据污染问题。

方法

该基准包含从44篇同行评审出版物中获取并经领域专家验证的102个数据驱动科学发现任务。每个任务要求生成一个自包含的Python程序,并从代码正确性、执行结果和成本三个方面进行评估。对五个开源和专有LLM进行了测试,每个任务使用三种框架(直接提示、OpenHands CodeAct、自调试)进行三次尝试,此外还使用直接提示和自调试对OpenAI o1-preview进行了评估。

关键结果

表现最佳的代理仅独立解决了32.4%的任务,在专家提供知识的情况下解决了34.3%;OpenAI o1-preview达到了42.2%,但成本是其他LLM的10倍以上,凸显了显著的性能差距。

局限性

  • 当前语言代理仍无法可靠地为数据驱动科学任务生成正确代码,最高性能仅为42.2%。
  • 该基准仅涵盖单个任务,而非端到端的科学工作流,限制了关于完全自动化的论断。
  • 像o1-preview这样的高级模型推理成本高(超过10倍),可能阻碍实际部署。
  • 任务范围仅限于来自四个学科的102个实例,可能无法代表所有科学领域。

技术栈

PythonOpenHands CodeActSelf-debugDirect promptingOpenAI o1-previewLLMs

标签

CLAILG