ScienceAgentBench:面向数据驱动科学发现的语言代理严格评估
TLDR
一个从真实出版物中严格评估语言代理在数据驱动科学发现任务上的基准。
评分理由
The paper's strength lies in its rigorous methodology: extracting tasks from peer-reviewed papers, expert validation, and contamination mitigation. Weaknesses include low agent success rates (32.4%) and focus only on data-driven tasks, limiting generalizability.
Read-first 评分解释
综合优先阅读分 56.4,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 45。
研究版图角色
桥接论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:80。
关键词评分
深度分析
创新点
- 创建了ScienceAgentBench基准,包含从四个学科的44篇同行评审出版物中提取的102个任务,并由九位领域专家验证。
- 统一任务输出为自包含的Python程序,能够评估生成的代码、执行结果和计算成本。
- 通过标注员和专家进行多轮手动验证,确保标注质量和科学合理性。
- 在基准设计中采用两种策略来缓解数据污染问题。
方法
该基准包含从44篇同行评审出版物中获取并经领域专家验证的102个数据驱动科学发现任务。每个任务要求生成一个自包含的Python程序,并从代码正确性、执行结果和成本三个方面进行评估。对五个开源和专有LLM进行了测试,每个任务使用三种框架(直接提示、OpenHands CodeAct、自调试)进行三次尝试,此外还使用直接提示和自调试对OpenAI o1-preview进行了评估。
关键结果
表现最佳的代理仅独立解决了32.4%的任务,在专家提供知识的情况下解决了34.3%;OpenAI o1-preview达到了42.2%,但成本是其他LLM的10倍以上,凸显了显著的性能差距。
局限性
- 当前语言代理仍无法可靠地为数据驱动科学任务生成正确代码,最高性能仅为42.2%。
- 该基准仅涵盖单个任务,而非端到端的科学工作流,限制了关于完全自动化的论断。
- 像o1-preview这样的高级模型推理成本高(超过10倍),可能阻碍实际部署。
- 任务范围仅限于来自四个学科的102个实例,可能无法代表所有科学领域。
技术栈
PythonOpenHands CodeActSelf-debugDirect promptingOpenAI o1-previewLLMs