FrontierChallenge:评估科学工作流完成度
TLDR
提出FrontierChallenge跨领域基准,含97个科学工作流,前沿智能体通过率仅20.6%,尽管部分得分较高。
评分理由
The paper provides a concrete benchmark with real scientific tasks across multiple domains and evaluates twelve models, yielding clear empirical results. Its main strength is the focus on end-to-end workflow completion rather than isolated answers, but limitations include the release of only 97 of 300 tasks and no analysis of failure causes beyond completion claims.
Read-first 评分解释
综合优先阅读分 60.7,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 53。
研究版图角色
排序敏感性
稳定性:volatile;排名波动范围:73。
关键词评分
深度分析
创新点
- 提出FrontierChallenge,一个跨领域基准测试,包含300个端到端科学工作流,其中97个任务已发布并在六个科学领域进行评估。
- 通过固定输入和一组必需的科学交付物来定义任务,将评估从最终答案或孤立程序转向完整工作流交付。
- 使用双重指标:Pass Rate(通过率)用于完全完成,Avg. Score(平均分)用于部分进展。
- 提供了多模型、多脚手架的评估,涵盖十二个前沿模型和三种智能体脚手架,揭示部分进展/声称完成与完整任务交付之间的差距。
方法
该基准测试包含300个端到端科学工作流;本文发布并评估了97个任务,涵盖量子化学、分子动力学、材料表征、分析化学、生命科学和电化学/环境。每个任务提供固定输入并指定一组必需的科学交付物。使用Pass Rate和Avg. Score,以三种智能体脚手架评估十二个前沿模型,并检查未通过的Claude Code轨迹中是否有声称完成的语言。
关键结果
表现最佳的配置仅完成了97个已发布任务中的20个,Pass Rate为20.6%。在分析化学和电化学/环境中,Avg. Score分别达到87.6和94.9,但Pass Rate仅为4%和0%;在未通过的Claude Code轨迹中,75.5%仍声称完成。
局限性
- 本文仅发布并评估了300个基准任务中的97个,因此所报告的结果并未覆盖完整基准。
- 评估仅限于十二个前沿模型和三种智能体脚手架,因此研究结果可能无法推广到其他模型、脚手架或未来系统。