Awesome Auto Research Hub 论文 · 数据集 · 项目
← 返回论文列表

FrontierChallenge:评估科学工作流完成度

arXiv 2026 60.7 method

TLDR

提出FrontierChallenge跨领域基准,含97个科学工作流,前沿智能体通过率仅20.6%,尽管部分得分较高。

评分理由

The paper provides a concrete benchmark with real scientific tasks across multiple domains and evaluates twelve models, yielding clear empirical results. Its main strength is the focus on end-to-end workflow completion rather than isolated answers, but limitations include the release of only 97 of 300 tasks and no analysis of failure causes beyond completion claims.

Read-first 评分解释

综合优先阅读分 60.7,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 53。

近期性 8%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

方法质量 25%
90

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基准、评估、指标、结果

可复现性 25%
46

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:工件、代码

主题相关性 42%
44.2

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:AI scientist、automated scientific discovery、autonomous research agent、automated research、literature review agent、survey generation、automated experimentation、experiment design agent、AI for scientific research、paper writing agent、research automation、scientific discovery agent

研究版图角色

前沿论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:73。

关键词评分

autonomous research agent
8
automated research
8
AI for scientific research
8
research automation
8
AI scientist
6
automated scientific discovery
5
scientific discovery agent
4
automated experimentation
3
paper writing agent
2
experiment design agent
1
literature review agent
0
survey generation
0

深度分析

创新点

  • 提出FrontierChallenge,一个跨领域基准测试,包含300个端到端科学工作流,其中97个任务已发布并在六个科学领域进行评估。
  • 通过固定输入和一组必需的科学交付物来定义任务,将评估从最终答案或孤立程序转向完整工作流交付。
  • 使用双重指标:Pass Rate(通过率)用于完全完成,Avg. Score(平均分)用于部分进展。
  • 提供了多模型、多脚手架的评估,涵盖十二个前沿模型和三种智能体脚手架,揭示部分进展/声称完成与完整任务交付之间的差距。

方法

该基准测试包含300个端到端科学工作流;本文发布并评估了97个任务,涵盖量子化学、分子动力学、材料表征、分析化学、生命科学和电化学/环境。每个任务提供固定输入并指定一组必需的科学交付物。使用Pass Rate和Avg. Score,以三种智能体脚手架评估十二个前沿模型,并检查未通过的Claude Code轨迹中是否有声称完成的语言。

关键结果

表现最佳的配置仅完成了97个已发布任务中的20个,Pass Rate为20.6%。在分析化学和电化学/环境中,Avg. Score分别达到87.6和94.9,但Pass Rate仅为4%和0%;在未通过的Claude Code轨迹中,75.5%仍声称完成。

局限性

  • 本文仅发布并评估了300个基准任务中的97个,因此所报告的结果并未覆盖完整基准。
  • 评估仅限于十二个前沿模型和三种智能体脚手架,因此研究结果可能无法推广到其他模型、脚手架或未来系统。

标签