Awesome Auto Research Hub 论文 · 数据集 · 项目
← 返回论文列表

像真正的科研人员一样行动:一套评估前沿大语言模型及智能体框架在研究生命周期中表现的基准

arXiv 2026 63.2 method

TLDR

一套评估前沿LLM和智能体在研究任务中的基准,显示其仍不及人类研究人员。

评分理由

The paper introduces a novel benchmark (AARRI-Bench) that focuses on nuanced research behavior rather than macro execution, with extensive experiments across models. However, it only covers the first benchmark in the series and does not detail specific task types or limitations beyond the reported 68.3% success rate.

Read-first 评分解释

综合优先阅读分 63.2,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 48。

近期性 8%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

方法质量 25%
80

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基准、实验、结果

可复现性 25%
73

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:有;数据:无;命中信号:GitHub

主题相关性 42%
40

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:AI scientist、automated scientific discovery、autonomous research agent、automated research、literature review agent、survey generation、automated experimentation、experiment design agent、AI for scientific research、paper writing agent、research automation、scientific discovery agent

研究版图角色

前沿论文方法锚点复现锚点

排序敏感性

稳定性:volatile;排名波动范围:101。

关键词评分

autonomous research agent
8
AI for scientific research
7
research automation
7
automated research
6
automated scientific discovery
4
scientific discovery agent
4
AI scientist
3
automated experimentation
3
literature review agent
2
experiment design agent
2
survey generation
1
paper writing agent
1

深度分析

创新点

  • 提出了AARR基准系列,该系列在需要专业性、全面性和细致推理的细粒度研究场景中评估智能体,将关注点从宏观执行能力转移。
  • 引入了AARRI-Bench,作为该系列的第一个基准,专门针对研究实习生级别的任务,评估智能体能否模仿人类研究人员的特质。

方法

作者设计了AARRI-Bench,这是一个由细粒度研究任务组成的基准,测试智能体展现专业性、全面性和细致推理的能力。他们通过测量这些任务的成功率,评估了多个前沿模型和智能体框架(例如Mini-SWE-Agent与Claude Opus 4.7)。

关键结果

最佳配置(Mini-SWE-Agent与Claude Opus 4.7)仅达到68.3%的成功率,智能体经常忽略对人类研究人员而言显而易见的细微但关键细节。

局限性

  • 智能体在领域敏感性、研究伦理和细微科学判断方面存在显著局限。
  • 当前的前沿智能体无法完全取代人类研究人员。
  • 该基准仅限于研究实习生级别的场景,未覆盖全部研究活动。
  • 开发类似研究人员的AI需要进一步探索研究行为,而不仅仅是复杂的框架。

标签

AI