像真正的科研人员一样行动:一套评估前沿大语言模型及智能体框架在研究生命周期中表现的基准
TLDR
一套评估前沿LLM和智能体在研究任务中的基准,显示其仍不及人类研究人员。
评分理由
The paper introduces a novel benchmark (AARRI-Bench) that focuses on nuanced research behavior rather than macro execution, with extensive experiments across models. However, it only covers the first benchmark in the series and does not detail specific task types or limitations beyond the reported 68.3% success rate.
Read-first 评分解释
综合优先阅读分 63.2,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 48。
研究版图角色
前沿论文方法锚点复现锚点
排序敏感性
稳定性:volatile;排名波动范围:101。
关键词评分
深度分析
创新点
- 提出了AARR基准系列,该系列在需要专业性、全面性和细致推理的细粒度研究场景中评估智能体,将关注点从宏观执行能力转移。
- 引入了AARRI-Bench,作为该系列的第一个基准,专门针对研究实习生级别的任务,评估智能体能否模仿人类研究人员的特质。
方法
作者设计了AARRI-Bench,这是一个由细粒度研究任务组成的基准,测试智能体展现专业性、全面性和细致推理的能力。他们通过测量这些任务的成功率,评估了多个前沿模型和智能体框架(例如Mini-SWE-Agent与Claude Opus 4.7)。
关键结果
最佳配置(Mini-SWE-Agent与Claude Opus 4.7)仅达到68.3%的成功率,智能体经常忽略对人类研究人员而言显而易见的细微但关键细节。
局限性
- 智能体在领域敏感性、研究伦理和细微科学判断方面存在显著局限。
- 当前的前沿智能体无法完全取代人类研究人员。
- 该基准仅限于研究实习生级别的场景,未覆盖全部研究活动。
- 开发类似研究人员的AI需要进一步探索研究行为,而不仅仅是复杂的框架。