Awesome Auto Research Hub 论文 · 数据集 · 项目
← 返回论文列表

AI科学家产出结果但未进行科学推理

arXiv 2026 59.1 method

TLDR

LLM科学智能体执行工作流但缺乏认知推理,68%轨迹忽略证据

评分理由

The paper's strength lies in its large-scale empirical evaluation (25,000+ runs) across eight domains, systematically decomposing base model vs. scaffold contributions. However, it focuses narrowly on LLM-based agents and may not generalize to other AI scientist paradigms; the abstract lacks details on specific domains or error analysis.

Read-first 评分解释

综合优先阅读分 59.1,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 67。

近期性 8%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

方法质量 25%
80

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:分析、评估、结果

主题相关性 42%
55.8

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:AI scientist、automated scientific discovery、autonomous research agent、automated research、literature review agent、survey generation、automated experimentation、experiment design agent、AI for scientific research、paper writing agent、research automation、scientific discovery agent

可复现性 25%
30

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:无

研究版图角色

前沿论文桥接论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:25。

关键词评分

AI scientist
9
automated scientific discovery
8
autonomous research agent
8
AI for scientific research
8
scientific discovery agent
8
automated research
7
research automation
7
automated experimentation
6
experiment design agent
3
literature review agent
1
survey generation
1
paper writing agent
1

深度分析

创新点

  • 将性能和行为系统分解为基础模型与智能体框架的贡献
  • 对工作流执行和假设驱动探究中的智能体推理轨迹进行认知分析
  • 证明基于结果的评估掩盖了科学推理模式中的失败

方法

通过超过25,000次智能体运行,在八个科学领域中进行双视角分析:对基础模型和框架贡献进行方差分解以分析性能,以及对推理轨迹进行行为分析,考察证据使用、反驳驱动的信念修正和多测试汇聚。

关键结果

基础模型解释了41.4%的性能方差,而框架仅解释1.5%;68%的轨迹中证据被忽略,反驳驱动的信念修正仅占26%,汇聚的多测试证据极为罕见;这些模式在不同任务类型中持续存在,并在重复试验中加剧不可靠性。

局限性

  • 基于结果的评估无法检测智能体推理中的认知失败
  • 仅靠框架工程无法修复科学推理模式的缺失
  • 在认知要求高的领域中,不可靠性随重复试验而加剧

技术栈

大型语言模型 (LLMs)智能体框架 (Agent scaffolds)计算工作流 (Computational workflows)

标签

AImtrl-sciLG