AI科学家产出结果但未进行科学推理
TLDR
LLM科学智能体执行工作流但缺乏认知推理,68%轨迹忽略证据
评分理由
The paper's strength lies in its large-scale empirical evaluation (25,000+ runs) across eight domains, systematically decomposing base model vs. scaffold contributions. However, it focuses narrowly on LLM-based agents and may not generalize to other AI scientist paradigms; the abstract lacks details on specific domains or error analysis.
Read-first 评分解释
综合优先阅读分 59.1,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 67。
研究版图角色
前沿论文桥接论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:25。
关键词评分
深度分析
创新点
- 将性能和行为系统分解为基础模型与智能体框架的贡献
- 对工作流执行和假设驱动探究中的智能体推理轨迹进行认知分析
- 证明基于结果的评估掩盖了科学推理模式中的失败
方法
通过超过25,000次智能体运行,在八个科学领域中进行双视角分析:对基础模型和框架贡献进行方差分解以分析性能,以及对推理轨迹进行行为分析,考察证据使用、反驳驱动的信念修正和多测试汇聚。
关键结果
基础模型解释了41.4%的性能方差,而框架仅解释1.5%;68%的轨迹中证据被忽略,反驳驱动的信念修正仅占26%,汇聚的多测试证据极为罕见;这些模式在不同任务类型中持续存在,并在重复试验中加剧不可靠性。
局限性
- 基于结果的评估无法检测智能体推理中的认知失败
- 仅靠框架工程无法修复科学推理模式的缺失
- 在认知要求高的领域中,不可靠性随重复试验而加剧
技术栈
大型语言模型 (LLMs)智能体框架 (Agent scaffolds)计算工作流 (Computational workflows)