ScientistOne: 通过证据链迈向人类级别的自主研究
TLDR
提出证据链框架与ScientistOne系统,确保自主研究可验证,实现零幻觉引用和人类级别性能。
评分理由
The paper's strength lies in its novel verifiability framework and comprehensive empirical validation across multiple tasks, addressing a critical flaw in existing autonomous research agents. Weaknesses include limited discussion of scalability and potential reliance on specific task domains, though the abstract is strong overall.
Read-first 评分解释
综合优先阅读分 62.7,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 86。
研究版图角色
排序敏感性
稳定性:volatile;排名波动范围:84。
关键词评分
深度分析
创新点
- 证据链(Chain-of-Evidence, CoE),一个要求每个声明都可追溯到其证据来源的可验证性框架
- ScientistOne,一个端到端的自主研究系统,在文献综述、解决方案发现和论文撰写过程中通过构造维护证据链
- CoE Audit,一种事后审计,其四项完整性检查(分数验证、规范违反、引用验证、方法-代码对齐)统一适用于所有系统
方法
作者提出了证据链框架并构建了ScientistOne,一个在文献综述、解决方案发现和写作过程中强制执行证据链的自主研究智能体。他们使用CoE Audit对来自五个系统的75篇论文在五个前沿研究任务上进行评估,并在涵盖医学影像、细粒度识别、3D感知和语言建模的六个额外任务上测试泛化能力。
关键结果
ScientistOne实现了零幻觉引用(0/337)、完美的分数验证(12/12)和最高的方法-代码对齐(14/15),在所有五个任务上达到或超过人类专家水平。它泛化到六个新任务,在Parameter Golf上达到最先进水平,并在基线完全失败的MLE-Bench任务上获得金牌,而基线表现出系统性失败,如21%的幻觉引用率和低至42%的分数验证通过率。