Awesome Auto Research Hub 论文 · 数据集 · 项目
← 返回论文列表

ScientistOne: 通过证据链迈向人类级别的自主研究

arXiv 2026 62.7 method

TLDR

提出证据链框架与ScientistOne系统,确保自主研究可验证,实现零幻觉引用和人类级别性能。

评分理由

The paper's strength lies in its novel verifiability framework and comprehensive empirical validation across multiple tasks, addressing a critical flaw in existing autonomous research agents. Weaknesses include limited discussion of scalability and potential reliance on specific task domains, though the abstract is strong overall.

Read-first 评分解释

综合优先阅读分 62.7,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 86。

近期性 8%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

主题相关性 42%
71.7

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:AI scientist、automated scientific discovery、autonomous research agent、automated research、literature review agent、survey generation、automated experimentation、experiment design agent、AI for scientific research、paper writing agent、research automation、scientific discovery agent

方法质量 25%
60

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基线、评估

可复现性 25%
38

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:代码

研究版图角色

前沿论文桥接论文

排序敏感性

稳定性:volatile;排名波动范围:84。

关键词评分

autonomous research agent
10
automated scientific discovery
9
automated research
9
research automation
9
scientific discovery agent
9
AI scientist
8
AI for scientific research
8
paper writing agent
8
literature review agent
7
survey generation
4
automated experimentation
3
experiment design agent
2

深度分析

创新点

  • 证据链(Chain-of-Evidence, CoE),一个要求每个声明都可追溯到其证据来源的可验证性框架
  • ScientistOne,一个端到端的自主研究系统,在文献综述、解决方案发现和论文撰写过程中通过构造维护证据链
  • CoE Audit,一种事后审计,其四项完整性检查(分数验证、规范违反、引用验证、方法-代码对齐)统一适用于所有系统

方法

作者提出了证据链框架并构建了ScientistOne,一个在文献综述、解决方案发现和写作过程中强制执行证据链的自主研究智能体。他们使用CoE Audit对来自五个系统的75篇论文在五个前沿研究任务上进行评估,并在涵盖医学影像、细粒度识别、3D感知和语言建模的六个额外任务上测试泛化能力。

关键结果

ScientistOne实现了零幻觉引用(0/337)、完美的分数验证(12/12)和最高的方法-代码对齐(14/15),在所有五个任务上达到或超过人类专家水平。它泛化到六个新任务,在Parameter Golf上达到最先进水平,并在基线完全失败的MLE-Bench任务上获得金牌,而基线表现出系统性失败,如21%的幻觉引用率和低至42%的分数验证通过率。

标签

AICLMA