Awesome Auto Research Hub 论文 · 数据集 · 项目
← 返回论文列表

AutoResearch:洞察入,幻觉出

arXiv 2026 60.5 method

TLDR

AutoResearch 两阶段系统:生成有依据的研究想法,以证据评审执行实验,提升基准性能并减少不可靠结果。

评分理由

The paper presents a clear two-stage architecture with mechanisms for grounded idea generation and evidence-based execution, supported by benchmark evaluations and audit comparisons. However, the abstract provides limited detail on baselines, scope, and limitations, making full assessment difficult.

Read-first 评分解释

综合优先阅读分 60.5,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 71。

近期性 8%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

方法质量 25%
80

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基准、实验、指标、结果

主题相关性 42%
59.2

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:AI scientist、automated scientific discovery、autonomous research agent、automated research、literature review agent、survey generation、automated experimentation、experiment design agent、AI for scientific research、paper writing agent、research automation、scientific discovery agent

可复现性 25%
30

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:无

研究版图角色

前沿论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:26。

关键词评分

autonomous research agent
9
automated research
9
automated scientific discovery
8
automated experimentation
8
AI for scientific research
8
research automation
8
scientific discovery agent
8
experiment design agent
7
AI scientist
6
literature review agent
0
survey generation
0
paper writing agent
0

深度分析

创新点

  • 连接 Idea Generation 与 Idea Execution 的两阶段系统,确保科学严谨性
  • Idea Generation:持续整合新兴研究信号与领域知识,识别可迁移的机制性洞见,通过多模型生成与交叉评审产生有依据、可检验的研究计划
  • Idea Execution:协调智能体将计划分解为实验,迭代实施并诊断实验,在接受结论前采用独立的基于证据的评审
  • 基于证据条件决定继续、修订或终止研究方向,并检测/纠正不可靠的实验结果

方法

AutoResearch 是一个两阶段系统:Idea Generation 利用多模型生成与交叉评审,结合整合的研究信号和领域知识,产生可检验的计划;Idea Execution 部署协调智能体,将计划分解、迭代实施并诊断实验,并应用独立的基于证据的评审。系统在跨模态检索、系统优化和基准驱动的机器学习上评估,使用平均召回率(mean Recall)和经审计确认的问题事件等指标。

关键结果

在 RSICD 基准上,AutoResearch 生成的一个想法将平均召回率(mean Recall)从 32.84 提升至 34.69,且仅有 5 次经审计确认的问题事件,而其他自主系统为 11-27 次,展示了可衡量的进展、错误检测和基于证据条件的决策。

标签