Awesome Auto Research Hub 论文 · 数据集 · 项目
← 返回论文列表

AutoResearchClaw:基于人机协作的自我强化自主研究

arXiv 2026 76.8 method

TLDR

AutoResearchClaw是一个多智能体自主研究流水线,结合人机协作,在ARC-Bench上比AI Scientist v2提升54.7%。

评分理由

Strengths include novel multi-agent debate and self-healing mechanisms, a human-in-the-loop ablation study, and strong benchmark results. Weaknesses are the focus on experiment-stage tasks only, lack of literature review or paper writing capabilities, and potential scalability concerns.

Read-first 评分解释

综合优先阅读分 76.8,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 74。

近期性 8%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

方法质量 25%
90

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:消融、分析、基准、实验、结果

可复现性 25%
81

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:有;数据:无;命中信号:代码、GitHub

主题相关性 42%
61.7

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:AI scientist、automated scientific discovery、autonomous research agent、automated research、literature review agent、survey generation、automated experimentation、experiment design agent、AI for scientific research、paper writing agent、research automation、scientific discovery agent

研究版图角色

前沿论文方法锚点复现锚点

排序敏感性

稳定性:volatile;排名波动范围:19。

关键词评分

automated scientific discovery
9
autonomous research agent
9
research automation
9
scientific discovery agent
9
automated research
8
automated experimentation
8
AI for scientific research
8
AI scientist
6
experiment design agent
6
literature review agent
1
paper writing agent
1
survey generation
0

深度分析

创新点

  • 用于假设生成和结果分析的结构化多智能体辩论
  • 具有Pivot/Refine决策循环的自愈执行器
  • 防止伪造数字和幻觉引用的可验证结果报告
  • 具有七种干预模式的人机协作,从完全自主到逐步监督
  • 将过去错误转化为未来保障的跨运行进化

方法

AutoResearchClaw是一个多智能体自主研究流水线,集成了结构化辩论、自愈执行、可验证报告、七种模式的人机协作以及跨运行进化。它在ARC-Bench(一个包含25个主题的实验阶段基准)上,与AI Scientist v2进行对比评估,并进行了干预模式的消融研究。

关键结果

AutoResearchClaw在ARC-Bench上比AI Scientist v2提升54.7%。消融研究表明,在高杠杆决策点进行精准的人机协作优于完全自主和详尽的逐步监督。

标签

AI