Awesome Auto Research Hub 论文 · 数据集 · 项目
← 返回论文列表

ARIS:基于对抗性多智能体协作的自主研究

arXiv 2026 64.9 method, system

TLDR

ARIS是开源研究框架,利用对抗性多智能体协作协调ML研究流程,并具备保障机制。

评分理由

The paper presents a novel architecture for autonomous research with adversarial collaboration between executor and reviewer models, which is a strength. However, the abstract lacks empirical results or real-world evaluation, making it unclear how effective the system is in practice.

Read-first 评分解释

综合优先阅读分 64.9,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 78。

近期性 8%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

方法质量 25%
80

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:评估、实验、结果

主题相关性 42%
65

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:AI scientist、automated scientific discovery、autonomous research agent、automated research、literature review agent、survey generation、automated experimentation、experiment design agent、AI for scientific research、paper writing agent、research automation、scientific discovery agent

可复现性 25%
38

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:工件

研究版图角色

前沿论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:31。

关键词评分

autonomous research agent
9
automated research
9
research automation
9
automated scientific discovery
8
AI for scientific research
8
scientific discovery agent
8
automated experimentation
7
AI scientist
6
experiment design agent
5
paper writing agent
4
literature review agent
3
survey generation
2

深度分析

创新点

  • 跨模型对抗性协作作为自主研究的默认配置,将执行模型与来自不同模型族的评审模型配对
  • 三层架构,包括执行层、编排层和保障层
  • 三阶段声称审计流程:完整性验证、结果到声称映射,以及针对声称账本和原始证据的声称审计
  • 五遍科学编辑流水线,包含数学证明检查和渲染PDF的视觉检查
  • 原型自我改进循环,记录研究轨迹并提出需经评审批准的框架改进

方法

ARIS是一个开源研究框架,通过跨模型对抗性协作协调机器学习研究工作流程。它包含一个执行层,提供超过65个Markdown定义的技能、MCP模型集成、持久研究Wiki和确定性图形生成;一个编排层,具有五个端到端工作流程、可调节的努力设置和可配置的评审路由;以及一个保障层,包含三阶段声称检查流程、五遍编辑流水线、证明检查和视觉检查。一个原型自我改进循环记录轨迹并提出需经评审批准的框架改进。

关键结果

论文报告了早期部署经验和原型自我改进循环,但摘要中未提供定量实验结果。

局限性

  • 如果评审模型未能检测到证据不足,则看似合理但缺乏支持的成功的核心失败模式仍可能发生
  • 跨模型对抗性协作是推荐而非强制,可能允许单模型执行
  • 自我改进循环仅为原型,其有效性尚未得到验证
  • 未提供研究质量、声称准确性或保障有效性的定量评估

技术栈

LLMsMCPMarkdownPython

标签