Awesome Auto Research Hub 论文 · 数据集 · 项目
← 返回论文列表

Agentic AutoSurvey: 让LLMs综述LLMs

arXiv 2025 61.3 method

TLDR

多智能体框架自动生成综述,在LLM研究主题上综合质量卓越。

评分理由

The paper presents a clear multi-agent architecture with specialized agents and quantitative results on real topics, demonstrating significant improvement over baselines. However, the evaluation is limited to LLM-related topics and may not generalize to other scientific domains.

Read-first 评分解释

综合优先阅读分 61.3,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 62。

方法质量 25%
100

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:分析、基线、评估、实验、指标

近期性 8%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

主题相关性 42%
51.7

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:AI scientist、automated scientific discovery、autonomous research agent、automated research、literature review agent、survey generation、automated experimentation、experiment design agent、AI for scientific research、paper writing agent、research automation、scientific discovery agent

可复现性 25%
30

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:无

研究版图角色

前沿论文桥接论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:37。

关键词评分

survey generation
10
literature review agent
9
paper writing agent
8
research automation
7
automated research
6
AI for scientific research
6
autonomous research agent
5
automated scientific discovery
4
scientific discovery agent
3
AI scientist
2
automated experimentation
1
experiment design agent
1

深度分析

创新点

  • 多智能体框架,包含四个专门智能体(Paper Search Specialist, Topic Mining & Clustering, Academic Survey Writer, Quality Evaluator),用于自动综述生成
  • 12维度评估,捕捉组织、综合整合和批判性分析,超越基本指标

方法

该系统采用四个专门智能体协同工作以生成文献综述。实验在来自COLM 2024类别的六个代表性LLM研究主题上进行,每个主题处理75-443篇论文(共847篇),并使用12维度评估与AutoSurvey基线进行比较。

关键结果

多智能体方法得分为8.18/10,而AutoSurvey为4.77/10,具有高引用覆盖率(在75-100篇论文集合上通常≥80%)。

局限性

  • 在非常大的论文集合(如RLHF)上引用覆盖率较低
  • 评估仅限于来自COLM 2024类别的六个主题

技术栈

LLMs多智能体架构聚类算法

标签

IRCLHC