Agentic AutoSurvey: 让LLMs综述LLMs
TLDR
多智能体框架自动生成综述,在LLM研究主题上综合质量卓越。
评分理由
The paper presents a clear multi-agent architecture with specialized agents and quantitative results on real topics, demonstrating significant improvement over baselines. However, the evaluation is limited to LLM-related topics and may not generalize to other scientific domains.
Read-first 评分解释
综合优先阅读分 61.3,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 62。
研究版图角色
前沿论文桥接论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:37。
关键词评分
深度分析
创新点
- 多智能体框架,包含四个专门智能体(Paper Search Specialist, Topic Mining & Clustering, Academic Survey Writer, Quality Evaluator),用于自动综述生成
- 12维度评估,捕捉组织、综合整合和批判性分析,超越基本指标
方法
该系统采用四个专门智能体协同工作以生成文献综述。实验在来自COLM 2024类别的六个代表性LLM研究主题上进行,每个主题处理75-443篇论文(共847篇),并使用12维度评估与AutoSurvey基线进行比较。
关键结果
多智能体方法得分为8.18/10,而AutoSurvey为4.77/10,具有高引用覆盖率(在75-100篇论文集合上通常≥80%)。
局限性
- 在非常大的论文集合(如RLHF)上引用覆盖率较低
- 评估仅限于来自COLM 2024类别的六个主题
技术栈
LLMs多智能体架构聚类算法