SciSage: 一个用于高质量科学综述生成的多智能体框架
TLDR
SciSage多智能体框架通过层次化Reflector生成高质量科学综述,在连贯性和引用准确性上超越基线。
评分理由
The paper introduces a novel multi-agent architecture with reflective evaluation at multiple levels, and releases a curated benchmark (SurveyScope). Strengths include clear methodology and quantitative gains; weaknesses are mixed human evaluation results and limited domain scope.
Read-first 评分解释
综合优先阅读分 60.9,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 61。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:36。
关键词评分
深度分析
创新点
- 采用'reflect-when-you-write'范式的多智能体框架
- 层次化的Reflector智能体,在提纲、章节和文档层面评估草稿
- 专门用于查询解释、内容检索和精炼的智能体
- SurveyScope基准测试:包含2020-2025年间11个计算机科学领域的46篇高影响力论文,具有严格的时效性和基于引用的质量控制
方法
SciSage是一个多智能体系统,其中层次化的Reflector智能体在多个粒度上批判草稿,并与用于查询解释、检索和精炼的智能体协作。它在SurveyScope基准测试上,以LLM x MapReduce-V2和AutoSurvey为基线,使用自动指标(文档连贯性、引用F1)和人工评估进行评价。
关键结果
SciSage在文档连贯性上比基线提高+1.73分,在引用F1上提高+32%。人工评估显示3胜7负于人工撰写的综述,但在主题广度和检索效率方面具有优势。
局限性
- 人工评估显示7负3胜于人工撰写的综述,表明仍存在质量差距。
- SurveyScope仅包含计算机科学领域的46篇论文,可能限制其向其他领域的泛化性。
技术栈
Large Language Models (LLMs)Multi-Agent SystemsRetrieval-Augmented Generation (RAG)