Awesome Auto Research Hub 论文 · 数据集 · 项目
← 返回论文列表

SciSage: 一个用于高质量科学综述生成的多智能体框架

arXiv 2025 60.9 method

TLDR

SciSage多智能体框架通过层次化Reflector生成高质量科学综述,在连贯性和引用准确性上超越基线。

评分理由

The paper introduces a novel multi-agent architecture with reflective evaluation at multiple levels, and releases a curated benchmark (SurveyScope). Strengths include clear methodology and quantitative gains; weaknesses are mixed human evaluation results and limited domain scope.

Read-first 评分解释

综合优先阅读分 60.9,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 61。

方法质量 25%
100

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:分析、基线、基准、评估、指标

近期性 8%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

主题相关性 42%
50.8

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:AI scientist、automated scientific discovery、autonomous research agent、automated research、literature review agent、survey generation、automated experimentation、experiment design agent、AI for scientific research、paper writing agent、research automation、scientific discovery agent

可复现性 25%
30

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:无

研究版图角色

前沿论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:36。

关键词评分

survey generation
10
literature review agent
9
paper writing agent
8
AI for scientific research
7
autonomous research agent
6
research automation
6
automated research
5
automated scientific discovery
4
AI scientist
3
scientific discovery agent
3
automated experimentation
0
experiment design agent
0

深度分析

创新点

  • 采用'reflect-when-you-write'范式的多智能体框架
  • 层次化的Reflector智能体,在提纲、章节和文档层面评估草稿
  • 专门用于查询解释、内容检索和精炼的智能体
  • SurveyScope基准测试:包含2020-2025年间11个计算机科学领域的46篇高影响力论文,具有严格的时效性和基于引用的质量控制

方法

SciSage是一个多智能体系统,其中层次化的Reflector智能体在多个粒度上批判草稿,并与用于查询解释、检索和精炼的智能体协作。它在SurveyScope基准测试上,以LLM x MapReduce-V2和AutoSurvey为基线,使用自动指标(文档连贯性、引用F1)和人工评估进行评价。

关键结果

SciSage在文档连贯性上比基线提高+1.73分,在引用F1上提高+32%。人工评估显示3胜7负于人工撰写的综述,但在主题广度和检索效率方面具有优势。

局限性

  • 人工评估显示7负3胜于人工撰写的综述,表明仍存在质量差距。
  • SurveyScope仅包含计算机科学领域的46篇论文,可能限制其向其他领域的泛化性。

技术栈

Large Language Models (LLMs)Multi-Agent SystemsRetrieval-Augmented Generation (RAG)

标签

AIIR