SurveyLens:面向自动综述生成的多学科感知基准
TLDR
SurveyLens是首个多学科感知的自动综述生成基准,评估了10个学科上的11个系统。
评分理由
The paper introduces a novel benchmark with a curated dataset and dual-lens evaluation framework, addressing a gap in cross-discipline ASG assessment. Its strengths include comprehensive system evaluation and practical guidance, but it is limited to survey generation rather than broader scientific discovery.
Read-first 评分解释
综合优先阅读分 54.4,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 55。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:22。
关键词评分
深度分析
创新点
- 首个面向自动综述生成的多学科感知基准(SurveyLens)
- SurveyLens-1k:包含10个学科、1000篇人工撰写综述的精选数据集
- 双视角评估框架,结合多学科感知的评分标准与基于参考的人工综述对齐
方法
本文提出了SurveyLens基准,包含来自10个学科的1000篇人工撰写综述,并使用双视角方法(学科特定评分标准与参考综述对齐)评估了11个系统(普通大语言模型、ASG系统、深度研究智能体)。
关键结果
深度研究智能体是唯一在所有10个学科中表现稳健的范式,ASG系统在结构规划方面表现优异,而所有范式在参考文献质量方面均存在不足。