SurGE:科学综述生成的基准与评估框架
TLDR
提出SurGE基准与评估框架,揭示LLM方法在科学综述生成中的性能差距。
评分理由
The paper addresses a critical gap by providing a standardized benchmark and evaluation framework for survey generation, with real data and open-source resources. However, it is limited to computer science and does not propose new methods, only evaluating existing ones.
Read-first 评分解释
综合优先阅读分 58.8,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 47。
研究版图角色
前沿论文桥接论文复现锚点
排序敏感性
稳定性:volatile;排名波动范围:81。
关键词评分
深度分析
创新点
- 提出了SurGE,一个面向计算机科学领域的科学综述生成基准,包含专家撰写的综述及其引用文献的测试实例,以及大规模学术语料库。
- 提出了一个自动化评估框架,从全面性、引用准确性、结构组织和内容质量四个维度衡量生成综述的质量。
方法
我们构建了SurGE,包含由主题描述、专家撰写的综述及其完整引用文献组成的测试实例,以及一个超过一百万篇论文的语料库。然后使用自动化框架对多种基于LLM的方法进行评估,该框架根据全面性、引用准确性、结构组织和内容质量对生成的综述进行评分。
关键结果
评估揭示了显著的性能差距,即使是先进的智能体框架也难以应对综述生成的复杂性。