SGSimEval:面向自动综述生成系统的全面多维度与相似性增强基准
TLDR
SGSimEval是一个结合人类偏好和相似性的多维度自动综述生成评估基准。
评分理由
The paper addresses limitations in existing evaluation methods for automatic survey generation by proposing a comprehensive benchmark that integrates outline, content, and reference assessments with LLM-based and quantitative metrics. Its strength lies in introducing human preference metrics and demonstrating consistency with human judgments, but it is narrowly focused on survey generation rather than broader scientific discovery.
Read-first 评分解释
综合优先阅读分 51.4,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 48。
研究版图角色
前沿论文桥接论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:24。
关键词评分
深度分析
创新点
- 提出了SGSimEval,一个面向自动综述生成评估的全面多维度基准,整合了大纲、内容和参考文献的评估。
- 将基于LLM的评分与定量指标相结合,构建了相似性增强的评估框架。
- 引入了强调内在质量和与人类生成综述相似性的人类偏好指标。
方法
SGSimEval通过结合基于LLM的评分和定量指标评估自动综述生成系统的大纲、内容和参考文献,并纳入衡量与人类综述相似性的人类偏好指标。大量实验将当前ASG系统与人类表现进行了比较。
关键结果
当前ASG系统在大纲生成方面达到与人类相当的水平,但在内容和参考文献生成方面仍有显著改进空间;所提出的评估指标与人类评估保持高度一致性。