SurveyEval:面向LLM生成学术综述的全面评估
TLDR
SurveyEval是一个评估LLM生成学术综述在质量、连贯性和准确性方面的基准。
评分理由
The paper introduces a comprehensive evaluation benchmark with three dimensions and seven subjects, using human references to improve alignment. Its strength lies in addressing the underexplored evaluation challenge, but it does not propose new generation methods, limiting its scope to assessment.
Read-first 评分解释
综合优先阅读分 48.6,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 47。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:16。
关键词评分
深度分析
创新点
- SurveyEval基准从整体质量、大纲连贯性和参考文献准确性三个维度评估综述
- 通过引入人工参考增强LLM-as-a-Judge框架以提升评估与人类判断的一致性
- 跨7个学科的多学科评估
方法
SurveyEval从三个维度评估自动生成的综述:整体质量、大纲连贯性和参考文献准确性。该基准覆盖7个学科,并使用引入人工参考的LLM-as-a-Judge框架来与人类判断对齐。
关键结果
通用长文本或论文写作系统生成质量较低的综述,而专门的综述生成系统能实现显著更高的质量。