Awesome Auto Research Hub 论文 · 数据集 · 项目
← 返回论文列表

SurveyEval:面向LLM生成学术综述的全面评估

arXiv 2025 48.6 method

TLDR

SurveyEval是一个评估LLM生成学术综述在质量、连贯性和准确性方面的基准。

评分理由

The paper introduces a comprehensive evaluation benchmark with three dimensions and seven subjects, using human references to improve alignment. Its strength lies in addressing the underexplored evaluation challenge, but it does not propose new generation methods, limiting its scope to assessment.

Read-first 评分解释

综合优先阅读分 48.6,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 47。

近期性 8%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

方法质量 25%
70

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基准、评估、结果

主题相关性 42%
39.2

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:AI scientist、automated scientific discovery、autonomous research agent、automated research、literature review agent、survey generation、automated experimentation、experiment design agent、AI for scientific research、paper writing agent、research automation、scientific discovery agent

可复现性 25%
30

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:无

研究版图角色

前沿论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:16。

关键词评分

survey generation
8
literature review agent
7
AI for scientific research
6
automated research
5
paper writing agent
5
research automation
5
autonomous research agent
3
AI scientist
2
automated scientific discovery
2
scientific discovery agent
2
automated experimentation
1
experiment design agent
1

深度分析

创新点

  • SurveyEval基准从整体质量、大纲连贯性和参考文献准确性三个维度评估综述
  • 通过引入人工参考增强LLM-as-a-Judge框架以提升评估与人类判断的一致性
  • 跨7个学科的多学科评估

方法

SurveyEval从三个维度评估自动生成的综述:整体质量、大纲连贯性和参考文献准确性。该基准覆盖7个学科,并使用引入人工参考的LLM-as-a-Judge框架来与人类判断对齐。

关键结果

通用长文本或论文写作系统生成质量较低的综述,而专门的综述生成系统能实现显著更高的质量。

标签

CLAI