Awesome Auto Research Hub 论文 · 数据集 · 项目
← 返回论文列表

SGSimEval:面向自动综述生成系统的全面多维度与相似性增强基准

arXiv 2025 51.4 method

TLDR

SGSimEval是一个结合人类偏好和相似性的多维度自动综述生成评估基准。

评分理由

The paper addresses limitations in existing evaluation methods for automatic survey generation by proposing a comprehensive benchmark that integrates outline, content, and reference assessments with LLM-based and quantitative metrics. Its strength lies in introducing human preference metrics and demonstrating consistency with human judgments, but it is narrowly focused on survey generation rather than broader scientific discovery.

Read-first 评分解释

综合优先阅读分 51.4,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 48。

近期性 8%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

方法质量 25%
80

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基准、评估、实验、指标

主题相关性 42%
40

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:AI scientist、automated scientific discovery、autonomous research agent、automated research、literature review agent、survey generation、automated experimentation、experiment design agent、AI for scientific research、paper writing agent、research automation、scientific discovery agent

可复现性 25%
30

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:无

研究版图角色

前沿论文桥接论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:24。

关键词评分

survey generation
10
literature review agent
7
paper writing agent
6
automated research
5
research automation
5
AI for scientific research
4
automated scientific discovery
3
AI scientist
2
autonomous research agent
2
scientific discovery agent
2
automated experimentation
1
experiment design agent
1

深度分析

创新点

  • 提出了SGSimEval,一个面向自动综述生成评估的全面多维度基准,整合了大纲、内容和参考文献的评估。
  • 将基于LLM的评分与定量指标相结合,构建了相似性增强的评估框架。
  • 引入了强调内在质量和与人类生成综述相似性的人类偏好指标。

方法

SGSimEval通过结合基于LLM的评分和定量指标评估自动综述生成系统的大纲、内容和参考文献,并纳入衡量与人类综述相似性的人类偏好指标。大量实验将当前ASG系统与人类表现进行了比较。

关键结果

当前ASG系统在大纲生成方面达到与人类相当的水平,但在内容和参考文献生成方面仍有显著改进空间;所提出的评估指标与人类评估保持高度一致性。

标签

CLAIIR