DeepSurvey-Bench: 评估自动生成科学综述的学术价值
TLDR
提出DeepSurvey-Bench基准,评估自动生成科学综述的学术价值,弥补现有表面层次指标的缺陷。
评分理由
The paper identifies a clear gap in evaluating survey generation quality beyond surface metrics, and introduces a multi-dimensional academic value criteria. However, the abstract is cut off, so full experimental validation is not visible, and the benchmark's novelty may be incremental.
Read-first 评分解释
综合优先阅读分 59.8,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 49。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:78。
关键词评分
深度分析
创新点
- 提出了DeepSurvey-Bench,一个用于评估自动生成科学综述学术价值的基准。
- 定义了包含信息价值、学术交流价值和研究指导价值三个维度的综合学术价值评估标准。
- 构建了带有学术价值标注的可靠数据集,超越了引用次数和结构连贯性等有缺陷的选择标准。
- 评估深层学术价值(核心研究目标、批判性分析),而非表面层次指标。
方法
该基准定义了一个三维学术价值评估标准。基于这些维度构建带有标注的数据集。将生成的综述与该基准进行对比评估,并将结果与人类评估进行比较。
关键结果
该基准在评估生成综述的学术价值方面与人类表现高度一致。