Awesome Auto Research Hub 论文 · 数据集 · 项目
← 返回论文列表

深度研究智能体能否检索与组织?利用专家分类体系评估综合差距

arXiv 2026 66.4 method

TLDR

提出TaxoBench基准评估深度研究智能体的论文检索与分类组织能力,揭示能力与对齐的双重瓶颈。

评分理由

The paper's strength lies in its novel benchmark (TaxoBench) with expert taxonomies and new metrics, providing a rigorous evaluation of both retrieval and hierarchical organization. Weaknesses include limited scope (only LLM surveys) and potential over-reliance on single expert references, though they attempt to partition findings into capability and alignment.

Read-first 评分解释

综合优先阅读分 66.4,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 57。

近期性 8%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

方法质量 25%
80

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基准、评估、指标

可复现性 25%
73

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:有;数据:无;命中信号:GitHub

主题相关性 42%
47.5

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:AI scientist、automated scientific discovery、autonomous research agent、automated research、literature review agent、survey generation、automated experimentation、experiment design agent、AI for scientific research、paper writing agent、research automation、scientific discovery agent

研究版图角色

前沿论文方法锚点复现锚点

排序敏感性

稳定性:volatile;排名波动范围:87。

关键词评分

literature review agent
9
survey generation
9
automated research
7
research automation
7
autonomous research agent
6
AI for scientific research
5
automated scientific discovery
4
paper writing agent
3
scientific discovery agent
3
AI scientist
2
automated experimentation
1
experiment design agent
1

深度分析

创新点

  • TaxoBench:包含72篇LLM综述、专家分类树及论文-类别映射的基准,用于评估检索与层次组织
  • 新的层次评估指标:无序语义树编辑距离(US-TED/US-NTED)和语义路径相似度(Sem-Path),捕捉超越平面聚类的分类结构
  • 将评估划分为基于能力(无参考)和基于对齐(依赖参考)两组,以区分模型失败与对单一专家参考的分歧

方法

TaxoBench由72篇高被引LLM综述及其专家分类树和3,815篇论文构建。通过召回率/精确率/F1评估检索,通过新指标US-TED和Sem-Path在叶子与层次层面评估组织。在7个深度研究智能体和12个前沿LLM上测试两种模式(深度研究端到端和自底向上仅组织),结果分为能力组和对齐组。

关键结果

最佳智能体仅检索到20.92%的专家引用论文;模型分类体系显示75.9%兄弟重叠、51.2% MECE违反和83.4%结构不平衡(能力)。所有LLM达到Sem-Path 28-29%,远低于人类标注者的47-58%(对齐)。

局限性

  • 对齐评估依赖单一专家分类参考,但通过将发现划分为无参考的能力指标来缓解此问题

标签

CL