深度研究智能体能否检索与组织?利用专家分类体系评估综合差距
TLDR
提出TaxoBench基准评估深度研究智能体的论文检索与分类组织能力,揭示能力与对齐的双重瓶颈。
评分理由
The paper's strength lies in its novel benchmark (TaxoBench) with expert taxonomies and new metrics, providing a rigorous evaluation of both retrieval and hierarchical organization. Weaknesses include limited scope (only LLM surveys) and potential over-reliance on single expert references, though they attempt to partition findings into capability and alignment.
Read-first 评分解释
综合优先阅读分 66.4,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 57。
研究版图角色
排序敏感性
稳定性:volatile;排名波动范围:87。
关键词评分
深度分析
创新点
- TaxoBench:包含72篇LLM综述、专家分类树及论文-类别映射的基准,用于评估检索与层次组织
- 新的层次评估指标:无序语义树编辑距离(US-TED/US-NTED)和语义路径相似度(Sem-Path),捕捉超越平面聚类的分类结构
- 将评估划分为基于能力(无参考)和基于对齐(依赖参考)两组,以区分模型失败与对单一专家参考的分歧
方法
TaxoBench由72篇高被引LLM综述及其专家分类树和3,815篇论文构建。通过召回率/精确率/F1评估检索,通过新指标US-TED和Sem-Path在叶子与层次层面评估组织。在7个深度研究智能体和12个前沿LLM上测试两种模式(深度研究端到端和自底向上仅组织),结果分为能力组和对齐组。
关键结果
最佳智能体仅检索到20.92%的专家引用论文;模型分类体系显示75.9%兄弟重叠、51.2% MECE违反和83.4%结构不平衡(能力)。所有LLM达到Sem-Path 28-29%,远低于人类标注者的47-58%(对齐)。
局限性
- 对齐评估依赖单一专家分类参考,但通过将发现划分为无参考的能力指标来缓解此问题