Awesome Auto Research Hub 论文 · 数据集 · 项目
← 返回论文列表

DSAgentBench:智能体能否在真实计算机环境中自动化端到端数据科学工作流?

arXiv 2026 43.5 method

TLDR

提出DSAgentBench基准,含275个真实计算机环境中的端到端数据科学任务,揭示智能体能力差距。

评分理由

The paper's strength is its realistic benchmark design with deterministic evaluators and extensive model testing. Weaknesses include limited scope to data science rather than broader scientific discovery, and no open-source agent success. The abstract provides clear evidence for real-world evaluation.

Read-first 评分解释

综合优先阅读分 43.5,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 25。

近期性 8%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

方法质量 25%
60

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基准、实验、结果、验证

可复现性 25%
46

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:代码、GitHub

主题相关性 42%
20.8

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:AI scientist、automated scientific discovery、autonomous research agent、automated research、literature review agent、survey generation、automated experimentation、experiment design agent、AI for scientific research、paper writing agent、research automation、scientific discovery agent

研究版图角色

前沿论文

排序敏感性

稳定性:volatile;排名波动范围:25。

关键词评分

AI for scientific research
5
automated experimentation
4
research automation
4
autonomous research agent
3
automated research
3
automated scientific discovery
2
experiment design agent
2
AI scientist
1
scientific discovery agent
1
literature review agent
0
survey generation
0
paper writing agent
0

标签