DSAgentBench:智能体能否在真实计算机环境中自动化端到端数据科学工作流?
TLDR
提出DSAgentBench基准,含275个真实计算机环境中的端到端数据科学任务,揭示智能体能力差距。
评分理由
The paper's strength is its realistic benchmark design with deterministic evaluators and extensive model testing. Weaknesses include limited scope to data science rather than broader scientific discovery, and no open-source agent success. The abstract provides clear evidence for real-world evaluation.
Read-first 评分解释
综合优先阅读分 43.5,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 25。
研究版图角色
前沿论文
排序敏感性
稳定性:volatile;排名波动范围:25。