MLRC-Bench:语言智能体能否解决机器学习研究挑战?
TLDR
提出MLRC-Bench基准,用客观指标评估语言智能体在机器学习研究挑战中的表现,显示显著差距。
评分理由
Strengths include rigorous objective evaluation and identification of misalignment with LLM-judged innovation. Weaknesses are limited task scope (7 tasks) and lack of detailed agent comparisons beyond one best performer.
Read-first 评分解释
综合优先阅读分 53.8,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 42。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:65。
关键词评分
深度分析
创新点
- 引入MLRC-Bench基准,该基准使用竞赛任务的客观指标评估语言智能体提出和实施新颖机器学习研究方法的能力,不同于以往的LLM-as-a-judge方法。
- 揭示了在机器学习研究挑战中,LLM评判的创新性与实际任务表现之间的不一致。
- 提出了一个动态基准,可以纳入新的机器学习竞赛以进行持续的严格评估。
方法
MLRC-Bench包含7个精心挑选的机器学习研究竞赛任务,这些任务需要新颖的方法论。语言智能体根据其提出和实施研究方法的能力进行评估,性能通过客观竞赛指标衡量,并与基线和顶级人类参与者得分进行比较。
关键结果
最佳智能体(MLAB下的gemini-exp-1206)仅缩小了基线与顶级人类得分之间差距的9.3%,并且LLM评判的创新性与实际表现不一致。