MLReplicate:面向机器学习可复现性的自主研究系统基准测试
TLDR
提出MLReplicate基准,基于ICML 2025论文评估自主研究系统的ML可复现性,发现自动评审不可靠且成本与质量无关。
评分理由
Strengths include a novel dual-protocol evaluation combining automated and human review, revealing critical flaws in current systems. Weaknesses are the narrow focus on ML reproducibility and limited sample size of 6 systems and 45 manuscripts.
Read-first 评分解释
综合优先阅读分 64.4,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 75。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:32。
关键词评分
深度分析
创新点
- MLReplicate基准:一个面向机器学习可复现性的自主研究系统端到端评估框架,基于ICML 2025杰出论文重构为标准输入规范构建。
- 双协议评估方法,结合自动化会议风格评审和结构化专家人工评估,同时追踪计算成本、运行时间和人工干预量。
- 证明自主研究工作流设计比计算规模更重要,因为最便宜的系统在人工评估中优于最耗资源的系统,尽管输入令牌数量相差38倍。
方法
MLReplicate基于ICML 2025杰出论文重构为标准输入规范构建。六个最先进的自主研究系统(AI SCIENTIST-V1, AI SCIENTIST-V2, AGENT LABORATORY, CYCLERESEARCHER, AI RESEARCHER, TINY SCIENTIST)生成了45篇手稿(3篇失败)。输出通过自动化会议风格评审和结构化专家人工评估进行评估,指标包括计算成本、运行时间和人工干预量。
关键结果
自动评审接受了37份有效提交中的10份,但人工评审员在所有系统中发现了方法论缺陷、虚构结果和可复现性失败;59%被接受的自动评审包含捏造或无依据的声明。最便宜的系统在人工评估中优于最耗资源的系统,表明工作流设计比计算规模更重要。