Awesome Auto Research Hub 论文 · 数据集 · 项目
← 返回论文列表

MLReplicate:面向机器学习可复现性的自主研究系统基准测试

arXiv 2026 64.4 method

TLDR

提出MLReplicate基准,基于ICML 2025论文评估自主研究系统的ML可复现性,发现自动评审不可靠且成本与质量无关。

评分理由

Strengths include a novel dual-protocol evaluation combining automated and human review, revealing critical flaws in current systems. Weaknesses are the narrow focus on ML reproducibility and limited sample size of 6 systems and 45 manuscripts.

Read-first 评分解释

综合优先阅读分 64.4,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 75。

近期性 8%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

方法质量 25%
90

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基准、评估、实验、指标、结果

主题相关性 42%
62.5

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:AI scientist、automated scientific discovery、autonomous research agent、automated research、literature review agent、survey generation、automated experimentation、experiment design agent、AI for scientific research、paper writing agent、research automation、scientific discovery agent

可复现性 25%
30

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:无

研究版图角色

前沿论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:32。

关键词评分

AI scientist
9
autonomous research agent
9
automated research
8
AI for scientific research
8
paper writing agent
8
research automation
8
automated scientific discovery
7
scientific discovery agent
7
automated experimentation
5
experiment design agent
3
literature review agent
2
survey generation
1

深度分析

创新点

  • MLReplicate基准:一个面向机器学习可复现性的自主研究系统端到端评估框架,基于ICML 2025杰出论文重构为标准输入规范构建。
  • 双协议评估方法,结合自动化会议风格评审和结构化专家人工评估,同时追踪计算成本、运行时间和人工干预量。
  • 证明自主研究工作流设计比计算规模更重要,因为最便宜的系统在人工评估中优于最耗资源的系统,尽管输入令牌数量相差38倍。

方法

MLReplicate基于ICML 2025杰出论文重构为标准输入规范构建。六个最先进的自主研究系统(AI SCIENTIST-V1, AI SCIENTIST-V2, AGENT LABORATORY, CYCLERESEARCHER, AI RESEARCHER, TINY SCIENTIST)生成了45篇手稿(3篇失败)。输出通过自动化会议风格评审和结构化专家人工评估进行评估,指标包括计算成本、运行时间和人工干预量。

关键结果

自动评审接受了37份有效提交中的10份,但人工评审员在所有系统中发现了方法论缺陷、虚构结果和可复现性失败;59%被接受的自动评审包含捏造或无依据的声明。最便宜的系统在人工评估中优于最耗资源的系统,表明工作流设计比计算规模更重要。

标签

LG