Awesome Auto Research Hub 论文 · 数据集 · 项目
← 返回论文列表

1GC-7RC: 一张显卡——七大研究挑战!AI智能体做你的工作有多好?

arXiv 2026 65.9 benchmark

TLDR

提出1GC-7RC基准,评估AI编码智能体在七项ML任务上的表现,揭示性能差异。

评分理由

Strengths include a novel benchmark with diverse tasks, realistic constraints, and public artifacts. Weaknesses are limited scope to coding agents and lack of broader scientific discovery tasks; evaluation on proprietary agents may hinder reproducibility.

Read-first 评分解释

综合优先阅读分 65.9,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 47。

近期性 8%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

可复现性 25%
85

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:有;数据:无;命中信号:工件、代码、GitHub

方法质量 25%
80

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基线、基准、评估

主题相关性 42%
39.2

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:AI scientist、automated scientific discovery、autonomous research agent、automated research、literature review agent、survey generation、automated experimentation、experiment design agent、AI for scientific research、paper writing agent、research automation、scientific discovery agent

研究版图角色

前沿论文桥接论文方法锚点复现锚点

排序敏感性

稳定性:volatile;排名波动范围:105。

关键词评分

automated experimentation
7
experiment design agent
7
autonomous research agent
6
research automation
6
automated research
5
AI for scientific research
5
AI scientist
4
scientific discovery agent
4
automated scientific discovery
3
literature review agent
0
survey generation
0
paper writing agent
0

深度分析

创新点

  • 提出1GC-7RC,这是首个标准化基准,用于评估自主AI编码智能体在跨多个领域的端到端ML模型设计、实现和从头训练方面的能力。
  • 基准设计强制执行现实约束:单GPU、无互联网、无预训练权重(一个受控例外)、严格的时间预算,测试隐式ML知识、规划和时间管理能力。
  • 模块化且可扩展的平台,可适应新任务、GPU预算和多智能体设置,用于未来自主研究智能体的研究。

方法

该基准包含七项ML任务(语言建模、图像分类、语义分割、图学习、表格预测、时间序列预测、文本分类),配有锁定的数据准备和评估脚本以及一个基线训练脚本。智能体只能修改训练代码,无互联网访问,无预训练权重(分割任务有一个受控例外),并且必须在单GPU上在40-120分钟的时间预算内完成每项任务。对七个编码智能体(五个专有,两个开源)进行了每个智能体-任务对五次运行的评估。

关键结果

观察到各智能体之间存在显著的性能差异,揭示了不同程度的隐式ML知识、规划能力和时间预算管理能力。

局限性

  • 仅限于七项任务,可能无法涵盖所有ML子领域或现实世界的复杂性。
  • 单GPU和时间预算限制了对更大规模项目的适用性。
  • 无互联网访问阻止智能体利用外部资源,这可能无法反映典型的开发工作流程。
  • 允许语义分割使用预训练权重的受控例外引入了任务间的不一致性。

标签

LGAICL