1GC-7RC: 一张显卡——七大研究挑战!AI智能体做你的工作有多好?
TLDR
提出1GC-7RC基准,评估AI编码智能体在七项ML任务上的表现,揭示性能差异。
评分理由
Strengths include a novel benchmark with diverse tasks, realistic constraints, and public artifacts. Weaknesses are limited scope to coding agents and lack of broader scientific discovery tasks; evaluation on proprietary agents may hinder reproducibility.
Read-first 评分解释
综合优先阅读分 65.9,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 47。
研究版图角色
前沿论文桥接论文方法锚点复现锚点
排序敏感性
稳定性:volatile;排名波动范围:105。
关键词评分
深度分析
创新点
- 提出1GC-7RC,这是首个标准化基准,用于评估自主AI编码智能体在跨多个领域的端到端ML模型设计、实现和从头训练方面的能力。
- 基准设计强制执行现实约束:单GPU、无互联网、无预训练权重(一个受控例外)、严格的时间预算,测试隐式ML知识、规划和时间管理能力。
- 模块化且可扩展的平台,可适应新任务、GPU预算和多智能体设置,用于未来自主研究智能体的研究。
方法
该基准包含七项ML任务(语言建模、图像分类、语义分割、图学习、表格预测、时间序列预测、文本分类),配有锁定的数据准备和评估脚本以及一个基线训练脚本。智能体只能修改训练代码,无互联网访问,无预训练权重(分割任务有一个受控例外),并且必须在单GPU上在40-120分钟的时间预算内完成每项任务。对七个编码智能体(五个专有,两个开源)进行了每个智能体-任务对五次运行的评估。
关键结果
观察到各智能体之间存在显著的性能差异,揭示了不同程度的隐式ML知识、规划能力和时间预算管理能力。
局限性
- 仅限于七项任务,可能无法涵盖所有ML子领域或现实世界的复杂性。
- 单GPU和时间预算限制了对更大规模项目的适用性。
- 无互联网访问阻止智能体利用外部资源,这可能无法反映典型的开发工作流程。
- 允许语义分割使用预训练权重的受控例外引入了任务间的不一致性。