基于合成任务扩展的AI科学家
TLDR
生成合成ML研究任务的流水线,通过教师-学生训练提升MLGym基准性能。
评分理由
The paper introduces a novel synthetic task generation pipeline for training AI agents in ML research, with grounding in real datasets and self-debugging. Strengths include a principled training approach and empirical gains on MLGym; weaknesses include limited scope to ML tasks and lack of evaluation on broader scientific discovery.
Read-first 评分解释
综合优先阅读分 63.5,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 68。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:23。
关键词评分
深度分析
创新点
- 针对机器学习智能体的合成环境生成流水线,自动合成与SWE-agent兼容的ML挑战(主题采样、数据集提议、代码生成)。
- 通过Huggingface API验证,将合成任务基于真实ML数据集。
- 自调试循环确保生成任务的高质量。
- 使用GPT-5在合成任务上的轨迹进行教师-学生训练,以提升较小模型(Qwen3-4B、Qwen3-8B)在MLGym基准上的性能。
方法
本文提出了一种流水线,自动合成与SWE-agent框架兼容的机器学习挑战,涵盖主题采样、数据集提议和代码生成。任务通过Huggingface API验证提议而基于真实数据集,并通过自调试循环进行优化。使用教师模型(GPT-5)在这些合成任务上的轨迹训练学生模型(Qwen3-4B和Qwen3-8B),然后使用AUP指标在MLGym基准上评估。
关键结果
使用合成任务训练使Qwen3-4B在MLGym上的AUP指标提升9%,Qwen3-8B提升12%。
技术栈
SWE-agentHuggingface APIGPT-5Qwen3-4BQwen3-8BMLGym