进化微调:在371个优化任务中学习发现
TLDR
提出进化微调(EFT),教会LLM跨优化任务演化解决方案,实现跨任务泛化。
评分理由
The paper presents a novel mid-training paradigm that leverages evolutionary search trajectories to enable cross-task generalization in LLMs, supported by a large dataset and empirical improvements. However, the focus is on optimization tasks rather than broader scientific discovery or research automation, limiting direct relevance to some keywords.
Read-first 评分解释
综合优先阅读分 41.8,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 33。
研究版图角色
前沿论文
排序敏感性
稳定性:volatile;排名波动范围:35。
关键词评分
深度分析
创新点
- 进化微调(EFT):一种中间训练范式,通过将进化搜索轨迹转换为监督信号来教会LLM跨任务演化解决方案。
- Finch Collection:一个包含156K条进化搜索轨迹的数据集,涵盖10个领域和371个优化任务。
- 将迭代解决方案演化的能力从搜索脚手架转移到模型本身,实现跨任务泛化。
- EFT作为通用发现代理的“练习阶段”,使其不再从头解决新问题。
方法
EFT在Finch Collection数据集(包含进化搜索轨迹)上对开源LLM(2B到9B参数)进行微调。模型在22个保留优化任务上进行评估,并进一步与测试时强化学习结合。
关键结果
EFT模型在22个保留任务上平均比基础模型高出10.22%。结合测试时RL,模型在两个圆填充任务上达到最先进性能,并在Erdős最小重叠问题上优于其基础模型。
技术栈
LLMs (2B-9B parameters)Finch Collection datasetEvolutionary searchTest-time reinforcement learning