将游戏代码世界模型生成蒸馏到轻量级大语言模型中
TLDR
通过SFT和RLVR将游戏代码世界模型生成能力蒸馏到小型LLM中,提升语法正确性和规则遵循度。
评分理由
Strengths include a novel distillation pipeline combining SFT and RLVR with a verification framework, and a curated dataset of 30 games. Weaknesses are the limited scope (only one 3B model, 30 games) and lack of direct comparison to frontier models.
Read-first 评分解释
综合优先阅读分 55.8,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 42。
研究版图角色
基础论文前沿论文桥接论文
排序敏感性
稳定性:volatile;排名波动范围:283。
关键词评分
深度分析
创新点
- 通过后训练将游戏代码世界模型生成能力蒸馏到小型LLM中
- 包含30个完美信息和不完美信息游戏的精选数据集
- 评估生成代码的结构和语义游戏属性的验证框架
- 结合监督微调(SFT)和可验证奖励强化学习(RLVR)的后训练流程
方法
作者引入了一个包含30个游戏的精选数据集、一个用于结构和语义属性的验证框架,以及一个结合监督微调(SFT)和可验证奖励强化学习(RLVR)的后训练流程。他们使用Qwen2.5-3B-Instruct模型进行实验,评估语法正确性和执行层面的游戏规则遵循度。
关键结果
SFT提高了语法正确性,而RLVR改善了执行层面的游戏规则遵循度,使Qwen2.5-3B-Instruct在完美信息和不完美信息游戏中生成有效游戏代码世界模型的能力更强。
技术栈
Qwen2.5-3B-InstructSFTRLVRPython