PaperGym:以评分标准为中心的研究计划生成演化
TLDR
PaperGym将论文转化为研究计划生成的训练环境,以评分标准为奖励提升模型性能。
评分理由
Strengths include a novel rubric-centered training framework, low criterion leakage, and consistent gains across model scales and benchmarks. Weaknesses include a focus on research-plan generation rather than full scientific discovery, and no evidence of physical or real-world experimentation.
Read-first 评分解释
综合优先阅读分 35.3,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 62。
研究版图角色
排序敏感性
稳定性:volatile;排名波动范围:22。
关键词评分
深度分析
创新点
- PaperGym框架通过将问题生成与准则推导分离,把每篇研究论文转化为完整的强化学习训练环境。
- 问题/准则分离利用论文结构:问题来自研究目标与背景,准则来自方法与实验,将准则泄漏降低至3.7%。
- 准则涵盖方法创新与实验设计,而不是压缩为每次rollout的单个标量。
- 评分标准使用两次:作为OPSD自教师的特权上下文,以及作为GRPO的奖励。
- 发布PaperGym-20k语料库与PaperGym-Innov/PaperGym-Design基准。
方法
PaperGym 从研究论文构建训练环境:从研究目标与背景综合问题,从方法与实验推导准则。模型采用两阶段以评分标准为中心的调度进行训练:评分标准首先作为 OPSD 自教师的特权上下文,然后作为 GRPO 的奖励。评估使用 Qwen3-1.7B/4B/8B 模型,并与监督微调、单阶段训练、相反顺序以及 RubricHub Science 在五个基准和 ResearchQA 上进行比较。
关键结果
准则泄漏降至3.7%,而现有数据集为11.90%-34.10%;PaperGym 训练使 Qwen3-1.7B/4B/8B 的五个基准平均分分别提升 +5.6、+5.0 和 +4.8 分。基于 PaperGym-20k 训练的模型在三方比较中获胜58.1%,而 RubricHub Science 为28.2%;Qwen3-8B 在 ResearchQA 上达到73.48,超过 Kimi K2.6。