Awesome Auto Research Hub 论文 · 数据集 · 项目
← 返回论文列表

PaperGym:以评分标准为中心的研究计划生成演化

arXiv 2026 35.3 method

TLDR

PaperGym将论文转化为研究计划生成的训练环境,以评分标准为奖励提升模型性能。

评分理由

Strengths include a novel rubric-centered training framework, low criterion leakage, and consistent gains across model scales and benchmarks. Weaknesses include a focus on research-plan generation rather than full scientific discovery, and no evidence of physical or real-world experimentation.

Read-first 评分解释

综合优先阅读分 35.3,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 62。

近期性 8%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

方法质量 25%
50

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基准、数据集、实验

可复现性 25%
38

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:数据集

主题相关性 42%
11.9

将配置的研究关键词与标题、摘要、标签和分析文本进行匹配。 匹配关键词数:3

研究版图角色

前沿论文

排序敏感性

稳定性:volatile;排名波动范围:22。

关键词评分

AI scientist
8
AI for scientific research
8
automated scientific discovery
7
automated research
7
research automation
7
autonomous research agent
6
scientific discovery agent
6
experiment design agent
5
automated experimentation
4
paper writing agent
2
literature review agent
1
survey generation
1

深度分析

创新点

  • PaperGym框架通过将问题生成与准则推导分离,把每篇研究论文转化为完整的强化学习训练环境。
  • 问题/准则分离利用论文结构:问题来自研究目标与背景,准则来自方法与实验,将准则泄漏降低至3.7%。
  • 准则涵盖方法创新与实验设计,而不是压缩为每次rollout的单个标量。
  • 评分标准使用两次:作为OPSD自教师的特权上下文,以及作为GRPO的奖励。
  • 发布PaperGym-20k语料库与PaperGym-Innov/PaperGym-Design基准。

方法

PaperGym 从研究论文构建训练环境:从研究目标与背景综合问题,从方法与实验推导准则。模型采用两阶段以评分标准为中心的调度进行训练:评分标准首先作为 OPSD 自教师的特权上下文,然后作为 GRPO 的奖励。评估使用 Qwen3-1.7B/4B/8B 模型,并与监督微调、单阶段训练、相反顺序以及 RubricHub Science 在五个基准和 ResearchQA 上进行比较。

关键结果

准则泄漏降至3.7%,而现有数据集为11.90%-34.10%;PaperGym 训练使 Qwen3-1.7B/4B/8B 的五个基准平均分分别提升 +5.6、+5.0 和 +4.8 分。基于 PaperGym-20k 训练的模型在三方比较中获胜58.1%,而 RubricHub Science 为28.2%;Qwen3-8B 在 ResearchQA 上达到73.48,超过 Kimi K2.6。

标签