PaperGym提出以评分标准为中心的研究计划生成进化方法
原文:PaperGym: Rubric-Centered Evolution for Research-Plan Generation
研究规划是 AI 科学家的决定性能力。然而研究计划没有可验证的答案,因此强化学习缺乏其所需的环境:任务配对评判者(critic)。从科学论文中提取的评分标准(rubric)可以充当评判者。但现有流程从同一内容中同时抽取问题和评判准则,导致模型可以通过改写来获得奖励。此外,评分标准被压缩为每次 rollout 的单一标量。我们提出 PaperGym,一个将每篇研究论文转化为完整训练环境的统一框架。PaperGym 利用了论文的结构:问题由研究目标和背景合成,而评判准则则来自方法与实验部分。准则涵盖方法论创新与实验设计,准则泄露率降至 3.7%,而现有数据集为 11.90% 至 34.10%。训练中评分标准被使用两次:首先作为 OPSD 自教师模型的特权上下文,然后作为 GRPO 的奖励。在 Qwen3-1.7B/4B/8B 上,这一方案优于监督微调、单独任一阶段以及相反的顺序,在五个基准的平均分上分别提升 +5.6、+5.0 和 +4.8 分。在配方保持不变的情况下,在 PaperGym-20k 上训练的模型在三方对比中胜率达到 58.1%,而在 RubricHub Science 上训练的仅为 28.2%。训练后的 Qwen3-8B 在 ResearchQA 上达到 73.48 分,超过规模大得多的 Kimi K2.6。我们发布了该流程、包含 2 万实例的语料库 PaperGym-20k,以及基准 PaperGym-Innov 和 PaperGym-Design。作者:Yuhan Wang, Zhengxi Lu, Yuchen Yan, Kaitao Song, Wenqi Zhang 分类:cs.CL