科研计划没有唯一正确答案,这让 AI 科学家的训练陷入一个基本矛盾:模型需要开放式地提出方法与实验,但强化学习又需要可执行的评价标准。PaperGym 的核心思路,是把已有科学论文改造成同时包含任务、评分细则和训练信号的完整环境。
从论文结构中分离问题与答案
此前一些数据管线会从同一段内容生成问题和评价标准,模型可能仅靠改写原文就获得较高奖励。PaperGym 利用论文内部结构降低这种捷径:研究问题由研究目标和背景合成,评分标准则来自方法与实验部分,覆盖方法创新和实验设计。
这种拆分不能完全消除信息泄漏,但论文报告的 criterion leakage 为 3.7%,低于现有数据集的 11.90% 至 34.10%。这里真正重要的不是把论文转换成普通问答,而是保留一组可分别检查的研究要求,使开放式计划获得比单一总分更具体的监督来源。
评分细则同时参与教学与奖励
PaperGym 在训练中使用评分细则两次。第一阶段将其作为特权上下文交给 OPSD 的自教师,帮助模型学习如何构造研究计划;第二阶段再把同一套细则作为 GRPO 的奖励依据。作者报告,在 Qwen3-1.7B、4B 和 8B 上,这一顺序均优于监督微调、任一单独阶段以及反向排序,五项基准平均分分别提升 5.6、5.0 和 4.8 分。
在训练方法保持不变时,PaperGym-20k 训练模型在三方比较中的胜率为 58.1%,RubricHub Science 为 28.2%。其中 Qwen3-8B 在 ResearchQA 上达到 73.48,超过体量更大的 Kimi K2.6。项目同时开放了生成管线、包含 2 万条实例的语料和相关基准。
我的判断
PaperGym 的价值在于把评分标准从评测附件提升为训练环境的核心,并用论文结构约束数据合成,适合缺乏唯一答案但仍能拆解质量要求的科研规划任务。结果也说明,训练阶段的先后顺序可能比简单增加监督数据更关键。
但现有结论主要来自指定模型、数据和基准,不能直接推导到真实科研产出。评分细则源于已发表论文,也可能鼓励模型复现既有研究范式,而非识别全新的方向。较低的泄漏率、基准得分和比较胜率证明了训练信号更有效,却仍不能替代对计划可行性、实验成本及最终科学价值的长期验证。