大语言模型的在策略蒸馏(On-policy Distillation,OPD)通常让学生模型生成rollout,再接受教师模型提供的逐token密集监督。过去的研究更多关注算法行为,训练数据究竟需要多少,仍缺少清晰答案。这项工作把问题推到数据极限:只用一个查询训练OPD,观察它能否接近完整数据训练的效果。

单条查询为何仍然有效

实验显示,单条查询的OPD在训练数百步后仍持续提升,并在不同任务领域和模型家族上恢复全数据OPD的大部分收益。作者用“状态覆盖率”解释这一现象:它衡量查询集合产生的rollout,能够触达全数据OPD训练过程中访问过的多少状态。

单个查询最终可以触达全数据训练状态的71.5%,其中大部分覆盖发生在前100步。加入语义上不同的查询后,状态覆盖率和验证准确率同步提升;当查询数量达到16个时,覆盖率达到98.9%,效果与全数据训练相当。这说明,OPD的有效监督并不一定依赖大量原始查询,关键在于rollout是否能够暴露足够广泛的训练状态。

数据覆盖与吸收速度

研究还观察到一个容易被忽略的区别:无论OPD只训练一个查询,还是训练整个数据集,学生模型与教师模型对齐的速度都以相近的节奏下降。即使状态集合固定,学生也需要数百步才能逐步吸收其中的监督信号。

作者据此将OPD概括为“数据过量、算法不足”:rollout很快就能带来较广的监督覆盖,但模型消化这些监督的过程越来越慢。这个结论也延伸到多教师OPD(MOPD):每个领域使用16个语义多样的查询,就能接近全数据MOPD。作为压力测试,内容较轻的模板和域外WildChat查询,也接近真实查询基线,表明查询内容本身未必需要高度贴合任务。

我的判断

这项工作的价值,在于把OPD的数据需求和优化需求拆开讨论。对于蒸馏训练,继续堆叠查询数据可能很快进入收益递减阶段;提高训练步数、改善状态利用率,或许更值得优先评估。不过,单条查询能够达到的效果依赖具体任务、模型和训练设置,材料并未说明这一结论可以无条件推广。状态覆盖率也只是对访问范围的刻画,不能单独等同于最终能力。更稳妥的实践是用少量语义多样的查询先验证覆盖率和验证集表现,再决定是否扩充数据规模。