大语言模型的测试时训练(TTT)想要继续提升推理能力,核心难题是缺少真实标签。近期强化学习和在策略自蒸馏(OPSD)推动了数学推理进展,但都依赖 ground-truth labels,因此难以直接用于测试时训练。TTPO(Test-Time Policy Optimization)尝试用模型自身的多数投票结果提供监督,并针对伪标签可能出错的问题设计了不对称优化目标。
伪标签为什么不够稳
用多次采样结果的多数投票作为伪标签,是一种自然的自监督方案,但错误投票会污染教师信号,并可能误导生成过程中的每个 token。论文观察到,这种失败并不是完全对称的:与伪标签不一致的推理轨迹,通常本身就是错误的,无论多数投票最终是否正确。
TTPO据此把推理轨迹分成两类。与伪标签一致的 rollout 通过 OPSD 进行蒸馏;不一致的 rollout 则通过 Grouped RL 受到惩罚。这样,模型不必把所有轨迹都当成同等可靠的学习目标,而是利用一致性信息分别处理正向和负向信号。
token级别的选择
TTPO还进一步在 token 层面筛选更新位置。蒸馏分支会降低已经收敛位置的权重,避免重复强化模型已经掌握的内容;RL 分支只惩罚具有较高置信度的错误,从而减少不确定预测带来的干扰。论文称,即使多数投票频繁出错,这两类更新仍能保持合理的自监督基础。随着模型能力提升,多数投票路由也会提供更紧的自监督信号。
在不使用标签的条件下,TTPO在五个竞赛级基准上达到与有标签监督的OPSD相当的表现。测试时训练实验中,Qwen3-1.7B的结果从38.0%提升到45.2%;在不进行思考的设置下,提升幅度为25.2%至36.4%。论文还报告了较强的跨任务泛化能力。
我的判断
TTPO的价值不在于消除了伪标签错误,而在于承认错误存在,并利用轨迹与伪标签之间的不一致来分配不同的训练信号。它为无标签测试时训练提供了一条更细致的路径,尤其适合能够生成多条候选推理轨迹、并可通过多数投票形成路由的任务。不过,材料没有说明这些收益在更多任务、不同采样设置或更大模型上的稳定性,也没有给出测试时训练的额外计算成本。因此,它更像是对自监督推理优化的一种有针对性的目标设计,距离通用的无标签训练方案仍需更多验证。