Muon 已在大规模预训练中表现出与 AdamW 竞争的能力,但它是否同样适合强化学习后训练,此前并不明确。这项工作把问题缩小到稀疏奖励的智能体任务:研究者使用 Qwen2.5-0.5B-Instruct 在 ALFWorld 上进行匹配的单种子对比,考察原始 Muon 与 AdamW 的差异。
Muon 在 GiGPO 上带来明显提升
在 Group-in-Group Policy Optimization(GiGPO)设置中,研究者只对隐藏层权重矩阵应用 Muon,最终窗口的验证成功率从 AdamW 的 0.290 提升到 0.546,相对增幅为 88%。作为对照,使用较高学习率的 AdamW 在参数更新后没有保留成功表现。
这一结果说明,Muon 在特定智能体强化学习配置中可能不只是 AdamW 的等价替代,而会直接影响策略能否从稀疏奖励中获得有效更新。不过,实验并未证明应将所有参数统一切换到 Muon;当前证据仅对应隐藏层权重矩阵上的用法。
收益取决于优势估计器和学习率
优化器效果并不独立存在。在学习率 3e-5 下,Muon 将 GRPO 的结果从 0.161 提升到 0.268;但对 GraphGPO 而言,接近饱和后,后期窗口中的差距会缩小。
当学习率降至 1e-5,GraphGPO 配合 Muon 的成功率达到 0.901,归一化验证 AUC 从 0.399 提升至 0.556。达到 0.5 和 0.75 成功率所需的训练进度,也分别提前了 30 次和 60 次更新。相比只看最终成功率,AUC 与达标速度表明 Muon 还可能改善训练过程中的样本效率和收敛速度。
我的判断
这项工作的价值,在于把优化器、优势估计器与学习率视为需要联合选择的训练组合,而不是孤立比较 Muon 和 AdamW。对稀疏奖励智能体训练,Muon 值得纳入实验矩阵,尤其是在 AdamW 高学习率配置不稳定时。
但结论仍属探索性结果:实验只有单个随机种子,模型规模较小,任务也仅覆盖 ALFWorld;不同优势估计器下的收益并不一致,接近饱和时优势还会收窄。在多种子和跨任务验证完成前,更稳妥的做法是将 Muon 视为可调选项,而非默认替代 AdamW。