强化学习已经被用于提升大语言模型的推理能力,但在掩码扩散语言模型(MDLM)上,策略所需的对数似然难以估计。现有方法通常只近似词元预测概率,没有完整表示生成过程中掩码位置如何变化。这篇工作把被忽略的位置选择纳入策略梯度,试图让优化目标与 MDLM 的实际生成过程对齐。

从词元预测扩展到位置决策

作者指出,MDLM 每一步实际上包含两类决策:一类是在当前被掩码的位置填入什么词元;另一类是决定哪些位置需要重新掩码。后者会影响位置被逐步解掩码的顺序,也会改变后续生成所处的状态。

论文将这一过程形式化为两阶段动作马尔可夫决策过程。对应地,策略梯度可以自然拆成词元项与掩码项:前者优化具体内容的预测,后者优化位置层面的掩码行为。相比只建模词元概率的近似方法,这一表述至少在目标定义上更完整,也明确了 MDLM 强化学习与自回归模型训练之间的差异。

数学与代码基准结果

根据摘要,同时优化词元项和掩码项后,方法在数学推理与代码生成基准上取得了当前最佳结果:GSM8K 得分为 87.1%,MBPP 得分为 53.4%。这说明位置选择并非纯粹的生成细节,它可能直接影响奖励信号如何分配到扩散过程中的不同动作。

不过,给定材料没有提供模型规模、对比方法、训练成本、结果方差以及两项策略梯度各自贡献等信息。因此,这些分数可以说明联合优化方案有效,但还不足以判断收益主要来自更准确的策略建模,还是其他训练配置。

我的判断

这项工作的价值,在于把 MDLM 生成中的“填什么”和“改哪些位置”都视为可学习动作,而不是继续沿用只关注词元概率的近似。对于需要用奖励优化数学推理或代码生成的扩散语言模型,这是一条结构清晰的训练思路。

它的适用边界也很明确:结论针对具有掩码与重新掩码过程的 MDLM,不能直接外推到自回归语言模型或其他扩散架构。仅凭摘要也无法评估额外掩码策略带来的计算开销、训练稳定性及跨任务泛化能力。当前更适合将其视为对 MDLM 强化学习目标的一次关键补全,而不是已经验证充分的通用方案。