扩散模型可以通过强化学习对齐人类偏好或任务目标,但图像最终得到的奖励,并不能直接说明去噪过程中的某一步预测应该如何调整。来自 Hugging Face Daily Papers 的这项工作提出 DiffusionOPSD,尝试把图像级奖励转换为中间去噪预测可以直接学习的目标,让扩散模型后训练更容易分析。

把最终奖励变成中间监督

DiffusionOPSD采用一种 on-policy self-distillation 框架。每轮外层迭代中,冻结的行为策略先生成轨迹,并提供查询状态与对应锚点。随后,奖励梯度围绕每个锚点构造有界的正向和负向目标,训练中的策略把这些目标当作已经分离梯度的监督信号进行拟合。完成有限次数的拟合后,再通过指数移动平均更新行为策略,为下一轮生成新的轨迹。

这个流程的关键在于,它把“目标构造带来了多少改进”和“模型实际拟合后实现了多少改进”区分开来。论文还设计了相同查询条件下的受控实验,结果显示,目标构造阶段更大的收益,并不一定会在单次拟合更新后转化为更大的实际收益。换言之,奖励信号如何被构造成可学习目标,以及模型能否充分实现这些目标,是两个不能混为一谈的问题。

实验结果与成本

在 SD 3.5-M 和经过步数蒸馏的 Z-Image-Turbo 上,DiffusionOPSD在两种骨干模型、十个评估器构成的二十个奖励匹配设置中,有十九个设置取得了最高的最终留出分数。相较最强竞争方法,论文报告的最高提升幅度为 44.0%。

训练成本方面,相比 DiffusionNFT,DiffusionOPSD在 SD 3.5-M 上减少了 40% 的训练 GPU 小时,在 Z-Image-Turbo 上减少了 63%。这些结果表明,作者关注的不只是最终分数,也包括训练过程的效率与可解释拆分。不过,摘要没有进一步说明不同评估器、奖励类型或拟合轮数下的具体表现,不能据此推断它在所有偏好优化任务中都同样有效。

我的判断

这项工作的价值,在于为扩散模型强化学习补上了一个实际的中间层:它不再只依赖图像级终点奖励,而是构造出针对采样查询的清晰预测目标,并用实验区分目标质量与实现能力。对于需要控制训练成本、同时希望分析奖励如何影响去噪过程的后训练任务,这一思路具有较强参考意义。

但它的适用边界也很明确。方法依赖奖励梯度、行为策略轨迹和有限拟合过程,目标构造是否稳定、不同奖励函数是否都能形成有效的正负目标,仍需要更多材料和实验来判断。当前结果覆盖两个扩散模型骨干与二十个奖励匹配设置,表现有说服力,但还不足以证明该框架对更广泛模型和任务的普适性。