自回归视频扩散模型使用自身生成的历史继续预测,可以缓解训练与推理上下文不一致的问题,但这并不意味着历史信息得到了充分训练。Self Gradient Forcing(SGF)关注的是一个更具体的缺口:模型生成的历史潜变量进入KV缓存后,通常只是供后续帧读取的固定状态,未来帧上的损失无法继续监督早期内容应该如何编码成更有效的记忆。
Self Forcing仍缺少什么
Self Forcing让学生模型基于自己的 rollout 历史训练,而非始终依赖真实视频上下文,因而降低了 exposure bias。不过,在后续帧生成过程中,历史KV缓存被冻结,梯度不能沿未来损失回到较早生成的潜变量及其上下文表示。作者将其称为“历史上下文梯度缺口”。
问题不只是早期帧是否生成正确,还包括它们是否被写成了便于未来读取的键和值。如果训练只约束当前输出,而不约束历史记忆的写入方式,误差在长时间生成中可能缺少针对性的修正信号。
两次前向补回记忆写入监督
SGF采用两阶段训练。第一阶段执行与推理过程一致、但不记录梯度的自回归 rollout,并在随机采样的去噪退出步骤保存模型自行生成的上下文,以及当时输入模型的带噪潜变量。
第二阶段针对该退出步骤并行重建上下文梯度。已生成上下文作为停止梯度的干净潜变量输入,但模型会重新计算上下文的KV表示,以及未来位置到历史上下文的因果注意力。这样,未来视频潜变量上的损失便能训练模型如何把历史内容编码进更有效的因果记忆,同时不需要对完整、串行的 rollout 进行反向传播。材料称实验覆盖逐帧与分块生成以及不同初始化,但未提供具体指标和增益幅度。
我的判断
SGF的价值在于,它没有另造推理机制,而是补齐自回归训练目标里“如何写记忆”的监督,思路与实际推理路径较一致。它尤其适合依赖历史KV缓存的原生长视频自回归扩散模型。边界也很明确:当前材料不足以判断额外一次计算带来的训练成本,也无法确认优势会随视频长度、生成粒度或模型规模如何变化。摘要结论还被截断,因此现阶段更适合把SGF视为一个有针对性的训练机制,而不是已被充分量化的通用长视频方案。