实时视频生成的一条重要路线,是把已经训练好的双向视频扩散模型蒸馏成因果的自回归学生模型。材料介绍的 Mask Forcing 针对这一过程中的视觉质量问题展开:现有基于分布匹配蒸馏(DMD)的方法容易生成过度饱和、过度平滑的视频,影响结果的真实感。论文将关键原因指向 DMD 所采用反向 KL 目标的模式寻求行为:学生分布可能只聚集到教师分布的少数模式,导致生成结果缺乏多样性和细节。
方法要点
Mask Forcing 的核心是 Dual-Noise Masking Rollout,即在自回归扩散蒸馏的自回滚过程中,对输入施加沿空间和时间轴的随机掩码。掩码带来的扰动,会把更干净的信号注入原本较噪的滚动输入,使学生模型不再只沿着已经覆盖的少数模式学习。这样,DMD 可以获得来自教师分布更多区域的学习信号,从而缓解反向 KL 造成的模式坍缩。
这一机制还有第二层作用。被保留下来的干净 token 可以为其他更噪的 token 提供去噪引导,改善中间阶段的滚动预测,并减少自回归生成中逐步累积的误差。换句话说,Mask Forcing 并不是单纯改变最终输出,而是试图在学生模型不断使用自身预测作为后续输入的过程中,改善训练信号和中间状态。
实验信息
论文称,广泛实验表明,Mask Forcing 能够提升多种自回归视频扩散蒸馏方法的视觉质量,并保持较高的效率。材料同时明确指出,该方法不依赖真实视频数据。其价值主要体现在蒸馏阶段:通过调整自回滚输入,扩大教师分布对学生的有效指导范围,而不是依靠额外的数据来源来弥补学生模型的生成缺陷。
我的判断
这项工作的判断比较具体:自回归视频扩散蒸馏的瓶颈不只在模型结构,也在学生模型如何探索教师分布。时空掩码提供了一种轻量的训练过程干预,适合已经采用 DMD、且受到过饱和、过平滑或误差累积影响的蒸馏方案。它的适用边界也很清楚:材料主要说明了蒸馏阶段的分布覆盖和滚动预测问题,尚不足以证明该策略适用于所有视频生成架构或所有质量维度。实际收益仍需要结合具体蒸馏方法、掩码设计和评测设置判断。