按策略蒸馏(OPD)会沿当前学生模型生成的轨迹查询教师,因此训练分布随学生变化。论文关注一个此前缺少清晰解释的问题:当现代扩散系统默认使用无分类器引导(CFG)时,直接匹配教师与学生的引导后速度,是否足以把知识稳定地传给学生?作者的答案是:取决于正、负两个分支的信息关系。
合成目标掩盖了分支误差
现有 OPD 通常把速度匹配自然延伸到 CFG 合成预测,只要求教师和学生的引导速度接近。但这一目标在分支层面是欠识别的:正分支和负分支的误差可以彼此补偿。即使合成结果看起来正确,也不能保证两个分支分别学对。
论文用两个对照情形说明边界。当教师与学生共享负条件时,朴素匹配仍然有效,两个分支误差会共同下降。问题出现在模型原生 CFG 结构让教师负分支保留了学生无法获得的特权信息时:共同下降不再成立,合成目标会制造对抗性的误差动态——正分支误差降低,负分支误差反而升高。作者将其称为负分支不对称(NBA)。
PDM 如何处理 NBA
为避免只监督合成结果,作者提出正向—方向匹配(PDM)。这个分支感知的 OPD 目标分别约束正向预测以及 CFG 的条件方向,从而不再允许正、负分支误差仅靠合成时相互抵消。
论文把 PDM 用于稠密到稀疏的视频控制。材料显示,朴素引导匹配对推理阶段的 guidance scale 高度敏感;加入分支感知监督后,知识迁移更稳健、也更有效。这里的重点不是取消 CFG,而是让蒸馏目标与 CFG 内部的分支结构对齐。
我的判断
这项工作的价值在于指出:合成输出一致不等于内部条件语义一致,尤其当教师拥有学生不可见的信息时,单一结果级损失可能给出误导性的训练信号。PDM 对带原生 CFG、且教师与学生条件信息不对称的视频控制任务值得关注。
适用边界也很明确:在共享负条件、两个分支误差能同步下降的场景,朴素方法本身仍可能足够。现有材料只报告了稠密到稀疏视频控制中的应用,未提供更广任务、计算代价或量化收益,因此还不能据此判断 PDM 是否应成为所有 OPD 场景的默认方案。