文本到图像扩散 Transformer 会在去噪时联合处理文本与图像词元,但语义究竟由哪些词元保存、又如何跨层流动,一直缺少因果层面的解释。这篇论文把注意力分解与定向干预结合起来,从词元区间、注意力头和网络层三个维度拆解生成过程。
模板词元如何接管语义
作者将文本分成提示内容词元与结构模板词元。编码器输出显示,结构模板词元携带的提示特定信息很少;进入 DiT 后,它们却成为图像到文本注意力的主要汇点,并在因果意义上维持对象身份。也就是说,输入时承载语义的词元,不一定是生成过程中持续保存语义的词元。
更关键的是,身份信息并非直接从提示词元传给模板词元。论文给出的路径是:提示语义先注入图像潜变量,再由模板词元从潜变量中读回。结构模板因此逐步变成隐式的“语义寄存器”,其作用来自去噪过程中的动态写入,而不是编码器阶段已经包含丰富语义。
从机制解释到免训练剪枝
基于上述观察,作者提出了一条无需训练的 DiT 剪枝规则:最强关注提示词元的注意力头反而可以被移除。该方法削减了 20% 的注意力 FLOPs,GenEval 分数下降 1.4 分。这里削减的是注意力计算量,不能直接等同于端到端推理成本下降 20%。
论文还将不同注意力头和深度上的计算分为语义路由与视觉合成,并描述了从身份形成、传播到细化的阶段性过程。这说明 DiT 内部并非所有头都以相同方式使用文本条件,高注意力权重也不必然意味着更强的因果贡献。
我的判断
这项工作的价值,在于把注意力相关性推进到可干预的因果分析,并给出了可直接用于剪枝的工程线索。“模板词元是语义寄存器”也为理解条件生成提供了更具体的中间机制。不过,现有材料没有说明覆盖了哪些模型、提示模板和图像分布,也缺少剪枝后的完整质量与速度结果。1.4 分的 GenEval 降幅是否可接受,仍取决于应用;该结论能否推广到不同 DiT 架构,也需要更多验证。