视频扩散 Transformer 需要处理很长的 token 序列,注意力因此成为主要推理瓶颈。Sol-Attn 试图改造的不是模型训练,而是稀疏注意力在推理时的选块过程:一边执行在线 softmax,一边决定哪些键值块值得计算,并复用已经得到的代理分数。
现有动态稀疏注意力卡在哪里
训练免费式动态稀疏注意力通常先用代理分数给块排序,再保留固定比例的高分块。这种方法预算明确,但无法按当前注意力分布调整计算量。另一种做法是持续选块,直到累计代理概率质量达到目标;预算虽然动态,却可能在不同计算单元间出现不均衡。
两类方法还有一个共同成本:需要计算并物化代理分数图,路由本身并不免费。与此同时,传统的“保留或丢弃”策略会完全移除未选中的块。当稀疏程度提高时,被丢弃的信息可能带来明显的精度损失,限制进一步压缩计算量。
把路由放进在线 softmax
Sol-Attn 的核心是即时块阈值判断。系统在在线 softmax 过程中,将块级代理分数与阈值比较,直接选择关键块,而不是预先生成完整代理图后再排序或累计。这让块预算能够随输入动态变化,同时仍可通过阈值进行控制。
论文还强调代理分数复用:同一份信号既服务于动态路由,也参与后续稀疏计算与近似校正,从而把多个阶段合并到一次在线 softmax 处理中。其目标是在减少路由开销的同时,缓解激进稀疏化造成的质量下降。不过,给定摘要没有披露近似校正的具体形式,也没有提供速度、显存占用或生成质量数据。
我的判断
Sol-Attn 的价值在于重新审视稀疏注意力的隐藏成本:如果选块需要额外构造代理图,理论上省下的注意力计算未必能完整转化为端到端收益。将判断嵌入在线 softmax,是更贴近实际执行路径的设计。
它更适合长序列视频生成这类注意力占主导、且允许块级近似的场景。适用边界则取决于阈值稳定性、校正质量以及具体实现能否高效执行动态预算。由于现有材料缺少实验结果,目前可以确认的是方法设计方向合理,但还不能据此判断其相对现有方案的实际加速幅度与画质代价。