视觉 Transformer 的训练后量化通常采用统一位宽,但不同组件对量化误差的敏感程度并不相同。MixFrag试图解决的核心问题不是设计新的量化算子,而是在给定精度预算下,把更高位宽留给更脆弱的组件,减少不必要的精度消耗。

用输出分布衡量量化脆弱度

MixFrag先使用一小组校准数据,分别观察全精度模型与单个组件被隔离量化后的输出分布,并用KL散度衡量两者差异。差异越大,意味着该组件在当前量化设置下越脆弱,更可能需要较高位宽。

这种做法把混合精度选择建立在组件级响应上,而不是默认所有 Transformer 层具有相同敏感性。论文还给出了额外分析,表明这一脆弱度指标与最终学习到的位宽分配具有较强相关性。不过,摘要没有披露校准集规模、候选位宽范围以及脆弱度估计的额外计算成本,因此尚不能判断它在不同部署流程中的具体开销。

把位宽分配变成多选背包问题

获得脆弱度后,MixFrag将位宽分配形式化为多选背包问题,在目标比特预算约束下,为不同层自适应选择精度。这个建模方式的价值在于,它明确处理了模型容量预算与量化损失之间的权衡,而不是依赖统一位宽或手工制定逐层规则。

论文在ImageNet-1K上的多种视觉 Transformer 架构中报告了有竞争力的分类表现;在COCO目标检测和实例分割任务上,MixFrag在现有混合精度PTQ方法中达到领先结果。尤其在较具挑战性的MP3/MP3设置下,相比此前最佳方法最高提升9.6 AP。摘要没有给出各模型的完整精度、延迟、吞吐量和硬件结果,因此这些收益目前主要应理解为任务指标上的改进。

我的判断

MixFrag的思路清晰:先用可计算的分布差异近似组件敏感性,再用组合优化完成预算分配。它适合已有ViT模型、缺少重新训练条件,但允许少量校准数据和离线搜索的部署场景。9.6 AP的最高提升值得关注,但这是特定MP3/MP3设置下的上限结果,不能直接外推到所有模型和位宽预算。是否真正改善端侧效率,还需要结合量化内核、硬件对混合位宽的支持,以及实际延迟和能耗数据判断。