语音大模型的音频编码器往往包含较深的网络层数,直接删除完整模块虽然能够降低推理成本,却可能改变解码器接收的表示,进一步引发文本删除或过早结束。论文提出 X-AuT,尝试把音频编码器压缩从一次性裁剪变成渐进式恢复过程,并在多个中英文语音识别基准上验证了这一思路。

从行为探测到渐进式剪枝

X-AuT首先通过较短的行为探测,选择合适的层组合,而不是直接决定最终保留哪些层。随后,框架使用表示对齐、跨尺度知识蒸馏、按计划进行的学生策略监督,以及 LoRA 微调来恢复剪枝模型的能力。蒸馏阶段冻结语言模型骨干,仅让注意力层中的 LoRA 适配器和绑定的输出嵌入参与适应。

训练数据先经过转录一致性流程,选取一致性最高的一档,微调阶段再进行数据源重加权。这样的设计把压缩重点放在音频塔,同时尽量维持语言模型部分的稳定性。

实验结果:渐进方案优于直接裁剪

在十个公开中英文基准上,Qwen3-ASR-0.6B 的音频编码器从 18 层压缩到 16 层后,宏平均错误率由 5.61% 降至 5.27%;压缩到 14 层时,错误率为 5.75%,音频塔参数减少 20.7%。这说明减少层数并不必然带来准确率下降,但不同任务上的影响并不一致。

在相同训练配方下,1.7B 教师模型的平均错误率为 5.55%,自蒸馏为 8.45%;从 18 层渐进压缩到 14 层的错误率为 5.75%,优于直接剪枝的 6.73%。论文将这些结果视为两个可操作的压缩档位,但同时强调它们来自单次运行。

我的判断

X-AuT的价值在于提供了一套面向语音大模型音频塔的压缩流程:先观察层组合的行为,再用蒸馏和轻量适配恢复表示,适合关注推理成本、又不希望重训完整模型的场景。它的边界也很明确:当前材料只覆盖十个公开中英文基准,结果为单次运行,且各基准的准确率变化并不完全一致。因此,14层或16层配置更像是值得进一步测试的工程工作点,而不是普遍适用的最优答案。