音频语言模型通常擅长听懂“说了什么”,却可能忽略情绪、音高和说话方式等细粒度声学信息。IAAN 提出一种无需训练、无需标签的推理时干预方法,直接在音频编码器内部寻找并放大与声学信息相关的前馈神经元。
如何找到声学神经元
方法把真实波形的激活与缺少原始声学信息的噪声参考进行对比,为每个编码器前馈神经元计算分数。推理时只放大得分最高的一小组神经元,而不改动全部表示,也不重新训练模型。
论文在十种非语义语音属性上测试,报告平均准确率在 Audio-Flamingo-3、Qwen2.5-Omni 和 Kimi-Audio 上分别提高 25.7、21.4 和 9.7 个百分点。控制实验显示,干预位置和神经元选择都很关键:把干预放到编码器之后、解码端或语言模型内部,收益很小甚至会退化。
对开发者的影响
这说明多模态模型的能力缺口未必都要靠微调解决。有权访问模型内部激活时,可以先定位信息在哪一层被弱化,再做小范围推理时控制。它尤其适合标签稀缺、但声学属性对任务重要的研究场景。
代价是该方法不适用于只开放 API 的模型,而且放大系数、音频域和任务变化都可能影响稳定性。上线前还需检查内容识别、噪声鲁棒性和其他属性是否被牺牲。
我的判断
IAAN 的亮点是把问题定位到编码器的信息选择,而不是一味增强语言端推理。论文结果很强,但仍是作者在指定模型和十类属性上的报告;跨语言、真实噪声和流式语音是否保持收益,需要独立复现。