智能体搜索需要在多步推理与信息检索之间反复切换,但只按最终答案进行强化学习,监督信号通常过于稀疏。专有模型可以充当能力更强的教师,却不会开放 logits,且师生模型往往使用不同的分词器。直接模仿自然语言轨迹又容易学到表达风格,而不是搜索与推理能力。MAPD 试图用结构化中间协议绕开这些障碍。

用协议代替原始轨迹

MAPD 的核心不是让学生逐字复现教师回答,而是先由离线多智能体系统处理查询。该系统会拆解问题、检索支持证据、修复失败的搜索,再把完整探索过程转换成 JSON 协议。协议包含任务类型、推理计划和可抽取的事实依据,并进行风格归一化,从而减少教师措辞、格式习惯等表层特征对训练的干扰。

这种设计针对的是异构蒸馏:当教师接口只返回文本、师生分词体系也不一致时,传统的 logit matching 无法直接使用。结构化协议不要求双方共享词表,也比未经处理的思维或搜索轨迹更强调任务结构与证据。

稠密蒸馏与稀疏奖励并行

训练阶段,协议只提供给学生策略中的特权分支。该分支产生的 token 分布构成稠密蒸馏信号,并与基于最终结果的稀疏强化学习目标联合使用。这样,模型既能从协议获得更连续的过程指导,也仍然受到任务成败信号约束。论文摘要称,MAPD 在七个问答基准上持续优于有竞争力的蒸馏方案,但现有材料没有给出具体提升幅度、模型规模、训练成本及各基准结果,因而不宜进一步推断收益大小。

我的判断

MAPD 最有价值的地方,是把“向封闭模型蒸馏”从不可获得的内部概率,转成可检查、可标准化的任务协议。它尤其适合需要搜索、证据 grounding 和失败修复的知识密集型智能体。不过,协议质量依赖离线多智能体系统的分解与检索能力;结构化压缩也可能遗漏难以显式表达的推理信息。此外,离线生成协议会引入额外流程与成本。七项问答评测说明方法具有一定通用性,但在更开放的长期任务、不同检索环境及成本受限场景中的效果,仍需完整实验验证。