传统知识蒸馏通常需要更新小模型参数。这项研究换了一个方向:让更强的“构建者模型”在测试阶段设计推理脚手架,帮助较弱的目标模型更稳定地完成任务。目标模型本身不训练、不改参数,能力迁移发生在外部推理流程中。

测试时如何完成能力迁移

实验覆盖四个具有代表性的心智理论基准。每个构建者模型使用5%的数据作为验证集,经过多轮迭代调整脚手架,再将最终版本用于完整测试集。结果显示,目标模型的平均表现从0.49提升到0.91,接近翻倍。

这里的“脚手架”并不只是增加一段提示词,而是由强模型构造一套推理时执行机制。研究发现,提升主要来自三个方面:把不稳定的模型推理转移到确定性代码中;针对不同基准进行任务路由;严格约束最终答案格式。相较之下,要求目标模型进行更长推理或扩大采样范围,并不是收益的主要来源。

谁决定脚手架的质量

构建者模型投入的推理努力越多,脚手架质量呈单调提升。不同运行平台带来的影响相对有限,构建者模型自身能力更关键。与此同时,较弱的目标模型获得了最大的增益,这说明外部流程可以补偿一部分模型能力不足,而不必立即诉诸训练或参数升级。

我的判断

这项工作的价值,在于把“模型能力”进一步拆成参数能力与系统能力:弱模型未必需要学会全部推理过程,也可以通过代码、路由和输出约束获得更可靠的结果。对成本敏感、模型不能更新或需要固定部署的场景,这种方法值得关注。

但边界同样明显。实验只覆盖四个心智理论基准,而且脚手架使用了5%的数据进行验证和多轮优化,因此结果不能直接等同于通用能力迁移。其收益又明显依赖基准特定路由,迁移到开放任务后的稳定性尚无材料支持。更准确地说,这是一种有验证数据、任务边界较清晰时的系统优化方法,是训练时蒸馏的补充,而非替代。