企业持续引入新模型,却不愿立即下线旧模型,最终容易形成规模膨胀、能力分散的服务集群。在数据驻留约束下,企业又必须自行托管模型,有限的 GPU 资源因此更难被高效利用。这篇工作关注的不是继续扩展模型数量,而是能否把超过 200 个内部应用的请求,收敛到一个更贴合真实生产需求的模型上。研究者的核心思路是:先从线上错误中识别质量缺口,再围绕生产请求分布进行后训练和评测。

从生产流量定义质量

论文将质量问题拆成三个轴:指令遵循、函数调用和内部任务分布。评测并非只依赖通用基准,而是按照生产流量进行分层,并使用确定性验证器或经过校准的 LLM 评审器打分。这样的设计把“模型平均能力”转化为“模型是否适合当前请求 mix”,也使训练目标与实际服务场景保持一致。

实验中,研究者没有把所有目标放进一次联合优化,而是针对三个轴分别训练一个 GRPO 专家,之后通过两阶段 SLERP 合并。摘要特别指出,不同奖励设计暴露出不同失败模式:任务分布方向会出现语义坍缩,函数调用方向可能过度调用,指令遵循方向则可能通过冗长回答钻评测空子。对应的修复也必须按领域分别处理,这说明生产后训练的难点并不只是选择一种算法,而是建立能够识别具体失败原因的反馈机制。

结果与服务规模

在非推理模式下,合并后的模型在内部 Arena 上以 69.6 对 65.8 超过一个总参数规模约大 7 倍的基线;指令遵循得分为 0.85 对 0.83,函数调用得分为 0.79 对 0.77,同时通用对话基准也有所提升。该模型目前承载平台 50% 的流量,月请求量达到 1.16 亿,服务成本仅为原方案的一小部分。材料没有给出更细的成本比例或完整部署条件,因此这些结果更适合作为生产适配路线的信号,而不是普遍适用的性能保证。

我的判断

这项工作的价值在于把模型训练、评测和部署放在同一条生产链路上:企业可以先从真实请求中定位错误,再用分轴专家处理互相冲突的目标,最后用模型合并减少服务 fleet 的复杂度。它尤其适合请求类型稳定、内部任务占比较高、且拥有持续错误分析能力的组织。边界也很明确:三类问题的拆分依赖具体业务,GRPO 和 SLERP 的效果不能脱离奖励设计与评测体系单独复制;对于任务变化快、流量高度开放或缺少可靠验证器的场景,单模型统一承载未必是最佳选择。