Motif 3 是一个仅解码器的混合专家语言模型,总参数量为 3140 亿,但每个词元只激活 132 亿参数。技术报告的重点不是单纯扩大规模,而是通过更细粒度的专家路由、压缩注意力表示和低精度训练技术,在模型容量、单次计算量与长上下文训练之间寻找平衡。
384 个专家,每次选择 8 个
每个稀疏 MoE 层包含 384 个可路由专家,每个词元选择其中 8 个。与总参数全部参与计算的稠密模型相比,这种设计让模型保留较大的专家容量,同时限制每个词元实际使用的参数量。报告还加入专家负载均衡与数值稳定技术,以支持大规模训练。
注意力部分采用 Grouped Differential Latent Attention,也就是 GDLA。它把分组差分注意力与 Multi-head Latent Attention 的压缩键值表示结合起来。架构还包含经过修改的流形约束超连接、专家专属 PolyNorm 激活函数和多词元预测,目标分别涉及优化稳定性、专家分工与推理效率。不过,摘要没有提供这些组件的独立消融结果,暂时无法判断各自贡献。
12.5 万亿词元与多教师后训练
Motif 3 使用约 12.5 万亿词元预训练,数据覆盖网页文档、STEM、代码、数学、多语言内容和专业领域语料。训练侧使用选择性的 MXFP8 计算与通信、节省内存的融合算子,以及窗口感知的上下文并行,支持最长 256K 词元的训练上下文。
后训练流程组合了通用监督微调、六个通过强化学习训练的专项教师、一个通过监督微调训练的软件工程教师,以及多教师在线策略蒸馏。其思路是先让教师模型形成专项能力,再将这些能力整合进一个统一模型,而不是在推理时长期维护多个独立专家模型。
我的判断
Motif 3 的价值主要在系统工程整合:高专家数量、较低激活参数、压缩键值表示、低精度训练和多教师蒸馏被放进同一条训练链路。它对研究超大规模 MoE 和长上下文训练具有参考意义。但当前材料没有给出基准测试、消融实验、训练成本或实际推理吞吐,因此不能据此判断它是否优于同规模模型。其复杂架构也意味着复现门槛可能较高,更适合作为大规模训练方案参考,而非可直接迁移到普通团队的通用配方。