万亿参数级 MoE 模型的全参数后训练,不只是增加设备数量:显存压力、无法重叠的通信开销和低效算子执行会相互放大。SLAI T-Rex 面向昇腾 NPU SuperPOD,以 DeepSeek-V4 家族为工作负载,给出从训练系统到运筹任务后训练的端到端实践。

三层优化提升训练利用率

报告将优化划分为三个层次:模型级并行策略、计算与通信编排,以及底层 kernel 执行。这个划分对应了大规模 MoE 训练的主要系统矛盾,即参数和状态如何分布、通信能否与计算协调,以及单个算子是否充分利用硬件。

在这套框架下,系统达到 34.22% 的 Model FLOPs Utilization(MFU),相对开源基线方案取得 2.93 倍提升,同时维持训练稳定性。摘要没有披露具体集群规模、并行配置、基线版本和稳定性指标,因此这些数字更适合视为该软硬件组合下的工程结果,不能直接外推到其他集群。

从训练基础设施延伸到运筹任务

优化后的基础设施被用于构建复杂运筹任务的持续预训练(CPT)与监督微调(SFT)流程。团队以 DeepSeek-V4-Flash 为基础,将收集的领域资源与经过求解器验证的合成优化文档结合,形成 1 万条高质量 SFT 样本,覆盖四类任务和三种问题表示。

专项模型在参评模型中取得最高的平均零样本 Pass@1,为 71.81%;报告称其分别领先 GPT-5.4-Mini 和基础版 DeepSeek-V4-Flash 3.98、11.27 个百分点。不过摘要未说明各任务占比、评测集规模及求解器验证流程,暂时难以判断提升来自数据覆盖、表示形式还是训练方法。

我的判断

这项工作的主要价值,是展示万亿参数 MoE 全参后训练在非 GPU 集群上的完整优化路径,并把系统吞吐改进落实到垂直任务数据与模型效果,而不只是报告峰值性能。其适用边界也很明确:MFU 不等于训练成本或扩展效率,运筹评测结果也不能代表通用能力。缺少硬件配置、基线细节和分项消融时,更稳妥的结论是这是一份有参考价值的昇腾工程实践,而非可直接复制的通用配方。