Qwen3.8-Flash-Next试图回答一个具体问题:稀疏模型能否在显著减少计算量后,仍维持与更大前代模型接近的能力。它包含125B参数,每个token激活6B参数,另有51B参数用于放在加速器之外的n-gram嵌入表。论文关注的不只是精度,还把训练、预填充、解码成本以及超参数稳定性纳入架构选择。
用混合机制压低主干成本
模型按层混合Gated DeltaNet与全局注意力,每四层安排一层完整注意力。进入持续预训练后,完整注意力又被Qwen Sparse Attention替换:它通过轻量压缩索引器,以微块粒度为上下文评分。残差流则扩展为四个分支,并通过逐元素门控读取,形成Gated Residual。两项设计分别作用于token混合和信息传递,目标是在控制计算成本的同时保留长上下文建模所需的全局通路。
容量扩展没有全部压到模型主干中。单层n-gram嵌入表存放于主机内存,并在使用前预取。消融结果显示,扩大n-gram词表会持续降低损失,但下游准确率会趋于饱和。这说明预训练损失改善不能直接等同于任务能力提升,也给外置容量的规模选择划出了实际边界。
效率数字与评估方法
在14项预训练基准上,该模型有8项超过397B-A17B前代,其余项目最多落后2.6分;对应代价约为前代三分之一的激活参数、三分之一的训练token和九分之一的训练FLOPs。论文对候选改动同时检查损失与下游基准、训练及推理成本,以及最优超参数和训练稳定性的变化。架构与Muon优化器还会改变适宜的学习率和批量大小,因此旧配方不能被默认直接复用。
我的判断
这项工作的价值不在单个新模块,而在于把能力、系统成本和训练稳定性作为共同约束,并用消融揭示损失与下游表现可能脱钩。它对受训练预算、显存容量和推理吞吐约束的大模型设计具有参考意义。不过,材料只给出了预训练基准的汇总结果,尚不足以判断其在具体下游任务、长上下文质量和真实部署中的收益;主机内存预取n-gram表的效果也会受硬件与带宽条件影响。