Kimi K3 的重点不只是参数规模,而是把模型架构、MoE 训练、长上下文强化学习与部署放在同一套系统中推进。模型总参数量为 2.8 万亿,每次激活 1040 亿参数,原生支持视觉,并提供 100 万 token 上下文窗口。团队将其定位为开放权重的前沿模型,同时承认整体表现仍落后于 Claude Fable 5 和 GPT-5.6 Sol。
架构与扩展效率
Kimi K3 建立在 Kimi Delta Attention 与 Attention Residuals 之上,目标分别涉及跨序列长度和跨模型深度的信息流改善。其 Stable LatentMoE 每个 token 从 896 个路由专家中激活 16 个,配合调整后的训练与数据方案,论文称整体扩展效率相较 Kimi K2 提升约 2.5 倍。这里的“整体扩展效率”在摘要中没有给出更细的计算口径,因此更适合视为作者的综合结论,而非可直接换算成训练成本或推理速度的指标。
从训练到长程智能体
后训练覆盖通用、智能体和代码领域的强化学习,并设置多档推理投入水平,目标是提升组合泛化和长程执行稳定性。支撑 2.8 万亿参数规模的基础设施包括 KDA 的算法—系统协同设计、保持专家负载完全均衡的并行训练与内存管理,以及保留 rollout 和沙箱状态的百万 token 智能体强化学习。论文报告其在长程编码、智能体、知识、推理和视觉任务上达到前沿水平,并在作者评测集合中持续超过其余被测开放及闭源模型;但摘要没有列出具体基准、分数和成本数据。
我的判断
Kimi K3 的主要价值,是证明开放权重模型仍能通过架构与系统工程协同逼近闭源前沿,而不只是继续堆叠参数。百万上下文、原生视觉和长程智能体训练的组合,对代码智能体及复杂工作流尤其值得关注。不过,1040 亿激活参数仍意味着很高的工程门槛,现有材料不足以判断实际推理成本、延迟和部署条件。完整权重的发布有利于后续研究,但摘要只确认了权重开放,不能据此推断训练数据、代码或其他资产同样开放。