循环Transformer一直有一笔不划算的账:当预训练算力增加N倍时,与其让同一个模型循环N次,直接把参数量扩大N倍通常效果更好。Loopie试图改变这一经验结论。论文作者称,它在相同计算预算下显著超过标准Transformer基线,并通过后训练获得较强的推理能力。

用MoE扩大总容量,控制活跃参数

Loopie系列包含两个混合专家模型:较大版本拥有200亿总参数、每次激活20亿参数;较小版本拥有60亿总参数、每次激活6亿参数。这样的设计把总容量与单次计算涉及的参数量拆开,再与循环计算结合,目标是在固定预算内提高模型能力。

论文进行了广泛的消融实验,并纳入一个标记为30B-A3B的标准模型作为对照。摘要给出的核心结论是,Loopie在相同计算预算下显著优于标准Transformer基线。不过,材料没有提供具体任务、分数、循环次数及训练规模,因此目前无法判断优势有多大,也不能确认这一结果能否跨数据集、模型规模稳定成立。

后训练带来竞赛级推理表现

作者还设计了一套新的后训练流程,并将Loopie的强推理能力归因于这一步。摘要称,模型在2025年国际数学奥林匹克竞赛和国际物理奥林匹克竞赛题目上达到金牌水平,而且没有使用工具。这是醒目的结果,但材料未披露评测协议、题目范围、评分方式以及后训练流程细节,因此更适合视为论文报告的能力信号,而非已经充分复核的通用推理结论。

我的判断

Loopie的价值不只是又一个MoE模型,而是重新挑战“增加参数总比增加循环更有效”的架构判断。如果完整实验能够证明同算力优势稳定存在,循环Transformer会多出一条值得研究的扩展路径。但现有材料不足以判断它的训练效率、推理延迟、显存需求和部署成本;活跃参数较少,也不等于整体系统天然轻量。现阶段更应关注消融是否真正分离了循环、MoE与后训练的贡献,而不是仅凭竞赛成绩断言循环架构已经全面胜出。