Transformer 的自回归解码会把每一步的内部计算压缩成 token,再进入下一步。T2MLR 试图绕过这条单一通道:它直接传递跨时间的中间层表示,让抽象推理状态能够在连续解码步骤之间保留,而不必把所有信息都显式写进输出 token。

用中层状态连接相邻解码步骤

T2MLR 会缓存前一个 token 位置的某个中间层表示,并将其直接融合到当前 token 位置的较早网络层。这样,当前步骤除了接收常规上下文,还能继续处理上一步留下的隐式状态。论文将其描述为一种基于 Transformer 的潜在推理架构,并称这条额外路径只带来较小的推理开销。

它与让整个模型反复循环的方案不同,重点是选择网络中部的一小段层建立时间递归。作者报告,在自然语言预训练和多跳推理微调中,T2MLR 持续优于数据量与参数量匹配的普通 Transformer 基线。

局部递归可能比全层递归更有效

一个值得关注的结果是,递归并非覆盖越多层越好。摘要称,只在局部中层模块中应用递归、覆盖范围低至网络的 20%,往往也能超过全层递归。这意味着潜在推理能力可能更依赖递归路径放置的位置,而不是简单增加循环深度。

T2MLR 也不要求从头预训练。研究者把递归路径加入一个已有的 1.7B 参数预训练 Transformer,并进行短暂微调后,数学推理表现获得明显改善。这为已有模型的结构改造提供了比重新预训练更现实的路线。

我的判断

这项工作的价值在于把“跨 token 保留计算状态”落到一个相对局部的结构改动上,也提示中间层可能是延续抽象计算的关键位置。它更适合需要多步推理、又无法承担全层循环成本的模型实验。

不过,现有材料没有给出具体评测集、提升幅度、训练成本及推理开销数字,也无法判断它对不同模型规模、长上下文任务和生成稳定性的影响。“20% 局部递归优于全层递归”目前应视为论文实验范围内的观察,尚不能直接推广为通用架构规律。