测试时训练(TTT)把序列建模视为在线学习:模型处理序列时,快速权重会按照内部学习规则持续更新。问题在于,现有 TTT 方案通常为每种变体单独编写实现,组件之间紧密耦合,既不利于组合新方法,也很难判断性能变化究竟来自哪一项设计。

把内层学习器拆成可组合图

Modular TTT 将内层学习器表示为有向无环图,并把快速权重网络、损失函数、学习率、权重衰减和归一化显式暴露为设计维度。框架从原语级别的训练视图前向、训练视图反向以及因果查询视图规则出发,自动组合出完整的图级 TTT 计算,同时处理快速权重的状态转移。

这项工作的重点不是再增加一种固定结构,而是提供统一表达方式。研究者可以在同一框架内替换局部组件,减少为每个变体重新硬编码的需要,也能更直接地进行受控消融。

哪些设计有效,哪些可能适得其反

系统消融显示,较小的学习率初始化、权重衰减和单层非线性能够改善性能;MSE 损失与内积损失的表现相近。相比之下,更深的快速权重网络和归一化往往会损害性能,论文将其归因于过大的激活值。残差连接与门控则没有带来明显的可测收益。

基于这些观察,作者选出表现最好的变体,训练了 4.1 亿和 14.5 亿参数模型,训练数据规模为 1000 亿 token。论文报告称,其训练损失和基准表现与 Gated DeltaNet 相当。不过摘要没有提供具体基准、分项成绩或资源开销,因此不能据此判断它在所有任务上的优势。

我的判断

Modular TTT 的主要价值是把架构探索变成可组合、可归因的工程过程,而不是宣称某个新组件全面领先。它对研究 TTT 变体、验证内部学习规则尤其有用,也给出了若干值得优先采用或谨慎使用的设计信号。边界同样明确:目前结论来自该框架下的消融与两种模型规模,且只报告与 Gated DeltaNet 相当;泛化到更多规模、任务和训练配置,仍需更完整的实验支持。