这项工作把语言模型中的“长期记忆”从底座参数中拆出,作为可以独立预训练和扩展的参数化模块。它关注的不是单纯把模型做大,而是同样的参数预算究竟应该分给推理底座,还是分给记忆容量;论文报告的结果明显支持后者。

从小规模方案扩展到 6.9B

Decoder-only 模型通常把长期记忆与推理能力混在同一套参数中,因此很难单独增加记忆容量。此前的 Memory Decoder 已引入参数化长期记忆,但只在较小规模上研究。新工作将记忆模型扩展至 6.9B 参数,并使用 300B token 进行预训练,使记忆模块能够与不同规模的底座组合。

在 17 项基准测试上,Pythia-410M 搭配 6.9B 通用记忆后,平均分从 29.86 提升至 37.34,略高于 Pythia-12B 的 37.24,同时总参数量少 39%。这组结果的重点不是绝对分差,而是较小底座加独立记忆,在参数—性能权衡上达到大型底座的水平。

数据规模带来的检索工程问题

当预训练数据达到 300B token 时,标准 Faiss 流程的索引与搜索综合成本变得不可行。研究采用分布式 Faiss 索引和检索管线,并以稀疏、按批次的方式加载 kNN 分布,以缓解这一瓶颈。这说明参数化记忆的规模化不仅是模型设计问题,也依赖索引、检索和训练数据加载系统的协同。

在 0.6B 至 14B 的 Qwen3 Base 模型上,加入 1.7B 领域记忆后,三个领域的平均分在每个底座规模上都提升超过 9 分。结果表明,收益并不只出现在 Pythia 组合中;但摘要没有给出三个领域及具体任务,覆盖面仍需结合完整实验判断。

我的判断

这项工作的价值,是为大模型扩展提供了“增加记忆参数”这一条独立于放大底座的路径,并用跨模型规模的结果证明其参数效率。边界也很明确:参数更少不等于训练或推理成本一定更低,摘要未提供延迟、吞吐、显存占用及索引维护成本。当前结论主要来自 Pythia、Qwen3 和基准平均分,能否推广到更多架构与实际应用仍需验证。