这项发表于 Hugging Face Daily Papers 2026 年 8 月 14 日的工作,尝试改变 Transformer 中知识存储与推理操作相互交织的方式。作者提出 Mobius-v0,并分别通过从零训练的 7B 模型和持续预训练模型,考察这种解耦设计对训练数据利用率与推理速度的影响。
用共享记忆承载知识
Mobius-v0 将模型拆成一个全局共享的 Memory 和多个 Reasoner。Memory 由前馈网络(FFN)构成,用于存储知识向量;Reasoner 则由自注意力模块构成,负责反复执行组合推理。隐藏状态同时充当缓存和信息载体:Reasoner 根据当前状态多次查询 Memory,取回所需知识向量,再把这些信息送回推理算子继续计算。
这一设计的核心不是简单增加外部知识库,而是在模型内部明确区分“知识放在哪里”和“如何使用知识”。全局共享的 Memory 面向知识压缩,多个 Reasoner 则通过迭代查询完成推理。作者将其概括为知识与推理分离,并认为这种结构能够改善知识压缩和推理效率。
两组实验对应两类效率
从零训练的 7B Mobius 模型,在下游得分与 7B Transformer 基线相近的情况下,只使用了基线 62.6% 的训练数据。这一结果主要支持其训练数据效率,但摘要没有提供具体任务、分项成绩或训练计算量,不能据此直接判断所有场景下的训练成本都按同样比例下降。
另一条路线是 Intern-S2-Mobius:它从 Qwen3.5-35B 持续预训练而来。在获得相近下游得分的同时,论文报告接近 4 倍的端到端推理加速。这里值得注意的是,材料没有披露硬件、批量大小、上下文长度和服务配置,因此该数字更适合作为特定实验设置下的结果,而不是通用部署承诺。
我的判断
Mobius 的价值在于把效率问题推进到基础架构层:不是只优化算子或推理引擎,而是重新安排知识存储与推理计算的关系。两组结果分别覆盖从零训练和持续预训练,也初步说明该思路并不局限于单一路径。
但目前材料只给出摘要级结果,缺少基准明细、质量差异、训练算力、显存占用及不同推理条件下的表现。相近下游得分也不等于能力完全等价。现阶段更稳妥的结论是:知识—推理解耦展示了较强的效率潜力,但能否稳定替代标准 Transformer,仍需更完整的评测和复现实验。