交互式世界模型的难点,不只是生成画面,还要持续响应用户动作,记住此前展示过的地点,并以足够低的延迟实时输出。ReWorld试图处理其中的结构性矛盾:控制依赖短期上下文,记忆却需要覆盖很长的历史。论文的核心思路,是把两类能力在训练阶段分开组织,在推理阶段用固定预算重新组合。

用混合注意力分配记忆

ReWorld采用混合的按头注意力窗口。大多数注意力头只看最近历史,以服务动作控制;少数全局头则访问完整历史,以保留长期信息。训练时加入随机头路由,避免模型把某一种能力固定绑定到特定注意力头;随机丢弃历史片段,则让模型在训练中见到稀疏历史,适应推理时不完整的上下文。

推理阶段,完整过去不会无限堆入上下文,而是受到固定预算约束。系统使用有界KV缓存,并配合按位姿索引的地标库;模型根据当前位姿,检索距离最近的地标,再将相关信息带回当前生成过程。这个设计把“记住所有视频帧”转化为“按空间位置检索曾经见过的内容”,更贴近交互世界中的访问方式。

从数据尺度到实时生成

论文还构建了一个度量尺度对齐的数据引擎,将八类来源放到同一物理动作尺度上,包括虚幻引擎渲染的飞行穿越、游戏中的漫游以及真实世界视频。这样,同一个按键在不同数据源中对应相近的镜头移动距离。回文轨迹则提供了往返路径,为训练模型识别“再次回到某处”所需的证据。

在生成效率上,ReWorld通过限制在LoRA适配器中的分布匹配蒸馏,把采样压缩到四步。同一个骨干模型同时支持高保真多步模式和实时交互模式,并能以704×1280分辨率流式生成视频,覆盖写实、游戏风格和风格化世界。评测协议包含动作跟随、长期回忆和视频质量三个维度,材料显示其与六个近期交互式世界模型进行了比较;但摘要末尾关于排名的结论不完整,不能据此补充更具体的胜负判断。

我的判断

ReWorld的价值在于把世界模型的长期记忆落到了可操作的系统机制上:注意力窗口负责近期控制,地标库负责跨时间检索,固定预算则明确了推理成本边界。度量尺度对齐和回文轨迹也说明,交互训练不仅需要更多视频,还需要动作、空间和重访关系的一致性。

它的适用边界同样清楚。位姿索引要求系统具备可用的空间状态表达,地标检索也不等于无损保存全部历史;在更复杂的环境变化或超出训练来源的交互中,记忆是否稳定仍需更多证据。四步采样改善了实时性,但材料没有给出延迟、吞吐或记忆容量的具体数值,因此目前更适合把它看作一种完整的架构方案,而不是已经充分验证的通用世界模型答案。