交互式世界模型要同时记住长期历史、快速响应,并持续生成连贯内容。Evoke的核心判断是:不要让全部历史挤进去噪器上下文,也不要把少步学生的能力上限交给一个只擅长短片段的固定教师。
外置世界状态,限制上下文规模
Evoke把场景几何写入按相机索引的外部世界状态库,生成当前视角时只检索相关信息。这样,持久状态不再完全依赖去噪器上下文或键值缓存;随着会话延长,模型仍可保留世界信息,同时让去噪器上下文保持有界。它解决的是“记忆放在哪里”,而非单纯扩大窗口。
教师也为长时监督重做
论文没有把教师视为固定生成器,而是用稀疏注意力组合三类机制:分块内分组、检索选定的远距离帧,以及维护全局状态的线性注意力。其内存与计算量随序列长度线性增长,因此可覆盖更长的监督范围。长时监督还能暴露短窗口内看似合理、累积后却明显的内容漂移;逐块条件则允许中途更换提示词并控制事件。
三步学生承接长时能力
训练采用30秒的分布匹配目标,并在自强制展开下进行,将上述能力迁移到三步学生。学生不使用无分类器引导。摘要报告其长期漂移抵抗力有所改善,但材料未提供具体指标、基线差值或更长时段结果。
我的判断
Evoke的价值在于把两个常被混在一起的问题拆开:外部状态库负责持久记忆,可扩展教师负责长时监督,再用少步学生面向交互。这个架构适合相机视角明确、场景几何可维护的交互视频或世界模拟。边界也很清楚:现有材料只说明30秒目标和线性增长性质,无法判断“无尽世界”在数分钟乃至更长会话中的稳定性;外部状态检索的准确率、更新冲突和系统开销也未披露,因此它更像有方向性的架构方案,而非已被充分量化的长期运行结论。