ABot-World-0 是一个动作条件视频世界模型,目标不是生成一段预先确定的视频,而是根据用户持续输入的键盘动作,实时推进可交互世界。论文将数据、训练和部署放在同一套系统中设计,重点处理长时间自回归生成中的漂移,以及桌面级单卡推理的速度和显存约束。
从多源数据到长程闭环
其数据基础设施覆盖 AAA 游戏、仿真引擎和互联网视频。WorldExplorer 根据训练反馈驱动智能体采集数据;统一处理管线包含 14 项确定性质量检查、基于 VLM 的评估,以及同步的动作与文本标注。原始键盘输入被用作统一控制接口,既支持场景漫游,也支持第三人称角色交互。针对角色在长时间生成中可能发生的外观变化,系统还加入参考角色记忆,为身份一致性提供持续线索。
训练上,团队先构建双向动作条件教师模型,再通过 teacher forcing 和 ODE distillation,逐步蒸馏为可因果生成的学生模型。LongForcing 则让学生模型的长程自展开结果与扩展时间范围的教师模型对齐,意图缓解误差累积带来的分布偏移和自回归漂移。
单张桌面 GPU 的流式推理
部署侧采用轻量 VAE 解码器、高效注意力、显存感知调度和低比特 DiT 推理。论文报告,在优化后的低比特配置下,系统可在单张 NVIDIA RTX 5090 上以最高 16 FPS 流式生成 720P 视频,动作到首帧延迟为 1.2 秒,峰值显存约 19GiB。作者还在 WorldRoamBench 和扩展交互 rollout 上评估了模型,并报告其具备有竞争力的可控性。
我的判断
这项工作的价值在于系统协同:它没有只优化生成质量,而是同时处理动作数据、长程训练和单卡部署,使世界模型更接近可操作的实时应用原型。边界也很明确:16 FPS 与 1.2 秒首帧延迟仍不同于传统游戏引擎的即时反馈,而且结果依赖 RTX 5090 与特定低比特优化。摘要没有提供与其他模型的完整量化对比,也不足以判断其跨场景泛化、物理一致性和无限 rollout 的实际稳定上限,因此“无限”更适合被理解为系统目标,而非已经被严格证明的能力。