长时视频世界模型的难点,不只是扩大模型规模,还在于如何把来源、时间尺度、相机几何和画面质量各不相同的视频数据,转化为稳定、可复现的训练信号。SolarWM提出了一套从数据准备到长时推理的开放基础,试图把数据工程、模型适配和训练配方放进同一套可重配置流程中。

先统一数据,再构建数据混合

SolarWM的数据引擎将10个数据集中的143万条标准化视频片段,转换为统一的数据契约。契约覆盖视觉观测、度量相机几何、字幕、质量元数据、筛选决策和数据来源等信息,并要求帧级对齐。这里的关键不只是“汇总更多数据”,而是把源数据处理与数据混合解耦:数据来源可以分别处理,混合策略则可以独立调整。

这对世界模型训练尤其重要。不同数据集在时间尺度、相机视角、视觉质量、运动模式和字幕风格上的差异,会直接影响监督信号。如果简单混合,或为每种模型单独实现一套处理逻辑,训练结果就很难稳定比较。SolarWM试图通过共享的数据接口,减少这些差异对实验复现的影响。

保留骨干差异的统一训练框架

在共享相机条件、训练和推理接口的前提下,研究者实例化了4个参数规模为50亿至330亿的模型,基础架构来自Wan2.2、LTX-2.5和MiniMax-H3。框架没有强行把不同视频生成器改造成同一种表示或目标,而是采用“骨干原生”的适配方式,保留各自的表示与训练目标。

训练配方分为三个阶段:双向适配、教师强制的自回归初始化,以及分布匹配蒸馏。最终得到的因果模型,可以在仅使用5秒序列训练的条件下,进行从数分钟到数小时的 rollout,并支持实时交互。材料没有进一步说明不同模型之间的效果差异,因此这里更适合把它看作一套统一实验基础,而不是单一模型的性能结论。

我的判断

SolarWM的价值在于把长时视频世界模型中最容易被低估的数据与工程问题显式化:统一契约、来源追踪、筛选记录和骨干适配,都是影响复现与比较的基础设施。它适合需要跨数据集、跨视频骨干开展实验的研究团队,也为后续调整数据混合和训练流程提供了较清晰的接口。

但现有材料不足以判断这套方法在具体任务上的质量提升,也没有给出四个模型的对比结果。所谓分钟到小时的实时交互,材料强调的是模型能力范围,尚未提供速度、硬件条件或交互质量指标。因此,SolarWM目前更值得关注的是开放、可重配置的系统设计;它能否成为通用的视频世界模型底座,还需要更多可复现实验来验证。