DreamX-Phi 1.0 面向机器人操作中的未来视频预测:输入当前观测帧、语言指令,以及由末端执行器位姿和夹爪状态构成的预定动作序列,模型生成后续观测。它关注的核心并非单纯提升画面真实感,而是避免视频看起来合理,实际却让错误的机械臂运动,或在抓取过程中丢失被操作对象。
用几何编码绑定机械臂与动作
为了让预测遵循每条机械臂的指定轨迹,DreamX-Phi 将每条机械臂的 SE(3) 变换通过 PRoPE 风格的几何编码注入注意力机制。其目的有两个:保留不同机械臂的身份,避免动作归属混淆;同时显式表达刚体运动结构,使模型不只依赖视频外观去猜测运动。对于双臂或多执行器操作,这类约束比笼统地加入动作向量更有针对性。
深度与对象监督补足动作条件
作者认为,动作控制本身仍不足以确定场景几何,也难以保证小物体在抓取、移动过程中的连续性。因此,模型加入轻量级深度分支,提供场景级几何信息;同时使用 SAM3 掩码,并引入冻结的 V-JEPA 教师,在抓取全过程中维持对象一致性。为降低生成成本,团队还通过分布匹配蒸馏,将多步生成器压缩为少步学生模型。论文称,该模型在 WorldArena 2.0 Challenge 的 Track 1 排名第一、Track 2 排名第二,并计划公开模型与代码。
我的判断
这项工作的价值在于把机器人视频世界模型的评价重点,从“生成得像不像”推进到“是否忠实执行动作、是否保住对象”。几何编码、深度分支和对象监督分别对应机械臂轨迹、场景结构与小物体连续性,设计逻辑清楚。它更适合需要按给定动作序列预测结果的机器人操作场景,但摘要没有提供具体指标、推理速度、真实机器人验证范围或失败案例;挑战赛名次也不能直接等同于开放环境中的稳定部署能力。少步蒸馏带来多大效率收益及是否损失动作忠实度,仍需等待完整实验与公开代码验证。