从一段普通的、未经相机标定的单目视频出发,能否恢复出可用于4D重建的人物场景?4DAnyone给出的路径是:先生成重建级别、跨视角一致的视频,再将这些视频提升为4D Gaussian Splatting(4DGS)。它关注的不是单个新视角是否看起来合理,而是大量目标视角能否共同支持稳定的4D重建。

问题在哪里

现有相机控制视频扩散模型可以合成 plausible 的新视角视频,但当目标视角扩展到4DGS所需的数十个视角时,一致性会明显成为瓶颈。论文将原因归结为有限注意力上下文:单次 DiT 前向计算无法容纳所有目标视角,因此必须把视角拆成多个组处理。

拆分后有两个相互关联的问题。第一,参考上下文会不断增长。模型需要使用此前生成的视角来指导后续生成,参考视角数量增加后,上下文复杂度按 O(N) 增长,跨视角的外观约束会变弱。第二,不同目标视角组之间无法直接交换信息,生成过程可能逐步出现全局结构漂移,局部细节看似合理,但人物整体形状和跨视角关系不再稳定。

两个上下文设计

4DAnyone分别用 Reference Context Packing(RCP)和 Target Context Routing(TCR)应对这两个问题。RCP将不断增加的参考视角压缩成固定长度的混合分辨率上下文,把参考上下文的复杂度控制在 O(1),从而保留更稳定的跨视角外观指导。

TCR则在去噪过程中轮换目标视角的分组方式,让不同组在高噪声阶段共享上下文,以促进全局结构协调;进入低噪声阶段后,再通过稳定细节的分组方式减少局部生成波动。两者分别处理参考视角膨胀和目标视角组隔离,构成了面向多视角扩展的配套机制。

训练数据方面,作者构建了基于自研游戏引擎的 MVGameHuman 数据集,并将其与 light-stage 数据集及野外视频数据集结合使用。摘要还报告称,4DAnyone在 DNA-Rendering 和 DyMVHumans 上优于既有方法,但给定材料没有提供具体评测指标、数值或提升幅度。

我的判断

这项工作的价值在于抓住了单目视频到4D重建中的一个具体工程约束:生成视角一多,问题就从“能不能生成”转向“能不能在有限上下文中维持一致”。RCP和TCR的设计也比较直接,分别对应参考信息增长和目标分组隔离两个瓶颈。

不过,材料尚不足以判断它在不同人物动作、遮挡、镜头运动或真实复杂场景中的稳定程度,也无法据此比较具体的重建质量。它更适合被看作一套面向多视角一致视频生成与4DGS提升的框架,而不是已经解决所有单目4D重建问题的通用方案。