当前不少视频生成器要么没有音频,要么在视频生成后单独合成声音。这种分阶段方案难以让视觉运动与声学事件相互建模。DreamX-Creator 1.0选择原生联合生成:以首帧和文本提示为条件,由一个7B生成器同时对音频流和视频流去噪,目标是直接获得时间同步的音画内容,并进一步输出2K分辨率视频。

音频与视频先分工、再协作

模型前半部分独立处理针对不同模态设计的音频流和视频流,后半部分再通过门控跨模态注意力进行耦合。其Gated Cross-Modal Attention为活跃的跨模态注意力头设置按 token、按 head 的输出门,从而调节各注意力头写入另一模态的信息。这个设计并非从网络入口就混合全部表示,而是先保留模态自身的处理空间,再在高层特征中建立联系。

训练侧同样围绕音画一致性组织。统一音视频数据系统负责构建和过滤时间连贯的片段、生成结构化多模态标注,并按能力划分数据池。渐进式联合训练包含两个音视频预训练阶段和高质量微调;随后,音视频强化学习使用模态感知的多模态反馈,把视频、音频和跨模态反馈分别路由至对应的数据流。

2K输出依赖单独的精炼管线

高分辨率并非完全由基础生成器一次完成。其自回归单步2K精炼管线先将双向、多步教师模型改造成自回归多步精炼器,再蒸馏为学生模型,使每个时间分块只需一次去噪评估。这里的“单步”主要描述精炼阶段每个时间块的计算方式,不能简单理解为整个音视频生成过程只运行一步。

我的判断

这项工作的价值在于把模型结构、数据系统、训练反馈和高分辨率精炼放进同一套原生音视频方案中,而不只是给视频生成器外挂音频模块。7B规模也体现了对紧凑部署和可用性的关注。它更适合需要首帧控制、文本引导以及音画同步的内容生成任务。不过,现有摘要没有提供具体基准、时长、推理速度、显存需求或与闭源系统的对比数据;作者仅称其表现可与先进开源方案竞争。因此,目前可以确认的是技术路径较完整,尚不能据此判断其2K质量、长时稳定性和实际生成成本。