视觉能力正推动基础模型从后期拼接转向原生统一的多模态预训练,但不同模态究竟如何相互促进、何时又会彼此竞争,仍缺少系统认识。这项工作通过合成数据和大规模真实数据上的受控实验,试图把多模态训练拆解为知识流动、模态关系、统一时机和训练配方四个问题。
知识流并非对称,协同取决于数据复杂度
论文分别考察语言、视觉理解与视觉生成之间的迁移,观察到不同方向具有各自的影响模式和不对称性。这意味着增加某一模态的数据或目标,不应被简单理解为会等比例改善其他模态;统一训练的收益需要结合知识流向判断。
更关键的变量是数据“复杂度”。实验显示,它在很大程度上决定多个模态形成协同还是发生竞争。架构设计也会改变结果:共享注意力与归一化层,同时为不同模态保留专用前馈层,更有利于促进协同。作者还发现,这类行为可以跨不同视觉 tokenizer 设计出现,说明观察结果并非只绑定某一种视觉离散化方案。
越早统一,越能避免“视觉懒惰”
与后期对齐或顺序训练相比,从训练早期就统一语言和视觉并持续联合优化更有效。论文将延迟接入视觉后出现的现象称为“视觉懒惰”:模型更容易依赖已有的语言先验,而没有充分利用视觉信息。这一结果提示,模态统一不只是最终网络接口是否一致,还涉及模型在能力形成阶段接触不同信号的顺序。
在此基础上,作者给出更高效的预训练配方,并报告仅使用完整计算预算的 5% 也能取得较强的生成表现。不过,摘要没有提供任务范围、绝对指标及完整预算定义,因此这一比例更适合视为特定实验设置下的效率结果,而不是可直接外推的通用缩放规律。
我的判断
这项工作的价值,在于把多模态预训练从“多放一些图文数据”推进到可讨论的机制层面:哪些知识会跨模态流动、什么条件下产生竞争,以及统一应该从何时开始。对设计原生多模态 Transformer,它提供了明确的实验线索,尤其是共享注意力和归一化、保留模态专用前馈层的组合。
边界也很清楚:现有材料只给出了摘要级结论,缺少具体模型规模、数据复杂度定义、评测任务和消融幅度。所谓“物理规律”更应理解为受控实验中总结出的经验模式。它值得作为架构与训练顺序的优先假设,但在不同数据分布、模型规模和视觉表示方案上,仍需重新验证。