这项研究讨论的不是在现有语言模型上追加视觉模块,而是从头用多模态输入训练 Transformer 视觉语言模型。作者希望回答一个基础但尚未被系统刻画的问题:计算预算固定时,模型应该做多大、使用多少训练 token,才能获得更低的目标损失。
从跨模态融合转向缩放规律
原生多模态预训练强调在训练初期就让不同模态共同参与优化,目标是形成更深的跨模态整合,并缓解传统后期融合架构中的优化不对称。研究表明,最低目标损失与计算量之间存在可预测的计算规律;与之对应,计算最优的模型规模和 token 数量则按幂律变化。这意味着原生多模态训练并非只能依靠逐次试验,也有可能像语言模型缩放研究一样,用经验规律缩小配置搜索范围。
语言与多模态目标并不共享一套配方
论文最值得注意的结果,是两类目标呈现出不同的资源分配行为。语言目标的分配规律基本不随数据组成变化,说明在不同多模态数据比例下,语言学习表现出相对稳定的缩放特征。多模态目标则对数据组成高度敏感:文本占比较高的混合数据,只有在更大的模型规模下才更具计算效率,并会把最优资源配置推向更高的模型容量。作者进一步建模数据组成对计算规律和分配指数的影响,并据此构造效率前沿,用于描述配置选择。
我的判断
这项工作的价值,在于把“多模态数据配多少”与“模型做多大”放进同一个计算预算框架,而不是分别调参。对计划从头训练视觉语言模型的团队,它可作为预算规划和实验设计的依据。适用边界也很明确:摘要没有给出具体指数、模型规模区间、数据构成细节和下游任务结果,因此不能直接把这些规律外推到任意架构或数据集,也不能将更低的预训练目标损失等同于更强的实际多模态能力。