多模态大模型扩展通常有两条路径:增加模型参数,或增加串行推理计算。前者带来更高内存开销,后者增加延迟,而且两者往往保留了视觉编码器与语言模型之间固定的计算比例。ParVL尝试引入第三种选择:复用已有骨干参数,通过并行分支扩展计算,并让视觉与语言两侧的投入可以重新分配。
用共享骨干扩展并行计算
ParVL同时复用现有的视觉 Transformer(ViT)和大语言模型(LLM)骨干,在视觉侧与语言侧建立多条并行计算流。每条分支使用独立的前缀参数,但主体骨干保持共享。这样做的重点不是继续扩大骨干参数量,而是在给定骨干参数预算下,增加调用共享参数的并行计算。
论文采用全参数监督微调进行端到端训练,训练数据规模约为 130 亿 token。其核心研究问题是:额外计算应当分给 ViT 编码器,还是分给 LLM 解码器,以及两者之间应采用怎样的比例。
最优计算比例取决于任务
实验结论显示,在相同训练方案下,ParVL的整体多模态表现优于单分支基线。但更值得关注的是,论文没有得到一个对所有任务都最优的固定比例:最佳的视觉—语言计算分配会随任务变化。
这意味着,多模态扩展不只是“总计算量够不够”的问题,还涉及计算放在哪里。视觉理解需求更强的任务与语言推理需求更高的任务,可能需要不同的分支配置。ParVL因此把原本固化在模型结构中的计算比例,转化为一个可研究、可调整的设计变量。
我的判断
ParVL的价值在于明确提出了参数规模、串行计算之外的并行扩展方向,并把视觉与语言之间的计算分配作为独立问题处理。它更适合骨干模型已经确定、但仍希望针对任务调整额外计算投入的场景。
不过,摘要未提供具体模型规模、评测基准、提升幅度,也没有给出并行分支在真实部署中的显存占用、吞吐和延迟数据。因此,目前可以确认的是其方法有效改善了所评估任务的总体表现,但还不能据此判断它是否能降低实际服务成本,或能否稳定迁移到更多模型与任务。