MOSS-VL关注的不是传统“看完再回答”,而是让视觉语言模型在生成内容时继续接收画面,并自行判断何时发言、保持沉默或修正此前输出。项目同时开放五个检查点、训练课程和实时推理代码,目标是提供一套可复现的开放实时交互方案。

从模型结构支持边看边说

MOSS-VL的语言解码器只通过门控交叉注意力访问视觉信息,视觉 token 不进入待解码序列。这样设计后,模型生成文本时仍可接收新帧,不必把完整视觉上下文与文本统一塞入自回归序列。

这一区分也直接影响延迟。报告称,11.3B 参数的 MOSS-VL 随视觉上下文增长,相对采用相同骨干的 Qwen3-VL-8B,首 token 时间优势从 2.8 倍扩大到 5.1 倍。不过,该结果针对首词延迟,不能直接等同于完整回答速度或端到端服务吞吐。

用轻量末阶段补齐实时行为

训练采用分阶段课程:先建立较强的离线能力,再把实时交互相关训练集中到最后一个较轻的阶段。合成的交互语料不仅监督回答内容,也监督何时开口、何时沉默以及何时修正,使“主动性”成为明确训练目标,而非仅靠提示词触发。

离线版本 MOSS-VL-Instruct 在相近规模下具备竞争力,并在时间推理视频数据集上领先。实时版本在四项流式基准中,三项取得开源流式模型最佳平均成绩,另一项排名第二;在三个重点测试主动行为的子集上均居首。OmniMMI Proactive Alerting 得分为 66.0,最佳基线为 37.5,是材料中最显著的差距。

我的判断

MOSS-VL的价值在于把实时交互同时落实到注意力结构、行为数据和训练流程,而不是为离线模型附加流式接口。视觉 token 脱离解码序列,对长视觉上下文下的首词延迟尤其有吸引力,也便于开发者研究主动提醒等应用。

边界也很明确:现有材料主要报告基准平均分和首词延迟,没有给出完整生成速度、资源占用、真实部署稳定性及复杂场景中的误提醒情况。它证明了开放模型可以更主动地“边看边说”,但是否适合生产环境,仍需结合具体硬件、视频长度和错误成本验证。