视觉语言模型可以识别单个视角中的空间关系,但这不等于能够在连续视频中建立稳定的全局地图。Hugging Face Daily Papers 收录的 GST-Bench,尝试把评测重点从局部感知推进到长时间、多视角条件下的全局空间理解。
从第一视角观察还原全局空间
GST-Bench 是一个面向视频理解的视觉问答基准,问题来自 6790 分钟的合成视频,并经过人工核验。任务不仅要求模型理解输入视频中看到的内容,还要从视频未呈现的新视点进行空间推断,并把第一视角观察映射到全局俯视图。
这类任务的难点不只是识别物体或判断相对位置。模型需要在持续变化的视角中保留此前观察,将分散信息整合为一致的场景表示,再利用这一表示回答新视角下的问题。它更接近具身智能体在移动过程中形成空间认知的需求。
局部能力没有自然扩展为全局能力
研究评估了 22 款当前 VLM。表现最好的零样本模型得分为 42.68,而人类得分为 79.08,两者差距明显。作者进一步构建 GST-Bench-Local,在相同任务形式下检查局部空间理解。
结果显示,模型在局部任务上具有较强能力,但仍难以把长时间视频中的观察整合成全局一致的场景表示。这说明问题未必出在基础空间概念本身,更可能集中在跨时间记忆、多视角对齐和全局信息整合。除评测集外,作者还提供 GST-Train,作为训练全局空间推理能力的配套数据资源。
我的判断
GST-Bench 的价值在于区分“看懂当前画面”和“形成全局空间认知”,避免用局部题目的高分替代对长期空间推理能力的验证。它适合评估视频大模型及具身智能体的空间表征短板,也为后续训练提供了明确方向。
但结论需要限定边界:数据来自合成视频,摘要未给出具体场景复杂度、题型分布及各模型明细,因此不能直接推断模型在真实世界导航或机器人任务中的表现。现阶段更稳妥的看法是,GST-Bench 证明了现有 VLM 在这套设定下存在显著全局整合缺口,而不是已经完整衡量了通用空间智能。