空间智能是智能体走向物理世界交互的重要能力,但现有评测往往要求模型输出坐标、选项或文本。对于本可通过指点、标记和绘图表达空间判断的图像生成模型,这种接口并不自然,也让它们难以与文本输出的视觉语言模型在相同任务语义下比较。
问题不只在推理,也在作答接口
许多空间任务建立在连续视觉场景中,位置、区域和路径更适合直接画在图像上,而不是转换成精确坐标或离散符号。传统基准的文本化答案接口,可能把空间判断能力与格式转换能力混在一起。论文因此把关注点从“模型能否按指定文本格式回答”转向“模型能否在像素空间明确表达判断”。
这并不是为图像生成模型另设一套任务,而是试图保留原任务语义与指标,只改变答案的表达和解析方式,从而建立更可比的评测入口。
ProVisE 如何统一两类模型
作者提出 ProVisE,即协议化视觉评测框架。它要求图像生成模型按照任务协议产生受约束的视觉答案,再将这些像素输出解析为结构化预测,使结果能够接入原有评测指标。框架本身不绑定单一基准,并包含一个 Agentic builder,用于为新任务构建并验证专用协议。
论文同时发布 SpatialGen-Bench,包含 470 个样本、14 类空间子任务、四个能力层级,并覆盖多种答案形式。作者在统一设置下评估了代表性的文本输出视觉语言模型与图像生成模型,还在六个外部空间基准上验证了协议构建流程。摘要给出的结论是:当空间答案能够被直接外化时,图像生成模型具有竞争力;但材料没有提供各模型的具体分数与分项差异。
我的判断
ProVisE 的价值在于指出一个常被忽略的变量:评测接口本身会偏向某类模型。让模型“画出答案”,比强迫它先把连续空间关系翻译成文本更符合任务结构,也有助于区分空间判断与格式遵循能力。
不过,这类结果不能直接等同于模型已具备可靠的物理世界认知。协议设计、视觉输出约束和解析器都可能影响最终得分;470 个样本更适合作为诊断性基准,能否覆盖复杂真实场景仍需更多验证。在缺少完整实验数据的情况下,更稳妥的结论是:它提供了更匹配生成模型能力形态的评测方法,而不是证明图像生成模型已经全面优于文本输出模型。