当VLM智能体从“描述三维场景”走向调用工具改变场景,评测目标也需要从回答是否正确,转向动作结果是否满足几何要求。SceneActBench正是针对这一缺口:它不只考察单个物体操作,而是在完整、多物体的三维场景中检验视觉条件下的行动能力。
它测的不是描述,而是执行结果
基准覆盖五类三维任务,统一采用智能体—环境循环。智能体接收PNG图像或从视频中采样的帧;在适用任务里,系统还会提供三维资产。智能体随后对三维环境采取行动,最终输出再与隐藏的真实答案比较,并按任务使用对应的几何指标评分。这样的设计把关注点放在“看见之后能否做对”,也减少了只靠文本表述获得高分的空间。
规模与结果暴露了跨任务短板
SceneActBench由210个源实例构建,共形成520个任务案例,其中包括成对的输入条件。所有任务都通过同一个固定智能体循环运行,以尽量保证不同配置之间的比较一致。对11种专有VLM配置的测试中,总体得分介于38.6到50.2,没有任何配置能在各项任务上持续表现良好。这比单一总榜更值得注意:当前系统的问题不只是整体分数有限,还在于能力分布不均,换一种三维行动任务就可能失效。论文还进一步分析了失败出现的位置与方式,但摘要未给出具体分类。
我的判断
这项工作的价值,在于把VLM智能体评测推进到完整三维场景、工具行动和几何结果验证的组合上,并用固定循环控制比较条件。它适合用于识别模型在不同三维任务间的稳定性,而不是只判断其是否“懂场景”。但边界也很明确:现有材料没有披露五项任务的具体内容、各任务分项成绩及失败类型,且结果仅来自11种专有VLM配置。因此,38.6至50.2应被视为该基准和这些配置下的结果,不能直接外推到开放模型、真实机器人或所有三维智能体。