视觉语言模型已经具备关于现实世界的广泛知识,但从理解场景到稳定控制机器人,中间仍存在明显鸿沟。Show-Harness提出了一种面向具身控制的接口层:让VLM负责理解意图和做出细粒度的物理决策,再由与具体机器人形态对应的解释器,将语义动作确定性地落地为本地动作。论文的核心判断是,机器人能力的瓶颈未必总在模型容量,也可能在于模型与执行系统之间缺少合适的表达方式。
用语义动作连接意图与执行
Show-Harness向VLM暴露的是离散的语义动作单元,而不是直接要求模型输出底层控制信号。这样的动作空间更接近VLM能够自然推理的对象,同时保留了对具体物理决策的直接责任。不同机器人则通过各自的解释器,把同一套语义表达转换为符合自身形态和执行方式的局部动作。
这套设计带来两个方向的适配能力。其一,闭源前沿VLM可以通过该接口直接参与零样本机器人控制,不需要针对某一具体机器人重新训练。其二,小规模开源VLM可以通过仅需数个GPU小时的微调,适配低成本部署。材料没有给出具体任务、机器人数量或微调效果数字,因此这里更适合将其理解为一种控制接口和适配路径,而不是对所有机器人场景的普遍承诺。
GUMI把演示采集搬到GUI
论文还提出GUMI,即GUI Manipulation Interface,将同一语义动作空间扩展到基于GUI的演示数据采集。人类和智能体可以通过图形界面“操作”机器人,在不同具身形态之间传递演示,而不依赖专门的遥操作硬件。
这使Show-Harness不只是一个推理时的控制包装,也涉及数据收集和模型适配流程。其价值在于统一了人、智能体与机器人之间的交互表示:人类可以提供演示,智能体可以参与操作,底层机器人则由对应解释器完成动作落地。对于需要快速试验不同机器人形态的研究和部署团队,这种统一接口可能减少硬件和控制层的重复工作。
我的判断
Show-Harness的主要价值在于重新划分VLM与机器人控制系统的职责:模型处理可泛化的语义和细粒度决策,解释器处理具身差异与动作落地。这条路线比单纯扩大模型规模更直接地回应了“会理解但不会操作”的问题,也为闭源模型进入机器人控制提供了清晰入口。
但它的适用边界同样明确。语义动作是否足够表达复杂、连续或高风险的物理操作,解释器能否可靠覆盖不同机器人形态,仍取决于具体接口设计和执行系统。论文摘要称其在任务、具身形态和环境之间表现出稳健泛化,并优于代表性的智能体和VLA范式,但没有提供比较对象、任务规模和失败情况的细节。因而目前可以确认的是接口设计具有潜力,尚不足以据此判断它已经解决了通用机器人控制问题。