当前不少视觉—语言—动作模型采用“视觉到语言再到动作”的路径:先把视觉观察投影到大语言模型的表示空间,再由模型解码机器人动作。TurboVLA 的核心变化,是取消大语言模型作为感知与动作之间的中央接口,改用更直接的“视觉与语言到动作”映射,以降低每次策略调用的计算和显存开销。

从串行中枢改为轻量交互

TurboVLA 分别编码视觉观察与语言指令,再通过轻量级的双向视觉—语言交互交换信息,形成与任务相关的联合表示。随后,一个紧凑解码器直接预测连续动作块。相比先把视觉信息送入大语言模型、再从语言表示生成动作,这种设计缩短了推理链路,也避免让大型语言模型持续承担高成本的中间表示处理。

这项工作的重点并不是压缩现有 LLM 中心架构,而是重新安排视觉、语言和动作三者的连接方式。其判断是:机器人策略需要利用语言条件,但未必需要让大语言模型成为每次动作预测的必经中枢。

速度、显存与任务结果

论文报告,TurboVLA 仅有 0.2B 参数。在 LIBERO 基准上,其平均成功率达到 97.7%;使用消费级 RTX 4090 时,单次推理延迟为 31.2 毫秒,对应约 32 Hz,推理显存占用为 0.9 GB。按照论文给出的比较,它能够匹配或超过规模大得多的 VLA 策略。

这些结果说明,至少在 LIBERO 所覆盖的机器人操作任务中,更小、更直接的架构并未必以明显牺牲任务成功率为代价。低于 1 GB 的推理显存也为同一 GPU 上容纳其他感知或控制模块留下了更多空间。

我的判断

TurboVLA 的价值在于给出了一条清晰的架构替代路线:如果目标是高频、低显存的机器人动作生成,语言模型不一定适合作为系统中枢,轻量跨模态交互可能更符合实时控制需求。不过,目前材料只提供了 LIBERO 上的结果,尚不足以判断它在更复杂语言指令、开放环境、长时程任务或不同硬件上的表现。97.7% 成功率、32 Hz 和 0.9 GB 显存应被理解为特定基准与 RTX 4090 条件下的数据,而不是对真实机器人场景的普遍保证。