接触丰富的机器人操作有一个直接问题:动作开始后,接触状态可能在一个动作周期内持续变化,但许多视觉语言动作模型会根据执行前采集的观测,一次性预测完整的动作片段。这样一来,模型实际执行动作时使用的触觉信息已经滞后。TacForcing针对这一问题提出流式动作生成框架,把执行过程中的触觉反馈纳入动作生成,而不是等到下一个完整动作片段再重新决策。

从动作块到流式生成

现有的分块式视觉语言动作模型通常先观察环境,再生成一组连续动作,并在之后执行这组动作。对于接触状态变化明显的任务,这种方式难以及时修正。已有的触觉响应方案通常会额外配置高频控制器,用它处理执行中的触觉信号,但这会带来独立控制模块,以及相应的架构和训练复杂度。

TacForcing选择替换标准的动作专家,改用流式动作专家。它根据执行过程中不断获得的触觉观测,持续生成动作,因此不需要另设一个反应式控制器。论文的核心变化不只是增加触觉输入,而是让动作生成过程本身具备随执行状态更新的能力。

EATA如何对齐时间

论文还提出Execution-Aware Tactile Attention,即执行感知触觉注意力。其做法是把触觉条件限制在即将执行的动作上,减少触觉采集时刻与动作真正执行时刻之间的时间错配。对于动作序列而言,并非所有未来动作都应该同等依赖当前触觉信息;让触觉主要影响临近执行的动作,有助于降低过时反馈对动作生成的影响。

在六个模拟UniVTAC任务中,TacForcing的平均成功率为65%;在三个真实世界的接触丰富操作任务中,平均成功率为69%。论文称,这一结果在模拟和真实设置中都超过了较强基线。材料没有进一步给出各任务的单项结果,因此更适合把它理解为整体实验层面的改进,而不是对所有任务都成立的统一幅度提升。

我的判断

TacForcing的价值在于,它把触觉反馈放回动作生成主流程,针对的是分块预测与执行时状态变化之间的结构性矛盾。流式动作专家和EATA分别处理持续更新与时间对齐,思路清晰,也避免了额外高频控制器带来的系统复杂度。它的适用边界同样明确:论文聚焦接触丰富的操作,不能据此推断对所有机器人任务都有同样收益;目前材料也没有说明训练成本、推理开销和不同触觉传感条件下的表现。对需要在接触过程中快速修正动作的机器人系统,这是一条值得继续验证的路线。