具身视觉追踪要求移动智能体仅依靠机载视觉,持续跟随自然语言指定的目标。现有视觉—语言—动作策略虽然能统一目标识别与路径规划,但其思维链往往停留在抽象空间表征中,既不容易直接监督,也未必能与图像中的明确检测结果对齐。ReferTrack 的核心选择,是把“认出要跟谁”和“接下来往哪走”拆成前后衔接的两个步骤。

先指认,再生成追踪路点

ReferTrack 使用单个前向摄像头。模型首先面对一组带索引的边界框,根据语言描述选出目标;随后以这次图像空间中的选择为条件,解码用于追踪的路点。相比直接从视觉和语言生成动作,这种设计提供了更明确的中间决策:目标身份可以落到具体边界框,而不是只存在于难以检查的隐空间中。

为了增强目标指认能力,作者还使用自建的 Refer-QA 数据集进行联合训练。摘要没有披露该数据集的规模、构造方式与覆盖场景,因此目前只能确认它被用于辅助目标识别,尚无法单独判断其贡献大小。

用边界框历史保留运动线索

持续追踪不能只看当前帧。ReferTrack 维护一个滑动窗口队列,保存此前选中的目标边界框,并提取其几何特征。模型再通过 temporal-viewpoint-bbox indicator,也就是 TVBI token,将这些信息注入视觉历史,以保留目标随时间变化的运动线索。

在 EVT-Bench 上,ReferTrack 在单目标、干扰和歧义三个划分中的成功率分别为 89.4%、73.3% 和 74.1%,取得单视角方法中的领先结果。在更依赖目标识别的任务上,其表现可匹配或超过若干多摄像头基线。作者还在四足与人形机器人上进行了真实部署,并报告了较稳健的仿真到现实迁移表现;不过摘要未提供部署规模、环境范围或失败率等细节。

我的判断

这项工作的价值不只是刷新单目结果,而是为具身追踪引入了可检查的图像空间中间变量。先选框、再规划,使目标认错和路径生成错误更容易被区分,也为后续监督与调试留下接口。它尤其适合目标指代复杂、摄像头数量受限的移动机器人。

边界也很明确:方法依赖候选边界框及其跨时间记录,检测框如何产生、漏检或误检时是否稳定,摘要没有说明;真实世界验证也缺少定量细节。因此,现阶段更适合把 ReferTrack 看作一种清晰且有效的架构方向,而不是已经证明能覆盖开放环境长期追踪的完整方案。