灵巧操作最难的部分之一,是手指与物体之间不断变化的接触。REGRIND 提出一条相对精简的训练路线:从单次人类演示提取手与物体运动,重定向为机器人参考,再用强化学习补偿机器人动力学与人手之间的差异。

三段式训练管线

第一步不是逐关节模仿,而是尽量保留手、物体之间的空间与接触关系。第二步在仿真中训练残差策略,让策略跟踪以物体为中心的关键点轨迹;参考动作负责给出总体结构,强化学习负责处理接触、误差与可执行性。第三步通过细致的系统辨识,把策略零样本迁移到真实硬件。

论文报告该方法在两种多指机械手上完成了剪刀操作和螺丝刀旋转等接触密集任务,并提供视频与代码。这里的“一段演示”描述的是任务参考来源,不意味着部署过程无需仿真训练或硬件标定。

对机器人开发者的影响

这条路线降低了为每个任务采集大量机器人遥操作数据的需求。更重要的是,它把问题拆开:人类示范提供任务语义与运动结构,物体关键点提供跨形态的跟踪目标,残差策略吸收机器人本体差异。

复现时应重点记录接触建模、执行器延迟、摩擦参数和系统辨识误差。对这类任务,仿真奖励更高不一定代表真机更稳,成功率还应按物体位置扰动、工具差异和多次执行统计。

我的判断

REGRIND 展示了“少演示”并不等于端到端少工程,而是把人工成本从大规模数据采集转移到参考构造、仿真和系统辨识。这种分工对具体工具操作很有吸引力,但能否跨越更大的物体和动作分布,仍需更多任务验证。

一手来源:A Minimalist Retargeting-Guided Reinforcement Learning Recipe for Dexterous Manipulation