机器人模仿学习能复制成功示范,却不容易告诉策略失败后该如何改进。常见奖励模型只给整段轨迹成功或失败的标签,也缺少真实多样的失败数据。DenseReward 试图同时解决这两个问题:自动制造物理上合理的失败,并学习逐帧任务进度。
从成功标签扩展到失败形态
训练管线在仿真中合成碰撞、漏抓、物体掉落和恢复行为等失败轨迹,不需要逐段人工标注。模型接收视觉观察与语言指令,对每一帧输出密集奖励,从而区分“正在接近目标”“已经偏离”和“从失败中恢复”等中间状态。
论文报告 DenseReward 在仿真和真实操作的密集奖励预测上优于通用视觉语言模型及已有机器人奖励模型,并展示了它对模型预测控制和强化学习的指导作用。作者发布了数据集、模型和评测套件。
对机器人训练的影响
逐帧奖励能减少只有任务结束才知道成败的信用分配困难,合成失败则覆盖成功示范里看不到的危险区域。团队可以用它为离线数据重新打分,或在策略优化时提供更平滑的学习信号。
风险在于仿真失败分布不等于真机失败分布。若合成器遗漏执行器迟滞、遮挡或材料形变,奖励模型可能对现实错误过度自信。部署前应按失败类别在真机上校准,并防止策略利用视觉奖励的漏洞获取高分。
我的判断
DenseReward 的关键贡献不是简单把二元标签变成连续分数,而是把“如何失败”纳入训练数据设计。机器人强化学习要可靠超过模仿学习,奖励模型必须认识真实失败、恢复路径和进度停滞;仿真合成是可扩展起点,但仍需真机闭环验证。
一手来源:DenseReward: Dense Reward Learning via Failure Synthesis for Robotic Manipulation