更新时间:2026-09-20 GMT+08:00
分享

方案概述

传统的行为克隆算法(模仿学习)擅长从人类演示中学习任务操作和语义知识,但其性能往往随着数据量增加而趋于饱和,难以达到100%的成功率,并且现有的SOTA VLA模型通常采用“action chunking”(动作分块)技术,虽然有助于长程任务规划,但其本质上是开环执行,缺乏高频的闭环反应能力,导致在高精度的任务(如精密插孔)中容易失败。

由于真机部署时场景数据会与训练数据存在分布偏移,导致基于模仿学习训练出来的算法在遇到训练数据分布之外(OOD)的状态时,往往无法自愈,因此该误差会逐渐累积最终导致机械臂的运行偏离正常轨迹。

本文档指导基于Physical-Intelligence_PI05-Base模型完成全流程真机强化作业,最终部署模型并执行真机评测。

残差强化学习算法价值

  • 提高样本效率与探索效率

    利用冻结的BC策略作为探索先验,RL仅需学习微小的修正量,而非学习整个动作,大幅缩短训练时间。

    引入人类干预纠正机制,当机械臂陷入死胡同或偏离基础策略太远,人类的介入能够将状态快速拉回高价值区域,极大地加速收敛效率。

  • 安全性与训练稳定性

    冻结基础策略充当了隐性的“安全约束”。通常残差策略会被限制探索幅度,这保证在RL的探索初期,机器人的行为仍然主要由相对安全的BC策略主导,避免纯RL常见的剧烈抖动或危险动作。

    人类作为安全保障,可以在机器人即将发生碰撞或严重错误的时候接管控制,进一步降低实机训练的风险,推动VLA的真机强化学习实现业务部署。

  • 解决“最后一厘米”的精度问题

    通过学习每一步(per-step)的闭环残差,算法能够修正动作分块(action chunking)的开环执行误差,使得机器人得以处理精密装配等高难度任务。

  • 数据回流与持续进化

    该插件算法不仅能提升当前任务的性能,还能通过RL在线交互生成大量高质量的成功轨迹(包含修正行为),这些数据可以被“蒸馏”回基座模型,打造数据飞轮,实现VLA模型的持续进化。

前置依赖

  • 已采集技能数据集(lerobot v3.0格式),用于基座模型训练。
  • 硬件依赖:UR5E机械臂、RealSense摄像头(正面+腕部)、大寰夹爪。
  • 操作系统:Ubuntu(机器人接入与数据采集)。
  • 已有CloudRobo平台账号及接入权限。

通信优化

残差强化学习对于通信时延要求较高,如果从观测端发送到云端的observation耗时过长,会对模型训练效果有影响。

Ubuntu系统在建立TCP连接时,为了探测网络带宽并避免拥塞,会从一个较小的窗口(发送速度)开始,然后逐步增大传输速度,即慢启动,一旦TCP连接空闲了,再次发送数据时会重新执行慢启动,会增加延迟,因此需要执行下列命令禁用慢启动:

sudo sysctl -w net.ipv4.tcp_slow_start_after_idle=0

启用后,经历初始阶段的慢启动后,后续的TCP会用较大的窗口发送数据,传输速度会维持在较高水平。该修改在系统重启后会失效,如果希望永久生效,需要将配置写入 /etc/sysctl.conf文件。

如果网络路径变化或变得拥塞,直接使用较大的窗口发送数据,可能会造成数据包丢失。

使用流程

图1 使用流程
表1 使用流程

操作

说明

创建模型训练作业

基于平台预置的Physical-Intelligence_PI05-Base操作模型创建模型训练作业,并完成首次模型调优训练作业,保存本次训练作业产生的新模型。

接入并激活机器人

安装残差强化学习端侧环境并启动端侧脚本,同时在云端接入机器人,最终结合本地配置激活接入的机器人。

部署模型服务

部署模型训练作业产生的新模型,模型部署成功后,该模型服务状态为“运行中”,用于后续的智能体调试。

机器人采集数据

在云端开始智能体调试,云端和端侧同时显示调试记录(日志),调试完成后,请将保存的轨迹数据上传并注册到云端。

在线真机强化作业

一键配置基模型和强化数据集,并接入在线机器人,成功创建真机强化作业,无需人工操作,该作业会自动运行,运行完成后可以查看训练产物。

部署模型并执行真机评测

部署基于真机强化作业产生的模型训练产物,再次接入并激活机器人,开始智能体调试,请实时观测机器人任务执行情况。

相关文档