# 真机强化作业概述
传统的行为克隆算法（模仿学习）擅长从人类演示中学习任务操作和语义知识，但其性能往往随着数据量增加而趋于饱和，难以达到100%的成功率，并且现有的SOTA VLA模型通常采用"action chunking"（动作分块）技术，虽然有助于长程任务规划，但其本质上是开环执行，缺乏高频的闭环反应能力，导致在高精度的任务（如精密插孔）中容易失败。
由于真机部署时场景数据会与训练数据存在分布偏移，导致基于模仿学习训练出来的算法在遇到训练数据分布之外（OOD）的状态时，往往无法自愈，因此该误差会逐渐累积最终导致机械臂的运行偏离正常轨迹。
目前，CloudRobo支持**基于Physical-Intelligence_PI05-Base模型完成真机强化作业**，更好地解决真机部署出现的问题缺陷。
#### 残差强化学习算法价值
- **提高样本效率与探索效率**
  利用冻结的BC策略作为探索先验，RL仅需学习微小的修正量，而非学习整个动作，大幅缩短训练时间。
  引入人类干预纠正机制，当机械臂陷入死胡同或偏离基础策略太远，人类的介入能够将状态快速拉回高价值区域，极大地加速收敛效率。
  
- **安全性与训练稳定性**
  冻结基础策略充当了隐性的"安全约束"。通常残差策略会被限制探索幅度，这保证在RL的探索初期，机器人的行为仍然主要由相对安全的BC策略主导，避免纯RL常见的剧烈抖动或危险动作。
  人类作为安全保障，可以在机器人即将发生碰撞或严重错误的时候接管控制，进一步降低实机训练的风险，推动VLA的真机强化学习实现业务部署。
  

- **解决"最后一厘米"的精度问题**
  通过学习每一步（per-step）的闭环残差，算法能够修正动作分块（action chunking）的开环执行误差，使得机器人得以处理精密装配等高难度任务。
  
- **数据回流与持续进化**
  该插件算法不仅能提升当前任务的性能，还能通过RL在线交互生成大量高质量的成功轨迹（包含修正行为），这些数据可以被"蒸馏"回基座模型，打造数据飞轮，实现VLA模型的持续进化。
  
 
#### 真机强化作业使用流程
图1真机强化作业使用流程   
![](https://support.huaweicloud.com/usermanual-cloudrobo/zh-cn_image_0000002739619982.png "点击放大")
表1使用流程 
| 操作                                                                                    | 说明                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                        |
|:---|:---|
| [模型准备](https://support.huaweicloud.com/usermanual-cloudrobo/cloudrobo_02_0160.html) | 1. 创建真机数据 用户自行采集机器人真机数据（机械臂轨迹数据），上传至CloudRobo空间资产并注册，保存为真机数据集。   2. 基模型调优 基于CloudRobo预置的Physical-Intelligence_PI05-Base模型、上传的真机数据集完成模型调优训练，并将训练后的模型作为强化基模型。                                                                                                     |
| [数据集准备](https://support.huaweicloud.com/usermanual-cloudrobo/cloudrobo_02_0153.html)   | 1. 部署模型服务 部署强化的基模型为模型服务。   2. 接入机器人 接入机器人进行本地调试，执行智能体调试并选择部署的模型服务。   3. 采集真机数据 需要结合端侧数采工具，采集真机数据作为强化作业的数据集。                   |
| 在线真机强化作业                                                                              | 1. [创建在线真机强化作业](https://support.huaweicloud.com/usermanual-cloudrobo/cloudrobo_02_0154.html) 一键配置基模型和强化数据集，并接入在线机器人，成功创建真机强化作业，该作业会自动运行。   2. [查看真机强化作业训练后模型产物](https://support.huaweicloud.com/usermanual-cloudrobo/cloudrobo_02_0159.html) 在真机强化作业完成后，可以查看本次强化作业的训练产物，该训练产物可以用于[部署](https://support.huaweicloud.com/usermanual-cloudrobo/cloudrobo_02_0158.html)模型服务。    |
   
#### 最佳实践
为了用户可以更全量地使用真机强化作业功能，本产品为用户提供全流程最佳实践，具体请参见[基于残差强化学习算法完成真机强化作业](https://support.huaweicloud.com/bestpractice-cloudrobo/toctopics/zh-cn_topic_0000002718861499.html)。
