更新时间:2026-09-24 GMT+08:00
分享

创建在线真机强化作业

用户可以创建在线真机强化作业,一键配置基模型和强化数据集,并接入在线机器人,成功创建真机强化作业,无需人工操作,该作业会自动运行,但自动运行过程中,由于刚开始训练作业策略效果不是很理想时,需要人工通过3D鼠标干预机械臂执行情况,运行完成后可以查看真机强化作业训练后模型产物。

前提条件

  • 已完成模型准备。
  • 已完成数据集准备。
  • 用户当前工作空间绑定的OBS桶必须可用且OBS桶策略正常,否则功能无法正常使用。
    • 如果OBS桶不可用,可根据界面提示重新选择存储地址。普通成员如遇配置失败,请联系管理员处理。
    • 如果OBS桶策略异常,可根据界面提示重新配置OBS桶策略。普通成员如遇配置失败,请联系管理员处理。
    • 如果因其他服务异常导致查询当前工作空间绑定的OBS桶详情失败,请联系华为云技术支持人员处理或提交工单。

创建在线真机强化作业

  1. 在左侧导航栏选择“模型开发 > 真机强化”,进入页面。

    如果是首次操作,请务必仔细查看新手引导,有利于后续操作的便利性。

  2. 在页面单击“创建在线真机强化作业”,进入“创建在线真机强化作业”页面。
  3. 请按照页面提示配置真机强化作业参数。

    表1 真机强化作业参数

    参数

    说明

    基础信息

    作业名称

    请输入自定义真机强化作业名称,推荐与实际作业相关。

    作业名称是由中文、数字、字母、下划线(_)、连字符(-)、点(.)、斜线(/)组成,输入长度范围为3~64个字符。

    描述

    请输入自定义真机强化作业描述,通过此描述可以清晰了解作业目的、场景等信息。

    描述内容长度不能超过512个字符。

    训练配置

    模型

    请按照实际需要选择模型,具体操作均可参见选择空间资产模型。

    当前仅支持真机实测的数据集微调平台预置的基模型(Physical-Intelligence_PI05-Base),微调后的模型产物作为真机强化的基模型,该模型属于空间资产模型。

    选择模型后,页面会显示模型的参数配置参数,请按照后续参数说明填写。

    强化算法

    选择真机强化模型后显示该参数。

    当前仅支持残差强化学习算法,冻结预训练基础策略,仅训练轻量残差策略网络以输出修正项。

    数据

    当前选择的数据集应为部署模型服务后,接入在线的机器人进行智能体调试,配合端侧数据采集工具收集真机数据,保存的强化数据集。

    • 空间资产-数据

      单击输入框,页面右侧显示已有空间资产数据集,且可以预览数据集,勾选所需的数据集(仅支持勾选1个数据集),完成后单击“确定”。

    • 对象存储服务OBS

      单击输入框,页面右侧显示存储数据集的OBS文件夹,勾选数据集所在的OBS文件夹(仅支持勾选1个文件夹),完成后单击“确定”。

      说明:
      • 不支持选择跨区域(Region)的OBS桶。如果您的OBS桶中有需要特别保护的敏感数据,请自行对数据加密后再存放到OBS桶。
      • 只能选择当前工作空间下的默认存储位置OBS路径下的文件夹,不能选择到具体文件。

    参数配置

    配置方式

    按照实际,选择需要的配置方式。

    • 快速配置

      先选择强化策略,再查看系统已预填真机强化作业的关键参数,请按照需求小幅度调整参数值。

    • YAML配置

      通过编辑器直接修改YAML配置,支持全部参数的精细调控。

    请参照官网说明配置上述两种方式涉及的参数,具体请参见YAML配置。还需要注意以下参数:

    • rollout.step_jump:chunk内动作跳步执行的间隔,建议使用默认值。
    • rollout.timeout_obs:云端结构观测的超时时间,建议使用默认值。
    • rollout.residual_scale:残差动作的缩放因子,数值越小,残差动作影响越小,建议使用默认值。

    如果不需要已配置的参数数值,可以单击“恢复默认参数”,将参数数值恢复至系统默认值。

    强化策略

    当“配置方式”选择“快速配置”时,显示此参数。

    默认显示RLPD(Reinforcement Learning with Prior Data)强化策略。

    RLPD(Reinforcement Learning with Prior Data),高效融合离线先验数据与在线交互,使机器人从少量交互中快速学会复杂技能。

    机器人配置

    在线机器人

    在下拉框选择在线机器人,该机器人应为本次模型在部署后参与智能体调试时使用的机器人。

    选择在线机器人将终止其正在进行的智能体调试任务,请谨慎操作并确保机器人全程保持在线以防训练失败。

    资源配置

    资源池

    请按照实际需要选择资源池,当前仅支持公共资源池。

    • 公共资源池:公共资源池提供公共的大规模计算集群,根据用户作业参数分配使用,资源按作业隔离。用户下发训练作业、部署模型、使用开发环境实例等情况下,均可以使用公共资源池完成。开通账号并申请公测后即可使用CloudRobo的公共资源池。

    实例规格

    下拉选择资源池类型对应的实例规格。

    实例数

    按照实际,输入实例数值。

    训练产物

    真机强化作业的最终训练产物将发布至CloudRobo的“空间资产 > 模型”(即自定义模型),且该模型支持部署模型服务。

    保存方式

    请按照实际选择训练产物的保存方式。

    • 选择“新模型”,系统可以自定义模型名称,最终会保存为新模型。
    • 选择“已有模型新版本”,下拉框显示当“保存方式”为“新模型”时保存的模型,请按照实际需求在下拉框选择模型。

    模型名称

    请输入或选择真机强化作业后的模型名称。

    模型名称是由中文、数字、字母、下划线(_)、连字符(-)、点(.)、斜线(/)、空格组成且不能以空格开头或结尾,输入长度范围为2~64个字符。

    模型版本号

    请输入模型版本号。

    模型版本号是以字母或数字开头,仅支持大小写字母、数字、连字符(-)、点号(.)、下划线(_),输入长度范围为2~128个字符。

    当“保存方式”为“已有模型新版本”时,需注意:

    • 模型版本号不能与该模型已有的版本号重复。
    • 未填写版本号时,模型版本号会自动新增一个版本。

    模型类型

    系统自动匹配模型类型,不支持修改。

    新模型的模型类型与源模型的模型类型保持一致。

    模型优势技能

    当“模型类型”为“操作模型”时,显示此参数。

    模型优势技能是模型经过真机强化作业后,在各项能力中表现相对优异、可作为该模型优势能力的技能。

    模型默认只能有1个技能,请按照实际需求填写技能。

    • 技能名称

      按照实际技能输入技能名称,名称由中文、数字、字母、下划线(_)、连字符(-)、空格组成且不能以空格开头和结尾,长度范围为1~64个字符。

    • Prompt

      模型技能的提示词,用户输入的指令或问题,用于引导模型生成特定内容或执行特定任务。

      该提示词由任意字符组成但不能是全是空格,长度范围在1~1024个字符。

    仅执行模型优势技能

    默认勾选仅执行模型优势技能,代表开启仅执行模型优势技能,部署后的模型服务在智能体调试时仅能执行当前的模型优势技能。

    不支持修改该参数。

  4. (可选)所有参数配置完成后,仍需要继续编辑,但当前不创建作业,可以单击“保存为草稿”,将该作业保存为草稿。
  5. 所有参数配置完成后,单击“立即创建”,即开始创建真机强化作业,该作业状态为“创建中”。
  6. 成功创建真机强化作业后,系统会自动开始运行该强化学习作业,该作业状态为“运行中”,作业运行完成后的状态为“已完成”。

    如果真机强化作业所选的资源规格紧张,该作业需要排队等待开始运行,此时作业状态为“等待中”。

选择空间资产模型

  1. 在模型处单击“选择空间资产模型”,页面右侧显示“选择空间资产模型”界面。

    图1 选择空间资产模型

    界面上仅支持展示基于预置模型(模型名:Physical-Intelligence_PI05-Base)微调后的空间资产模型,更多模型信息请前往具身广场查看。

  2. 在左侧区域选择目标模型,并在右侧选择模型版本。

    仅支持选择1个模型版本。

    图2 选择空间资产模型与版本

  3. 完成后单击“确定”,页面会显示模型卡片。

    如果不满意此次选择的模型,请直接单击模型卡片,在界面上按照2选择其他模型。

    图3 模型卡片示例

常见问题

创建在线真机强化作业时,如果系统提示配额或资源不足,请参考“创建执行作业时遇到系统提示配额或资源不足怎么解决”章节描述来解决。

相关文档