更新时间:2026-09-24 GMT+08:00
分享

查看真机强化作业详情

在“在线真机强化作业”页面,找到目标作业,单击作业名称,进入在线真机强化作业详情界面,可以查看该作业的概览(基础信息等)、训练指标、日志。

概览

图1 概览示例
表1 概览信息

参数

说明

训练产物

训练后模型

本次真机强化作业产生的模型名称。

单击模型名称,可以查看该模型的详细信息,在该模型的“模型文件”处,可以查看本次真机强化作业的训练产物。

模型类型

本次真机强化作业产生的模型类型,与源模型类型一致。

模型优势技能

本次真机强化作业配置的模型优势技能。

鼠标移至该参数上,会显示配置的模型优势技能。

图2 模型优势技能示例

基础信息

名称

本次真机强化作业名称。

ID

本次真机强化作业ID。

单击,即可复制该ID。

描述

本次真机强化作业的描述,通过此描述可以清晰了解作业目的、场景等信息。

单击,即可编辑该描述。

作业创建时间

本次真机强化作业的创建时间。

运行时长

本次真机强化作业的运行时间。

训练配置

来源模型

本次真机强化作业的来源模型,支持“空间资产-模型”。

单击模型名称,可以查看该模型的详细信息。

数据集

本次真机强化作业的数据集,显示数据集的名称或OBS路径。

强化算法

仅支持残差强化学习算法。

参数配置

强化策略

本次真机强化作业的参数配置选择“快速配置”,会显示该强化策略。

参数信息

  • 本次真机强化作业的参数配置选择“快速配置”,会显示关键参数。
  • 本次真机强化作业的参数配置选择“YAML配置”,会显示配置的YAML参数。

机器人配置

机器人名称

本次真机强化作业的机器人名称。

单击“查看执行记录”,页面右侧执行过程界面,可以查看本次作业中机器人的执行过程。

图3 机器人执行过程示例

机器人状态

本次真机强化作业的机器人状态,该状态为该机器人的实时状态。

资源配置

资源池

本次真机强化作业的资源池类型,支持“公共资源池”。

实例规格

本次真机强化作业的运行实例规格。

实例数

本次真机强化作业的运行实例数。

训练指标

在“训练指标”页签,按照曲线图展示本次作业的训练指标。

按照手动刷新、每10s刷新、每30s刷新、每60s刷新来刷新训练指标页面图表数据。

图4 训练指标示例
表2 训练指标说明

训练指标

说明

actor_time

策略网络(actor)的单次训练时间,单位:秒(s)。

rollout_time

采样器(rollout)采集一个轨迹数据的时间,单位:秒(s)。

entropy

强化学习算法训练过程中熵值,描述策略在当前状态下选择动作时的“随机程度”或“不确定性”。合理的熵值变化是一个“先降后稳”的收敛过程。

buffer_num

轨迹数目。

  • demo_num_traj:预采集演示数据的轨迹数目。
  • replay_num_traj:训练过程中采集的轨迹数目。

buffer_total

样本数目。

  • demo_total:预采集演示数目的样本数目。
  • replay_total:训练过程中采集的样本数目(会随着训练过程,采集数目而逐渐增加)。

sac_loss

强化学习算法sac(Soft Actor-Critic)各个 组成的损失函数。

  • actor_loss:策略网络的损失。 衡量Actor网络(策略)选择的动作好在哪,目标是让策略倾向于选择“高价值”且“高熵(探索性)”的动作。actor_loss 越低,表示选择的动作有更高的Q值,而更大的多样性。
  • alpha_loss:温度参数的损失。自动调整熵正则项的权重系数α(温度系数),调整探索节奏。SAC通过设定一个目标熵值(target_entropy),让α自适应;如果当前策略熵低于目标(太确定),alpha_loss会增大α鼓励探索;反之则减小。
  • critic_loss: 价值网络的损失。衡量Critic网络(Q值)对“当前状态-动作”打分的准确度,critic_loss 则是描述预测的Q值与真实回报间的差异。

日志

日志记录真机强化作业的运行过程和异常信息,帮助用户快速定位作业运行中出现的问题。

CloudRobo默认保存日志30天,过期后会自动清除。

按照最近30天、1周、1天等筛选日志,还可以自定义时间段筛选日志。

在页面可以查看日志内容,按照关键字定位日志内容,还可以下载日志文件至本地查看。

图5 日志示例

事件

真机强化作业的(从用户可看见任务运行开始)整个生命周期中,每一个关键事件点在系统后台均有记录,用户可随时在对应作业的详情页面查看。方便用户更清楚地了解作业运行过程,遇到任务异常时,更加准确地排查定位问题。

在“事件”页签,支持查看的事件类型包括以下两种:

  • 作业事件

    记录作业部署层面的运行状态和操作。

    作业事件保留周期为30天,30天后自动清理数据。

    按照最近30天、1周、1天等筛选作业事件,还可以自定义时间段筛选作业事件。

    图6 作业事件示例
  • Pod事件

    记录底层容器的生命周期和异常情况。

    Pod事件保留周期为1小时,1小时后自动清理数据。

    根据部署历史、部署实例查看事件,按照最近一小时、30分钟、15分钟会自定义时间段筛选事件。

    图7 Pod事件示例

相关文档