
# 查看CV大模型训练状态与指标
模型启动训练后，可以在模型训练列表中查看训练任务的状态，单击任务名称可以进入详情页查看训练结果、训练任务详情和训练日志。
#### 查看模型训练状态
在模型训练列表中查看训练任务的状态，各状态说明详见[表1]。
 表1训练状态说明 
| 训练状态 | 训练状态含义                                |
|:---|:---|
| 初始化  | 模型训练任务正在进行初始化配置，准备开始训练。               |
| 等待创建 | 模型训练任务可用算力不足，等待创建，待其他运行中的任务算力释放后开始创建。 |
| 排队中  | 模型训练任务正在排队，请稍等。                       |
| 运行中  | 模型正在训练中，训练过程尚未结束。                     |
| 停止中  | 模型训练正在停止中。                            |
| 已停止  | 模型训练已被用户手动停止。                         |
| 失败   | 模型训练过程中出现错误，需查看日志定位训练失败原因。            |
| 已完成  | 模型训练已完成。                              |
   
#### 查看训练指标
对于训练状态为"已完成"的任务，单击任务名称，可在"训练结果"页面查看训练指标，模型的训练指标介绍请参见[图1]。
图1查看训练指标   
![](https://support.huaweicloud.com/usermanual-pangulm/zh-cn_image_0000002601726205.png)
表2训练指标说明 
| 模型                                                                                                                                                                                                                                                                                                                                                                                     | 训练指标     | 指标说明                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                           |
|:---|:---|:---|
| Pangu-CV-物体检测-S-V2 Pangu-CV-物体检测-S-V3 Pangu-CV-目标跟踪-V3 Pangu-CV-物体检测-N-V2 Pangu-CV-实例分割-V1 Pangu-CV-图像分类-V2 Pangu-CV-视觉交互检测-V3 Pangu-CV-异常检测-V3 | 训练损失值    | 训练损失值是一种衡量模型预测结果和真实结果之间的差距的指标，通常情况下越小越好。 一般来说，一个正常的Loss曲线应该是单调递减的，即随着训练的进行，Loss值不断减小，直到收敛到一个较小的值。                                                                                                                                                                                                                                                                                                                                                                                            |
| Pangu-CV-物体检测-S-V2 Pangu-CV-物体检测-S-V3 Pangu-CV-目标跟踪-V3 Pangu-CV-物体检测-N-V2 Pangu-CV-实例分割-V1 Pangu-CV-图像分类-V2 Pangu-CV-视觉交互检测-V3 Pangu-CV-异常检测-V3 | 精准率      | 精准率是指在模型预测为正类的样本中，真正类样本的比例。数值越高，表明模型在检测正类样本时的准确性越高。 公式： ![](https://support.huaweicloud.com/usermanual-pangulm/zh-cn_formulaimage_0000002571206666.png) - TP（True Positive）：真正为正类且被预测为正类的样本数。  - FP（False Positive）：实际为负类但被预测为正类的样本数。          |
| Pangu-CV-物体检测-S-V2 Pangu-CV-物体检测-S-V3 Pangu-CV-目标跟踪-V3 Pangu-CV-物体检测-N-V2 Pangu-CV-实例分割-V1 Pangu-CV-图像分类-V2 Pangu-CV-视觉交互检测-V3 Pangu-CV-异常检测-V3 | 召回率      | 召回率是指在所有实际为正类的样本中，被模型正确预测为正类的比例。数值越高，表明模型在检测正类样本时的全面性越高。 公式： ![](https://support.huaweicloud.com/usermanual-pangulm/zh-cn_formulaimage_0000002571047056.png) - FN（False Negative）：实际为正类但被预测为负类的样本数。                                                                                                           |
| Pangu-CV-语义分割-V2                                                                                                                                                                                                                                                                                                                                                                       | 训练损失值    | 训练损失值是一种衡量模型预测结果和真实结果之间的差距的指标，通常情况下越小越好。 一般来说，一个正常的Loss曲线应该是单调递减的，即随着训练的进行，Loss值不断减小，直到收敛到一个较小的值。                                                                                                                                                                                                                                                                                                                                                                                            |
| Pangu-CV-语义分割-V2                                                                                                                                                                                                                                                                                                                                                                       | 平均交并比    | 平均交并比是所有类别的交并比的平均值。数值越高，表明模型在所有类别上的性能越好。 公式： ![](https://support.huaweicloud.com/usermanual-pangulm/zh-cn_formulaimage_0000002571206670.png) 计算的是预测区域与真实区域的交集除以并集。对于每个类别，计算IoU，然后取平均，单类别IoU = TP / (TP + FP + FN)，然后取所有类别的平均值。                                                                                                                                                                                             |
| Pangu-CV-语义分割-V2                                                                                                                                                                                                                                                                                                                                                                       | 像素精度     | 像素精度表示模型正确分类的像素数量占总像素数量的比例。数值越高，表明模型性能越好。 公式： ![](https://support.huaweicloud.com/usermanual-pangulm/zh-cn_formulaimage_0000002571047060.png) 指所有预测正确的像素数除以总像素数，TP / Total Pixels。                                                                                                                                                                                                                                        |
| Pangu-CV-语义分割-V2                                                                                                                                                                                                                                                                                                                                                                       | 平均精度     | 平均精度用于衡量模型在不同类别上的检测准确率。数值越高，表明模型性能越好。 公式： ![](https://support.huaweicloud.com/usermanual-pangulm/zh-cn_formulaimage_0000002601606253.png) 计算TP / (TP + FP)作为每个类别的精度，然后取平均。                                                                                                                                                                                                                                                  |
| Pangu-CV-语义分割-V2                                                                                                                                                                                                                                                                                                                                                                       | 平均Dice系数 | Dice系数是一种集合相似度度量指标，用于衡量两个样本的重叠程度。值越高说明模型预测的分割结果与真实结果在形状和位置上有较高的相似度。 公式： ![](https://support.huaweicloud.com/usermanual-pangulm/zh-cn_formulaimage_0000002601726191.png) 单类别Dice=2TP / (2TP + FP + FN)，它和IoU类似，但更强调交集，对于每个类别计算Dice，然后取平均。                                                                                                                                                                               |
| Pangu-CV-语义分割-V2                                                                                                                                                                                                                                                                                                                                                                       | F1分数     | F1 分数是精确率和召回率的调和平均数，用于评估模型在同时考虑准确性和完整性方面的性能。F1 分数越高，模型性能越好。 公式： ![](https://support.huaweicloud.com/usermanual-pangulm/zh-cn_formulaimage_0000002571206684.png) F1分数是精确率和召回率的调和平均，单类别F1=2PR / (P + R)，每个类别计算F分数，然后取平均。                                                                                                                                                                                                    |
| Pangu-CV-语义分割-V2                                                                                                                                                                                                                                                                                                                                                                       | 精准率      | 精准率是指在模型预测为正类的样本中，真正类样本的比例。数值越高，表明模型在检测正类样本时的准确性越高。 公式： ![](https://support.huaweicloud.com/usermanual-pangulm/zh-cn_formulaimage_0000002571206664.png) - TP（True Positive）：真正为正类且被预测为正类的样本数。  - FP（False Positive）：实际为负类但被预测为正类的样本数。   |
| Pangu-CV-语义分割-V2                                                                                                                                                                                                                                                                                                                                                                       | 召回率      | 召回率是指在所有实际为正类的样本中，被模型正确预测为正类的比例。数值越高，表明模型在检测正类样本时的全面性越高。 公式： ![](https://support.huaweicloud.com/usermanual-pangulm/zh-cn_formulaimage_0000002571047036.png) - FN（False Negative）：实际为正类但被预测为负类的样本数。                                                                                                           |
   
#### 获取训练日志
单击训练任务名称，可以在"日志"页面查看训练过程中产生的日志。
对于训练异常或失败的任务可以通过训练日志定位训练失败的原因。典型训练报错和解决方案请参见[CV大模型训练常见报错与解决方案](https://support.huaweicloud.com/usermanual-pangulm/pangulm_04_0248.html)。
训练日志可以按照不同的节点（训练阶段）进行筛选查看。分布式训练时，任务被分配到多个工作节点上进行并行处理，每个工作节点负责处理一部分数据或执行特定的计算任务。日志也可以按照不同的工作节点（如worker-0表示第一个工作节点）进行筛选查看。
图2获取训练日志   
![](https://support.huaweicloud.com/usermanual-pangulm/zh-cn_image_0000002601726213.png)
#### 训练异常定位方法
模型训练失败时，您可以按照如下定位思路对训练任务做初步定位。
1. 在训练任务列表查看任务失败原因。 模型启动训练后，可以在模型训练列表中查看训练任务的状态，当任务状态为"失败"时，可将鼠标放置在"失败"上，可以查看到任务失败的概要信息。
   图3查看失败概要信息   
   ![](https://support.huaweicloud.com/usermanual-pangulm/zh-cn_image_0000002601726201.png) 
2. 单击任务名，进入任务详情页查看训练任务运行关键事件信息。 单击"事件"页签，可查看训练任务子任务运行事件，通过事件可以观察到当前任务的运行情况。事件可以按照"正常、异常、告警"三类事件类型过滤。
   图4查看训练任务事件   
   ![](https://support.huaweicloud.com/usermanual-pangulm/zh-cn_image_0000002571206688.png) 
3. 获取当前任务运行的worker、workerIP以及任务异常退出时的节点和退出码信息。 在ModelArts Studio训练任务页面单击需要查看的任务名，进入"任务详情"页，在"工作流节点详情"下可以查看到当前任务所运行的节点及IP信息。
   ![](https://support.huaweicloud.com/usermanual-pangulm/zh-cn_image_0000002571206672.png)
   
4. 当训练任务运行失败时，可查看"模型训练详情 \> 基本信息 \> 状态"，单击"查看失败节点列表"获取训练任务故障节点及退出码信息。 ![](https://support.huaweicloud.com/usermanual-pangulm/zh-cn_image_0000002601606223.png)
   
5. 训练作业遇到问题时，可查看"模型训练详情 \> 日志"，多数场景下的问题可以通过日志报错信息直接定位。 如果训练作业运行失败，ModelArts Studio会自动识别导致作业失败的原因，在训练日志界面上给出提示并对部分常见训练错误给出分析建议。包括失败的可能原因和推荐的解决方案。
   图5训练错误分析建议   
   ![](https://support.huaweicloud.com/usermanual-pangulm/zh-cn_image_0000002601726199.png)
   ![](https://support.huaweicloud.com/usermanual-pangulm/public_sys-resources/note_3.0-zh-cn.png)
   针对分布式作业，只会显示当前节点的一个分析结果，作业的失败需要综合各个节点的失败原因做综合判断。
   
 
