# 实现NPU指标的全面监控
#### 应用场景
当集群中包含NPU节点时，监控NPU指标可以帮助用户识别性能瓶颈、优化资源利用率、快速定位异常，从而提升系统的整体稳定性和效率。在CCE Standard和Turbo集群中，您可以使用[npu-exporter](https://gitee.com/ascend/ascend-npu-exporter)组件将dcmi/hccn tool采集的NPU指标数据上传至云原生监控系统，实现NPU资源的实时监控与告警，从而提升系统的可靠性和性能。npu-exporter组件共支持采集73个NPU指标（如健康状态、功耗、温度等），通过这些指标您可以全面了解NPU状况。关于NPU指标的更多信息，请参见[NPU指标说明](https://support.huaweicloud.com/usermanual-cce/cce_10_0970.html)。
本文将进一步为您介绍如何启用npu-exporter组件以及如何对NPU指标进行实时监控。
图1NPU指标获取流程   
![](https://support.huaweicloud.com/usermanual-cce/zh-cn_image_0000002230918842.png)
#### 前提条件
- 集群中已有[AI加速型](https://support.huaweicloud.com/usermanual-cce/cce_10_0719.html#cce_10_0719__section84136569358)节点，且已安装24.x及以上的NPU驱动。
  ![](https://support.huaweicloud.com/usermanual-cce/public_sys-resources/caution_3.0-zh-cn.png)
  驱动升级时要求节点上有配套的NPU固件，**重新安装驱动将涉及节点重启** ，建议在安装驱动前排空节点，具体操作请参见[节点排水](https://support.huaweicloud.com/usermanual-cce/cce_10_0605.html)。虚拟机不支持固件升级。
  如果驱动升级失败，请查看文档"常见问题 \> 模板插件 \> NPU驱动升级失败如何解决？"。
  
- 集群中已安装CCE AI 套件 (Ascend NPU)，且版本在2.1.55及以上，具体安装步骤请参见[CCE AI套件（Ascend NPU）](https://support.huaweicloud.com/usermanual-cce/cce_10_0239.html)。
- 集群中已安装云原生监控插件，且版本在3.12.1及以上，具体安装步骤请参见[云原生监控插件](https://support.huaweicloud.com/usermanual-cce/cce_10_0406.html)。如果您需要将NPU指标上传至AOM，请在云原生监控插件中启用"监控数据上报至AOM服务"。
- 如果您需要通过Grafana创建NPU相关仪表盘，请在集群中提前安装Grafana插件并启用"公网访问"，具体安装步骤请参见[安装Grafana](https://support.huaweicloud.com/usermanual-cce/cce_10_0828.html)。
 
#### 操作流程
| 操作步骤                                                         | 步骤说明                                                                          | 费用说明                                                                                                                                                                                                                                                                                                                                                           |
|:---|:---|:---|
| [步骤一：启用npu-exporter组件]   | 启用npu-exporter组件后，系统可以监控和收集NPU指标数据，并以Prometheus兼容的格式暴露指标数据。                   | 不涉及费用。                                                                                                                                                                                                                                                                                                                                                          |
| [步骤二：采集NPU指标信息]        | 默认情况下，npu-exporter暴露的指标不会被云原生监控插件自动采集和上报，需要在安装云原生监控插件之后，前往"配置中心"手动开启相关数据采集功能。 | 不涉及费用。                                                                                                                                                                                                                                                                                                                                                        |
| [步骤三：在AOM中查看NPU指标]     | 可选步骤，如果您需要在AOM中查看NPU指标信息，请查看此步骤。                                             | 本文采集的NPU指标属于自定义指标，上传至AOM会涉及一定费用，具体请参见[价格详情](https://www.huaweicloud.com/pricing.html#/aom)。                                                                                                                                                                                                                                                                   |
| [步骤四：使用Grafana查看NPU指标信息] | 可选步骤，如果您需要通过Grafana仪表盘实时监控NPU性能数据，请查看此步骤。                                     | - 如果使用AOM数据源，则NPU指标需上传至AOM。NPU指标属于自定义指标，上传至AOM会涉及一定费用，具体费用请参见[价格详情](https://www.huaweicloud.com/pricing.html#/aom)。  - 如果使用Prometheus数据源，可能需要创建云硬盘资源，具体费用请参见[价格计算器](https://www.huaweicloud.com/pricing/calculator.html#/evs)。   |
| [步骤五：关闭npu-exporter组件]   | 可选步骤，如果npu-exporter组件使用完成，可以选择关闭该组件。                                           | 不涉及费用                                                                                                                                                                                                                                                                                                                                                          |
   
 #### 步骤一：启用npu-exporter组件
npu-exporter组件用于监控和收集NPU指标数据，并以Prometheus兼容的格式暴露指标数据，便于用户通过Prometheus等监控系统对NPU进行监控和告警。当CCE AI套件（Ascend NPU）插件版本为2.1.55及以上时，支持使用npu-exporter组件，配置的具体步骤如下：
1. 登录[CCE控制台](https://console.huaweicloud.com/cce2.0/?#/cce/cluster/list)，单击集群名称进入集群"概览"页。在左侧导航栏中选择"插件中心"，在右侧找到**CCE AI套件（Ascend NPU）** **插件**，单击"编辑"。
2. 在"编辑插件"页面的"指标观测 \> 启用npu-exporter组件进行NPU指标观测"中单击![](https://support.huaweicloud.com/usermanual-cce/zh-cn_image_0000002487701734.png "点击放大")，右下角单击"确定"。此时，插件将以DaemonSet形式在NPU节点上部署npu-exporter组件，从而实现NPU指标观测。
   
   图2启用npu-exporter组件   
   ![](https://support.huaweicloud.com/usermanual-cce/zh-cn_image_0000002372478101.png "点击放大")
   
   
   
3. 待插件状态为运行中后，在CCE AI套件（Ascend NPU）插件模块单击"插件详情"，并切换至实例列表。若实例列表中，存在npu-exporter-xxx实例且状态为运行中，则说明npu-exporter组件启用成功。
 
 #### 步骤二：采集NPU指标信息
默认情况下，npu-exporter暴露的指标不会被云原生监控插件自动采集和上报。您需要在安装云原生监控插件之后，前往"配置中心"手动开启相关数据采集功能，具体存在以下两种情形：
- 未开启"系统预置采集"：如果安装云原生插件后暂未在"配置中心"开启"系统预置采集"，则可以在"配置中心"的ServiceMonitor开启npu-exporter数据采集。
- 已开启"系统预置采集"：如果安装云原生监控插件后已在"配置中心"中开启"系统预置采集"，则需要在"系统预置采集"中开启npu-exporter数据采集。
 
- [未开启系统预置采集]
  如果您安装云原生插件后暂未在"配置中心"开启"系统预置采集"，请参考本节步骤配置。
  1. 登录[CCE控制台](https://console.huaweicloud.com/cce2.0/?#/cce/cluster/list)，单击集群名称进入集群。
  
  2. 在左侧导航栏中选择"集群 \> 配置中心"，切换至"监控运维配置"页签。在"采集配置"中找到"ServiceMonitor"，单击"管理"。
  
  3. 在"采集配置"页面中单击搜索栏，选择"名称"，在下拉框中单击"npu-exporter"，并在搜索结果中选择"启用"。 
     图3ServiceMonitor   
     ![](https://support.huaweicloud.com/usermanual-cce/zh-cn_image_0000002248190126.png "点击放大")
     
     
     
   
- [已开启系统预置采集]
  如果您已在"配置中心"启用了"系统预置采集"功能，系统预置的ServiceMonitor和PodMonitor将被删除，导致无法通过ServiceMonitor上报npu-exporter暴露的NPU指标数据。若您需要采集npu-exporter的相关监控数据，请按照以下步骤配置：
  1. 登录[CCE控制台](https://console.huaweicloud.com/cce2.0/?#/cce/cluster/list)，单击集群名称进入集群。
  
  2. 在左侧导航栏单击"集群 \> 配置中心"，在右侧切换至"监控运维配置"页签。在"采集配置 \> 系统预置采集"中单击"管理"。
  
  3. 在"采集配置"页面单击搜索栏，选择任务名称，在下拉框中选择"npu-exporter"。在搜索结果的"指标采集"列选择"采集全量指标"，并选择"启用"。 
     图4系统预置采集   
     ![](https://support.huaweicloud.com/usermanual-cce/zh-cn_image_0000002248173858.png "点击放大")
     
     
     
   
 #### 步骤三：在AOM中查看NPU指标
如果您需要在AOM中查看NPU指标信息，请确保已在云原生监控插件中开启"监控数据上报至AOM服务"。此处采集的NPU指标属于自定义指标，上传至AOM会涉及一定费用，具体请参见[价格详情](https://www.huaweicloud.com/pricing.html#/aom)。
1. 进入AOM管理页面，在左侧导航栏单击"实例列表"，在右侧页面选择所上报的AOM实例。
   图5AOM实例   
   ![](https://support.huaweicloud.com/usermanual-cce/zh-cn_image_0000002283334713.png "点击放大")
   
   
2. 进入"指标管理"，在上方"集群"中选择使用的集群名称，在搜索栏输入"NPU"，查看NPU指标。
 
 #### 步骤四：使用Grafana查看NPU指标信息
Grafana仪表盘可实时监控NPU性能数据，并支持灵活配置，帮助您快速发现异常、定位问题，提升运维效率。您可以通过AOM数据源或Prometheus数据源对接Grafana，具体如下：
- 使用AOM数据源：需要在云原生监控插件中启用"监控数据上报至AOM服务"，并在Grafana插件中启用"数据源对接AOM"，同时**确保两者选择的AOM实例一致**。此时，Grafana将自动生成"prometheus-aom"数据源。
- 使用Prometheus数据源：需要在云原生监控插件中开启"本地存储模式"，此时可直接使用Grafana自带的"prometheus"数据源。
1. 测试数据源的连通性。需要保证"prometheus-aom"或"prometheus"数据源与Grafana的连通性，连通性测试通过才可在Grafana中使用相关数据源。 
   1. 在集群左侧导航栏中，单击"集群 \> 插件"。在右侧插件列表中，在Grafana插件模块单击"访问"，进入Grafana可视化界面。
   
   2. 首次访问Grafana可视化界面，需要输入用户名和密码，默认用户名与密码均为admin。输入用户名和密码后，您可以根据界面提示重置密码。
   
   3. 在Grafana可视化界面左上角单击![](https://support.huaweicloud.com/usermanual-cce/zh-cn_image_0000002265857277.png "点击放大")，单击"Connections"左侧的![](https://support.huaweicloud.com/usermanual-cce/zh-cn_image_0000002230817922.png) ，单击"Data sources"，进入"Data sources"界面。
   
   4. 在数据源列表中，单击"prometheus-aom"或"prometheus"。在数据源页面底部单击"Save\&test"，测试数据源是否连通。若提示"Successfully queried the Prometheus API"，则说明连通测试通过。
      图6连通测试通过   
      ![](https://support.huaweicloud.com/usermanual-cce/zh-cn_image_0000002265817177.png "点击放大") 
   
   5. 官方已提供Ascend NPU Exporter仪表盘，您可以通过该仪表盘查看NPU相关指标数据。进入[ascend-npu-exporter](https://grafana.com/grafana/dashboards/20592-ascend-npu-exporter/)，在右侧单击"Download JSON"，下载仪表盘的JSON文件。
      返回Grafana可视化界面，左上角单击![](https://support.huaweicloud.com/usermanual-cce/zh-cn_image_0000002230977718.png "点击放大")，打开左侧菜单栏。单击"Dashboards"。在"Dashboards"页面右上角，单击"New"，下拉菜单中单击"Import"。在"Import dashboard"页面上传刚下载的Json文件，并在"Prometheus"中选择"prometheus-aom"或"prometheus"数据源，单击"Import"。
      Grafana导入Dashboard的更多方法，请参见[Manage dashboards](https://grafana.com/docs/grafana/latest/dashboards/manage-dashboards/#import-a-dashboard)。
      图7导入仪表盘   
      ![](https://support.huaweicloud.com/usermanual-cce/zh-cn_image_0000002265742433.png "点击放大") 
   
   6. 导入完成后，您可以直接看到对应面板。在右上角单击![](https://support.huaweicloud.com/usermanual-cce/zh-cn_image_0000002265857285.png)，即可保存看板。
      图8查看仪表盘   
      ![](https://support.huaweicloud.com/usermanual-cce/zh-cn_image_0000002230741306.png "点击放大") 
   
   
   
   
 
 #### 步骤五：关闭npu-exporter组件
待npu-exporter组件使用完成后，您可以通过以下步骤关闭组件：
1. 登录[CCE控制台](https://console.huaweicloud.com/cce2.0/?#/cce/cluster/list)，单击集群名称进入集群"概览"页。在左侧导航栏中选择"插件中心"，在右侧找到**CCE AI套件（Ascend NPU）** **插件**，单击"编辑"。
2. 在"编辑插件"页面的"指标观测 \> 启用npu-exporter组件进行NPU指标观测"中单击![](https://support.huaweicloud.com/usermanual-cce/zh-cn_image_0000002343397554.png "点击放大")，右下角单击"确定"。
3. 待插件状态为运行中后，在CCE AI套件（Ascend NPU）插件模块单击"插件详情"，并切换至实例列表。若实例列表中，npu-exporter-xxx实例消失，则说明npu-exporter组件关闭成功。
 
