# 配置RocketMQ监控告警
本章节主要介绍部分监控指标的告警策略，以及配置操作。在实际业务中，建议按照以下告警策略，配置监控指标的告警规则。
![](https://support.huaweicloud.com/usermanual-hrm/public_sys-resources/note_3.0-zh-cn.png)
**是否接近性能上限**，表示当前资源支撑的性能为告警策略中设置的告警阈值，如果继续上升，业务可能出现问题。
表1RocketMQ实例配置告警的指标 
| **指标ID**               | 指标名称                                                             | **测量对象** | 告警策略                                                                                                              | 指标说明                                                            | 告警处理建议                                                                                                                                 |
|:---|:---|:---|:---|:---|:---|
| instance_accumulation    | 消息堆积数                                                              | 实例      | 告警阈值：原始值\>积压上限的90%，积压上限由您根据业务实际情况设定。 连续触发次数：1 告警级别：重要 | 该指标用于统计RocketMQ实例中所有消费组的总堆积消息数。                                   | 出现该告警时，首先排查是否有闲置消费组，如果有，则删除。其次，可以考虑加快消费速度，例如增加组内消费者数量。                                                                                  |
| broker_disk_usage      | 磁盘容量使用率                                                          | 节点       | 告警阈值：原始值\>85 连续触发次数：3 告警级别：紧急                              | 该指标为从RocketMQ节点虚拟机层面采集的磁盘容量使用率。单位：%。                            | 出现该告警时，说明当前实例规格已不足以承载业务，需要扩容**存储空间** 。具体操作，请参考[变更实例规格](https://support.huaweicloud.com/usermanual-hrm/hrm-ug-038.html)。                  |
| broker_cpu_usage         | CPU使用率                                                             | 节点       | 告警阈值：原始值\>80 连续触发次数：3 告警级别：重要                                  | 该指标为从RocketMQ节点虚拟机层面采集的CPU使用率。                                    | 出现该告警时，先检查该监控是否长期处于接近或超过告警阈值状态，如果是，需要扩容实例**代理个数** 。具体操作，请参考[变更实例规格](https://support.huaweicloud.com/usermanual-hrm/hrm-ug-038.html)。  |
| broker_disk_read_await  | 磁盘平均读操作耗时 （RocketMQ 4.8.0版本才显示此监控项） | 节点       | 告警阈值：原始值\>20 连续触发次数：3 告警级别：重要                             | 该指标为从RocketMQ节点磁盘读时延，当磁盘性能到达上限时，磁盘读、写时延会上升，导致RocketMQ生产、消费时延增大。 | 出现该告警时，先检查该监控是否长期处于接近或超过告警阈值状态，如果是，需要扩容实例**代理个数** 。具体操作，请参考[变更实例规格](https://support.huaweicloud.com/usermanual-hrm/hrm-ug-038.html)。 |
| broker_disk_write_await | 磁盘平均写操作耗时 （RocketMQ 4.8.0版本才显示此监控项）    | 节点      | 告警阈值：原始值\>20 连续触发次数：3 告警级别：重要                          | 该指标为从RocketMQ节点磁盘写时延，当磁盘性能到达上限时，磁盘读、写时延会上升，导致RocketMQ生产、消费时延增大。 | 出现该告警时，先检查该监控是否长期处于接近或超过告警阈值状态，如果是，需要扩容实例**代理个数** 。具体操作，请参考[变更实例规格](https://support.huaweicloud.com/usermanual-hrm/hrm-ug-038.html)。    |
   
#### 操作视频
本视频演示配置RocketMQ监控告警通知的操作。
因产品功能演进，操作界面可能存在差异，相关视频仅供参考，具体以实际环境为准。
<video controls="controls" preload="none" id="object1670743284210" class="idp-external-video" src="https://res-video.hc-cdn.com/cloudbu-site/china/zh-cn/support/rocketmq-video/RocketMQAlarm.mp4" title="配置告警通知" poster="https://support.huaweicloud.com/usermanual-hrm/zh-cn_image_0000002490046896.jpg" height="300.0000" width="600.0000"></video>
#### 配置RocketMQ监控告警
1. 登录[RocketMQ实例控制台](https://console.huaweicloud.com/dms/?engine=reliability&locale=zh-cn#/queue/manager/instances)。
2. 在RocketMQ实例名称后，单击"查看监控数据"。 
   进入云监控该实例的监控指标页面。
   
   
3. 在实例监控指标页面中，找到需要创建告警的指标项，鼠标移动到指标区域，然后单击指标右上角的![](https://support.huaweicloud.com/usermanual-hrm/zh-cn_image_0000001160616010.png)，创建告警规则。
   
   跳转到创建告警规则页面。
   
   
4. 在告警规则页面，设置告警信息。 
   创建告警规则操作，请参见[创建告警规则](https://support.huaweicloud.com/usermanual-ces/zh-cn_topic_0084572213.html)。
   1. 设置告警名称和告警的描述。
   
   2. 设置告警策略和告警级别。 如下图所示，在进行指标监控时，如果连续3次周期，磁盘容量使用率原始值超过85%，则产生告警，如果未及时处理，则产生告警通知。
      图1设置告警策略和告警级别   
      ![](https://support.huaweicloud.com/usermanual-hrm/zh-cn_image_0000001991308969.png "点击放大") 
   
   3. 设置"发送通知"开关。当开启时，设置告警生效时间、产生告警时通知的对象以及触发的条件。
   
   4. 单击"立即创建"，等待创建告警规则成功。
   
   
   
   
 
#### 相关文档
Topic监控数据无法正常展示的处理方法请参见[云监控无法展示Topic监控数据？](https://support.huaweicloud.com/hrm-faq/hrm_faq_014.html)。
