
# ALM-19021 RegionServer handler 使用率超过阈值
#### 告警解释
系统每30秒周期性检测每个HBase服务实例RegionServer的handler使用率。当检测到某个RegionServer上的handler使用率超出阈值（默认连续5次超过默认阈值90%）时产生该告警。当handler使用率小于或等于阈值时，告警消除。
#### 告警属性
| 告警ID  | 告警级别 | 是否自动清除 |
|:---|:---|:---|
| 19021 | 重要   | 是      |
   
#### 告警参数
| 参数名称              | 参数含义                  |
|:---|:---|
| 来源                | 产生告警的集群名称。            |
| 服务名               | 产生告警的服务名称。            |
| 角色名               | 产生告警的角色名称。            |
| 主机名               | 产生告警的主机名。             |
| Trigger Condition | 系统当前指标取值满足自定义的告警设置条件。 |
   
#### 对系统的影响
RegionServer的handler使用率超出阈值，会影响RegionServer对外提供服务的能力，导致RegionServer处理读写的并发能力下降，业务读写时延变大或者请求失败。
#### 可能原因
- handler配置值过低。
- 请求存在热点问题。
 
#### 处理步骤
**查看告警定位信息**
1. 在FusionInsight Manager首页，选择"运维 \> 告警 \> 告警"，选择"告警ID"为"19021"的告警，查看"定位信息"中产生该告警的服务实例和主机名。
**查看handler配置**
2. 选择"集群 \> 服务 \> HBase \> 配置"，在界面右上角搜索"hbase.regionserver.handler.count"，查看RegionServer角色对应的该参数值是否过低，默认值是"200"。 
   - 是，执行[步骤 3]。
   
   - 否，执行[步骤 5]。
   
   
   
   
3. 适当调大参数值并保存配置，选择"集群 \> 服务 \> HBase \> 实例"，勾选受影响的"RegionServer"实例，选择"更多 \> 滚动重启 "，在弹出的界面中输入用户和密码，单击"确定"，在"滚动重启实例"界面单击"确定"，等待滚动重启完成，使其生效。
4. 配置生效后，在告警列表中，查看本告警是否清除。 
   - 是，处理完毕。
   
   - 否，执行[步骤 5]。
   
   
   
   
**检查集群是否存在热点问题**
5. 在FusionInsight Manager首页，选择"集群 \> 服务 \> HBase"，单击"HMaster WebUI"后的"HMaster(主)"链接，进入该HBase实例的WebUI页面，查看"Home"页签的"Region Servers"区域中的"Requests"中的"Filtered Read Request Count"和"Write Request Count"列的请求分布是否均衡。
   
   ![](https://support.huaweicloud.com/usermanual-mrs/zh-cn_image_0000001249147751.png "点击放大")
   - 是，执行[步骤 13]。
   
   - 否，执行[步骤 6]。
   
   
   
   
6. 排查Region是否分布均衡。
   
   在FusionInsight Manager首页，选择"集群 \> 服务 \> HBase"，单击"HMaster WebUI"后的"HMaster(主)"链接，打开该HBase实例的WebUI界面，查看"Home"页签的"Region Servers"区域的"Base Stats"中的"Num.Regions"列的Region分布是否均衡。
   ![](https://support.huaweicloud.com/usermanual-mrs/zh-cn_image_0000001204347802.png "点击放大")
   - 是，执行[步骤 13]。
   
   - 否，执行[步骤 7]。
   
   
   
   
7. 以**omm**用户登录故障RegionServer节点。
8. 进入客户端安装目录，配置环境变量。 
   **cd** *客户端安装目录*
   **source bigdata_env**
   如果集群采用安全版本，要执行以下命令进行安全认证：
   **kinit hbase**
   按提示输入密码（向MRS集群管理员获取密码）。
   
   
9. 执行以下命令查看目前负载均衡功能是否打开，结果显示为"true"，则表示负载均衡功能已打开。 
   **hbase shell**
   **balancer_enabled**
   ```
   hbase:004:0> balancer_enabled
   true
   Took 0.0165 seconds
   => true
   ```
   - 是，执行[步骤 13]。
   
   - 否，执行[步骤 10]。
   
   
   
   
10. 在hbase shell中执行以下命令打开负载均衡功能，并查看是否成功打开。
    
    **balance_switch true**
    **balancer_enabled**
    ![](https://support.huaweicloud.com/usermanual-mrs/public_sys-resources/note_3.0-zh-cn.png)
    建议打开和手动触发负载均衡操作在业务低峰期进行。
    
    
11. 执行以下命令手动触发负载均衡。 
    **balancer**
    
    
12. 执行完均衡后，等待一段时间，再登录FusionInsight Manager界面，选择"运维 \> 告警 \> 告警"，观察该告警是否清除。 
    - 是，处理完毕。
    
    - 否，执行[步骤 13]。
    
    
    
    
**收集故障信息**
13. 在FusionInsight Manager界面，选择"运维 \> 日志 \> 下载"。
14. 在"服务"中勾选待操作集群的"HBase"。
15. 单击右上角的![](https://support.huaweicloud.com/usermanual-mrs/zh-cn_image_0000001245784125.png)设置日志收集的"开始时间"和"结束时间"分别为告警产生时间的前后10分钟，单击"下载"。
16. 请联系运维人员，并发送已收集的故障日志信息。
 
#### 告警清除
此告警修复后，系统会自动清除此告警，无需手工清除。
#### 参考信息
无。
