
# ALM-19011 RegionServer的Region数量超出阈值
#### 告警解释
系统每30秒周期性检测每个HBase服务实例中每个RegionServer的Region数。该指标可以在HBase服务监控界面和RegionServer角色监控界面查看，当检测到某个RegionServer上的Region数超出阈值（默认连续20次超过默认阈值2000）时产生该告警。用户可通过"运维 \> 告警 \> 阈值设置\> 服务 \> HBase"修改阈值。当Region数小于或等于阈值时，告警消除。
#### 告警属性
| 告警ID  | 告警级别 | 是否自动清除 |
|:---|:---|:---|
| 19011 | 重要   | 是      |
   
#### 告警参数
| 参数名称 | 参数含义       |
|:---|:---|
| 来源   | 产生告警的集群名称。 |
| 服务名  | 产生告警的服务名称。 |
| 角色名  | 产生告警的角色名称。 |
| 主机名  | 产生告警的主机名。  |
   
#### 对系统的影响
RegionServer的Region数超出阈值，过多的Region会加剧RegionServer的负载，使得内存、磁盘IO、CPU等资源出现瓶颈，最终导致请求响应变慢，甚至超时。
#### 可能原因
- RegionServer的Region分布不均衡。
- HBase集群规模过小。
 
#### 处理步骤
**查看告警定位信息**
1. 在FusionInsight Manager首页，选择"运维 \> 告警 \> 告警"，选中"告警ID"为"19011"的告警，查看"定位信息"中产生该告警的服务实例和主机名。
2. 在FusionInsight Manager首页，选择"集群 \> 服务 \> HBase"，单击"HMaster(主)"，打开该HBase实例的WebUI，查看RegionServer上Region分布是否均衡。 
   ![](https://support.huaweicloud.com/usermanual-mrs/public_sys-resources/note_3.0-zh-cn.png)
   **admin**用户默认不具备其他组件的管理权限，如果访问组件原生界面时出现因权限不足而打不开页面或内容显示不全时，可手动创建具备对应组件管理权限的用户进行登录。
   - 是，执行[步骤 9]。
   
   - 否，执行[步骤 3]。
   
   
   图1HBase的WebUI   
   ![](https://support.huaweicloud.com/usermanual-mrs/zh-cn_image_0000001575365000.png "点击放大")
   
   
**负载均衡**
3. 以**root** 用户登录HBase客户端所在节点，用户密码为安装前用户自定义，请咨询系统管理员。
   
   集群节点登录可参考[登录MRS集群节点](https://support.huaweicloud.com/usermanual-mrs/mrs_01_0083.html)。
   进入客户端安装目录。
   ```
   cd 客户端安装目录
   ```
   设置环境变量。
   ```
   source bigdata_env
   ```
   如果集群采用安全版本，要进行安全认证。
   ```
   kinit 具有HBase操作权限的业务用户
   ```
   按提示输入密码。
   
   
4. 执行以下命令进入hbase shell。 
   ```
   hbase shell
   ```
   查看目前负载均衡功能是否打开。
   ```
   balancer_enabled
   ```
   - 是，执行[步骤 6]。
   
   - 否，执行[步骤 5]。
   
   
   
   
5. 在hbase shell中执行命令打开负载均衡功能。
   
   ```
   balance_switch true
   ```
   查看确认成功打开：
   ```
   balancer_enabled
   ```
   
   
6. 执行命令手动触发负载均衡。
   
   ```
   balancer
   ```
   **建议打开和手动触发负载均衡操作在业务低峰期进行。**
   
   
7. FusionInsight Manager首页，选择"集群 \> 服务 \> HBase"，单击"HMaster(主)"，打开该HBase实例的WebUI，刷新页面查看Region分布是否均衡。 
   - 是，执行[步骤 8]。
   
   - 否，执行[步骤 21]。
   
   
   
   
8. 观察该告警是否清除。
   
   - 是，处理完毕。
   
   - 否，执行[步骤 9]。
   
   
   
   
**清理无用** **HBase** **表**。
9. 在FusionInsight Manager首页，选择"集群 \> 服务 \> HBase"，单击"HMaster(主)"，打开该HBase实例的WebUI，查看该HBase服务实例上存储的表并记录可删除的无用表。
10. 在hbase shell中，执行**disable** 和**drop** 命令，确认删除无用表，以减少Region数。
    
    ```
    disable '待删除表名'
    ```
    ```
    drop '待删除表名'
    ```
    ![](https://support.huaweicloud.com/usermanual-mrs/public_sys-resources/warning_3.0-zh-cn.png)
    在清理过程中，请谨慎操作，确保删除数据的准确性。
    
    
11. 在hbase shell中，执行命令查看目前负载均衡功能是否打开。 
    ```
    balancer_enabled
    ```
    - 是，执行[步骤 13]。
    
    - 否，执行[步骤 12]。
    
    
    
    
12. 在hbase shell中，执行命令打开负载均衡功能。
    
    ```
    balance_switch true
    ```
    查看确认成功打开：
    ```
    balancer_enabled
    ```
    
    
13. 在hbase shell中，执行命令手动触发负载均衡。
    
    ```
    balancer
    ```
    
    
14. 在FusionInsight Manager首页，选择"集群 \> 服务 \> HBase"，单击产生该告警的HBase服务实例，单击"HMaster(主)"，打开该HBase实例的WebUI，刷新页面查看Region分布是否均衡。 
    - 是，执行[步骤 15]。
    
    - 否，执行[步骤 21]。
    
    
    
    
15. 观察该告警是否清除。
    
    - 是，处理完毕。
    
    - 否，执行[步骤 16]。
    
    
    
    
**调整阈值**
16. 在FusionInsight Manager首页，选择"运维 \> 告警 \> 阈值设置 \> HBase \> 单个RegionServer的Region数目"，选中目前应用的规则，单击"修改"查看目前的阈值设置是否合理。
    
    - 如果过小，则根据集群实际情况，增大阈值，执行[步骤 17]。
    
    - 如果阈值设置合理，则执行[步骤 18]。
    
    
    图2单个RegionServer的Region数目   
    ![](https://support.huaweicloud.com/usermanual-mrs/zh-cn_image_0000001210221135.png "点击放大")
    
    
17. 观察该告警是否清除。
    
    - 是，处理完毕。
    
    - 否，执行[步骤 18]。
    
    
    
    
**系统扩容**
18. 对HBase集群扩容，增加节点，并在节点上增加RegionServer实例，然后按照"负载均衡"小节中，打开负载均衡功能并手动触发。
19. 在FusionInsight Manager首页，选择"集群 \> 服务"，单击产生该告警的HBase服务实例，单击"HMaster(主)"，打开该HBase实例的WebUI，刷新页面查看Region分布是否均衡。 
    - 是，执行[步骤 20]。
    
    - 否，执行[步骤 21]。
    
    
    
    
20. 观察该告警是否清除。
    
    - 是，处理完毕。
    
    - 否，执行[步骤 21]。
    
    
    
    
**收集故障信息**
21. 在主备集群的FusionInsight Manager界面，选择"运维 \> 日志 \> 下载"。
22. 在"服务"中勾选待操作集群的"HBase"。
23. 单击右上角的![](https://support.huaweicloud.com/usermanual-mrs/zh-cn_image_0263895532.png)设置日志收集的"开始时间"和"结束时间"分别为告警产生时间的前后10分钟，单击"下载"。
24. 请联系运维人员，并发送已收集的故障日志信息。
 
#### 告警清除
此告警修复后，系统会自动清除此告警，无需手工清除。
#### 参考信息
无。
