
# ALM-19030 RegionServer的RPC请求处理时间的P99超过阈值
#### 告警解释
系统每30秒周期性检测每个HBase服务的RegionServer实例的RPC请求处理时间的P99，当检测到某个RegionServer上的RPC请求处理时间的P99连续10次超出阈值时产生该告警。
当RegionServer实例的RPC请求处理时间的P99小于或等于阈值时，告警消除。
本章节仅适用于MRS 3.3.1-LTS及之后版本。
#### 告警属性
| 告警ID  | 告警级别                                                                               | 是否可自动清除 |
|:---|:---|:---|
| 19030 | 紧急（默认阈值为10秒） 重要（默认阈值为5秒） | 是       |
   
#### 告警参数
| 类别   | 参数名称      | 参数含义       |
|:---|:---|:---|
| 定位信息 | 来源        | 产生告警的集群名称。 |
| 定位信息 | 服务名       | 产生告警的服务名称。 |
| 定位信息 | 角色名       | 产生告警的角色名称。 |
| 定位信息 | 主机名       | 产生告警的主机名。  |
| 附加信息 | Threshold | 产生告警的阈值。   |
   
#### 对系统的影响
RegionServer RPC处理时间的P99超过阈值，会影响RegionServer对外提供服务的能力。对于时延敏感型业务，可能会导致大量的业务读写请求超时。
#### 可能原因
- RegionServer GC时间过长。
- HDFS RPC响应时间过长。
- 客户端请求不合理（大请求、高并发）。
 
#### 处理步骤
1. 在FusionInsight Manager首页，选择"运维 \> 告警 \> 告警"，查看"告警ID"为"19030"的告警的"定位信息"中上报该告警的服务实例和主机名，单击主机名并记录该主机的业务IP地址。
**检查RegionServer的GC时间。**
2. 在FusionInsight Manager的告警列表中，查看[步骤 1]中的告警实例是否有"HBase GC时间超出阈值"告警产生。
   
   - 是，执行[步骤 3]。
   
   - 否，执行[步骤 5]。
   
   
   
   
3. 参考"ALM-19007 HBase GC时间超出阈值"的处理步骤处理该故障。
4. 等待几分钟后，在告警列表中查看该告警是否清除。 
   - 是，处理完毕。
   
   - 否，执行[步骤 5]。
   
   
   
   
**检查HDFS RPC响应时间。**
5. 在FusionInsight Manager的告警列表中，查看HBase依赖的HDFS服务的DataNode实例是否有告警产生，或上报告警节点是否存在"慢盘故障"、"磁盘不可用"或"NameNode RPC处理平均时间超过阈值"告警。
   
   - 是，执行[步骤 6]。
   
   - 否，执行[步骤 8]。
   
   
   
   
6. 参考HDFS服务的DataNode告警、"ALM-12033 慢盘故障"、"ALM-12063 磁盘不可用"或"ALM-14021 NameNode RPC处理平均时间超过阈值"的处理步骤处理该故障。
7. 等待几分钟后，在告警列表中查看该告警是否清除。 
   - 是，处理完毕。
   
   - 否，执行[步骤 8]。
   
   
   
   
8. 登录告警上报节点，执行**iostat -x 2** 命令查看磁盘IO，查看回显中各磁盘"util"列的值是否大于90%。
   
   - 是，执行[步骤 9]。
   
   - 否，执行[步骤 11]。
   
   
   
   
9. 选择"集群 \> 服务 \> HDFS \> 实例"，勾选上报告警所在节点的DataNode实例，选择"更多 \> 停止实例"，输入当前登录用户密码，单击"确定"停止DataNode实例。
10. 等待几分钟后，在告警列表中查看该告警是否清除。 
    - 是，处理完毕。
    
    - 否，执行[步骤 11]。
    
    
    
    
**检查RegionServer并发数。**
11. 在FusionInsight Manager的告警列表中，查看[步骤 1]中的告警实例是否有"RegionServer handler 使用率超过阈值"告警产生。
    
    - 是，执行[步骤 12]。
    
    - 否，执行[步骤 14]。
    
    
    
    
12. 参考"ALM-19021 RegionServer handler 使用率超过阈值"的处理步骤处理该故障。
13. 等待几分钟后，在告警列表中查看该告警是否清除。 
    - 是，处理完毕。
    
    - 否，执行[步骤 14]。
    
    
    
    
**收集故障信息**
14. 在FusionInsight Manager界面，选择"运维 \> 日志 \> 下载"。
15. 在"服务"中勾选待操作集群的"HBase"。
16. 单击右上角的时间编辑按钮，设置日志收集的"开始时间"和"结束时间"分别为告警产生时间的前后10分钟，单击"下载"。
17. 请联系运维人员，并发送已收集的故障日志信息。
 
#### 告警清除
此告警修复后，系统会自动清除此告警，无需手工清除。
#### 参考信息
不涉及。
