
# ALM-29016 Impalad实例亚健康
#### 告警解释
MRS 3.1.5版本：系统每60秒周期性检测Impalad的Hive Server2 HTTP端口（28000）是否响应curl请求，当返回结果不正确（连续2次检测超过20秒）时产生该告警，当curl请求在20秒内正确响应时，告警恢复。
除MRS 3.1.5的其他版本：系统每60秒周期性检测Impalad是否能执行select 1，当返回结果不正确（连续2次检测超过20秒）时产生该告警，当SQL在20秒内正确执行时，告警恢复。
#### 告警属性
| 告警ID  | 告警级别                                                           | 是否可自动清除 |
|:---|:---|:---|
| 29016 | MRS 3.5.1之前版本：次要 MRS 3.5.1及之后版本：重要 | 是       |
   
#### 告警参数
| 类别   | 参数名称 | 参数含义       |
|:---|:---|:---|
| 定位信息 | 来源   | 产生告警的集群名称。 |
| 定位信息 | 服务名  | 产生告警的服务名称。 |
| 定位信息 | 角色名  | 产生告警的角色名称。 |
| 定位信息 | 主机名  | 产生告警的主机名。  |
   
#### 对系统的影响
Impalad不能执行sql或执行sql超时，会影响到数据的读写。
#### 可能原因
该Impalad服务维护的查询数量过多。
#### 处理步骤
1. 登录FusionInsight Manager，然后选择"集群 \> 服务 \> Impala \> Impalad Web UI"，单击任一个节点进入Web UI页面。
2. 在Web UI页面，单击"/backends"，查看Impala列表，找到告警上报的实例，单击"Web UI"，进入亚健康节点的Web UI后，单击"/queries"，查看任务执行情况，是否存在执行缓慢的任务。 
   - 是，执行[步骤 3]。
   
   - 否，执行[步骤 4]
   
   
   
   
3. 等待任务执行完成，查看告警是否清除。
   
   - 是，操作结束。
   
   - 否，执行[步骤 4]。
   
   
   
   
4. 在FusionInsightManager首页，选择"集群 \> Impala \> 实例 \> 告警上报的Impala实例 \> 更多 \> 重启实例"，查看告警是否清除。
   
   - 是，操作结束。
   
   - 否，执行[步骤 5]。
     ![](https://support.huaweicloud.com/usermanual-mrs/public_sys-resources/note_3.0-zh-cn.png)
     重启全部实例，服务不可用。重启单个实例，会导致当前实例节点正在执行的任务失败，服务可用。
     
   
   
   
   
**收集故障信息**
5. 在主备集群的FusionInsight Manager首页，选择"运维 \> 日志 \> 下载"。
6. 在"服务"中勾选待操作集群的"Impala"。
7. 单击右上角的![](https://support.huaweicloud.com/usermanual-mrs/zh-cn_image_0000001847724429.png)设置日志收集的"开始时间"和"结束时间"分别为告警产生时间的前后10分钟，单击"下载"。
8. 请联系运维人员，并发送已收集的故障日志信息。
 
#### 告警清除
此告警修复后，系统会自动清除此告警，无需手工清除。
#### 参考信息
不涉及。
