
# ALM-45001 HetuEngine计算实例故障
#### 告警解释
系统每60秒周期性检测HetuEngine计算实例状态，当检测到HetuEngine服务存在故障计算实例时产生该告警。
HetuEngine故障计算实例全部恢复时，告警清除。
本章节仅适用于MRS 3.2.0-LTS及之后版本。
#### 告警属性
| 告警ID  | 告警级别 | 是否自动清除 |
|:---|:---|:---|
| 45001 | 重要   | 是      |
   
#### 告警参数
| 参数名称 | 参数含义       |
|:---|:---|
| 来源   | 产生告警的集群名称。 |
| 服务名  | 产生告警的服务名称。 |
| 角色名  | 产生告警的角色名称。 |
| 主机名  | 产生告警的主机名。  |
   
#### 对系统的影响
用户提交到HetuEngine该故障计算实例的SQL任务会执行失败。
#### 可能原因
- HDFS服务异常
- Yarn服务异常
- Yarn队列资源不足
- 计算实例进程故障
- 计算实例Worker个数为0
- 计算实例资源配置过小
 
#### 处理步骤
**检查HDFS服务状态。**
1. 在Manager首页，选择"运维 \> 告警 \> 告警"，在告警列表中，查看是否有"ALM-14000 HDFS服务不可用"告警产生。 
   登录集群Manager具体操作，请参考[访问MRS集群Manager](https://support.huaweicloud.com/usermanual-mrs/mrs_01_0128.html)。
   - 是，执行[步骤 2]。
   
   - 否，执行[步骤 4]。
   
   
   
   
2. 参考[ALM-14000 HDFS服务不可用](https://support.huaweicloud.com/usermanual-mrs/ALM-14000.html)告警帮助指导处理该告警。
3. 在告警列表中，查看"ALM-45001 HetuEngine计算实例故障"告警是否清除。 
   - 是，处理完毕。
   
   - 否，执行[步骤 4]。
   
   
   
   
**检查Yarn服务状态。**
4. 在告警列表中，查看是否有"ALM-18000 Yarn服务不可用"告警产生。
   
   - 是，执行[步骤 5]。
   
   - 否，执行[步骤 7]。
   
   
   
   
5. 参考[ALM-18000 Yarn服务不可用](https://support.huaweicloud.com/usermanual-mrs/ALM-18000.html)告警帮助指导处理该告警。
6. 在告警列表中，查看"ALM-45001 HetuEngine计算实例故障"告警是否清除。 
   - 是，处理完毕。
   
   - 否，执行[步骤 7]。
   
   
   
   
**检查Yarn队列资源状态。**
7. 在告警列表中，查看是否有"ALM-18022 Yarn队列资源不足"告警产生。
   
   - 是，执行[8]。
   
   - 否，执行[步骤 10]。
   
   
   
   
8. 参考[ALM-18022 Yarn队列资源不足](https://support.huaweicloud.com/usermanual-mrs/ALM-18022.html)告警帮助指导处理该告警。
9. 在告警列表中，查看"ALM-45001 HetuEngine计算实例故障"告警是否清除。 
   - 是，处理完毕。
   
   - 否，执行[步骤 10]。
   
   
   
   
**检查** **HetuEngine** **计算实例状态** **。**
10. 使用可访问HetuEngine WebUI界面的管理员用户登录Manager，选择"集群 \> 服务 \> HetuEngine"，进入HetuEngine服务页面。
11. 在"概览"页签下的"基本信息"区域，单击"HSConsole WebUI"后的链接，进入HSConsole界面。
12. 在"计算实例"页面，查看是否存在状态为"故障"的计算实例。 
    - 是，执行[步骤 13]。
    
    - 否，执行[步骤 15]。
    
    
    
    
13. 选中状态为"故障"的计算实例，单击"重启"，等待实例重启完成。
14. 在告警列表中，查看"ALM-45001 HetuEngine计算实例故障"告警是否清除。 
    - 是，处理完毕。
    
    - 否，执行[步骤 15]。
    
    
    
    
**检查** **HetuEngine** **计算实例Worker个数是否为0**。
15. 在"计算实例"页面，单击租户名旁边的![](https://support.huaweicloud.com/usermanual-mrs/zh-cn_image_0000002654921593.png "点击放大")，查看是否存在Worker个数为0的计算实例。
    
    - 是，执行[步骤 16]。
    
    - 否，执行[步骤 18]。
    
    
    
    

16. 在对应计算实例的"操作"列中，单击"重启"，等待实例重启完成。
17. 在告警列表中，查看"ALM-45001 HetuEngine计算实例故障"告警是否清除。 
    - 是，处理完毕。
    
    - 否，执行[步骤 18]。
    
    
    
    
**检查计算实例资源配置是否合理**。
18. 使用可访问HetuEngine WebUI界面的管理员用户登录Manager。
19. 选择"运维 \> 告警 \> 告警 \> HetuEngine计算实例任务积压"，检查该告警的"附加信息"，查看并记录告警上报的租户名。
20. 选择"集群 \> 服务 \> HetuEngine"，在"概览"页签下的"基本信息"区域，单击"HSConsole Web UI"后的链接，进入HSConsole界面。
21. 在"计算实例"页签，单击对应计算实例所属租户名"操作"列的"配置"，查看该计算实例的资源配置是否合理（默认资源配置为最小化配置，可以根据实际需求调节）。 
    - 是，执行[步骤 25]。
    
    - 否，执行[步骤 22]。
    
    
    
    
22. 返回计算实例列表，单击"停止实例"，根据界面提示停止计算实例。
    
    ![](https://support.huaweicloud.com/usermanual-mrs/public_sys-resources/warning_3.0-zh-cn.png)
    停止计算实例会影响提交到该计算实例上的业务。
    
    
23. 单击"配置"，根据实际情况增加计算实例的资源配置，配置完成后单击"确定"，单击"启动实例"，根据界面提示启动实例。
24. 等待2分钟，查看告警是否清除。 
    - 是，处理完毕。
    
    - 否，执行[步骤 25]。
    
    
    
    
**收集故障信息。**
25. 在Manager界面，选择"运维 \> 日志 \> 下载"。
26. 在"服务"中勾选操作集群的"HetuEngine"，单击"确定"。
27. 在"主机"中勾选对应角色所在的主机，单击"确定"。
28. 单击右上角的![](https://support.huaweicloud.com/usermanual-mrs/zh-cn_image_0000001365916513.png)，设置日志收集的"开始时间"和"结束时间"，分别为告警产生时间的前后30分钟，单击"下载"。
29. 请联系运维人员，并发送已收集的故障日志信息。
 
#### 告警清除
此告警修复后，系统会自动清除此告警，无需手工清除。
#### 参考信息
无。
