
# ALM-23001 Loader服务不可用
#### 告警解释
系统每60秒周期性检测Loader服务的可用性。当Loader服务不可用时产生该告警。当Loader服务恢复时，告警恢复。
#### 告警属性
| 告警ID  | 告警级别 | 是否自动清除 |
|:---|:---|:---|
| 23001 | 紧急   | 是      |
   
#### 告警参数
| 参数名称 | 参数含义       |
|:---|:---|
| 来源   | 产生告警的集群名称。 |
| 服务名  | 产生告警的服务名称。 |
| 角色名  | 产生告警的角色名称。 |
| 主机名  | 产生告警的主机名。  |
   
#### 对系统的影响
如果Loader服务不可用，数据加载，导入，转换的功能也不可用。
#### 可能原因
- Loader服务依赖的内部服务异常。
  - ZooKeeper服务异常。
  
  - HDFS服务异常。
  
  - DBService服务异常。
  
  - Yarn服务异常。
  
  - Mapreduce服务异常。
   
- 环境故障：网络异常，Loader服务无法与其依赖的内部服务通信，无法提供服务。
- 软件故障：Loader服务无法正常运行。
 
#### 处理步骤
**检查ZooKeeper服务状态。**
1. 在FusionInsight Manager首页，选择"集群 \> *待操作集群的名称* \> 服务 \> ZooKeeper"查看ZooKeeper的运行状态是否正常。
   
   - 是，执行[步骤 3]。
   
   - 否，执行[步骤 2]。
   
   
   
   
2. 选择"更多 \> 重启服务"重新启动ZooKeeper服务实例。重启完成后在告警列表中，查看"Loader服务不可用"告警是否清除。
   
   - 是，处理完毕。
   
   - 否，执行[步骤 3]。
   
   
   
   
3. 在FusionInsight Manager的告警列表中，查看是否有"进程故障"告警产生。
   
   - 是，执行[步骤 4]。
   
   - 否，执行[步骤 7]。
   
   
   
   
4. 在"ALM-12007 进程故障"的"定位信息"中查看"服务名"是否为"ZooKeeper"。
   
   - 是，执行[步骤 5]。
   
   - 否，执行[步骤 7]。
   
   
   
   
5. 参考[ALM-12007 进程故障](https://support.huaweicloud.com/usermanual-mrs/ALM-12007.html)的处理步骤处理该故障。
6. 在告警列表中，查看"Loader服务不可用"告警是否清除。 
   - 是，处理完毕。
   
   - 否，执行[步骤 7]。
   
   
   
   
**检查HDFS服务状态。**
7. 在FusionInsight Manager的告警列表中，查看是否有"HDFS服务不可用"告警产生。
   
   - 是，执行[步骤 8]。
   
   - 否，执行[步骤 10]。
   
   
   
   
8. 参考[ALM-14000 HDFS服务不可用](https://support.huaweicloud.com/usermanual-mrs/ALM-14000.html)的处理步骤处理该故障。
9. 在告警列表中，查看"Loader服务不可用"告警是否清除。 
   - 是，处理完毕。
   
   - 否，执行[步骤 10]。
   
   
   
   
**检查DBService服务状态。**
10. 在FusionInsight Manager首页，选择"集群 \> *待操作集群的名称* \> 服务 \> DBService"查看DBService的运行状态是否正常。
    
    - 是，执行[步骤 12]。
    
    - 否，执行[步骤 11]。
    
    
    
    
11. 选择"更多 \> 重启服务"重新启动DBService服务实例。重启完成后在告警列表中，查看"Loader服务不可用"告警是否清除。
    
    - 是，处理完毕。
    
    - 否，执行[步骤 12]。
    
    
    
    
**检查Mapreduce服务状态。**
12. 在FusionInsight Manager首页，选择"集群 \> *待操作集群的名称* \> 服务 \> Mapreduce"查看Mapreduce的运行状态是否正常。
    
    - 是，执行[步骤 16]。
    
    - 否，执行[步骤 13]。
    
    
    
    
13. 选择"更多 \> 重启服务"重新启动Mapreduce服务。重启完成后在告警列表中，查看"Loader服务不可用"告警是否清除。
    
    - 是，处理完毕。
    
    - 否，执行[步骤 16]。
    
    
    
    
**检查Yarn服务状态。**
14. 在FusionInsight Manager首页，选择"集群 \> *待操作集群的名称* \> 服务 \> Yarn"查看Yarn的运行状态是否正常。
    
    - 是，执行[步骤 16]。
    
    - 否，执行[步骤 15]。
    
    
    
    
15. 选择"更多 \> 重启服务"重新启动Yarn服务实例。重启完成后在告警列表中，查看"Loader服务不可用"告警是否清除。
    
    - 是，处理完毕。
    
    - 否，执行[步骤 16]。
    
    
    
    
16. 在FusionInsight Manager的告警列表中，查看是否有"Yarn服务不可用"告警产生。
    
    - 是，执行[步骤 17]。
    
    - 否，执行[步骤 19]。
    
    
    
    
17. 参考[ALM-18000 Yarn服务不可用](https://support.huaweicloud.com/usermanual-mrs/ALM-18000.html)的处理步骤处理该故障。
18. 在告警列表中，查看"Loader服务不可用"告警是否清除。 
    - 是，处理完毕。
    
    - 否，执行[步骤 19]。
    
    
    
    
**检查Loader和依赖组件之间的网络连接。**
19. 在FusionInsight Manager界面，选择"集群 \> *待操作集群的名称* \> 服务 \> Loader"。
20. 单击"实例"，显示LoaderServer实例列表。
21. 记录"LoaderServer(主)"行的"管理IP"。
22. 以**omm** 用户通过[步骤 21]获取的IP地址登录主LoaderServer所在的主机。

23. 执行**ping** 命令，查看主LoaderServer所在主机和依赖组件所在主机的网络连接是否正常。（依赖组件包括ZooKeeper、DBService、HDFS、Mapreduce和Yarn等，获取依赖组件所在主机的IP地址的方式和获取主LoaderServer IP地址的方式相同。）
    
    - 是，执行[步骤 26]。
    
    - 否，执行[步骤 24]。
    
    
    
    
24. 联系网络管理员恢复网络。
25. 在告警列表中，查看"Loader服务不可用"告警是否清除。 
    - 是，处理完毕。
    
    - 否，执行[步骤 26]。
    
    
    
    
**收集故障信息。**
26. 在FusionInsight Manager界面，选择"运维 \> 日志 \> 下载"。
27. 在"服务"框中勾选待操作集群的如下节点信息。 
    - Zookeeper
    
    - HDFS
    
    - DBService
    
    - Yarn
    
    - Mapreduce
    
    - Loader
    
    
    
    
28. 单击右上角的![](https://support.huaweicloud.com/usermanual-mrs/zh-cn_image_0263895532.png)设置日志收集的"开始时间"和"结束时间"分别为告警产生时间的前后10分钟，单击"下载"。
29. 在FusionInsight Manager界面，选择"集群 \> *待操作集群的名称* \> 服务 \> Loader"。
30. 选择"更多 \> 重启服务"，单击"确定"。

31. 查看该告警是否已清除。 
    - 是，处理完毕。
    
    - 否，执行[步骤 32]。
    
    
    
    
32. 请联系运维人员，并发送已收集的故障日志信息。
 
#### 告警清除
此告警修复后，系统会自动清除此告警，无需手工清除。
#### 参考信息
无。
