
# ALM-13000 ZooKeeper服务不可用（2.x及以前版本）
#### 告警解释
系统每30秒周期性检测ZooKeeper服务状态，当检测到ZooKeeper服务不可用时产生该告警。
ZooKeeper服务恢复时，告警清除。
#### 告警属性
| 告警ID  | 告警级别 | 可自动清除 |
|:---|:---|:---|
| 13000 | 致命   | 是     |
   
#### 告警参数
| 参数名称        | 参数含义       |
|:---|:---|
| ServiceName | 产生告警的服务名称。 |
| RoleName    | 产生告警的角色名称。 |
| HostName    | 产生告警的主机名。  |
   
#### 对系统的影响
ZooKeeper无法为上层组件提供协调服务，依赖ZooKeeper的组件可能无法正常运行。
#### 可能原因
- ZooKeeper实例状态异常。
- 磁盘容量不足。
- 网络故障。
- ZooKeeper节点上安装了DNS。
 
#### 处理步骤
**检查ZooKeeper服务实例状态。**
1. 在MRS集群详情页面，单击"组件管理 \> ZooKeeper \> quorumpeer"。
2. 查看ZooKeeper各实例是否正常。 
   - 是，执行[步骤 6]。
   
   - 否，执行[步骤 3]。
   
   
   
   
3. 选中健康状态不为良好的实例，单击"更多 \> 重启实例"。
4. 查看实例重启后健康状态是否为良好。 
   - 是，执行[步骤 5]。
   
   - 否，执行[步骤 19]。
   
   
   
   
5. 在"告警管理"页签，查看该告警是否恢复。
   
   - 是，处理完毕。
   
   - 否，执行[步骤 6]。
   
   
   **检查磁盘状态。**
   
   
6. 在MRS集群详情页面，单击"组件管理 \> ZooKeeper \> quorumpeer"查看ZooKeeper实例所在的各节点主机信息。
7. 在MRS集群详情页面，单击"节点管理"并展开节点组信息。
8. 在"磁盘使用率"列，检查ZooKeeper实例所在的各节点磁盘空间是否不足（使用率超过百分之80）。 
   - 是，执行[步骤 9]。
   
   - 否，执行[步骤 11]。
   
   
   
   
9. 参考[ALM-12017 磁盘容量不足（2.x及以前版本）](https://support.huaweicloud.com/usermanual-mrs/alm_12017.html)进行处理，对磁盘进行扩容。
10. 在"告警管理"页签，查看该告警是否恢复。 
    - 是，处理完毕。
    
    - 否，执行[步骤 11]。
    
    
    **检查网络状态。**
    
    
11. 在ZooKeeper实例所在Linux节点使用**ping** 命令，看能否**ping** 通其他ZooKeeper实例所在节点的主机名。
    
    - 是，执行[步骤 15]。
    
    - 否，执行[步骤 12]。
    
    
    
    
12. 修改"/etc/hosts"中的IP信息，添加主机名与IP地址的对应关系。
13. 再次执行**ping** 命令，查看能否在该ZooKeeper实例节点**ping** 通其他ZooKeeper实例节点的主机名。
    
    - 是，执行[步骤 14]。
    
    - 否，执行[步骤 19]。
    
    
    
    
14. 在"告警管理"页签，查看该告警是否恢复。
    
    - 是，处理完毕。
    
    - 否，执行[步骤 15]。
    
    
    **检查DNS。**
    
    
15. 查看ZooKeeper实例所在节点上是否安装DNS。在ZooKeeper实例所在Linux节点使用命令cat /etc/resolv.conf，看该文件是否为空。
    
    - 是，执行[步骤 16]。
    
    - 否，执行[步骤 19]。
    
    
    
    
16. 运行命令**service named status** 查看DNS是否启动。
    
    - 是，执行[步骤 17]。
    
    - 否，执行[步骤 19]。
    
    
    
    
17. 运行命令**service named stop**将DNS服务停掉，如果出现"Shutting down name server BIND waiting for named to shut down (28s)"如下结果，即说明DNS服务停止成功。然后将"/etc/resolv.conf"文件的内容（若不为空）全部注释。
18. 在"告警管理"页签，查看该告警是否恢复。 
    - 是，处理完毕。
    
    - 否，执行[步骤 19]。
    
    
    
    
19. 收集故障信息。
    
    1. 在MRS Manager界面，单击"系统设置 \> 日志导出"。
    
    2. 请联系运维人员，并发送已收集的故障日志信息。
    
    
    
    
 
#### 参考信息
无。
