
# ALM-45441 ZooKeeper连接断开
#### 告警解释
系统每分钟检测一次ClickHouse和ZooKeeper的连接情况，如果检测连接失败，系统产生告警（告警原因为ZooKeeper连接异常）。如果连续3次检测连接失败，系统产生告警（告警原因为ZooKeeper连接断开）。
当系统检测到有一次连接成功，告警自动清除。
本章节仅适用于MRS 3.3.0-LTS及之后版本。
#### 告警属性
| 告警ID  | 告警级别 | 是否可自动清除 |
|:---|:---|:---|
| 45441 | 紧急   | 是       |
   
#### 告警参数
| 参数名称 | 参数含义          |
|:---|:---|
| 来源   | 产生告警的集群或系统名称。 |
| 服务名  | 产生告警的服务名称。    |
| 角色名  | 产生告警的角色名称。    |
| 主机名  | 产生告警的主机名。     |
   
#### 对系统的影响
当ClickHouse与Zookeeper断连，将无法正常使用ClickHouse服务。
#### 可能原因
- ZooKeeper状态异常。
- ClickHouse业务压力过大。
 
#### 处理步骤
**检查ZooKeeper状态是否异常**
1. 在FusionInsight Manager首页，选择"集群 \> 服务 \> ZooKeeper \> quorumpeer"。 
   登录集群Manager具体操作，请参考[访问MRS集群Manager](https://support.huaweicloud.com/usermanual-mrs/mrs_01_0128.html)。
   
   
2. 查看ZooKeeper各实例是否正常。 
   - 是，执行[步骤 6]。
   
   - 否，执行[步骤 3]。
   
   
   
   
3. 选中运行状态不为良好的实例，选择"更多 \> 重启实例"。
   
   ![](https://support.huaweicloud.com/usermanual-mrs/public_sys-resources/notice_3.0-zh-cn.png)
   重启实例期间实例不可用，当前实例节点的ZooKeeper业务会执行失败。
   
   
4. 查看实例重启后运行状态是否为良好。 
   - 是，执行[步骤 5]。
   
   - 否，执行[步骤 10]。
   
   
   
   
5. 在"运维 \> 告警 \> 告警"页签，查看该告警是否恢复。
   
   - 是，处理完毕。
   
   - 否，执行[步骤 6]。
   
   
   
   
**检查ClickHouse业务压力是否过大**
6. 登录FusionInsight Manager页面，选择"运维 \> 告警 \> 告警"，查看当前告警"定位信息"中的角色名以及确认主机名所在的IP地址。
7. 以客户端安装用户，登录客户端的节点，执行如下命令： 
   ```
   cd {客户端安装路径}
   ```
   ```
   source bigdata_env
   ```
   - 集群已启用Kerberos认证（安全模式）：
     ```
     kinit 组件业务用户
     ```
     ```
     clickhouse client --host 上报告警的ClickHouseServer实例IP --port 9440 --secure
     ```
     
   
   - 集群未启用Kerberos认证（普通模式）：
     ```
     clickhouse client --host 上报告警的ClickHouseServer实例IP --user 用户名 --password --port 9440
     ```
     
   
   
   
   
8. 执行以下语句，查询系统表判断是否有业务频繁写入，若有相关业务，等待业务执行完成，查看告警是否清除。 
   ```
   SELECT query_id, user, FQDN(), elapsed, query FROM system.processes ORDER BY query_id;
   ```
   - 是，操作结束。
   
   - 否，执行[步骤 9]。
   
   
   
   
9. 和用户确认是否有大批量数据写入，若是，请等待任务结束之后，查看告警是否消除。
   
   - 是，操作结束。
   
   - 否，执行[步骤 10]。
   
   
   
   
**收集故障信息**
10. 在FusionInsight Manager界面，选择"运维 \> 日志 \> 下载"。
11. 在"服务"中勾选待操作集群的"ClickHouse"。
12. 在"主机"中选择异常的主机，单击"确定"。
13. 单击右上角的时间编辑按钮，设置日志收集的"开始时间"和"结束时间"分别为告警产生时间的前后1小时，单击"下载"。
14. 请联系运维人员，并发送已收集的故障日志信息。
 
#### 告警清除
此告警修复后，系统会自动清除此告警，无需手工清除。
#### 参考信息
不涉及。
