
# ALM-38000 Kafka服务不可用（2.x及以前版本）
#### 告警解释
系统按照30秒的周期检测Kafka服务是否可用，当Kafka服务不可用，系统产生此告警。
当Kafka服务恢复正常，告警自动清除。
#### 告警属性
| **告警ID** | **告警级别** | **可自动清除** |
|:---|:---|:---|
| 38000    | 致命       | 是         |
   
#### 告警参数
| **参数名称**    | **参数含义**   |
|:---|:---|
| ServiceName | 产生告警的服务名称。 |
| RoleName    | 产生告警的角色名称。 |
| HostName    | 产生告警的主机名。  |
   
#### 对系统的影响
集群无法对外提供Kafka服务，用户无法执行新的Kafka任务。
#### 可能原因
- KrbServer组件故障。
- ZooKeeper组件故障或无响应。
- Kafka集群中Broker节点异常。
 
#### 处理步骤
1. 检查KrbServer组件状态。未启用Kerberos认证的集群无需检查Kerberos状态，请直接执行[步骤 2]。
   
   1. 登录MRS集群详情页面，选择"组件管理"。
   
   2. 查看KrbServer服务的健康状态是否为"良好"。
      - 是，执行[2.a]。
      
      - 否，执行[1.c]。
       
   
   3. 参考[ALM-25500 KrbServer服务不可用（2.x及以前版本）](https://support.huaweicloud.com/usermanual-mrs/alm_25500.html)的处理步骤进行操作。
   
   4. 再次执行[1.b]。
   
   
   
   
2. 检查ZooKeeper组件状态。
   
   1. 查看ZooKeeper服务的健康状态是否为"良好"。
      - 是，执行[3.a]。
      
      - 否，执行[2.b]。
       
   
   2. 如果ZooKeeper服务已停止，则启动ZooKeeper服务，否则参考[ALM-13000 ZooKeeper服务不可用（2.x及以前版本）](https://support.huaweicloud.com/usermanual-mrs/alm_13000.html)的处理步骤进行操作。
   
   3. 再次执行[2.a]。
   
   
   
   
3. 检查Broker状态。 
   1. 选择"组件管理 \> Kafka \> Broker"，进入Kafka实例页面。
   
   2. 查看"角色"中所有实例是否正常。
      - 是，执行[3.d]。
      
      - 否，执行[3.c]。
       
   
   3. 勾选Broker所有实例，选择"更多 \> 重启实例"，查看是否重启成功。
      - 是，执行[3.d]。
      
      - 否，执行[步骤 4]。
       
   
   4. 选择"组件管理 \> Kafka"，查看健康状态是否为"良好"。
      - 是，执行[3.e]。
      
      - 否，执行[步骤 4]。
       
   
   5. 等待30秒，查看告警是否恢复。
      - 是，处理完毕。
      
      - 否，执行[步骤 4]。
       
   
   
   
   
4. 收集故障信息。
   
   1. 在MRS Manager界面，单击"系统设置 \> 日志导出"。
   
   2. 请联系运维人员，并发送已收集的故障日志信息。
   
   
   
   
 
#### 参考信息
无。
