更新时间:2024-11-29 GMT+08:00

ALM-38007 Kafka默认用户状态异常

告警解释

系统每60秒周期性检测Kafka服务默认用户,当检测到该用户异常时发送此告警。

平滑次数为1,当用户状态恢复后,告警恢复。

告警属性

告警ID

告警级别

告警类型

业务类型

是否可自动清除

38007

紧急

业务质量告警

Kafka

告警参数

类别

参数名称

参数含义

定位信息

来源

产生告警的集群名称。

服务名

产生告警的服务名称。

角色名

产生告警的角色名称。

主机名

产生告警的主机名称。

附加信息

触发条件

系统当前指标取值满足自定义的告警设置条件。

对系统的影响

Kafka默认用户状态异常,会影响Broker之间的元数据同步,以及Kafka与ZooKeeper之间的交互,进而影响业务生产、消费和Topic的创建、删除等操作。

可能原因

  • Sssd服务异常导致。
  • 部分Broker实例停止运行。

处理步骤

检查是否有"Sssd服务异常"告警。

  1. 在FusionInsight Manager首页,选择“运维 > 告警 > 告警 > Kafka默认用户状态异常 > 定位信息”。查看告警上报的实例的主机名。
  2. 根据告警提示的主机信息,登录到该节点上。
  3. 执行id -Gn kafka,查看返回结果是否报"No such user"。

    • 是,记录当前节点主机名,并执行4
    • 否,执行6

  4. 在FusionInsight Manager首页,选择“运维 > 告警 > 告警”。查看所有告警信息中是否有"Sssd服务异常"告警,根据对应的告警指导进行处理。

检查Broker实例运行状态。

  1. 在FusionInsight Manager首页,选择“集群 > 待操作集群的名称 > 服务 > Kafka > 实例”,进入Kafka实例页面。
  2. 查看所有Broker实例中是否有已停止的节点。

    • 是,执行7
    • 否,执行8

  3. 勾选所有已停止的Broker实例,单击“启动实例”。
  4. 观察界面告警是否清除。

    • 是,处理完毕。
    • 否,执行9

收集故障信息。

  1. 在FusionInsight Manager界面,选择“运维 > 日志 > 下载”。
  2. 在“服务”中勾选待操作集群的“Kafka”。
  3. 单击右上角的设置日志收集的“开始时间”和“结束时间”分别为告警产生时间的前后10分钟,单击“下载”。
  4. 请联系运维人员,并发送已收集的故障日志信息。

告警清除

此告警修复后,系统会自动清除此告警,无需手工清除。

参考信息

不涉及。