
# ALM-38006 Kafka未完全同步的Partition百分比超过阈值
#### 告警解释
系统每60秒周期性检测Kafka服务未完全同步的Partition数占Partition总数的百分比，当连续3次检测到该比率超出阈值时产生该告警。
平滑次数为1，未完全同步的Partition百分比小于或等于阈值时，告警恢复；平滑次数大于1，未完全同步的Partition百分比小于或等于阈值的90%时，告警恢复。
#### 告警属性
| 告警ID  | 告警级别                                         | 是否自动清除 |
|:---|:---|:---|
| 38006 | 重要（默认为50%） 紧急（默认为60%） | 是      |
   
#### 告警参数
| 参数名称              | 参数含义                  |
|:---|:---|
| 来源                | 产生告警的集群名称。            |
| 服务名               | 产生告警的服务名称。            |
| 角色名               | 产生告警的角色名称。            |
| Trigger Condition | 系统当前指标取值满足自定义的告警设置条件。 |
   
#### 对系统的影响
Kafka服务未完全同步的Partition数过多，会影响服务的可靠性，一旦发生leader切换，可能会导致丢数据。
#### 可能原因
部分Broker实例所在节点故障或者实例停止运行，导致Kafka中某些Partition的副本下线。
#### 处理步骤
**检查Broker实例。**
1. 在FusionInsight Manager首页，选择"集群 \> *待操作集群的名称* \> 服务 \> Kafka \> 实例"，进入Kafka实例页面。
2. 查看所有Broker实例中是否有故障的节点。
   
   - 是，记录当前节点主机名，并执行[步骤 3]。
   
   - 否，执行[步骤 5]。
   
   
   
   
3. 在FusionInsight Manager首页，选择"运维 \> 告警 \> 告警"。查看所有告警信息中是否有[步骤 2]中节点主机对应的故障告警，根据对应的告警指导进行处理。
4. 在FusionInsight Manager首页，选择"集群 \> *待操作集群的名称* \> 服务 \> Kafka \> 实例"，进入Kafka实例页面。
5. 查看所有Broker实例中是否有已停止的实例。
   
   - 是，执行[步骤 6]。
   
   - 否，执行[步骤 7]。
   
   
   
   
6. 勾选所有已停止的Broker实例，单击"启动实例"。
7. 观察界面告警是否清除。
   
   - 是，处理完毕。
   
   - 否，执行[步骤 8]。
   
   
   
   
**收集故障信息。**
8. 在FusionInsight Manager界面，选择"运维 \> 日志 \> 下载"。
9. 在"服务"中勾选待操作集群的"Kafka"。
10. 单击右上角的![](https://support.huaweicloud.com/usermanual-mrs/zh-cn_image_0263895574.png)设置日志收集的"开始时间"和"结束时间"分别为告警产生时间的前后10分钟，单击"下载"。
11. 请联系运维人员，并发送已收集的故障日志信息。
 
#### 告警清除
此告警修复后，系统会自动清除此告警，无需手工清除。
#### 参考信息
无。
