
# ALM-24005 Flume传输数据异常
#### 告警解释
告警模块对Flume Channel的容量状态进行实时监控，当Channel满的时长超过阈值，或Source向Channel放数据失败的次数超过阈值（默认为10）后，系统即时上报告警。
默认阈值为10，用户可通过conf目录下的配置文件properties.properties修改阈值：修改对应Channel的"channelfullcount"参数。阈值较小时告警触发更灵敏，但误报率相应升高，网络抖动等瞬时问题也会触发告警；阈值较大时误报率降低，但可能导致问题响应延迟，增加数据积压风险。
当Flume Channel空间被释放，且告警处理完成时，告警恢复。
#### 告警属性
| 告警ID  | 告警级别 | 是否自动清除 |
|:---|:---|:---|
| 24005 | 重要   | 是      |
   
#### 告警参数
| 参数名称    | 参数含义           |
|:---|:---|
| 来源      | 产生告警的集群名称。     |
| 服务名     | 产生告警的服务名称。     |
| 主机名     | 产生告警的主机名。      |
| AgentId | 产生告警的Agent id。 |
| 部件类型    | 产生告警的元素类型。     |
| 部件名     | 产生告警的元素名称。     |
   
#### 对系统的影响
Flume Channel的磁盘空间使用率持续增长将导致数据传输延迟增加，当使用率达到100%时，Flume Agent将因无法继续处理数据而停止运行。
#### 可能原因
- Flume Sink故障，导致数据无法发送。
- 网络故障，导致数据无法发送。
 
#### 处理步骤
**检查Flume Sink是否故障。**
1. 本地打开用户自定义配置文件properties.properties，搜索配置文件中是否有"type = hdfs"关键字，确认Flume Sink是否是HDFS类型。 
   - 是，执行[步骤 2]。
   
   - 否，执行[步骤 3]。
   
   
   
   
2. 在Manager首页，选择"运维 \> 告警 \> 告警"，在告警列表中查看是否有"HDFS服务不可用"告警产生，及服务列表中HDFS是否已停止。
   
   登录集群Manager具体操作，请参考[访问MRS集群Manager](https://support.huaweicloud.com/usermanual-mrs/mrs_01_0128.html)。
   - 是，如果有告警参考[ALM-14000 HDFS服务不可用](https://support.huaweicloud.com/usermanual-mrs/ALM-14000.html)的处理步骤处理该故障；如果HDFS已停止，选择"集群 \> 服务"，单击HDFS服务右上角的"启动服务"，执行[步骤 7]。
   
   - 否，执行[步骤 7]。
   
   
   
   
3. 本地打开用户自定义配置文件properties.properties，搜索配置文件中是否有"type = hbase"关键字，确认Flume Sink是否是HBase类型。
   
   - 是，执行[步骤 4]。
   
   - 否，执行[步骤 5]。
   
   
   
   
4. 在Manager首页，选择"运维 \> 告警 \> 告警"，在告警列表中查看是否有"HBase服务不可用"告警产生，及服务列表中HBase是否已停止。
   
   - 是，如果有告警参考[ALM-19000 HBase服务不可用](https://support.huaweicloud.com/usermanual-mrs/ALM-19000.html)的处理步骤处理该故障，如果HBase已停止，选择"集群 \> 服务"，单击HBase服务右上角的"启动服务"，执行[步骤 7]。
   
   - 否，执行[步骤 7]。
   
   
   
   
5. 本地打开用户自定义配置文件properties.properties，搜索配置文件中是否有"org.apache.flume.sink.kafka.KafkaSink"关键字，确认Flume Sink是否是Kafka类型。
   
   - 是，执行[步骤 6]。
   
   - 否，执行[步骤 9]。
   
   
   
   
6. 在FManager首页，选择"运维 \> 告警 \> 告警"，在告警列表中查看是否有"Kafka服务不可用"告警产生，及服务列表中Kafka是否已停止。
   
   - 是，如果有告警参考[ALM-38000 Kafka服务不可用](https://support.huaweicloud.com/usermanual-mrs/ALM-38000.html)的处理步骤处理该故障；如果Kafka已停止，选择"集群 \> 服务"，单击Kafka服务右上角的"启动服务"，执行[步骤 7]。
   
   - 否，执行[步骤 7]。
   
   
   
   
7. 在Manager首页，选择"集群 \> 服务 \> Flume \> 实例"。
8. 单击进入故障节点的Flume实例页面，查看指标"Sink速度指标"，检查其速度是否为0。 
   - 是，执行[步骤 13]。
   
   - 否，执行[步骤 9]。
   
   
   
   
**检查Flume Sink配置的IP所在节点与故障节点的网络状态。**
9. 本地打开用户自定义配置文件properties.properties，搜索配置文件中是否有"type = avro"关键字，确认Flume Sink是否是avro类型。
   
   - 是，执行[10]。
   
   - 否，执行[步骤 13]。
   
   
   
   
10. 以**root** 用户登录故障节点所在主机，执行**ping** *Flume Sink* *配置的IP* *地址* 命令查看对端主机是否可以ping通，用户密码为安装前用户自定义，请咨询系统管理员。
    
    - 是，执行[步骤 13]。
    
    - 否，执行[步骤 11]。
    
    
    
    
11. 联系网络管理员恢复网络。
12. 等待一段时间后，在告警列表中，查看告警是否清除。 
    - 是，处理完毕。
    
    - 否， 执行[步骤 13]。
    
    
    
    
**收集故障信息。**
13. 在Manager界面，选择"运维 \> 日志 \> 下载"。
14. 在"服务"框中勾选待操作集群的"Flume"。
15. 单击右上角的时间编辑按钮，设置日志收集的"开始时间"和"结束时间"分别为告警产生时间的前后1小时，单击"下载"。
16. 请联系运维人员，并发送已收集的故障日志信息。
 
#### 告警清除
此告警修复后，系统会自动清除此告警，无需手工清除。
#### 参考信息
无。
