
# ALM-12089 节点间网络互通异常
#### 告警解释
告警模块按10秒周期检测集群间节点的网络健康状态。当检测到某两台节点之间网络不可达或者网络状态不稳定，产生该告警。
当网络恢复正常，告警恢复。
#### 告警属性
| 告警ID  | 告警级别 | 是否自动清除 |
|:---|:---|:---|
| 12089 | 重要   | 是      |
   
#### 告警参数
| 参数名称 | 参数含义          |
|:---|:---|
| 来源   | 产生告警的集群或系统名称。 |
| 服务名  | 产生告警的服务名称。    |
| 角色名  | 产生告警的角色名称。    |
| 主机名  | 产生告警的主机名。     |
   
#### 对系统的影响
- 数据传输异常：如果网络互通异常，数据的传输会变得缓慢或者中断，导致数据丢失或者传输不完整。
- 任务调度异常：如果网络互通异常，任务调度会受到影响，例如会导致Yarn任务无法正常执行或者执行超时失败。
- 数据处理异常：如果网络互通异常，数据处理会受到影响，例如会导致HDFS数据同步失败或者结果不准确。
- 系统性能下降：大数据集群之间的网络互通异常会导致系统性能下降，影响整个数据处理的效率和质量。
 
#### 可能原因
- 节点宕机。
- 网络故障。
 
#### 处理步骤
**确认网络健康状态。**
1. 打开FusionInsight Manager页面，在告警列表中，单击此告警所在行的![](https://support.huaweicloud.com/usermanual-mrs/zh-cn_image_0263895669.png)，查看附加信息中的描述信息。明确具体发生告警源IP地址及目标IP，并记录两个IP地址。
2. 登录告警上报节点，在告警上报节点上使用**ping** 命令，向目标节点手动发起ping请求，检查两个节点之间的网络状态是否正常。
   
   集群节点登录可参考[登录MRS集群节点](https://support.huaweicloud.com/usermanual-mrs/mrs_01_0083.html)。
   ```
   ping 目标节点IP地址
   ```
   - 是，执行[6]
   
   - 否，执行[3]。
   
   
   
   
**确认节点状态**。
3. 在FusionInsight Manager界面，单击"主机"查看主机列表中是否包含故障节点，确认故障节点是否已从集群中移除。
   
   - 是，执行[5]。
   
   - 否，执行[4]。
   
   
   
   
4. 查看故障节点运行状态，判断是否处于关机状态。
   
   - 是，启动故障节点，执行[步骤 2]。
   
   - 否，联系相关工作人员定位问题，若需要从集群中移除故障节点，执行[5]，否则执行[6]。
   
   
   
   
5. 将故障节点从集群所有节点的"$NODE_AGENT_HOME/etc/agent/hosts.ini"文件中移除，并清空"/var/log/Bigdata/unreachable/unreachable_ip_info.log"文件内容，然后手动清除告警。
6. 等待30秒后查看告警是否自动清除。
   
   - 是，处理完毕。
   
   - 否，执行[7]。
   
   
   
   
**收集故障信息**
7. 在FusionInsight Manager界面，选择"运维 \> 日志 \> 下载"。
8. 在"服务"中勾选"OmmAgent"，单击"确定"。
9. 单击右上角的![](https://support.huaweicloud.com/usermanual-mrs/zh-cn_image_0263895746.png)设置日志收集的时间范围，一般为告警产生时间的前后10秒钟，单击"下载"。
10. 请联系运维人员，并发送已收集的故障日志信息。
 
#### 告警清除
此告警修复后，系统会自动清除此告警，无需手工清除。
#### 参考信息
无。
