
# ALM-12053 主机文件句柄使用率超过阈值
#### 告警解释
系统每30秒周期性检测主机文件句柄使用率，并把实际使用率和阈值进行比较，当检测到主机文件句柄使用率连续多次（默认值为5）超过阈值时产生该告警。
用户可通过"运维 \> 告警 \> 阈值设置 \> *待操作集群的名称* \> 主机 \> 主机状态 \> 主机文件句柄使用率"修改阈值。
平滑次数为1，主机文件句柄使用率小于或等于阈值时，告警恢复；平滑次数大于1，主机文件句柄使用率小于或等于阈值的90%时，告警恢复。
#### 告警属性
| 告警ID  | 告警级别                                                 | 是否自动清除 |
|:---|:---|:---|
| 12053 | 紧急（默认阈值为95%） 重要（默认阈值为80%） | 是      |
   
#### 告警参数
| 参数名称              | 参数含义                  |
|:---|:---|
| 来源                | 产生告警的集群或系统名称。         |
| 服务名               | 产生告警的服务名称。            |
| 角色名               | 产生告警的角色名称。            |
| 主机名               | 产生告警的主机名。             |
| Trigger Condition | 系统当前指标取值满足自定义的告警设置条件。 |
   
#### 对系统的影响
业务失败：主机文件句柄使用率超过阈值时，系统应用无法打开文件、网络等IO操作，程序异常，可能会导致作业运行失败。
#### 可能原因
- 应用进程存在异常，如打开的文件或socket没有关闭。
- 文件句柄数不满足当前业务需求。
- 系统环境异常。
 
#### 处理步骤
**查看进程打开文件情况**。
1. 打开FusionInsight Manager页面，在实时告警列表中，单击此告警所在行的![](https://support.huaweicloud.com/usermanual-mrs/zh-cn_image_0263895750.png)，获取告警所在主机IP地址。
2. 以**root**用户登录告警所在主机，用户密码为安装前用户自定义，请咨询系统管理员。
3. 执行以下命令查看文件句柄占用较多的进程。 
   **for proc in /proc/\[0-9\]\*; do if \[ -d "$proc/fd" \]; then num_fds=$(ls -l "$proc/fd" \| wc -l); pid=$(basename $proc); echo "$num_fds ${pid}" ; fi; done \| sort -nr \| more**
   
   
4. 分析打开文件数目较多的进程，分析该进程是否存在异常，如打开的文件或socket没有关闭。 
   - 是，执行[步骤 5]。
   
   - 否，执行[步骤 7]。
   
   
   
   
5. 文件句柄占用多的异常进程进行确认释放。
6. 等待5分钟，检查该告警是否恢复。 
   - 是，处理完毕。
   
   - 否，执行[步骤 7]。
   
   
   
   
**增大文件句柄数。**
7. 打开FusionInsight Manager页面，在实时告警列表中，单击此告警所在行的![](https://support.huaweicloud.com/usermanual-mrs/zh-cn_image_0263895749.png)，获取告警所在主机IP地址。
8. 以**root**用户登录告警所在主机。
9. 联系MRS集群管理员，增大系统文件句柄数。
10. 执行**cat /proc/sys/fs/file-nr** 查看已使用句柄数和最大句柄数。第一个值为已使用句柄数，第三个值为最大句柄数，计算使用率是否超过设定阈值。
    
    ```
    # cat /proc/sys/fs/file-nr
    127040640000
    ```
    - 是，执行[步骤 9]。
    
    - 否，执行[步骤 11]。
    
    
    
    
11. 等待5分钟，检查该告警是否恢复。
    
    - 是，处理完毕。
    
    - 否，执行[步骤 12]。
    
    
    
    
**检查系统环境是否异常。**
12. 联系操作系统管理员，检查操作系统是否存在异常。
    
    - 是，恢复操作系统故障，执行[步骤 13]。
    
    - 否，执行[步骤 14]。
    
    
    
    
13. 等待5分钟，检查该告警是否恢复。
    
    - 是，处理完毕。
    
    - 否，执行[步骤 14]。
    
    
    
    
**收集故障信息。**
14. 在主集群的FusionInsight Manager界面，选择"运维 \> 日志 \> 下载"。
15. 在"服务"中勾选"OMS"，单击"确定"。
16. 设置"主机"为告警所在节点和主OMS节点。
17. 单击右上角的![](https://support.huaweicloud.com/usermanual-mrs/zh-cn_image_0263895382.png)设置日志收集的"开始时间"和"结束时间"分别为告警产生时间的前后30分钟，单击"下载"。
18. 请联系运维人员，并发送已收集的故障日志信息。
 
#### 告警清除
此告警修复后，系统会自动清除此告警，无需手工清除。
#### 参考信息
无。
