
# ALM-12063 磁盘不可用
#### 告警解释
**MRS 3.6.0.1之前版本：**
系统每五分钟（MRS 3.1.5之前版本周期为：每一个小时的整点）检查一次当前主机的磁盘是否可用，只检查数据盘，在磁盘对应的挂载目录下执行创建文件，写文件和删文件等操作，如果能够成功则认为磁盘可用，发送恢复告警，如果不能成功，则发送故障告警。
**MRS 3.6.0.1及之后版本：**
系统每分钟检查一次当前主机的数据盘及安装目录磁盘是否可用，检查方式有如下两种：
- 方式一：判断磁盘是否可读或者可写 在磁盘对应的挂载目录下执行创建文件，写文件和删文件等操作，如果不能成功，则发送故障告警，如果能够成功则认为磁盘可用，告警恢复。
  
- 方式二：判断磁盘文件系统是否存在异常 检查磁盘挂载目录对应的虚拟磁盘设备分区文件系统是否正常，针对xfs类型磁盘使用xfs_info命令检测，ext4盘使用tune2fs命令进行检测。如果文件系统异常则发送故障告警，如果文件系统正常则告警恢复。
  
- 方式三：判断磁盘是否存在坏道 检查磁盘挂载目录对应的虚拟磁盘设备分区是否正常，检测方式为读取操作系统message日志进行判断。如果设备分区异常则发送故障告警，如果设备分区正常则告警恢复。
  
![](https://support.huaweicloud.com/usermanual-mrs/public_sys-resources/note_3.0-zh-cn.png)
MRS 3.6.0.1及之后版本，告警名称从"磁盘不可用"变成"磁盘故障"。
#### 告警属性
| 告警ID  | 告警级别 | 是否自动清除 |
|:---|:---|:---|
| 12063 | 重要   | 是      |
   
#### 告警参数
| 参数名称  | 参数含义                             |
|:---|:---|
| 来源    | 产生告警的集群或系统名称。                    |
| 服务名   | 产生告警的服务名称。                       |
| 角色名   | 产生告警的角色名称。                       |
| 主机名   | 产生告警的主机名。                        |
| 磁盘名   | 产生告警的磁盘名称。（MRS 3.3.1之前版本支持）      |
| 分区挂载点 | 产生告警的磁盘分区挂载位置。（MRS 3.3.1及之后版本支持） |
| 磁盘序列号 | 产生告警的磁盘序列号。（MRS 3.3.1及之后版本支持）    |
| 详细信息  | 告警详细信息。（MRS 3.6.0.1及之后版本支持）      |
   
#### 对系统的影响
MRS 3.6.0.1之前版本：磁盘不可写或不可读时，如果需要修改或使用该磁盘上的数据，可能会导致作业运行失败。
MRS 3.6.0.1及之后版本：磁盘不可读写或不可读者磁盘文件系统异常时，如果需要修改或使用该磁盘上的数据，可能会导致作业运行读取数据失败或者读取错误。
#### 可能原因
磁盘挂载目录权限异常、磁盘文件系统受损或磁盘设备分区异常。
#### 处理步骤（MRS 3.6.0.1之前版本）
**检查磁盘挂载目录权限是否正常。**
1. 登录MRS集群Manager页面，在告警列表中，单击此告警所在行的![](https://support.huaweicloud.com/usermanual-mrs/zh-cn_image_0263895587.png)，查看该告警的主机地址和告警的磁盘名称DiskName。
   
   登录集群Manager具体操作，请参考[访问MRS集群Manager](https://support.huaweicloud.com/usermanual-mrs/mrs_01_0128.html)。
   
   
2. 以**root**用户登录告警所在主机，用户密码为安装前用户自定义，请咨询系统管理员。

3. 执行以下命令，获取对应的挂载点，查看挂载目录的权限，是否存在不可写或者不可读**。**
   
   ```
   df -h |grep 磁盘名称
   ```
   如果挂载目录权限为000，或者属主为root，则表示当前状态为不可读不可写。
   - 是，执行[步骤 4]。
   
   - 否，执行[步骤 8]。
   
   
   
   
4. 修改目录权限为合适的目录权限。
5. 等待一小时，查看告警是否恢复。 
   - 是，操作结束。
   
   - 否，执行[6]。
   
   
   
   

6. 联系硬件工程师，修复磁盘故障。

7. 等待一小时，查看告警是否恢复。 
   - 是，操作结束。
   
   - 否，执行[步骤 8]。
   
   
   
   
**收集故障信息。**
8. 在Manager界面，选择"运维 \> 日志 \> 下载"。
9. 在"服务"中勾选"NodeAgent"，单击"确定"。
10. 单击右上角的![](https://support.huaweicloud.com/usermanual-mrs/zh-cn_image_0263895490.png)设置日志收集的"开始时间"和"结束时间"分别为告警产生时间的前后10分，单击"下载"。
11. 请联系运维人员，并发送已收集的故障日志信息。
 
#### 处理步骤（MRS 3.6.0.1及之后版本）
1. 登录MRS集群Manager页面，在告警列表中，查看该告警的详细信息，获取主机地址和告警的磁盘名称DiskName。 
   登录集群Manager具体操作，请参考[访问MRS集群Manager](https://support.huaweicloud.com/usermanual-mrs/mrs_01_0128.html)。
   
   
2. 查看该告警的附加信息中详细信息。 
   - 告警详细信息打印"Disk not readable or writable"，执行[步骤 3]。
   
   - 告警详细信息打印"Disk file system exception"，执行[步骤 7]。
   
   - 告警详细信息打印"Disk sector exception"，执行[步骤 12]。
   
   
   
   
**检查磁盘挂载目录权限是否正常**
3. 以**omm**用户登录告警所在主机节点。
4. 执行以下命令，获取对应的挂载点，查看挂载目录的权限，是否存在不可写或者不可读。 
   ```
   df -h |grep 磁盘名称
   ```
   如果挂载目录权限为000，或者属主为**root**，则表示当前状态为不可读不可写。
   - 是，执行[步骤 5]。
   
   - 否，执行[步骤 14]。
   
   
   
   

5. 修改目录权限为合适的目录权限。
6. 等待约2分钟，查看告警是否已恢复。 
   - 是，操作结束。
   
   - 否，执行[步骤 14]。
   
   
   
   
**检查磁盘文件系统是否正常。**
7. 以**root**用户登录告警所在主机节点。
8. 查看告警附加信息中，告警上报磁盘所属的文件系统类型是否为xfs。 
   - 文件系统类型为xfs，执行[步骤 9]。
   
   - 文件系统类型为ext4，执行[步骤 10]。
   
   - 文件系统为其他类型，执行[步骤 14]。
   
   
   
   

9. 执行如下命令切换到**omm** 用户，并验证返回值是否存在异常。
   
   ```
   su - omm
   ```
   ```
   xfs_info ${虚拟磁盘设备分区名称} | grep "error"
   ```
   - 是，若存在异常则联系硬件人员进行维护处理，处理完成后执行[步骤 11]。
   
   - 否，执行[步骤 14]。
   
   
   例如执行结果如下表示无异常：
   ![](https://support.huaweicloud.com/usermanual-mrs/zh-cn_image_0000002554517695.png "点击放大")
   
   

10. 执行如下命令验证返回值是否存在异常。
    
    ```
    tune2fs -l /dev/vdb2 | grep "Filesystem state" | grep "errors"
    ```
    - 是，若存在异常则联系硬件人员进行维护处理，处理完成后执行[步骤 11]。
    
    - 否，执行[步骤 14]。
    
    
    例如执行结果如下表示无异常：
    ![](https://support.huaweicloud.com/usermanual-mrs/zh-cn_image_0000002523477818.png "点击放大")
    
    
11. 等待约2分钟，查看告警是否已恢复。
    
    - 是，操作结束。
    
    - 否，执行[步骤 14]。
    
    
    
    
**检查磁盘分区是否正常。**
12. 以**root** 用户登录告警所在节点，根据告警位置信息中的挂载点信息，执行如下命令查看系统日志是否存在异常。
    
    ```
    grep -rn "blk_update_request:" /var/log/messages | grep "error" | grep "${挂载点}" | grep "sector"
    ```
    - 是，若存在异常则联系硬件人员进行维护处理，处理完成后执行[步骤 13]。
    
    - 否，执行[步骤 14]。
    
    
    
    

13. 手动清除"/var/log/message"中[步骤 12]匹配到的内容信息，等待约2分钟，查看告警是否已恢复。
    
    - 是，操作结束。
    
    - 否，执行[步骤 14]。
    
    
    
    
**收集故障信息。**
14. 在FusionInsight Manager界面，选择"运维 \> 日志 \> 下载"。
15. 在"服务"中勾选"NodeAgent"，单击"确定"。
16. 单击右上角的编辑按钮设置日志收集的"开始时间"和"结束时间"分别为告警产生时间的前后10分，单击"下载"。
17. 请联系运维人员，并发送已收集的故障日志信息。
 
#### 告警清除
此告警修复后，系统会自动清除此告警，无需手工清除。
#### 参考信息
无。
