更新时间:2026-09-07 GMT+08:00
分享

ALM-12063 磁盘不可用

告警解释

MRS 3.6.0.1之前版本:

系统每五分钟(MRS 3.1.5之前版本周期为:每一个小时的整点)检查一次当前主机的磁盘是否可用,只检查数据盘,在磁盘对应的挂载目录下执行创建文件,写文件和删文件等操作,如果能够成功则认为磁盘可用,发送恢复告警,如果不能成功,则发送故障告警。

MRS 3.6.0.1及之后版本:

系统每分钟检查一次当前主机的数据盘及安装目录磁盘是否可用,检查方式有如下两种:

  • 方式一:判断磁盘是否可读或者可写

    在磁盘对应的挂载目录下执行创建文件,写文件和删文件等操作,如果不能成功,则发送故障告警,如果能够成功则认为磁盘可用,告警恢复。

  • 方式二:判断磁盘文件系统是否存在异常

    检查磁盘挂载目录对应的虚拟磁盘设备分区文件系统是否正常,针对xfs类型磁盘使用xfs_info命令检测,ext4盘使用tune2fs命令进行检测。如果文件系统异常则发送故障告警,如果文件系统正常则告警恢复。

  • 方式三:判断磁盘是否存在坏道

    检查磁盘挂载目录对应的虚拟磁盘设备分区是否正常,检测方式为读取操作系统message日志进行判断。如果设备分区异常则发送故障告警,如果设备分区正常则告警恢复。

MRS 3.6.0.1及之后版本,告警名称从“磁盘不可用”变成“磁盘故障”。

告警属性

告警ID

告警级别

是否自动清除

12063

重要

是

告警参数

参数名称

参数含义

来源

产生告警的集群或系统名称。

服务名

产生告警的服务名称。

角色名

产生告警的角色名称。

主机名

产生告警的主机名。

磁盘名

产生告警的磁盘名称。(MRS 3.3.1之前版本支持)

分区挂载点

产生告警的磁盘分区挂载位置。(MRS 3.3.1及之后版本支持)

磁盘序列号

产生告警的磁盘序列号。(MRS 3.3.1及之后版本支持)

详细信息

告警详细信息。(MRS 3.6.0.1及之后版本支持)

对系统的影响

MRS 3.6.0.1之前版本:磁盘不可写或不可读时,如果需要修改或使用该磁盘上的数据,可能会导致作业运行失败。

MRS 3.6.0.1及之后版本:磁盘不可读写或不可读者磁盘文件系统异常时,如果需要修改或使用该磁盘上的数据,可能会导致作业运行读取数据失败或者读取错误。

可能原因

磁盘挂载目录权限异常、磁盘文件系统受损或磁盘设备分区异常。

处理步骤(MRS 3.6.0.1之前版本)

检查磁盘挂载目录权限是否正常。

  1. 登录MRS集群Manager页面,在告警列表中,单击此告警所在行的,查看该告警的主机地址和告警的磁盘名称DiskName。

    登录集群Manager具体操作,请参考访问MRS集群Manager。

  2. 以root用户登录告警所在主机,用户密码为安装前用户自定义,请咨询系统管理员。
  1. 执行以下命令,获取对应的挂载点,查看挂载目录的权限,是否存在不可写或者不可读。

    df -h |grep 磁盘名称

    如果挂载目录权限为000,或者属主为root,则表示当前状态为不可读不可写。

  2. 修改目录权限为合适的目录权限。
  3. 等待一小时,查看告警是否恢复。

    • 是,操作结束。
    • 否,执行6。

  1. 联系硬件工程师,修复磁盘故障。
  1. 等待一小时,查看告警是否恢复。

    • 是,操作结束。
    • 否,执行步骤 8。

收集故障信息。

  1. 在Manager界面,选择“运维 > 日志 > 下载”。
  2. 在“服务”中勾选“NodeAgent”,单击“确定”。
  3. 单击右上角的设置日志收集的“开始时间”和“结束时间”分别为告警产生时间的前后10分,单击“下载”。
  4. 请联系运维人员,并发送已收集的故障日志信息。

处理步骤(MRS 3.6.0.1及之后版本)

  1. 登录MRS集群Manager页面,在告警列表中,查看该告警的详细信息,获取主机地址和告警的磁盘名称DiskName。

    登录集群Manager具体操作,请参考访问MRS集群Manager。

  2. 查看该告警的附加信息中详细信息。

    • 告警详细信息打印“Disk not readable or writable”,执行步骤 3。
    • 告警详细信息打印“Disk file system exception”,执行步骤 7。
    • 告警详细信息打印“Disk sector exception”,执行步骤 12。

检查磁盘挂载目录权限是否正常

  1. 以omm用户登录告警所在主机节点。
  2. 执行以下命令,获取对应的挂载点,查看挂载目录的权限,是否存在不可写或者不可读。

    df -h |grep 磁盘名称

    如果挂载目录权限为000,或者属主为root,则表示当前状态为不可读不可写。

  1. 修改目录权限为合适的目录权限。
  2. 等待约2分钟,查看告警是否已恢复。

    • 是,操作结束。
    • 否,执行步骤 14。

检查磁盘文件系统是否正常。

  1. 以root用户登录告警所在主机节点。
  2. 查看告警附加信息中,告警上报磁盘所属的文件系统类型是否为xfs。

    • 文件系统类型为xfs,执行步骤 9。
    • 文件系统类型为ext4,执行步骤 10。
    • 文件系统为其他类型,执行步骤 14。

  1. 执行如下命令切换到omm用户,并验证返回值是否存在异常。

    su - omm
    xfs_info ${虚拟磁盘设备分区名称} | grep "error"
    • 是,若存在异常则联系硬件人员进行维护处理,处理完成后执行步骤 11。
    • 否,执行步骤 14。

    例如执行结果如下表示无异常:

  1. 执行如下命令验证返回值是否存在异常。

    tune2fs -l /dev/vdb2 | grep "Filesystem state" | grep "errors"
    • 是,若存在异常则联系硬件人员进行维护处理,处理完成后执行步骤 11。
    • 否,执行步骤 14。

    例如执行结果如下表示无异常:

  2. 等待约2分钟,查看告警是否已恢复。

    • 是,操作结束。
    • 否,执行步骤 14。

检查磁盘分区是否正常。

  1. 以root用户登录告警所在节点,根据告警位置信息中的挂载点信息,执行如下命令查看系统日志是否存在异常。

    grep -rn "blk_update_request:" /var/log/messages | grep "error" | grep "${挂载点}" | grep "sector"
    • 是,若存在异常则联系硬件人员进行维护处理,处理完成后执行步骤 13。
    • 否,执行步骤 14。

  1. 手动清除“/var/log/message”中步骤 12匹配到的内容信息,等待约2分钟,查看告警是否已恢复。

    • 是,操作结束。
    • 否,执行步骤 14。

收集故障信息。

  1. 在FusionInsight Manager界面,选择“运维 > 日志 > 下载”。
  2. 在“服务”中勾选“NodeAgent”,单击“确定”。
  3. 单击右上角的编辑按钮设置日志收集的“开始时间”和“结束时间”分别为告警产生时间的前后10分,单击“下载”。
  4. 请联系运维人员,并发送已收集的故障日志信息。

告警清除

此告警修复后,系统会自动清除此告警,无需手工清除。

参考信息

无。

相关文档