弹性云服务器支持事件监控的事件说明
功能说明
事件监控提供了事件类型数据上报、查询和告警的功能。方便您将业务中的各类重要事件或对云资源的操作事件收集到云监控服务,并在事件发生时进行告警。
本节定义了弹性云服务器支持事件监控的事件说明。
命名空间
SYS.ECS
事件监控支持的事件列表
| 事件名称 | 事件ID | 事件级别 | 事件说明 | 处理建议 | 事件影响 |
|---|---|---|---|---|---|
| 因系统故障触发重启 | startAutoRecovery | 重要 | 弹性云服务器所在的主机出现故障时,系统会自动将弹性云服务器迁移至正常的物理机,迁移过程中系统会自动重启云服务器。 | 等待恢复成功,观察业务是否受到影响。 | 业务存在中断的可能。 |
| 因系统故障重启已完成 | endAutoRecovery | 重要 | 当自动迁移完成后,弹性云服务器已恢复正常。 | 当收到“恢复成功”时,云服务器已正常工作,可继续使用。 | 业务恢复正常。 |
| 恢复超时(后台处理中) | faultAutoRecovery | 重要 | 迁移弹性云服务器至正常的物理机操作超时。 | 迁移业务至其他云服务器。 | 业务中断。 |
| GPU链路故障 | GPULinkFault | 紧急 | 弹性云服务器所在的主机上GPU卡故障。包括:GPU卡故障、GPU卡故障恢复中。 | 业务应用做成高可用。 GPU卡故障恢复后,确认业务是否自动恢复。 | 业务中断。 |
| 删除虚拟机 | deleteServer | 重要 | 删除云服务器。包括:
| 确认删除操作是否为主动执行。 | 业务中断。 |
| 重启虚拟机 | rebootServer | 次要 | 云服务器重启。包括:
| 确认操作是否为主动执行。
| 业务中断。 |
| 关闭虚拟机 | stopServer | 次要 | 云服务器关机。包括:
说明:
|
| 业务中断。 |
| 删除网卡 | deleteNic | 重要 | 云服务器删除网卡。包括:
|
| 网卡被删除,存在业务中断的可能。 |
| 变更规格 | resizeServer | 次要 | 云服务器规格变更。包括:
|
| 业务中断。 |
| GuestOS系统层重启告警 | RestartGuestOS | 一般 | GuestOS内部重启。 | 联系运维人员处理。 | 在系统重启场景下,可能导致业务中断。 |
| 系统故障导致虚拟机故障 | VMFaultsByHostProcessExceptions | 紧急 | 弹性云服务器所在的主机出现故障导致云服务器故障,系统会自动拉起弹性云服务器。 | 请检查云服务器和业务应用是否恢复正常。 | 云服务器故障。 |
| 开机失败 | faultPowerOn | 重要 | 云服务器开机失败。 | 重试开机,若仍开机失败,联系运维人员处理。 | 云服务器无法开机。 |
| 宿主机存在宕机风险 | hostMayCrash | 重要 | 弹性云服务器所在的宿主机存在宕机风险,且由于一些原因,无法通过热迁移手段规避该风险。 | 将该弹性云服务器上业务移除,并将该弹性云服务器删除或关机,等待运维人员处理完风险后再开机。 | 可能因为宿主机宕机而导致业务中断。 |
| 实例计划迁移已完成 | instance_migrate_completed | 重要 | 由于底层硬件、系统运维等影响,实例在计划时间迁移,任务已完成。 | 等待运行状态恢复正常,确认业务是否自动恢复。 | 业务存在中断的可能 |
| 实例计划迁移执行中 | instance_migrate_executing | 重要 | 由于底层硬件、系统运维等影响,实例在计划时间迁移,任务执行中。 | 等待自动恢复事件结束,观察业务是否受到影响。 | 业务存在中断的可能 |
| 实例计划迁移已取消 | instance_migrate_canceled | 重要 | 由于底层硬件、系统运维等影响,实例在计划时间迁移,任务已取消。 | 无 | 无 |
| 实例计划迁移失败 | instance_migrate_failed | 重要 | 由于底层硬件、系统运维等影响,实例在计划时间迁移,任务失败。 | 联系运维人员处理 | 业务中断 |
| 实例计划迁移等待执行 | instance_migrate_scheduled | 重要 | 由于底层硬件、系统运维等影响,实例在计划时间迁移,任务等待执行。 | 确认执行窗口对业务的影响 | 无 |
| 实例计划规格变更失败 | instance_resize_failed | 重要 | 实例在计划时间规格变更,任务失败。 | 联系运维人员处理 | 业务中断 |
| 实例计划规格变更已完成 | instance_resize_completed | 重要 | 实例在计划时间规格变更,任务已完成。 | 无 | 无 |
| 实例计划规格变更执行中 | instance_resize_executing | 重要 | 实例在计划时间规格变更,任务执行中。 | 等待自动恢复事件结束,观察虚拟机是否正常变更成功。 | 业务中断 |
| 实例计划规格变更已取消 | instance_resize_canceled | 重要 | 实例在计划时间规格变更,任务已取消。 | 无 | 无 |
| 实例计划规格变更等待执行 | instance_resize_scheduled | 重要 | 实例在计划时间规格变更,任务等待执行。 | 确认执行窗口对业务的影响。 | 无 |
| 实例计划重新部署等待执行 | instance_redeploy_scheduled | 重要 | 由于底层硬件、系统运维等影响,实例在计划时间重新部署到新主机,任务等待执行。 | 确认执行窗口对业务的影响。 | 无 |
| 实例计划重启等待执行 | instance_reboot_scheduled | 重要 | 由于底层硬件、系统运维等影响,实例在计划时间重启,任务等待执行。 | 确认执行窗口对业务的影响。 | 无 |
| 实例计划停止等待执行 | instance_stop_scheduled | 重要 | 由于底层硬件、系统运维等影响,实例在计划时间停止,任务等待执行。 | 确认执行窗口对业务的影响。 | 无 |
| GPU SRAM存在Uncorrectable ECC告警 | SRAMUncorrectableEccError | 重要 | GPU卡SRAM出现Uncorrectable ECC Error硬件故障。 | 如果业务受损,请提交工单。 | 可能gpu硬件问题导致SRAM故障,导致业务异常退出。 |
| FPGA链路故障 | FPGALinkFault | 紧急 | 弹性云服务器所在的主机上FPGA卡故障。包括:FPGA卡故障、FPGA卡故障恢复中。 | 业务应用做成高可用。 FPGA卡故障恢复后,确认业务是否自动恢复。 | 业务中断。 |
| 实例计划重新部署问询中 | instance_redeploy_inquiring | 重要 | 由于底层硬件、系统运维等影响,实例在计划时间重新部署到新主机,任务问询中。 | 授权重新部署到新主机操作。 | 无 |
| 本地盘换盘取消 | localdisk_recovery_canceled | 重要 | 因本地盘故障,更换本地盘任务,任务已取消 | 无 | 无 |
| 本地盘换盘等待执行 | localdisk_recovery_scheduled | 重要 | 因本地盘故障,更换本地盘任务,任务等待执行 | 确认执行窗口对业务的影响 | 无 |
| GPU存在通用Xid事件告警 | commonXidError | 重要 | GPU卡出现Xid事件告警 | 如果业务受损,请提交工单。 | gpu硬件、驱动、应用问题导致Xid事件,可能导致业务异常退出。 |
| nvidia-smi命令卡住 | nvidiaSmiHangEvent | 重要 | nvidia-smi命令超时,该命令可能卡住 | 如果业务受损,请提交工单。 | 可能是命令执行过程中,触发驱动问题,导致命令卡住,同时可能出现业务使用驱动报错问题。 |
| NPU: 存在不可纠正ECC错误 | UncorrectableEccErrorCount | 重要 | NPU卡出现Uncorrectable ECC Error硬件故障 | 如果业务受到影响,转硬件换卡 | 业务可能受到影响终止 |
| 实例计划重新部署已取消 | instance_redeploy_canceled | 重要 | 由于底层硬件、系统运维等影响,实例在计划时间重新部署到新主机。 | 无 | 无 |
| 实例计划重新部署执行中 | instance_redeploy_executing | 重要 | 由于底层硬件、系统运维等影响,实例在计划时间重新部署到新主机。 | 等待自动恢复事件结束,观察业务是否受到影响。 | 业务中断 |
| 实例计划重新部署已完成 | instance_redeploy_completed | 重要 | 由于底层硬件、系统运维等影响,实例在计划时间重新部署到新主机。 | 等待运行状态恢复正常,观察业务是否受到影响。 | 业务恢复正常 |
| 实例计划重新部署失败 | instance_redeploy_failed | 重要 | 由于底层硬件、系统运维等影响,实例在计划时间重新部署到新主机。 | 联系运维人员处理。 | 业务中断 |
| 本地盘换盘问询中 | localdisk_recovery_inquiring | 重要 | 本地盘故障 | 授权本地盘换盘操作。 | 本地盘不可用 |
| 本地盘换盘执行中 | localdisk_recovery_executing | 重要 | 本地盘故障 | 等待本地盘换盘结束,观察本地盘功能是否正常。 | 本地盘不可用 |
| 本地盘换盘已完成 | localdisk_recovery_completed | 重要 | 本地盘故障 | 等待运行状态恢复正常,确认本地盘功能是否自动恢复。 | 本地盘恢复正常 |
| 本地盘换盘失败 | localdisk_recovery_failed | 重要 | 本地盘故障 | 联系运维人员处理。 | 本地盘不可用 |
| GPU时钟降频告警 | gpuClocksThrottleReasonsAlarm | 提示 |
| 判断是否为硬件原因导致降频,如果是,转硬件同事处理。 | GPU频率下降,算力下降。 |
| GPU DRAM ECC页隔离待生效 | gpuRetiredPagesPendingAlarm | 重要 |
|
| GPU功能异常。 |
| GPU DRAM ECC行重映射待生效 | gpuRemappedRowsAlarm | 重要 | GPU显存中存在某些rows出现错误,需要被重新映射,需要将问题行映射到备用资源。 |
| GPU功能异常 |
| GPU DRAM ECC行重映射剩余可用资源不足 | gpuRowRemapperResourceAlarm | 重要 |
| 转硬件同事处理 | GPU功能异常 |
| GPU DRAM 可纠正ECC报错 | gpuDRAMCorrectableEccError | 重要 |
|
| GPU功能可能异常 |
| GPU DRAM 不可纠正ECC报错 | gpuDRAMUncorrectableEccError | 重要 |
|
| GPU功能可能异常 |
| GPU当前内核版本和安装驱动时的内核版本不一致 | gpuKernelVersionInconsistencyAlarm | 重要 | GPU当前内核版本和安装驱动时的内核版本不一致: GPU驱动在安装的时候会基于当前内核进行编译,如果内核版本不一致说明自行升级了内核,这个时候驱动会变得不可用,需要重新安装驱动。 |
| GPU功能异常 |
| OS出现ReadOnly问题 | ReadOnlyFileSystem | 紧急 | 文件系统%s只读 | 请检查磁盘健康状态 | 无法对文件进行写操作 |
| NPU:驱动固件不匹配 | NpuDriverFirmwareMismatch | 重要 | NPU驱动固件版本不匹配 | 请从昇腾官网获取匹配版本重新安装 | 无法正常使用NPU卡 |
| NPU:Docker容器环境检测 | NpuContainerEnvSystem | 重要 | Docker不可用 | 确认docker软件是否正常 | 无法使用docker软件 |
| 重要 | 容器插件Ascend-Docker-Runtime未安装 | 安装容器插件Ascend-Docker-Runtime,否则影响容器使用昇腾卡 | docker容器无法挂载NPU卡 | ||
| 重要 | 操作系统没有开启IP转发功能 | 请检查/etc/sysctl.conf文件中net.ipv4.ip_forward配置 | docker容器无法正常网络通信 | ||
| 重要 | 容器共享内存过小 | 共享内存默认为64M,可按需修改 方式一: 修改/etc/docker/daemon.json配置文件default-shm-size字段 方式二: docker run 命令中使用 --shm-size 参数来设置单个容器的共享内存大小 | 分布式训练时共享内存不足导致训练失败 | ||
| NPU:RoCE网卡down | RoCELinkStatusDown | 重要 | NPU 卡 %d RoCE Link 状态Down | 请检查NPU Roce网口状态 | NPU网卡不可用 |
| NPU:RoCE网卡健康状态异常 | RoCEHealthStatusError | 重要 | NPU 卡 %d RoCE 网络健康状态异常 | 请检查NPU Roce网卡健康状态 | NPU网卡不可用 |
| NPU:Roce网卡配置文件/etc/hccn.conf不存在 | HccnConfNotExisted | 重要 | Roce网卡配置文件"/etc/hccn.conf"不存在 | 请检查/etc/hccn.conf网卡配置文件 | Roce网卡不可用 |
| GPU:GPU基本组件异常 | GpuEnvironmentSystem | 重要 | nvidia-smi命令异常 | 请检查GPU驱动是否正常 | GPU卡驱动不可用 |
| 重要 | nvidia-fabricmanager版本和GPU驱动版本不一致 | 请检查GPU驱动版本和nvidia-fabricmanager版本 | nvidia-fabricmanager 无法正常工作,影响 GPU 的使用 | ||
| 重要 | 容器插件nvidia-container-toolkit未安装 | 安装容器插件nvidia-container-toolkit | docker无法挂载GPU卡 | ||
| 本地磁盘挂载巡检 | MountDiskSystem | 重要 | /etc/fstab中有无效的UUID | 请检查/etc/fstab配置文件中UUID的正确性,否则可能会导致机器重启失败 | 挂载磁盘错误,导致机器重启异常 |
| GPU:Ant系列机器动态路由配置错误 | GpuRouteConfigError | 重要 | Ant系列机器网卡%s动态路由未配置或配置错误,CMD [ip route]: %s | CMD [ip route show table all]: %s。 | 请正确配置RoCE网卡路由 | NPU网络通信异常 |
| NPU:Roce 端口未散列配置 | RoCEUdpConfigError | 重要 | RoCE UDP端口未散列配置 | 请检查NPU RoCE UDP端口配置情况 | 影响NPU卡通信性能 |
| 系统内核自动升级预警 | KernelUpgradeWarning | 重要 | 系统内核自动升级预警,旧版本:%s,新版本:%s | 系统内核升级可能导致配套AI软件异常,请检查系统更新日志,避免机器重启 | 可能导致配套AI配套软件不可用 |
| NPU环境相关命令检测 | NpuToolsWarning | 重要 | hccn_tool不可用 | 请检查NPU驱动是否正常 | 无法配置RoCE网卡的IP、网关 |
| 重要 | npu-smi不可用 | 请检查NPU驱动是否正常 | 无法正常使用NPU卡 | ||
| 重要 | ascend-dmi不可用 | 请检查工具包ToolBox是否正常安装 | 无法使用ascend-dmi进行性能分析 | ||
| NPU驱动异常告警 | NpuDriverAbnormalWarning | 重要 | NPU驱动异常 | 重装NPU驱动 | 无法正常使用NPU卡 |