事件中心页面授权运维
场景描述
华为云会对节点的软硬件设备进行故障检测和日常运维,当节点由于不可恢复故障需要进行硬件维护时,会推送计划事件到控制台的事件中心。您可以在事件中心,查看具体的事件信息、事件类型、事件状态、事件描述等信息,可以授权华为技术支持对故障节点进行运维或重部署节点。
| 事件类型 | 事件状态 | 可执行操作 | 适用的资源类型 | 说明 |
|---|---|---|---|---|
| 系统维护 | 待授权 | 维护机器、重部署 | Snt9b, Snt9b21 | 维护机器操作需要对主机进行下电,在此期间节点将停止无法工作。在维护机器前,请确保节点中部署的业务离线或节点停止对业务无影响。 重部署操作对于包含本地盘的实例,实例重部署操作会丢失所有本地盘上的数据,如果无需保留本地盘上的数据,可通过重部署快速修复节点。 |
| 本地盘恢复 | 待授权 | 更换本地盘、重部署 | Snt9b, Snt9b21 | 更换本地盘操作会导致故障本地盘的数据可能部分或全部受损且不可恢复,建议您在收到事件通知时,立刻对重要数据进行备份。 本地盘修复后,请通过重置节点完成对分区的修复。 在本地盘修复期间,您可以随时选择重部署方式来快速恢复故障本地盘,但该方式将导致所有本地盘数据丢失并重启节点,操作前需要对所有本地盘数据进行备份。 警告: 更换本地盘操作将会导致本地盘数据丢失,授权前请先迁移业务和备份数据。 |
| 运维授权 | 待授权 | 节点运维 | Snt9b, Snt9b21 | 节点运维操作表示授权华为技术支持对Lite资源类型的节点进行运维操作 |
| 节点重启 | 待授权 | 节点重启 | Snt9b, Snt9b21, Snt9b23 | 节点重启操作会停止实例,可能导致业务中断,未保存的数据丢失,请提前确认业务影响。 |
| 超节点维护 | 待授权 | 维护机器 | Snt9b23 | 维护机器操作需要对主机进行下电,在此期间节点将停止无法工作。在维护机器前,请确保节点中部署的业务离线或节点停止对业务无影响。 |
| 超节点重部署 | 待授权 | 重部署 | Snt9b23 | 重部署操作大约耗时10~30分钟,并且会重启节点,请选择合适的时间授权并提前进行业务切流。
|
| 超节点本地盘恢复 | 待授权 | 更换本地盘 | Snt9b23 | 当系统检测到超节点的本地盘因硬件故障、数据异常等原因导致无法正常读写时,会对受影响的节点自动生成“超节点本地盘恢复”计划事件。 本地盘修复后,请通过重置节点完成对分区的修复。 更换本地盘操作会导致故障本地盘的数据可能部分或全部受损且不可恢复,建议您在收到事件通知时,立刻对重要数据进行备份。 警告: 更换本地盘操作将会导致本地盘数据丢失,授权前请先迁移业务和备份数据。 |
概念解释
- 系统维护: 系统维护操作要对主机下电维修,需要运维人员在机房实际重新插拔设备或更换备机,有时需要等待备件,因此时效性相对较差。
- 重部署:重部署操作是授权华为技术支持对发生故障的节点进行整机替换,并能够确保节点的配置信息和之前保持一致。故障恢复快,但是重部署后本地盘数据将会丢失数据。请谨慎操作。重部署前请先迁移业务和备份数据。
- 强制重部署:在节点不可用时强制执行替换,需清空所有存储数据。
- 冷备整机替换:使用备用硬件替换故障节点,保留配置信息。
- 本地盘:本地盘指的是server上安装的物理硬盘,重部署后,机器上安装的硬盘会同步被更换,因此数据会丢失。
- 云硬盘:云硬盘是为弹性云服务器(ECS)和裸金属服务器(BMS)提供的高可靠、高性能、规格丰富且可弹性扩展的虚拟块存储服务,不和具体server绑定。
- 系统盘:系统盘指的是节点上安装的Linux的内核、启动引导程序、系统配置文件等重要信息的硬盘,大多是云硬盘。
约束限制
- 当前中国站所有站点均支持此功能,国际站部分站点(香港、约翰内斯堡和新加坡)站点支持此功能。
- 仅Snt9b、超节点Snt9b21和超节点Snt9b23支持通过计划事件发起硬件维护。
- 超节点重部署需要在物理超节点内操作。当超节点达到满配48台时,不支持重部署操作,该情况下会直接推送超节点系统维护计划事件。
- 如果计划事件不满足表1所示的事件状态,授权处理按钮为置灰状态。
- 节点本地盘恢复和超节点本地盘恢复操作将会导致本地盘数据丢失,授权前请先迁移业务和备份数据。本地盘恢复后需要登录到轻量算力节点内完成本地盘分区。
计划事件状态流转说明
完成计划事件授权处理后,计划事件的状态会从待授权依次流转至待执行、执行中、已完成/失败,如下图所示。
计划事件列表中,事件展示时间与事件状态有关。
- 状态为“取消”或“已完成”,会保留7天记录。
- 状态为“待授权”时,会保留30天记录,如果超过30天未授权处理,则状态会自动修改为“取消”状态。
- 状态为“失败”,请联系华为技术支持处理。
| 计划事件状态 | 状态说明 | 可执行的操作 |
|---|---|---|
| 待授权(Authorization Pending) | 系统计划事件已生成但还未得到授权,需要用户授权执行 | 授权计划事件,选择对应的处理方式 |
| 待执行(Execution Pending) | 计划事件已得到授权,系统会根据执行窗口自动执行 | 无需操作 |
| 执行中(Executing) | 用户选择的计划事件处理方式正在执行中 | 无需操作 |
| 已完成(Completed) | 计划事件已执行成功,对应的故障已完成修复 | 无需操作 |
| 取消 (Canceled) | 计划事件被系统取消,比如导致该计划事件的根因故障已修复,系统会自动取消计划事件 | 无需操作 |
| 失败 (Failed) | 计划事件执行失败 | 联系华为技术支持进行运维处理 |
- 选择重部署处理的修复场景,计划事件的状态会直接从待授权切换到执行中,因为用户授权重部署后的执行窗口是立即执行。
- 强制重部署会在节点重部署完成后进行节点重置,会导致服务器的本地盘数据和系统盘数据全部丢失,请谨慎操作。
操作步骤
- 登录ModelArts管理控制台,在左侧菜单栏中选择“资源管理 > 辅助工具 > 事件中心”。
- 单击操作列的“授权处理”,在弹出的提示框中选择对应的处理方式,单击“确认”即可完成授权。 图2 授权处理
- 授权成功后,“授权处理”按钮置灰,事件状态变为待执行/执行中。
如果选择了重部署处理方式,操作列会显示查看进度按钮。单击操作列查看进度按钮,可以看到当前重部署的进度信息。如果重部署失败,也可以看到失败原因,如果用户在重部署时勾选静默修复,可以无需关注,系统会自动切换为原地维修计划事件或者重新重部署节点。
图3 事件进度
在完成运维操作后,事件将变成“已完成”状态,无需额外操作。
系统维护场景操作示例
重部署场景操作示例
专属资源池和轻量算力集群两类资源在重部署时采用相同处理逻辑,但轻量算力节点当前仅支持静默修复模式的重部署操作。
- 若选择重部署且未启用静默修复,任务失败时(如无同规格冷备机器)需联系华为技术支持处理。
- 专属资源池和轻量算力集群
- 操作流程
- 在2时单击"授权处理"按钮时,选择"重部署"处理方式。系统将执行冷备整机替换,确保新节点IP、配置与源节点一致,恢复时间约10-30分钟。
- 操作前准备:
- 确认是否勾选"静默修复"及"强制重部署",输入"YES"后单击"确认"完成授权。
- 静默修复机制
- 启用场景:当重部署失败(如无冷备机器、准入检查失败),系统自动流转至"系统维护"或发起多次重部署,生成新计划事件且无需二次授权。
- 未启用场景:计划事件状态变为失败,需人工联系技术支持处理。
- 强制重部署说明
- 适用条件:节点不可用时强制执行冷备替换,或用户明确需要节点重置。
- 注意事项:
- 操作耗时20-30分钟,本地盘与系统盘数据将被清空,需提前备份。
- 事件状态"已完成"表示故障修复,可调度节点进行业务作业;"失败"状态需联系技术支持。
- 静默修复联动逻辑
示例2:Snt9b和超节点Snt9b21重部署
- 依赖条件
- 操作步骤
- 在2时单击"授权处理"按钮时选择"重部署",确认静默修复(建议默认勾选)与强制重部署选项。
- 在授权确认窗口输入"YES"或单击"一键输入"后提交。
图5 授权处理
- 操作流程
常见问题
- 专属资源池节点故障定位
对于专属资源池,ModelArts平台在识别到节点故障后,通过给K8S节点增加污点的方式(taint)将节点隔离避免新作业调度到该节点而受到影响,并且使本次作业不受污点影响。当前可识别的故障类型如下,可通过隔离码及对应检测方法定位故障。详情请见资源池节点故障定位。
- 轻量算力节点进行重部署时,节点详情页的状态与实际情况不一致。
轻量算力节点的节点状态并非实时同步,自动同步周期较长。可能出现节点详情页的状态与实际情况不一致,可在轻量算力节点详情页单击右上角“同步”按钮,实现手动状态同步。
例如:
Snt9b23在重部署前会先自动关机,如果关机后,重部署失败(如无备机),实际节点状态为已关机。在轻量算力节点自动同步之前可能会显示运行中等状态。用户可以手动同步状态。
