更新时间:2026-08-13 GMT+08:00
分享

使用AI助手处理ModelArts典型开发与运维场景

在ModelArts的日常开发与运维中,开发人员和运维人员经常需要处理资源清理、作业状态巡检以及跨时段调度等重复性工作,这些任务不仅耗时而且容易出错。面对这些挑战,如何高效地完成这些任务成为了一个亟待解决的问题。

本文将为您提供一套以OpenClaw为例的最佳实践——本文整理了多个高频真实业务场景的“标准提示词模板”。您无需重新编写复杂的Prompt,只需在Notebook环境中打开OpenClaw,将提示词直接复制粘贴,即可让Agent自动完成这些复杂的运维任务,从而提高工作效率,减少人为错误。

Notebook是容器运行时环境,运行环境会在关机时被清理。请通过保存镜像及时保留npm install、apt-get install、yum install、pip install和OpenClaw安装后的配置对话等,以避免Notebook运行环境中的数据或对话session丢失。关于如何保存镜像,请参见保存镜像

约束限制

Notebook OpenClaw功能仅支持“华北-北京四”、“西南-贵阳一”、“华北-乌兰察布一”、“华东-上海一”和“华南-广州”区域。

计费说明

  • 在ModelArts进行AI开发时,会产生计算资源等计费。计费详情请参见计费项
  • OpenClaw本身不收费,但调用大模型API会产生费用。具体计费方式取决于您选择的API Provider。

配置Notebook镜像自动备份与资源池清理定时任务

  1. 登录ModelArts管理控制台,在左侧导航栏选择开发空间 > Notebook,进入“Notebook”页面。
  2. “状态”“运行中”的Notebook实例的操作列,单击“接入环境”,在“接入方式”对话框,单击“JupyterLab 接入”右侧的“接入”
  3. “ModelArts Launcher”页面的“AI Agent”区域,单击“OpenClaw”,打开OpenClaw。
  4. 在OpenClaw左侧导航栏,单击“聊天”,输入提示词,示例如下(示例中的变量请根据实际情况填写):
    你是一位云资源运维专家,请编写一个在每天晚上12点自动执行的定时任务脚本。该任务的核心目标是清理和优化 ModelArts 资源。首先,处理公共池。你需要排查公共池中的所有Notebook实例,并停止它们。但对于描述中带有“勿删”字样的实例,必须先为其保存镜像,然后再停止。保存镜像时,组织应选择${镜像组织名称},镜像名称与实例名称保持一致,版本则使用保存时的年月日时分秒(YYYYMMDDHHmmss)时间戳。其次,处理专属池。在专属池中,首先要跳过正在运行此定时任务的实例本身。对于其他实例,如果其描述中包含“勿删”字样,则同样遵循“先保存镜像(规则同上),后停止”的流程;其余实例则直接停止。最后,清理专属资源池。你需要保留名为${白名单专属资源池名称}的资源池,但需检查其节点数,如果超过1个,则将其缩容至1个节点。除了这个白名单资源池外,其余所有专属资源池都应被直接删除,无论其中是否有正在运行的作业。
    图1 创建定时管理资源任务

训练作业健康度评估报告

  1. 登录ModelArts管理控制台,在左侧导航栏选择开发空间 > Notebook,进入“Notebook”页面。
  2. “状态”“运行中”的Notebook实例的操作列,单击“接入环境”,在“接入方式”对话框,单击“JupyterLab 接入”右侧的“接入”
  3. “ModelArts Launcher”页面的“AI Agent”区域,单击“OpenClaw”,打开OpenClaw。
  4. 在OpenClaw左侧导航栏,单击“聊天”,输入提示词,示例如下(示例中的变量请根据实际情况填写):
    请你作为运维助手,对训练作业${训练作业ID}执行一次全面的健康度评估。请严格按照以下步骤进行操作,并给出最终的评估结论:
    1. 检查训练作业基础运行状态请通过系统命令或作业管理平台接口,确认训练作业当前的生命周期状态(例如:Running、Pending、Failed、Completed)。同时,检查作业关联的Pod或容器是否处于正常的Running状态,以及核心训练进程是否存活。
    2. 深度排查并总结作业事件与日志请前往查看该训练作业的事件日志(PodEvents)以及训练进程的标准输出/错误日志(Stdout/Stderr)。重点排查:是否存在资源调度失败(如GPU/CPU 资源不足)、镜像拉取失败、分布式训练通信超时、显存溢出(OOM)或代码执行报错等固定异常原因。动作要求:对抓取到的关键事件和报错日志进行总结,判断这些异常是否导致了作业停滞或即将失败。
    3. 监控核心训练指标(如有条件)如果具备指标监控能力,请简要查看作业近期的资源利用率(如GPU利用率是否长期为0)或Loss曲线的变化趋势,判断训练是否处于正常的收敛状态,是否存在梯度爆炸/消失或死循环等逻辑异常。
    4. 输出评估报告请结合上述的状态检查、事件日志总结以及训练指标情况,告诉我当前训练作业整体是否健康。如果发现异常,请明确指出具体的报错原因、异常发生的时间点,并给出初步的排查建议。
    图2 训练作业健康度评估

推理服务健康度评估报告

  1. 登录ModelArts管理控制台,在左侧导航栏选择开发空间 > Notebook,进入“Notebook”页面。
  2. “状态”“运行中”的Notebook实例的操作列,单击“接入环境”,在“接入方式”对话框,单击“JupyterLab 接入”右侧的“接入”
  3. “ModelArts Launcher”页面的“AI Agent”区域,单击“OpenClaw”,打开OpenClaw。
  4. 在OpenClaw左侧导航栏,单击“聊天”,输入提示词,示例如下(示例中的变量请根据实际情况填写):
    请你作为云运维助手,对我在华为云控制台部署的推理服务${推理服务ID}执行一次全面的健康度评估。请严格按照以下步骤进行排查,并给出最终的评估结论:
    1. 检查推理服务云端运行状态请通过华为云控制台或相关的云资源管理接口,确认该推理服务当前的生命周期状态是否正常(例如:状态应为“运行中/Running”或“已部署/Deployed”,而非“创建中”、“异常/Abnormal”或“已停止”)。同时,检查服务关联的底层资源(如Pod、容器实例或节点)是否处于Ready状态。
    2. 深度排查并总结服务事件(PodEvents)请前往查看该推理服务的事件日志或PodEvents(例如在控制台的“日志与事件”或“监控”板块中)。重点排查:是否存在固定的异常报错原因,例如“容器启动失败(Failed tostart container)”、“镜像拉取失败”、“驱动版本与镜像不匹配”、“资源配额不足(QuotaExceeded)”或“健康检查探针失败(Liveness/Readiness probe failed)”等。动作要求:对抓取到的关键事件内容进行总结,判断这些事件是否表明服务当前存在异常或潜在风险。
    3. 输出评估报告请结合上述的云端状态检查结果和事件日志总结,告诉我当前推理服务整体是否健康。如果发现异常,请明确指出具体的报错原因、异常发生的时间点,并给出初步的排查建议(例如:是否需要调整资源规格、更换镜像版本或联系SRE排查节点问题)。
    图3 推理服务健康度评估

专属资源池健康度评估

  1. 登录ModelArts管理控制台,在左侧导航栏选择开发空间 > Notebook,进入“Notebook”页面。
  2. “状态”“运行中”的Notebook实例的操作列,单击“接入环境”,在“接入方式”对话框,单击“JupyterLab 接入”右侧的“接入”
  3. “ModelArts Launcher”页面的“AI Agent”区域,单击“OpenClaw”,打开OpenClaw。
  4. 在OpenClaw左侧导航栏,单击“聊天”,输入提示词,示例如下(示例中的变量请根据实际情况填写):
    请你作为云资源运维专家,对当前的资源池${专属资源池ID}执行一次全面的健康度评估。请严格按照以下步骤进行操作,并输出最终的汇总报告:
    1. 检查资源池整体健康状态与运行事件请通过相关的云平台接口或集群管理命令,确认资源池及其底层节点(Node)的整体状态是否正常(例如:状态应为“正常/Ready”或“运行中”,而非“亚健康”、“异常/NotReady”或“通道静默”)。重点排查:前往查看资源池及节点相关的运行事件(PodEvents或Node Events)。检查是否存在节点网络不可用、内存/磁盘压力过大(Memory/DiskPressure)、组件通信异常或 ICAgent 采集失败等固定报错原因。
    2. 输出汇总分析报告请结合上述的资源池健康状态、运行事件以及资源碎片分析结果,为我生成一份最终的评估报告。报告需明确指出当前资源池整体是否健康,如果发现异常,请给出具体的优化建议(例如:建议清理碎片、扩容特定规格的节点或调整资源调度策略)。
    图4 专属资源池健康度评估

专属资源池碎片化分析

  1. 登录ModelArts管理控制台,在左侧导航栏选择开发空间 > Notebook,进入“Notebook”页面。
  2. “状态”“运行中”的Notebook实例的操作列,单击“接入环境”,在“接入方式”对话框,单击“JupyterLab 接入”右侧的“接入”
  3. “ModelArts Launcher”页面的“AI Agent”区域,单击“OpenClaw”,打开OpenClaw。
  4. 在OpenClaw左侧导航栏,单击“聊天”,输入提示词,示例如下(示例中的变量请根据实际情况填写):
    请你作为云资源运维专家,对当前的资源池${专属资源池ID}执行一次可用资源分析。请严格按照以下步骤进行操作,并输出最终的汇总报告:
    1. 深度分析节点剩余资源与碎片化情况请获取当前资源池内各节点的剩余可用资源数据(包括 CPU、内存以及 GPU 显存等核心指标)。碎片分析重点:结合剩余资源总量,分析资源是否存在严重的“碎片化”现象。例如,虽然节点总剩余资源充足,但是否因为分散在不同节点或存在大量不连续的小规格资源(如显存碎片、无法被大规格任务调度的零散 CPU/内存),导致无法成功调度新的作业或容器。请评估当前资源池的“库存健康分”或资源调度的实际成功率。
    2. 输出汇总分析报告请结合上述的资源池健康状态、运行事件以及资源碎片分析结果,为我生成一份最终的评估报告。报告需明确指出当前资源池整体是否存在因资源碎片化导致的“有资源却无法使用”的隐患。如果发现异常,请给出具体的优化建议。
    图5 专属资源池碎片化分析

配置朝推夕训定时任务

  1. 登录ModelArts管理控制台,在左侧导航栏选择开发空间 > Notebook,进入“Notebook”页面。
  2. “状态”“运行中”的Notebook实例的操作列,单击“接入环境”,在“接入方式”对话框,单击“JupyterLab 接入”右侧的“接入”
  3. “ModelArts Launcher”页面的“AI Agent”区域,单击“OpenClaw”,打开OpenClaw。
  4. 在OpenClaw左侧导航栏,单击“聊天”,输入提示词,示例如下(示例中的变量请根据实际情况填写):
    请作为我的专属运维专家,为我执行“朝推夕训”的自动化资源调度任务。请严格按照以下早晚两个阶段的逻辑,依次完成推理服务和训练任务的启动与保障工作:
    第一阶段:早上${推理服务启动时间}
    推理服务启动与确认:前往华为云控制台,启动我创建的推理服务${推理服务ID}。持续轮询直到确认其状态变为“运行中(Running)”且实例处于“就绪”状态。
    健康度排查:检查该服务近期的PodEvents或运行日志,重点排查是否存在“容器启动失败”、“驱动版本不匹配”或“资源配额不足”等异常。如有异常,请总结报错原因并汇报。
    时长保障:确认服务健康后,检查配置确保其运行时长能覆盖白天${推理服务运行时长}小时,保证白天推理业务不受影响。
    第二阶段:晚上训练任务启动(预设晚间执行逻辑)
    资源池分析:在晚上${训练作业启动时间}左右,先检查资源池状态。确认节点正常,并分析剩余可用资源(CPU/内存/GPU),排查是否存在严重的“资源碎片化”现象,确保有足够连续资源拉起训练作业。
    启动与确认:资源无误后,启动指定的训练作业,训练作业配置可以复制训练作业${已有训练作业ID}。持续监控直到确认其状态变为“运行中(Running)”,且训练进程正常拉起。
    异常排查:查看训练作业的PodEvents和日志,排查是否存在“镜像拉取失败”、“分布式通信超时”、“显存溢出(OOM)”或“代码执行报错”等问题。
    时长保障:确认训练任务健康后,检查配置确保其最大运行时长能覆盖夜间${训练作业运行时长}小时。
    最终汇报
    请根据当前实际执行的时间段,向我汇报对应任务的完成情况。例如:“【朝推任务完成】推理服务已成功启动并处于健康运行状态。” 或 “【夕训任务完成】训练任务已成功启动,资源池状况良好。”
    图6 朝推夕训定时任务

相关文档