# 魔坊(ModelArts)模型训推平台 > 面向AI开发者的一站式开发平台 ## 服务公告 - [ModelArts版本配套关系表](https://support.huaweicloud.com/bulletin-modelarts/bulletin-modelarts_0023.md): 本文档介绍ModelArts中针对Ascend Snt9b和Snt9b23算力资源的周边依赖组件配套版本关系。非配套版本易出现软件适配问题,个别新机型(如560T)降低驱动固件版本到24.x后会出现NPU卡无法识别的问题,导致机器故障无法使用。因此推荐使用官方操作系统自带配套版本,如需更换版本配套,请参考以下方式查询配套关系:登录昇腾计算 - [ModelArts配套的驱动版本策略](https://support.huaweicloud.com/bulletin-modelarts/bulletin-modelarts_0036.md): 本章节介绍ModelArts的专属资源池和轻量算力集群资源池中不同卡类型配套支持的驱动版本。轻量算力节点的驱动版本和轻量算力节点的操作系统镜像强配套,轻量算力节点的驱动版本配套关系和策略请参见ModelArts轻量算力节点操作系统EOS公告。HDK(Hardware Development Kit) 是华为昇腾系列AI处理器配套的硬件开发 - [ModelArts提供的容器镜像EOS公告](https://support.huaweicloud.com/bulletin-modelarts/bulletin-modelarts_0041.md): ModelArts提供了ARM+Ascend、GPU等规格的统一镜像,包括MindSpore、PyTorch。适用于开发环境、模型训练、服务部署,以提升用户体验和系统稳定性。为了方便您能够体验最新功能、规避已知漏洞或问题,并保障业务的安全性和可靠性,建议定期切换至最新版本的统一镜像。版本EOS(停止服务)阶段:容器镜像EOS之后,Mode - [ModelArts专属资源池的Kubernetes版本策略](https://support.huaweicloud.com/bulletin-modelarts/bulletin-modelarts_0040.md): ModelArts专属资源池为用户提供云容器引擎提供高度可扩展的、高性能的企业级Kubernetes集群。由于社区定期发布Kubernetes版本,ModelArts会随之发布相应的集群公测和商用版本。本文将为您介绍ModelArts专属资源池的Kubernetes版本策略。版本商用阶段:ModelArts专属资源池商用版本经过充分验证, - [ModelArts轻量算力集群/专属资源池节点操作系统版本配套关系表](https://support.huaweicloud.com/bulletin-modelarts/bulletin-modelarts_0042.md): ModelArts为轻量算力集群和专属资源池提供了预置的节点操作系统,以提升用户体验和系统稳定性。为了方便您能够体验最新功能、规避已知漏洞或问题,并保障业务的安全性和可靠性,建议定期切换至最新版本的操作系统。版本EOS(停止服务)阶段:操作系统版本EOS之后,ModelArts将不再支持对该版本的资源创建,同时不提供相应的技术支持,包含新 - [ModelArts轻量算力节点操作系统EOS公告](https://support.huaweicloud.com/bulletin-modelarts/bulletin-modelarts_0046.md): ModelArts为轻量算力节点提供了预置的节点操作系统,以提升用户体验和系统稳定性。为了方便您能够体验最新功能、规避已知漏洞或问题,并保障业务的安全性和可靠性,建议定期切换至最新版本的操作系统。版本EOS(停止服务)阶段:操作系统版本EOS之后,ModelArts将不再支持对该版本的资源创建,同时不提供相应的技术支持,包含新特性更新、漏 - [ModelArts公共资源池调整公告](https://support.huaweicloud.com/bulletin-modelarts/bulletin-modelarts_0049.md): 华为云ModelArts对Notebook和模型训练的公共资源池进行安全加固和优化,提升云上资源的安全。ModelArts服务将于2026年8月16日 00:00(北京时间)不允许使用公共资源池中的昇腾Snt9和Vnt1的部分规格新建Notebook实例和训练作业。Notebook涉及规格:华北-北京四、华北-乌兰察布一昇腾Snt9相关公 - [ModelArts开发环境公共资源池调整公告](https://support.huaweicloud.com/bulletin-modelarts/bulletin-modelarts_0027.md): 华为云ModelArts针对开发环境公共资源池进行安全加固和优化,新模式的公共资源池可以为用户的资源提供更好的隔离性,提升云上资源的安全。新建实例会调度到新模式的资源池,存量实例会逐步迁移到新模式的资源池。ModelArts服务将于2026年5月6日 00:00(北京时间)逐步缩容并迁移历史公共资源池。影响区域:华为云全部Region。M - [ModelArts专属资源池网络调整公告](https://support.huaweicloud.com/bulletin-modelarts/bulletin-modelarts_0026.md): 华为云ModelArts针对专属资源池网络进行安全加固和优化,新的网络模式可以为用户的资源提供更好的隔离性,提升云上资源的安全。为保障您的网络安全,建议您后续使用新网络创建资源池。ModelArts服务将于2025年10月15日 00:00(北京时间)逐步限制存量旧网络模式的使用。在ModelArts控制台的网络管理页面,可以查看该网络是 - [ModelArts Notebook开启HTTPS特性上线公告](https://support.huaweicloud.com/bulletin-modelarts/bulletin-modelarts_0047.md): 为提升产品的安全性,华为云ModelArts将于2026年1月15日 00:00 (北京时间) 上线Notebook启动JupyterLab支持HTTPS特性。新创建的专属池和公共池下新创建的Notebook。部分深度定制JupyterLab的用户可能强依赖了JupyterLab的启动协议,导致打不开Notebook。此种场景下,支持用户 - [ModelArts CommonOperations权限策略变更公告](https://support.huaweicloud.com/bulletin-modelarts/bulletin-modelarts_0048.md): 影响区域:华为云全部Region。优化了ModelArts CommonOperations 策略,将原来的Deny模式,纠正为Allow模式,更符合IAM规范要求的“默认无权限”的逻辑。 - [ModelArts在线服务(旧版)预测API的域名停用公告](https://support.huaweicloud.com/bulletin-modelarts/bulletin-modelarts_0030.md): 华为云ModelArts将于2024年12月31日 00:00(北京时间)逐步停用预测API的域名huaweicloudapis.com,后续预测API切换使用新域名modelarts-infer.com。影响区域:华为云全部Region新建服务、存量服务停止后再启动、存量服务失败后再启动,会立即切换使用新域名。为保障持续提供推理服务,请 - [ModelArts特性下线公告汇总](https://support.huaweicloud.com/bulletin-modelarts/bulletin-modelarts_0002.md): 本文介绍了ModelArts服务生命周期类产品公告,更多类型的服务公告请参考服务公告。 ## 产品介绍 - [什么是ModelArts](https://support.huaweicloud.com/productdesc-modelarts/modelarts_01_0001.md): 魔坊(ModelArts)模型训推平台是华为云提供的面向开发者的一站式人工智能AI开发平台,致力于将AI技术转化为高效、易用的生产力工具。提供数据准备、算法开发、模型训练、部署上线、实时对比、资源管理的全生命周期工具链,旨在显著降低AI应用开发的技术门槛与时间成本,让开发者能更专注于业务创新本身。同时,ModelArts底层兼容多种异构计 - [ModelArts功能介绍](https://support.huaweicloud.com/productdesc-modelarts/modelarts_01_0003.md): ModelArts融合算力与框架级性能调优,为开发者提供高效训练、灵活部署的一站式AI开发平台,包括数据准备、模型开发与训练、模型部署、实时比对、模型调测、资源管理、运维运营等功能。 - [ModelArts常用概念](https://support.huaweicloud.com/productdesc-modelarts/modelarts_01_0007.md): 本章节介绍ModelArts的常用概念和专有名词,方便用户更好地理解产品功能。 - [模型能力地图](https://support.huaweicloud.com/productdesc-modelarts/modelarts_01_0010.md): 本章节介绍ModelArts平台适配验证过的推理模型(基于Ascend-vLLM框架)。来源于第三方开源社区或用户自备模型,ModelArts平台无法保证这些模型的性能和能力,请酌情使用。 - [与其他云服务的关系](https://support.huaweicloud.com/productdesc-modelarts/modelarts_01_0006.md): ModelArts使用统一身份认证服务(Identity and Access Management,简称IAM)实现认证功能。IAM的更多信息请参见《统一身份认证服务产品文档》。由于ModelArts本身没有数据存储功能,ModelArts使用对象存储服务(Object Storage Service,简称OBS)进行数据存储以及模型的 - [约束与限制](https://support.huaweicloud.com/productdesc-modelarts/modelarts_01_0062.md): 本节介绍ModelArts服务在使用过程中的约束和限制。 - [配额与限制](https://support.huaweicloud.com/productdesc-modelarts/modelarts_01_0018.md): 本节介绍ModelArts涉及的相关云服务的配额限制,帮助用户查看和管理自己的配额。配额是在某一区域下最多可同时拥有的某种资源的数量。华为云为防止资源滥用,对云服务每个区域的用户资源数量和容量做了配额限制。如果当前资源配额限制无法满足使用需要,您可以申请扩大配额。如需查看每个配额项目支持的默认配额,请参考怎样查看我的配额?章节,登录控制台 - [权限管理](https://support.huaweicloud.com/productdesc-modelarts/modelarts_01_0017.md): ModelArts作为一个完备的AI开发平台,支持用户对其进行细粒度的权限配置,以达到精细化资源、权限管理之目的。这类特性在大型企业用户的使用场景下很常见,但对个人用户则显得复杂而意义不足,所以建议个人用户在使用ModelArts时,参照配置访问权限来进行初始权限设置。您是否需要阅读本文档?如果下述问题您的任何一个回答为“是”,则需要阅读 - [计费说明](https://support.huaweicloud.com/productdesc-modelarts/modelarts_01_0042.md): ModelArts是面向AI开发者的一站式开发平台,提供海量数据预处理及半自动化标注、大规模分布式训练、自动化模型生成及端-边-云模型按需部署能力,帮助用户快速创建和部署模型,管理全周期AI工作流。ModelArts服务的计费方式简单、灵活,您既可以选择按实际使用时长计费,也可以选择更经济的按包周期(包年/包月)计费方式。详细的费用价格请 - [责任共担](https://support.huaweicloud.com/productdesc-modelarts/modelarts_01_0030.md): 华为云秉承“将公司对网络和业务安全性保障的责任置于公司的商业利益之上”。针对层出不穷的云安全挑战和无孔不入的云安全威胁与攻击,华为云在遵从法律法规业界标准的基础上,以安全生态圈为护城河,依托华为独有的软硬件优势,构建面向不同区域和行业的完善云服务安全保障体系。《华为云安全白皮书》详细介绍华为云安全性的构建思路与措施,包括云安全战略、责任共 - [身份认证与访问控制](https://support.huaweicloud.com/productdesc-modelarts/modelarts_01_0032.md): 用户访问ModelArts的方式有多种,包括ModelArts控制台、API、SDK,无论访问方式封装成何种形式,其本质都是通过ModelArts提供的REST风格的API接口进行请求。ModelArts的接口均需要进行认证鉴权以此来判断是否通过身份认证。通过控制台发出的请求需要通过Token认证鉴权,调用API接口认证鉴权支持Token - [审计与日志](https://support.huaweicloud.com/productdesc-modelarts/modelarts_01_0034.md): 云审计服务(Cloud Trace Service,CTS),是华为云安全解决方案中专业的日志审计服务,提供对各种云资源操作记录的收集、存储和查询功能,可用于支撑安全分析、合规审计、资源跟踪和问题定位等常见应用场景。用户开通云审计服务并创建和配置追踪任务后,CTS可记录ModelArts的管理事件和数据事件用于审计。CTS的详细介绍和开通 - [服务韧性](https://support.huaweicloud.com/productdesc-modelarts/modelarts_01_0035.md): 韧性特指安全韧性,即云服务受攻击后的韧性,不含可靠性、可用性。本章主要阐述ModelArts服务受入侵的检测响应能力、防抖动的能力、域名合理使用、内容安全检测等能力。ModelArts服务部署主机层、应用层、网络层和数据层的安全防护套件。及时检测主机层、应用层、网络层和数据层的安全入侵行为。ModelArts服务涉及对互联网开放的Web应 - [认证证书](https://support.huaweicloud.com/productdesc-modelarts/modelarts_01_0039.md): 华为云服务及平台通过了多项国内外权威机构(ISO/SOC/PCI等)的安全合规认证,用户可自行申请下载合规资质证书。合规证书下载华为云还提供以下资源来帮助用户满足合规性要求,具体请查看资源中心。资源中心另外,华为云还提供了以下销售许可证及软件著作权证书,供用户下载和参考。具体请查看合规资质证书。销售许可证&软件著作权证书 - [安全边界](https://support.huaweicloud.com/productdesc-modelarts/modelarts_01_0048.md): 云服务的责任共担模型是一种合作方式,其中云服务提供商和云服务客户共同承担云服务的安全和合规性责任。这种模型是为了确保云服务的安全性和可靠性而设计的。根据责任共担模型,云服务提供商和云服务客户各自有一些责任。云服务提供商负责管理云基础架构,提供安全的硬件和软件基础设施,并确保云基础架构的可用性。而云服务客户则需要负责保护自己的数据和应用程序 ## 计费说明 - [计费概述](https://support.huaweicloud.com/price-modelarts/price-modelarts-0035.md): 通过阅读本文,您可以快速了解ModelArts的计费模式、计费项、续费、欠费等主要计费信息。计费模式ModelArts提供包年/包月和按需计费两种计费模式,以满足不同场景下的用户需求。包年/包月是一种预付费模式,即先付费再使用,按照订单的购买周期进行结算,因此在购买之前,您必须确保账户余额充足。按需计费是一种后付费模式,即先使用再付费,按 - [ModelArts计费模式概述](https://support.huaweicloud.com/price-modelarts/price-modelarts-0003.md): ModelArts服务提供包年/包月和按需计费两种计费模式,以满足不同场景下的用户需求。如您需要快速了解ModelArts服务不同计费模式的具体价格,请参见ModelArts价格详情。包年/包月:一种预付费模式,即先付费再使用,按照订单的购买周期进行结算。购买周期越长,享受的折扣越大。一般适用于计算资源需求量长期稳定的成熟业务。按需计费: - [包年/包月](https://support.huaweicloud.com/price-modelarts/price-modelarts-0004.md): 包年/包月是一种先付费再使用的计费模式,适用于对资源需求稳定且希望降低成本的用户。通过选择包年/包月的计费模式,您可以预先购买云服务资源并获得一定程度的价格优惠。本文将介绍ModelArts资源包年/包月的计费规则。包年/包月计费模式需要用户预先支付一定时长的费用,适用于长期、稳定的业务需求。以下是一些适用于包年/包月计费模式的业务场景: - [按需计费](https://support.huaweicloud.com/price-modelarts/price-modelarts-0005.md): 按需计费是一种先使用再付费的计费模式,适用于无需任何预付款或长期承诺的用户。本文将介绍按需计费资源的计费规则。按需计费适用于资源需求波动的场景,例如面向ToC业务的AIGC推理场景,客户业务量会随时间有规律波动,按需计费模式能大幅降低客户的业务成本。可在运行Workflow工作流、创建Notebook实例、创建训练作业、部署模型服务等页面 - [数据管理计费项](https://support.huaweicloud.com/price-modelarts/price-modelarts-0009.md): ModelArts提供的新版数据相关功能(包括数据连接、数据精炼、数据资产)、旧版数据相关功能(包括数据集、数据标注、数据处理)都不收费。但是数据存储到OBS中时会收取费用。具体内容如表1所示。示例:使用公共资源池。计费项:计算资源费用 + 存储资源费用假设用户创建了一个使用公共资源池的智能精炼任务,使用规格为CPU: 8 核 32GB、 - [开发环境计费项](https://support.huaweicloud.com/price-modelarts/price-modelarts-0010.md): 在ModelArts开发环境中运行Notebook实例时,会使用计算资源和存储资源,会产生计算资源和存储资源的累计值计费。具体内容如表1所示。Notebook实例停止运行时,算力资源将停止计费,但是EVS仍会持续计费。为了防止不必要的费用产生,请您及时删除EVS资源以停止计费。关于EVS的计费详情,请参见表1;关于如何删除EVS,请参见卸 - [模型训练计费项](https://support.huaweicloud.com/price-modelarts/price-modelarts-0011.md): 在ModelArts进行模型训练时,会产生计算资源和存储资源的累计值计费。计算资源为训练作业运行的费用。存储资源包括数据存储到OBS或SFS的费用。具体内容如表1所示。以下案例中出现的费用价格仅供参考,实际价格请参见各服务价格详情。示例:使用公共资源池。计费项:计算资源费用 + 存储费用假设用户创建了一个使用公共资源池的训练作业,使用规格 - [模型管理计费项](https://support.huaweicloud.com/price-modelarts/price-modelarts-0012.md): 在ModelArts创建模型不收费,但在通过OBS导入模型时,需要先将模型包文件存放到OBS中,OBS会产生费用。存储资源包括数据存储到OBS的计费。具体内容如表1 存储计费项所示。示例:存储费用假设用户于2023年4月1日10:00将创建模型需用到的模型包文件上传至OBS桶中。按照存储费用结算,那么创建的费用计算如下:存储费用:创建模型 - [推理部署(新版)计费项](https://support.huaweicloud.com/price-modelarts/inference2.0-modelarts-0074.md): 在ModelArts进行服务部署时,会产生计算资源和存储资源的累计值计费。计算资源为运行推理服务的费用。存储资源包括数据存储到OBS的计费。具体内容如表1所示。部署推理服务选择公共资源池时,客户等级为V0~V2的华为云直销(包含顾问销售类子客户)预付费客户开通按时长计费的按需资源时,华为云会冻结该客户账户的一定金额作为保证金,对应订单在费 - [推理部署计费项](https://support.huaweicloud.com/price-modelarts/price-modelarts-0013.md): 在ModelArts进行服务部署时,会产生计算资源和存储资源的累计值计费。计算资源为运行推理服务的费用。存储资源包括数据存储到OBS的计费。具体内容如表1所示。以下案例中出现的费用价格仅供参考,实际价格请参见各服务价格详情。示例:使用公共资源池。计费项:计算资源费用 + 存储费用假设用户于2023年4月1日10:00:00创建了一个使用公 - [专属资源池计费项](https://support.huaweicloud.com/price-modelarts/price-modelarts-0014.md): 在ModelArts使用专属资源池进行AI开发时,会产生计算资源的计费。具体内容如表1所示。在创建专属资源池时,从节点创建成功起开始计费,驱动升级和安装过程也视为创建成功的一部分。以下案例中出现的资源规格和费用价格仅供参考,实际价格请参见各服务价格详情。示例:使用按需计费的专属资源池。计费项:计算资源费用假设用户于2023年4月1日10: - [轻量算力节点计费项](https://support.huaweicloud.com/price-modelarts/price-modelarts-server.md): 使用ModelArts轻量算力节点进行AI开发时,会产生计算资源的计费。具体内容如表1 计费项所示。以下案例中出现的资源规格和费用价格仅供参考,实际价格请参见各服务价格详情。示例:使用包年包月的轻量算力节点。计费项:计算资源费用+存储资源费用假设用户创建了一个包年/包月的轻量算力节点,资源池规格为NPU:8*Snt9b23,节点规模为1台 - [轻量算力集群计费项](https://support.huaweicloud.com/price-modelarts/price-modelarts-cluster.md): 使用ModelArts轻量算力集群进行AI开发时,会产生计算资源的计费。具体内容如表1 计费项所示。在创建专属资源池时,从节点创建成功起开始计费,驱动升级和安装过程也视为创建成功的一部分。以下案例中出现的资源规格和费用价格仅供参考,实际价格请参见各服务价格详情。示例:使用包年包月的轻量算力集群。计费项:计算资源费用+存储资源费用假设用户创 - [Workflow计费项](https://support.huaweicloud.com/price-modelarts/price-modelarts-0008.md): 在ModelArts Workflow中进行模型训练和推理时,会使用计算资源和存储资源,会产生计算资源和存储资源的累计值计费。具体内容如表1所示。计算资源费用:如果运行Workflow工作流时,使用专属资源池进行模型训练和推理,计算资源不计费。如果运行Workflow工作流时,使用公共资源池进行模型训练和推理,计算资源需收费。如果运行Wo - [计费样例](https://support.huaweicloud.com/price-modelarts/price-modelarts-0015.md): 某用户于2023/03/18 15:30:00使用一个按需计费的公共资源池进行训练,规格配置如下:规格:CPU: 8 核 32GB (modelarts.vm.cpu.8ud)计算节点个数:1个用了一段时间后,于2023/03/20 10:30:00停止训练作业。那么在3月份,该公共资源池总共产生多少费用呢?在2023/03/18 15: - [变更计费模式](https://support.huaweicloud.com/price-modelarts/price-modelarts-0018.md): 在购买ModelArts专属资源池后,如果发现当前计费模式无法满足业务需求,您可以变更计费模式。如果您需要长期使用当前按需购买的ModelArts专属资源池,可以将该专属资源池转为包年/包月计费模式,以节省开支。按需计费变更为包年/包月会生成新的订单,用户支付订单后,包年/包月资源将立即生效。假设用户于2023/04/18 15:29:1 - [续费概述](https://support.huaweicloud.com/price-modelarts/price-modelarts-0021.md): 包年/包月专属资源池到期后会影响ModelArts正常使用。如果您想继续使用,需要在指定的时间内为资源池续费,否则资源会自动释放,数据丢失且不可恢复。续费操作仅适用于包年/包月专属资源池,按需计费专属资源池不需要续费,只需要保证账户余额充足即可。专属资源池在到期前续费成功,所有资源得以保留,且ModelArts使用不受影响。专属资源池到期 - [手动续费](https://support.huaweicloud.com/price-modelarts/price-modelarts-0022.md): 包年/包月资源池从购买到被自动删除之前,您可以随时在ModelArts控制台为资源池续费,以延长资源池的使用时间。ModelArts不支持包周期到期转按需的计费模式。包年/包月的专属资源池、轻量算力集群和轻量算力节点在购买成功后支持手动续费操作。专属资源池:在ModelArts控制台的资源管理 > 专属算力资源 > 资源池(新版控制台)或 - [自动续费](https://support.huaweicloud.com/price-modelarts/price-modelarts-0023.md): 自动续费可以减少手动续费的管理成本,避免因忘记手动续费而导致ModelArts中专属资源池、轻量算力集群资源或轻量算力节点资源不能使用。仅包年/包月的专属资源池、轻量算力集群资源或轻量算力节点资源支持自动续费,按需计费类型的资源不支持自动续费。请确认包年/包月的专属资源池、轻量算力集群资源或轻量算力节点资源还未到期。ModelArts不支 - [费用账单](https://support.huaweicloud.com/price-modelarts/price-modelarts-0024.md): 您可以在“费用中心 > 账单管理”查看资源的费用账单,以了解该资源在某个时间段的使用量和计费信息。包年/包月计费模式的资源完成支付后,会实时上报一条账单到计费系统进行结算。按需计费模式的资源按照固定周期上报使用量到计费系统进行结算。按需计费模式产品根据使用量类型的不同,分为按小时、按天、按月三种周期进行结算,具体扣费规则可以参考按需产品周 - [欠费说明](https://support.huaweicloud.com/price-modelarts/price-modelarts-0025.md): 用户在使用云服务时,账户的可用额度小于待结算的账单,即被判定为账户欠费。欠费后,可能会影响云服务资源的正常运行,请及时充值。已购买资源包,但使用量超出资源包额度或资源包属性与桶属性不匹配,进而产生按需费用,同时账户中的余额不足以抵扣产生的按需费用。请参考如何查看ModelArts中正在收费的作业?识别产生按需计费的原因,并重新选择正确的资 - [停止计费](https://support.huaweicloud.com/price-modelarts/price-modelarts-0026.md): 在不需要使用ModelArts服务功能时,需要删除或停止正在计费的项目。Workflow、开发环境、模型训练、在线服务、专属资源池涉及到需要停止的计费项如下:Workflow:停止因运行Workflow作业而创建的训练作业和在线服务。删除存储到OBS中的数据及OBS桶。Notebook:删除Notebook实例。删除存储到OBS中的数据及 - [成本管理](https://support.huaweicloud.com/price-modelarts/price-modelarts-0027.md): ModelArts提供AI工具链、AI算力,成本由AI算力的资源成本和运维成本构成。ModelArts支持企业项目管理,可以由企业项目服务来管理同一账号下不同项目的成本。通过华为云费用账单来分析账号下的成本支出情况。长期使用的资源,建议客户使用更优惠的方式购买(包年包月);针对临时使用的资源,您可选择按需的资源规格,避免浪费。 - [如何查看ModelArts中正在收费的作业?](https://support.huaweicloud.com/price-modelarts/modelarts_05_0104.md): 在ModelArts管理控制台,在总览(旧版控制台)页,您可以在生产概况区域查看正在收费的作业。根据实际情况进入管理页面,停止并删除实例。例如,Notebook正在计费,请前往Notebook页面,将状态为运行中的Notebook实例停止并删除。ModelArts使用过程中涉及到的具体收费项如下:Workflow:Workflow工作流运 - [如何查看ModelArts消费详情?](https://support.huaweicloud.com/price-modelarts/modelarts_05_0105.md): 在费用中心,您可以根据需求按照账期、产品类型等查询ModelArts的消费详情。本章节以查询账单详情为例指导您查看计费情况,如需了解更多的账单情况,请参见查看费用账单。查询方法:单击右上方的“费用中心 > 费用账单”进入费用中心详情页面,在左侧导航栏选择“账单管理 > 流水和明细账单”,在流水和明细账单页面,可切换账单详情和“明细账单”页 - [如果不再使用ModelArts,如何停止收费?](https://support.huaweicloud.com/price-modelarts/modelarts_05_0109.md): 在ModelArts中进行AI全流程开发时,主要包括存储费用、资源费用。如果不再使用ModelArts,需要停止/删除ModelArts中运行的服务;删除在OBS中存储的数据;删除在EVS中存储的数据。由于ModelArts的数据存储在OBS中,请前往OBS服务删除对应数据和目录,停止计费。请检查在ModelArts所创建运行中的作业,并 - [ModelArts数据管理相关计费FAQ](https://support.huaweicloud.com/price-modelarts/modelarts_05_0106.md): ModelArts中的数据集管理、标注等操作不收费,但是由于数据集存储在OBS中,因此会根据您使用的OBS桶进行收费。建议您前往OBS服务,了解OBS计费详情,创建相应的OBS桶用于存储ModelArts使用的数据。标注样本集本身不计费,数据集存储在OBS中,收取OBS的费用。建议您前往OBS控制台,删除存储的数据和OBS桶,即可停止收费 - [ModelArts标注完样本集后,如何保证退出后不再产生计费?](https://support.huaweicloud.com/price-modelarts/modelarts_05_0107.md): 标注样本集本身不计费,数据集存储在OBS中,收取OBS的费用。建议您前往OBS控制台,删除存储的数据和OBS桶,即可停止收费。 - [训练作业如何收费?](https://support.huaweicloud.com/price-modelarts/modelarts_05_0110.md): 如果您使用的是公共资源池,则根据您选择的规格、节点数、运行时长进行计费。计费规则为“规格单价×节点数×运行时长”(运行时长精确到秒)。如果您使用的是专属资源池,则训练作业就不再进行单独计费。由专属资源池进行收费。 - [为什么项目删除完了,仍然还在计费?](https://support.huaweicloud.com/price-modelarts/modelarts_05_0115.md): 如果ModelArts的Notebook实例、训练作业或在线服务,都已经处于停止状态,即总览页面没看到收费项目,仍然发现账号还在计费。有以下几种可能情况:因为您在使用ModelArts过程中,将数据上传至OBS进行存储,OBS会根据实际存储的数据进行计费。建议前往OBS管理控制台,清理您不再使用的数据、文件夹以及OBS桶,避免产生不必要的 - [欠费后,ModelArts的资源是否会被删除?](https://support.huaweicloud.com/price-modelarts/modelarts_05_0120.md): 欠费后,ModelArts的资源不会被立即删除。欠费后,您可以在“费用中心”查看欠费详情。为了防止相关资源不会被停止服务或者逾期释放,您需要及时进行还款或充值。登录管理控制台。单击页面右上角的费用进入费用中心页面。在总览页面可以查看到当前的欠费金额。如果存在欠费,请及时充值。更多关于欠费还款操作,请参见如何进行欠费还款。 - [ModelArts训练作业和模型部署如何收费?](https://support.huaweicloud.com/price-modelarts/modelarts_05_0138.md): 如果您使用的是公共资源池,则根据您选择的规格、节点数、运行时长进行计费。计费规则为“规格单价×节点数×运行时长”(运行时长精确到秒)。如果您使用的是专属资源池,则训练作业就不再进行单独计费。由专属资源池进行收费。ModelArts支持将模型按照业务需求部署为服务。具体计费方式请参见ModelArts产品价格详情。 - [ModelArts的资源冻结解冻常见问题](https://support.huaweicloud.com/price-modelarts/toctopics/zh-cn_topic_0000002608019107.md): 资源冻结的类型包括欠费冻结、违规冻结、公安冻结。单击了解资源冻结的类型、冻结后对续费、退订的影响、资源冻结后,什么时候可以解冻。资源冻结时:资源将被限制访问和使用,会导致您的业务中断。例如推理在线服务会限制调用。资源解冻时:资源将被解除限制,但是需要您自行检查并恢复业务。例如推理在线服务解冻后,需要您自行启动。包年/包月资源未及时续费或按 ## 快速入门 - [首次使用ModelArts](https://support.huaweicloud.com/qs-modelarts/modelarts_06_0006.md): 欢迎使用ModelArts模型训推平台!本文档将带您快速完成从账号准备到首次体验AI开发的全流程,帮助您轻松开启AI开发之旅。ModelArts作为一站式AI开发平台,集成了数据处理、模型开发、模型训练、推理部署等全链路能力,无论您是AI零基础新手还是专业开发者,都能找到合适的使用方式。在使用ModelArts前,需完成华为云账号注册、实 - [数据精炼入门:一键完成数据精炼](https://support.huaweicloud.com/qs-modelarts/modelarts_06_0001.md): 为了降低用户的使用门槛并增强用户体验,ModelArts控制台推出了一键数据精炼案例。本文档帮助您快速上手华为ModelArts一键精炼功能,使用ModelArts一键精炼的“单轮问答处理流程”模板,自动剔除脏数据、去重并标准化格式,生成高纯净度的问答数据集,直接用于大语言模型微调训练。如需对数据精炼有更深入的了解,请参考数据精炼。已完成 - [GPU迁移到NPU:手写数字识别](https://support.huaweicloud.com/qs-modelarts/modelarts_06_0035.md): 在AI大模型训练与推理中,昇腾NPU作为国产算力平台,提供了与NVIDIA GPU对标的计算能力。对于已有基于GPU的PyTorch代码,开发者往往关心迁移成本与适配难度。torch_npu作为昇腾PyTorch适配包,使得标准PyTorch代码仅需极少量改动即可在NPU上运行,大幅降低迁移门槛。本教程适用于已有基于GPU的PyTorch - [Notebook入门:一键部署Qwen3-8B模型并搭建聊天机器人](https://support.huaweicloud.com/qs-modelarts/modelarts_06_0034.md): 对于AI开发者而言,传统的本地开发环境由于资源限制和工具链不完善,导致在进行AI模型的部署和测试时效率低下。例如,当尝试部署Qwen3-8B模型时,本地环境可能无法提供足够的计算资源,也无法支持高效的模型调试和测试。如何在不增加成本的情况下提高AI模型的开发效率?ModelArts开发环境通过云原生的资源使用和开发工具链的集成,旨在解决这 - [训练入门:一键完成模型训练](https://support.huaweicloud.com/qs-modelarts/modelarts_06_0010.md): 本章节内容仅适用于控制台界面为新版样式。为了降低用户的使用门槛并增强用户体验,ModelArts控制台推出了一键训练案例。当前,ModelArts已支持Qwen3-8B、Qwen3-32B和Qwen3-30B-A3B模型的SFT和LoRA微调,帮助用户快速掌握ModelArts的模型训练功能。模型训练成功后,用户可以直接用于模型部署等后续 - [推理入门:一键完成DeepSeek-V4-Flash模型部署](https://support.huaweicloud.com/qs-modelarts/modelarts_ds4_001.md): DeepSeek-V4-Flash模型正式发布并开源。DeepSeek-V4-Flash拥有百万Token超长上下文,在Agent能力、世界知识和推理性能上均实现国内与开源领域的领先,且模型参数下降至284B,推理成本进一步降低。为方便您快速部署模型,本案例介绍如何在ModelArts控制台一键部署DeepSeek-V4-Flash模型。 - [推理入门:一键完成GLM-5.1模型部署](https://support.huaweicloud.com/qs-modelarts/modelarts_06_0009.md): GLM-5.1是智谱清言最新代旗舰MoE基础模型w8a8量化版本,在编程与长程智能体任务上实现SOTA性能全新跃升。为方便您快速部署该模型,ModelArts控制台推出了一键部署该模型案例。借助ModelArts提供的丰富的开源模型及推理框架,您可通过简单表单配置,快速开启模型部署。GLM-5.1模型支持能力参见模型能力说明。本案例以As - [推理入门:一键完成Qwen3-32B-64k模型部署](https://support.huaweicloud.com/qs-modelarts/modelarts_06_0002.md): Qwen3-32B-64k模型是阿里千问推出的大语言模型。实现了思考模式和非思考模式的有效融合,可在对话中切换模式。推理能力显著超过QwQ、通用能力显著超过Qwen2.5-32B-Instruct,达到同规模业界SOTA水平。本案例以Ascend-vLLM框架一键部署Qwen3-32B-64K模型为例,介绍ModelArts一键部署服务并 - [一站式体验:数据连接、训练、推理与实时比对](https://support.huaweicloud.com/qs-modelarts/modelarts_06_0004.md): 在AI开发领域,开发者经常面临从数据准备到模型部署的复杂流程,这不仅耗时而且容易出错。使用传统的开发工具和方法,开发者往往难以高效地管理和优化这一流程。因此,如何简化这一流程、提高开发效率成为了一个亟待解决的问题。ModelArts作为面向开发者的一站式AI开发平台,支持用户将自己的数据集导入到平台中,用于模型训练等任务。本案例中使用的数 - [ModelArts入门实践](https://support.huaweicloud.com/qs-modelarts/modelarts_06_0043.md): 本章节列举了一些常用的实践案例,方便您快速了解并使用ModelArts完成AI开发。 ## 数据准备 - [数据准备功能说明](https://support.huaweicloud.com/dataprepare-modelarts/dataprepare-modelarts-0001.md): 在大模型开发过程中,数据的质量和处理效率直接影响模型的性能。然而,开发者常常面临“数据获取难、质量参差不齐、处理效率低”的挑战,这不仅增加了模型训练的成本,还限制了模型的泛化能力。如何高效地准备高质量的训练数据成为了一个亟待解决的问题。ModelArts数据准备功能提供了一站式、全流程的数据处理和管理服务,通过内置的行业级数据处理算子与自 - [基础文本](https://support.huaweicloud.com/dataprepare-modelarts/dataprepare-modelarts-0011.md): 以多格式原始文档为核心,支持文档内容的深度提取与解析。上传后的基础文本数据可通过平台内置的数据精炼功能,转化为预训练数据集或评测集。从OBS导入:单个文件/压缩包大小不超过20GB;多个文件场景,文件数量不限制,总文件大小不超过20GB。本地导入:单个文件大小不超过1GB,文件数量最多20个。文件格式:docx、pdf格式说明:此类型直接 - [预训练文本](https://support.huaweicloud.com/dataprepare-modelarts/dataprepare-modelarts-0012.md): 以大规模原始文本语料为核心,支持直接用于大模型的无监督预训练,或通过平台进行数据精炼加工,转化为高质量的文本生成SFT数据集。从OBS导入:单个文件/压缩包大小不超过20GB;多个文件场景,文件数量不限制,总文件大小不超过20GB。本地导入:单个文件大小不超过1GB,文件数量最多20个。文件编码:所有jsonl格式文件必须采用UTF-8编 - [文本生成SFT](https://support.huaweicloud.com/dataprepare-modelarts/dataprepare-modelarts-0030.md): 以问答对为核心的标注文本数据集,包含明确的指令与标准应答内容。该类型深度适配大模型的有监督指令微调,能够满足对话生成、指令对齐以及特定行业场景定制的模型训练需求。从OBS导入:单个文件/压缩包大小不超过20GB;多个文件场景,文件数量不限制,总文件大小不超过20GB。本地导入:单个文件大小不超过1GB,文件数量最多20个。文件编码:所有j - [图片类数据集格式要求](https://support.huaweicloud.com/dataprepare-modelarts/dataprepare-modelarts-0004.md): ModelArts支持创建图片类数据集,具体格式如下。从OBS导入:单个文件/压缩包大小不超过20GB;多个文件场景,文件数量不限制,总文件大小不超过20GB。本地导入:单个文件大小不超过1GB,文件数量最多20个。支持的文件格式:仅支持后缀名为.jpg、.jpeg、.png、.bmp的图片文件和后缀名为.jsonl的标签文件,JSONL - [视频类数据集格式要求](https://support.huaweicloud.com/dataprepare-modelarts/dataprepare-modelarts-0005.md): ModelArts支持创建视频类数据集,创建时可导入多种形式的数据,具体格式要求如下。从OBS导入:单个文件/压缩包大小不超过20GB;多个文件场景,文件数量不限制,总文件大小不超过20GB。本地导入:单个文件大小不超过1GB,文件数量最多20个。支持的文件格式:仅支持后缀名为.avi、.mp4的视频文件和后缀名为.jsonl的标签文件, - [音频类数据集格式要求](https://support.huaweicloud.com/dataprepare-modelarts/dataprepare-modelarts-0006.md): ModelArts支持创建音频类数据集,具体格式要求如下。从OBS导入:单个文件/压缩包大小不超过20GB;多个文件场景,文件数量不限制,总文件大小不超过20GB。本地导入:单个文件大小不超过1GB,文件数量最多20个。支持的文件格式:仅支持后缀名为.mp3、.flac、.wav、.opus、.aac、.m4a的音频文件和后缀名为.jso - [其他类数据集格式要求](https://support.huaweicloud.com/dataprepare-modelarts/dataprepare-modelarts-0010.md): 除文本、图片、视频、音频数据集外,平台还支持导入其他类数据集,即用户训练模型时使用的自定义数据集。从OBS导入:单个文件/压缩包大小不超过20GB;多个文件场景,文件数量不限制,总文件大小不超过20GB。本地上传:单个文件大小不超过1GB,单次上传文件数量最多20个。平台不对文件内容、嵌套层级做任何硬性要求。对于平台预设之外的特异性或前沿 - [创建数据连接](https://support.huaweicloud.com/dataprepare-modelarts/dataprepare-modelarts-0015.md): 在数据处理和模型训练的场景中,用户需要将多种类型的数据集高效、准确地导入到ModelArts数据平台中,以支持后续的智能精炼和模型训练任务。然而,传统的数据导入方式存在诸多限制,如不支持自定义任务名称、数据格式转换功能有限等,导致用户在导入数据时面临操作不便和数据处理效率低下的问题。如何在新的平台中实现更加灵活和高效的数据导入功能,成为用 - [管理数据连接](https://support.huaweicloud.com/dataprepare-modelarts/dataprepare-modelarts-0016.md): 数据连接页面可以对所有任务做统一管理,可查看数据连接任务的名称/ID、状态、生成数据集的名称、操作时间、操作人以及支持的相关操作。本文介绍如何管理数据连接任务。数据连接任务支持过滤、搜索、删除、重试等操作。过滤和搜索数据连接任务在数据连接页面的搜索框,您可以按照任务ID、任务名称、状态、生成数据集等维度过滤,快速找到目标任务。您也可以单击 - [智能精炼功能说明](https://support.huaweicloud.com/dataprepare-modelarts/dataprepare-modelarts-0023.md): 智能精炼是ModelArts数据工程的核心功能模块,旨在解决大模型训练数据准备过程中的“质量”与“数量”双重挑战。它打破了传统数据处理工具的界限,将基于规则的数据加工(清洗、过滤、去重等)与基于大模型的数据合成(改写、扩充、润色等)深度融合。通过可视化的编数据算子编排,您可以像搭积木一样,将多个加工算子与合成算子串联成一条自动化流水线。系 - [智能精炼使用场景](https://support.huaweicloud.com/dataprepare-modelarts/dataprepare-modelarts-0025.md): 智能精炼是面向大模型训练的“清洗+合成”一体化数据准备方案。如果您的数据处于“原始粗糙”或“样本匮乏”状态——无论是需要去除HTML标签与乱码的预训练语料清洗,还是需要对少量种子数据进行扩充与润色的SFT指令微调增强,亦或是涉及隐私信息的安全合规脱敏——智能精炼均能通过丰富的数据处理算子编排为一条流水线,将原始数据转化为高质量、高多样性且 - [创建智能精炼](https://support.huaweicloud.com/dataprepare-modelarts/dataprepare-modelarts-0026.md): 智能精炼是面向大模型训练的“清洗+合成”一体化数据准备方案。如果您的数据处于“原始粗糙”或“样本匮乏”状态——无论是需要去除HTML标签与乱码的预训练语料清洗,还是需要对少量种子数据进行扩充与润色的SFT指令微调增强,亦或是涉及隐私信息的安全合规脱敏——智能精炼均能通过丰富的数据处理算子编排为一条流水线,将原始数据转化为高质量、高多样性且 - [管理智能精炼任务](https://support.huaweicloud.com/dataprepare-modelarts/dataprepare-modelarts-0028.md): 数据精炼 > 智能精炼页面展示所有的精炼任务,您可以查看精炼任务的名称/ID、关联数据集、最近运行状态、最近生成数据集、最近运行时间、创建者以及支持的操作。本文介绍如何对精炼任务进行相关操作。精炼任务支持过滤、搜索、启动、停止、重试、编辑、删除等操作。以下分别讲解如何操作。过滤和搜索精炼任务在智能精炼页面的搜索框,您可以按照ID、最近运行 - [智能精炼模板说明](https://support.huaweicloud.com/dataprepare-modelarts/dataprepare-modelarts-0029.md): 智能精炼模板是ModelArts平台沉淀的数据处理最佳实践集合。它将复杂的算子组合按特定业务逻辑预先编排,封装为一键可用的标准化工作流。它的核心作用在于:无需从零开始研究算子顺序与参数,直接复用资深算法工程师验证过的成熟方案,确保数据处理流程的专业性与合理性。用户只需在创建任务时选择匹配业务场景的模板,系统即可自动加载完整的算子链路。您既 - [预置智能精炼算子说明](https://support.huaweicloud.com/dataprepare-modelarts/dataprepare-modelarts-0033.md): 智能精炼算子分为加工算子和合成算子两大类,通过算子的组合编排实现完整的数据处理流程。适用的文件格式:适用于所有类型数据集,但针对“文本类 > 单轮对话、单轮对话带人设、多轮对话、多轮对话带人设”数据具备数据格式转换能力。说明:所有格式数据集,在开始节点处理后都会转化为标准格式数据集。针对部分文本类(文本生成SFT)数据,具备数据格式转换的 - [人工校准](https://support.huaweicloud.com/dataprepare-modelarts/dataprepare-modelarts-0037.md): 您可以通过可视化标注界面,对数据集进行人工校准,并一键生成标准化数据集并同步至我的数据,供智能精炼等任务使用。一个IAM账号最大创建10个人工校准任务。数据集样本数大小不能超过一万个。登录ModelArts管理控制台,在左侧导航栏选择“数据准备 > 数据精炼”。在人工校准页签右上角,单击创建,在创建人工校准页面,配置相关信息,单击确定。创 - [常见问题](https://support.huaweicloud.com/dataprepare-modelarts/dataprepare-modelarts-0031.md): 合成算子可以放在工作流中间吗?不可以。当前版本合成算子仅支持放在工作流末端。如果需要对合成结果进行进一步处理,建议分两次任务执行:第一次任务:加工算子 + 合成算子第二次任务:对合成结果继续加工处理不可以。当前版本合成算子仅支持放在工作流末端。如果需要对合成结果进行进一步处理,建议分两次任务执行:第一次任务:加工算子 + 合成算子第二次任 - [数据资产介绍](https://support.huaweicloud.com/dataprepare-modelarts/dataprepare-modelarts-0032.md): 数据资产是指在ModelArts平台中被纳入管理、存储并可供使用的数据集,包含预置数据和我的数据两类资产。预置数据:平台预置数据集是为用户提供的开箱即用的高质量数据资源,涵盖文本类、图片类、视频类和音频类四大类型的精选数据集。这些数据集经过严格筛选和预处理,可直接用于智能精炼、模型训练、微调和评估,大幅降低用户数据准备的时间成本和技术门槛 - [预置数据](https://support.huaweicloud.com/dataprepare-modelarts/dataprepare-modelarts-0020.md): 预置数据集是ModelArts平台为用户提供的开箱即用的高质量数据资源。这些数据集是行业通用数据集,符合开源协议要求,能够兼容主流的训练框架。使用预置数据集,能够保证数据集版本可追溯,确保实验可复现。您可以根据实际场景,选择合适的数据集直接在平台环境调用。预置数据典型使用场景如下:使用预置数据集配合用户自定义数据完成智能精炼,合成下游需要 - [我的数据](https://support.huaweicloud.com/dataprepare-modelarts/dataprepare-modelarts-0021.md): 在控制台创建数据连接和智能精炼任务时,生成的数据集将作为数据资产放置在我的数据列表。如果创建数据连接和智能精炼任务配置“立即上线数据集”选项,生成的数据集将自动上线为资产。如果没有勾选,则在资产清单是未上线的状态。我的数据典型使用场景如下:使用我的数据集完成智能精炼,生成下游需要数据集。使用我的数据集完成大模型预训练与微调,提升模型基础能 - [使用CTS审计ModelArts数据服务](https://support.huaweicloud.com/dataprepare-modelarts/dataprepare-modelarts-0035.md): ModelArts支持对接云审计CTS服务,通过云审计服务,您可以记录与ModelArts相关的操作事件,便于日后的查询、审计和回溯。在您开启了云审计服务后,系统会记录ModelArts的相关操作,且控制台保存最近7天的操作记录。本节介绍如何在云审计服务管理控制台查看最近7天的操作记录。已开通云审计服务。详细操作请参见《云审计服务用户指南 - [数据准备错误码](https://support.huaweicloud.com/dataprepare-modelarts/dataprepare-modelarts-0036.md): 当您使用数据准备相关功能时,可能出现的错误码及相关信息如下。 - [在AOM查看数据准备监控告警](https://support.huaweicloud.com/dataprepare-modelarts/dataprepare-modelarts-0049.md): 告警,是一种基于预设规则对监控指标、日志数据进行实时评估,并在异常发生时自动触发告警事件的自动化机制。它将分散的监控数据转化为明确的、可处理的事件,是连接“数据观测”与“运维行动”的关键桥梁,帮助您从被动响应故障转变为主动管理风险。AOM提供告警监控能力,具体功能请参见AOM告警监控概述。当任务执行失败时,系统将触发告警。您可以在AOM控 ## 模型开发 - [Notebook使用说明](https://support.huaweicloud.com/devtool-modelarts/devtool-modelarts_0002.md): 在软件开发领域,随着技术的发展,降低开发者成本和提升开发体验一直是追求的目标。然而,在AI开发阶段,开发者们面临着工具链复杂、资源管理困难等挑战,这与传统软件开发形成了鲜明对比。如何解决这些问题,提升AI开发的效率和体验?ModelArts提供灵活开放的开发环境,通过云原生的资源使用和开发工具链的集成,旨在为不同类型AI开发、探索、教学用 - [创建Notebook实例](https://support.huaweicloud.com/devtool-modelarts/devtool-modelarts_3495.md): 在开始进行模型开发前,您需要创建Notebook实例,并打开Notebook进行编码。创建Notebook实例有以下两种方式:通过ModelArts管理控制台进行创建,下文将详细介绍创建Notebook实例的控制台操作。通过ModelArts提供的API接口进行创建,详细操作请参见创建Notebook实例。在创建Notebook时,默认会 - [使用Code Server进行代码开发](https://support.huaweicloud.com/devtool-modelarts/devtool-modelarts_0014.md): Code Server是一个开源项目,它将Visual Studio Code完整运行在远程服务器上,并通过浏览器提供访问能力。主要支持以下能力:完整VS Code体验:支持扩展市场、调试器、终端、Git等几乎所有原生功能。跨平台访问:只需浏览器即可在任何设备上编写代码。统一开发环境:代码、配置和依赖项均部署在服务器上,确保环境一致性。私 - [Code Server AI助手风险说明及安全建议](https://support.huaweicloud.com/devtool-modelarts/devtool-modelarts_0023.md): 在使用Code Server AI助手时,存在一定的安全风险。本文以Cline为例,介绍可能出现的风险、影响及应对策略。 - [企业用户使用Code Server网络要求](https://support.huaweicloud.com/devtool-modelarts/devtool-modelarts_0024.md): 为确保Code Server在企业内网环境中的稳定性,请满足以下要求:所有依赖域名已放行,详情请参见Code Server依赖域名。企业网络设备(防火墙、CDN、代理)支持WebSocket协议透传。如遇问题,请参考Code Server网络故障排查。为确保Code Server正常运行,需开放以下域名的网络访问权限。这些域名涉及插件市场 - [使用JupyterLab在线开发和调试代码](https://support.huaweicloud.com/devtool-modelarts/devtool-modelarts_0012.md): 在AI模型开发过程中,开发者们通常需要一个强大的交互式开发环境来支持多种开发需求,如编写Notebook、操作终端、编辑Markdown文本等。然而,传统的开发环境往往无法满足这些多样化的需求,导致开发效率低下。如何提高AI模型开发的效率和灵活性?ModelArts支持通过JupyterLab工具在线打开Notebook,开发基于PyTo - [JupyterLab常用功能介绍](https://support.huaweicloud.com/devtool-modelarts/devtool-modelarts_0013.md): 下面介绍如何从运行中的Notebook实例打开JupyterLab。登录ModelArts管理控制台,按需选择以下操作。新版控制台:选择模型开发与训练 > Notebook,进入Notebook页面。旧版控制台:选择开发空间 > Notebook,进入Notebook页面。新版控制台:选择模型开发与训练 > Notebook,进入Note - [升级JupyterLab版本](https://support.huaweicloud.com/devtool-modelarts/devtool-modelarts_03032.md): 为了提高Notebook的易用性,现将JupyterLab升级至4.4.10版本(2025年稳定版),实现从JupyterLab 3.2.3(2021年老版)的跨版本升级。此次升级对Notebook的性能和启动速度进行了优化,重构了编辑器,强化了调试和协作功能,扩展了更稳定的生态系统,并全面改善了交互体验和内存占用。欢迎您使用。Jupyt - [在JupyterLab使用Git克隆代码仓](https://support.huaweicloud.com/devtool-modelarts/modelarts_23_0281.md): 在JupyterLab中使用Git插件可以克隆GitHub开源代码仓库,快速查看及编辑内容,并提交修改后的内容。Notebook处于运行中状态。在Notebook列表中,选择一个实例,单击右侧的接入环境,在接入方式对话框,单击JupyterLab接入右侧的接入,进入JupyterLab页面。图1所示图标,为JupyterLab的Git插件 - [在JupyterLab中创建定时任务](https://support.huaweicloud.com/devtool-modelarts/devtool-modelarts_3391.md): ModelArts Notebook支持创建定时任务。本文档介绍了如何创建定时任务、一键运行Notebook文件,从而提高工作效率。一键运行:允许用户一键运行Notebook文件,无需逐个执行Cell。定时任务调度:允许用户设置定时执行代码块的时间和频率。支持秒、分钟、小时和每天/每周/月的时间设置。支持参数化执行:允许用户在运行时向No - [上传本地文件至JupyterLab](https://support.huaweicloud.com/devtool-modelarts/modelarts_30_0043.md): Notebook的JupyterLab中提供了多种方式上传文件。对于大小不超过100MB的文件直接上传,并展示文件大小、上传进度及速度等详细信息。对于大小超过100MB不超过5GB的文件可以使用OBS中转,系统先将文件上传OBS(对象桶或并行文件系统),然后从OBS下载到Notebook,上传完成后,会将文件从OBS中删除。5GB以上的文 - [克隆GitHub开源仓库文件到JupyterLab](https://support.huaweicloud.com/devtool-modelarts/modelarts_30_0048.md): 在Notebook的JupyterLab中,支持从GitHub开源仓库克隆文件。通过JupyterLab打开一个运行中的Notebook。单击JupyterLab窗口上方导航栏的ModelArts Upload Files按钮,打开文件上传窗口,选择左侧的进入GitHub开源仓库克隆界面。进入GitHub开源仓库克隆界面输入有效的GitH - [上传OBS文件到JupyterLab](https://support.huaweicloud.com/devtool-modelarts/modelarts_30_0049.md): 在Notebook的JupyterLab中,支持将OBS中的文件上传到Notebook。注意:文件大小不能超过50GB,否则会上传失败。通过JupyterLab打开一个运行中的Notebook。单击JupyterLab窗口上方导航栏的ModelArts Upload Files按钮,打开文件上传窗口,选择左侧的进入OBS文件上传界面。OB - [上传远端文件至JupyterLab](https://support.huaweicloud.com/devtool-modelarts/modelarts_30_0050.md): 在Notebook的JupyterLab中,支持通过远端文件地址下载文件。要求:远端文件的URL粘贴在浏览器的输入框中时,可以直接下载该文件。通过JupyterLab打开一个运行中的Notebook。单击JupyterLab窗口上方导航栏的ModelArts Upload Files按钮,打开文件上传窗口,选择左侧的进入远端文件上传界面。 - [下载JupyterLab文件到本地](https://support.huaweicloud.com/devtool-modelarts/devtool-modelarts_0187.md): 在JupyterLab中开发的文件,可以下载至本地。关于如何上传文件至JupyterLab,请参见上传文件至JupyterLab。不大于100MB的文件,可以直接从JupyterLab中下载到本地,具体操作请参见从JupyterLab中下载不大于100MB的文件至本地。大于100MB的文件,需要先从JupyterLab上传到OBS,再通过 - [在JupyterLab中使用TensorBoard可视化作业](https://support.huaweicloud.com/devtool-modelarts/develop-modelarts-0069.md): ModelArts支持在开发环境中开启TensorBoard可视化工具。TensorBoard是TensorFlow的可视化工具包,提供机器学习实验所需的可视化功能和工具。TensorBoard能够有效地展示训练过程中的计算图、各种指标随时间的变化趋势以及训练中使用到的数据信息,相关概念请参考TensorBoard官网。TensorBoa - [在JupyterLab中预览Markdown、PDF、数学公式](https://support.huaweicloud.com/devtool-modelarts/develop-modelarts-0070.md): 在JupyterLab中预览Markdown、PDF、数学公式功能默认关闭。预览功能存在跨站脚本(XSS)安全风险。为了保护您的系统安全,建议不要打开不受信任的文件。如果必须使用这些功能,请谨慎操作,并确保文件来源可靠。打开Notebook的Terminal。具体操作,请参见JupyterLab常用功能介绍。按需执行以下命令,开启或关闭所 - [VS Code连接Notebook方式介绍](https://support.huaweicloud.com/devtool-modelarts/devtool-modelarts_0019.md): Visual Studio Code (VS Code) 是一个流行的代码编辑器,它支持多种编程语言和开发环境。支持通过VS Code连接和使用Jupyter Notebook。当用户创建完成支持SSH的Notebook实例后,使用VS Code的开发者可以通过以下方式连接到开发环境中:在VS Code中一键连接Notebook(推荐)该 - [在VS Code中一键连接Notebook](https://support.huaweicloud.com/devtool-modelarts/devtool-modelarts_0206.md): 当Notebook启用SSH远程开发后,本地的VS Code可以一键连接到Notebook。已安装VS Code推荐版本并满足约束限制。详细信息,请参见VS Code推荐版本及约束限制。已在DEW管理控制台创建账号密钥对或私有密钥对,并将密钥文件并存放在以下目录中。具体操作,请参见创建密钥对。Windows:C:\Users\{{user - [使用VS Code ToolKit连接Notebook](https://support.huaweicloud.com/devtool-modelarts/devtool-modelarts_0207.md): 本节介绍如何在本地使用ModelArts提供的VS Code插件工具VS Code ToolKit,协助用户完成SSH远程连接Notebook。已下载并安装VS Code,并满足VS Code推荐版本及约束限制要求。详细操作请参考VS Code连接Notebook方式介绍。在本地的VS Code开发环境中,如图1所示,在VS Code扩展 - [在VS Code中手动连接Notebook](https://support.huaweicloud.com/devtool-modelarts/devtool-modelarts_0208.md): 本地IDE环境支持VS Code。通过简单配置,即可用本地IDE远程连接到ModelArts的Notebook开发环境中,调试和运行代码。本章节介绍基于VS Code环境访问Notebook的方式。已安装VS Code推荐版本并满足约束限制,详情请参见安装VS Code软件。用户本地PC或服务器的操作系统中建议先安装Python环境,详情 - [在VS Code中上传下载文件](https://support.huaweicloud.com/devtool-modelarts/devtool-modelarts_0210.md): 小于或等于500MB数据量,直接复制至本地IDE中即可。大于500MB数据量,请先上传到OBS中,再从OBS上传到云上开发环境。操作步骤上传数据至OBS。具体操作请参见上传文件至OBS桶。或者在本地VS Code的Terminal中使用ModelArts SDK完成数据上传至OBS。首先在本地VS Code中单击上方菜单栏的Termina - [通过SSH工具远程使用Notebook](https://support.huaweicloud.com/devtool-modelarts/devtool-modelarts_0021.md): 本文介绍在Windows环境中使用CMD、MobaXterm和本地IDE通过SSH远程登录Notebook实例的操作步骤。使用SSH连接Notebook实例的约束限制如下:本地用户密钥和权限必须匹配。本地用户密钥需要存放在指定目录下。Windows:C:\Users\{{user}}macOS/Linux:~在macOS和Linux系统中 - [Notebook存储类型说明](https://support.huaweicloud.com/devtool-modelarts/devtool-modelarts_0005.md): 不同存储的实现方式都不同,在性能、易用性、成本的权衡中可以有不同的选择,没有一个存储可以覆盖所有场景,了解下云上开发环境中各种存储使用场景说明,更能提高使用效率。在SFS Turbo与OBS桶进行存储联动时,如果将其挂载到Notebook中进行使用,会存在一些使用限制,详情请参见管理SFS Turbo文件系统与OBS桶的存储联动。Mode - [Notebook存储挂载方式说明](https://support.huaweicloud.com/devtool-modelarts/devtool-modelarts_0007.md): ModelArts支持动态存储和扩展存储两种方式。动态存储:支持在实例运行期间动态挂载存储,无需停止实例,实例启动后自动重新挂载,数据持久保留。适合需要运行时灵活挂载或临时扩展存储的场景。扩展存储:基于云原生持久化存储方案,提供稳定可靠的存储管理,但挂载或变更存储配置需停止实例。适用于规划好的、长期使用的数据卷。关于存储类型的详细说明,请 - [Notebook动态扩充云硬盘EVS容量](https://support.huaweicloud.com/devtool-modelarts/modelarts_30_0040.md): 存储配置采用云硬盘EVS的Notebook实例, 存储盘是挂载至容器/home/ma-user/work/目录下, 可以在实例运行中的状态下,动态扩充存储盘容量,单次最大动态扩容100GB。在Notebook开发过程中,初期存储使用量较小时, 创建Notebook可以选择小容量EVS, 比如5G大小; 开发完成后,需要大规模数据集训练,此 - [查找Notebook实例](https://support.huaweicloud.com/devtool-modelarts/devtool-modelarts_0216.md): Notebook页面展示了所有创建的实例。如果需要查找特定的实例,可根据筛选条件快速查找。查看所有Notebook实例:参考给子账号配置查看所有Notebook实例的权限后,进入Notebook页面,选择“全部”,可以看到IAM项目下所有子账号创建的Notebook实例。查看所有筛选Notebook实例:在页面上方,单击计费中或运行中,可 - [更新Notebook实例](https://support.huaweicloud.com/devtool-modelarts/modelarts_30_0051.md): ModelArts允许用户在同一个Notebook实例中切换镜像,方便用户灵活调整实例的AI引擎。Notebook实例状态需在停止中才可以变更镜像。注意事项:变更镜像后可能会导致Notebook实例无法启动,镜像对应的Notebook实例规格不匹配,对应的收费规则也会随着镜像的变更而变化,请谨慎操作。更换镜像后挂载目录下的数据不会丢失(例 - [启动/停止/删除Notebook实例](https://support.huaweicloud.com/devtool-modelarts/devtool-modelarts_0006.md): 本文介绍如何启动、停止和删除Notebook实例。当专属资源池的节点被设置为热备节点时,该节点将不支持运行Notebook实例,例如创建、启动Notebook实例等。关于如何关闭热备节点,请参见修复专属资源池故障节点。由于运行中的Notebook将一直耗费资源,您可以通过停止操作,停止资源消耗。对于停止状态的Notebook,可通过启动操 - [使用root启动Notebook实例](https://support.huaweicloud.com/devtool-modelarts/devtool-modelarts_03034.md): 在ModelArts平台中,默认的用户名为ma-user,用户组为ma-group。如果在使用过程中挂载了SFS Turbo、使用自定义镜像或直接上传文件,需要提前修改文件权限,确保ma-user用户具有读取权限,否则可能会遇到“Permission denied”错误。下文将介绍使用root启动Notebook实例的适用场景及具体操作。 - [保存Notebook实例](https://support.huaweicloud.com/devtool-modelarts/devtool-modelarts_0008.md): 通过预置的镜像创建Notebook实例,在基础镜像上安装对应的自定义软件和依赖,在管理页面上进行操作,进而完成将运行的实例环境以容器镜像的方式保存下来。镜像保存后,默认工作目录是根目录/路径。保存的镜像中,安装的依赖包不丢失,持久化存储的部分(home/ma-user/work目录的内容)不会保存在最终产生的容器镜像中。VS Code远程 - [创建凭据](https://support.huaweicloud.com/devtool-modelarts/devtool-modelarts_0020.md): 凭据用于验证身份和授权访问的证明信息。在信息安全和身份认证领域,凭据是确保只有授权用户才能访问系统、资源或服务的关键机制。当您使用公共池创建Notebook实例,或者所选的专属池集群版本小于1.28,Everest插件版本小于2.5.60时,如果选择数据盘类型为对象存储 OBS - 并行文件系统或对象存储 OBS - 对象桶类型的存储,则 - [查看Notebook实例资源使用情况](https://support.huaweicloud.com/devtool-modelarts/devtool-modelarts_0231.md): 在使用Notebook实例的过程中,您可以在Notebook详情页查看资源使用情况,例如CPU使用率、物理内存使用率、GPU显卡使用率等。系统会自动保存Notebook实例的资源使用情况30天,过期后将清除。登录ModelArts管理控制台,在左侧菜单栏按需选择以下操作。新版控制台:选择模型开发与训练 > Notebook,进入Noteb - [查看Notebook实例事件](https://support.huaweicloud.com/devtool-modelarts/devtool-modelarts_0230.md): 在Notebook的整个生命周期,包括实例的创建、启动、停止、规格变更等关键操作以及实例的运行状态等在后台都有记录,用户可以在Notebook实例详情页中查看具体的事件,通过实例的事件,从而看到实例的运行或者异常等状态详情。在右侧可以手动刷新事件,也可以设置间隔30秒,1分钟,5分钟自动刷新事件。登录ModelArts管理控制台,在左侧导 - [使用CTS审计Notebook](https://support.huaweicloud.com/devtool-modelarts/devtool-modelarts_03033.md): ModelArts支持对接云审计CTS服务,通过云审计服务,您可以记录与ModelArts Notebook相关的操作事件,便于日后的查询、审计和回溯。已开通云审计服务。详细操作请参见云审计服务入门指引。登录CTS云审计服务控制台。在管理控制台左上角单击图标,选择目标区域。在左侧导航栏,单击事件列表,进入事件列表信息页面。用户每次登录云审 - [Notebook Cache盘告警上报](https://support.huaweicloud.com/devtool-modelarts/devtool-modelarts_03031.md): 创建Notebook时,可以根据业务数据量的大小选择CPU、GPU或者Ascend资源,对GPU或Ascend类型的资源,ModelArts会挂载硬盘至“/cache”目录,用户可以使用此目录来储存临时文件。当前开发环境的Cache盘使用时,没有容量告警,在使用时很容易超过限制,并直接重启Notebook实例。重启后多种配置重置,会导致用 - [Notebook实践案例](https://support.huaweicloud.com/devtool-modelarts/devtool-modelarts_0022.md): 本文列举了常用Notebook实践案例,涵盖入门指南、AI助手最佳实践、ModelArts Skill最佳实践和环境迁移等场景,帮助开发者快速找到适合的实践方案。 - [MoXing Framework功能介绍](https://support.huaweicloud.com/devtool-modelarts/modelarts_11_0001.md): MoXing Framework模块为MoXing提供基础公共组件,例如访问华为云的OBS服务,和具体的AI引擎解耦,在ModelArts支持的所有AI引擎(TensorFlow、MXNet、PyTorch、MindSpore等)下均可以使用。目前,提供的MoXing Framework功能中主要包含操作OBS组件,即下文中描述的mox. - [Notebook中快速使用MoXing](https://support.huaweicloud.com/devtool-modelarts/modelarts_11_0002.md): 本文档介绍如何在ModelArts中调用MoXing Framework接口。登录ModelArts管理控制台,在左侧菜单栏按需选择以下操作。新版控制台:选择模型开发与训练 > Notebook,进入Notebook页面。旧版控制台:选择开发空间 > Notebook,进入Notebook页面。新版控制台:选择模型开发与训练 > Note - [mox.file与本地接口的对应关系和切换](https://support.huaweicloud.com/devtool-modelarts/modelarts_11_0004.md): Python:指本地使用Python对本地文件的操作接口。支持一键切换为对应的MoXing文件操作接口(mox.file)。mox.file:指MoXing框架中用于文件操作的接口,与Python接口具有一一对应的关系。tf.gfile:指MoXing文件操作接口一一对应的TensorFlow相同功能的接口,在MoXing中,文件操作接口 - [MoXing常用操作的样例代码](https://support.huaweicloud.com/devtool-modelarts/modelarts_11_0005.md): 读取一个OBS文件。例如读取obs://bucket_name/obs_file.txt文件内容,返回string(字符串类型)。import moxing as mox file_str = mox.file.read('obs://bucket_name/obs_file.txt')也可以使用打开文件对象并读取的方式来实现,两者是等价 - [MoXing进阶用法的样例代码](https://support.huaweicloud.com/devtool-modelarts/modelarts_11_0006.md): 如果您已经熟悉了常用操作,同时熟悉MoXing Framework API文档以及常用的Python编码,您可以参考本章节使用MoXing Framework的一些进阶用法。当读取OBS文件时,实际调用的是HTTP连接读取网络流,注意要记得在读取完毕后将文件关闭。为了防止忘记文件关闭操作,推荐使用with语句,在with语句退出时会自动调 - [ModelArts CLI命令功能介绍](https://support.huaweicloud.com/devtool-modelarts/devtool-modelarts_0303.md): ModelArts CLI,即ModelArts命令行工具,是一个跨平台命令行工具,用于连接ModelArts服务并在ModelArts资源上执行管理命令。用户可以使用交互式命令行提示符或脚本通过终端执行命令。为了方便理解,下面将ModelArts CLI统称为ma-cli。ma-cli支持用户在ModelArts Notebook及线下 - [(可选)本地安装ma-cli](https://support.huaweicloud.com/devtool-modelarts/devtool-modelarts_0305.md): 本文以Windows系统为例,介绍如何在Windows环境中安装ma-cli。参考本地安装ModelArts SDK完成SDK的安装。下载ma-cli软件包。完成软件包签名校验。下载软件包签名校验文件。安装openssl并执行如下命令进行签名校验。openssl cms -verify -binary -in D:\ma_cli-late - [ma-cli auto-completion自动补全命令](https://support.huaweicloud.com/devtool-modelarts/devtool-modelarts_0306.md): 命令行自动补全是指用户可以在Terminal中输入命令前缀通过Tab键自动提示支持的ma-cli命令。ma-cli自动补全功能需要手动在Terminal中激活。执行ma-cli auto-completion命令,用户根据提示的补全命令,复制并在当前Terminal中执行,就可以自动补全ma-cli的命令。目前支持Bash、Fish及Zs - [ma-cli configure鉴权命令](https://support.huaweicloud.com/devtool-modelarts/devtool-modelarts_0307.md): 在虚拟机及个人PC场景,需要配置鉴权信息,目前支持用户名密码鉴权(默认)和AK/SK鉴权;在使用账号认证时,需要指定username和password;在使用IAM用户认证时,需要指定account、username和password;在ModelArts Notebook中可以不用执行鉴权命令,默认使用委托信息,不需要手动进行鉴权操作; - [ma-cli image镜像构建支持的命令](https://support.huaweicloud.com/devtool-modelarts/devtool-modelarts_0309.md): ma-cli image命令支持:查询用户已注册的镜像、查询/加载镜像构建模板、Dockerfile镜像构建、查询/清理镜像构建缓存、注册/取消注册镜像、调试镜像是否可以在Notebook中使用等。具体命令及功能可执行ma-cli image -h命令查看。ma-cli提供了一些常用的镜像构建模板,模板中包含了在ModelArts Not - [ma-cli ma-job训练作业支持的命令](https://support.huaweicloud.com/devtool-modelarts/devtool-modelarts_0320.md): 使用ma-cli ma-job命令可以提交训练作业,查询训练作业日志、事件、使用的AI引擎、资源规格及停止训练作业等。使用ma-cli ma-job get-job命令可以查看训练作业列表或某个作业详情。示例:查询指定任务ID的训练作业。ma-cli ma-job get-job -ib63e90xxx示例:根据任务名称关键字“auto” - [ma-cli dli-job提交DLI Spark作业支持的命令](https://support.huaweicloud.com/devtool-modelarts/devtool-modelarts_0329.md): 执行ma-cli dli-job get-job查询DLI Spark作业列表或单个作业详情。示例:查询DLI Spark所有作业。执行ma-cli dli-job submit命令提交DLI Spark作业。ma-cli dli-job submit命令需要指定一个位置参数YAML_FILE表示作业的配置文件路径,如果不指定该参数,则表 - [使用ma-cli obs-copy命令复制OBS数据](https://support.huaweicloud.com/devtool-modelarts/devtool-modelarts_0337.md): 使用ma-cli obs-copy [SRC] [DST]可以实现本地和OBS文件或文件夹的相互复制。# 上传文件到OBS中# 上传文件夹到OBS中,对应上传到OBS的目录为obs://${your_bucket}/test-copy/data/# 上传文件夹到OBS中,并指定--drop-last-dir,对应上传到OBS的目录为ob - [使用CodeLab体验Notebook](https://support.huaweicloud.com/devtool-modelarts/devtool-modelarts_0010.md): 面向广大开发者,ModelArts提供了CodeLab功能,您可以通过一键操作进入开发环境,并且预置了算力规格,能够直接体验Notebook功能。仅“华北-北京四”区域的旧版控制台支持CodeLab功能。如果您使用的是新版控制台,请在左侧导航栏最下方单击返回旧版。如果您使用的是新版控制台,请在左侧导航栏最下方单击返回旧版。CodeLab默 - [使用PyCharm Toolkit插件连接Notebook](https://support.huaweicloud.com/devtool-modelarts/devtool-modelarts_0016.md): 由于AI开发者会使用PyCharm工具开发算法或模型,为方便快速将本地代码提交到ModelArts的训练环境,ModelArts提供了一个PyCharm插件工具PyCharm ToolKit,协助用户完成SSH远程连接Notebook、代码上传、提交训练作业、将训练日志获取到本地展示等,用户只需要专注于本地的代码开发即可。本章节介绍了使用 ## 模型训练 - [概述](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-0001.md): 魔坊(ModelArts)是华为云提供的一站式AI开发与训推平台,提供算法开发、模型训练、部署上线、资源管理等全生命周期工具链。模型训练是ModelArts的核心模块,支持用户通过界面化操作及API等方式创建训练任务。您可以使用训练模块快速迭代模型参数、验证不同数据集与超参数组合,训练出满足要求的模型。AI模型开发的过程,称之为Model - [准备工作](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-0136.md): 由于训练作业运行需消耗资源,为了避免训练失败请确保账户无欠费。详见模型训练计费项。检查是否配置了访问授权。如果未配置,请参见快速配置ModelArts委托授权完成操作。在启动模型训练任务前,您需要准备计算资源完成后续模型训练任务。ModelArts提供了如下不同种类训练资源,请参考使用:公共算力资源:在创建训练作业时称为公共资源池。公共资 - [训练场景说明](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-0137.md): ModelArts为不同经验水平和业务需求的开发者提供了多种灵活的模型训练场景。这些场景覆盖了从“零代码快速验证”到“企业级自动化生产”的完整路径,帮助用户根据任务复杂度、模型类型、开发成熟度以及自动化程度,选择最适合的训练路径。以下对训练场景进行详细说明。ModelArts为新手、快速原型验证和教学演示设计的最简便入口。用户无需编写代码 - [创建一键训练作业](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-0138.md): 如果您的任务属于常见的标准任务(如文本生成),不希望关心底层的训练脚本、超参调优和资源配置时,推荐使用一键训练。您只需要准备好数据集、选择对应的任务类型,平台会自动完成算法选择、训练参数配置和资源调度,最终直接产出可部署的模型。这种场景的核心价值是"零代码、快速见效",帮助用户在最短时间内跑通从数据到模型的完整闭环,非常适合原型验证和业务 - [创建自定义训练作业](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-0006.md): 本章节内容仅适用于控制台界面为新版样式的站点,请参考新旧控制台说明了解如何切换新旧控制台。如需在旧版控制台创建训练作业,请参考创建训练作业(旧版控制台页面)。在模型开发过程中,如何高效地优化模型性能是一个关键挑战。传统的模型训练方式往往需要反复尝试不同的模型结构、数据集和超参数组合,这不仅耗时耗力,还可能导致训练效果不理想。针对这一问题, - [创建精调训练作业](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-0007.md): 在大模型训练中,精调(或“微调”)(Fine-tuning) 是指通过特定领域的数据集对已经做过全量预训练模型(Pre-trained Model, PT)进行二次训练的方法。通过精调能够更新模型权重,使模型能够更有效地应对具体的任务需求。这一阶段使模型能够精确执行如文案生成、代码生成和专业问答等特定场景中的任务。在模型开发过程中,精调的 - [使用API创建训练作业](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-0139.md): 当您需要基于特定数据集和算法模型执行机器学习训练时,可以使用ModelArts API创建和配置训练作业。 训练作业创建成功后,平台将根据配置的资源规格自动启动训练作业,您可以通过作业ID监控训练进度和状态。通过API创建训练作业特别适合以下场景,是生产环境中最推荐的训练作业创建方式:自动化生产流水线:将训练作业集成到CI/CD流水线或M - [增量模型训练](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-1420.md): 增量训练(Incremental Learning)是机器学习领域中的一种训练方法,它允许人工智能(AI)模型在已经学习了一定知识的基础上,增加新的训练数据到当前训练流程中,扩展当前模型的知识和能力,而不需要从头开始。增量训练不需要一次性存储所有的训练数据,缓解了存储资源有限的问题;另一方面,增量训练节约了重新训练中需要消耗大量算力、时间 - [优先级和调度策略](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-0105.md): 使用专属资源池训练作业时,支持在创建训练作业时设置任务优先级,也支持作业在长时间处于等待中的状态时调整优先级。如通过调整作业优先级可以减少作业的排队时长。在用户运行训练作业过程中,需要对训练作业做优先级划分。例如部分低优先级任务用于测试或简单的非关键实验,当存在高优先级作业时,高优先级作业能够比低优先级作业更快进入调度队列。在资源使用高峰 - [管理训练容器环境变量](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-0104.md): 本章节展示了训练容器环境中预置的环境变量,方便用户查看,主要包括以下类型。路径相关环境变量分布式训练作业环境变量NCCL(Nvidia Collective multi-GPU Communication Library)环境变量OBS环境变量PIP源环境变量API网关地址环境变量作业元信息环境变量为了避免新设置的环境变量与系统环境变量冲 - [示例:将本地PyTorch训练代码迁移到ModelArts](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-0148.md): 本实践旨在指导开发者将本地已调试完成的PyTorch训练脚本,改造为可在ModelArts训练作业中运行的标准形态,内容涵盖数据路径改造、运行环境准备、单机多卡/多机多卡分布式改造,以及从GPU迁移至昇腾NPU的代码适配四个部分,并分别给出改造前后的代码示例。代码必须先在本地调试好,再上传华为云平台进行训练,否则会出现各种难以解释的问题, - [分布式训练功能介绍](https://support.huaweicloud.com/develop-modelarts/modelarts-distributed-0001.md): 分布式训练是指在多个计算节点(如多台服务器或GPU设备)上并行执行深度学习任务,以加快模型训练速度或处理更大规模的数据。通过将训练任务分配到多个节点上,每个节点负责计算模型的一部分,然后通过通信机制将计算结果同步,最终完成整个模型的训练。这种方式可以显著提高训练效率,尤其适用于复杂模型和大规模数据集的场景。ModelArts提供了对分布式 - [创建多机多卡的分布式训练(DistributedDataParallel)](https://support.huaweicloud.com/develop-modelarts/modelarts-distributed-0008.md): 在深度学习领域,随着模型复杂度的不断提升和训练规模的不断扩大,传统的单机训练方式已难以满足实际需求。在这一背景下,如何在多机多卡环境下实现高效的分布式训练成为了亟待解决的关键问题。针对这一问题,本章节将详细介绍基于PyTorch引擎的多机多卡数据并行训练方法。本文不仅提供具体的代码适配操作过程,还通过完整的代码示例帮助读者更好地理解和实践 - [自定义镜像训练作业配置实例间SSH免密互信](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-0032.md): 在使用自定义镜像进行分布式训练时,如果未配置训练作业实例间的SSH免密互信,将会导致训练任务失败。为确保实例间的通信顺畅,必须预先配置实例间SSH免密互信,确保分布式训练任务顺利进行。配置实例间SSH免密互信涉及代码适配和训练作业参数配置,本文提供了一个操作示例。准备一个预装OpenSSH的自定义镜像,使用的训练框架是MPI或Horovo - [超节点亲和组实例数配置](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-0011.md): 大模型训练中通常会采取多种并行策略,通过分布式计算来提高模型的训练效率和扩展性。其中模型并行中的allreduce通信以及MoE专家并行中的alltoall通信对卡间的互联带宽要求非常高,受限于硬件的组网,这些通信开销较大的阶段往往成为限制训练性能的瓶颈。昇腾新一代硬件Snt9b23,使用HCCS总线将多个计算节点的NPU互联进行大带宽互 - [示例:创建DDP分布式训练(PyTorch+GPU)](https://support.huaweicloud.com/develop-modelarts/modelarts-distributed-0011.md): 在分布式训练场景中,使用PyTorch的DistributedDataParallel(DDP)功能是实现高效训练的重要方式。为了帮助用户更好地理解和应用这一功能,本文将详细介绍torch.distributed.launch命令启动训练作业PyTorchDDP训练的方法,并提供对应的代码示例。需要有GPU加速卡资源池。在创建训练任务之前 - [示例:创建DDP分布式训练(PyTorch+NPU)](https://support.huaweicloud.com/develop-modelarts/modelarts-distributed-0012.md): 在深度学习领域,使用PyTorch的DistributedDataParallel(DDP)功能在Ascend加速卡上进行分布式训练是一种高效的方式。然而,如何通过自定义镜像和自定义启动命令来实现这一目标,是用户在实际操作中可能遇到的挑战。针对这一问题,本文提供了一种解决方案:通过配置训练作业的自定义镜像,并结合自定义启动命令,用户可以轻 - [创建并调试训练作业](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-0042.md): 在AI模型开发过程中,高效的调试环境是确保模型质量的关键环节。传统开发模式中,开发人员需要在本地环境中完成模型调试,再进行云端部署,这一过程往往面临环境配置复杂、资源利用率低等问题。ModelArts训练作业的调试模式提供了一套完整的云端开发解决方案,有效解决了上述问题。该方案主要包含以下核心功能:云化开发环境支持集成JupyterLab - [使用Cloud Shell调试生产训练作业](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-0119.md): ModelArts提供了Cloud Shell,可以登录运行中的容器,用于调试生产环境的训练作业。仅专属资源池支持使用Cloud Shell登录训练容器,且训练作业必须处于运行中状态。使用主用户账号登录华为云管理控制台,单击右上角用户名,在下拉框中选择统一身份认证,进入统一身份认证(IAM)服务。在统一身份认证服务页面的左侧导航选择权限管 - [SSH远程开发](https://support.huaweicloud.com/develop-modelarts/develop-modelarts_0299.md): 本节操作介绍在Windows环境中使用方式一:使用CMD工具连接云上训练作业实例和方式二: 使用MobaXterm工具连接云上训练作业实例两种方式远程登录云上实例的操作步骤。使用SSH连接训练作业实例的约束限制如下:本地用户密钥和权限必须匹配。本地用户密钥需要存放在指定目录下。Windows:C:\Users\{{user}}macOS/ - [保存调试模式训练作业镜像](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-1423.md): 在使用镜像进行开发和调试的过程中,用户可能会对镜像环境修改和优化。如果用户在完成镜像修改后,希望保留当前的镜像环境以备后续开发使用,此时可以在控制台使用"保存镜像"功能,将当前的镜像环境保存,用于后续的开发和调试工作。在镜像保存时,需要注意以下几点:安装的依赖包将被保留,但训练数据、代码等需要持久化存储的内容不会被保存在最终生成的容器镜像 - [模型训练存储加速](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-1421.md): 针对AI训练场景中大模型Checkpoint保存和加载带来的I/O挑战,华为云提供了基于对象存储服务OBS+高性能弹性文件服务SFS Turbo的AI云存储解决方案,如下图所示。SFS Turbo HPC型支持和OBS数据联动,您可以通过SFS Turbo HPC型文件系统来加速对OBS对象存储中的数据访问,并将生成的结果数据异步持久化到 - [训练作业动态路由加速](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-0004.md): 在分布式训练场景下,由于多节点之间的数据交互频繁,网络通信效率往往成为性能瓶颈。传统方式下,训练作业的网络通信存在带宽利用率低、数据传输延迟高等问题,这会直接影响训练效率和资源利用率。针对这一技术挑战,用户可能会问:如何有效优化分布式训练中的网络通信性能?ModelArts提供了一项动态路由加速功能,通过智能优化训练作业的网络通信路径,显 - [MoXing基础功能](https://support.huaweicloud.com/develop-modelarts/develop-moxing-0002.md): 在使用ModelArts服务时,您可能会遇到需要访问对象存储服务(OBS)的情况。OBS是一个基于对象的海量存储服务,与传统的本地文件系统不同,无法直接通过文件路径访问OBS上的文件。直接访问OBS文件时会遇到以下问题:无法像访问本地文件那样使用open()方法。需要通过网络请求进行文件读写操作。使用OBS Python SDK接口可能较 - [模型高可用功能说明](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-0121.md): 在长时间、大规模的模型训练中,受限于硬件稳定性、网络波动等原因,训练作业难免会出现中断。如果训练作业能够在中断后快速恢复,将极大地提高训练设备的利用率,降低用户训练的时间成本和算力损失。ModelArts提供了模型训练高可用功能,包括断点续训练、故障检测、自动重启、故障节点隔离、卡死检测、算子重执行和失败日志分析等能力,用于提升训练作业在 - [高可用性配置场景](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-0122.md): 本章推荐一些常用场景的高可用配置,给您在配置高可用训练作业时提供一些配置参考。 - [高可靠性前置准备:断点续训练](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-0023.md): 通过本章,您将了解到断点续训练的相关原理、配置方法、配置建议和注意事项。由于内容较多,为便于您找到关心的内容,本节开头先做一个简单的内容分类。请参照如下分类,阅读您关心的内容。了解断点续训的概念及为什么需要断点续训,请您参考什么是断点续训练和为什么需要配置断点续训练。了解如何配置断点续训,请您参考如何配置CheckPoint。了解配置Ch - [开启和查看高可用配置](https://support.huaweicloud.com/develop-modelarts/modelarts_trouble_0003.md): 通过本章,您将了解到ModelArts高可用配置方法、配置建议和查看高可用配置任务。由于内容较多,为便于您找到关心的内容,本节开头先做一个简单的内容分类。请参照如下分类,阅读您关心的内容。了解如何开启高可用配置。ModelArts提供了两种开启高可用配置的方法,分别是通过ModelArts控制台创建训练作业,设置“高可用配置”开启和通过创 - [故障检测机制](https://support.huaweicloud.com/develop-modelarts/modelarts_trouble_0108.md): ModelArts提供了容错检测和卡死检测两大类故障检测机制,用于保证模型训练作业的高可用性。本章将详细介绍两种故障检测机制的原理和检测规则。本节将通过视频介绍和容错检查场景原理介绍ModelArts容错检查的执行原理。如果您想了解如何配置高可用性,请参考开启和查看高可用配置。用户在训练模型过程中,存在因硬件故障而产生的训练失败场景。针对 - [故障恢复机制](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-0012.md): 用户在创建训练作业时可以通过设置自动重启的方式开启和查看高可用配置,当训练作业所在节点故障或训练作业检查到异常时,系统会自动触发训练作业故障恢复机制,通过重启进程或重建作业等手段尝试恢复训练业务。不同恢复策略的及差异如表1所示。容错恢复主要是通过重启进程或重建作业恢复训练业务,为了避免丢失训练进度、浪费算力,开启此功能前请确认代码已适配断 - [算子重执行](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-14191.md): 算子重执行是指当因为通信链路故障导致训练作业中通信算子报错,借助HCCL能力实现失败算子重新执行,保障训练作业不失败。在超节点大模型训练场景,集群通信链路存在闪断的情况,此时通信算子会执行报错,算子重执行可以很好的避免由于链路闪断故障造成的整个作业失败,提升训练作业的通信稳定性。在昇腾新一代硬件Snt9b23构建的超节点集群中,每个超节点 - [观测、日志与故障诊断](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-0098.md): 在ModelArts中训练作业遇到问题时,可首先查看日志,多数场景下的问题可以通过日志报错信息直接定位。ModelArts提供了训练作业失败定位与分析功能,如果训练作业运行失败,ModelArts会自动识别导致作业失败的原因,在训练全量日志界面上给出提示。提示包括三部分:失败的可能原因、推荐的解决方案以及对应的日志(底色标红部分)。Mod - [查看训练作业列表和详情](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-0027.md): 本章节内容仅适用于控制台界面为新版样式的站点,请参考新旧控制台说明了解如何切换新旧控制台。如需在查看旧版控制台作业详情,请参考创建训练作业(旧版)。在使用ModelArts平台的模型训练功能时,您可能需要查看当前正在进行的训练作业列表及其详细信息,以确保训练过程顺利进行。通过作业列表页面,您可以轻松掌握每个作业的状态,调整列表展示内容,根 - [训练作业流程可视化](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-1431.md): 在机器学习训练过程中,用户通常需要监控训练作业的执行状态。然而,传统的监控方式往往难以提供全面的作业运行信息,导致用户无法及时掌握训练进度。通过作业流程可视化功能模块,用户可以实时查看训练作业的详细运行状态。该功能支持多维度的信息展示,包括作业调度情况、环境准备状态以及作业执行进度等关键环节。用户只需进入可视化界面,即可一目了然地掌握训练 - [查看训练作业事件](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-0092.md): 在训练作业的整个生命周期中,从用户可见的开始阶段起,系统后台会记录每一个关键事件点,用户可以随时在对应训练作业的详情页面查看这些记录。这样,用户能够清晰地了解训练作业的进展和状态,确保信息的透明度和可追溯性。方便用户更清楚地了解训练作业运行过程,遇到任务异常时,更加准确地排查定位问题。当前支持的作业事件如下所示:训练作业创建成功训练作业创 - [查看训练作业日志](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-0014.md): 训练日志记录了训练作业的运行过程和异常信息,帮助用户快速定位作业运行中出现的问题。用户代码中的标准输出和标准错误信息都会在训练日志中显示。当在ModelArts中遇到训练作业问题时,用户可以首先查看日志,大多数情况下,问题可以通过日志中的报错信息直接定位。训练日志包括普通训练日志和Ascend相关日志。普通日志:当使用Ascend之外的资 - [查看训练作业监控指标](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-1424.md): 在训练作业运行过程中,如果用户能在模型训练出问题(例如loss值异常)的情况下能收到告警并及时处理,可以节省大量时间和资源,避免无效运行作业导致的浪费。同时通过指标监控可以实时掌握训练作业的进度,了解模型在不同阶段的训练状态。当前ModelArts训练作业模块在训练作业详情页的监控页签中提供了训练作业占用的CPU、GPU或NPU资源使用情 - [智能运维](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-0018.md): 训练作业运行过程中,ModelArts平台会对训练作业进行全方位的实时监测,确保作业的正常运行。训练作业详情中提供智能运维功能,便于用户对作业的监测和运维。当训练作业运行结束后,如果作业状态是“失败”或者“已终止”, 可以在“智能运维”中根据需要选择诊断工具对作业进行诊断。不同工具的诊断范围和诊断时间存在差异,请根据需要选择诊断类型。故障 - [查看训练作业资源占用情况](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-0015.md): 当前ModelArts训练作业模块在训练作业详情页的监控页签中提供了训练作业的资源使用情况监控,可以查看当前训练作业整体或单个节点占用的CPU、GPU或NPU资源使用情况。支持查看整个训练周期内的监控数据,具体数据参见表1。训练作业的资源占用情况系统会自动保存30天,过期会被清除。在ModelArts管理控制台的左侧导航栏中选择模型开发与 - [查看模型评估结果](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-0016.md): 训练作业运行结束后,ModelArts可为您的模型进行评估,并且给出调优诊断和建议。针对使用预置算法创建训练作业,无需任何配置,即可查看此评估结果(由于每个模型情况不同,系统将自动根据您的模型指标情况,给出一些调优建议,请仔细阅读界面中的建议和指导,对您的模型进行进一步的调优)。针对用户自己编写训练脚本或自定义镜像方式创建的训练作业,则需 - [查看训练作业标签](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-0108.md): 通过给训练作业添加标签,可以标识云资源,便于快速搜索训练作业。在ModelArts管理控制台的左侧导航栏中选择模型开发与训练模型训练(旧版控制台:模型训练 > 训练作业)。在训练作业列表中,单击作业名称进入训练作业详情页面。在训练作业详情页面,单击标签页签查看标签信息。支持添加、修改、删除标签。标签详细用法请参见使用TMS标签实现资源分组 - [复制、停止或删除训练作业](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-0017.md): 登录ModelArts管理控制台。在左侧导航栏中,选择模型训练训练作业(新版为“模型训练”),进入训练作业列表。单击进入训练作业详情。当您需要修改训练作业的算法时,可以在训练作业详情页面右上角,单击另存为算法。在创建算法页面中,会自动填充上一次训练作业的算法参数配置,您可以根据业务需求在原来算法配置基础上修改。新版控制台不支持此功能。订阅 - [使用CTS审计ModelArts训练作业](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-0026.md): ModelArts训练支持对接云审计CTS服务,通过云审计服务,您可以记录与ModelArts相关的操作事件,便于日后的查询、审计和回溯。在您开启了云审计服务后,系统会记录ModelArts的相关操作,且控制台保存最近7天的操作记录。本节介绍如何在云审计服务管理控制台查看最近7天的操作记录。已开通云审计服务。详细操作请参见《云审计服务用户 - [模型训练实践汇总](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-0145.md): 本章汇总了模型训练所有相关实践案例,请根据实际需求获取对应案例。 - [模型训练使用流程](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-0002.md): AI模型开发的过程,称之为Modeling,一般包含两个阶段:开发阶段:准备并配置环境,调试代码,使代码能够开始进行深度学习训练,推荐在ModelArts开发环境中调试。实验阶段:调整数据集、调整超参等,通过多轮实验,训练出理想的模型,推荐在ModelArts训练中进行实验。两个过程可以相互转换。如开发阶段代码稳定后,则会进入实验阶段,通 - [准备模型训练镜像](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-1417.md): ModelArts平台提供了TensorFlow,PyTorch,MindSpore等常用深度学习任务的基础镜像,镜像里已经安装好运行任务所需软件。当基础镜像里的软件无法满足您的程序运行需求时,您还可以基于这些基础镜像制作一个新的镜像并进行训练。ModelArts中预置的训练基础镜像如下表所示。场景一:预置镜像满足ModelArts训练平 - [预置框架启动文件的启动流程说明](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-1415.md): ModelArts训练服务为用户预置了多种主流AI框架,并针对不同框架的特点进行了专门的适配优化。在使用这些预置框架进行模型训练时,用户需要根据所选框架的特点,相应地调整训练启动命令,以确保训练任务能够顺利执行。ModelArts提供4种预置框架,便于用户在创建训练作业时根据需求直接调整使用。4种框架如下:本章节详细介绍基于不同的预置框架 - [开发用于预置框架训练的代码](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-0008.md): 在使用ModelArts平台完成算法开发时,开发者需要利用预置框架来构建和训练模型。然而,预置框架虽然提供了基础功能,但可能无法完全满足特定的业务需求,需要进行定制化开发。为了确保预置框架能够与具体的业务需求完美结合,开发者需要在使用预置框架创建算法之前,预先完成算法代码的开发工作。通过预先开发,可以确保预置框架能够高效地支持模型训练和优 - [开发用于自定义镜像训练的代码](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-1416.md): 在使用ModelArts进行模型训练时,平台提供了多种预置框架和算法,能够满足大部分用户的需求。然而,当预置框架和算法确实无法满足需求时,ModelArts提供了自定义镜像训练的功能,为用户提供了一个灵活的解决方案。通过构建自定义镜像,用户可以完全定制训练环境,满足特定需求。自定义镜像的制作要求用户对容器相关知识有比较深刻的了解,除非订阅 - [创建训练作业](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-0022.md): 本章节内容适用控制台界面为旧版样式的华为云站点。在模型开发过程中,如何高效地优化模型性能是一个关键挑战。传统的模型训练方式往往需要反复尝试不同的模型结构、数据集和超参数组合,这不仅耗时耗力,还可能导致训练效果不理想。针对这一问题,ModelArts的训练模块提供了一套完整的解决方案。它支持创建训练作业、实时监控训练进展以及管理训练版本,帮 - [创建算法](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-0003.md): 机器学习从有限的观测数据中学习一般性的规律,并利用这些规律对未知的数据进行预测。为了获取更准确的预测结果,用户需要选择一个合适的算法来训练模型。针对不同的场景,ModelArts提供大量的算法样例。以下章节提供了关于业务场景、算法学习方式、算法实现方式的指导。ModelArts提供如下方式实现模型训练前的算法准备。使用订阅算法ModelA - [自动模型优化介绍](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-0031.md): ModelArts训练支持超参搜索功能,自动实现模型超参搜索,为您的模型匹配最合适的超参。在模型训练过程中,有很多超参需要根据任务进行调整,比如learning_rate、weight_decay等,这一工作往往需要一个有经验的算法工程师花费一定精力和大量时间进行手动调优。ModelArts支持的超参搜索功能,在无需算法工程师介入的情况下 - [创建自动模型优化的训练作业](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-0036.md): 如果用户使用的AI引擎为pytorch_1.8.0-cuda_10.2-py_3.7-ubuntu_18.04-x86_64和tensorflow_2.1.0-cuda_10.1-py_3.7-ubuntu_18.04-x86_64,并且优化的超参类型为float类型,ModelArts支持用户使用超参搜索功能。在0代码修改的基础下,实现 - [训练大盘监控](https://support.huaweicloud.com/develop-modelarts/develop-monitoring-0001.md): 在使用ModelArts进行模型训练时,用户需要实时监控训练任务的运行状态,以确保训练过程的顺利进行。然而,有时用户可能需要更详细的数据分析和管理,而不仅仅是实时监控。为此,ModelArts管理控制台提供了全面的监控和数据导出功能。通过导航至“模型训练 > 训练作业 > 大盘监控”(旧版控制台),用户可以一站式查看训练作业的概览、健康监 - [管理训练实验](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-0020.md): 当训练作业的数量较多时,可能会遇到难以快速定位作业或不便跟踪的情况。为了便于管理训练作业,ModelArts引入了训练实验的概念,类似于对训练作业进行分组管理。用户可以根据需求将作业归类到不同的训练实验中,实现分类管理。每个训练实验可以包含多个同类型的作业。在管理训练实验时,支持以下操作:将单个作业纳入实验、在已有的实验中创建作业、查看实 - [查看训练作业列表和详情](https://support.huaweicloud.com/develop-modelarts/develop-modelarts-0013.md): 本章节内容适用控制台界面为旧版样式的华为云站点。在使用ModelArts平台的模型训练功能时,您可能需要查看当前正在进行的训练作业列表及其详细信息,以确保训练过程顺利进行。通过作业列表页面,您可以轻松掌握每个作业的状态,调整列表展示内容,根据需要的属性类型进行筛选过滤,快速查找训练作业,并将训练作业导出为Excel表到本地。单击具体作业, ## 推理部署 - [推理部署介绍](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0002.md): ModelArts提供的AI模型推理服务管理平台,旨在帮助用户快速将AI模型部署为可运行的推理服务,并为推理服务提供API能力,供用户集成到自定义的应用中。ModelArts支持将模型部署为一个在线服务,并且提供在线的测试UI与监控功能。部署成功的在线服务,将为用户提供一个可调用的API。在线推理常用于对实时性要求较高的场景,如在线智能客 - [场景化部署](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0078.md): 在人工智能应用落地的过程中,推理部署的效率、灵活性与性能优化是决定业务成败的关键。ModelArts推理服务致力于提供全场景、全栈式的 AI 推理部署能力,从开箱即用的便捷体验到深度定制的极致性能优化,满足不同规模、不同复杂度业务场景的需求。本章节概述ModelArts在推理部署方面的场景化能力:一键部署、预置模型自定义部署、开源社区(v - [准备推理镜像](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0003.md): 在推理服务部署场景中,开发人员通常需要将训练好的模型封装为镜像进行部署,并将镜像上传至容器镜像服务SWR(SoftWare Repository for Container),利用其安全存储和版本管理能力,实现镜像的高效分发和推理服务的快速部署。用户可以通过ECS或CCE拉取已有推理业务镜像,或者制作推理业务镜像,再将推理业务镜像推送到S - [配置服务信息](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0016.md): 在线服务有新旧2个版本,推荐使用新版在线服务。推理服务信息负责对外统一入口,确保模型迭代时调用地址永久稳定。支持配置认证方式、网络访问策略及全局流量开关。服务信息不涉及计费。登录ModelArts管理控制台,在左侧导航栏中选择模型推理 > 在线推理,默认进入在线推理列表。在在线服务列表中,单击部署。在部署在线服务页面,配置服务信息。基本配 - [推理在线服务单机部署](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0004.md): 在线服务有新旧2个版本,推荐使用新版在线服务。推理在线服务单机部署(基础模式)是指单个推理单元就能完成推理,不在部署形态上区分推理角色、不做分布式拆分,所有推理计算、前后处理都在同一实例完成,是轻量、简单、易维护的部署形态。即仅创建1个推理单元,就可以承载推理服务的功能。适用场景:中小型、小参数模型(如分类、检测、轻量对话模型)上线低并发 - [推理在线服务多机PD混部](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0038.md): 在线服务有新旧2个版本,推荐使用新版在线服务。在大模型推理业务规模化落地过程中,Prefill(预填充) 负责处理用户输入、生成初始向量,属于高算力、短时密集型任务;Decode(解码) 负责逐词生成文本、维持会话上下文,属于低算力、长时流式任务。两类任务资源需求差异显著,单机部署易出现资源争抢、性能波动问题。多机 PD 混部适用于中大型 - [推理在线服务多机PD分离部署](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0086.md): 在线服务有新旧2个版本,推荐使用新版在线服务。在超大规模大模型(百亿 / 千亿参数)推理场景中,传统单机部署存在显存不足、首 Token 延迟高、并发吞吐量低、资源利用率差等痛点,无法满足企业级生成式 AI(文本生成、多模态生成)的高并发、低延迟、高稳定需求。多机PD分离(Prefill - 预填充、Decode - 解码分离)部署,专为 - [测试在线服务](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0100.md): 在ModelArts管理控制台左侧导航栏中选择模型推理 > 在线推理,默认进入在线推理列表,单击目标服务的操作列的服务调用,查看调用信息。也可单击目标服务名称,进入服务详情页,在服务调用中获取调用信息。URL示例:https://10.XX.XXX.XXX/v2/infer/testxxxx-xxxx-xxxx-xxxx-xxxxxxxx - [通过无认证方式访问在线服务](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0006.md): 如果在线服务的状态处于运行中,则表示在线服务已部署成功,部署成功的在线服务,将为用户提供一个可调用的API,此API为标准RESTful API。在使用ModelArts部署在线服务时,用户通常希望快速验证模型的效果,ModelArts提供无认证方式访问在线服务,不需要身份验证即可访问在线服务。通过无认证方式,客户端可以直接调用API,安 - [通过IAM Token认证的方式访问在线服务](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0007.md): 如果在线服务的状态处于运行中,则表示在线服务已部署成功,部署成功的在线服务,将为用户提供一个可调用的API,此API为标准RESTful API。然而,直接调用API存在安全风险,因为这可能让未经授权的用户访问敏感数据或执行操作。为了确保API调用的安全性,ModelArts平台支持通过Token认证访问在线服务。Token认证就是在调用 - [通过API KEY认证访问在线服务](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0008.md): 如果在线服务的状态处于运行中,则表示在线服务已部署成功。部署成功的在线服务,将为用户提供一个可调用的API,此API为标准RESTful API。在使用ModelArts提供的在线服务时,用户需要通过API调用进行模型预测,通常需要进行身份认证以确保安全。然而,传统的认证方式可能需要复杂的配置和管理,增加了开发和维护的难度。如何在保证安全 - [通过公网访问通道的方式访问在线服务](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0010.md): ModelArts推理支持使用公网访问在线服务,您可以使用标准的HTTPS协议或WebSocket协议访问在线服务。在线服务部署成功后,将为用户提供一个可调用的API,此API为标准RESTful API。在将在线服务RESTful API集成至生产环境之前,需要对此API进行调测,本章节以通过API KEY认证方式介绍如何向在线服务发起 - [通过内网访问在线服务](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0011.md): 在企业级应用开发中,当开发人员需要从企业内部网络访问ModelArts提供的在线推理服务时,会遇到因网络隔离导致的访问障碍,影响开发效率和安全性。ModelArts支持内网访问在线服务。内网访问适合需要高安全性和低延迟的场景。内网接入在线服务的场景下,通过在自己的VPC或资源池VPC等场景下创建VPCEP ,可以在VPC内提供便捷、安全、 - [通过弹性负载均衡ELB访问在线服务](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0104.md): 弹性负载均衡(Elastic Load Balance,简称ELB)是将访问流量根据分配策略分发到后端多台服务器的流量分发控制服务。弹性负载均衡可以通过流量分发扩展应用系统对外的服务能力,同时通过消除单点故障提升应用系统的可用性。为了确保外网用户能够安全、高效地访问ModelArts提供的在线服务,并更灵活地整合ModelArts提供的预 - [使用WebSocket协议的方式访问在线服务](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0013.md): 在实时通信和在线游戏中,传统的HTTP协议由于需要频繁建立和断开连接,导致延迟高和带宽消耗大。WebSocket是一种网络传输协议,使得客户端和服务器之间的数据交换变得更加简单,允许服务端主动向客户端推送数据。在WebSocket API中,浏览器和服务器只需要完成一次握手,两者之间就可以建立持久性的连接,并进行双向数据传输。适用于实时通 - [使用Server-Sent Events协议的方式访问在线服务](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0014.md): Server-Sent Events(SSE)是一种服务器向客户端推送数据的技术,它是一种基于HTTP的推送技术,服务器可以向客户端推送事件。这种技术通常用于实现服务器向客户端单向推送实时数据,例如实时新闻更新、股票价格等。SSE主要解决了客户端与服务器之间的单向实时通信需求(例如大模型回答的流式输出),相较于WebSocket(双向实时 - [使用HTTP/HTTPS协议的方式访问在线服务](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0015.md): HTTP的核心模式是请求-响应,即客户端发起请求,服务器返回响应,服务器无法主动推送数据。HTTPS在HTTP的基础上增强了安全性,广泛应用于对数据隐私和完整性要求较高的场景。HTTP协议以明文方式发送内容,不提供任何方式的数据加密,如果攻击者截取了Web浏览器和网站服务器之间的传输报文,就可以直接读懂其中的信息,因此,HTTP协议不适合 - [查看在线服务详情](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0018.md): 登录ModelArts管理控制台,在左侧菜单栏中选择模型推理 > 在线推理,进入在线推理管理页面。在线推理服务列表页的搜索框中,支持通过各种筛选条件搜索,具体的筛选条件如下:在线服务层级的筛选条件:服务调用模式:在线服务的调用模式,包括同步调用、异步调用认证方式:在线服务的的认证方式,包括API Key认证、IAM Token认证、无认证 - [管理在线服务部署的生命周期](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0021.md): 使用公共资源池创建的服务部署,不支持对部署进行独立的生命周期管理,包括服务添加部署、启动服务部署、停止服务部署、切换部署运行的版本、中断服务部署、删除服务部署、升级服务部署、克隆服务部署、扩缩容在线服务部署。对于已部署的在线服务,可以通过添加部署配置以匹配业务变化,实现服务升级。登录ModelArts管理控制台,在左侧菜单栏中选择模型推理 - [升级(修改)在线服务部署](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0022.md): 对于在线服务已添加的部署,您可以通过变更部署配置项来新增部署版本,实现服务部署的升级。修改资源配置、环境配置、部署管理配置、高级配置(密钥配置、自定义监控指标采集)将会触发滚动升级,可能导致重新部署。部署升级关系着业务实现,不当的升级操作会导致升级期间业务中断的情况,请谨慎操作。只有当服务部署处于“运行中”、“异常”、“告警”或“停止”状 - [扩缩容在线服务部署](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0023.md): 当在线服务部署完成,使用一段时间后,由于实际业务的变化,对于在线服务资源量的需求可能会产生变化。面对这种场景,ModelArts支持在线服务部署扩缩容,根据实际负载需求,调整在线服务部署的资源规格或实例数量。ModelArts在线服务当前提供两种方式的扩缩容方式,手动扩缩容和自动扩缩容,应对用户多样化的需求。目前只支持对单个部署实例数进行 - [克隆(复制)在线服务部署](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0024.md): 克隆在线服务部署功能通过快速复制已有的在线服务部署配置,根据实际需求修改配置,对在线服务快速添加新的部署。服务已部署成功。克隆服务功能仅支持复制已有推理服务的部署,不支持复制服务的运行状态或历史数据。克隆后的服务需要重新部署,可能会占用新的资源配额。不支持跨区域克隆并快速部署新的在线服务。登录ModelArts管理控制台,在左侧菜单栏中选 - [修改在线服务配置](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0025.md): 对于已部署的服务,您可以修改服务的基本信息以匹配业务变化,实现服务升级。您可以通过服务管理页面修改服务的基本信息。服务已部署成功,“部署中”的服务不支持修改服务信息进行升级。服务升级关系着业务实现,不当的升级操作会导致升级期间业务中断的情况,请谨慎操作。登录ModelArts管理控制台,在左侧菜单栏中选择模型推理 > 在线推理,进入在线服 - [修改在线服务名称](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0101.md): 对于已创建的在线服务,您可以在线修改服务的名称,便于管理,实现服务升级。在线服务的状态处于部署中、停止中、升级中、删除中状时,不支持修改在线服务名称。修改服务名称后,仅对重启、新增部署等操作产生的新Pod生效,存量Pod保持不变。例如:修改服务名称后重启服务,在AOM以service_name或task_name维度查看新上报的容器指标。 - [导出在线推理的服务列表](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0105.md): 在使用ModelArts推理服务过程中,用户经常需要对服务列表进行管理和记录。用户可以通过在线推理服务列表页的导出功能,导出全部或指定的记录,快速生成Excel文件,从而提高工作效率和数据管理的便捷性。无登录ModelArts管理控制台,在左侧菜单栏中选择模型推理 > 在线推理,进入在线推理的服务列表页面。在服务列表右上角,单击导出,按需 - [异步推理](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0079.md): 在AI生成内容(AIGC)及复杂计算任务(如高清图像处理、长视频解析)广泛应用的业务场景中,传统同步请求-响应模式面临显著挑战:客户端需长时间等待任务完成易导致网络超时中断,服务端则因瞬时高并发请求承受巨大压力,且计算资源(如GPU)因同步等待产生空闲浪费。此类场景下,如何实现任务提交与结果获取的解耦,同时保障系统高可用性与资源高效利用成 - [调度策略](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0088.md): 在华为云的资源管理场景中,用户在配置推理服务时,可能会遇到需要优化调度策略以提高服务性能或资源利用率的情况。例如,当用户希望确保服务的高可用性时,通常会选择高可用调度策略,这要求不同部署副本的Pod尽量均匀分布到不同节点上,以减少单点故障的影响。然而,在实际操作中,用户可能会发现现有的调度策略配置选项不够灵活,无法满足特定的业务需求,如在 - [流量策略](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0089.md): ModelArts在线推理服务提供多部署流量调度能力,针对同一个在线推理服务下创建的多个部署实例,可为每个部署配置独立的流量权重值,平台按照各部署权重相对占比,自动将推理服务调用请求按比例进行分流分发,实现模型灰度发布、A/B 测试、故障切流、流量按需分配等的精细化运维管控。针对已有部署配置的在线服务,可以通过修改流量权重操作,设置当前服 - [存储挂载](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0090.md): 在 ModelArts 推理部署场景中,文件存储挂载是解决大模型存储、数据共享、加载加速的核心能力,适配高性能、高稳定、高吞吐的推理业务需求,核心适用场景如下:超大模型存储与加载:大语言模型、多模态模型等体积可达数十 GB 至 TB 级,无法通过容器镜像内置模型,需借助挂载存储统一存储模型文件,供推理实例直接读取,避免镜像臃肿与部署超时。 - [密钥挂载](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0091.md): 在ModelArts推理服务场景中,密钥挂载是通过Secret机制实现敏感信息加密存储与安全注入的能力,避免明文存放账号密码、AK/SK、数据库密钥、证书等敏感数据,确保推理服务运行过程中的数据安全与权限隔离。典型适用场景包括:模型 / 存储访问认证推理服务需要访问OBS、SFS Turbo等资源,通过密钥挂载注入AK/SK、访问密钥、签 - [智能路由策略](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0092.md): 在大规模在线推理场景中,请求分发策略会直接影响到响应时延、负载均衡、会话连续性、服务稳定性等。ModelArts推理在线服务提供了智能路由策略,可根据业务诉求灵活分发流量。适用于以下典型场景:负载均衡与流量打散高并发场景下,需将请求均匀分发到多个实例,避免单点过载、减少排队延迟,提升整体吞吐。高并发场景下,需将请求均匀分发到多个实例,避免 - [基于多角色部署的弹性降级(降P补D)](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0106.md): 降P补D是ModelArts推理部署平台面向PD分离部署场景提供的一种弹性降级调度能力。在大模型推理的PD分离部署中,P(Prefill)负责请求的预处理与首token计算,D(Decode)负责后续token的逐步解码生成。在xP1D等部署形态中,D的角色至关重要,一旦D故障且资源不足以恢复全部负载,业务将完全中断。降P补D的核心思路: - [在线服务优雅停机](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0094.md): 推理在线服务的优雅停机用于服务下线、升级、缩容、故障迁移等场景,目的是平滑结束在途请求、释放资源、保存状态、避免强制中断,保障业务连续性与数据完整性。典型适用场景:服务正常下线:业务迭代、版本更替、资源回收时,等待当前推理请求完成后再终止实例,避免客户端报错;滚动升级:更新模型或镜像时,逐步优雅下线旧实例、拉起新实例,实现零中断平滑升级; - [在线服务部署滚动升级](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0102.md): 滚动升级是ModelArts推理在线服务平滑迭代、无中断更新的核心能力,通过逐步替换部署副本,实现服务版本升级、镜像更新、模型替换、配置变更等操作,全程业务无感知、请求不中断。典型适用场景:模型版本迭代:大模型 / 小模型更新权重、微调后升级,避免服务整体下线;镜像更新:修复漏洞、优化性能、升级依赖包,零停机替换实例;配置变更:调整资源规 - [在线服务健康检查](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0095.md): ModelArts 在线服务健康检查是保障AI推理服务稳定运行、高可用交付的核心能力,通过对服务实例的启动状态、就绪状态、运行健康状态进行周期性探测,自动识别异常实例并触发修复或隔离操作,避免无效流量转发、服务卡顿、进程崩溃等问题,适用于以下核心场景:模型加载慢场景:大模型(如千亿参数LLM、多模态模型)部署时加载耗时久,避免服务状态显示 - [在线服务故障自动重启](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0029.md): 当检测到NPU卡、交换机、硬件等出现故障时,会自动触发故障节点上的业务重新调度,提升了推理在线服务的恢复速度。部分能力仅Snt9b、Snt9b2系列资源支持,如NPU卡故障。用户可以在配置在线服务的部署信息时,在更多配置中可以看到故障自动重启参数,勾选即可。部分能力仅Snt9b、Snt9b2系列资源支持。 - [在线服务故障自动重建](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0096.md): 自动重建是保障在线推理服务高可用、自愈、稳定运行的核心能力,适用于以下场景:容器、进程意外崩溃,业务快速恢复推理实例(Pod)因进程异常、内存溢出(OOM,Out of Memory)、依赖缺失、代码 Bug 等意外退出时,平台自动重建Pod并重新拉起推理服务,无需人工介入,减少业务中断时间。推理实例(Pod)因进程异常、内存溢出(OOM - [在线服务智能运维(HRA插件)](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0097.md): 智能运维(HRA 插件)核心解决大模型部署 P/D 配比不合理问题,适配大规模推理、跨节点部署、负载均衡等高复杂度场景,典型适用场景如下:大模型高并发推理场景大模型推理分为推理单元(P)和解码单元(D),业务高峰期易出现 P/D 配比失衡,导致资源利用率低、响应延迟高、吞吐量不足。智能运维通过仿真算法给出最优配比建议,手动调整后可提升资源 - [查看在线服务日志](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0020.md): ModelArts推理服务中提供查看实时日志的能力,也支持日志对接LTS服务。可用于调试模型启动状态、核查请求出入参、定位运行故障,也能核验业务逻辑与分析推理性能问题。参考推理在线服务单机部署创建一个在线服务,“高级配置”不勾选“日志对接LTS”。不勾选日志对接LTS服务进入运行中后,单击服务名称进入服务详情页面,切换到日志页签,选择实例 - [查看在线服务的事件](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0019.md): 服务的(从用户可看见部署服务任务开始)整个生命周期中,每一个关键事件点在系统后台均有记录,用户可随时在对应服务的详情页面进行查看。方便用户更清楚的了解服务部署和运行过程,遇到任务异常时,更加准确的排查定位问题。支持查看的事件类型包括以下两种:服务事件:记录了服务层面的运行状态和操作。Pod事件:记录了底层容器的生命周期和异常情况。登录Mo - [在ModelArts平台查看在线服务性能指标](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0027.md): ModelArts 推理监控是针对在线推理服务的全链路可观测能力,覆盖资源层、网络层、请求层、模型推理层四大维度,实时采集服务运行数据并可视化呈现,支持性能诊断、异常告警、容量规划,保障 AI 服务稳定高效运行。支持的监控维度和指标分类如表1所示。权限配置:用户需要配置AOM只读权限。如果使用角色与策略权限,请配置AOM ReadOnly - [在AOM平台查看在线服务性能指标](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0026.md): ModelArts推理服务相关的所有监控数据底层全量上报到 AOM;ModelArts控制台上只展示常用子集,精细运维、告警、自定义大盘必须进AOM。AOM是云上应用的一站式立体化运维管理平台,实时监控应用及云资源,可以对ModelArts在线服务和模型负载运行状态进行日常监控。您可以通过AOM管理控制台,直观地查看ModelArts在线 - [使用CTS审计推理服务操作](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0103.md): ModelArts支持对接云审计CTS服务,通过云审计服务,您可以记录与ModelArts相关的操作事件,便于日后的查询、审计和回溯。已开通云审计服务。详细操作请参见《云审计服务用户指南》。登录CTS云审计服务控制台。在管理控制台左上角单击图标,选择目标区域。在左侧导航栏,单击事件列表,进入事件列表信息页面。用户每次登录云审计控制台时,控 - [推理部署使用场景](https://support.huaweicloud.com/inference-modelarts/inference-modelarts-0001.md): 推理部署(Inference Deployment)是人工智能和机器学习领域中的一个重要环节。推理部署是指将训练好的机器学习或深度学习模型,从开发环境转移到实际生产环境中,使其能够对新的、未见过的数据进行预测或推理的过程,确保模型在实际应用中高效、稳定运行,同时满足实时性和资源限制的要求。简单来说,就是让模型在实际应用中发挥作用,根据输入 - [创建模型不同方式的场景介绍](https://support.huaweicloud.com/inference-modelarts/inference-modelarts-0003.md): AI开发和调优往往需要大量的迭代和调试,数据集、训练代码或参数的变化都可能会影响模型的质量,如不能统一管理开发流程元数据,可能会出现无法重现最优模型的现象。ModelArts的模型可导入所有训练生成的元模型、上传至对象存储服务(OBS)中的元模型和容器镜像中的元模型,可对所有迭代和调试的模型进行统一管理。创建模型、管理模型版本等功能目前是 - [从训练作业中导入模型文件创建模型](https://support.huaweicloud.com/inference-modelarts/inference-modelarts-0006.md): 在ModelArts中创建训练作业,并完成模型训练,在得到满意的模型后,可以将训练后得到的模型导入至模型管理,方便统一管理,同时支持将模型快速部署上线为服务。针对使用订阅算法的训练作业,无需推理代码和配置文件,其生成的模型可直接导入ModelArts。使用容器化部署,导入的元模型有大小限制,详情请参见导入模型对于镜像大小限制。请确保训练作 - [从OBS中导入模型文件创建模型](https://support.huaweicloud.com/inference-modelarts/inference-modelarts-0008.md): 针对使用常用框架完成模型开发和训练的场景,可以将您的模型导入至ModelArts中,创建为模型,并进行统一管理。针对创建模型的模型,需符合ModelArts的模型包规范,推理代码和配置文件也需遵循ModelArts的要求,详细说明请参见模型包结构介绍、模型配置文件编写说明、模型推理代码编写说明。使用容器化部署,导入的元模型有大小限制,详情 - [从容器镜像中导入模型文件创建模型](https://support.huaweicloud.com/inference-modelarts/inference-modelarts-0009.md): 针对ModelArts目前不支持的AI引擎,您可以通过自定义镜像的方式将编写的模型导入ModelArts。关于自定义镜像规范和说明,请参见模型镜像规范。使用容器化部署,导入的元模型有大小限制,详情请参见导入模型对于镜像大小限制。当自定义镜像更新以后,需要同步更新镜像版本号,或者使用该镜像创建模型时打开镜像复制功能,否则会存在使用新创建的模 - [从AI Gallery订阅模型](https://support.huaweicloud.com/inference-modelarts/inference-modelarts-0011.md): 在AI Gallery中,支持订阅官方发布或者他人分享的模型,订阅后的模型,可推送至ModelArts模型管理中,进行统一管理。订阅模型与云服务订阅模型的区别:在管理控制台,模型管理所在位置不同。订阅模型统一管理在模型管理>订阅模型页面中,而云服务订阅模型管理在模型管理>云服务订阅模型页面中。模型来源不同。订阅模型,模型来源于AI Gal - [模型包结构介绍](https://support.huaweicloud.com/inference-modelarts/inference-modelarts-0055.md): 创建模型时,如果是从OBS中导入元模型,则需要符合一定的模型包规范。模型包规范适用于单模型场景,如果是多模型场景(例如含有多个模型文件)推荐使用自定义镜像方式。ModelArts推理平台不支持的AI引擎,推荐使用自定义镜像方式。请参考模型镜像规范和制作自定义镜像用于推理,制作自定义镜像。更多的自定义脚本代码示例,请参考自定义脚本代码示例。 - [模型配置文件编写说明](https://support.huaweicloud.com/inference-modelarts/inference-modelarts-0056.md): 模型开发者发布模型时需要编写配置文件config.json。模型配置文件描述模型用途、模型计算框架、模型精度、推理代码依赖包以及模型对外API接口。配置文件为JSON格式,参数说明如表1所示。如下代码以TensorFlow引擎为例,您可以根据实际使用的引擎类型修改model_type参数后使用。模型输入key:imagesvalue:图片 - [模型推理代码编写说明](https://support.huaweicloud.com/inference-modelarts/inference-modelarts-0057.md): 本章节介绍了在ModelArts中模型推理代码编写的通用方法及说明,针对常用AI引擎的自定义脚本代码示例(包含推理代码示例),请参见自定义脚本代码示例。本文在编写说明下方提供了一个TensorFlow引擎的推理代码示例以及一个在推理脚本中自定义推理逻辑的示例。ModelArts推理因API网关(APIG)的限制,模型单次预测的时间不能超过 - [自定义引擎创建模型规范](https://support.huaweicloud.com/inference-modelarts/inference-modelarts-0128.md): 使用自定义引擎创建模型,用户可以通过选择自己存储在SWR服务中的镜像作为模型的引擎,指定预先存储于OBS服务中的文件目录路径作为模型包来创建模型,轻松地应对ModelArts平台预置引擎无法满足个性化诉求的场景。ModelArts将自定义引擎类型的模型部署为服务时,会先将模型相关的SWR镜像下载至集群中,用“uid=1000, gid=1 - [自定义脚本代码示例](https://support.huaweicloud.com/inference-modelarts/inference-modelarts-0078.md): 从OBS中导入模型文件创建模型时,模型文件包需符合ModelArts的模型包规范,推理代码和配置文件也需遵循ModelArts的要求。本章节提供针对常用AI引擎的自定义脚本代码示例(包含推理代码示例)。模型推理代码编写的通用方法及说明请见模型推理代码编写说明。TensorFlow存在两种接口类型,keras接口和tf接口,其训练和保存模型 - [实时推理的部署及使用流程](https://support.huaweicloud.com/inference-modelarts/inference-modelarts-0097.md): 在线服务(旧版)已下线,届时将为您上线全新升级的在线服务,支持多机多卡等多种全新体验。在创建完模型后,可以将模型部署为一个在线服务。当在线服务的状态处于运行中,则表示在线服务已部署成功,部署成功的在线服务,将为用户提供一个可调用的API,此API为标准RESTful API。访问在线服务时,您可以根据您的业务需求,分别确认使用何种认证方式 - [部署模型为在线服务](https://support.huaweicloud.com/inference-modelarts/inference-modelarts-0018.md): 在线推理是指利用部署在远程服务器或云平台上的 AI/机器学习模型,通过网络接收用户输入的数据或问题,并实时返回处理结果或决策的过程。在线推理是一种基于云端模型的实时交互式服务,提供低延迟、高可用性的 AI 智能服务,让用户无需本地部署复杂模型即可获得强大的分析、预测、理解等能力,适用于需要快速响应和交互的场景。ModelArts提供在线部 - [通过Token认证的方式访问在线服务](https://support.huaweicloud.com/inference-modelarts/inference-modelarts-0023.md): Token在计算机系统中代表令牌(临时)的意思。拥有Token就代表拥有某种权限。Token认证就是在调用API的时候将Token加到请求消息头,从而通过身份认证,获得操作API的权限。如果在线服务的状态处于运行中,则表示在线服务已部署成功,部署成功的在线服务,将为用户提供一个可调用的API,此API为标准RESTful API。通过To - [通过AK/SK认证的方式访问在线服务](https://support.huaweicloud.com/inference-modelarts/inference-modelarts-0024.md): AK/SK认证是华为云ModelArts平台用于身份验证的一种方式,其中AK(Access Key)和SK(Secret Key)是用于访问华为云服务的密钥。如果在线服务的状态处于运行中,则表示在线服务已部署成功。部署成功的在线服务,将为用户提供一个可调用的API,此API为标准RESTful API。用户可以通过AK/SK签名认证方式调 - [通过APP认证的方式访问在线服务](https://support.huaweicloud.com/inference-modelarts/inference-modelarts-0025.md): 部署在线服务支持开启APP认证,即ModelArts会为服务注册一个支持APP认证的接口,为此接口配置APP授权后,用户可以使用授权应用的AppKey+AppSecret或AppCode调用该接口。针对在线服务的APP认证,具体操作流程如下。开启支持APP认证功能:开启支持APP认证功能,选择已有APP应用或者创建新的APP应用。在线服务 - [通过公网访问通道的方式访问在线服务](https://support.huaweicloud.com/inference-modelarts/inference-modelarts-0105.md): ModelArts推理默认使用公网访问在线服务,您可以使用标准的HTTPS协议或WebSocket协议访问在线服务。在线服务部署成功后,将为用户提供一个可调用的API,此API为标准RESTful API。您可以在服务详情页面,调用指南页签中查看API接口公网地址。调用API访问在线服务时,对预测请求体大小和预测时间有限制:请求体的大小不 - [通过VPC访问通道的方式访问在线服务](https://support.huaweicloud.com/inference-modelarts/inference-modelarts-0134.md): 如果您希望在自己账号的VPC内部节点访问ModelArts推理的在线服务,可以使用VPC访问通道的功能,用户通过在自己账号的指定VPC下创建终端节点,连接到ModelArts的终端节点服务,即可在自己的VPC节点中访问在线服务。使用VPC访问通道访问在线服务适用于需要高安全性和低延迟的场景,例如内部系统之间的通信。调用API访问在线服务时 - [通过VPC高速访问通道的方式访问在线服务](https://support.huaweicloud.com/inference-modelarts/inference-modelarts-0099.md): 访问在线服务的实际业务中,用户可能会存在如下需求:高吞吐量、低时延TCP或者RPC请求因此,ModelArts提供了VPC直连的高速访问通道功能以满足用户的需求。使用VPC直连的高速访问通道,用户的业务请求不需要经过推理平台,而是直接经VPC对等连接发送到实例处理,访问速度更快。此访问方式适用于需要高带宽和低延迟的场景,例如实时数据处理、 - [使用WebSocket协议的方式访问在线服务](https://support.huaweicloud.com/inference-modelarts/inference-modelarts-0106.md): WebSocket是一种网络传输协议,可在单个TCP连接上进行全双工通信,位于OSI模型的应用层。WebSocket协议在2011年由IETF标准化为RFC 6455,后由RFC 7936补充规范。Web IDL中的WebSocket API由W3C标准化。WebSocket使得客户端和服务器之间的数据交换变得更加简单,允许服务端主动向客 - [使用Server-Sent Events协议的方式访问在线服务](https://support.huaweicloud.com/inference-modelarts/inference-modelarts-0124.md): Server-Sent Events(SSE)是一种服务器向客户端推送数据的技术,它是一种基于HTTP的推送技术,服务器可以向客户端推送事件。这种技术通常用于实现服务器向客户端单向推送实时数据,例如实时新闻更新、股票价格等。SSE主要解决了客户端与服务器之间的单向实时通信需求(例如大模型回答的流式输出),相较于WebSocket(双向实时 - [将模型部署为批量推理服务](https://support.huaweicloud.com/inference-modelarts/inference-modelarts-0039.md): 批量推理将多个输入数据批量处理,一次性返回所有结果。ModelArts支持将模型部署为批量服务,批量服务可对批量数据进行推理,完成数据处理后自动停止。批量推理适用于对大量数据进行离线分析和处理的场景,如大数据分析、批量数据标注、模型评估等。本章节主要介绍如何在ModelArts部署模型为批量推理服务,并查看批量服务预测结果。在ModelA - [查看ModelArts模型详情](https://support.huaweicloud.com/inference-modelarts/inference-modelarts-0005.md): 当模型创建成功后,您可在模型列表页查看所有创建的模型。模型列表页包含以下信息。单击模型的“版本数量”,可查看版本列表信息。版本列表中包含以下信息。当模型创建成功后,您可以进入模型详情页查看模型的信息。登录ModelArts管理控制台,在左侧菜单栏中选择模型管理,进入自定义模型列表页面。单击目标模型名称,进入模型详情页面。您可以查看模型的基 - [查看ModelArts模型事件](https://support.huaweicloud.com/inference-modelarts/inference-modelarts-0118.md): 创建模型的(从用户可看见创建模型任务开始)过程中,每一个关键事件点在系统后台均有记录,用户可随时在对应模型的详情页面进行查看。方便用户更清楚地了解创建模型过程,遇到任务异常时,更加准确地排查定位问题。可查看的事件点包括:创建模型的过程中,关键事件支持手动/自动刷新。在ModelArts管理控制台的左侧导航栏中选择模型管理,在模型列表中,您 - [管理ModelArts模型版本](https://support.huaweicloud.com/inference-modelarts/inference-modelarts-0013.md): 为方便溯源和模型反复调优,在ModelArts中提供了模型版本管理的功能,您可以基于版本对模型进行管理。已在ModelArts中创建模型。在模型页面,单击操作列的创建新版本进入创建新版本页面,参数配置除版本外,将默认选择上一个版本的配置信息,您可以对参数配置进行修改,参数说明请参见创建模型。单击立即创建,完成新版本的创建操作。在模型管理页 - [发布ModelArts模型](https://support.huaweicloud.com/inference-modelarts/inference-modelarts-0014.md): 针对ModelArts中创建的模型,支持以下发布方式:发布至AI GalleryAI Gallery是在ModelArts的基础上构建的开发者生态社区,提供算法、模型、数据集等内容的共享,为高校科研机构、模型开发商、解决方案集成商、企业级个人开发者等群体,提供安全、开放的共享,加速AI资产的开发与落地。发布至AI Gallery的资产是免 - [查看在线服务详情](https://support.huaweicloud.com/inference-modelarts/inference-modelarts-0019.md): 当模型部署为在线服务成功后,您可以进入在线服务页面,来查看服务详情。登录ModelArts管理控制台,在左侧菜单栏中选择模型部署 > 在线服务,进入在线服务管理页面。单击目标服务名称,进入服务详情页面。您可以查看服务的名称、状态等信息,详情说明请参见表1。在线服务配置参数说明名称在线服务名称。状态在线服务当前状态。来源在线服务的来源。服务 - [查看在线服务的事件](https://support.huaweicloud.com/inference-modelarts/inference-modelarts-0119.md): 服务的(从用户可看见部署服务任务开始)整个生命周期中,每一个关键事件点在系统后台均有记录,用户可随时在对应服务的详情页面进行查看。方便用户更清楚地了解服务部署和运行过程,遇到任务异常时,更加准确地排查定位问题。可查看的事件点包括:服务部署和运行过程中,关键事件支持手动/自动刷新。在ModelArts管理控制台的左侧导航栏中选择模型部署 > - [管理在线服务生命周期](https://support.huaweicloud.com/inference-modelarts/inference-modelarts-0088.md): 您可以对处于运行完成、异常和停止状态的服务进行启动操作,部署中状态的服务无法启动。启动服务,当服务处于运行中状态后,ModelArts将开始计费。您可以通过如下方式启动服务:登录ModelArts管理控制台,在左侧菜单栏中选择模型部署,进入目标服务类型管理页面。您可以单击操作列的启动,启动服务。登录ModelArts管理控制台,在左侧菜单 - [修改在线服务配置](https://support.huaweicloud.com/inference-modelarts/inference-modelarts-0087.md): 对于已部署的服务,您可以修改服务的基本信息以匹配业务变化,更换模型的版本号,实现服务升级。您可以通过如下两种方式修改服务的基本信息:方式一:通过服务管理页面修改服务信息方式二:通过服务详情页面修改服务信息服务已部署成功,“部署中”的服务不支持修改服务信息进行升级。服务升级关系着业务实现,不当的升级操作会导致升级期间业务中断的情况,请谨慎操 - [在云监控平台查看在线服务性能指标](https://support.huaweicloud.com/inference-modelarts/modelarts_23_0186.md): SYS.ModelArts为使用户更好地掌握自己的ModelArts在线服务和对应模型负载的运行状态,云服务平台提供了云监控。您可以使用该服务监控您的ModelArts在线服务和对应模型负载,执行自动实时监控、告警和通知操作,帮助您更好地了解服务和模型的各项性能指标。通过设置ModelArts在线服务和模型负载告警规则,用户可自定义监控目 - [集成在线服务API至生产环境中应用](https://support.huaweicloud.com/inference-modelarts/inference-modelarts-0028.md): 针对已完成调测的API,可以将在线服务API集成至生产环境中应用。确保在线服务一直处于运行中状态,否则会导致生产环境应用不可用。ModelArts在线服务提供的API是一个标准的RESTful API,可使用HTTPS协议访问。ModelArts提供了SDK用于调用在线服务API,SDK调用方式请参见《SDK参考》>“场景1:部署在线服务 - [设置在线服务故障自动重启](https://support.huaweicloud.com/inference-modelarts/inference-modelarts-0135.md): 当系统检测到Snt9b硬件故障时,自动复位Snt9b芯片并重启推理在线服务,提升了推理在线服务的恢复速度。仅支持使用Snt9b资源的同步在线服务。只支持针对整节点资源复位,请确保部署的在线服务为8*N卡规格,请谨慎评估对部署在该节点的其他服务的影响。用户可以在部署在线服务任务时,勾选高级选项的现在配置,可以看到故障自动重启参数,打开开关即 - [查看批量服务详情](https://support.huaweicloud.com/inference-modelarts/inference-modelarts-0126.md): 当模型部署为批量服务成功后,您可以进入批量服务页面,来查看服务详情。登录ModelArts管理控制台,在左侧菜单栏中选择模型部署>批量服务,进入批量服务管理页面。单击目标服务名称,进入服务详情页面。您可以查看服务的名称、状态等信息,详情说明请参见表1。批量服务参数参数说明名称批量服务名称。服务ID批量服务的ID。状态批量服务当前状态。任务 - [查看批量服务的事件](https://support.huaweicloud.com/inference-modelarts/inference-modelarts-0131.md): 服务的(从用户可看见部署服务任务开始)整个生命周期中,每一个关键事件点在系统后台均有记录,用户可随时在对应服务的详情页面进行查看。方便用户更清楚地了解服务部署和运行过程,遇到任务异常时,更加准确地排查定位问题。可查看的事件点包括:服务部署和运行过程中,关键事件支持手动/自动刷新。在ModelArts管理控制台的左侧导航栏中选择模型部署 > - [管理批量服务生命周期](https://support.huaweicloud.com/inference-modelarts/inference-modelarts-0132.md): 您可以对处于运行完成、异常和停止状态的服务进行启动操作,部署中状态的服务无法启动。启动服务,当服务处于运行中状态后,ModelArts将开始计费。您可以通过如下方式启动服务:登录ModelArts管理控制台,在左侧菜单栏中选择模型部署,进入目标服务类型管理页面。您可以单击操作列的启动,启动服务。登录ModelArts管理控制台,在左侧菜单 - [修改批量服务配置](https://support.huaweicloud.com/inference-modelarts/inference-modelarts-0133.md): 对于已部署的服务,您可以修改服务的基本信息以匹配业务变化,更换模型的版本号,实现服务升级。您可以通过如下两种方式修改服务的基本信息:方式一:通过服务管理页面修改服务信息方式二:通过服务详情页面修改服务信息服务已部署成功,“部署中”的服务不支持修改服务信息进行升级。服务升级关系着业务实现,不当的升级操作会导致升级期间业务中断的情况,请谨慎操 - [旧版在线服务迁移至新版在线服务](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0080.md): ModelArts在线服务(旧版)即将下线,对于AI模型部署场景,如果用户当前使用ModelArts在线服务(旧版)部署的服务,会因旧版服务即将下线导致服务中断。ModelArts推出的新版在线服务支持全形态大模型、分布式部署等能力,提供更全面的指标监控和更流畅的运维体验。因此,如何将旧版服务平滑迁移至新版服务成为用户普遍诉求。本章节提供 ## 模型评测 - [实时比对](https://support.huaweicloud.com/model-evaluation-modelarts/model-evaluation-modelarts-0001.md): 在AI工程化落地过程中,面对众多的基础大模型和微调版本,如何选择“最合适”的模型是关键难题。模型实时比对功能提供了一个直观的比对平台,允许用户在完全一致的输入条件下,对不同模型进行横向评测。核心作用与价值:基础大模型选型:在项目初期,比对不同架构模型(例如DeepSeek、Qwen3、GLM等)的表现,快速锁定适合业务场景的基模。微调效果 - [模型评测功能说明](https://support.huaweicloud.com/model-evaluation-modelarts/model-evaluation-modelarts-0003.md): 模型评测是测试和衡量大模型在现实世界情境中表现如何的过程,是了解大模型性能的关键。效果优秀的模型需要保证模型拥有良好的泛化能力,即模型不仅要在已给定的数据(训练数据)上表现良好,还要能够在未见过的数据上也达到类似的效果。为了实现这一目标,模型评测是必不可少的环节。在ModelArts模型的开发流程中,模型评测是在完成模型训练后,对尚未投入 - [创建模型评测任务](https://support.huaweicloud.com/model-evaluation-modelarts/model-evaluation-modelarts-0005.md): 已注册华为账号并开通华为云,进行了实名认证,且在使用ModelArts前检查账号状态,账号不能处于欠费或冻结状态。注册华为账号并开通华为云进行实名认证注册华为账号并开通华为云进行实名认证配置委托访问授权ModelArts使用过程中涉及OBS等服务交互,首次使用ModelArts需要用户配置委托授权,允许访问这些依赖服务。ModelArts - [查看模型评测报告](https://support.huaweicloud.com/model-evaluation-modelarts/model-evaluation-modelarts-0006.md): 评测任务创建成功后,可以查看大模型评测任务报告,具体步骤如下:前往ModelArts管理控制台。在控制台左侧导航栏中选择“模型评测 > 评测任务”。单击操作列“评测报告”,在“评测报告”页面,可以查看评测任务的基本信息及评测概览。其中,各评测指标说明详见大模型评测指标说明。其中,各评测指标说明详见大模型评测指标说明。导出评测报告。在评测报 - [预置评测集与评测模板](https://support.huaweicloud.com/model-evaluation-modelarts/model-evaluation-modelarts-0008.md): 功能介绍预置评测集是一组经过精心设计、标注和标准化的数据样本,专门用于测试、评估和量化人工智能模型在特定任务上的表现。本次支持的预置评测集名称列表,和评测集描述见表1 预置评测集列表。预置评测集列表名称评测集描述MMLU-ProMMLU是人工智能领域最有影响力的大模型测评基准之一,涵盖了基础数学、计算机科学、法律、历史等57项子任务,用于 - [管理评测任务](https://support.huaweicloud.com/model-evaluation-modelarts/model-evaluation-modelarts-0009.md): 在评测任务列表中,任务创建者可以对任务进行克隆(复制评测任务)、启动(重启评测任务)和删除操作。前往ModelArts管理控制台。在左侧导航栏中选择“模型评测 > 评测任务”,可进行如下操作:克隆。单击操作列的“克隆”,可以复制当前状态为“已完成”评测任务。启动。单击操作列的“启动”,可以重启状态为“已停止”的评测任务。删除。单击操作列的 - [在AOM查看模型评测监控告警](https://support.huaweicloud.com/model-evaluation-modelarts/model-evaluation-modelarts-0010.md): 告警,是一种基于预设规则对监控指标、日志数据进行实时评估,并在异常发生时自动触发告警事件的自动化机制。它将分散的监控数据转化为明确的、可处理的事件,是连接“数据观测”与“运维行动”的关键桥梁,帮助您从被动响应故障转变为主动管理风险。AOM提供告警监控能力,具体功能请参见AOM告警监控概述。当任务执行失败时,系统将触发告警。您可以在AOM控 ## 模型调用 - [快速调用预置模型](https://support.huaweicloud.com/model-call-modelarts/model-call-modelarts-0001.md): ModelArts平台集成了主流第三方模型如DeepSeek系列、Qwen系列等模型,提供了兼容OpenAI的API及全链路模型服务。同时支持这些模型在ModelArts平台上一键部署。本文介绍ModelArts支持的预置模型,以及如何一键部署模型并调用。预置模型、模型一键部署功能仅“西南-贵阳一”、“华北-北京四”和“华南-广州”区域的 - [文本生成](https://support.huaweicloud.com/model-call-modelarts/model-call-modelarts-0002.md): 在开发智能应用的过程中,开发者经常需要处理文本理解和生成的任务,但传统的文本处理方法往往效率低下且效果不佳。语言大模型具备文本理解和文本对话的能力,如当您传入文本信息时,大模型可以理解信息,并结合这些信息进行回复。然而,如何高效地利用这些大模型成为了一个挑战。通过这篇教程,您可以学习到如何使用模型服务API,来调用模型理解文本,生成文本内 - [图像理解](https://support.huaweicloud.com/model-call-modelarts/model-call-modelarts-0003.md): 在多媒体内容处理领域,用户经常需要对图片或视频中的视觉信息进行分析和理解。然而,传统的处理方法往往需要复杂的图像处理技术和算法,这不仅增加了开发成本,也提高了技术门槛。部分大模型具备视觉理解能力,如当您传入图片或视频时,大模型可以理解图片或视频里的视觉信息,并结合这些信息完成如描述其中的物体等视觉相关任务。如何利用这些大模型简化多媒体内容 - [模型API调用指南](https://support.huaweicloud.com/model-call-modelarts/model-call-modelarts-0004.md): ModelArts平台提供功能丰富的在线推理能力,支持用户选取模型在专属实例上进行自部署。本文介绍对话Chat相关API的调用规范。对于支持图片上传的模型,单个图片文件的大小不超过10MB。如果以Base64编码形式上传图片,需确保编码后的图片小于10MB。思维链(Chain of Thought,简称CoT)是指模型在解决复杂问题时,能 - [模型资产管理](https://support.huaweicloud.com/model-call-modelarts/model-call-modelarts-0005.md): 模型资产管理是ModelArts平台的核心模块,负责统一管理平台提供的预置模型和我的模型。本模块旨在为下游的“模型精调”和“模型部署”提供标准化的输入对象。预置模型:ModelArts预置的热门模型,方便您快速完成模型部署。我的模型:本地导入模型或通过平台完成模型预训练、模型精调后生成的模型。模型资产可供用户做模型部署和模型微调。在模型资 ## 镜像管理 - [ModelArts镜像功能介绍](https://support.huaweicloud.com/docker-modelarts/modelarts_23_0084.md): 在AI业务开发过程中,开发人员经常遇到环境依赖复杂、开发环境脆弱以及多轨切换困难等问题,这些问题严重影响了开发效率和模型迭代速度。如何解决这些问题,确保开发环境的稳定性和可移植性?ModelArts支持通过容器镜像的方式将运行环境进行固化,不仅能够进行依赖管理,而且可以方便地完成工作环境切换。配合ModelArts提供的云化容器资源使用, - [ModelArts预置镜像](https://support.huaweicloud.com/docker-modelarts/docker-modelarts_6030.md): 在使用ModelArts进行机器学习开发时,用户经常需要根据不同的框架配置环境,这可能导致配置复杂度增加和使用问题。如何帮助减少配置复杂度和使用问题?ModelArts提供了基于不同框架的预置镜像,您可以在ModelArts管理控制台创建Notebook、模型训练或在线推理时,直接选择这些预置镜像。通过使用预置镜像,用户可以快速启动Not - [ModelArts统一镜像](https://support.huaweicloud.com/docker-modelarts/docker-modelarts_6022.md): 在使用ModelArts进行机器学习开发时,用户经常需要根据不同的框架配置环境,这可能导致配置复杂度增加和使用问题。如何帮助减少配置复杂度和使用问题?ModelArts将基于不同框架的统一镜像直接上传到容器镜像服务SWR,用户可以使用这些镜像地址在ModelArts管理控制台注册镜像,或通过docker pull命令拉取,快速用于创建No - [Notebook的自定义镜像制作方法](https://support.huaweicloud.com/docker-modelarts/docker-modelarts_6023.md): 在使用ModelArts进行机器学习开发时,开发者经常需要根据项目需求对开发环境进行定制化改造,例如安装、升级或卸载特定的软件包。然而,由于Notebook实例运行时缺乏root权限,导致无法在预置的开发环境镜像中直接安装需要root权限的软件,这给开发工作带来了不便。如何解决这一权限限制,以实现开发环境的灵活定制?用户可以利用Model - [在Notebook中通过镜像保存功能制作自定义镜像](https://support.huaweicloud.com/docker-modelarts/docker-modelarts_0008.md): 在数据科学项目开发中,开发人员经常需要在不同的环境中复现相同的运行环境,以确保代码的可移植性和一致性。然而,手动配置环境不仅耗时,而且容易出错。如何解决这一问题,确保开发环境的一致性和效率?您可以将Notebook实例的运行环境(包括安装的软件、依赖包和配置)保存为一个容器镜像。这个镜像可以用于创建新的Notebook实例,确保新实例具有 - [在ECS上构建自定义镜像并在Notebook中使用](https://support.huaweicloud.com/docker-modelarts/docker-modelarts_0011-0.md): 为了满足用户的定制需求,用户可以使用ModelArts提供的基础镜像或第三方的镜像来编写Dockerfile,在ECS服务器上构建出完全适合自己的镜像并注册到SWR服务,用以创建新的开发环境,满足自己的业务需求。准备一台Linux服务器,本文以ECS服务器为例。在ECS中构建自定义镜像(本文提供了Dockfile样例文件)。将构建的镜像推 - [训练作业的自定义镜像制作流程](https://support.huaweicloud.com/docker-modelarts/develop-modelarts-10079.md): 如果您已经在本地完成模型开发或训练脚本的开发,且您使用的AI引擎是ModelArts不支持的框架。您可以制作自定义镜像,并上传至SWR服务。您可以在ModelArts使用此自定义镜像创建训练作业,使用ModelArts提供的资源训练模型。基础镜像:镜像制作的一个基本概念,您可以在基础镜像上构建业务镜像。基础镜像可以是ModelArts预置 - [使用预置镜像制作自定义镜像用于训练模型](https://support.huaweicloud.com/docker-modelarts/docker-modelarts_0118.md): 如果先前基于预置框架且通过指定代码目录和启动文件的方式来创建的训练作业;但是随着业务逻辑的逐渐复杂,您期望可以基于预置框架修改或增加一些软件依赖的时候,可以使用预置框架构建自定义镜像,即在创建训练作业页面选择预置框架名称后,在预置框架版本下拉列表中选择“自定义”。该方式的训练流程与直接基于预置框架创建的训练作业相同,例如:系统会自动注入一 - [已有镜像迁移至ModelArts用于训练模型](https://support.huaweicloud.com/docker-modelarts/docker-modelarts_0029.md): 本地已有镜像,需要做云上适配,用于ModelArts模型训练。参考如下Dockerfile,修改已有镜像,使其符合模型训练的自定义镜像规范。FROM {已有镜像} USER root # 如果已存在 gid = 100 用户组,则删除 groupadd 命令。 RUN groupadd ma-group -g 100 # 如果已存在 - [从0制作自定义镜像用于创建训练作业(Pytorch+Ascend)](https://support.huaweicloud.com/docker-modelarts/docker-modelarts_6031.md): 本章节介绍如何从0到1制作镜像,并使用该镜像在ModelArts平台上进行训练。镜像中使用的AI引擎是PyTorch,训练使用的资源是专属资源池的Ascend芯片。本示例使用Linux x86_64架构的主机,操作系统ubuntu-18.04,通过编写Dockerfile文件制作自定义镜像。目标:构建安装如下软件的容器镜像,并在Model - [从0制作自定义镜像用于创建训练作业(PyTorch+CPU/GPU)](https://support.huaweicloud.com/docker-modelarts/docker-modelarts-0097.md): 本章节介绍如何从0到1制作镜像,并使用该镜像在ModelArts平台上进行训练。镜像中使用的AI引擎是PyTorch,训练使用的资源是CPU或GPU。本实践教程仅适用于新版训练作业。本示例使用Linux x86_64架构的主机,操作系统ubuntu-18.04,通过编写Dockerfile文件制作自定义镜像。目标:构建安装如下软件的容器镜 - [从0制作自定义镜像用于创建训练作业(MPI+CPU/GPU)](https://support.huaweicloud.com/docker-modelarts/docker-modelarts-0105.md): 本章节介绍如何从0到1制作镜像,并使用该镜像在ModelArts平台上进行训练。镜像中使用的AI引擎是MPI,训练使用的资源是CPU或GPU。本实践教程仅适用于新版训练作业。本示例使用Linux x86_64架构的主机,操作系统ubuntu-18.04,通过编写Dockerfile文件制作自定义镜像。目标:构建安装如下软件的容器镜像,并在 - [从0制作自定义镜像用于创建训练作业(Tensorflow+GPU)](https://support.huaweicloud.com/docker-modelarts/docker-modelarts-0145.md): 本章节介绍如何从0到1制作镜像,并使用该镜像在ModelArts平台上进行训练。镜像中使用的AI引擎是Tensorflow,训练使用的资源是GPU。本实践教程仅适用于新版训练作业。本示例使用Linux x86_64架构的主机,操作系统ubuntu-18.04,通过编写Dockerfile文件制作自定义镜像。目标:构建安装如下软件的容器镜像 - [模型的自定义镜像制作流程](https://support.huaweicloud.com/docker-modelarts/modelarts_23_0219.md): 如果您使用了ModelArts不支持的AI引擎开发模型,也可通过制作自定义镜像,导入ModelArts创建为模型,并支持进行统一管理和部署为服务。基础镜像:镜像制作的一个基本概念,您可以在基础镜像上构建业务镜像。基础镜像可以是ModelArts预置镜像或统一镜像。场景一:预置镜像的环境软件满足要求,只需要导入模型包,就能用于创建模型,通过 - [在Notebook中通过镜像保存功能制作自定义镜像用于推理](https://support.huaweicloud.com/docker-modelarts/docker-modelarts_6002.md): 本文详细介绍如何将本地已经制作好的模型包导入ModelArts的开发环境Notebook中进行调试和保存,然后将保存后的镜像部署到推理。本案例仅适用于华为云北京四和上海一站点。操作流程如下:步骤一:在Notebook中复制模型包步骤二:在Notebook中调试模型步骤三:Notebook中保存镜像步骤四:使用保存成功的镜像用于推理部署登录 - [在Notebook中通过Dockerfile从0制作自定义镜像用于推理](https://support.huaweicloud.com/docker-modelarts/docker-modelarts_0031.md): 针对ModelArts目前不支持的AI引擎,您可以通过自定义镜像的方式将编写的模型导入ModelArts,创建为模型。本文详细介绍如何在ModelArts的开发环境Notebook中使用基础镜像构建一个新的推理镜像,并完成模型的创建,部署为在线服务。本案例仅适用于华为云北京四和上海一站点。操作流程如下:步骤一:在Notebook中构建一个 - [在ECS中通过Dockerfile从0制作自定义镜像用于推理](https://support.huaweicloud.com/docker-modelarts/modelarts_23_0270.md): 针对ModelArts目前不支持的AI引擎,您可以针对该引擎构建自定义镜像,并将镜像导入ModelArts,创建为模型。本文详细介绍如何使用自定义镜像完成模型的创建,并部署成在线服务。操作流程如下:本地构建镜像:在本地制作自定义镜像包,镜像包规范可参考创建模型的自定义镜像规范。本地验证镜像并上传镜像至SWR服务:验证自定义镜像的API接口 - [使用自定义镜像](https://support.huaweicloud.com/docker-modelarts/docker-modelarts_6025.md): 当ModelArts预置镜像无法满足您的环境依赖或业务需求时(如需安装特定版本的深度学习框架、系统库或业务依赖),您可以制作自定义镜像并推送到容器镜像服务SWR,然后在ModelArts模型训练、在线推理和Notebook中使用该镜像。已完成自定义镜像制作。具体操作,请参见制作自定义镜像。SWR存储费用:镜像存储在SWR中会产生存储费用, - [镜像注册与管理](https://support.huaweicloud.com/docker-modelarts/modelarts_23_0091.md): ModelArts提供注册镜像功能,支持注册ModelArts统一镜像或上传到SWR上的镜像。注册后的镜像,可以用于模型训练、在线推理和Notebook。本文介绍如何注册镜像,并对已注册镜像进行查看、编辑、使用、删除等操作。已获取ModelArts统一镜像地址或其他镜像的SWR地址。关于ModelArts统一镜像的详细信息,请参见Mode ## 算力资源管理 - [算力资源介绍](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-overview_0001.md): 为了提升用户使用体验,ModelArts对控制台及部分界面进行了一系列的易用性改进。现推出新版页面,旨在简化操作流程并增强界面的直观性。本文档中的“新版”:是指新版控制台界面,部分新版功能需要切换至新版控制台查看和使用。本文档中的“旧版”:是指旧版控制台界面,新版界面也可手动切回旧版。资源池是一种集中管理和分配计算(CPU、内存)、存储( - [专属资源池功能介绍](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0003.md): 资源池是一种集中管理和分配计算(CPU、内存)、存储(硬盘空间)、网络(带宽、IP地址)等资源的机制,实现资源的高效利用、灵活分配和动态管理。ModelArts专属资源池提供了在使用ModelArts进行AI开发(包括创建Workflow工作流、创建Notebook实例、创建训练作业和创建推理服务)所需的计算资源。您可根据业务所需购买使用 - [不同机型对应的软件配套版本](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0085.md): 弹性集群资源池支持选择弹性裸金属或弹性云服务器作为节点资源。由于不同机型节点的操作系统和适用的CCE集群版本等存在差异,为方便您进行镜像制作、软件升级等操作,本文将详细介绍各机型对应的软件配套版本。 - [创建专属资源池](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0004.md): 在AI开发过程中,由于业务需求的多样化和资源使用的复杂性,为满足特定业务对资源确定性、安全性、高效性的严格要求,创建专属资源池成为必要举措。专属资源池是一种为特定用户、业务或项目专门划分和预留的资源集合,这些资源在物理或逻辑上与其他资源隔离开来,以确保特定需求能够得到满足。ModelArts专属资源池提供了在使用ModelArts进行AI - [查看专属资源池列表和详情](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0005.md): 本章节旨在帮助用户查看资源池列表及详情,涵盖列表页与详情页的核心内容及基础操作。详情页通过控制台页面的页签分类呈现功能模块,包括概览(展示基本信息与作业列表)、资源队列、节点、节点池、预热任务、事件、监控及插件等八大模块。用户可通过单击对应页签切换视图,实现对资源池配置状态、运行数据及扩展功能的集中管理。这种结构化设计有效解决了资源信息分 - [扩缩容专属资源池](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0006.md): 当专属资源池创建完成,使用一段时间后,由于用户AI开发业务的变化,对于资源池资源量的需求可能会产生变化,面对这种场景,ModelArts专属资源池提供了扩缩容功能,用户可以根据自己的需求动态调整资源池规模。对已有规格实例数扩缩容,即增加或减少资源池已有规格的实例数量,增加实例数即扩容,减少实例数即缩容。扩缩容规格实例数适用于调整资源池的整 - [升级专属资源池驱动](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0009.md): 当专属资源池中的节点含有GPU/NPU资源时,资源池节点性能如果无法满足现有业务,升级驱动可以修复已知问题、提升性能或者支持新功能,确保资源池性能和兼容性得到优化。ModelArts提供升级专属资源池GPU/NPU驱动的功能,您可根据自身业务需要通过ModelArts控制台升级专属资源池内节点池的GPU/NPU驱动。驱动升级有两种升级方式 - [管理专属资源池节点](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0059.md): 专属资源池支持对故障节点进行修复操作,目前提供了热备节点、重置节点和重启节点等方式。华为云技术支持在故障定位和性能诊断时,部分运维操作需要用户授权才可进行,本章节同时也介绍了如何进行授权操作。视频介绍功能介绍热备节点作为专属资源池内的备用节点,能够在普通节点故障时自动进行切换,可以提升资源池整体的可用性和容错能力,有效避免单个节点故障造成 - [事件中心页面授权运维](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0007.md): 华为云会对节点的软硬件设备进行故障检测和日常运维,当节点由于不可恢复故障需要进行硬件维护时,会推送计划事件到控制台的事件中心。您可以在事件中心,查看具体的事件信息、事件类型、事件状态、事件描述等信息,可以授权华为技术支持对故障节点进行运维或重部署节点。系统维护: 系统维护操作要对主机下电维修,需要运维人员在机房实际重新插拔设备或更换备机, - [修改专属资源池支持的作业类型](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0008.md): ModelArts含有许多“作业”类型(作业为统称,并非单指训练作业),其中有一部分是可以运行在专属资源池上的,包括“训练”、“推理”服务及“开发环境”。专属资源池提供了动态设置作业类型的功能,您可以在创建资源池时、创建完成后,对资源池支持的作业类型进行编辑(新增或减少)。当前支持的“作业类型”有“训练作业”、“开发环境”、“模型部署”和 - [迁移专属资源池和网络至其他工作空间](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0045.md): 专属资源池的工作空间关联了企业项目,企业项目涉及到账单归集。为隔离不同子用户操作资源的权限,ModelArts提供了工作空间功能,管理员可以根据工作空间,隔离不同子用户操作工作空间内资源的权限。ModelArts提供迁移资源池和网络的功能,可以将资源池和网络迁移到新的目标空间,迁移完成后,资源池将与目标工作空间关联,您可以在目标工作空间中 - [配置专属资源池可访问公网](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0012.md): 当您使用专属资源池创建作业时(如训练作业),如果作业运行过程中需要专属资源池访问外网,首先专属资源池通过打通VPC的方式,使得专属资源池和已绑定EIP的弹性云服务器实现网络对等连接;然后对已绑定EIP的弹性云服务器配置公网NAT网关,实现公网访问;通过这种方式专属资源池不用另外配置公网NAT网关即可访问公网。在配置专属资源池公网的过程中, - [关联专属资源池的网络至SWR企业仓](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0084.md): 当前用户在专属资源池中使用SWR企业仓下发训练作业时面临网络连接障碍,由于专属资源池与SWR企业仓之间缺乏自动化的网络打通机制,导致每次作业下发都需要手动配置网络连接,显著增加了操作复杂度。为解决这一问题,ModelArts创新性地提供SWR企业仓关联功能,通过建立专属资源池与SWR企业仓的自动化网络通道,不仅实现了镜像仓库与计算资源的无 - [关联专属资源池的网络至SFS Turbo](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0096.md): 关联SFS Turbo主要是在不需要打通VPC的情况下,可直接在Notebook及训练环境中挂载SFS盘,并访问相应数据。使用SFS Turbo作为数据存储介质,当前在安全隔离上是弱隔离等级,即同一租户内所有用户对同一个SFS Turbo均有相同权限。若您有更高的安全需求,推荐使用OBS桶作为数据存储介质,并为不同OBS桶配置安全策略。使 - [变更专属资源池超节点规格](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0074.md): 当专属资源池创建完成,使用一段时间后,由于用户AI开发业务的变化,对于资源池资源量的需求可能会产生变化,面对这种场景,ModelArts专属资源池提供了针对超节点池变更规格功能,用户可以根据自己的需求动态调整超节点规格。超节点不同规格价格不同,在变更规格后,价格根据目标规格会产生变化,以变更后的目标规格配置价格计费。具体费用可参见Mode - [使用TMS标签实现资源分组管理](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0063.md): ModelArts支持对接标签管理服务(Tag Management Service,简称TMS),在ModelArts中创建资源消耗性任务时,可以为这些任务配置标签,通过标签实现资源的多维分组管理。ModelArts支持配置标签的任务有:创建训练作业、创建Notebook、创建推理在线服务、创建ModelArts专属资源池、创建轻量算力 - [管理专属资源池的资源队列](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0079.md): 在ModelArts专属资源池管理场景中,用户需要通过拆分资源队列实现资源的精细化分配,但传统手动调整资源配额的方式存在操作繁琐、资源利用率低等问题。为此,ModelArts提供资源队列管理功能,支持用户在资源池详情页的"资源队列"页签中,通过"创建资源队列"按钮建立多个队列,并为每个队列配置保障配额(最低资源保障)和配额上限(最大资源限 - [管理专属资源池的节点池](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0080.md): 在专属资源池节点管理场景中,用户面临节点配置分散、批量操作困难等管理挑战。为解决这一问题,ModelArts创新性地引入节点池管理机制,通过将单个或多个节点纳入统一节点池,实现批量配置、驱动升级等集中化管理。用户可通过本章节完成节点池的创建、配置修改、状态查看及删除操作,系统支持在节点池维度进行资源调度和版本控制,显著提升节点管理效率并降 - [在专属资源池添加模型预热](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0081.md): 在专属资源池部署模型服务时,用户常面临服务初始化耗时过长的挑战。当首次部署或服务重启时,系统需从对象存储加载权重文件至本地环境,该过程可能因网络带宽限制或文件体积过大导致显著延迟。如何有效缩短这一初始化阶段的等待时间,成为提升用户体验的关键问题。针对此场景,ModelArts专属资源池创新性地提供模型预热功能作为解决方案:用户可通过控制台 - [删除/退订专属资源池和网络](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0010.md): 业务结束,资源长期闲置等情况下,如果资源池内无正在运行的任务且已完成数据备份和迁移,可删除专属资源池和网络,释放资源。在删除资源池前,请确保所有重要数据已备份,避免因误操作导致数据丢失。如果资源池中存在正在运行的任务或作业,建议先停止或迁移这些任务,再进行释放操作。当AI业务开发不再需要使用专属资源池时,您可以删除/退订专属资源池,释放资 - [专属资源池插件概述](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0065.md): 在资源池功能扩展场景中,用户面临业务需求多样化与资源池基础功能的适配性矛盾。为解决这一问题,ModelArts构建了插件化扩展体系,通过提供多种类型插件实现功能按需加载。系统采用智能安装策略,部分插件根据业务场景自动预装,其余插件支持手动安装,用户可通过插件广场搜索并查看插件详情。在资源池详情页的插件管理模块,用户可实时查看已安装插件列表 - [节点故障检测(ModelArts Node Agent)](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0068.md): ModelArts节点故障检测是一款监控集群节点异常事件的插件,以及对接第三方监控平台功能的组件。每个k8s的资源池默认都会安装,它是一个在每个节点上运行的守护程序,可从不同的守护进程中搜集节点问题。创建专属资源池时自动安装。当前不支持用户自助升级。 - [指标监控插件(ModelArts Metric Collector)](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0078.md): 指标监控插件(Metrics Collector)是默认内置插件,以节点守护程序运行,可采集节点及各类作业监控指标,并上报到AOM。指标列表请见在AOM控制台查看ModelArts所有监控指标。创建资源池时自动安装。不支持卸载。存量资源池,需要将节点故障检测(ModelArts Node Agent)插件版本升级到最新版本,自动安装该插件 - [AI套件(NV GPU)](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0069.md): AI套件(NV GPU)插件是用于支持在容器中管理GPU设备的插件,当集群中使用GPU节点时,必须安装此插件。创建专属资源池时,仅实例规格类型选择“GPU”时自动安装。对节点池的GPU驱动升级前,请您先将 AI 套件 - GPU 版本升级至1.2.24及以上。插件升级完成前,请勿进行GPU驱动升级,否则可能会导致驱动升级卡住或者失败。插件 - [AI套件(ModelArts Device Plugin)](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0070.md): AI套件(ModelArts Device Plugin)是支持容器里使用ModelArts Device Plugin设备的管理插件。创建专属资源池时,仅实例规格类型选择“NPU”时自动安装。创建Notebook、创建训练作业、部署在线服务、部署批量服务时,升级ModelArts Device Plugin插件会影响作业调度,请谨慎执行 - [Volcano调度器(Volcano Scheduler)](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0071.md): Volcano 是一个基于 Kubernetes 的批处理平台,提供了机器学习、深度学习、生物信息学、基因组学及其他大数据应用所需要而 Kubernetes 当下缺失的一系列特性。Volcano提供了高性能任务调度引擎、高性能异构芯片管理、高性能任务运行管理等通用计算能力,通过接入AI、大数据、基因、渲染等诸多行业计算框架服务终端用户,最 - [节点本地域名解析加速(NodeLocal DNSCache)](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0072.md): 节点本地域名解析加速(NodeLocal DNSCache)是基于社区NodeLocal DNSCache提供的插件,通过在集群节点上作为守护程序集运行DNS缓存代理,提高集群DNS性能。启用NodeLocal DNSCache之后,DNS查询所遵循的路径如下图所示。其中解析线路说明如下:①:已注入DNS本地缓存的Pod,默认会通过Nod - [云原生日志采集插件](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0073.md): 云原生日志采集插件(原名log-agent)是基于开源fluent-bit和opentelemetry构建的云原生日志、K8s事件采集插件。log-agent插件支持将集群中训练、推理实例的容器标准输出日志采集到lts中。日志系统的核心功能在于记录业务组件的全生命周期状态数据(包括启动初始化、退出、运行时信息及异常事件等),主要服务于组件 - [云原生监控插件(kube-prometheus-stack)](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0075.md): 云原生监控插件(原名kube-prometheus-stack)通过使用Prometheus-operator和Prometheus,提供简单易用的端到端Kubernetes集群监控能力。使用云原生监控插件可将监控数据与监控中心对接,在监控中心控制台查看监控数据,配置告警等。开源社区地址:https://github.com/promet - [KubeInfer(ModelArts Infers Operator)](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0083.md): 在AI应用开发与部署过程中,用户经常需要在创建专属资源池时集成特定的插件以支持模型推理等关键功能。然而,传统的插件安装方式往往需要手动配置,不仅耗时费力,还容易出错,影响AI应用的快速上线。为了提升用户体验,华为云ModelArts平台在创建专属资源池,选择新版推理作业时,支持KubeInfer(ModelArts Infers Oper - [ModelArts LWS](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0087.md): ModelArts LWS(LeaderWorkerSet)是一款开源大模型推理模型部署插件。它将一组Pod作为一个整体进行部署,可用于承载分布式推理任务,提供灵活的升级和恢复策略。升级过程中将短暂影响业务创建功能 (预计恢复极快),请尽量避开业务高峰期操作。创建专属资源池作业类型选择模型部署时,自动安装该插件。 - [ModelArts HRA](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0094.md): HRA 是一款基于 xPyD 框架构建的高效弹性部署方案。它通过对 P 与 D 组件进行解耦并支持独立伸缩,能够精准匹配不同模块的负载需求,显著提升集群的资源利用率与整体调度效率。在资源池中安装指定插件。登录ModelArts管理控制台,在左侧菜单栏中选择“资源管理 > 专属算力资源 > 资源池”。单击资源池名称,进入资源池详情页。在资源 - [Everest](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0095.md): CSI(Container Storage Interface)是Kubernetes社区推荐的存储插件标准,用于实现容器编排平台与各类存储系统的统一对接。基于CSI标准,CCE提供自研的存储插件,即CCE容器存储(Everest)插件。该插件可无缝对接多种IaaS存储服务,包括云硬盘(块存储)、文件存储、对象存储和极速文件存储等,为容器 - [ModelArts Infers Proxy](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0097.md): ModelArts Infers Proxy 是大模型推理场景下的高阶负载均衡组件,作为请求调度的核心模块,为推理服务提供请求转发、服务发现、负载均衡、流控等能力。Proxy 是集群级别的插件,多推理服务共享。插件安装时会根据集群节点数自动选择合适的规格,当资源池规模较大时,默认副本数和配置可能存在瓶颈,支持用户自助配置副本数和资源规格。 - [ModelArts资源监控概述](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0032.md): 为了满足用户对资源使用的监控诉求,ModelArts提供了多种监控查看方式。方式一:通过ModelArts控制台查看您在可通过ModelArts控制台的总览页或各模块资源监控页签查看监控指标。具体涉及以下几个方面:通过ModelArts控制台的总览页查看,具体请参见通过ModelArts控制台查看监控指标。训练作业:用户在运行训练作业时, - [在ModelArts控制台查看监控指标](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0060.md): 本章节中提到的总览页是基于旧版控制台的总览页。控制台界面为旧版样式。在总览页查看全部事件时,如果顶部事件总数和底部的“总条数”数量不一致,请刷新重试。在ModelArts控制台的总览页,支持查看生产概况(即总体作业运行数量)、资源占用情况、训练作业资源利用情况。您可以单击生产概况的链接、资源池名称、训练作业,跳转到对应界面查看更多详情。训 - [在AOM控制台查看ModelArts所有监控指标](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0033.md): 在资源池监控管理场景中,用户需要实时掌握计算资源(GPU、NPU、CPU、Memory等)及开发环境、训练作业、推理服务的资源消耗情况。传统手动监控方式存在数据分散、时效性差等问题。ModelArts通过构建自动化监控体系,定期采集资源池中各节点及作业的关键资源使用数据,并将这些数据统一上报至AOM监控平台,用户无需切换系统即可在AOM控 - [操作流程](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0042.md): Grafana支持灵活而又复杂多样的监控视图和模板,可以满足绝大部分情况下用户的诉求。将Grafana的数据源配置完成后,就可以通过Grafana查看AOM保存的所有ModelArts的所有指标。通过Grafana插件查看AOM中的监控指标的操作流程如下:安装配置Grafana安装配置Grafana有在Windows上安装配置Grafan - [在Windows上安装配置Grafana](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0036.md): 本章节适用于在Windows操作系统的PC中安装配置Grafana。下载Grafana安装包。进入下载链接,单击Download the installer,等待下载成功即可。进入下载链接,单击Download the installer,等待下载成功即可。安装Grafana。双击安装包,按照指示流程安装完成即可。双击安装包,按照指示流程 - [在Linux上安装配置Grafana](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0037.md): 本章节适用于在Linux操作系统的PC中安装配置Grafana。一台可访问外网的Ubuntu服务器。如果没有请具备以下条件:准备一台ECS服务器(建议规格选8U或者以上,镜像选择Ubuntu,建议选择22.04版本,本地存储100G),具体操作请参考《购买弹性云服务器》。购买弹性公网IP,并绑定到购买的弹性云服务器ECS上,具体操作请参见 - [在Notebook上安装配置Grafana](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0038.md): 本章节适用于在ModelArts的Notebook中安装配置Grafana。已创建CPU或GPU类型的Notebook实例,并处于运行中。打开Terminal。在Terminal中依次执行以下命令,下载并安装Grafana。mkdir -p /home/ma-user/work/grfcd /home/ma-user/work/grfwg - [配置Grafana数据源](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0039.md): 在Grafana配置数据源后,即可通过Grafana查看ModelArts的监控数据。已安装Grafana。获取Grafana数据源配置代码。进入AOM管理控制台。AOM管理控制台在左侧导航栏中选择“Prometheus监控 > 实例列表”,在实例列表中单击“Prometheus_AOM_Default”实例。Prometheus_AOM - [配置仪表盘查看指标数据](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0040.md): Grafana中可以自定义配置各种视图的仪表盘,ModelArts也提供了针对集群的配置模板。本章节通过使用ModelArts提供的模板查看指标和创建Dashboards查看指标的方式,说明如何进行仪表盘配置。Grafana的更多使用请参考Grafana官方文档。ModelArts提供了集群视图、节点视图、用户视图、任务视图和任务详细视图 - [ModelArts支持的事件监控的事件说明](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0043.md): 事件监控提供了故障节点的计划事件类型数据上报、查询和告警的功能。方便您将业务中的各类重要事件或对云资源的操作事件收集到云监控服务,并在事件发生时进行告警,授权华为技术支持对故障节点进行运维。事件收集到云监控服务后,用户可以切换到CES服务界面查看事件监控数据。本节定义了ModelArts的昇腾服务器支持计划事件监控的事件说明。当前支持的站 - [使用CTS审计专属资源池和轻量算力集群服务操作](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0091.md): ModelArts专属资源池和轻量算力集群支持对接云审计CTS服务,通过云审计服务,您可以记录与ModelArts专属资源池和轻量算力集群相关的操作事件,便于日后的查询、审计和回溯。云审计服务管理控制台保存最近7天的ModelArts专属资源池和轻量算力集群的操作记录。已开通云审计服务。详细操作请参见《云审计服务用户指南》。登录CTS云审 - [轻量算力节点使用流程](https://support.huaweicloud.com/resmgmt-modelarts/usermanual-server-0002.md): 对于算法工程师而言,日常的训练和推理工作需要一个灵活且强大的云上开发环境。然而,现有的云服务往往限制了用户的自定义能力,导致无法满足特定的软件安装和配置需求。ModelArts轻量算力节点提供多样化的资源,赋予用户以root账号自主安装和部署AI框架、应用程序等第三方软件的能力,为用户打造专属的云上服务器环境。用户只需轻松选择服务器的规格 - [轻量算力节点高危操作一览表](https://support.huaweicloud.com/resmgmt-modelarts/usermanual-server-0003.md): ModelArts轻量算力节点在日常操作与维护过程中涉及的高危操作,需要严格按照操作指导进行,否则可能会影响业务的正常运行。高危操作风险等级说明:高:对于可能直接导致业务失败、数据丢失、系统不能维护、系统资源耗尽的高危操作。中:对于可能导致安全风险及可靠性降低的高危操作。低:高、中风险等级外的其他高危操作。 - [轻量算力节点操作系统镜配套关系](https://support.huaweicloud.com/resmgmt-modelarts/usermanual-server-0004.md): ModelArts 轻量算力节点了提供多种操作系统镜像,您可在创建轻量算力节点资源前了解当前支持的镜像及对应详情,供您在表5时选择。镜像名称:HCE2.0-Arm-64bit-for-Snt9b2x-with-25.5.1-7.8.0.6.201-CANN8.5.2-v2镜像详情软件类型版本详情操作系统HCE2.0内核版本5.10.0-1 - [轻量算力节点资源开通(新版页面)](https://support.huaweicloud.com/resmgmt-modelarts/usermanual-server-0005.md): 本章节主要介绍如何在ModelArts控制台上购买轻量算力节点算力资源,及购买前的准备工作。用户先完成资源配额提升、配置基础权限、设置ModelArts委托授权等准备工作。在购买资源时,用户创建实例并支付订单,支付完成后等待约20~60分钟,资源创建成功后即可配置弹性公网IP进行访问,开展相关AI开发工作。轻量算力节点超节点当前仅支持包年 - [轻量算力节点资源配置流程](https://support.huaweicloud.com/resmgmt-modelarts/usermanual-server-0007.md): 在开通轻量算力节点资源后,需要完成相关配置才能使用,配置流程如下图所示。 - [配置轻量算力节点网络](https://support.huaweicloud.com/resmgmt-modelarts/usermanual-server-0008.md): 轻量算力节点创建后,需要进行网络配置,才可使其与Internet通信,本章节介绍网络配置步骤。网络配置主要分为以下两个场景:单个弹性公网IP用于单个轻量算力节点:为单台轻量算力节点服务器绑定一个弹性公网IP,该轻量算力节点服务器独享网络资源。单个弹性公网IP用于多个轻量算力节点服务器:一个VPC配置一个EIP(弹性公网IP),通过NAT网 - [配置轻量算力节点存储](https://support.huaweicloud.com/resmgmt-modelarts/usermanual-server-0009.md): 轻量算力节点服务器支持SFS、OBS、EVS三种云存储服务,提供了多种场景下的存储解决方案,主要区别如下表所示。如果需要对本地盘进行配置,请参考磁盘合并挂载。如果使用SFS服务作为存储方案,推荐使用SFS Turbo文件系统。SFS Turbo提供按需扩展的高性能文件存储,还具备高可靠和高可用的特点,支持根据业务需要弹性扩容,且性能随容量 - [NPU服务器上配置轻量算力节点资源软件环境](https://support.huaweicloud.com/resmgmt-modelarts/usermanual-server-0011.md): 本文旨在指导如何在基于NPU资源的轻量算力节点服务器上,进行磁盘合并挂载、安装Docker等环境配置。具体配置项如表1所示。当前指导中很多配置在最新发放的轻量算力节点服务器中已经预置,无需用户再手动配置,用户在操作中如发现某个步骤已有预置配置可直接跳过该步骤。在配置前请注意如下事项:首次装机时需要配置存储、固件、驱动、网络访问等基础内容, - [制作轻量算力节点服务器操作系统](https://support.huaweicloud.com/resmgmt-modelarts/usermanual-server-0030.md): 当前轻量算力节点服务器操作系统不满足用户诉求时,您可以使用BMS或ECS的制作镜像功能,将当前操作系统保存为新的镜像,方便用于其他轻量算力节点。制作镜像需满足以下条件:当前轻量算力节点服务器状态为停止状态。制作的镜像仅支持基于轻量算力节点当前的操作系统制作新的镜像,不支持其他场景制作镜像,例如从ISO开始制作等。制作操作系统镜像前需要先清 - [配置NPU服务器驱动固件一致性与UDP端口hash散列](https://support.huaweicloud.com/resmgmt-modelarts/usermanual-server-0061.md): 轻量算力节点的Snt9b、超节点Snt9b23公共操作系统中,都进行了驱动固件一致性与UDP端口hash散列配置。驱动固件一致性配置能够在服务器关机重启后自动刷新固件,保证操作系统HDK驱动与固件的一致性。UDP端口hash散列配置能够在服务器关机重启后自动刷新参数面网络上行端口配置,保证参数面网络不发生拥塞。当您使用自行构建的私有操作系 - [LLM/AIGC等模型基于轻量算力节点适配NPU的训练推理指导](https://support.huaweicloud.com/resmgmt-modelarts/usermanual-server-0014.md): ModelArts提供了丰富的关于轻量算力节点使用NPU进行训练推理的案例指导,涵盖了LLM大语言模型、AIGC图像视频生成等主流应用场景。您可查看详细指导。主流开源大模型基于轻量算力节点适配Ascend-VLLM PyTorch NPU推理指导主流开源大模型基于轻量算力节点适配AscendFactory PyTorch NPU训练指导A - [GPT-2基于轻量算力节点适配GPU的训练推理指导](https://support.huaweicloud.com/resmgmt-modelarts/usermanual-server-0015.md): 本文将介绍在GP Ant8裸金属服务器中,使用DeepSpeed框架训练GPT-2(分别进行单机单卡和单机多卡训练)。 训练完成后给出自动式生成内容,和交互式对话框模式。Megatron-DeepSpeedMegatron-DeepSpeed是一个基于PyTorch的深度学习模型训练框架。它结合了两个强大的工具:Megatron-LM和D - [查看轻量算力节点服务器详情](https://support.huaweicloud.com/resmgmt-modelarts/usermanual-server-0017.md): 在您创建了轻量算力节点后,可以通过管理控制台查看和管理您的轻量算力节点。本节介绍如何查看轻量算力节点的详细信息,包括名称/ID、规格、镜像等信息。在轻量算力节点的普通节点列表页中,可以查看轻量算力节点普通节点的名称、状态、实例规格、资源类型、监控、RoCE ID、VPC、IP地址、计费模式、创建时间和操作。单击某个普通节点名称,进入到轻量 - [开机或关机轻量算力节点服务器](https://support.huaweicloud.com/resmgmt-modelarts/usermanual-server-0018.md): 当您暂时不需要使用轻量算力节点的时候,可以通过关机操作停止运行中的Server实例,停止对资源的消耗。当需要使用的时候,对于停止状态的轻量算力节点,可以通过开机操作重新使用。只有处于“已停止/启动失败”状态的轻量算力节点可以执行开机操作。只有处于“运行中/停止失败”状态的轻量算力节点可以执行关机操作。普通节点和超节点的子节点支持批量开机或 - [同步轻量算力节点服务器状态](https://support.huaweicloud.com/resmgmt-modelarts/usermanual-server-0019.md): 轻量算力节点普通节点为一台弹性服务器ECS或裸金属服务器BMS,当用户在ECS或BMS侧修改了服务器状态或磁盘信息后,您可通过同步功能,将服务器状态和磁盘信息同步至ModelArts轻量算力节点。轻量算力节点超节点的子节点也是ECS服务器,当用户在ECS侧修改了子节点的磁盘信息后,您也可通过同步功能,同步磁盘信息至ModelArts轻量算 - [切换或重置轻量算力节点服务器操作系统](https://support.huaweicloud.com/resmgmt-modelarts/usermanual-server-0020.md): 当轻量算力节点的操作系统镜像不满足要求时,可以进行切换或重置。本文介绍以下几种切换操作系统的方式:在ModelArts控制台的轻量算力节点页面切换或重置操作系统(推荐)在裸金属服务器控制台切换操作系统使用BMS Go SDK的方式切换裸金属服务器操作系统使用Python封装API的方式切换裸金属服务器操作系统节点状态要求:轻量算力节点状态 - [轻量算力节点资源热备管理](https://support.huaweicloud.com/resmgmt-modelarts/usermanual-server-0046.md): 轻量算力节点资源热备需要用户自建k8s集群。对于k8s集群中的机器资源通过打污点的方式,完成资源热备机的处理,从而使业务Pod无法调度到该热备机上。根据下单使用的轻量算力节点资源机器种类和台数不同,推荐您按照下面的表格进行热备机器台数准备。示例1:当购买Snt9b类型的资源台数为6台时,该台数少于10台,因此根据热备机推荐表,此时不需要准 - [修改轻量算力节点名称](https://support.huaweicloud.com/resmgmt-modelarts/usermanual-server-0051.md): 在日常的云服务管理中,用户经常需要对云服务器进行命名或重命名,以便更好地管理和识别不同的实例。为了提升用户体验,允许用户在轻量算力节点中直接修改名称。支持在轻量算力节点的普通节点列表页或详情页中修改普通节点名称,并且允许重名。支持在轻量算力节点的超节点列表页或详情页中修改子节点名称,并且允许重名。订单中的服务器名称会一直保持下单购买时设置 - [事件中心页面授权运维](https://support.huaweicloud.com/resmgmt-modelarts/usermanual-server-0039.md): 华为云会对节点的软硬件设备进行故障检测和日常运维,当节点由于不可恢复故障需要进行硬件维护时,会推送计划事件到控制台的事件中心。您可以在事件中心,查看具体的事件信息、事件类型、事件状态、事件描述等信息,可以授权华为技术支持对故障节点进行运维或重部署节点。系统维护: 系统维护操作要对主机下电维修,需要运维人员在机房实际重新插拔设备或更换备机, - [重启轻量算力节点服务器](https://support.huaweicloud.com/resmgmt-modelarts/usermanual-server-0053.md): 当用户需要重启轻量算力节点服务器时,轻量算力节点页面提供了服务器重启功能,方便用户操作。只有处于运行中、重启失败状态时,才可进行重启操作。普通节点和超节点均支持重启操作。普通节点和超节点的子节点支持批量重启操作,超节点本身不支持批量操作。登录ModelArts管理控制台,在左侧导航栏中,选择资源管理轻量算力资源轻量算力节点页面。支持以下两 - [安装轻量算力节点AI插件](https://support.huaweicloud.com/resmgmt-modelarts/usermanual-server-0032.md): 节点任务中枢(NodeTaskHub)是深度集成的弹性节点管理插件,为ModelArts 轻量算力节点提供批量任务下发与自动化运维能力。支持昇腾软件升级、实时检测、故障诊断等高频操作,降低人工干预风险,保障AI业务流程稳定高效。轻量算力节点任务中心提供多种任务模板供用户创建任务,任务下发依赖轻量算力节点中已安装的NodeTaskHub插件 - [升级轻量算力节点中的Ascend驱动固件版本](https://support.huaweicloud.com/resmgmt-modelarts/usermanual-server-0033.md): 本文旨在指导用户如何通过轻量算力节点的任务中心下发Ascend驱动固件升级任务,通过该任务可以在Snt9b和Snt9b23机器上完成Ascend驱动固件的一键升级。当前仅支持Snt9b和Snt9b21系列的普通节点、Snt9b23的超节点。升级驱动固件过程中会导致业务中断,升级前请保证节点内无业务运行,同时升级完毕后需要重启节点生效。如果 - [升级轻量算力节点中的GPU驱动等软件](https://support.huaweicloud.com/resmgmt-modelarts/usermanual-server-0065.md): 在高性能计算和深度学习领域,用户经常需要使用最新的GPU驱动和相关软件来优化计算性能。然而,当前市场上许多GPU机型在购买时预装的驱动和软件版本可能较旧,导致用户在使用最新版本的CUDA时遇到兼容性问题。为了提升用户体验,轻量算力节点提供了一键式软件升级功能,支持GPU驱动、CUDA、nvidia-fabricmanager、nv_pee - [安装/升级轻量算力节点中的CES Agent插件](https://support.huaweicloud.com/resmgmt-modelarts/usermanual-server-0054.md): 在轻量算力节点的运维管理中,当用户发现当前操作系统镜像中预置的CES Agent版本过低,影响了CES服务的正常使用时,会面临无法通过现有手段进行升级的问题。传统的升级方式,如重新制作OS镜像或手动登录机器执行命令,不仅操作复杂、耗时长,还存在较高的误操作风险,无法满足用户对于高效、便捷运维的需求。如何在不中断业务的前提下,实现CES A - [轻量算力节点故障诊断](https://support.huaweicloud.com/resmgmt-modelarts/usermanual-server-0031.md): 轻量算力节点任务中心提供一键式故障诊断能力,包括参数面网络诊断和Ascend设备诊断。用户无需深入了解具体诊断操作命令,即可自助快捷地在轻量算力节点产品页面上完成网络和Ascend设备检查的诉求。参数面网络诊断支持查询卡的网络状态,IP和掩码信息等,Ascend设备诊断支持对驱动固件版本兼容性进行诊断,并实现了带内检查自动化。同时可批量在 - [轻量算力节点漏洞修复](https://support.huaweicloud.com/resmgmt-modelarts/usermanual-server-0057.md): 在日常的系统运维过程中,运维人员经常面临操作系统版本更新后出现的安全漏洞问题,如内核漏洞、openssh漏洞等,这些问题不仅影响系统的稳定运行,还可能带来安全隐患。传统的解决方法是重新制作OS镜像,但这一过程耗时较长且工作量大,无法满足快速响应的需求。为此,轻量算力节点新增了通用系统漏洞修复任务,支持一键系统配置,能够逐项检测并修复各类安 - [轻量算力节点一键式压测](https://support.huaweicloud.com/resmgmt-modelarts/usermanual-server-0035.md): 轻量算力节点任务中心提供一键式的压测能力,用户无需深入理解AICore,HBM等软件栈,即可自助快捷地在轻量算力节点产品页面上完成业务压测诉求。支持对昇腾服务器的带宽测试、算力测试、功耗测试、诊断压测等,为AI训练、推理等高负载场景提供硬件保障,同时可批量在多台服务器上均可并行,大幅度提升效率。当前仅支持Snt9b和Snt9b21系列的普 - [轻量算力节点参数面网络配置](https://support.huaweicloud.com/resmgmt-modelarts/usermanual-server-0047.md): 轻量算力节点任务中心提供一键式的系统配置能力,用户可自助快捷地在轻量算力节点产品页面上完成参数面网络配置诉求。通过优化服务器参数(如RoCE网络上行端口、参数面网络IP)等,以满足训练/推理场景基本需求,并提升服务器性能,同时可批量在多台服务器上均可并行,大幅度提升效率。当前仅支持Snt9b和Snt9b21系列的普通节点、Snt9b23的 - [轻量算力节点健康巡检](https://support.huaweicloud.com/resmgmt-modelarts/usermanual-server-0056.md): 在日常的运维工作中,运维人员在进行压测、健康检查、故障检测和日志分析等操作时面临诸多不便。为了提升运维效率,本场景中通过轻量算力节点与昇腾云脑的联动,实现对轻量算力节点的全面巡检和管理。通过在轻量算力节点资源管理界面增加“创建巡检作业”按钮,使运维人员能够直接从轻量算力节点页面跳转至昇腾云脑页面,创建并执行巡检作业,从而有效提升系统的运维 - [轻量算力节点超节点规格变更](https://support.huaweicloud.com/resmgmt-modelarts/usermanual-server-0040.md): 当用户使用一段时间轻量算力节点的超节点资源后,由于用户业务的变化,需要扩容或缩容超节点,可以通过本章节的操作实现。扩容:仅适用于超节点(Snt9b23)扩容。超节点扩容时,子节点个数不超过48个。待扩容节点处于可用状态时,才支持扩容。扩容时不影响原有节点上的业务。缩容:仅适用于超节点(Snt9b23)缩容。超节点的子节点个数为1个时,不支 - [轻量算力节点超节点系统盘扩容](https://support.huaweicloud.com/resmgmt-modelarts/usermanual-server-0055.md): 在使用超节点进行业务操作时,如果遇到系统盘空间不足的情况,例如在尝试切换操作系统(OS)时,由于系统盘容量不足以支持新的OS镜像,导致切换失败。此外,在日常业务运行中,随着数据的不断积累,系统盘的剩余空间逐渐减少,最终达到容量上限,影响业务的正常运行。面对这些情况,为确保业务的连续性和稳定性,轻量算力节点提供了系统盘扩容功能,用户可以在节 - [轻量算力节点超节点定期压测](https://support.huaweicloud.com/resmgmt-modelarts/usermanual-server-0036.md): 针对超节点Snt9b23,支持用户定期对昇腾服务器进行性能测试和故障诊断,及时发现NPU故障,减少业务影响。仅支持超节点Snt9b23。压测使用工具Ascend DMI,其不支持在同一个设备里同时开启多个进程来测试性能数据,多进程测试时,可能导致测试结果不准确或者失败等不可预测情况。性能测试和故障诊断会影响训练或推理业务,执行命令前请确保 - [开启超节点HCCL通信算子级重执行机制](https://support.huaweicloud.com/resmgmt-modelarts/usermanual-server-0037.md): 针对Snt9b23超节点下光模块故障率高的问题,通过在HCCL通信算子级引入重执行机制,提升系统的稳定性和可靠性。HCCL(Huawei Collective Communication Library,华为集合通信库)是华为专为昇腾(Ascend)AI处理器设计的分布式通信库,旨在优化多设备间的高效协作,以加速深度学习模型的分布式训练, - [轻量算力节点超节点绑定弹性网卡](https://support.huaweicloud.com/resmgmt-modelarts/usermanual-server-0060.md): 弹性网卡(Elastic Network Interfaces,以下简称ENI)即虚拟网卡,您可以通过创建并配置弹性网卡,并将其附加到您的云服务器实例(包括弹性云服务器和裸金属服务器)上,实现灵活、高可用的网络方案配置。另外,在分布式计算环境中,当用户需要创建或管理超节点资源时,可能会遇到存储网络性能不足的问题,尤其是在使用TCP/IP协 - [NPU日志收集上传](https://support.huaweicloud.com/resmgmt-modelarts/usermanual-server-0024.md): 当轻量算力节点上的NPU出现故障时,您可通过本方案快速下发NPU日志采集任务,采集到的日志信息保存在轻量算力节点的指定目录,在用户授权同意后自动上传至华为云技术支持提供的OBS桶中,供后台进行问题定位分析。采集日志范围包括:Device侧日志:Device侧Control CPU上的系统类日志、EVENT级别系统日志、非Control C - [GPU日志收集上传](https://support.huaweicloud.com/resmgmt-modelarts/usermanual-server-0026.md): 当GPU出现故障,您可以通过本方案收集GPU的日志信息。本方案中生成的日志会保存在节点上,并自动上传至技术支持提供的OBS桶中,日志仅用于问题定位分析,因此需要您提供AK/SK给技术支持,用于授权认证。获取AK/SK。该AK/SK用于后续脚本配置,做认证授权。如果已生成过AK/SK,则可跳过此步骤,找到原来已下载的AK/SK文件,文件名一 - [使用CES监控轻量算力节点NPU资源](https://support.huaweicloud.com/resmgmt-modelarts/usermanual-server-0022.md): 轻量算力节点的监控能力依赖于CES云监控服务。本文主要介绍如何对接CES云监控服务,对轻量算力节点上的资源和事件进行监控。监控需要用到CES Agent插件,Agent有严格的资源占用限制,当资源占用超过阈值后出现Agent熔断情况,详细的资源占用说明请参考CES产品文档相关章节:CES Agent性能说明。通过Ascend-dmi执行N - [使用CES监控轻量算力节点NPU事件](https://support.huaweicloud.com/resmgmt-modelarts/usermanual-server-0062.md): 通过对接CES,可以将业务中的重要事件或对云资源的操作事件收集到CES云监控服务,并在事件发生时进行告警。轻量算力节点支持的事件来源主要是BMS和ECS,NPU涉及的具体事件列表如下,其他相关事件请参考CES事件监控说明。事件上报到CES需要用到CES Agent插件,Agent有严格的资源占用限制,当资源占用超过阈值后出现Agent熔断 - [使用CES实现轻量算力节点监控和事件告警](https://support.huaweicloud.com/resmgmt-modelarts/usermanual-server-0034.md): 针对上报到CES的监控指标和事件,支持配置告警,以短信、邮件等方式通知用户故障信息,并支持通过API查询故障记录。本方案基于CES的告警规则实现,由于CES允许每个账号最多创建100个告警规则,因此本方案最多可以监控100个超节点。告警来源基于CES故障检测事件,因此需要开启CES主机监控委托。可以在购买超节点时开启,也可以购买后在CES - [使用CES自动检测服务器环境并提供事件通知](https://support.huaweicloud.com/resmgmt-modelarts/usermanual-server-0066.md): 在日常的系统运维过程中,管理员经常需要对机器环境进行检测,以确保系统的稳定性和安全性。然而,传统的检测方式往往依赖于人工操作,不仅耗时耗力,而且容易遗漏潜在的问题。为了解决这一问题,推出了CES-Agent进行机器环境检测的功能。通过这一功能,CES-Agent能够自动检测机器环境中的漏洞和配置问题,并将检测结果上报给轻量算力节点,并在控 - [使用DCGM监控轻量算力节点GPU资源](https://support.huaweicloud.com/resmgmt-modelarts/usermanual-server-0023.md): 本文主要介绍如何在轻量算力节点上配置DCGM监控,用于监控轻量算力节点上的GPU资源。DCGM是用于管理和监控基于Linux系统的GPU大规模集群的一体化工具,提供多种能力,包括主动健康监控、诊断、系统验证、策略、电源和时钟管理、配置管理和审计等。仅适用于GPU资源监控。裸金属服务器需要安装driver、cuda、fabric-manag - [轻量算力节点管理CloudPond的NPU资源](https://support.huaweicloud.com/resmgmt-modelarts/usermanual-server-0048.md): 客户已经购买的CloudPond的昇腾算力资源需要通过轻量算力节点发放。本方案主要介绍如何通过轻量算力节点发放资源。CloudPond可以理解为华为云的一个边缘可用区,边缘可用区将云基础设施和云服务部署到企业现场,适合对应用访问时延、数据本地化留存及本地系统交互等有高要求的场景,可便捷地将云端丰富应用部署到本地,CloudPond介绍可参 - [使用CTS审计轻量算力节点服务操作](https://support.huaweicloud.com/resmgmt-modelarts/usermanual-server-0050.md): ModelArts轻量算力节点支持对接云审计CTS服务,通过云审计服务,您可以记录与ModelArts轻量算力节点相关的操作事件,便于日后的查询、审计和回溯。云审计服务管理控制台保存最近7天的ModelArts轻量算力节点操作记录。已开通云审计服务。详细操作请参见《云审计服务用户指南》。登录CTS云审计服务控制台。在管理控制台左上角单击图 - [退订或删除轻量算力节点资源](https://support.huaweicloud.com/resmgmt-modelarts/usermanual-server-0025.md): 针对不再使用的轻量算力节点资源,可以删除/退订以释放资源。停止计费相关介绍请见停止计费。包年/包月的轻量算力节点普通节点、整柜资源或超节点资源才支持退订,按需计费方式不支持退订。包年/包月的轻量算力节点普通节点、整柜资源或超节点资源处于创建失败或错误状态下时,可以直接删除。包年/包月的轻量算力节点普通节点、整柜资源或超节点资源在宽限期和冻 - [轻量算力集群使用流程](https://support.huaweicloud.com/resmgmt-modelarts/umn-cluster-modelarts-0002.md): ModelArts 轻量算力集群面向k8s资源型用户,提供托管式k8s集群,并预装主流AI开发插件以及自研的加速插件,以云原生方式直接向用户提供AI Native的资源、任务等能力,用户可以直接操作资源池中的节点和k8s集群。本文旨在帮助您了解轻量算力集群的基本使用流程,帮助您快速上手。轻量算力集群基于CCE服务实现对资源节点的管理,因此 - [轻量算力集群高危操作一览表](https://support.huaweicloud.com/resmgmt-modelarts/umn-cluster-modelarts-0003.md): 当您在CCE、ECS或BMS服务控制台直接操作ModelArts 轻量算力集群资源时,可能会导致资源池部分功能异常。下表可帮助您定位异常出现的原因,风险操作包括但不限于以下内容。高危操作风险等级说明:高:对于可能直接导致业务失败、数据丢失、系统不能维护、系统资源耗尽的高危操作。中:对于可能导致安全风险及可靠性降低的高危操作。低:高、中风险 - [不同机型对应的软件配套版本](https://support.huaweicloud.com/resmgmt-modelarts/umn-cluster-modelarts-0004.md): 由于弹性集群资源池可选择弹性裸金属或弹性云服务器作为节点资源,不同机型的节点对应的操作系统、适用的CCE集群版本等不相同,为了便于您制作镜像、升级软件等操作,本文对不同机型对应的软件配套版本做了详细介绍。ModelArts 轻量算力集群使用的CCE集群归属于用户,用户拥有对CCE集群的完全控制权。如果您的轻量算力集群使用了EOS的CCE集 - [轻量算力集群资源开通](https://support.huaweicloud.com/resmgmt-modelarts/umn-cluster-modelarts-0005.md): ModelArts 轻量算力集群是华为云ModelArts平台中的一种专属资源池,面向k8s资源型用户,提供托管式k8s集群,并预装主流AI开发插件以及自研的加速插件,以云原生方式直接向用户提供AI Native的资源、任务等能力。用户可以直接操作资源池中的节点和k8s集群,适合需要直接使用云原生资源的场景。ModelArts轻量算力集群 - [轻量算力集群资源配置流程](https://support.huaweicloud.com/resmgmt-modelarts/umn-cluster-modelarts-0007.md): 在轻量算力集群部署场景中,用户面临加速卡环境配置复杂、标准化流程缺失等实施难题。本章节系统性地提供加速卡环境配置的标准化操作指南,通过分步骤解析轻量算力集群的硬件适配、驱动安装、资源调度等关键配置环节,帮助用户快速构建符合业务需求的加速计算环境,显著降低异构计算资源的部署门槛并提升配置效率。已完成集群资源购买和开通,具体请参见轻量算力集群 - [配置轻量算力集群网络](https://support.huaweicloud.com/resmgmt-modelarts/umn-cluster-modelarts-0008.md): 弹性公网IP(Elastic IP,简称EIP)提供独立的公网IP资源,包括公网IP地址与公网出口带宽服务。购买轻量算力集群后,需要使用弹性公网IP进行网络配置,配置网络后可通过公网访问轻量算力集群资源。本章节介绍如何申请弹性公网IP并绑定到轻量算力集群。通过本文档,您可以实现弹性云服务器访问公网的目的。轻量算力集群绑定弹性公网IP后,可 - [配置kubectl工具](https://support.huaweicloud.com/resmgmt-modelarts/umn-cluster-modelarts-0009.md): kubectl是Kubernetes提供的一种命令行工具,它用于与Kubernetes集群进行交互,帮助用户管理集群中的资源、查看集群状态、部署应用程序、进行调试等操作。通过kubectl,您可以方便地在命令行界面上执行集群管理任务。配置kubectl后,您可连接到轻量算力集群,通过kubectl命令操作Kubernetes集群,从而方便 - [配置轻量算力集群存储](https://support.huaweicloud.com/resmgmt-modelarts/umn-cluster-modelarts-0010.md): 如果没有挂载任何外部存储,此时可用存储空间根据dockerBaseSize的配置来决定,可访问的存储空间比较小,因此建议通过挂载外部存储空间解决存储空间受限问题。容器中挂载存储有多种方式,不同的场景下推荐的存储方式不一样,详情如表1所示。容器存储的基础知识了解请参见存储基础知识,有助您理解本章节内容。您可查看数据盘空间分配说明,了解节点数 - [(可选)配置驱动](https://support.huaweicloud.com/resmgmt-modelarts/umn-cluster-modelarts-0011.md): 当专属资源池中的节点含有GPU/Ascend资源时,为确保GPU/Ascend资源能够正常使用,需要配置好对应的驱动来满足业务需求。轻量算力集群支持两种配置驱动的方式:方式一:购买资源池时通过自定义驱动参数进行配置:在购买资源池页面,部分GPU和Ascend规格资源池允许自定义安装驱动。开启自定义驱动开关并选择需要的驱动版本即可。方式二: - [(可选)配置镜像预热](https://support.huaweicloud.com/resmgmt-modelarts/umn-cluster-modelarts-0012.md): 镜像预热是指在计算节点上提前加载所需的镜像,主要目的是提高镜像加载效率,减少训练作业启动时间。轻量算力集群支持镜像预热功能,提前在资源池节点上拉取镜像,在推理及大规模分布式训练时有效缩短镜像拉取时间。本文将介绍如何在轻量算力集群配置镜像预热功能。已完成轻量算力集群资源购买和开通,具体请参见轻量算力集群资源开通。镜像预热的镜像来源需要获取依 - [在轻量算力集群上使用Snt9B完成分布式训练任务](https://support.huaweicloud.com/resmgmt-modelarts/umn-cluster-modelarts-0014.md): 本案例介绍如何在Snt9B上进行分布式训练任务,其中Cluster资源池已经默认安装volcano调度器,训练任务默认使用volcano job形式下发轻量算力集群。训练测试用例使用NLP的bert模型,详细代码和指导可参考Bert。config.yaml文件用于配置pod,本示例中使用sleep命令启动pod,便于进入pod调试。您也可 - [在轻量算力集群上使用ranktable路由规划完成PyTorch NPU分布式训练](https://support.huaweicloud.com/resmgmt-modelarts/umn-cluster-modelarts-0015.md): ranktable路由规划是一种用于分布式并行训练中的通信优化能力,在使用NPU的场景下,支持对节点之间的通信路径根据交换机实际topo做网络路由亲和规划,进而提升节点之间的通信速度。本案例介绍如何在ModelArts 轻量算力集群场景下使用ranktable路由规划完成PyTorch NPU分布式训练任务,训练任务默认使用Volcano - [在轻量算力集群上使用Snt9B完成推理任务](https://support.huaweicloud.com/resmgmt-modelarts/umn-cluster-modelarts-0016.md): 本案例介绍如何在Snt9B环境中利用Deployment机制部署在线推理服务。首先创建一个Pod以承载服务,随后登录至该Pod容器内部署在线服务,并最终通过新建一个终端作为客户端来访问并测试该在线服务的功能。config.yaml文件用于配置pod,本示例中使用sleep命令启动pod,便于进入pod调试。您也可以修改command为对应 - [在轻量算力集群上使用Ascend FaultDiag工具完成日志诊断](https://support.huaweicloud.com/resmgmt-modelarts/umn-cluster-modelarts-0030.md): 本文档介绍了在ModelArts 轻量算力集群环境下使用Ascend FaultDiag工具进行日志诊断的过程,包括日志采集、日志清洗、故障诊断三个步骤。日志数据以节点为单位进行采集,在单节点日志目录下分别清洗,将清洗结果汇总后,进行故障诊断。例如,对于运行在8个节点共64卡集群上的任务,需要在8个节点上分别进行日志采集,收集的日志存储在 - [在轻量算力集群挂载SFS Turbo](https://support.huaweicloud.com/resmgmt-modelarts/umn-cluster-modelarts-0043.md): 当本地服务器磁盘空间不足,无法满足业务增长需求时,将数据盘挂载到轻量算力集群,可以实现存储资源的动态分配,满足存储资源的灵活调度、高效利用和安全访问需求。华为云高性能弹性文件服务(Scalable File Service Turbo,SFS Turbo)提供按需扩展的高性能文件存储(NAS),能够满足大规模数据读写需求,且支持多个计算节 - [在轻量算力集群启用紧凑型缩容功能](https://support.huaweicloud.com/resmgmt-modelarts/umn-cluster-modelarts-0042.md): Volcano 调度器支持紧凑型缩容功能,包括DIE亲和缩容和Binpack缩容,支持的工作负载类型包括Deployment和ReplicaSet。DIE亲和缩容策略主要适用于ARM Snt3PD和Snt9c NPU场景。这类NPU的NPU卡由多个DIE芯片封装而成,相同NPU卡的多个DIE之间的带宽比跨DIE的带宽更高。基于这样的NPU - [在轻量算力集群跨区域访问其他服务](https://support.huaweicloud.com/resmgmt-modelarts/umn-cluster-modelarts-0045.md): 当您使用专属资源池创建作业时(如训练作业),如果作业运行时有跨区域访问已搭建的站点服务或数据需求,可借助云连接实现跨区域的数据访问。云连接实例支持区域,请参见云连接实例支持区域。企业在华为云账号A的华北-乌兰察布一创建了轻量算力集群,在西南-贵阳一区域已搭建站点服务或数据,华北-乌兰察布一的轻量算力集群需要访问西南-贵阳一区域的数据或服务 - [轻量算力集群资源管理介绍](https://support.huaweicloud.com/resmgmt-modelarts/umn-cluster-modelarts-0018.md): 在ModelArts控制台,您可以对已创建的资源进行管理。通过单击资源池名称,可以进入到资源池详情页,您可以在详情页进行下述操作。管理轻量算力集群:ModelArts支持对资源池进行管理,包括续费、开通/修改自动续费、扩容、升级驱动等操作。管理轻量算力集群节点池:为帮助您更好地管理Kubernetes集群内的节点,ModelArts支持通 - [管理轻量算力集群](https://support.huaweicloud.com/resmgmt-modelarts/umn-cluster-modelarts-0019.md): 在轻量算力集群管理场景中,用户面临资源生命周期管理分散、配置操作复杂等运维挑战。为解决集群续费、信息查看、标签管理、配置调整及退订等全生命周期管理需求,ModelArts提供集中化管理方案,支持通过控制台实现轻量算力集群的续费状态监控、基础信息查询、标签分类管理、资源配置优化,以及通过删除/退订操作完成集群资源池的生命周期终结,帮助用户构 - [管理轻量算力集群节点池](https://support.huaweicloud.com/resmgmt-modelarts/umn-cluster-modelarts-0020.md): 在集群节点管理场景中,用户面临节点配置分散、批量操作效率低等管理难题。ModelArts创新性地引入节点池管理机制,通过将节点池作为逻辑单元(可包含单个或多个节点)实现批量配置管理。用户可基于节点池统一进行节点组的扩缩容、资源配置及生命周期管理,系统支持在节点池维度执行驱动升级、标签管理等操作,从而显著提升集群节点的运维效率并降低管理复杂 - [管理轻量算力集群节点](https://support.huaweicloud.com/resmgmt-modelarts/umn-cluster-modelarts-0021.md): 在集群资源管理场景中,节点作为基础组成单元需要高效运维。为解决节点操作分散、资源信息查询不便等问题,ModelArts在资源池详情页提供"节点管理"页签,支持通过该页签执行节点删除、重置、续费等全生命周期管理操作。系统通过交互优化设计,当用户将鼠标悬停在节点名称时,自动显示资源ID,该标识符可直接用于账单查询或费用中心的包周期资源计费信息 - [扩缩容轻量算力集群](https://support.huaweicloud.com/resmgmt-modelarts/umn-cluster-modelarts-0022.md): 当轻量算力集群创建完成,使用一段时间后,由于用户业务的变化,对于资源池资源量的需求可能会产生变化,面对这种场景,ModelArts 轻量算力集群提供了扩缩容功能,用户可以根据需求动态调整资源。对已有规格实例数扩缩容,即增加或减少资源池已有规格的实例数量,增加实例数即扩容,减少实例数即缩容。扩缩容规格实例数适用于调整资源池的整体规模,减少资 - [升级轻量算力集群驱动](https://support.huaweicloud.com/resmgmt-modelarts/umn-cluster-modelarts-0023.md): 当轻量算力集群中的节点含有GPU/Ascend资源时,资源池节点性能如果无法满足现有业务,升级驱动可以修复已知问题、提升性能或者支持新功能,确保资源池性能和兼容性得到优化。ModelArts提供升级轻量算力集群GPU/Ascend驱动的功能,您可根据自身业务需要通过ModelArts控制台升级轻量算力集群内节点池的GPU/Ascend驱动 - [升级轻量算力集群单个节点驱动](https://support.huaweicloud.com/resmgmt-modelarts/umn-cluster-modelarts-0028.md): 当轻量算力集群中的节点含有GPU/Ascend资源时,资源池节点性能如果无法满足现有业务,升级驱动可以修复已知问题、提升性能或者支持新功能,确保资源池性能和兼容性得到优化。ModelArts提供升级轻量算力集群GPU/Ascend驱动的功能,您可根据自身业务需要通过ModelArts控制台升级轻量算力集群GPU/Ascend驱动。轻量算力 - [使用AOM查看轻量算力集群监控指标](https://support.huaweicloud.com/resmgmt-modelarts/umn-cluster-modelarts-0025.md): ModelArts 轻量算力集群会定期收集资源池中各节点的关键资源(GPU、NPU、CPU、Memory等)的使用情况并上报到AOM,用户可直接在AOM上查看默认配置好的基础指标,也支持用户自定义一些指标项上报到AOM查看。此外,还支持在ModelArts 轻量算力集群上安装Prometheus开源监控工具,方便用户使用Prometheu - [使用Prometheus查看轻量算力集群监控指标](https://support.huaweicloud.com/resmgmt-modelarts/umn-cluster-modelarts-0026.md): Prometheus是一款开源监控工具,ModelArts支持Exporter功能,方便用户使用Prometheus等第三方监控系统获取ModelArts采集到的指标数据。本章节主要介绍如何通过Prometheus查看轻量算力集群监控指标。需要在ModelArts 轻量算力集群详情页的配置管理页面中先打开监控开关。开通此功能后,兼容Pro - [事件中心页面授权运维](https://support.huaweicloud.com/resmgmt-modelarts/umn-cluster-modelarts-0032.md): 华为云会对节点的软硬件设备进行故障检测和日常运维,当节点由于不可恢复故障需要进行硬件维护时,会推送计划事件到控制台的事件中心。您可以在事件中心,查看具体的事件信息、事件类型、事件状态、事件描述等信息,可以授权华为技术支持对故障节点进行运维或重部署节点。系统维护: 系统维护操作要对主机下电维修,需要运维人员在机房实际重新插拔设备或更换备机, - [释放轻量算力集群资源](https://support.huaweicloud.com/resmgmt-modelarts/umn-cluster-modelarts-0027.md): 针对不再使用的轻量算力集群资源,可以释放资源,停止计费相关介绍请见停止计费。删除资源池,会同步删除资源池中按需计费的关联资源,且删除操作无法恢复,请谨慎操作。资源池中的包周期节点需要单独退订或者释放。删除轻量算力集群,会同步删除资源池中的磁盘,磁盘上的数据会被清除,不可恢复,请谨慎操作。如果资源池中包含已开启删除锁的节点,删除资源池可能会 - [使用TMS标签实现资源分组管理](https://support.huaweicloud.com/resmgmt-modelarts/umn-cluster-modelarts_0063.md): ModelArts支持对接标签管理服务(Tag Management Service,简称TMS),在ModelArts中创建资源消耗性任务时,可以为这些任务配置标签,通过标签实现资源的多维分组管理。ModelArts支持配置标签的任务有:创建训练作业、创建Notebook、创建推理在线服务、创建ModelArts专属资源池、创建轻量算力 - [轻量算力集群插件概述](https://support.huaweicloud.com/resmgmt-modelarts/umn-cluster-modelarts-0034.md): ModelArts提供多种类型的插件,支持通过安装插件选择性扩展轻量算力集群功能,以满足业务需求。在创建专属资源池时,已默认安装的插件。资源池默认安装的插件不支持卸载。为确保集群稳定运行,平台将自动部署必要的系统组件(如 CoreDNS、metrics-server 等)。这些组件会占用一定的 CPU 与内存资源,请在规划时合理预留资源。 - [节点故障检测(ModelArts Node Agent)](https://support.huaweicloud.com/resmgmt-modelarts/umn-cluster-modelarts-0035.md): ModelArts节点故障检测是一款监控集群节点异常事件的插件,以及对接第三方监控平台功能的组件。每个k8s的资源池默认都会安装,它是一个在每个节点上运行的守护程序,可从不同的守护进程中搜集节点问题。创建专属资源池时自动安装。当前不支持用户自助升级。 - [指标监控插件(ModelArts Metrics Collector)](https://support.huaweicloud.com/resmgmt-modelarts/umn-cluster-modelarts-0041.md): 指标监控插件(ModelArts Metrics Collector)是默认内置插件,以节点守护程序运行,可采集节点及各类作业监控指标,并上报到AOM。指标列表请见使用AOM查看轻量算力集群监控指标。创建资源池时自动安装。不支持卸载。存量资源池,需要将节点故障检测(ModelArts Node Agent)插件版本升级到最新版本,自动安装 - [AI套件(NV GPU)](https://support.huaweicloud.com/resmgmt-modelarts/umn-cluster-modelarts-0036.md): AI套件(NV GPU)插件是支持在容器中使用GPU显卡的设备管理插件,集群中使用GPU节点时必须安装本插件。轻量算力集群资源开通时,仅实例规格类型选择“GPU”时自动安装。对节点池、节点的GPU驱动升级前,请您先将 AI 套件 - GPU 版本升级至1.2.24及以上。插件升级完成前,请勿进行GPU驱动升级,否则可能会导致驱动升级卡住或 - [AI套件(ModelArts Device Plugin)](https://support.huaweicloud.com/resmgmt-modelarts/umn-cluster-modelarts-0037.md): AI套件(ModelArts Device Plugin)是支持容器里使用huawei NPU设备的管理插件。创建专属资源池时,仅实例规格类型选择“Ascend”时自动安装。 - [Volcano调度器](https://support.huaweicloud.com/resmgmt-modelarts/umn-cluster-modelarts-0039.md): Volcano 是一个基于 Kubernetes 的批处理平台,提供了机器学习、深度学习、生物信息学、基因组学及其他大数据应用所需要而 Kubernetes 当下缺失的一系列特性。Volcano提供了高性能任务调度引擎、高性能异构芯片管理、高性能任务运行管理等通用计算能力,通过接入AI、大数据、基因、渲染等诸多行业计算框架服务终端用户,最 - [KubeInfer(ModelArts Infers Operator)](https://support.huaweicloud.com/resmgmt-modelarts/umn-cluster-modelarts_0083.md): 在AI应用开发与部署过程中,用户经常需要在创建专属资源池时集成特定的插件以支持模型推理等关键功能。然而,传统的插件安装方式往往需要手动配置,不仅耗时费力,还容易出错,影响AI应用的快速上线。为了提升用户体验,华为云ModelArts平台在创建专属资源池,选择新版推理作业时,支持KubeInfer(ModelArts Infers Oper - [使用CTS审计专属资源池和轻量算力集群服务操作](https://support.huaweicloud.com/resmgmt-modelarts/umn-cluster-modelarts_0091.md): ModelArts专属资源池和轻量算力集群支持对接云审计CTS服务,通过云审计服务,您可以记录与ModelArts专属资源池和轻量算力集群相关的操作事件,便于日后的查询、审计和回溯。云审计服务管理控制台保存最近7天的ModelArts专属资源池和轻量算力集群的操作记录。已开通云审计服务。详细操作请参见《云审计服务用户指南》。登录CTS云审 ## 权限管理 - [ModelArts权限管理基本概念](https://support.huaweicloud.com/permission-modelarts/modelarts_24_0078.md): ModelArts作为一个完备的AI开发平台,支持用户对其进行细粒度的权限配置,以达到精细化资源、权限管理之目的。这类特性在大型企业用户的使用场景下很常见,但对个人用户则显得复杂而意义不足,所以建议个人用户在使用ModelArts时,参照快速配置ModelArts委托授权来进行初始权限设置。您是否需要阅读本文档?如果下述问题您的任何一个回 - [IAM](https://support.huaweicloud.com/permission-modelarts/modelarts_24_0080.md): 介绍ModelArts所有功能涉及到的IAM权限配置。如果您需要为企业中的员工设置不同的权限访问ModelArts资源,以达到不同员工之间的权限隔离,您可以使用统一身份认证服务(Identity and Access Management,简称IAM)进行精细的权限管理。该服务提供用户身份认证、权限分配、访问控制等功能,可以帮助您安全的控 - [依赖和委托](https://support.huaweicloud.com/permission-modelarts/modelarts_24_0081.md): 功能依赖策略项您在使用ModelArts的过程中,需要和其他云服务交互,比如需要在提交训练作业时选择指定数据集OBS路径和日志存储OBS路径。因此管理员在为用户配置细粒度授权策略时,需要同时配置依赖的权限项,用户才能使用完整的功能。如果您使用根用户(与账户同名的缺省子用户)使用ModelArts,根用户默认拥有所有权限,不再需要单独授权。 - [工作空间](https://support.huaweicloud.com/permission-modelarts/modelarts_24_0082.md): ModelArts的用户需要为不同的业务目标开发算法、管理和部署模型,此时可以创建多个工作空间,把不同应用开发过程的输出内容划分到不同工作空间中,便于管理和使用。工作空间支持3种访问控制:PUBLIC:租户(主账号和所有子账号)内部公开访问。PRIVATE:仅创建者和主账号可访问。INTERNAL:创建者、主账号、指定IAM子账号可访问当 - [快速配置ModelArts委托授权](https://support.huaweicloud.com/permission-modelarts/modelarts_24_0085.md): 为了完成AI计算的各种操作,AI平台ModelArts在任务执行过程中需要访问用户的其他服务,典型的就是训练过程中,需要访问OBS读取用户的训练数据。在这个过程中,就出现了ModelArts服务“代表”用户去访问其他云服务的情形。从安全角度出发,ModelArts服务代表用户访问任何云服务之前,均需要先获得用户的委托,而这个动作就是一个用 - [创建IAM用户并授权使用ModelArts](https://support.huaweicloud.com/permission-modelarts/permission-modelarts-007.md): 快速配置ModelArts委托授权章节中介绍的一键式自动授权方式创建的委托的权限比较大,基本覆盖了依赖服务的全部权限。如果华为云账号已经能满足您的要求,不需要创建独立的IAM用户,您可以跳过本章节,不影响您使用ModelArts服务的其他功能。ModelArts作为一个完备的AI开发平台,支持用户对其进行细粒度的权限配置,以达到精细化资源 - [创建和管理工作空间](https://support.huaweicloud.com/permission-modelarts/umn-standard-modelarts-0005.md): ModelArts的工作空间是为企业客户提供的高阶功能,用于将资源划分为多个逻辑隔离的空间,并支持以空间维度进行访问权限的限定。开通工作空间后,系统会默认创建一个“default”空间,用户之前创建的所有资源均在此空间下。用户可以创建多个工作空间,每个新工作空间相当于一个独立的“ModelArts分身”,不同工作空间之间互不影响,便于管理 - [场景描述](https://support.huaweicloud.com/permission-modelarts/modelarts_10_0062.md): ModelArts作为顶层服务,其部分功能依赖于其他服务的访问权限。本章节主要介绍对于IAM子账号使用ModelArts时,如何根据需要开通的功能配置子账号相应权限。子账号的权限,由主用户来控制,主用户通过IAM的权限配置功能设置用户组的权限,从而控制用户组内的子账号的权限。此处的授权列表均按照ModelArts和其他服务的系统预置策略来 - [Step1 创建用户组并加入用户](https://support.huaweicloud.com/permission-modelarts/modelarts_24_0089.md): 主用户账号下面可以创建多个子账号,并对子账号的权限进行分组管理。此步骤介绍如何创建用户组、子账号、并将子账号加入用户组中。主用户登录统一身份认证服务管理控制台。统一身份认证创建用户组。在左侧菜单栏中,选择用户组。单击右上角创建用户组,在用户组名称中填入用户组02,然后单击确定完成用户组创建。创建完成后,返回用户组列表。通过用户组管理,将已 - [Step2 为用户配置云服务使用权限](https://support.huaweicloud.com/permission-modelarts/modelarts_24_0090.md): 主用户为子账号授予ModelArts、OBS等云服务的使用权限后,子账号才可以使用这些云服务。此步骤介绍如何为用户组中的所有子账号授予使用ModelArts、OBS、SWR等各类云服务的权限。主用户在IAM服务的用户组列表页面,单击授权,进入到授权页面,为子账号配置权限。为用户组授权配置授权前,请先了解ModelArts各模块使用到的最小 - [Step3 为用户配置ModelArts的委托访问授权](https://support.huaweicloud.com/permission-modelarts/modelarts_24_0091.md): 配置完IAM权限之后,需要在ModelArts页面为子用户设置ModelArts访问授权,允许ModelArts访问OBS、SWR、IEF等依赖服务。此方式只允许主用户为子用户进行配置,但拥有admin权限的子用户也可以配置委托授权。本示例中,管理员账号需为子用户完成访问授权的配置。使用主用户的账号登录ModelArts控制台。请注意选择 - [Step4 测试用户权限](https://support.huaweicloud.com/permission-modelarts/modelarts_24_0092.md): 由于4中的权限需要等待15-30分钟生效,建议在配置完成后,等待30分钟,再执行如下验证操作。使用用户组02中任意一个子账号登录ModelArts控制台。在登录页面,请使用“IAM用户登录”方式进行登录。首次登录会提示修改密码,请根据界面提示进行修改。首次登录会提示修改密码,请根据界面提示进行修改。验证ModelArts权限。在左上角选择 - [给子账号配置开发环境基本使用权限](https://support.huaweicloud.com/permission-modelarts/modelarts_24_00134.md): 本文介绍开发环境场景下子账号所需的基本使用权限,您可参考权限清单新增对应业务场景的权限。示例场景为授权子账号使用Notebook进行调试,数据和代码存放在并行文件系统。以下内容需使用管理账号进行配置。权限开发环境所需权限业务场景依赖的服务依赖策略项支持的功能配置建议开发环境实例生命周期管理ModelArtsmodelarts:notebo - [给子账号配置训练作业基本使用权限](https://support.huaweicloud.com/permission-modelarts/modelarts_24_00135.md): 本文介绍训练作业场景下子账号所需的基本使用权限,您可参考权限清单新增对应业务场景的权限。示例场景为授权子账号使用自定义镜像训练,数据和代码存放在OBS桶中。以下内容需使用管理账号进行配置。权限训练作业所需权限业务场景依赖的服务依赖策略项支持的功能配置建议训练管理ModelArtsmodelarts:trainJob:*modelarts: - [给子账号配置推理(新版)基本使用权限](https://support.huaweicloud.com/permission-modelarts/inference2.0-modelarts-0036.md): 本文介绍推理部署场景下子账号所需的基本使用权限。示例场景为授权子账号权限,使其能够在ModelArts控制台的在线服务(新版)功能中部署推理服务。本案例场景为将镜像上传至SWR,并在ModelArts控制台的在线服务(新版)功能中部署推理服务。添加部署上线使用权限。策略名称:设置自定义策略名称,例如:service。策略配置方式:选择JS - [给子账号配置推理(旧版)基本使用权限](https://support.huaweicloud.com/permission-modelarts/modelarts_24_00136.md): 本文介绍推理部署场景下子账号所需的基本使用权限,您可参考权限清单新增对应业务场景的权限。示例场景为授权子账号权限,使其能够在开发环境Notebook中使用基础镜像构建一个新的推理镜像,并完成模型的创建,在ModelArts控制台的在线服务(旧版)功能中部署推理服务。权限管理模型所需权限业务场景依赖的服务依赖策略项支持的功能配置建议管理模型 - [管理员和开发者权限分离](https://support.huaweicloud.com/permission-modelarts/modelarts_24_0093.md): 对于中小规模团队,管理员希望对ModelArts资源进行主导分配,全局控制,而对于普通开发者只需关注自己实例的生命周期控制。对于开发者账号,一般不会具有te_admin的权限,相应的权限也需要主账号进行统一配置。本章节以使用Notebook进行项目开发为例,通过自定义策略配置实现管理员和开发者分离。以使用Notebook进行项目开发为例, - [给子账号配置查看所有Notebook实例的权限](https://support.huaweicloud.com/permission-modelarts/modelarts_24_0095.md): Notebook页面展示了所有创建的实例。如果需要查找特定的实例,可根据筛选条件快速查找。查看所有Notebook实例:参考给子账号配置查看所有Notebook实例的权限后,进入Notebook页面,选择“全部”,可以看到IAM项目下所有子账号创建的Notebook实例。查看所有筛选Notebook实例:在页面上方,单击计费中或运行中,可 - [使用Cloud Shell登录训练容器](https://support.huaweicloud.com/permission-modelarts/modelarts_24_0096.md): 允许用户使用ModelArts控制台提供的Cloud Shell登录运行中的训练容器。仅专属资源池支持使用Cloud Shell,且训练作业必须处于运行中状态。使用主用户账号登录华为云的管理控制台,单击右上角用户名,在下拉框中选择统一身份认证,进入统一身份认证(IAM)服务。在统一身份认证服务页面的左侧导航选择权限管理 > 权限,单击右上 - [不允许子账号使用公共资源池创建作业](https://support.huaweicloud.com/permission-modelarts/modelarts_24_0097.md): 本章节介绍如何控制ModelArts用户权限,限制用户使用ModelArts公共资源池的资源创建训练作业、创建开发环境实例,部署推理服务等。对于ModelArts专属资源池的用户,不允许使用公共资源池创建训练作业、创建Notebook实例或者部署推理服务时,可以通过权限控制限制用户使用公共资源池。涉及配置的自定义权限策略项如下:model - [委托授权ModelArts云服务使用SFS Turbo](https://support.huaweicloud.com/permission-modelarts/modelarts_24_0133.md): 本章节介绍如何配置ModelArts委托权限,允许用户使用专属资源池的网络中的关联sfsturbo和解除关联功能。当用户新增委托并授权操作SFS Turbo时,请参考新增委托授权操作SFS Turbo。当用户为已有的委托新增权限,授权操作SFS Turbo,请参考已有委托新增授权操作SFS Turbo。对于使用ModelArts专属资源池 - [给子账号配置文件夹级的SFS Turbo访问权限](https://support.huaweicloud.com/permission-modelarts/modelarts_24_0137.md): 本文介绍如何配置文件夹级的SFS Turbo访问权限,实现在ModelArts中访问挂载的SFS Turbo时,只允许子账号访问特定的SFS Turbo文件夹内容。给子账号配置文件夹级的SFS Turbo访问权限为白名单功能,如果有试用需求,请提工单申请权限。需要在ModelArts控制台打开严格授权模式。新创建的账号默认开启严格授权模式 - [使用ModelArts时提示“权限不足”,如何解决?](https://support.huaweicloud.com/permission-modelarts/modelarts_05_0148.md): 当您使用ModelArts时如果提示权限不足,请您按照如下指导对相关服务和用户进行授权,并检查用户权限。本案例中以OBS权限不足为例,介绍如何为用户授予OBS服务权限。其他权限不足的场景也可以参考本案例操作,只是授权范围不同。不同业务场景下的授权范围请参考权限依赖和委托章节。由于ModelArts的使用权限依赖OBS服务的授权,您需要为用 ## 最佳实践 - [ModelArts最佳实践案例列表](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_0014.md): 在最佳实践文档中,提供了针对多种场景、多种AI引擎的ModelArts案例,方便您通过如下案例快速了解使用ModelArts完成AI开发的流程和操作。本文档中提供的所有实践案例,仅适用于功能验证、原型测试等场景。鉴于生产环境对高可用、安全合规、可观测性及运维管控的严苛要求,请勿直接将本文档中的案例用于业务生产环境。 - [模型能力地图](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_04_0235.md): 本章节介绍ModelArts平台适配验证过的推理模型(基于Ascend-vLLM框架)。来源于第三方开源社区或用户自备模型,ModelArts平台无法保证这些模型的性能和能力,请酌情使用。 - [Notebook OpenClaw风险说明及安全建议](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_0048.md): OpenClaw(原名Moltbot、Clawdbot)作为一种能够持续运行的AI智能体,能调用多种大型语言模型,并作为网关,使用户可以通过通讯软件与多个AI模型进行交互,无需在不同平台之间切换,从而简化了操作流程。Notebook是容器运行时环境,运行环境会在关机时被清理。请通过保存镜像及时保留npm install、apt-get i - [在Notebook中安装配置OpenClaw](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_0038.md): 对于AI开发人员来说,如果需要在华为云ModelArts Notebook中高效地编写和管理AI模型,可能会遇到代码编写效率低、模型管理复杂的问题。本文介绍如何在华为云ModelArts Notebook中部署并使用OpenClaw。OpenClaw是一个开源的AI编程助手,可以运行在ModelArts Notebook实例中,通过浏览器 - [使用OpenClaw开发贪吃蛇](https://support.huaweicloud.com/bestpractice-modelarts/develop-modelarts-0119.md): 对于希望快速开发前端小游戏或工具页面的开发者来说,手动编写大量代码不仅耗时而且容易出错。使用ModelArts Notebook中的OpenClaw工具,可以通过自然语言提示词快速生成并迭代一个网页版贪吃蛇游戏。OpenClaw是ModelArts Notebook内置的AI Agent开发工具,能够根据用户输入的自然语言提示词自动生成代 - [使用OpenClaw快速集成飞书AI助手](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_0046.md): 在传统AI助手仅能提供文本建议的局限性下,OpenClaw作为开源本地优先的智能体执行框架,创新性地实现了大语言模型与本地系统的深度整合。该框架通过自然语言指令驱动文件系统操作、Shell命令执行、浏览器控制及API调用等多模态交互能力,使AI从"只会说"升级为"能动手做"。华为云已开放OpenClaw体验计划,本文重点指导开发者在Mod - [Cline风险说明及安全建议](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_20_0003.md): 本文介绍使用Cline时可能出现的风险、影响及应对策略。 - [在Code Server中配置Cline](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_20_0004.md): Cline是集成在Code Server中的AI编程助手,能够根据自然语言描述自动完成代码编写、文件创建、服务启动等开发任务。本文介绍如何在ModelArts Notebook的Code Server配置Cline。Cline通过连接大模型API获取智能推理能力,用户在对话框中输入自然语言需求后,Cline会调用配置的大模型进行理解,并自 - [使用Cline进行模型训练](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_20_00013.md): Code Server是一个开源项目,它将Visual Studio Code完整运行在远程服务器上,并通过浏览器提供访问能力。主要支持以下能力:完整VS Code体验:支持扩展市场、调试器、终端、Git等几乎所有原生功能。跨平台访问:只需浏览器即可在任何设备上编写代码。统一开发环境:代码、配置和依赖项均部署在服务器上,确保环境一致性。私 - [使用Cline开发贪吃蛇和华容道](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_20_00014.md): 本文通过一个完整的实战案例——使用Cline开发贪吃蛇和华容道小游戏,演示从需求描述到项目运行的全流程。您将体验Cline如何根据自然语言需求自主完成代码编写、文件创建和服务启动。Cline项目实践的核心流程为:用户描述需求→Cline自主执行(创建文件、编写代码、启动服务)→用户通过端口转发访问验证→迭代优化。Cline会将您的自然语言 - [Cline高级功能](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_20_00015.md): Cline提供了多种高级功能,帮助您提升开发效率和代码质量。本文档将介绍六项核心技巧:Rules(项目规则)、Workflows(自动化工作流)、MCP Servers(能力扩展)、Skills(技能包)、Hooks(钩子机制)和@提及(上下文引用)。Rules是Cline的项目级持久化规则,相当于给Cline写一份“行为守则”。每次对话 - [Hermes风险说明及安全建议](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_20_00042.md): Hermes是NousResearch开源的AI智能体,原生提供桌面应用、Web Dashboard、CLI、TUI等多种交互界面,并支持iMessage、Telegram、Discord、Slack等22个消息平台接入。其核心能力涵盖20+模型提供商接入、代码编写与编辑、终端命令执行、联网搜索、持久记忆(Memory)、技能复用(Ski - [在Notebook中安装配置Hermes](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_20_00018.md): 对于AI开发人员来说,如果需要在华为云ModelArts Notebook中高效地编写和管理AI模型,可能会遇到代码编写效率低、模型管理复杂的问题。本文介绍如何在华为云ModelArts Notebook中部署并使用Hermes。Hermes是NousResearch开源的AI智能体,本文提供的安装脚本已针对ModelArts环境进行适配 - [Hermes自进化:从执行任务到自动学习Skill](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_20_00019.md): 本文介绍Hermes的Skill自进化机制:将完成过的工作流程保存为可复用的Skill模板,实现从“手动执行”到“一键复用”的效率跃迁,并通过迭代优化Skill持续提升输出质量。已安装配置Hermes。具体操作,请参见在Notebook中安装配置Hermes。Skill是Hermes的核心自进化机制。当Hermes完成一项任务后,可以将整 - [OpenCode风险说明及安全建议](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_20_00021.md): OpenCode是运行于终端的AI编程智能体,作为一种交互式CLI工具,能调用多种大型语言模型,并集成了代码仓管理、需求追踪、缺陷分析、代码检视等研发工具链。用户可以通过自然语言指令完成代码编写、问题定位、架构分析等全流程研发活动,无需在不同工具平台之间切换,从而简化了开发操作流程。Notebook是容器运行时环境,运行环境会在关机时被清 - [在Notebook中安装配置OpenCode](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_20_00022.md): 对于AI开发人员来说,日常工作中经常需要在华为云ModelArts Notebook中编写和管理AI模型。然而,在实际操作中,开发人员可能会遇到代码编写效率低、模型管理复杂的问题,这直接影响了开发进度和项目质量。如何解决这些问题,提高开发效率和简化模型管理呢?本文介绍如何在华为云ModelArts Notebook中部署并使用OpenCo - [在OpenCode配置代理](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_20_00023.md): 在日常开发过程中,开发人员经常需要处理各种任务和工作流程,但现有的工具和助手往往无法满足所有需求,导致效率低下。例如,在处理复杂的数据处理任务时,现有的工具可能无法提供足够的支持,导致开发人员需要手动编写大量代码,耗时且容易出错。如何使用AI助手提高开发效率?本文介绍OpenCode的代理机制,包括内置代理的功能和使用方式,以及如何创建自 - [ModelArts Skill概述](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_20_00025.md): ModelArts-Skill是华为云ModelArts平台的智能体技能包,将ModelArts全量API封装为200多个可调用函数,覆盖Notebook、资源池、节点池、训练任务、推理服务、工作空间、镜像仓库、VPC、KMS、Lite Server等 12 个功能模块。安装AI助手时默认携带此技能包,无需单独安装。在拥有ModelArt - [使用AI助手在线管理Notebook](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_0040.md): 在华为云ModelArts平台上,数据科学家和AI开发者经常需要高效地管理Notebook实例,以支持机器学习模型的开发和测试。然而,手动管理这些实例可能会导致资源浪费和操作效率低下。如何通过自动化工具提高Notebook实例管理的效率和准确性?本文以OpenClaw为例(其他AI助手使用ModelArts Skill方式相同),介绍如何 - [使用AI助手自动保存Notebook镜像](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_0042.md): 在使用ModelArts Notebook进行深度学习模型训练时,用户经常需要手动保存Notebook镜像,这不仅耗时而且容易忘记,导致工作进度丢失。为了解决这一问题,如何实现定时自动保存Notebook镜像功能成为了用户关注的焦点。本文将以OpenClaw为例(其他AI助手使用ModelArts Skill方式相同),介绍如何在Mode - [使用AI助手在线部署推理服务](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_0043.md): 在AI模型开发过程中,开发者经常需要将训练好的模型快速部署为在线服务,以供应用程序调用。然而,传统的部署方式往往需要编写复杂的代码和配置,这不仅增加了开发者的负担,也延长了模型上线的时间。如何简化这一过程,提高模型部署的效率?本文以OpenClaw为例(其他AI助手使用ModelArts Skill方式相同),介绍如何在ModelArts - [使用AI助手在线创建训练作业](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_0044.md): 在传统AI助手仅能提供文本建议的局限性下,当前很多主流开源本地优先的智能体执行框架,创新性地实现了大语言模型与本地系统的深度整合。该框架通过自然语言指令驱动文件系统操作、Shell命令执行、浏览器控制及API调用等多模态交互能力,使AI从“只会说”升级为“能动手做”。本文以OpenClaw为例(其他AI助手使用ModelArts Skil - [使用AI助手在线管理专属资源池](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_0045.md): 在使用华为云ModelArts进行机器学习项目时,用户可能会遇到资源管理的挑战,如资源分配不均、作业执行效率低下等问题。为了提高资源利用率和作业执行效率,您可以使用OpenClaw(或其他AI助手)+ModelArts Skill创建专属资源池,通过该工具,您可以轻松地进行资源池的扩容、缩容以及修改支持的作业范围等操作,从而优化资源管理, - [使用AI助手处理ModelArts典型开发与运维场景](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_20_00026.md): 在ModelArts的日常开发与运维中,开发人员和运维人员经常需要处理资源清理、作业状态巡检以及跨时段调度等重复性工作,这些任务不仅耗时而且容易出错。面对这些挑战,如何高效地完成这些任务成为了一个亟待解决的问题。本文将为您提供一套以OpenClaw为例的最佳实践——本文整理了多个高频真实业务场景的“标准提示词模板”。您无需重新编写复杂的P - [推理入门:一键完成DeepSeek-V4-Flash模型部署](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_ds4_001.md): DeepSeek-V4-Flash模型正式发布并开源。DeepSeek-V4-Flash拥有百万Token超长上下文,在Agent能力、世界知识和推理性能上均实现国内与开源领域的领先,且模型参数下降至284B,推理成本进一步降低。为方便您快速部署模型,本案例介绍如何在ModelArts控制台一键部署DeepSeek-V4-Flash模型。 - [推理入门:一键完成GLM-5.1模型部署](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_glm51_001.md): GLM-5.1是智谱清言最新代旗舰MoE基础模型w8a8量化版本,在编程与长程智能体任务上实现SOTA性能全新跃升。为方便您快速部署该模型,ModelArts控制台推出了一键部署该模型案例。借助ModelArts提供的丰富的开源模型及推理框架,您可通过简单表单配置,快速开启模型部署。GLM-5.1模型支持能力参见模型能力说明。本案例以As - [推理入门:一键完成GLM-5模型部署](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_06_0009.md): 为了降低用户的使用门槛,增强用户体验,ModelArts控制台推出了一键部署案例,ModelArts提供丰富的开源模型及推理框架,可通过简单表单配置,快速开启模型部署。本案例以Ascend-vLLM框架一键部署GLM-5模型为例,介绍ModelArts一键部署服务并调用的全流程。GLM-5是智谱AI发布的新一代开源旗舰大模型,主打复杂系统 - [GLM-5模型基于ModelArts轻量算力节点适配NPU推理指导](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_glm5_server_infer_0001.md): 本文主要介绍如何在ModelArts的轻量算力节点环境中,部署GLM-5模型并使用NPU卡Snt9b23进行推理。GLM-5是智谱AI发布的新一代开源旗舰大模型,主打复杂系统工程与长程智能体任务,在编程与Agent能力上获得开源SOTA表现。确保容器可以访问公网。请参考轻量算力节点资源开通,购买轻量算力节点资源,并确保机器已开通,密码已获 - [从vLLM-Ascend开源社区获取模型部署在ModelArts推理平台](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_3121.md): 通过vllm-ascend推理框架结合ModelArts推理平台的在线服务部署能力,实现开源大模型在昇腾NPU环境下的快速部署与推理,适用于GLM、Qwen、DeepSeek等开源大语言模型的推理部署场景。本部署指导方案基于vLLM-Ascend开源社区提供的模型,仅适用于功能验证、原型测试等场景,鉴于生产环境对高可用、安全合规、可观测性 - [Ascend-vLLM介绍](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5908001.md): vLLM是GPU平台上广受欢迎的大模型推理框架,因其高效的continuous batching和pageAttention功能而备受青睐。此外,vLLM还具备投机推理和自动前缀缓存等关键功能,使其在学术界和工业界都得到了广泛应用。Ascend-vLLM是华为云针对NPU优化的推理框架,继承了vLLM的优点,并通过特定优化实现了更高的性能 - [支持的模型列表](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5908002.md): 说明:以下模型能力与开源社区保持一致,未做其他额外能力增强Qwen3-Embedding-8B、Qwen3-Reranker-8B、bge-large-en-v1.5各模型支持的卡数请参见各模型支持的最小卡数和最大序列章节。 - [各模型支持的最小卡数和最大序列](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5908003.md): 基于vLLM部署推理服务时,不同模型推理支持的最小昇腾卡数和对应卡数下的max-model-len长度说明,如下面的表格所示。以下值是在gpu-memory-utilization为0.95时测试得出,为服务部署所需的最小昇腾卡数及该卡数下推荐的最大max-model-len长度,不代表最佳性能。以Qwen3-8B为例,NPU卡显存为64 - [版本说明和要求](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5908004.md): 本文档支持昇腾云6.5.906及以后版本。推荐使用最新版本配套的软件包和镜像。本文档中的模型运行环境是ModelArts Lite的弹性节点Server。推荐使用西南-贵阳一Region上的资源和Ascend Snt9b和Snt9b23。请参考轻量算力节点资源开通,购买轻量算力节点资源,并确保机器已开通,密码已获取,能通过SSH登录,不同 - [准备推理环境](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5908006.md): 准备一台Linux服务器用于构建镜像。安装过程需要连接互联网git clone,确保容器可以访问公网。SSH登录机器后,检查NPU设备状态。运行如下命令,返回NPU设备信息。npu-smi info # 在每个实例节点上运行此命令可以看到NPU卡状态 npu-smi info -l | grep To - [启动推理服务(大语言模型)](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5908007.md): 本章节主要介绍大语言模型的推理服务启动方式,包括离线推理和在线推理2种方式。无论是离线推理还是在线推理方式,以下的框架通用环境变量都需要设置。框架通用环境变量如下:编辑一个python脚本offline_inference.py,脚本内容如下,运行该脚本使用ascend-vllm进行模型离线推理。脚本中,未标注释部分,请勿更改。参数说明: - [启动推理服务(Embedding&Rerank)](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5908008.md): 本章节主要介绍大语言模型的推理服务Embedding&Rerank启动方式,包括离线推理和在线推理2种方式。无论是离线推理还是在线推理方式,以下的框架通用环境变量都需要设置。框架通用环境变量如下:编辑一个embeddings python脚本embeddings_offline_inference.py,脚本内容如下,运行该脚本使用asc - [W8A8量化](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5908013.md): W8A8量化是一种将模型权重和激活值都量化为8位数据的技术。该技术把高位浮点数转为8位,通常是将权重和激活值从16位或32位浮点数转换为8位整数(int8)格式。量化后,模型权重体积会减少,同时使用int8格式数据进行矩阵乘法(MatMul)运算时,可减少计算量,进而提升推理性能。W8A8量化方案能降低模型显存以及需要部署的卡数。也能同时 - [Prefix Caching](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5908014.md): 在LLM推理应用中,经常会面临具有长system prompt的场景以及多轮对话的场景。长system prompt的场景,system prompt在不同的请求中但是相同的,KV Cache的计算也是相同的;多轮对话场景中,每一轮对话需要依赖所有历史轮次对话的上下文,历史轮次中的KV Cache在后续每一轮中都要被重新计算。这两种情况下 - [投机推理使用说明](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5908016.md): 传统LLM推理主要依赖于自回归式(auto-regressive)的解码(decoding)方式,每步解码只能够产生一个输出token,并且需要将历史输出内容拼接后重新作为LLM的输入,才能进行下一步的解码。为了解决上述问题,提出了一种投机式推理方式,其核心思想是通过计算代价远低于LLM的小模型替代LLM进行投机式的推理(Speculat - [N-Gram投机](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5908017.md): N-Gram投机是一种优化推理性能的技术,主要用于加速大语言模型(LLM)的生成过程。它通过 N-Gram 匹配 来预测后续可能的 token,减少模型的计算量,从而提高生成速度。适用场景:长文本生成(如故事、代码补全)。高重复性任务(如批量问答、翻译)。不适用场景:短文本生成(投机收益不明显)。高随机性任务(如创意写作,N-Gram 匹 - [大小模型投机推理](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5908018.md): 大小模型投机是一种优化推理性能的技术,主要用于加速大语言模型(LLM)的生成过程。大小模型投机是一种利用小模型快速生成候选 token 序列,再由大模型进行验证的推理加速技术。小模型负责“投机”生成若干 token,大模型则并行验证这些 token 的合理性。如果候选 token 被接受,则跳过部分计算;否则回退到第一个错误位置重新生成。 - [Eagle/Eagle3投机推理](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5908019.md): 相比大小模型投机,Eagle/Eagle3投机仅有一层模型参数,同时使用历史生成的token和该token对应的hidden states作为投机模型的输入。这种方式提高了投机模型生成的效率。适用场景:对时延要求较高的场景。有专门的Eagle/Eagle3模型。需要配置相关环境变量后再使用,环境变量参考表1 Qwen Dense系列启动环 - [图模式](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5908020.md): AscendTurboGraph图模式是一种Capture-Replay架构的Host图,可以有效消除Host瓶颈,支持模型输入动态shape,无需分档构图,构图较快。未设置INFER_MODE环境变量时,即默认模式下,部分模型会默认使用ACLGraph图模式启动来提升性能。AscendTurboGraph图模式目前仅支持Qwen2、Qw - [Chunked Prefill](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5908021.md): Chunked Prefill(Splitfuse)特性的目的是将长prompt request分解成更小的块,并在多个forward step中进行调度,只有最后一块的forward完成后才开始这个prompt request的生成。将短prompt request组合以精确填充step的空隙,每个step的计算量基本相等,达到所有请求 - [Tool Calling](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5908023.md): 工具调用(Tool Calling,Function Calling,FC)是一种将大模型与外部工具和 API 相连的关键功能,作为自然语言与信息接口之间的“翻译官”,它能够将用户的自然语言请求智能地转化为对特定工具或 API 的调用,从而高效满足用户的特定需求。工作原理:开发者通过自然语言向模型描述工具的功能和定义,模型在对话过程中自主 - [Reasoning Outputs](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5908024.md): 支持Qwen3系列等思考模型,这些模型会生成包含推理步骤和最终结论的输出。Reasoning Outputs能力可以在输出中返回一个附加字段reasoning_content,其中包含导致最终结论的思考过程和推理步骤。Reasoning Outputs功能仅适用于OpenAI的/v1/chat/completions接口。在启动推理服务时 - [推理服务精度评测](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5908025.md): 本章节介绍了3种精度测评方式,分别为OpenCompass、Simple-evals工具和MME工具。OpenCompass工具支持20+HuggingFace和API模型,70+数据集的模型评估方案,约40万个问题,支持对各类大语言模型进行一站式评测。Simple-evals是一个用于评估语言模型的轻量级库,可用来评估的数据集为MMLU - [大语言模型推理性能测试](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5908027.md): 性能测试需要使用acs-bench工具。acs-bench prof命令主要用于LLM性能benchmark测试任务,支持给定数据长度和数量,在不同请求并发度的场景下对于Ascend vLLM服务进行性能测试,目前支持爬坡测试和性能压测两种模式。可以通过如下命令查看是否已经安装acs-bench工具。如已安装acs-bench工具,将输出 - [获取模型推理的Profiler数据](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5908029.md): PyTorch Profiler 是 PyTorch 官方提供的性能分析工具,用于深度剖析模型训练/推理过程中的性能瓶颈,帮助开发者优化计算效率、内存占用和硬件利用率。Ascend PyTorch Profiler 完全对标 PyTorch-GPU场景下的使用方式,支持采集PyTorch层算子信息、CANN层算子信息、底层NPU算子信息、 - [Ascend-vLLM推理常见问题](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5908032.md): 解决方法:调整推理服务启动时的显存利用率,将--gpu-memory-utilization的值调小。解决方法:允许传入大于模型config.json 中的序列最大值。解决方法:将block_size大小设置为128解决办法: - [参考:Structured Outputs](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5908022.md): Structured Outputs是指在大模型请求中通过用户给定的指定格式信息(如json格式,sql格式),生成严格符合格式要求的相关文本。Guided Decoding相关特性可以支持用户给定格式的文本生成。Guided Decoding是一种用于生成文本的策略,通过提供额外的上下文或约束,来引导模型生成更符合预期的结果。比如使用O - [Ascend-vLLM介绍](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5910001.md): vLLM是GPU平台上广受欢迎的大模型推理框架,因其高效的continuous batching和pageAttention功能而备受青睐。此外,vLLM还具备投机推理和自动前缀缓存等关键功能,使其在学术界和工业界都得到了广泛应用。Ascend-vLLM是华为云针对NPU优化的推理框架,继承了vLLM的优点,并通过特定优化实现了更高的性能 - [支持的模型列表](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5910002.md): 说明:以下模型能力与开源社区保持一致,未做其他额外能力增强Qwen3-Embedding-8B、Qwen3-Reranker-8B、bge-large-en-v1.5各模型支持的卡数请参见各模型支持的最小卡数和最大序列章节。 - [各模型支持的最小卡数和最大序列](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5910003.md): 基于vLLM部署推理服务时,不同模型推理支持的最小昇腾卡数和对应卡数下的max-model-len长度说明,如下面的表格所示。以下值是在gpu-memory-utilization为0.95时测试得出,为服务部署所需的最小昇腾卡数及该卡数下推荐的最大max-model-len长度,不代表最佳性能。以Qwen3-8B为例,NPU卡显存为64 - [版本说明和要求](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5910004.md): 本文档支持昇腾云6.5.906及以后版本。推荐使用最新版本配套的软件包和镜像。本文档中的模型运行环境是ModelArts 轻量算力节点。推荐使用Snt9b或Snt9b23资源。请参考轻量算力节点资源开通,购买轻量算力节点资源,并确保机器已开通,密码已获取,能通过SSH登录,不同机器之间网络互通。当容器需要提供服务给多个用户,或者多个用户共 - [准备推理环境](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5910006.md): 准备一台Linux服务器用于构建镜像。安装过程需要连接互联网git clone,确保容器可以访问公网。SSH登录机器后,检查NPU设备状态。运行如下命令,返回NPU设备信息。npu-smi info # 在每个实例节点上运行此命令可以看到NPU卡状态 npu-smi info -l | grep To - [启动推理服务(大语言模型)](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5910007.md): 本章节主要介绍大语言模型的推理服务启动方式,包括离线推理和在线推理2种方式。无论是离线推理还是在线推理方式,以下的框架通用环境变量都需要设置。框架通用环境变量如下:编辑一个python脚本offline_inference.py,脚本内容如下,运行该脚本使用ascend-vllm进行模型离线推理。脚本中,未标注释部分,请勿更改。参数说明: - [启动推理服务(Embedding&Rerank)](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5910008.md): 本章节主要介绍大语言模型的推理服务Embedding&Rerank启动方式,包括离线推理和在线推理2种方式。无论是离线推理还是在线推理方式,以下的框架通用环境变量都需要设置。框架通用环境变量如下:编辑一个embeddings python脚本embeddings_offline_inference.py,脚本内容如下,运行该脚本使用asc - [W4A16量化](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5910012.md): 大模型推理中,模型权重数据类型(weight),推理计算时的数据类型(activation)和kvcache一般使用半精度浮点FP16或BF16。量化指将高比特的浮点转换为更低比特的数据类型的过程。例如int4、int8等。模型量化分为weight-only量化,weight-activation量化和kvcache量化。量化的一般步骤是 - [W8A8量化](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5910013.md): W8A8量化是一种将模型权重和激活值都量化为8位数据的技术。该技术把高位浮点数转为8位,通常是将权重和激活值从16位或32位浮点数转换为8位整数(int8)格式。量化后,模型权重体积会减少,同时使用int8格式数据进行矩阵乘法(MatMul)运算时,可减少计算量,进而提升推理性能。W8A8量化方案能降低模型显存以及需要部署的卡数。也能同时 - [Prefix Caching](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5910014.md): 在LLM推理应用中,经常会面临具有长system prompt的场景以及多轮对话的场景。长system prompt的场景,system prompt在不同的请求中但是相同的,KV Cache的计算也是相同的;多轮对话场景中,每一轮对话需要依赖所有历史轮次对话的上下文,历史轮次中的KV Cache在后续每一轮中都要被重新计算。这两种情况下 - [投机推理使用说明](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5910016.md): 传统LLM推理主要依赖于自回归式(auto-regressive)的解码(decoding)方式,每步解码只能够产生一个输出token,并且需要将历史输出内容拼接后重新作为LLM的输入,才能进行下一步的解码。为了解决上述问题,提出了一种投机式推理方式,其核心思想是通过计算代价远低于LLM的小模型替代LLM进行投机式的推理(Speculat - [N-Gram投机](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5910017.md): N-Gram投机是一种优化推理性能的技术,主要用于加速大语言模型(LLM)的生成过程。它通过 N-Gram 匹配 来预测后续可能的 token,减少模型的计算量,从而提高生成速度。适用场景:长文本生成(如故事、代码补全)。高重复性任务(如批量问答、翻译)。不适用场景:短文本生成(投机收益不明显)。高随机性任务(如创意写作,N-Gram 匹 - [大小模型投机推理](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5910018.md): 大小模型投机是一种优化推理性能的技术,主要用于加速大语言模型(LLM)的生成过程。大小模型投机是一种利用小模型快速生成候选 token 序列,再由大模型进行验证的推理加速技术。小模型负责“投机”生成若干 token,大模型则并行验证这些 token 的合理性。如果候选 token 被接受,则跳过部分计算;否则回退到第一个错误位置重新生成。 - [Eagle/Eagle3投机推理](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5910019.md): 相比大小模型投机,Eagle/Eagle3投机仅有一层模型参数,同时使用历史生成的token和该token对应的hidden states作为投机模型的输入。这种方式提高了投机模型生成的效率。适用场景:对时延要求较高的场景。有专门的Eagle/Eagle3模型。需要配置相关环境变量后再使用,环境变量参考表1 Qwen Dense系列启动环 - [图模式](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5910020.md): AscendTurboGraph图模式是一种Capture-Replay架构的Host图,可以有效消除Host瓶颈,支持模型输入动态shape,无需分档构图,构图较快。未设置INFER_MODE环境变量时,即默认模式下,部分模型会默认使用ACLGraph图模式启动来提升性能。AscendTurboGraph图模式目前仅支持Qwen2、Qw - [Chunked Prefill](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5910021.md): Chunked Prefill(Splitfuse)特性的目的是将长prompt request分解成更小的块,并在多个forward step中进行调度,只有最后一块的forward完成后才开始这个prompt request的生成。将短prompt request组合以精确填充step的空隙,每个step的计算量基本相等,达到所有请求 - [参考:Structured Outputs](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5910022.md): Structured Outputs是指在大模型请求中通过用户给定的指定格式信息(如json格式,sql格式),生成严格符合格式要求的相关文本。Guided Decoding相关特性可以支持用户给定格式的文本生成。Guided Decoding是一种用于生成文本的策略,通过提供额外的上下文或约束,来引导模型生成更符合预期的结果。比如使用O - [Tool Calling](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5910023.md): 工具调用(Tool Calling,Function Calling,FC)是一种将大模型与外部工具和 API 相连的关键功能,作为自然语言与信息接口之间的“翻译官”,它能够将用户的自然语言请求智能地转化为对特定工具或 API 的调用,从而高效满足用户的特定需求。工作原理:开发者通过自然语言向模型描述工具的功能和定义,模型在对话过程中自主 - [Reasoning Outputs](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5910024.md): 支持Qwen3系列等思考模型,这些模型会生成包含推理步骤和最终结论的输出。Reasoning Outputs能力可以在输出中返回一个附加字段reasoning_content,其中包含导致最终结论的思考过程和推理步骤。Reasoning Outputs功能仅适用于OpenAI的/v1/chat/completions接口。在启动推理服务时 - [推理服务精度评测](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5910025.md): 本章节介绍了3种精度测评方式,分别为acs-bench、Simple-evals工具和MME工具。acs-bench工具支持LLM精度在线评测业务及多模型并发测试,按照需求自定义测试配置进行多模型多数据集的组合在线精度测试,测试完成后输出详细测试结果可供分析。Simple-evals是一个用于评估语言模型的轻量级库,可用来评估的数据集为M - [大语言模型推理性能测试](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5910027.md): 性能测试需要使用acs-bench工具。acs-bench prof命令主要用于LLM性能benchmark测试任务,支持给定数据长度和数量,在不同请求并发度的场景下对于Ascend vLLM服务进行性能测试,目前支持爬坡测试和性能压测两种模式。可以通过如下命令查看是否已经安装acs-bench工具。如果未安装acs-bench工具,请参 - [获取模型推理的Profiler数据](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5910029.md): PyTorch Profiler 是 PyTorch 官方提供的性能分析工具,用于深度剖析模型训练/推理过程中的性能瓶颈,帮助开发者优化计算效率、内存占用和硬件利用率。Ascend PyTorch Profiler 完全对标 PyTorch-GPU场景下的使用方式,支持采集PyTorch层算子信息、CANN层算子信息、底层NPU算子信息、 - [大语言模型推理性能PD配比仿真](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5910030.md): acs-advisor基于python simpy实现了对vllm的轻量化仿真,支持针对PD混合、PD分离两类部署形态进行性能仿真,在给定请求负载和SLO约束下仿真出最优的实例数(混合实例、预填充推理实例,增量推理实例)。acs-advisor中实现了vllm内部的请求调度逻辑,从而近似还原了vllm中请求组batch的情况。对于模型执行 - [大语言模型推理参数自动寻优](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5910031.md): 大模型推理服务部署时,超参数的配置对模型性能影响很大。比如请求 batch size 、最大处理的 token 等会对服务的性能带来很大影响。较大的 batch size 可以一次执行多条请求提升并发吞吐,但是 batch 增大的同时也伴随计算量增加造成请求时延的降低。同时不同长度的输入,也应当采用不同的 batch size 策略。比如 - [Ascend-vLLM推理常见问题](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_infer_5910033.md): 解决方法:调整推理服务启动时的显存利用率,将--gpu-memory-utilization的值调小。解决方法:允许传入大于模型config.json 中的序列最大值。解决方法:将block_size大小设置为128解决办法: - [方案概述](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_veomni_train_001.md): 本文档介绍了在ModelArts上基于VeOmni训练框架,对业界主流的开源三方大模型进行微调训练的详细过程。VeOmni 是由字节跳动 seed 团队推出的开源全模态分布式训练框架,基于 PyTorch 构建。该框架以模型为核心,将分布式并行逻辑与模型计算过程解耦,支持灵活组合多种并行策略(如 fsdp、sp、ep),能够高效扩展至超长 - [配置云资源](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_veomni_train_002.md): 本文档中涉及到的资源如下,请提前准备。由于ModelArts创建训练作业时,需要从OBS桶中获取模型权重文件、训练数据、训练脚本,并将训练产物输出至OBS桶中,因此创建OBS桶为必选项。具体创建操作请参考创建OBS桶。OBS桶内文件夹示意如下,此处规划的目录需要和训练脚本中涉及的各类文件路径保持一致。创建训练作业并将OBS桶添加至代码目录 - [准备模型权重与训练数据](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_veomni_train_003.md): 本文档以Qwen系列模型为例介绍训练过程,表1 支持的大语言模型列表和权重获取地址中介绍了Qwen系列模型的权重获取地址。访问权重文件下载网站Huggingface时,需要配置代理,请在互联网查询解决方案。下载好的模型权重文件,请上传至OBS桶中。基于OBS规划,OBS桶中文件存放目录示例如下:以Qwen3系列模型为例,不同类型模型使用不 - [准备训练脚本](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_veomni_train_004.md): 在VeOmni中不同类型的模型,训练步骤和脚本有所差异。在此分Dense模型,Moe模型,VL模型进行介绍。更多详细内容可以参考官网内容,参数设置可以参考 Arguments API Reference — VeOmni v0.1.0 documentation 获取更多详细信息。如直接复制本文档提供的命令或脚本,请注意不同操作系统下换行 - [执行训练任务](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_veomni_train_005.md): 本章节以Qwen3-32B SFT为例介绍基于ModelArts控制台配置并执行训练任务的关键操作。已经在ModelArts控制台完成权限配置,具体参考委托授权配置,如果未配置授权,会在训练作业页面顶端提示权限缺失,请根据界面提示操作。将模型权重、训练数据、训练相关脚本上传至OBS桶中,例如obs://veomni/veomni-a2登录 - [查看训练结果输出](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_veomni_train_006.md): 存放在自己设置的输出路径,如果选择输出变量${output_dir},则可以在OBS配置的输出路径查看。在OBS桶内可以查看相应的日志,或者在任务界面终端查看。训练性能主要通过训练日志中的2个指标查看:吞吐量和收敛情况。在shell内运行npu-smi info可以查看实时用量。或者在训练日志中看到整体吞吐和处理时间。例如从如下日志中,我 - [训练常见问题](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_veomni_train_007.md): A:通过复制文档中提供的的样例脚本后创建文件,可能由于Windows系统文件的换行符和Linux有所不同,导致了换行符识别不匹配。可以在Linux系统中执行dos2unix xxx.sh 或者使用vim执行以下两条命令进行格式转换。A:训练结束时生成的是 DCP (Distributed Checkpoint)格式权重。在裸机上可以设置y - [方案概述](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_mindspeed_train_001.md): 本文档介绍了在ModelArts上基于MindSpeed-LLM训练框架,对业界主流的开源三方大模型进行微调训练的详细过程。MindSpeed-LLM是基于昇腾生态的大语言模型分布式训练套件,旨在为华为 昇腾芯片 生态合作伙伴提供端到端的大语言模型训练方案,包含分布式预训练、分布式指令微调以及对应的开发工具链,如:数据预处理、权重转换、在 - [配置云资源](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_mindspeed_train_002.md): 本文档中涉及到的资源如下,请提前准备。由于ModelArts创建训练作业时,需要从OBS桶中获取模型权重文件、训练数据、训练脚本,并将训练产物输出至OBS桶中,因此创建OBS桶为必选项。具体创建操作请参考创建OBS桶。OBS桶内文件夹示意如下,此处规划的目录需要和训练脚本中涉及的各类文件路径保持一致。创建训练作业并将OBS桶添加至代码目录 - [准备模型权重与训练数据](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_mindspeed_train_003.md): 本文档以Qwen系列模型为例介绍训练过程,表1 支持的大语言模型列表和权重获取地址中介绍了Qwen系列模型的权重获取地址。访问权重文件下载网站Huggingface时,需要配置代理,请在互联网查询解决方案。下载好的模型权重文件,请上传至OBS桶中。基于OBS规划,OBS桶中文件存放目录示例如下:以Qwen3系列模型为例,可以使用如下数据集 - [准备训练脚本](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_mindspeed_train_004.md): 在MindSpeed-LLM中不同类型的模型的权重转化、数据处理、微调任务脚本有所差异,具体请参考MindSpeed-LLM/docs/quick_start.md · Ascend/MindSpeed-LLM - AtomGit | GitCode 下每种模型具体的脚本example。以Qwen3系列模型的训练任务为例,分别准备对应模型 - [执行训练任务](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_mindspeed_train_005.md): 本章节介绍基于ModelArts控制台配置并执行训练任务的关键操作。已经在ModelArts控制台完成权限配置,具体参考委托授权配置,如果未配置授权,会在训练作业页面顶端提示权限缺失,请根据界面提示操作。将模型权重、训练数据、训练相关脚本上传至OBS桶中,例如obs://mindspeed/mindspeed-a2登录ModelArts管 - [查看训练结果输出](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_mindspeed_train_006.md): 存放在自己设置的输出路径,如果选择输出变量${output_dir},则可以在OBS配置的输出路径查看。在OBS桶内可以查看相应的日志,或者在任务界面终端查看。训练性能主要通过训练日志中的2个指标查看:吞吐量和收敛情况。在shell内运行npu-smi info可以查看实时用量。或者在训练日志中看到整体吞吐和处理时间。例如从如下日志中,我 - [训练常见问题](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_mindspeed_train_007.md): A:通过复制文档中提供的的样例脚本后创建文件,可能由于Windows系统文件的换行符和Linux有所不同,导致了换行符识别不匹配。可以在Linux系统中执行dos2unix xxx.sh 或者使用vim执行以下两条命令进行格式转换。A:使用不同模型的时候,或者进行不同类型的训练时,都需要参考MindSpeed-LLM/docs/quick - [方案概述](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_verl_train_001.md): 本文档介绍了在ModelArts训练平台上基于VeRL训练框架,对业界主流的开源三方大模型进行强化学习训练的详细过程。VeRL是一个灵活、高效且面向生产环境的大语言模型(LLM)强化学习训练库,具有高度的灵活性和易用性,主要体现在:轻松扩展多样化的强化学习算法:混合控制器编程模型支持对复杂的后训练数据流进行灵活的表示和高效的执行。只需几行 - [配置云资源](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_verl_train_002.md): 本文档中涉及到的资源如下,请提前准备。由于ModelArts创建训练作业时,需要从OBS桶中获取模型权重文件、训练数据、训练脚本,并将训练产物输出至OBS桶中,因此创建OBS桶为必选项。具体创建操作请参考创建OBS桶。OBS桶内文件夹示意如下,此处规划的目录需要和训练脚本中涉及的各类文件路径保持一致。创建训练作业并将OBS桶添加至代码目录 - [准备模型权重与训练数据](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_verl_train_003.md): 本文档以Qwen系列模型为例介绍训练过程,表1中介绍了Qwen系列模型的权重获取地址。访问权重文件下载网站Huggingface时,需要配置代理,请在互联网查询解决方案。下载好的模型权重文件,请上传至OBS桶中。基于OBS规划,OBS桶中文件存放目录示例如下:Qwen3-8b和Qwen3-30B-A3B模型训练使用gsm8k数据。下载gs - [准备训练脚本](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_verl_train_004.md): 模型训练使用的训练脚本文件请参见训练脚本(Qwen3-8B),训练脚本(Qwen2.5-VL-32B-Instruct)和训练脚本(Qwen3-30B-A3B),需要用户参考本章节内容制作sh文件,并上传到OBS桶中。训练脚本文件中涉及到的路径解释如下:/home/ma-user/work为ModelArts创建训练作业时设置的本地代码目 - [执行训练任务](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_verl_train_005.md): 本章节介绍基于ModelArts训练平台配置并执行训练任务的关键操作。已经在ModelArts控制台完成权限配置,具体参考委托授权配置,如果未配置授权,会在训练作业页面顶端提示权限缺失,请根据界面提示操作。将模型权重、训练数据、数据预处理脚本、训练脚本上传至OBS桶中,例如obs://verl/verl-a2登录ModelArts管理控制 - [查看训练结果输出](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_verl_train_006.md): 训练输出结果,包括预处理后的训练数据、checkpoint、训练日志、模型权重均存放在OBS桶obs:///verl-a2中。训练结果结构说明如下:在OBS桶中查找obs:///verl-a2/run_qwen3_8b_npu_ma.log,obs:///ver - [方案概述](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_areal_train_001.md): 本文档介绍了在ModelArts上基于AReaL强化学习框架,对业界主流的开源三方大模型进行强化学习训练的详细过程。训练使用的算力资源是Snt9b。AReaL 是一个开源的完全异步强化学习训练系统,用于训练大型推理和智能体模型。基于开源项目 ReaLHF,我们完全遵循开源原则,提供复现我们成果所需的训练细节、数据和基础设施,同时公开模型本 - [配置云资源](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_areal_train_002.md): 本文档中涉及到的资源如下,请提前准备。由于ModelArts创建训练作业时,需要从OBS桶中获取模型权重文件、训练数据、训练脚本,并将训练产物输出至OBS桶中,因此创建OBS桶为必选项。具体创建操作请参考创建OBS桶。OBS桶内文件夹示意如下,此处规划的目录需要和训练脚本中涉及的各类文件路径保持一致。用户可通过OBS Browser+、o - [准备模型权重与训练数据](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_areal_train_003.md): 本文档以Qwen3系列模型为例介绍训练过程,表1 支持的大语言模型列表和权重获取地址中介绍了信息xx系列模型的权重获取地址。访问权重文件下载网站Huggingface时,需要配置代理,请在互联网查询解决方案。请将下载好的模型权重文件上传至OBS桶中。基于OBS规划,OBS桶中文件存放目录示例如下:模型训练使用gsm8k数据,无需预处理下载 - [准备训练脚本](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_areal_train_004.md): 本案例提供训练脚本样例a2_multi.sh,需要用户参考本章节内容制作sh文件,并上传到OBS桶中。脚本中的python命令后的强化学习配置参数,可以直接增加,用以覆盖examples/math/gsm8k_grpo_npu.yaml的默认值,对于yaml中不存在但是实际有效的参数,在参数名称前增加"+"即可生效。部分配置参数说明如下, - [执行训练任务](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_areal_train_005.md): 本章节介绍基于ModelArts控制台配置并执行训练任务的关键操作。已经在ModelArts控制台完成权限配置,具体参考委托授权配置,如果未配置授权,会在训练作业页面顶端提示权限缺失,请根据界面提示操作。将模型权重、训练数据、数据预处理脚本、训练脚本上传至OBS桶中,例如obs://areal/xxx登录ModelArts管理控制台,选择 - [查看训练结果输出](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_areal_train_006.md): 训练结果结构说明如下:若设置了CKPT_ROOT_PATH,则ckpt在该路径下。areal logs在FILE_ROOT_PATH下,默认/home/ma-user/areal_exp)ModelArts平台日志则在平台UI页面查看通过平台日志观测epoch信息及ppo_actor/task_reward/avg 信息,下载日志构建re - [调试训练作业](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_areal_train_007.md): 在ModelArts生产模式执行训练任务时,如果任务执行出错,会直接退出,导致难以查看容器状态以排查错误,尤其在训练启动参数、环境变量等配置有误时无法及时重试,带来不便。因此,建议用户在初始适配期间使用如下方法保留容器,用于快速重试排障。使用CloudShell调试训练作业的详细操作方式请参见使用Cloud Shell调试生产训练作业。常 - [AscendFactory方案概述](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_590801.md): AscendFactory是华为云推出的分布式训练框架,当前支持开源的MindSpeed-LLM(原ModelLink)、Llama-Factory、VeRL和MindSpeed-MM训练框架作为后端,提供统一的训练API接口和自动化配置方式,具有配置简单、开箱性能优、预制主流模型、支持多框架等特性。LLaMa-Factory是开源社区中 - [支持的模型列表](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_590802.md): 模型列表分为表1 大语言模型列表和表2 多模态模型列表,详细如下。 - [各训练框架支持的模型和特性](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_590803.md): 支持多种显存优化特性,包括参数副本、分布式优化器、swap attention、重计算、Norm重计算; 支持梯度reduce通算掩盖、Recompute in advance、权重all-gather通算掩盖、MC2等通信优化。 - [各模型支持的最小卡数和序列长度](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_590804.md): 针对不同模型,集群规格(Snt9b、Snt9b23)、数据集大小等均会导致训练时间、集群卡数规模不同,如训练过程中对卡数或训练时间有要求,可根据以下公式计算预测:训练时间(秒):Time=Token总/(TPS*N卡数)*线性加速比,计算出的训练时间为范围值,仅作参考。训练卡数:N卡数=Token总/(Time*TPS)*线性加速比,N卡 - [版本说明和要求](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_590805.md): 本文档支持昇腾云6.5.906及以后版本,最新版本是6.5.912。推荐使用最新版本配套的软件包和镜像。LlamaFactory框架版本:0.9.4MindSpeed-LLM框架版本:2.2.0MindSpeed-MM框架版本:2.2.0VeRL框架版本:0.5.0.dev本教程中用到的训练基础镜像地址和配套版本关系如下表所示,请提前了解 - [MindSpeed-LLM](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_590808.md): 本章节主要描述训练所需的yaml配置文件(通过ascendfactory-cli config 命令生成)、配置参数说明,用户可根据实际自行选择其需要的参数。根据以下步骤修改yaml文件。数据集选择:以下参数二选一,详解如下。参数示例值参数说明backend_config.preprocess_data.input【预训练:pt】预训练数 - [Llama-Factory](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_590809.md): 本章节主要描述训练所需的yaml配置文件(通过ascendfactory-cli config 命令生成)、配置参数说明,用户可根据实际自行选择其需要的参数。根据以下步骤修改yaml文件。 - [VeRL](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_590810.md): 本章节主要描述训练所需的yaml配置文件(通过ascendfactory-cli config 命令生成)、配置参数说明,用户可根据实际自行选择其需要的参数。根据以下步骤修改yaml文件。 - [MindSpeed-MM](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_590812.md): 本章节主要描述训练所需的yaml配置文件(通过ascendfactory-cli config 命令生成)、配置参数说明,用户可根据实际自行选择其需要的参数。根据以下示例步骤修改yaml文件。数据集及模型路径设置:参数示例值参数说明backend_config.data.dataset_param.preprocess_parameter - [tokenizer文件修改](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_590813.md): 在训练开始前根据所选训练框架针对模型的tokenizer文件进行修改。当前仅涉及Llama-Factory框架下glm4-9b模型和InternVL2_5系列模型的tokenizer文件修改,具体修改内容如下,您可对tokenizer文件进行编辑。InternVL2_5、InternVL3系列模型InternVL2_5、InternVL3 - [训练数据说明](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_590814.md): MindSpeed-LLM、Llama-Factory框架常用数据集格式:alpaca格式sharegpt格式moss格式(仅支持MindSpeed-LLM)本教程样例数据集下载链接如下:预训练(MindSpeed-LLM):train-00000-of-00001-a09b74b3ef9c3b56.parquet,数据大小:24M左右。 - [VeRL数据处理样例脚本](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_590815.md): VeRL框架中的样例数据处理脚本分为大语言模型和多模态模型,样例脚本如下,根据模型类型选择:VeRL大语言模型gsm8k数据处理多模态模型geometry3k数据处理多轮对话Agent训练gsm8k数据处理注:如果在配套镜像之外的地方转换数据集时,要指定dataset库的版本等于3.0.1。否则会与镜像内的版本不兼容,导致数据加载失败。 - [工具使用](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_590817.md): 在强化学习训练过程中,往往存在多个模型(Actor、Reward、Reference)和两个阶段(推理、训练),精度问题定界困难。本工具基于msprobe提供关键阶段数据的灵活采集与对比能力,结合系统化定位方法论,助力VeRL框架精度问题分析与调优。支持VeRL两种主流训练后端(FSDP、Megatron-LM)的精度数据采集。针对训练过 - [使用场景](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_590818.md): 数据采集按如下配置运行模型将采集对应数据。如需对比同一模型在标杆Device与当前Device上的表现,可分别采集,(两次需要设置不同的dump_path)precision_collector: msprobe: True # 使用以下采集、加载功能时,必须开启 dump_path: "./benchmark_infer_ - [精度数据采集FAQ](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_590819.md): 问题现象:当调用FSDP后端训练且 actor_train_dump=True ,level=L0 时,出现如下报错。原因:msprobe工具侧 与FSDP的patch 存在冲突,工具侧master分支已修复。解决方案:master分支拉取最新代码进行编译安装 ,从源码安装msprobe。问题现象:当使用VL模型调用FSDP后端训练且 c - [方案概述](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_590601.md): 本文档介绍了在ModelArts的轻量算力节点上基于AscendFactory训练框架,对业界主流的开源三方大模型进行训练的详细过程。训练使用的算力资源是Snt9b和Snt9b23。AscendFactory是对多种训练框架的一个封装,当前支持MindSpeed-LLM(原ModelLink)、Llama-Factory、VeRL、Min - [支持的模型列表](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_590602.md): 模型列表分为表1 大语言模型列表和表2 多模态模型列表,详细如下。以下模型不再跟随版本演进。Llama2/3:llama2-7b/13b/70b、llama3-8b/70bQwen/Qwen1.5:qwen-7b/14b/72b、qwen1.5-7b/14b/32b/72bYi:yi-6b、yi-32bBaiChuan2:baichuan - [各模型支持的训练特性](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_590603.md): 本章节介绍不同模型在AscendFactory方案中对应各训练框架支持的训练特性。NA表示不会规划支持,例如多模态模型不会支持MindSpeed-LLM训练框架。 - [各模型支持的最小卡数和序列长度](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_590604.md): 针对不同模型、集群规格(Snt9b B3/B2/B1、Snt9b23)、数据集大小等不同导致训练时间、集群卡数规模不同,如训练过程中对卡数或训练时间有要求可根据以下公式计算预测:训练时间(秒):Time=Tok总/(TPS*N卡数),计算出训练时间为范围值,仅参考。训练卡数:N卡数=Tok总/(Time*TPS),N卡数>8时则需取整为8 - [版本软件说明和要求](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_590605.md): 本文档支持昇腾云6.5.906及以后版本,最新版本是6.5.907。推荐使用最新版本配套的软件包和镜像。本教程中用到的训练基础镜像地址和配套版本关系如下表所示,请提前了解。本方案需要使用到的软件配套版本和依赖包获取地址如下表所示。AscendCloud-LLM代码包关键训练文件介绍如下:|——AscendCloud-LLM |──ll - [准备轻量算力节点环境](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_590607.md): 开通轻量算力节点资源开通,并确保机器已开通,密码已获取,能通过SSH登录,不同机器之间网络互通。多机运行分布式训练场景下,已购买可挂载的存储硬盘资源,以实现多机共同访问同一存储硬盘资源。支持在轻量算力节点中挂载的有弹性文件服务SFS和云硬盘EVS,SFS存储方案如下,EVS方案参考文档配置轻量算力节点存储;安装过程需要连接互联网git c - [准备软件包、权重、训练数据集](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_590608.md): 训练前需要先上传模型权重、软件包和训练数据集到轻量算力节点指定目录,如下表所示。/mnt/sfs_turbo为宿主机中默认挂载SFS Turbo的工作目录,因此上传模型权重、软件包、训练数据集只需要在Server服务器执行即可。上传安装依赖软件训练代码AscendCloud-LLM-xxx.zip到主机中并解压,包获取路径请参见表5,解压 - [准备镜像](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_590609.md): SSH登录机器后,检查NPU设备检查。运行如下命令,返回NPU设备信息。npu-smi info # 在每个实例节点上运行此命令可以看到NPU卡状态 npu-smi info -l | grep Total # 在每个实例节点上运行此命令可以看到总卡数,用来确认对应卡数已经挂载 npu-smi - [执行训练任务](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_590610.md): 生成模型训练config配置yaml文件,生成方式分为交互式、传参式两种,两者区别为传参式提前传入所需参数,交互式为命令执行后交互选择所需参数,客户自行选择其中一种方式即可。交互式,命令如下:ascendfactory-cli config --output_file_path=传参式,命令如下:as - [查看训练输出结果](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_590611.md): 训练过程中,MindSpeed-LLM框架训练loss、性能信息日志会在最后的Rank节点打印;MindSpeed-RL、VeRL和Llama-Factory框架的loss、性能信息日志会在第一个Rank节点打印。训练结果结构说明如下:MindSpeed-LLM|──{af_output_dir} #{af_output_dir}参数设置 - [日志采集与存储](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_590612.md): Proc Log是由用户训练代码产生的打屏日志,当用户通过常用框架的方式启动单机多卡或多机多卡的Ascend规格训练作业时,每一张Ascend加速卡对应的训练进程都会产生一份python打印在屏幕上的日志。同一台节点上多个训练进程的日志会被汇集到查看日志及权重章节描述的训练日志文件中,在定位问题时往往需要查看每一个训练进程对应的日志文件。 - [配置监控告警(可选)](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_590613.md): 使用CES监控NPU资源轻量算力节点的监控能力依赖于CES云监控服务,监控需要的Agent插件已经默认安装,申请的NPU资源可以在云监控服务查看到对应监控信息。具体操作请参考轻量算力节点资源监控。重点关注的指标常用的监控指标如下表所示,全量支持的监控指标请参考文档轻量算力节点监控指标介绍。通过对接CES,可以将业务中的重要事件或对云资源的 - [配置调优](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_590615.md): 该章节介绍针对不同框架给出的常见调优配置和建议,实际使用过程中由于模型参数量、训练数据集及资源数的不同,需要结合参数进行持续调整。1. 并行策略优化:当模型权重或序列长度较大时,需要开启模型并行或长序列并行缓解显存占用。关键参数:tensor-model-parallel-size(简称TP):模型并行大小,设置越大显存占用越小、通信开销 - [断点续训](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_590616.md): 断点续训功能允许用户在训练过程中断后,从上次训练保存的最新中间权重继续训练,避免重复计算,提高训练效率。在训练由于外部原因中断后,可通过以下步骤进行断点续训。进入训练结果输出目录,确认存在已保存的权重。cd ${af_output_dir}{af_output_dir}为训练启动脚本中通过--save参数配置的输出目录,该目录下会存在多个 - [MindSpeed-LLM](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_590619.md): 本章节主要描述训练所需的yaml配置文件、配置参数说明,用户可根据实际自行选择其需要的参数。根据以下步骤修改yaml文件。数据集选择:以下参数二选一,详解如下。参数示例值参数说明backend_config.preprocess_data.input【预训练:pt】预训练数据集相对或绝对地址【微调:sft】微调数据集相对或绝对地址训练时指 - [Llama-Factory](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_590620.md): 本章节主要描述训练所需的yaml配置文件、配置参数说明,用户可根据实际自行选择其需要的参数。根据以下步骤修改yaml文件。 - [VeRL](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_590621.md): 本章节主要描述训练所需的yaml配置文件、配置参数说明,用户可根据实际自行选择其需要的参数。根据以下步骤修改yaml文件,以下参数aaa.bbb为aaa区域的bbb参数值,如backend_config.data.train_files指backend_config区域中data.train_files参数: - [MindSpeed-RL](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_590622.md): 本章节主要描述训练所需的yaml配置文件、配置参数说明,用户可根据实际自行选择其需要的参数。根据以下步骤修改yaml文件。数据集选择:以下参数二选一,详解如下。参数示例值参数说明backend_config.preprocess_data.input数据集相对或绝对地址训练时指定的输入数据路径。请根据实际规划修改。用户根据训练情况二选一b - [MindSpeed-MM](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_590659.md): 本章节主要描述训练所需的yaml配置文件、配置参数说明,用户可根据实际自行选择其需要的参数。根据以下示例步骤修改yaml文件。数据集及模型路径设置:参数示例值参数说明backend_config.data.dataset_param.preprocess_parameters.model_name_or_path/home/ma-user - [tokenizer文件修改](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_590623.md): 在训练开始前根据所选训练框架针对模型的tokenizer文件进行修改。当前仅涉及Llama-Factory框架下glm4-9b模型和InternVL2_5系列模型的tokenizer文件修改,具体修改内容如下,您可对tokenizer文件进行编辑。glm4-9b模型在训练开始前,需要修改glm4-9b模型中的tokenizer文件mode - [训练数据说明](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_590624.md): MindSpeed-LLM、Llama-Factory框架常用数据集格式:alpaca格式sharegpt格式moss格式(仅支持MindSpeed-LLM)本教程样例数据集下载链接如下:预训练(MindSpeed-LLM):train-00000-of-00001-a09b74b3ef9c3b56.parquet,数据大小:24M左右。 - [VeRL数据处理样例脚本](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_590625.md): VeRL框架中的样例数据处理脚本分为大语言模型和多模态模型,样例脚本如下,根据模型类型选择:VeRL大语言模型gsm8k数据处理多模态模型geometry3k数据处理 - [常见错误原因和解决方法](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_590626.md): 训练中常见错误链接如下,根据实际情况选择相应链接:显存溢出错误网卡名称错误保存ckpt时超时报错DockerFile或install.sh安装三方依赖包失败Llama-Factory框架数据预处理过大数据集超时Llama-Factory框架训练过程中训练至某一步卡死现象Llama-Factory环境,运行DockerFile或instal - [方案概述](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_c_5910001.md): 本文档介绍了在ModelArts的轻量算力集群上基于AscendFactory训练框架,对业界主流的开源三方大模型进行训练的详细过程。训练使用的算力资源是Snt9b和Snt9b23,本文将以Snt9b23资源为例介绍训练过程。AscendFactory是对多种训练框架的一个封装,当前支持Llama-Factory、MindSpeed-LL - [版本说明和要求](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_c_5910002.md): 本文档支持昇腾云6.5.906及以后版本,最新版本是6.5.910。推荐使用最新版本配套的软件包和镜像。LlamaFactory框架版本:0.9.3MindSpeed-LLM框架版本:2.1.0MindSpeed-RL框架版本:2.1.0MindSpeed-MM框架版本:2.2.0VeRL框架版本:0.5.0.dev本教程中用到的训练基础 - [资源规划设计](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_c_5910004.md): 针对不同模型,集群规格(Snt9b、Snt9b23)、数据集大小等均会导致训练时间、集群卡数规模不同,如训练过程中对卡数或训练时间有要求,可根据以下公式计算预测:训练时间(秒):Time=Token总/(TPS*N卡数)*线性加速比,计算出的训练时间为范围值,仅作参考。训练卡数:N卡数=Token总/(Time*TPS)*线性加速比,N卡 - [准备轻量算力集群环境](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_c_5910005.md): 本文档中的模型运行环境是ModelArts轻量算力集群,请参考本文档要求准备资源环境。如果使用轻量算力集群资源,请先阅读k8s Cluster资源购买,熟悉集群资源开通流程,再开始操作购买轻量算力集群资源。若已完成集群资源购买和开通,则需要对网络、存储、容器镜像等内容进行配置,请参考轻量算力集群环境配置详细流程。轻量算力集群的容器中挂载存 - [准备软件包、权重、训练数据集](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_c_5910006.md): 训练前需要先上传模型权重、软件包和训练数据集到轻量算力集群指定目录,如下表所示。/mnt/sfs_turbo为宿主机中默认挂载SFS Turbo的工作目录,因此上传模型权重、软件包、训练数据集只需要在任意轻量算力集群的主机上执行即可。上传安装依赖软件训练代码AscendCloud-LLM-xxx.zip到主机中并解压,包获取路径请参见表4 - [准备镜像](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_c_5910007.md): Kubernetes社区已经在v1.24版本中移除Dockershim,建议将容器引擎从Docker逐步迁移至官方推荐的Containerd,以确保未来与Kubernetes版本的兼容性和持续支持。所以轻量算力集群目前推荐使用containerd作为容器引擎,安装镜像。SSH登录机器后,检查NPU设备检查。运行如下命令,返回NPU设备信息 - [准备训练config.yaml文件](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_c_5910008.md): config.yaml文件用于启动训练作业时调度k8s集群,具体模板如下,请用户参考下面模板制作。参数说明:${container_name} :容器名称,此处可以自己为container_name定义一个容器名称,例如ascend-train。${image_name} :为步骤五:修改并上传镜像至SWR中,上传至SWR上的镜像链接。$ - [执行训练任务](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_c_5910009.md): 确认模型权重文件、训练数据集已经上传,准备软件包、权重、训练数据集。进入调试模式。修改config.yaml中的${command}进行调试,本示例中使用sleep命令启动pod,便于进入pod调试。command: ["/bin/bash", "-c"] args: - sleep 100000000000 - [训练结果输出](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_c_5910010.md): 训练过程中,MindSpeed-LLM框架训练loss、性能信息日志会在最后的Rank节点打印,Llama-Factory框架loss、性能信息日志会在第一个Rank节点打印。训练结果结构说明如下:MindSpeed-LLM|──{af_output_dir} #{af_output_dir}参数设置值,如yaml文件中参数配置 - [配置监控告警](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_c_5910011.md): ModelArts 轻量算力集群会定期收集资源池中各节点的关键资源(GPU、NPU、CPU、Memory等)的使用情况并上报到应用运维管理AOM和云监控平台CES。整体监控告警方案如下图所示:AOM:ModelArts相关的监控指标,通过AOM进行上报;CES:部分节点指标,AOM无法覆盖的,可以通过CES进行上报;SMN:告警规则关联S - [训练日志介绍](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_c_5910013.md): 本章介绍在轻量算力集群模式下训练日志配置及对接建议,包含四部分内容:CANN应用类日志、训练日志、NPU Device 日志、OS日志,其中客户自定义的训练日志(写入SFS Turbo日志)在此章节不涉及。在训练过程中,有多种类型的日志可用于监控和分析:标准输出(训练日志):这是用户最常关注的日志,其中包含了任务的实时运行状态、Loss值 - [CANN应用类日志存储至OBS配置方法](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_c_5910014.md): 创建OBS桶。在CCE控制台创建关联OBS桶的PV及PVC。进入要挂载OBS的CCE集群控制台。创建存储卷PV。创建存储卷声明pvc进入要挂载OBS的CCE集群控制台。创建存储卷PV。创建存储卷声明pvc创建完成后,在CCE中可以看到对应的PVC,在容器中直接引用即可。kubectl get pvc pvc-obs-glj -o yaml - [NPU Device日志及OS日志转储说明](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_c_5910015.md): NPU Device日志及OS日志都是宿主机层面的日志,与容器及作业ID无法直接关联,可使用脚本在crontab中定期执行上传或人工手动触发上传至OBS,推荐将日志转储成如下目录,方便后期关联job以进行定位诊断。关于NPU Device日志和OS日志采集操作请参考NPU日志收集上传章节,该操作也适用于轻量算力集群场景。 - [通过CCE控制台配置日志采集](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_c_5910017.md): 进入CCE控制台界面,购买CCE集群时安装云原生日志采集插件,选择容器日志和kubernetes事件。购买集群如果购买CCE集群时没有默认安装日志采集插件,单击CCE控制台左侧导航栏的插件中心,安装云原生日志采集插件。如果购买CCE集群时没有默认安装日志采集插件,单击CCE控制台左侧导航栏的插件中心,安装云原生日志采集插件。单击CCE控制 - [LTS查看CCE接入日志](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_c_5910018.md): 在CCE控制台的集群基本信息页面查看集群ID。查找集群ID登录LTS控制台,在日志管理页面,通过集群ID查看对应的日志组。查看日志在日志详情页中查看日志内容已生成。查看日志详情 - [LTS标准日志转储OBS](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_c_5910019.md): 进入LTS控制台,在日志转储页面,单击右上角的配置转储,根据界面提示配置日志转储信息。日志转储配置日志转储信息时,对应的参数设置如下:日志源:当前账号转储方式:周期性转储是否开启转储:是转存对象:OBS日志组名称:选择已创建的日志组。日志流名称:选择已创建的日志流。已配置过OBS转储的日志流不能重复配置。OBS桶:已创建的OBS桶自定义转 - [配置OBS生命周期管理](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_c_5910020.md): 在OBS控制台,进入OBS桶,单击左侧数据管理 > 生命周期管理。单击创建。创建生命周期规则在创建生命周期规则页面,根据界面提示信息配置,具体的参数配置如下。状态:开启规则名称:自定义范围:对象前缀前缀:LogTanks/cn-southwest-2当前版本状态:开启最后一次修改3天后删除创建生命周期规则状态:开启规则名称:自定义范围:对 - [资源HA冷备快恢说明](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_c_5910024.md): 在对可靠性要求比较高的场景,为保障快速故障恢复需要在超节点内预留备机。本章节介绍如何使用超节点的HA能力,实现节点级故障的快速恢复。资源快恢整体流程超节点内的节点出现故障,会产生对应故障事件和告警。节点的严重故障通知相关联系人,同时会产生客户侧的告警。同时AOM配置了告警通知机制,同样也会通知到客户侧。华为云的Console界面生成对应处 - [超节点内故障告警](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_c_5910025.md): 超节点发生节点异常时,在故障初步分析阶段,您可先按表1识别是否为亚健康并自助进行处理 - [超节点重部署运维](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_c_5910027.md): 针对ModelArts运维平台告警的故障节点,控制台“资源管理>事件中心”页面记录故障节点的计划事件,包括故障节点的基本信息、事件类型、事件状态、事件描述等,并支持授权和重部署操作。针对节点资源不可服务的场景,执行重部署操作。登录ModelArts控制台,进入“资源管理>事件中心”页面,查看到对应故障的节点。如果计划事件不满足重部署操作执 - [节点重部署检测](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_c_5910028.md): 客户已执行重部署操作后,登录重部署节点检测资源是否重部署成功。NPU健康状态检查8个NPU模组(两个device & mcu)的健康状态是否OK执行命令npu-smi info,回显信息如下:8个NPU模组(两个device & mcu)的健康状态是否OK执行命令npu-smi info,回显信息如下:NPU网络健康验证NPU参数面网络健 - [MindSpeed-LLM](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_c_5910031.md): 本章节主要描述训练所需的yaml配置文件(通过ascendfactory-cli config 命令生成)、配置参数说明,用户可根据实际自行选择其需要的参数。根据以下步骤修改yaml文件。数据集选择:以下参数二选一,详解如下。参数示例值参数说明backend_config.preprocess_data.input【预训练:pt】预训练数 - [Llama-Factory](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_c_5910032.md): 本章节主要描述训练所需的yaml配置文件(通过ascendfactory-cli config 命令生成)、配置参数说明,用户可根据实际自行选择其需要的参数。根据以下步骤修改yaml文件。 - [VeRL](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_c_5910033.md): 本章节主要描述训练所需的yaml配置文件(通过ascendfactory-cli config 命令生成)、配置参数说明,用户可根据实际自行选择其需要的参数。根据以下步骤修改yaml文件。 - [MindSpeed-RL](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_c_5910034.md): 本章节主要描述训练所需的yaml配置文件(通过ascendfactory-cli config 命令生成)、配置参数说明,用户可根据实际自行选择其需要的参数。若需基于本框架对多模态模型进行强化学习训练,请参见MindSpeed-MM-RL。根据以下步骤修改yaml文件。数据集选择:以下参数二选一,详解如下。参数示例值参数说明backend - [MindSpeed-MM-RL](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_c_5910035.md): MindSpeed-MM-RL针对多模态模型的强化学习任务,本章节主要描述该框架训练所需的yaml配置文件(通过ascendfactory-cli config 命令生成)、配置参数说明,用户可根据实际自行选择其需要的参数。1. 数据集及模型路径设置如下表所示。2. 权重转换设置,详解如下。3. 训练场景、权重文件、输出目录及其他重要参数 - [MindSpeed-MM](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_c_5910036.md): 本章节主要描述训练所需的yaml配置文件(通过ascendfactory-cli config 命令生成)、配置参数说明,用户可根据实际自行选择其需要的参数。根据以下示例步骤修改yaml文件。数据集及模型路径设置:参数示例值参数说明backend_config.data.dataset_param.preprocess_parameter - [tokenizer文件修改](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_c_5910037.md): 在训练开始前根据所选训练框架针对模型的tokenizer文件进行修改。当前仅涉及Llama-Factory框架下glm4-9b模型和InternVL2_5系列模型的tokenizer文件修改,具体修改内容如下,您可对tokenizer文件进行编辑。glm4-9b模型在训练开始前,需要修改glm4-9b模型中的tokenizer文件mode - [训练数据说明](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_c_5910038.md): MindSpeed-LLM、Llama-Factory框架常用数据集格式:alpaca格式sharegpt格式moss格式(仅支持MindSpeed-LLM)本教程样例数据集下载链接如下:预训练(MindSpeed-LLM):train-00000-of-00001-a09b74b3ef9c3b56.parquet,数据大小:24M左右。 - [VeRL数据处理样例脚本](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_c_5910039.md): VeRL框架中的样例数据处理脚本分为大语言模型和多模态模型,样例脚本如下,根据模型类型选择:VeRL大语言模型gsm8k数据处理多模态模型geometry3k数据处理多轮对话Agent训练gsm8k数据处理 - [显存溢出错误](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_c_5910041.md): 在训练过程中,常见显存溢出报错,示例如下:通过npu-smi info查看是否有进程资源占用NPU,导致训练时显存不足。解决可通过kill掉残留的进程或等待资源释放。可调整参数:TP张量并行(tensor-model-parallel-size) 和PP流水线并行(pipeline-model-parallel-size),可以尝试增加T - [网卡名称错误](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_c_5910042.md): 当训练开始时提示网卡名称错误或者通信超时,可以使用ifconfig命令检查网卡名称配置是否正确。比如,ifconfig看到当前机器IP对应的网卡名称为enp67s0f5,则可以设置环境变量指定该值。关于环境变量的解释可以参考:Distributed communication package - torch.distributed — P - [工作负载Pod异常](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_c_5910043.md): 当Pod状态为“Pending”,事件中出现“实例调度失败”的信息时,可根据具体事件信息确定具体问题原因。具体参考链接为工作负载状态异常定位方法。通过以下命令打印Pod日志信息。当volcano的资源出现争抢时,会出现下图中的问题。解决方法:通过打印所有Pod的信息,并找到命名有scheduler字段的Pod。kubectl get po - [OBS联动SFS_Turbo场景下dist权重保存失败](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_c_5910044.md): 在VeRL训练场景中,启用联动了OBS的SFS_Turbo,训练产物设置保存在SFS_Turbo中,训练结束保存权重时报以下错误:根因是:联动了OBS的SFS_Turbo目前不支持重命名功能解决方法如下,任选一种:使用未联动OBS的SFS_Turbo通过执行 pip show megatron-core 查看megatron-lm安装路 - [VeRL训练HCCL超时导致训练失败](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_llm_train_c_5910045.md): 当VeRL训练场景下,在训练过程中报以下错误:可尝试通过训练配置文件调大参数 actor_rollout_ref.nccl_timeout 的参数值规避。 - [moondream2基于轻量算力节点适配PyTorch NPU推理指导](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_1953.md): 本文档从模型部署的环境配置、模型转换、模型推理等方面进行介绍moondream2模型在ModelArts 轻量算力节点上部署,支持NPU推理场景。本方案目前仅适用于部分企业客户,完成本方案的部署,需要先联系您所在企业的华为方技术支持。推理部署推荐使用轻量算力节点资源和Ascend Snt9B单机单卡。请参考轻量算力节点资源开通,购买轻量算 - [Qwen3-Omni模型基于ModelArts轻量算力节点适配NPU推理指导(6.5.911)](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_qwen3omini_5911.md): Qwen3-Omni采用了Thinker-Talker混合专家架构,统一了文本、图像、音频和视频的感知与生成,能够生成流畅的文本和自然的实时语音。本方案介绍如何在ModelArts的轻量算力节点环境中,使用NPU卡对Qwen3-Omni模型进行推理。使用轻量算力节点的Snt9b23单机资源。本文档适配ModelArts 6.5.911版本 - [Z-Image-Turbo模型基于ModelArts轻量算力节点适配NPU推理指导(6.5.912)](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_wan22_infer_5912.md): 在图像内容创作领域,随着消费者对图像质量要求的提高,图像生成的需求日益增长。然而现有图像生成模型往往需要高性能的计算资源,这使得许多创作者难以负担。Z-Image-Turbo 是一款功能强大且高效的开源图像生成模型,拥有60 亿个参数,仅需8 次函数评估 (NFE),即可达到甚至超越领先竞争对手的性能,主打轻量、超快、中文友好。通过对该模 - [Open-Clip基于轻量算力节点适配NPU训练指导](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_1952.md): Open-Clip广泛应用于AIGC和多模态视频编码器的训练。本方案介绍了在ModelArts的轻量算力节点上使用NPU计算资源开展Open-Clip训练的详细过程。完成本方案的部署,需要先联系您所在企业的华为方技术支持购买轻量算力节点资源。本方案目前仅适用于企业客户。推荐使用ModelArts 轻量算力节点的Ascend Snt9B单机 - [DeepSeek Janus-Pro模型基于轻量算力节点适配NPU推理指导(6.5.908)](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_ds-januspro_infer_5902.md): DeepSeek Janus-Pro(简称:Janus-Pro),是DeepSeek发布的开源多模态AI模型,主要应用于文生图领域。本方案主要介绍在ModelArts 轻量算力节点上如何使用计算资源Ascend Snt9B开展DeepSeek Janus-Pro模型的推理过程。推荐使用ModelArts 轻量算力节点的Ascend Snt - [AIGC工具tailor使用指导](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_0166.md): tailor是AIGC场景下用于模型转换(onnx到mindir)和性能分析的辅助工具,当前支持以下功能。本工具支持x86和ARM的系统环境,使用前需要安装以下软件。tailor支持“命令行”和“Python API”两种方式使用。命令行方式命令行运行示例:tailor --model_path="./resnet50-v2-7.onnx - [Wan2.1-VACE-1.3B模型基于ModelArts轻量算力节点适配NPU推理指导(6.5.911)](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_wanvace_infer_5906.md): 在视频内容创作领域,随着消费者对视频质量要求的提高,视频生成与编辑的需求日益增长。然而,现有的视频生成模型往往需要高性能的计算资源,这使得许多创作者难以负担。Wan2.1-VACE-1.3B是开源的通义万相视频生成与编辑模型的轻量版本,专为消费级显卡设计,具备强大的多任务视频处理能力。它突破了视频生成的界限,是一个能够生成中英文文本的视频 - [Wan2.1/Wan2.2/HunyuanVideo/CogVideo系列模型基于ModelArts轻量算力节点适配NPU推理指导(6.5.911)](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_aigc_ascendx_video_5905.md): 在AI视频生成领域,越来越多的企业开始探索使用先进的视频生成模型来提升内容创作效率。然而,由于计算资源的限制,很多企业难以在本地环境中高效运行这些模型。如何解决计算资源限制,高效运行这些模型?通过使用ModelArts的轻量算力节点环境和NPU卡,企业可以轻松部署和运行这些模型,从而加速内容创作过程。本文主要介绍如何在ModelArts的 - [HiDream-I1-Full模型基于ModelArts轻量算力节点适配NPU推理指导(6.5.911)](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_hidream_5911.md): HiDream-I1 Full是由HiDream团队开发的图像生成基础MOE模型,具有稀疏DiT结构,首先采用具有动态MOE的双流结构分别处理文本以及图像信息,然后使用具有动态MOE的单流结构对信息进行混合处理,以经济高效的方式进行图像生成。但是由于其参数量的庞大,无法使用单卡对其进行推理,因此需要使用TP、EP等并行方式对其进行优化,使 - [Wan2.1系列文/图生视频模型基于ModelArts 轻量算力节点适配NPU训练指导(6.5.911)](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_wan_train_5905.md): 在视频内容创作领域,创作者们常常面临视频生成技术的限制,难以高效地生成高质量的视频内容。Wan2.1是一套全面而开放的视频基础模型,它突破了视频生成的界限,是一个能够生成中英文文本的视频模型,具有强大的视频生成功能,可增强其实际应用。本方案介如何在ModelArts的轻量算力节点环境中,使用NPU卡对Wan2.1系列模型进行训练。本方案支 - [Wan2.2对应ComfyUI框架基于轻量算力节点适配NPU推理指导(6.5.911)](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_wan22_infer_5908.md): 本文档主要介绍如何在ModelArts 轻量算力节点环境中部署文生视频、图生视频模型Wan2.2+lora i2v t2v对应ComfyUI框架,使用NPU卡进行推理。推荐使用ModelArts 轻量算力节点的Snt9b23资源。请参考轻量算力节点资源开通,购买资源,并确保机器已开通,密码已获取,能通过SSH登录,不同机器之间网络互通。购 - [Wan系列视频生成模型基于轻量算力节点的本地服务化部署(6.5.910)](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_wan_infer_5910.md): 在AI视频生成领域,越来越多的企业开始探索使用先进的视频生成模型来提升内容创作效率。然而,由于计算资源的限制,很多企业难以在本地环境中高效运行这些模型。如何解决计算资源限制,高效运行这些模型,通过使用ModelArts的轻量算力节点环境和NPU卡,企业可以轻松本地化部署和运行这些模型,从而加速内容创作过程。本文主要介绍如何在ModelAr - [ComfyUI套件下Wan2.2模型首尾帧基于ModelArts轻量算力节点适配NPU推理指导(6.5.910)](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_wan22_infer_5910.md): 在视频生成领域,ComfyUI框架因其灵活性和强大的功能而受到广泛欢迎。然而,用户在使用ComfyUI框架进行视频生成时,经常会遇到模型性能不足的问题,尤其是在处理首尾帧工作流时。如何在保持模型精度的同时,实现性能的显著提升,是用户面临的主要挑战。为此,我们针对Wan2.2-14B模型进行了线性层w8a8量化和sage attention - [方案概述](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_auto_data_911001.md): 本文档介绍客户使用ModelArts 轻量算力集群进行数据标注的详细过程,包含日志、监控等功能介绍,推荐使用的算力资源是Snt9B 313T。自动驾驶领域的数据标注,是指对采集自真实世界的原始数据(如图像、激光雷达点云、雷达信号等)进行加工处理,通过人工或辅助工具识别出数据中特定目标(如车辆、行人、交通标志灯)并为其添加标签的过程。数据标 - [版本配套关系说明](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_auto_data_911007.md): 本解决方案涉及使用如下的基础容器镜像,该镜像主要目的是提供执行标注任务的基础环境,包括pytorch、cann、python等。基础容器镜像分类名称获取路径Snt9B基础镜像包贵阳一:swr.cn-southwest-2.myhuaweicloud.com/atelier/pytorch_ascend:pytorch_2.5.1-cann - [资源规划设计](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_auto_data_911010.md): 针对CenterPoint、MaskDino等自动驾驶领域的模型,单张卡即可满足标注场景一定数据量下的推理,对于卡数则需根据单个数据集大小和一定时间内需要完成计算的数据集数量有关。例如单卡标注一个数据集平均需要20分钟,总共有150个数据集需要在1小时内标注完,则需要的卡数为150 / (60 / 20) = 50。存储资源包括基础的节 - [准备轻量算力集群环境](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_auto_data_911011.md): 本文档中的模型运行环境是ModelArts轻量算力集群,请参考本文档要求准备资源环境。如果使用轻量算力集群资源,请先阅读k8s Cluster资源购买,熟悉集群资源开通流程,再开始操作购买轻量算力集群资源。完成集群资源购买和开通后,需要对网络、存储、容器镜像等内容进行配置,请参考轻量算力集群资源配置流程。进入已创建的 CCE 集群控制面板 - [准备预处理数据](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_auto_data_911012.md): 预处理数据和选用的模型有关,如CenterPoint模型的输入数据来自激光雷达扫描,MaskDino模型的输入数据来自2D图像,这些数据都需要经过一定的预处理以符合模型的输入要求。本方案以开源的YOLOv7模型为例,通过如下链接(http://images.cocodataset.org/zips/val2017.zip)下载数据集,YO - [准备基础镜像](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_auto_data_911013.md): 由于准备模型时可能需要使用基础镜像,因此需要提前准备基础镜像。Kubernetes社区已经在v1.24版本中移除Dockershim,建议将容器引擎从Docker逐步迁移至官方推荐的Containerd,以确保未来与Kubernetes版本的兼容性和持续支持。所以轻量算力集群目前推荐使用Containerd作为容器引擎,安装镜像。SSH登 - [准备模型](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_auto_data_911014.md): 本方案以开源YOLOv7模型为例说明如何准备模型。在宿主机上基于步骤二:获取基础镜像获取的基础镜像起一个容器,挂载宿主机目录/home/driving_model用于存储模型相关数据,启动容器可参考如下命令:ctr run \ --device=/dev/davinci_manager \ --device=/dev/devmm_ - [准备标注镜像](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_auto_data_911015.md): 获取模型和启动代码。准备模型已将导出的mindir模型放置于/home/driving_model,将AscendCloud-ACD-6.5.911-xxx.zip包上传到节点机器/home/driving_model,执行命令解压:unzip AscendCloud-ACD-6.5.911-xxx.zip准备模型已将导出的mindir模 - [部署Argo服务](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_auto_data_911016.md): Argo服务作为标注工作的计划编排服务,需要在执行标注作业前部署,详细的部署参考Argo的快速开始。Argo服务部署在argo命名空间下,首先创建argo命名空间。kubectl create ns argo下载部署Argo,这里以3.7.0版本为例,则变量ARGO_WORKFLOWS_VERSION取v3.7.0。kubectl app - [NPU标注](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_auto_data_911018.md): 自动驾驶标注流程包含前处理、3D推理、2D推理、后处理等多个步骤,如果NPU可以处理全部标注流程,则可将标注方案称为NPU标注。如果标注所有流程均可使用NPU执行,则可以在任务yaml文件中指定流程均运行在NPU上,如下的data-label-workflow-npu.yaml文件可作为标注编排的参考。data-label-workflo - [轻量算力集群监控告警方案](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_auto_data_911024.md): ModelArts 轻量算力集群会定期收集资源池中各节点的关键资源(GPU、NPU、CPU、Memory等)的使用情况,并上报到应用运维管理AOM和云监控平台CES。整体监控告警方案如下图所示:AOM:ModelArts相关的监控指标,通过AOM进行上报;CES:部分AOM无法覆盖的节点指标,通过CES进行上报;SMN:告警规则关联SMN - [AOM监控告警](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_auto_data_911025.md): AOM提供告警监控能力,具体功能可参考AOM告警监控功能说明。创建AOM告警通知规则创建AOM指标告警规则并关联通知规则轻量算力集群资源池节点故障告警(通过PromQL进行配置)对于ModelArts 轻量算力集群资源池,每个节点会以DaemonSet方式部署node-agent组件,该组件会检测节点状态,并将检测结果写到K8S Node - [CES告警](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_auto_data_911026.md): 具体配置操作请参见创建CES告警规则和关联主题通知文档,下表介绍关键的告警信息。 - [SMN消息通知配置(可选)](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_auto_data_911027.md): 创建消息主题。订阅消息主题。 - [日志介绍](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_auto_data_911029.md): 本章介绍在轻量算力集群模式下执行数据标注的日志配置及对接建议,包含四部分内容:CANN应用类日志、标注推理日志、NPU Device 日志、OS日志。在数据标注过程中,有多种类型的日志可用于监控和分析:标准输出(标注推理日志):这是用户最常关注的日志,其中包含了任务的实时运行状态等关键信息。CANN应用类日志、Device侧日志、主机侧日 - [NPU Device日志及OS日志转储](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_auto_data_911030.md): NPU Device日志及OS日志都是宿主机层面的日志,与容器及作业ID无法直接关联,可使用脚本在crontab中定期执行上传或人工手动触发上传至OBS,推荐将日志转储成如下目录,方便后期关联job以进行定位诊断。关于NPU Device日志和OS日志采集操作请参考NPU日志收集上传章节,该操作也适用于轻量算力集群场景。 - [日志转储LTS](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_auto_data_911032.md): 关于CCE集群配置容器标准输出和Kubernetes事件采集至LTS,可参考“通过云原生日志采集插件采集容器日志”。当配置完成后,可按如下步骤在LTS上查看CCE接入的日志:在CCE控制台的集群基本信息页面查看集群ID。查找集群ID登录LTS控制台,在日志管理页面,通过集群ID查看对应的日志组。查看日志在日志详情页中查看日志内容已生成。查 - [LTS日志转储OBS](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_auto_data_911033.md): 进入LTS控制台,在日志转储页面,单击右上角的配置转储,根据界面提示配置日志转储信息。日志转储配置日志转储信息时,对应的参数设置如下:日志源:当前账号转储方式:周期性转储是否开启转储:是转存对象:OBS日志组名称:选择已创建的日志组。日志流名称:选择已创建的日志流。已配置过OBS转储的日志流不能重复配置。OBS桶:已创建的OBS桶自定义转 - [OBS日志定期清理](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_auto_data_911034.md): 在OBS控制台,进入OBS桶,单击左侧数据管理 > 生命周期管理。单击创建。创建生命周期规则在创建生命周期规则页面,根据界面提示信息配置,具体的参数配置如下。状态:开启规则名称:自定义范围:对象前缀前缀:LogTanks/cn-southwest-2当前版本状态:开启最后一次修改3天后删除创建生命周期规则状态:开启规则名称:自定义范围:对 - [因缺乏Ascend Docker Runtime导致无法启动容器](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_auto_data_911039.md): 当需要手动启动容器时,若启动的容器需要依赖Ascend Docker Runtime,启动容器时提示缺乏Ascend-Docker-Runtime。参考如下流程安装。安装包下载完成后,首先进入安装包(run包)所在路径。cd 执行以下命令,为软件包添加可执行权限。chmod u+x Ascend- - [方案概述](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_auto_train_911001.md): 本方案介绍了在ModelArts上使用PyTorch框架开展UniAD模型的训练过程,涵盖了数据加载、训练作业创建、训练作业快恢、日志转储以及监控等各类常规操作。本架构描述了ModelArts训练平台进行模型训练的整体方案:此解决方案重点关注训练任务如何创建以及训练任务可靠性、运维等方面。在存储上使用OBS存储原始数据,使用SFS Tur - [版本说明](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_auto_train_911002.md): 本解决方案所涉及的各组件及其版本关系见表1 配套关系表,其中ModelArts 训练平台产品的依赖关系见ModelArts版本配套关系表。昇腾云框架包训练相关的目录说明如下: - [资源规划设计](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_auto_train_911004.md): 部署所需算力和存储资源考虑维度如下:训练作业的性能要求。模型权重存储的性能与容量规格。训练机器资源规划。针对UniAD模型,单机就可以满足模型的训练。对于卡数的选择与batchsize的大小,数据量的大小有关,例如:batchsize 为 4,数据量为400G,样本数11w,所占用显存大小为50GB。所需卡数 = 预估显存/单卡显存数量。 - [准备训练代码、数据集和镜像](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_auto_train_911005.md): 训练代码包含训练文件,启动命令等内容。启动命令开发规范可以参考开发用于自定义镜像训练的代码。断点续训适配。UniAD模型内部已经具备了断点续训的能力,无需修改代码。其他框架中如果没有具备断点续训的能力,那么需要进行代码适配。PyTorch框架适配断点续训的示例代码如下:准备一套可以连接外部网络,装有Linux系统并安装18.09.7及以上 - [执行训练作业](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_auto_train_911006.md): 在ModelArts控制台模型训练页面创建训练作业,详细操作请参见创建生产训练作业,此处仅介绍关键参数。训练作业中环境配置如下启动命令如下:--nproc_per_node=8 表示每个节点上启动的训练进程数。--nnodes=1 表示有多少个节点参与分布式训练。--node_rank=0 表示当前节点的排名。--master_port= - [训练结果输出](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_auto_train_911007.md): 当训练作业的状态变为已完成时,则可以查看训练结果日志。在本例中,在OBS桶中的/train-test/log路径下查看输出结果,部分示例结果如下。 - [默认监控告警](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_auto_train_911009.md): 模型在进行训练时,需要重点关注系统资源的使用情况,例如:NPU,CPU,存储。当前AOM服务可以监控上述系统资源,同时支持设置告警规则,关键指标如表1 指标查看与告警配置建议所示。 - [自定义监控指标](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_auto_train_911010.md): 在训练过程中,loss值,吞吐量等非系统资源指标也需要监控,此时可以使用AOM提供的相关接口来采集非系统资源指标。自定义指标采集方式如下:核心代码示例:接入SDK的详细代码见文档:使用SDK上报自定义指标到AOM验证自定义指标是否接入成功: 监控指标验证相关指标的告警阈值由客户自行决定:告警配置文档 - [日志采集与转储](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_auto_train_911011.md): 用户在训练的过程中,如果出现异常需要定位问题,可查看训练进程日志、ModelArts平台日志以及Ascend日志。训练平台训练日志可以在ModelArts控制台和OBS上查看。推荐方案:训练平台训练日志可以通过云原生日志采集插件采集到LTS。日志采集到LTS后对于历史日志建议转储至OBS。ModelArts 训练平台日志介绍请参见文档在M - [GPU迁移到NPU:手写数字识别](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_06_0035.md): 在AI大模型训练与推理中,昇腾NPU作为国产算力平台,提供了与NVIDIA GPU对标的计算能力。对于已有基于GPU的PyTorch代码,开发者往往关心迁移成本与适配难度。torch_npu作为昇腾PyTorch适配包,使得标准PyTorch代码仅需极少量改动即可在NPU上运行,大幅降低迁移门槛。本教程适用于已有基于GPU的PyTorch - [迁移流程](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_2500.md): 本文介绍如何将客户已有的PyTorch训练业务迁移到昇腾设备上运行并获得较好的模型训练效果。华为云ModelArts针对该场景提供了系统化的迁移指导,包括迁移原理、迁移流程以及迁移后的精度调试及性能调优方法介绍。此外,ModelArts提供了即开即用的云上集成开发环境,包含迁移所需要的算力资源、AI框架、昇腾开发套件以及迁移调优工具链,最 - [代码迁移](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_2501.md): 本篇指导是迁移的总体思路介绍,便于用户对迁移过程有一个整体的认识。如果您希望通过具体案例直接实操,请参考主流开源大模型基于ModelArts Lite Server适配AscendFactory PyTorch NPU训练指导。该案例以ChatGLM-6B为例,介绍如何将模型迁移至昇腾设备上训练、模型精度对齐以及性能调优。本文以弹性裸金属 - [精度问题概述](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_2518.md): 随着ChatGPT的推出,大模型迅速成为AI界热点。大模型训练需要强大的算力支撑,涉及数据、模型、框架、算子、硬件等诸多环节。由于规模巨大,训练过程复杂,经常出现loss不收敛的情况(模型精度问题),主要表现为loss曲线起飞或者毛刺等,且模型的下游任务评测效果变差。影响大模型loss收敛的原因是多方面的:首先,数据问题可能导致不收敛,比 - [精度调优总体思路](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_2519.md): PyTorch大模型训练的精度问题的分析、定位可以参考如下思路:大模型训练通常使用多机训练,鉴于多机训练复现问题的成本较高,且影响因子较多,建议用户先减少模型层数,使模型能够单机训练,确认单机训练是否也存在精度问题,如果存在,则使用下述手段定位精度问题,使得单机精度达标,然后再恢复层数拉起多机训练。若单机精度正常但多机精度异常,有可能是多 - [精度调优前准备工作](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_2520.md): 在定位精度问题之前,首先需要排除训练脚本及参数配置等差异的干扰。目前大部分精度无法对齐的问题都是由于模型超参数、Python三方库版本、模型源码等与标杆环境(GPU/CPU)设置的不一致导致,为了在定位过程中少走弯路,需要在定位前先对训练环境及代码做有效排查。此外,问题定位主要基于GPU环境和NPU环境上运行的过程数据做对比,所以需要分别 - [msprobe精度分析工具使用指导](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_2521.md): msprobe是MindStudio Training Tools工具链下精度调试部分的工具包,其通过采集和对比标杆(GPU/CPU)环境和昇腾环境上运行训练时的差异点来判断问题所在,主要包括精度预检、精度比对和梯度监控等功能。更多内容请参考msprobe工具介绍。一般场景的训练模型都是包括随机种子、数据集Shuffle、网络结构Drop - [调优流程](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_2506.md): PyTorch在昇腾AI处理器的加速实现方式是以算子为粒度进行调用(OP-based),即通过Python与C++调用CANN层接口Ascend Computing Language(AscendCL)调用一个或几个亲和算子组合的形式,代替原有GPU的实现方式,具体逻辑模型请参考PyTorch自动迁移。在PyTorch模型迁移后进行训练的 - [性能诊断](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_2526.md): MA-Advisor是一款迁移性能问题自动诊断工具,其集成了昇腾自动诊断工具msprof-analyze,并在ModelArts的Jupyter lab平台进行了插件化,能快速分析和诊断昇腾场景下PyTorch性能劣化问题并给出相关调优建议。在过往性能调优场景中,如果性能profiling数据在OBS上,通常需要将TB或者GB级别的pro - [性能可视化](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_2527.md): 对于高阶的调优用户,可以使用可视化工具MindStudio Insight查看profiling数据详情并分析可优化点,其提供了丰富的调优分析手段,可视化呈现真实软硬件运行数据,多维度分析性能瓶颈点,支持百卡、千卡及以上规模的可视化集群性能分析,助力开发者天级完成性能调优。MindStudio-Insight提供时间线视图、内存、算子耗时 - [场景介绍及环境准备](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_09_2007.md): DiT(Diffusion Transformers)模型是一种将Transformer架构引入扩散模型的新方法。传统的扩散模型通常使用U-Net架构,而DiT模型则用Transformer替代了U-Net,处理图像生成和去噪等任务。核心思想是通过Transformer的自注意力机制来捕捉序列中的依赖关系,从而提高生成图像的质量。研究表明 - [训练迁移适配](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_09_2008.md): 完成环境准备之后,本节将详细介绍Dit模型训练迁移过程。下载Kaggle官网提供的imagenet-mini数据集,解压之后文件大小4.1GB。该数据集是从[imagenet-2012]数据集中筛选的少量数据集。下载Hugging Face权重。入口函数train.py导入自动迁移接口。执行以下命令,导入自动迁移接口。import tor - [长训Loss比对结果](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_09_2010.md): 在单卡环境下,执行一个Epoch训练任务,GPU和NPU训练叠加效果如下:上图中的红色曲线为GPU Loss折线图,蓝色曲线为NPU训练Loss折线图。在整网训练单个Epoch情况下,Loss总体的绝对偏差大约为0.08181。 - [使用Msprobe工具分析偏差](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_09_2011.md): 观察上一章Loss趋势,在首个Step有较小偏差,所以对第一个Step进行比对分析。此处使用Msprobe的整网Dump和比对分析功能。执行以下命令,安装社区Msprobe工具。pip install mindstudio-probe使能工具进行数据Dump分析。本实验可在train.py中如下两处添加使能代码:其中config.json - [Loss对齐结果](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_09_2012.md): 在排查完精度偏差来源之后发现,Loss最大绝对偏差减少为0.0003,Loss结果对齐。需要注意训练引入随机性的目的是为了增加结果的鲁棒性,理论上不会对训练模型的收敛与否造成影响。此处做随机性固定主要的目的是为了训练结果可完全复现,从而实现NPU和标杆的精度对齐。 - [Profiling数据采集](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_09_2014.md): 在train.py的main()函数Step迭代处添加配置,添加位置如下图所示:此处需要注意的是prof.step()需要加到dataloder迭代循环的内部以保证采集单个Step迭代的Profiling数据。更多信息,请参见Ascend PyTorch Profiler接口采集。 - [使用Advisor工具分析生成调优建议](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_09_2015.md): 关于Advisor使用及安装过程请参见昇腾社区Gitee。最后生成导出的各类场景的建议包含以下两种:Terminal日志信息的概览建议。包含Detail信息及修改示例的HTML信息。按照建议信息做如下修改:亲和优化器使能,在train.py中修改优化器为apex混合精度模式下的DDP优化方式(修改点:注释第161和167行,增加第168~ - [调优前后性能对比](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_09_2016.md): 在完成上一章几类调优方式之后,在单卡场景下实测性能调优比对结果如下表所示: - [简介](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_1154.md): 本文旨在指导客户将已有的推理业务迁移到昇腾设备上运行(单机单卡、单机多卡),并获得更好的推理性能收益。ModelArts针对上述使用场景,在给出系统化推理业务昇腾迁移方案的基础上,提供了即开即用的云上集成开发环境,包含迁移所需要的算力资源和工具链,以及具体的Notebook代码运行示例和最佳实践,并对于实际的操作原理和迁移流程进行说明,包 - [昇腾迁移快速入门案例](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_1155.md): ModelArts提供了两个昇腾迁移案例,方便您快速了解并完成昇腾迁移过程。当前仅贵阳一区域支持选择本案例中的规格及镜像。部分配置项说明如下。关于配置项的更多信息,请参见创建Notebook实例。新建Terminal,执行下述命令将对应的repo克隆到Notebook实例。ResNet50模型迁移到Ascend上进行推理:通过使用Mind - [迁移评估](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_1156.md): 推理迁移包括模型迁移、业务迁移、精度性能调优等环节,是否能满足最终的迁移效果需要进行系统的评估。如果您仅需要了解迁移过程,可以先按照本文档的指导进行操作并熟悉迁移流程。如果您有实际的项目需要迁移,建议填写下方的推理业务迁移评估表,并将该调研表提供给华为云技术支持人员进行迁移评估,以确保迁移项目能顺利实施。通用的推理业务及LLM推理可提供下 - [环境准备](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_1157.md): ModelArts开发环境针对推理昇腾迁移的场景提供了云上可以直接访问的开发环境,具有如下优点:利用云服务的资源使用便利性,可以直接使用到不同规格的昇腾设备。通过指定对应的运行镜像,可以直接使用预置的、在迁移过程中所需的工具集,且已经适配到最新的版本可以直接使用。开发者可以通过浏览器入口以Notebook方式访问,也可以通过VSCode远 - [基于MindSpore Lite的模型转换](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_1159.md): 迁移推理业务的整体流程如下:模型准备转换关键参数准备模型转换推理应用适配主要通过MindSpore Lite(简称MSLite)进行模型的转换,进一步通过MindSpore Runtime支持昇腾后端的能力来将推理业务运行到昇腾设备上。MindSpore Lite提供的模型convertor工具可以支持主流的模型格式到MindIR的格式转 - [动态shape](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_1160.md): 在某些推理场景中,模型输入的shape可能是不固定的,因此需要支持用户指定模型的动态shape,并能够在推理中接收多种shape的输入。在CPU上进行模型转换时无需考虑动态shape问题,因为CPU算子支持动态shape;而在Ascend场景上,算子需要指定具体的shape信息,并且在模型转换的编译阶段完成对应shape的编译任务,从而能 - [精度校验](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_1162.md): 转换模型后执行推理前,可以使用benchmark工具对MindSpore Lite云侧推理模型进行基准测试。它不仅可以对MindSpore Lite云侧推理模型前向推理执行耗时进行定量分析(性能),还可以通过指定模型输出进行可对比的误差分析(精度)。benchmark工具用于精度验证,主要工作原理是:固定模型的输入,通过benchmark - [性能调优](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_1163.md): benchmark工具也可用于性能测试,其主要的测试指标为模型单次前向推理的耗时。在性能测试任务中,与精度测试不同,并不需要用户指定对应的输入(inDataFile)和输出的标杆数据(benchmarkDataFile),benchmark工具会随机生成一个输入进行推理,并统计推理时间。执行的示例命令行如下。为了简化用户使用,ModelA - [迁移过程使用工具概览](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_1165.md): 基础的开发工具在迁移的预置镜像和开发环境中都已经进行预置,用户原则上不需要重新安装和下载,如果预置的版本不满足要求,用户可以执行下载和安装与覆盖操作。为了简化用户使用,ModelArts提供了Tailor工具,将模型转换、精度benchmark、性能benchmark和profiling采集工具集成到同一个工具中,极大简化了用户的使用流程 - [MindSpore Lite问题定位指南](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_1167.md): 在MindSpore Lite使用中遇到问题时,例如模型转换失败、训练后量化转换失败、模型推理失败、模型推理精度不理想、模型推理性能不理想、使用Visual Studio报错、使用Xcode构建APP报错等,您可以先查看日志信息进行定位分析。多数场景下的问题可以通过日志报错信息直接定位。如果日志的信息不能定位问题,您可以通过设置环境变量调 - [模型转换报错如何查看日志和定位?](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_1170.md): 通过如下的配置项打开对应的模型转换日志,可以看到更底层的报错。如配置以下的环境变量之后,再重新转换模型,导出对应的日志和dump图进行分析:报错日志中搜到“not support onnx data type”,表示MindSpore暂不支持该算子。报错日志中搜到“Convert graph to om failed”,表示CANN模块进 - [日志提示Compile graph failed](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_1171.md): 日志提示:Compile graph failed。模型转换时未指定Ascend后端。需要在模型转换阶段指定--device=Ascend。 - [日志提示Custom op has no reg_op_name attr](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_1172.md): 日志提示:Custom op has no reg_op_name attr。无。定义context时无需指定: - [推理业务迁移评估表](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_1174.md): 通用的推理业务及LLM推理可提供下表进行业务迁移评估:如果是AIGC场景的业务例如Stable Diffusion,请在上表的基础上,再提供以下信息: - [场景介绍](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_2000.md): 阅读本文前建议您先了解以下内容:Stable Diffusion的基础知识,可参考Stable Diffusion github、Stable Diffusion wikipedia、diffusers github、Stable Diffusion with diffusers。推理业务迁移到昇腾的通用流程,可参考推理迁移指导(Mind - [迁移环境准备](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_2001.md): 迁移环境准备有以下两种方式:本文基于方式二的环境进行操作,请参考方式二中的环境开通和配置指导完成裸机和容器开发初始化配置。注意业务基础镜像选择Ascend+PyTorch镜像。配置好的容器环境如下图所示: - [pipeline应用准备](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_2002.md): 当前迁移路径是从ONNX模型转换到MindIR模型,再用MindSpore Lite做推理, 所以迁移前需要用户先准备好自己的ONNX pipeline。下文以官方开源的图生图的Stable Diffusion v1.5的onnx pipeline代码为例进行说明。由于在Snt9B裸金属服务器环境配置指南的配置环境步骤中,在启动容器时将物 - [模型适配](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_2004.md): MindSpore Lite是华为自研的推理引擎,能够最大化地利用昇腾芯片的性能。在使用MindSpore Lite进行离线推理时,需要先将模型转换为mindir模型,再利用MindSpore Lite作为推理引擎,将转换后的模型直接运行在昇腾设备上。模型转换需要使用converter_lite工具。Huggingface提供的onnx模 - [pipeline代码适配](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_2005.md): onnx pipeline的主要作用是将onnx模型进行一系列编排,并在onnx Runtime上按照编排顺序执行。因此,需要将转换得到的mindir模型按照相同的逻辑进行编排,并在MindSpore Lite上执行。只需要将原始onnx的pipeline中涉及到onnx模型初始化及推理的接口替换为MindSpore Lite的接口即可。 - [迁移效果校验](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_2006.md): 在pipeline适配完成后,需要验证适配后的效果是否满足要求,通过对比原始onnx pipeline的最终输出结果确认迁移效果。如果精度和性能都没有问题,则代表迁移完成。在CPU上推理onnx,将原始onnx和适配完成的MindSpore Lite pipeline输出的结果图片进行对比,在这里保证输入图片及文本提示词一致。如果差异较为 - [场景介绍](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_2024.md): 本小节通过一个具体问题案例,介绍模型精度调优的过程。如下图所示,使用MindSpore Lite生成的图像和onnx模型的输出结果有明显的差异,因此需要对MindSpore Lite pipeline进行精度诊断。在MindSpore Lite 2.0.0版本中,Stable Diffusion的五个模型的精度都能够保证一致性,但是在最新 - [精度问题诊断](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_2008.md): 该方式主要是通过模型替换,先定位出具体哪个模型引入的误差,进一步诊断具体的模型中哪个算子或者操作导致效果问题,模型替换原理如下图所示。通过设置开关选项(是否使用onnx模型),控制模型推理时,模型使用的是onnx模型或是mindir的模型。一般情况下,onnx模型推理的结果可以认为是标杆数据,单独替换某个onnx模型为MindSpore - [精度问题处理](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_2009.md): 在转换模型时,默认采用的精度模式是fp16,如果转换得到的模型和标杆数据的精度差异比较大,可以使用fp32精度模式提升模型的精度(精度模式并不总是需要使用fp32,因为相对于fp16,fp32的性能较差。因此,通常只在检测到某个模型精度存在问题时,才会考虑是否使用fp32进行尝试)。使用fp32精度模式的配置文件如下:配置文件:需要实际分 - [单模型性能测试工具Mindspore lite benchmark](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_2011.md): 在模型精度对齐后,针对Stable Diffusion模型性能调优,您可以通过AOE工具进行自助性能调优,进一步可以通过profiling工具对于性能瓶颈进行分析,并针对性地做一些调优操作。您可以直接使用benchmark命令测试mindir模型性能,用来对比调优前后性能是否有所提升。上述命令中:modelFile指定生成的mindir模 - [单模型性能调优AOE](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_2012.md): 使用AOE工具可以在模型转换阶段对于模型运行和后端编译过程进行执行调优。请注意AOE只适合静态shape的模型调优。在AOE调优时,容易受当前缓存的一些影响,建议分两次进行操作,以达到较好的优化效果(第一次执行生成AOE的知识库,在第二次使用时可以复用)。在该场景中,AOE对text_encoder等模型提升效果不大,性能主要瓶颈点在un - [常见问题](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_2013.md): 模型转换失败怎么办?常见的模型转换失败原因可以通过查询转换失败错误码来确认具体导失败的原因。Stable Diffusion新推出的模型在转换中可能会遇到算子不支持的问题,您可以到华为云管理页面上提交工单来寻求帮助。常见的模型转换失败原因可以通过查询转换失败错误码来确认具体导失败的原因。Stable Diffusion新推出的模型在转换中 - [工具总览](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_1175.md): ModelArts集成了多个昇腾迁移调优工具,方便您在ModelArts平台环境中进行训练推理迁移、精度调试、性能调优等工作,您可在下表中查看当前ModelArts支持的昇腾迁移调优工具及对应指导。表格中的部分工具已集成到ModelArts基础镜像中。如果您使用的是ModelArts基础镜像,可先尝试直接使用工具命令,如果相关命令不存在则 - [数据dump指导](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_25193.md): msprobe是MindStudio Training Tools工具链下精度调试部分的工具包,主要包括精度预检、溢出检测、精度比对和梯度监控等功能,目前适配PyTorch和MindSpore框架。这些子工具侧重不同的训练场景,可以定位模型训练中的精度问题。已安装msprobe工具,建议使用官方支持的版本。具备相应的系统权限,可执行数据d - [advisor异常值分析](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_25194.md): msprobe advisor异常值分析功能可快速定位训练过程中出现的异常值(例如NaN、Infinity等),通过分析msprobe dump的统计量数据,结合通信建模和联立分析,能够自动定位问题发生的初始位置。该功能主要针对以下训练问题现象:训练日志中出现loss、grad norm等关键指标异常:出现Nan、Infinity等无效值 - [API预检](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_2524.md): 精度预检工具旨在计算单个API在整网计算中和标杆场景下的差异,对于无明确精度差异来源情况或者对模型了解不多的情形下都推荐使用预检工具,检查第一个步骤或Loss明显出现问题的步骤。它可以抓取模型中API输入的数值范围,根据范围随机生成输入,用相同的输入分别在NPU(GPU)和CPU上执行算子,比较输出差异。预检最大的好处是,它能根据算子(A - [精度比对](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_2525.md): 精度比对功能主要针对两类场景的问题:同一模型,从CPU或GPU移植到NPU中存在精度下降问题,对比NPU芯片中的API计算数值与CPU或GPU芯片中的API计算数值,进行问题定位。同一模型,进行迭代(模型、框架版本升级或设备硬件升级)时存在的精度下降问题,对比相同模型在迭代前后版本的API计算数值,进行问题定位。首先通过在PyTorch训 - [梯度监控](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_25211.md): 梯度监控工具提供了将模型梯度数据导出的能力。使用梯度监控工具,可以实现对训练过程模型每一层梯度信息进行监控,目前支持两种能力:将模型权重的梯度数据导出。这种功能可以将模型权重的梯度值以统计量的形式采集出来,用以分析问题,例如检测确定性问题,使用训练状态监控工具监控NPU训练过程中的确定性计算问题。将两份梯度数据进行相似度对比。在有标杆问题 - [精度调试:TensorBoard可视化](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_25195.md): TensorBoard是TensorFlow的可视化工具包,提供机器学习实验所需的可视化功能和工具。TensorBoard能够有效地展示训练过程中的计算图、各种指标随时间的变化趋势以及训练中使用到的数据信息,帮助用户快速识别训练精度问题。在JupyterLab中使用TensorBoard可视化作业页面介绍了如何在云上ModelArts开发 - [advisor调优总体步骤](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_advisor_2000.md): 基于ModelArts performance advisor插件的昇腾PyTorch性能调优主要分为以下步骤:准确采集性能劣化时刻的profiling数据。存储profiling数据。创建advisor分析环境。对于固定step出现性能劣化,如固定在16步出现性能劣化,则需要合理配置profiling参数,确保能采集到16步的数据。对于 - [创建诊断任务](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_advisor_2001.md): 本文介绍如何创建Notebook并执行性能诊断任务。在ModelArts控制台创建一个Notebook实例,选择要使用的AI框架,创建Notebook时可以选择任意镜像。具体参见创建Notebook实例。不同AI引擎的Notebook,打开后Launcher页面呈现的Notebook和Console内核及版本均不同,图2仅作为示例,请以实 - [创建调试训练作业并执行性能诊断任务](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_advisor_2002.md): 本文介绍如何创建调试训练作业并执行性能诊断任务。在ModelArts管理控制台创建训练作业,详细操作请参考创建调试训练作业。其中,作业模式选择“调试模式”,训练应用程序选择“JupyterLab”,环境变量中新增“MA_PROF_ADVISOR_ENABLE=true”。训练调试模式当前处于受限使用阶段,如需使用请提交工单申请开通。 - [查看诊断报告](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_advisor_2003.md): Advisor分析profiling会输出html和xlsx两份文件。请优先查看html报告进行训练作业性能调优。xlsx中记录了html中全量数据,如集群计算、通信和下发的耗时,可以基于xlsx对计算耗时、下发耗时和带宽等列进行排序,从而快速过滤出计算慢卡、下发慢卡、带宽最小卡。html中包括总体性能分析(overall)、快慢卡算子性 - [将Notebook的Conda环境迁移到SFS磁盘](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_0141.md): 本文介绍了如何将Notebook的Conda环境迁移到SFS磁盘上。这样重启Notebook实例后,Conda环境不会丢失。步骤如下:创建新的虚拟环境并保存到SFS目录克隆原有的虚拟环境到SFS盘重新启动镜像激活SFS盘中的虚拟环境保存并共享虚拟环境创建一个Notebook,资源类型选择专属资源池,存储配置选择SFS弹性文件服务器,打开t - [在ModelArts上运行训练作业的场景介绍](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_20_2002.md): 不同AI模型训练所需要的数据量和算力不同,在训练时选择合适的存储及训练方案可提升模型训练效率与资源性价比。ModelArts 支持单机单卡、单机多卡和多机多卡的训练场景,满足不同AI模型训练的要求。ModelArts提供了公共资源池和专属资源池,专属资源池不与其他用户共享资源,更加高效。针对企业多用户场景,推荐使用专属资源池开展AI模型训 - [在ModelArts运行训练作业的准备工作](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_20_2003.md): 使用ModelArts的专属资源池训练时,需要完成以下准备工作。使用华为云主账号创建一个开发者用户组user_group,将开发者账号加入用户组user_group中。具体操作请参见Step1 创建用户组并加入用户。创建自定义策略。使用华为云主账号登录华为云管理控制台,单击右上角用户名,在下拉框中选择统一身份认证,进入IAM服务。在统一身 - [在ModelArts上运行单机单卡训练作业](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_20_0034.md): 准备工作购买服务资源(OBS和SWR)配置权限创建专属资源池(不需要打通VPC)安装和配置OBS命令行工具(可选)工作空间配置购买服务资源(OBS和SWR)配置权限创建专属资源池(不需要打通VPC)安装和配置OBS命令行工具(可选)工作空间配置模型训练本地构建镜像及调试上传镜像上传数据和算法到OBS使用Notebook进行代码调试创建单机 - [在ModelArts上运行单机多卡训练作业](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_20_0027.md): 准备工作:购买服务资源(VPC、SFS、SWR和ECS)配置权限创建专属资源池(打通VPC)在ECS服务器挂载SFS Turbo存储在ECS中设置ModelArts用户可读权限安装和配置OBS命令行工具(可选)工作空间配置购买服务资源(VPC、SFS、SWR和ECS)配置权限创建专属资源池(打通VPC)在ECS服务器挂载SFS Turbo - [在ModelArts上运行多机多卡训练作业](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_20_2040.md): 准备工作:购买服务资源(VPC/SFS/OBS/SWR/ECS)配置权限创建专属资源池(打通VPC)ECS服务器挂载SFS Turbo存储在ECS中设置ModelArts用户可读权限安装和配置OBS命令行工具(可选)工作空间配置购买服务资源(VPC/SFS/OBS/SWR/ECS)配置权限创建专属资源池(打通VPC)ECS服务器挂载SFS - [在ModelArts使用run.sh脚本实现OBS和训练容器间的数据传输](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_20_2055.md): 自定义容器在ModelArts上训练和本地训练的区别如下图:ModelArts上进行训练比本地训练多了一步OBS和容器环境的数据迁移工作。增加了和OBS交互工作的整个训练流程如下:建议使用OBSutil作为和OBS交互的工具,如何在本机安装obsutil可以参考安装和配置OBS命令行工具。训练数据、代码、模型下载。(本地使用硬盘挂载或者d - [通过专属APIG&WAF&VPC&ELB连接内网访问在线服务](https://support.huaweicloud.com/bestpractice-modelarts/inference2.0-modelarts-0043.md): 为了确保外网用户能够安全、高效地访问ModelArts提供的在线服务,并更灵活地整合ModelArts提供的预测服务,本方案将详细描述如何通过专属API Gateway(APIG)、Web应用防火墙(WAF)、虚拟私有云(VPC)和弹性负载均衡(ELB)连接内网访问ModelArts在线服务。流量访问说明如下:用户在浏览器输入域名后,客户 - [通过弹性负载均衡ELB访问在线服务](https://support.huaweicloud.com/bestpractice-modelarts/inference2.0-modelarts-0104.md): 弹性负载均衡(Elastic Load Balance,简称ELB)是将访问流量根据分配策略分发到后端多台服务器的流量分发控制服务。弹性负载均衡可以通过流量分发扩展应用系统对外的服务能力,同时通过消除单点故障提升应用系统的可用性。为了确保外网用户能够安全、高效地访问ModelArts提供的在线服务,并更灵活地整合ModelArts提供的预 - [ModelArts推理服务访问公网方案](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_04_0203.md): 本章节提供了推理服务访问公网的方法。推理服务访问公网地址的场景,如:输入图片,先进行公网OCR服务调用,然后进行NLP处理;进行公网文件下载,然后进行分析;分析结果回调给公网服务终端。从推理服务的算法实例内部,访问公网服务地址的方案。如下图所示:创建好VPC和子网,具体步骤请参考创建虚拟私有云和子网。创建ModelArts专属资源池网络。 - [端到端运维ModelArts推理服务方案](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_04_0204.md): ModelArts推理服务的端到端运维覆盖了算法开发、服务运维和业务运行的整个AI流程。推理服务的端到端运维流程算法开发阶段,先将业务AI数据存放到对象存储服务(OBS)中,接着通过ModelArts数据管理进行标注和版本管理,然后通过训练获得AI模型结果,最后通过开发环境构建模型镜像。服务运维阶段,先利用镜像构建模型,接着部署模型为在线 - [使用自定义引擎在ModelArts创建模型](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_04_0230.md): 使用自定义引擎创建模型,用户可以通过选择自己存储在SWR服务中的镜像作为模型的引擎,指定预先存储于OBS服务中的文件目录路径作为模型包来创建模型,轻松地应对ModelArts平台预置引擎无法满足个性化诉求的场景。使用自定义引擎创建模型,用户的SWR镜像、OBS模型包和文件大小需要满足以下规范:SWR镜像规范:镜像必须内置一个用户名为“ma - [使用大模型在ModelArts创建模型部署在线服务](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_04_0275.md): 目前大模型的参数量已经达到千亿甚至万亿,随之大模型的体积也越来越大。千亿参数大模型的体积超过200G,在版本管理、生产部署上对平台系统产生了新的要求。例如:导入模型时,需要支持动态调整租户存储配额;模型加载、启动慢,部署时需要灵活的超时配置;当负载异常重启,模型需要重新加载,服务恢复时间长的问题亟待解决。为了应对如上诉求,ModelArt - [第三方推理框架迁移到ModelArts推理自定义引擎](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_04_0277.md): ModelArts支持第三方的推理框架在ModelArts上部署,本文以TFServing框架、Triton框架为例,介绍如何迁移到推理自定义引擎。TensorFlow Serving是一个灵活、高性能的机器学习模型部署系统,提供模型版本管理、服务回滚等能力。通过配置模型路径、模型端口、模型名称等参数,原生TFServing镜像可以快速启 - [ModelArts推理服务支持VPC直连的高速访问通道配置](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_04_0233.md): 访问在线服务的实际业务中,用户可能会存在如下需求:高吞吐量、低时延TCP或者RPC请求因此,ModelArts提供了VPC直连的高速访问通道功能以满足用户的需求。使用VPC直连的高速访问通道,用户的业务请求不需要经过推理平台,而是直接经VPC对等连接发送到实例处理,访问速度更快。此访问方式适用于需要高带宽和低延迟的场景,例如实时数据处理、 - [ModelArts的WebSocket在线服务全流程开发](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_04_0234.md): WebSocket是一种网络传输协议,可在单个TCP连接上进行全双工通信,位于OSI模型的应用层。WebSocket协议在2011年由IETF标准化为RFC 6455,后由RFC 7936补充规范。Web IDL中的WebSocket API由W3C标准化。WebSocket使得客户端和服务器之间的数据交换变得更加简单,允许服务端主动向客 - [从0-1制作自定义镜像并创建模型](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_0072.md): 针对ModelArts目前不支持的AI引擎,您可以针对该引擎构建自定义镜像,并将镜像导入ModelArts,创建为模型。本文详细介绍如何使用自定义镜像完成模型的创建,并部署成在线服务。操作流程如下:本地构建镜像:在本地制作自定义镜像包,镜像包规范可参考创建AI应用的自定义镜像规范。本地验证镜像并上传镜像至SWR服务:验证自定义镜像的API - [使用AppCode认证鉴权方式进行在线预测](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_04_0311.md): APPcode认证是一种简易的API调用认证方式,通过在HTTP请求头中添加参数X-Apig-AppCode来实现身份认证,无需复杂的签名过程,适合于客户端环境安全可控的场景,如内网系统之间的API调用。在ModelArts中,支持在部署在线服务时开启AppCode认证(部署模型为在线服务中的“支持APP认证”参数)。对于已部署的在线服务 - [ModelArts权限管理基本概念](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_24_0078.md): ModelArts作为一个完备的AI开发平台,支持用户对其进行细粒度的权限配置,以达到精细化资源、权限管理之目的。这类特性在大型企业用户的使用场景下很常见,但对个人用户则显得复杂而意义不足,所以建议个人用户在使用ModelArts时,参照快速配置ModelArts委托授权来进行初始权限设置。您是否需要阅读本文档?如果下述问题您的任何一个回 - [IAM](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_24_0080.md): 介绍ModelArts所有功能涉及到的IAM权限配置。如果您需要为企业中的员工设置不同的权限访问ModelArts资源,以达到不同员工之间的权限隔离,您可以使用统一身份认证服务(Identity and Access Management,简称IAM)进行精细的权限管理。该服务提供用户身份认证、权限分配、访问控制等功能,可以帮助您安全的控 - [依赖和委托](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_24_0081.md): 功能依赖策略项您在使用ModelArts的过程中,需要和其他云服务交互,比如需要在提交训练作业时选择指定数据集OBS路径和日志存储OBS路径。因此管理员在为用户配置细粒度授权策略时,需要同时配置依赖的权限项,用户才能使用完整的功能。如果您使用根用户(与账户同名的缺省子用户)使用ModelArts,根用户默认拥有所有权限,不再需要单独授权。 - [工作空间](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_24_0082.md): ModelArts的用户需要为不同的业务目标开发算法、管理和部署模型,此时可以创建多个工作空间,把不同应用开发过程的输出内容划分到不同工作空间中,便于管理和使用。工作空间支持3种访问控制:PUBLIC:租户(主账号和所有子账号)内部公开访问。PRIVATE:仅创建者和主账号可访问。INTERNAL:创建者、主账号、指定IAM子账号可访问当 - [快速配置ModelArts委托授权](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_24_0085.md): 为了完成AI计算的各种操作,AI平台ModelArts在任务执行过程中需要访问用户的其他服务,典型的就是训练过程中,需要访问OBS读取用户的训练数据。在这个过程中,就出现了ModelArts服务“代表”用户去访问其他云服务的情形。从安全角度出发,ModelArts服务代表用户访问任何云服务之前,均需要先获得用户的委托,而这个动作就是一个用 - [创建IAM用户并授权使用ModelArts](https://support.huaweicloud.com/bestpractice-modelarts/permission-modelarts-007.md): 快速配置ModelArts委托授权章节中介绍的一键式自动授权方式创建的委托的权限比较大,基本覆盖了依赖服务的全部权限。如果华为云账号已经能满足您的要求,不需要创建独立的IAM用户,您可以跳过本章节,不影响您使用ModelArts服务的其他功能。ModelArts作为一个完备的AI开发平台,支持用户对其进行细粒度的权限配置,以达到精细化资源 - [创建和管理工作空间](https://support.huaweicloud.com/bestpractice-modelarts/umn-standard-modelarts-0005.md): ModelArts的工作空间是为企业客户提供的高阶功能,用于将资源划分为多个逻辑隔离的空间,并支持以空间维度进行访问权限的限定。开通工作空间后,系统会默认创建一个“default”空间,用户之前创建的所有资源均在此空间下。用户可以创建多个工作空间,每个新工作空间相当于一个独立的“ModelArts分身”,不同工作空间之间互不影响,便于管理 - [场景描述](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_0062.md): ModelArts作为顶层服务,其部分功能依赖于其他服务的访问权限。本章节主要介绍对于IAM子账号使用ModelArts时,如何根据需要开通的功能配置子账号相应权限。子账号的权限,由主用户来控制,主用户通过IAM的权限配置功能设置用户组的权限,从而控制用户组内的子账号的权限。此处的授权列表均按照ModelArts和其他服务的系统预置策略来 - [Step1 创建用户组并加入用户](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_24_0089.md): 主用户账号下面可以创建多个子账号,并对子账号的权限进行分组管理。此步骤介绍如何创建用户组、子账号、并将子账号加入用户组中。主用户登录统一身份认证服务管理控制台。统一身份认证创建用户组。在左侧菜单栏中,选择用户组。单击右上角创建用户组,在用户组名称中填入用户组02,然后单击确定完成用户组创建。创建完成后,返回用户组列表。通过用户组管理,将已 - [Step2 为用户配置云服务使用权限](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_24_0090.md): 主用户为子账号授予ModelArts、OBS等云服务的使用权限后,子账号才可以使用这些云服务。此步骤介绍如何为用户组中的所有子账号授予使用ModelArts、OBS、SWR等各类云服务的权限。主用户在IAM服务的用户组列表页面,单击授权,进入到授权页面,为子账号配置权限。为用户组授权配置授权前,请先了解ModelArts各模块使用到的最小 - [Step3 为用户配置ModelArts的委托访问授权](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_24_0091.md): 配置完IAM权限之后,需要在ModelArts页面为子用户设置ModelArts访问授权,允许ModelArts访问OBS、SWR、IEF等依赖服务。此方式只允许主用户为子用户进行配置,但拥有admin权限的子用户也可以配置委托授权。本示例中,管理员账号需为子用户完成访问授权的配置。使用主用户的账号登录ModelArts控制台。请注意选择 - [Step4 测试用户权限](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_24_0092.md): 由于4中的权限需要等待15-30分钟生效,建议在配置完成后,等待30分钟,再执行如下验证操作。使用用户组02中任意一个子账号登录ModelArts控制台。在登录页面,请使用“IAM用户登录”方式进行登录。首次登录会提示修改密码,请根据界面提示进行修改。首次登录会提示修改密码,请根据界面提示进行修改。验证ModelArts权限。在左上角选择 - [给子账号配置开发环境基本使用权限](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_24_00134.md): 本文介绍开发环境场景下子账号所需的基本使用权限,您可参考权限清单新增对应业务场景的权限。示例场景为授权子账号使用Notebook进行调试,数据和代码存放在并行文件系统。以下内容需使用管理账号进行配置。权限开发环境所需权限业务场景依赖的服务依赖策略项支持的功能配置建议开发环境实例生命周期管理ModelArtsmodelarts:notebo - [给子账号配置训练作业基本使用权限](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_24_00135.md): 本文介绍训练作业场景下子账号所需的基本使用权限,您可参考权限清单新增对应业务场景的权限。示例场景为授权子账号使用自定义镜像训练,数据和代码存放在OBS桶中。以下内容需使用管理账号进行配置。权限训练作业所需权限业务场景依赖的服务依赖策略项支持的功能配置建议训练管理ModelArtsmodelarts:trainJob:*modelarts: - [给子账号配置推理(新版)基本使用权限](https://support.huaweicloud.com/bestpractice-modelarts/inference2.0-modelarts-0036.md): 本文介绍推理部署场景下子账号所需的基本使用权限。示例场景为授权子账号权限,使其能够在ModelArts控制台的在线服务(新版)功能中部署推理服务。本案例场景为将镜像上传至SWR,并在ModelArts控制台的在线服务(新版)功能中部署推理服务。添加部署上线使用权限。策略名称:设置自定义策略名称,例如:service。策略配置方式:选择JS - [给子账号配置推理(旧版)基本使用权限](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_24_00136.md): 本文介绍推理部署场景下子账号所需的基本使用权限,您可参考权限清单新增对应业务场景的权限。示例场景为授权子账号权限,使其能够在开发环境Notebook中使用基础镜像构建一个新的推理镜像,并完成模型的创建,在ModelArts控制台的在线服务(旧版)功能中部署推理服务。权限管理模型所需权限业务场景依赖的服务依赖策略项支持的功能配置建议管理模型 - [管理员和开发者权限分离](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_24_0093.md): 对于中小规模团队,管理员希望对ModelArts资源进行主导分配,全局控制,而对于普通开发者只需关注自己实例的生命周期控制。对于开发者账号,一般不会具有te_admin的权限,相应的权限也需要主账号进行统一配置。本章节以使用Notebook进行项目开发为例,通过自定义策略配置实现管理员和开发者分离。以使用Notebook进行项目开发为例, - [给子账号配置查看所有Notebook实例的权限](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_24_0095.md): Notebook页面展示了所有创建的实例。如果需要查找特定的实例,可根据筛选条件快速查找。查看所有Notebook实例:参考给子账号配置查看所有Notebook实例的权限后,进入Notebook页面,选择“全部”,可以看到IAM项目下所有子账号创建的Notebook实例。查看所有筛选Notebook实例:在页面上方,单击计费中或运行中,可 - [使用Cloud Shell登录训练容器](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_24_0096.md): 允许用户使用ModelArts控制台提供的Cloud Shell登录运行中的训练容器。仅专属资源池支持使用Cloud Shell,且训练作业必须处于运行中状态。使用主用户账号登录华为云的管理控制台,单击右上角用户名,在下拉框中选择统一身份认证,进入统一身份认证(IAM)服务。在统一身份认证服务页面的左侧导航选择权限管理 > 权限,单击右上 - [不允许子账号使用公共资源池创建作业](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_24_0097.md): 本章节介绍如何控制ModelArts用户权限,限制用户使用ModelArts公共资源池的资源创建训练作业、创建开发环境实例,部署推理服务等。对于ModelArts专属资源池的用户,不允许使用公共资源池创建训练作业、创建Notebook实例或者部署推理服务时,可以通过权限控制限制用户使用公共资源池。涉及配置的自定义权限策略项如下:model - [委托授权ModelArts云服务使用SFS Turbo](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_24_0133.md): 本章节介绍如何配置ModelArts委托权限,允许用户使用专属资源池的网络中的关联sfsturbo和解除关联功能。当用户新增委托并授权操作SFS Turbo时,请参考新增委托授权操作SFS Turbo。当用户为已有的委托新增权限,授权操作SFS Turbo,请参考已有委托新增授权操作SFS Turbo。对于使用ModelArts专属资源池 - [给子账号配置文件夹级的SFS Turbo访问权限](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_24_0137.md): 本文介绍如何配置文件夹级的SFS Turbo访问权限,实现在ModelArts中访问挂载的SFS Turbo时,只允许子账号访问特定的SFS Turbo文件夹内容。给子账号配置文件夹级的SFS Turbo访问权限为白名单功能,如果有试用需求,请提工单申请权限。需要在ModelArts控制台打开严格授权模式。新创建的账号默认开启严格授权模式 - [使用ModelArts时提示“权限不足”,如何解决?](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_05_0148.md): 当您使用ModelArts时如果提示权限不足,请您按照如下指导对相关服务和用户进行授权,并检查用户权限。本案例中以OBS权限不足为例,介绍如何为用户授予OBS服务权限。其他权限不足的场景也可以参考本案例操作,只是授权范围不同。不同业务场景下的授权范围请参考权限依赖和委托章节。由于ModelArts的使用权限依赖OBS服务的授权,您需要为用 - [安全配置最佳实践](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_safe_0001.md): 安全性是华为云与您的共同责任。华为云负责云服务自身的安全,提供安全的云;作为租户,您需要合理使用云服务提供的安全能力对数据进行保护,安全地使用云。本文提供了ModelArts使用过程中的安全最佳实践,旨在为提高整体安全能力提供可操作的规范性指导。根据该指导文档您可以持续评估ModelArts资源的安全状态,更好的组合使用ModelArts - [使用ModelArts自定义算法实现手写数字识别](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_0080.md): 本文为用户提供如何将本地的自定义算法通过简单的代码适配,实现在ModelArts上进行模型训练与部署的全流程指导。本案例中的的推理部署操作基于旧版推理,旧版推理仅对老用户可见,新用户不可见。本案例待更新为新版推理操作后重新上线。本案例用于指导用户使用PyTorch1.8实现手写数字图像识别,示例采用的数据集为MNIST官方数据集。通过学习 - [推理部署](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_10_0093.md): 当前文档页面已日落。Ascend-VLLM推理框架相关开发指南,支持的模型列表和推理部署等内容,请参见LLM大语言模型推理。 - [MaaS推理实践](https://support.huaweicloud.com/bestpractice-modelarts/modelarts_ds.md): 基于MaaS平台的实践案例已经迁移到MaaS文档中,不在ModelArts中承载。MaaS文档地址 ## API参考 - [使用前必读](https://support.huaweicloud.com/api-modelarts/modelarts_03_0141.md): 在调用ModelArts API之前,请确保已经充分了解ModelArts相关概念,详细信息请参见产品介绍。ModelArts提供了REST(Representational State Transfer)风格API,支持您通过HTTPS请求调用,调用方法请参见如何调用API。同时ModelArts还提供多种编程语言的SDK供您使用,SD - [API概览](https://support.huaweicloud.com/api-modelarts/modelarts_03_0002.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [构造请求](https://support.huaweicloud.com/api-modelarts/modelarts_03_0005.md): 本节介绍REST API请求的组成,并以调用IAM服务的获取用户Token接口说明如何调用API,Token可以用于调用其他API时的鉴权。您还可以通过这个视频教程了解如何构造请求调用API:https://bbs.huaweicloud.com/videos/102987 。请求URI由如下部分组成:{URI-scheme} :// { - [认证鉴权](https://support.huaweicloud.com/api-modelarts/modelarts_03_0004.md): 调用接口有如下两种认证方式,您可以选择其中一种进行认证鉴权。推荐使用AK/SK认证,其安全性比Token认证要高。Token认证:通过Token认证通用请求。AK/SK认证:通过AK(Access Key ID)/SK(Secret Access Key)加密调用请求。Token认证:通过Token认证通用请求。AK/SK认证:通过AK( - [返回结果](https://support.huaweicloud.com/api-modelarts/modelarts_03_0003.md): 请求发送以后,您会收到响应,包含:状态码、响应消息头和响应消息体。状态码是一组从1xx到5xx的数字代码,状态码表示了请求响应的状态,完整的状态码列表请参见状态码。对于获取用户Token接口,如果调用后返回状态码为201,则表示请求成功。对应请求消息头,响应同样也有消息头,如Content-type。对于获取用户Token接口,返回如图1 - [通过API创建Notebook应用示例](https://support.huaweicloud.com/api-modelarts/modelarts_03_0406.md): 本节通过调用一系列API,以创建开发环境实例为例介绍ModelArts API的使用流程。创建开发环境实例的流程如下:调用认证鉴权接口获取用户Token,在后续的请求中需要将Token放到请求消息头中作为认证。调用查询支持的镜像列表接口查看开发环境的镜像类型和版本。调用创建Notebook实例接口创建一个Notebook实例。调用查询No - [通过API创建PyTorch框架训练作业](https://support.huaweicloud.com/api-modelarts/modelarts_03_0407.md): 本节通过调用一系列API,以训练模型为例介绍ModelArts API的使用流程。使用PyTorch框架创建训练作业的流程如下:调用认证鉴权接口获取用户Token,在后续的请求中需要将Token放到请求消息头中作为认证。调用获取训练作业支持的公共规格接口获取训练作业支持的资源规格。调用获取训练作业支持的AI预置框架接口查看训练作业支持的引 - [通过API创建自定义镜像训练作业应用示例](https://support.huaweicloud.com/api-modelarts/modelarts_03_0410.md): 本节通过调用一系列API,以训练模型为例介绍ModelArts API的使用流程。使用PyTorch框架创建训练作业的流程如下:调用认证鉴权接口获取用户Token,在后续的请求中需要将Token放到请求消息头中作为认证。调用创建训练作业接口使用刚创建的算法返回的uuid创建一个训练作业,记录训练作业id。调用查询训练作业详情接口使用刚创建 - [通过API创建自定义镜像Tensorboard训练作业场景](https://support.huaweicloud.com/api-modelarts/modelarts_03_0411.md): 本节通过调用一系列API,以训练模型为例介绍ModelArts API的使用流程。使用PyTorch框架创建训练作业的流程如下:调用认证鉴权接口获取用户Token,在后续的请求中需要将Token放到请求消息头中作为认证。调用创建训练作业接口使用刚创建的算法返回的uuid创建一个训练作业,记录训练作业id。调用查询训练作业详情接口使用刚创建 - [通过API创建和修改工作空间应用示例](https://support.huaweicloud.com/api-modelarts/modelarts_03_0404.md): 本节通过调用一系列API,以创建和修改工作空间为例介绍ModelArts API的使用流程。创建和修改工作空间的流程如下:调用认证鉴权接口获取用户Token,在后续的请求中需要将Token放到请求消息头中作为认证。调用创建工作空间接口创建一个工作空间。调用查询工作空间详情接口根据工作空间ID查询工作空间的详细信息。调用修改工作空间接口根据 - [通过API管理ModelArts服务的委托授权](https://support.huaweicloud.com/api-modelarts/modelarts_03_0405.md): 本节通过调用一系列API,以管理ModelArts服务的委托授权为例介绍ModelArts API的使用流程。管理ModelArts服务的委托授权流程如下:调用认证鉴权接口获取用户Token,在后续的请求中需要将Token放到请求消息头中作为认证。调用创建ModelArts委托接口完成包含OBS、SWR等依赖服务的ModelArts委托。 - [查询工作空间详情 - ShowWorkspace](https://support.huaweicloud.com/api-modelarts/ShowWorkspace.md): 查询工作空间详情接口用于获取指定工作空间的详细信息。该接口适用于以下场景:当用户需要查看工作空间的具体配置、状态或相关信息时,可以通过此接口获取详细数据。使用该接口的前提条件是工作空间已存在且用户具有查看该工作空间的权限。查询操作完成后,接口将返回工作空间的详细信息,包括但不限于工作空间名称、描述、创建时间、状态等。若工作空间不存在或用户 - [修改工作空间 - UpdateWorkspace](https://support.huaweicloud.com/api-modelarts/UpdateWorkspace.md): 修改工作空间接口用于更新指定工作空间的配置信息。该接口适用于以下场景:当用户需要更改工作空间的名称、描述或其他配置信息时,可以通过此接口进行修改。使用该接口的前提条件是工作空间已存在且用户具有修改该工作空间的权限。修改操作完成后,接口将返回更新后的工作空间详细信息,包括但不限于工作空间名称、描述、更新时间等。若工作空间不存在或用户无权限操 - [删除工作空间 - DeleteWorkspace](https://support.huaweicloud.com/api-modelarts/DeleteWorkspace.md): 删除工作空间接口用于移除已创建的工作空间。该接口适用于以下场景:当工作空间不再需要或需要清理资源时,用户可通过此接口删除指定的工作空间。使用该接口的前提条件是工作空间已存在且用户具有删除工作空间的权限。删除操作完成后,工作空间将被永久移除,相关资源也将被清理。若工作空间不存在或用户无权限操作,接口将返回相应的错误信息。您可以在API Ex - [查询工作空间配额 - ShowWorkspaceQuotas](https://support.huaweicloud.com/api-modelarts/ShowWorkspaceQuotas.md): 查询工作空间配额接口用于获取指定工作空间的资源配额信息。该接口适用于以下场景:当用户需要了解工作空间的资源使用情况和配额限制时,可以通过此接口获取详细数据。使用该接口的前提条件是工作空间已存在且用户具有查看该工作空间配额的权限。查询操作完成后,接口将返回工作空间的配额信息,包括但不限于计算资源、存储资源、网络资源的配额和已使用量。若工作空 - [修改工作空间配额 - UpdateWorkspaceQuotas](https://support.huaweicloud.com/api-modelarts/UpdateWorkspaceQuotas.md): 修改工作空间配额接口用于更新指定工作空间的资源配额。该接口适用于以下场景:当用户需要调整工作空间的资源配额,例如增加或减少计算资源、存储资源或网络资源的配额时,可以通过此接口进行修改。使用该接口的前提条件是工作空间已存在且用户具有修改该工作空间配额的权限。修改操作完成后,接口将返回更新后的配额信息,包括但不限于计算资源、存储资源、网络资源 - [查询工作空间列表 - ListWorkspace](https://support.huaweicloud.com/api-modelarts/ListWorkspace.md): 查询工作空间列表接口用于获取所有已创建的工作空间的详细信息。该接口适用于以下场景:当需要查看所有可用的工作空间或进行审计时,用户可通过此接口查询工作空间列表。使用该接口的前提条件是用户具有查看权限。查询操作完成后,系统将返回所有工作空间的详细信息,包括名称、创建时间、状态等。若用户无权限操作,接口将返回相应的错误信息。您可以在API Ex - [创建工作空间 - CreateWorkspace](https://support.huaweicloud.com/api-modelarts/CreateWorkspace.md): 创建工作空间("default"为系统预留的默认工作空间名称,不能使用)。该接口适用于以下场景:当需要为不同的业务目标、团队或项目创建独立的工作空间时,用户可通过此接口创建新的工作空间。使用该接口的前提条件是用户具备创建工作空间的权限,并且工作空间名称未被占用且不为"default"。创建成功后,系统将为该工作空间分配默认的访问控制策略, - [查询授权模式 - ShowAuthmodeDetail](https://support.huaweicloud.com/api-modelarts/ShowAuthmodeDetail.md): 查询授权模式接口用于获取指定资源或功能的授权方式和权限配置信息。该接口适用于以下场景:当系统管理员需要查看资源的访问权限设置、开发者需要验证授权策略配置是否正确,或安全审计人员需要检查授权配置是否符合安全规范时,可通过此接口查询授权模式的详细信息。使用该接口的前提条件是用户具有查询权限且目标资源或功能的授权模式已配置。调用成功后,接口将返 - [更新授权模式 - UpdateAuthMode](https://support.huaweicloud.com/api-modelarts/UpdateAuthMode.md): 更新授权模式接口用于修改指定资源或功能的授权方式和权限配置信息。该接口适用于以下场景:当系统管理员需要调整资源的访问权限、开发者需要更新授权策略以适应新的业务需求,或安全审计人员需要修改授权配置以符合新的安全规范时,可通过此接口更新授权模式的详细信息。使用该接口的前提条件是用户具有更新权限且目标资源或功能的授权模式已存在。调用成功后,接口 - [鉴权能否使用当前工作空间资源 - ValidateAuthorization](https://support.huaweicloud.com/api-modelarts/ValidateAuthorization.md): 鉴权能否使用当前工作空间资源接口用于验证用户是否有权限访问和使用当前工作空间中的资源。该接口适用于以下场景:当用户尝试访问或操作工作空间中的资源时,系统需要确认用户是否具有相应的权限。使用该接口的前提条件是用户已登录且工作空间已存在。鉴权成功后,用户可以正常访问和使用工作空间资源;若鉴权失败,接口将返回相应的错误信息,如用户无权限或工作空 - [查询用户列表 - ListUsers](https://support.huaweicloud.com/api-modelarts/ListUsers.md): 查询用户列表接口用于获取系统中用户的列表信息。该接口适用于以下场景:当需要查看系统中所有用户或根据特定条件筛选用户时,管理员或系统可以通过此接口查询用户列表。使用该接口的前提条件是用户已存在且查询者具有相应的权限。查询操作完成后,接口将返回符合条件的用户列表;若系统中无用户或查询者无权限操作,接口将返回相应的错误信息。您可以在API Ex - [创建Notebook实例 - CreateNotebook](https://support.huaweicloud.com/api-modelarts/CreateNotebook.md): 创建Notebook实例接口用于根据指定的参数创建一个新的Notebook实例。该接口适用于以下场景:用户需要为特定任务或项目创建Notebook实例时,可通过此接口指定实例规格、AI引擎镜像和存储配置。使用该接口的前提条件是用户已登录系统并具有创建Notebook实例的权限,同时需提供有效的创建参数。调用该接口后,系统将异步创建Note - [查询Notebook实例列表 - ListNotebooks](https://support.huaweicloud.com/api-modelarts/ListNotebooks.md): 查询Notebook实例列表接口用于获取满足特定条件的Notebook实例信息。该接口适用于以下场景:用户管理多个Notebook实例或查看特定状态的Notebook实例时,可通过此接口获取相关信息。使用该接口的前提条件是用户已创建Notebook实例,并且具有相应的查询权限。调用成功后,系统将返回符合条件的Notebook实例列表,包含 - [查询所有Notebook实例列表 - ListAllNotebooks](https://support.huaweicloud.com/api-modelarts/ListAllNotebooks.md): 查询所有Notebook实例列表接口用于获取所有已创建的Notebook实例信息。该接口适用于以下场景:用户需要全面了解当前系统中所有Notebook实例的状态、资源使用情况或管理多个Notebook实例时,可通过此接口获取相关信息。使用该接口的前提条件是用户已创建Notebook实例,并且具有相应的查询权限。调用成功后,系统将返回所有N - [查询Notebook实例详情 - ShowNotebook](https://support.huaweicloud.com/api-modelarts/ShowNotebook.md): 查询Notebook实例详情接口用于获取指定Notebook实例的详细信息。该接口适用于以下场景:用户需要查看特定Notebook实例的详细配置、运行状态或获取访问链接时,可通过此接口获取相关信息。使用该接口的前提条件是Notebook实例已存在且用户具有相应的查询权限。调用成功后,系统将返回实例ID、名称、规格、镜像、实例状态和实例可打 - [更新Notebook实例 - UpdateNotebook](https://support.huaweicloud.com/api-modelarts/UpdateNotebook.md): 更新Notebook实例接口用于修改Notebook实例的配置信息,包括名称、描述、规格和镜像等。该接口适用于以下场景:用户需要调整Notebook实例的配置以适应新的需求时,可通过此接口更新实例的详细信息。使用该接口的前提条件是用户已登录系统并具有操作目标Notebook实例的权限,同时Notebook实例必须处于停止状态。调用该接口后 - [删除Notebook实例 - DeleteNotebook](https://support.huaweicloud.com/api-modelarts/DeleteNotebook.md): 删除Notebook实例接口用于移除已创建的Notebook实例及其相关资源。该接口适用于以下场景:用户需要清理不再使用的Notebook实例时,可通过此接口删除指定的Notebook实例,包括其容器和所有存储资源。使用该接口的前提条件是用户已登录系统并具有操作目标Notebook实例的权限。调用该接口后,系统将删除指定的Notebook - [通过运行的实例保存成容器镜像 - CreateImage](https://support.huaweicloud.com/api-modelarts/CreateImage.md): 通过运行的实例保存成容器镜像接口用于将正在运行的实例保存为容器镜像。该接口适用于以下场景:用户需要保存当前运行环境以便后续使用或开发时,可通过此接口将实例保存为镜像。使用该接口的前提条件是用户已登录系统并具有访问目标实例的权限,同时实例必须处于运行状态。调用该接口后,系统将保存实例的当前状态为容器镜像,包括安装的依赖包和插件。若用户无权限 - [查询Notebook支持的有效规格列表 - ListFlavors](https://support.huaweicloud.com/api-modelarts/ListFlavors.md): 查询Notebook支持的有效规格列表接口用于获取运行Notebook实例时可使用的规格选项。该接口适用于以下场景:用户需要了解Notebook实例支持的配置选项时,可通过此接口查询可用的规格列表。使用该接口的前提条件是用户已登录系统并具有访问目标Notebook实例的权限。调用该接口后,系统将返回Notebook实例支持的有效规格列表, - [查询Notebook支持的可切换规格列表 - ShowSwitchableFlavors](https://support.huaweicloud.com/api-modelarts/ShowSwitchableFlavors.md): 查询Notebook支持的可切换规格列表接口用于获取创建Notebook实例时可选择的规格选项。该接口适用于以下场景:用户需要了解Notebook实例支持的配置选项时,可通过此接口查询可用的规格列表。使用该接口的前提条件是用户已登录系统并具有创建Notebook实例的权限。调用该接口后,系统将返回Notebook实例支持的可切换规格列表, - [查询运行中的Notebook可用时长 - ShowLease](https://support.huaweicloud.com/api-modelarts/ShowLease.md): 查询运行中的Notebook可用时长接口用于获取正在运行的Notebook实例的剩余可用时间。该接口适用于以下场景:用户需要了解Notebook实例的剩余运行时间以合理安排任务时,可通过此接口查询指定实例的可用时长。使用该接口的前提条件是用户已登录系统并具有访问目标Notebook实例的权限,同时Notebook实例必须处于运行状态。调用 - [Notebook时长续约 - RenewLease](https://support.huaweicloud.com/api-modelarts/RenewLease.md): Notebook时长续约接口用于延长运行中的Notebook实例的运行时间。该接口适用于以下场景:用户需要延长Notebook实例的使用时间以完成长时间任务时,可通过此接口延长指定实例的运行时间。使用该接口的前提条件是用户已登录系统并具有操作目标Notebook实例的权限,同时Notebook实例必须处于运行状态。调用该接口后,系统将延长 - [启动Notebook实例 - StartNotebook](https://support.huaweicloud.com/api-modelarts/StartNotebook.md): 启动Notebook实例接口用于启动已创建的Notebook实例。该接口适用于以下场景:用户需要开始运行Notebook实例以进行数据处理、模型训练或开发时,可通过此接口启动指定的Notebook实例。使用该接口的前提条件是用户已登录系统并具有操作目标Notebook实例的权限,同时Notebook实例必须处于停止状态且配置正确。调用该接 - [停止Notebook实例 - StopNotebook](https://support.huaweicloud.com/api-modelarts/StopNotebook.md): 停止Notebook实例接口用于停止正在运行的Notebook实例。该接口适用于以下场景:用户需要释放Notebook实例占用的资源或结束当前运行的任务时,可通过此接口停止指定的Notebook实例。使用该接口的前提条件是用户已登录系统并具有操作目标Notebook实例的权限,同时Notebook实例必须处于运行状态。调用该接口后,系统将 - [查询用户所有Notebook资源池实例详情 - ListAuthoringClusters](https://support.huaweicloud.com/api-modelarts/ListAuthoringClusters.md): 查询用户所有Notebook资源池实例详情接口用于获取用户关联的所有Notebook资源池实例的详细信息。该接口适用于以下场景:当用户创建Notebook示例需要选择资源池时,可通过此接口获取所有资源池实例列表信息。使用该接口的前提条件是用户已注册并登录系统,且具有查看资源池实例的权限。调用成功后,接口将返回包含所有资源池实例的详细信息列 - [查询Notebook资源池详情 - ShowCluster](https://support.huaweicloud.com/api-modelarts/ShowCluster.md): 查询Notebook资源池详情接口用于获取资源池的详细信息。该接口适用于以下场景:当用户需要创建Notebook实例作业时,可通过此接口查询指定集群的详细信息。使用该接口的前提条件是集群已成功纳管且用户具有相应的访问权限。调用该接口后,系统将返回集群的实例ID、名称、Flavor规格、实例状态以及实例可打开的URL等详细信息。若集群不存在 - [查询当前用户指定特性的开关及配额 - ListFeatures](https://support.huaweicloud.com/api-modelarts/ListFeatures.md): 查询当前用户指定特性的开关及配额接口用于获取指定特性在当前用户下的开关状态及配额信息。该接口适用于以下场景:当用户需要了解特定特性是否已开启、查看配额限制或监控已使用的资源情况时,可通过此接口查询相关信息。使用该接口的前提条件是用户已登录且具有查询权限,同时指定的特性必须存在。调用该接口后,系统将返回该特性是否已开启、配额总量及已使用的资 - [添加资源标签 - CreateNotebookTags](https://support.huaweicloud.com/api-modelarts/CreateNotebookTags.md): 添加资源标签接口用于为指定的Notebook实例添加标签信息。该接口适用于以下场景:用户需要为Notebook实例添加标签信息,可通过此接口添加一个或多个标签。使用该接口的前提条件是用户已登录系统并具有操作目标Notebook实例的权限。调用该接口后,系统将为指定的Notebook实例添加标签,若标签的key已存在,则覆盖原有的value - [删除资源标签 - DeleteNotebookTags](https://support.huaweicloud.com/api-modelarts/DeleteNotebookTags.md): 删除资源标签接口用于移除指定Notebook实例的标签信息。该接口适用于以下场景:用户需要清理或重新组织Notebook实例的标签时,可通过此接口删除单个或多个标签。使用该接口的前提条件是用户已登录系统并具有操作目标Notebook实例的权限。调用该接口后,系统将删除指定的标签,若标签不存在则不进行操作。若用户无权限操作指定Noteboo - [查询Notebook资源类型下的标签 - ShowNotebookTags](https://support.huaweicloud.com/api-modelarts/ShowNotebookTags.md): 查询Notebook资源类型下的标签接口用于获取用户当前project下Notebook实例的标签信息。该接口适用于以下场景:用户需要管理或统计Notebook资源时,可通过此接口查询特定标签或所有标签的Notebook实例。使用该接口的前提条件是用户已登录系统并具有访问权限,同时可指定工作空间或默认查询所有工作空间。调用该接口后,系统将 - [查询支持的镜像列表 - ListImage](https://support.huaweicloud.com/api-modelarts/ListImage.md): 查询支持的镜像列表接口用于根据指定条件分页查询满足条件的所有镜像。该接口适用于以下场景:当用户需要查找特定镜像、管理镜像仓库或选择合适的镜像版本进行部署时,可通过此接口获取符合条件的镜像列表。使用该接口的前提条件是镜像仓库已存在且用户具有访问权限。查询操作完成后,将返回满足条件的镜像列表,包括镜像ID、名称、版本、类型、状态、大小和创建时 - [注册自定义镜像 - RegisterImage](https://support.huaweicloud.com/api-modelarts/RegisterImage.md): 注册自定义镜像接口用于将用户自定义的镜像注册到ModelArts镜像管理。该接口适用于以下场景:当用户需要将自己的自定义镜像(如特定算法环境、工具链或配置)集成到ModelArts平台时,可通过此接口将镜像注册到镜像管理中以便后续使用。使用该接口的前提条件是用户具备ModelArts镜像管理权限,并且需要提供有效的镜像地址和符合要求的镜像 - [查询用户镜像列表 - ListImageGroup](https://support.huaweicloud.com/api-modelarts/ListImageGroup.md): 查询用户镜像列表接口用于查询用户镜像信息概览,以镜像名称作为聚合的信息。该接口适用于以下场景:当用户需要管理多个镜像或了解各镜像的基本信息时,可通过此接口获取镜像列表及其概览信息。使用该接口的前提条件是用户具备镜像管理权限,并且镜像已存在。查询操作完成后,将返回用户所有镜像的列表,包括镜像名称、版本、状态等信息。若镜像不存在或用户无权限访 - [查询镜像详情 - ShowImage](https://support.huaweicloud.com/api-modelarts/ShowImage.md): 查询镜像详情接口用于查询镜像的详细信息。该接口适用于以下场景:当用户需要了解特定镜像的详细信息(如镜像名称、版本、创建时间、大小、状态等)或对镜像执行一些操作时,可通过此接口获取镜像的详细信息。使用该接口的前提条件是用户具备镜像管理权限,并且待查询镜像有效且存在。查询操作完成后,将返回镜像的详细信息,包括镜像ID、名称、版本、创建时间、大 - [删除镜像 - DeleteImage](https://support.huaweicloud.com/api-modelarts/DeleteImage.md): 删除镜像接口用于删除镜像对象,对于个人私有镜像可以通过参数一并删除SWR镜像内容。该接口适用于以下场景:当镜像不再需要、配置错误或需要清理资源时,用户可通过此接口删除指定的镜像对象。使用该接口的前提条件是镜像已存在且用户具有删除权限。删除操作完成后,镜像对象将被永久移除,相关资源和配置也将被清理。若镜像不存在、用户无权限操作或镜像正在被使 - [同步镜像状态 - SyncImage](https://support.huaweicloud.com/api-modelarts/SyncImage.md): 同步镜像状态接口用于修正镜像状态的异常情况。该接口适用于以下场景:当镜像状态因误操作、网络问题或系统故障等原因出现异常时,用户可通过此接口同步镜像的最新状态。使用该接口的前提条件是镜像已存在且用户具有相应的操作权限。同步操作完成后,镜像的状态将被更新为最新的正确状态,相关资源和配置也将被同步。若镜像不存在、用户无权限操作或同步过程中出现错 - [删除镜像组 - DeleteImageGroup](https://support.huaweicloud.com/api-modelarts/DeleteImageGroup.md): 删除镜像组接口用于删除镜像组内所有的版本对象,对于个人私有镜像可以通过参数一并删除SWR镜像内容。该接口适用于以下场景:当镜像不再需要、配置错误或需要清理资源时,用户可通过此接口删除指定的镜像组对象内所有版本。使用该接口的前提条件是镜像组已存在且用户具有删除权限。删除操作完成后,镜像组内所有版本对象将被永久移除,相关资源和配置也将被清理。 - [更新镜像组 - UpdateImageGroup](https://support.huaweicloud.com/api-modelarts/UpdateImageGroup.md): 更新镜像组接口用于更新镜像组的标签及说明信息。该接口适用于以下场景:当镜像说明需要修改,或者镜像的标签需要修改时,用户可通过此接口修改。使用该接口的前提条件是镜像组已存在且用户具有更新权限。更新操作完成后,镜像组对应的配置文件会。若镜像组不存在、用户无权限操作或镜像正在被使用,接口将返回相应的错误信息。暂无约束。您可以在API Explo - [创建工作流定时调度 - CreateWorkflowSchedule](https://support.huaweicloud.com/api-modelarts/CreateWorkflowSchedule.md): 创建工作流定时调度接口用于为指定的工作流设置定时调度任务。该接口适用于以下场景:当用户希望定期执行某个工作流,例如数据处理、模型训练等任务时,可以通过此接口配置定时调度。使用该接口的前提条件是用户已登录并具有对目标工作流的管理权限,且目标工作流已存在。创建操作完成后,将根据配置的调度规则自动执行工作流。若工作流不存在或用户无权限操作,接口 - [查询工作流定时调度列表 - ShowWorkflowScheduleList](https://support.huaweicloud.com/api-modelarts/ShowWorkflowScheduleList.md): 查询工作流定时调度列表接口用于获取指定项目下所有工作流的定时调度信息。该接口适用于以下场景:当用户需要查看项目中所有工作流的定时调度配置,以便进行任务管理和调度优化时,可以通过此接口获取定时调度列表。使用该接口的前提条件是用户已登录并具有查看工作流定时调度的权限。响应消息体中包含每个工作流的定时调度信息,如调度ID、调度时间、状态等。若用 - [查询工作流定时调度详情 - ShowWorkflowSchedule](https://support.huaweicloud.com/api-modelarts/ShowWorkflowSchedule.md): 查询工作流定时调度详情接口用于获取指定工作流的定时调度任务的详细信息。该接口适用于以下场景:当用户需要查看某个工作流的定时调度配置,例如调度时间、执行频率等详细信息时,可以通过此接口获取相关信息。使用该接口的前提条件是用户已登录并具有查看目标工作流定时调度的权限,且目标工作流及其定时调度任务已存在。查询操作完成后,将返回定时调度任务的详细 - [删除工作流定时调度信息 - DeleteWorkflowScheduleId](https://support.huaweicloud.com/api-modelarts/DeleteWorkflowScheduleId.md): 删除工作流定时调度信息接口用于移除指定工作流的定时调度任务。该接口适用于以下场景:当用户不再需要某个工作流的定时调度任务,例如任务完成、配置错误或需要清理资源时,可以通过此接口删除指定的定时调度任务。使用该接口的前提条件是用户已登录并具有对目标工作流定时调度的管理权限,且目标工作流及其定时调度任务已存在。删除操作完成后,定时调度任务将被永 - [更新工作流定时调度信息 - UpdateWorkflowSchedule](https://support.huaweicloud.com/api-modelarts/UpdateWorkflowSchedule.md): 更新工作流定时调度信息接口用于修改指定工作流的定时调度任务的配置。该接口适用于以下场景:当用户需要调整某个工作流的定时调度任务,例如更改备注内容、是否生效等信息时,可以通过此接口更新定时调度任务的配置。使用该接口的前提条件是用户已登录并具有对目标工作流定时调度的管理权限,且目标工作流及其定时调度任务已存在。更新操作完成后,定时调度任务将按 - [获取Workflow工作流列表 - ListWorkflows](https://support.huaweicloud.com/api-modelarts/ListWorkflows.md): 获取Workflow工作流列表接口用于展示已创建的工作流列表。该接口适用于以下场景:当用户需要管理、监控或操作工作流时,可通过此接口查看所有可用的工作流。使用该接口的前提条件是用户已通过身份验证并具有访问权限,且系统中已存在至少一个工作流。调用该接口后,将返回所有工作流的列表,每个工作流包含其唯一标识、名称、状态等基本信息。若用户无权限访 - [删除Workflow工作流 - DeleteWorkflow](https://support.huaweicloud.com/api-modelarts/DeleteWorkflow.md): 删除Workflow工作流接口用于移除系统中已存在的工作流定义。该接口适用于以下场景:当工作流不再需要或配置错误时,用户可以通过此接口删除指定的工作流。删除操作完成后,工作流将被永久移除,相关配置也将被清理。若工作流不存在或用户无权限操作,接口将返回相应的错误信息。无您可以在API Explorer中调试该接口,支持自动认证鉴权。API - [新建Workflow工作流 - CreateWorkflow](https://support.huaweicloud.com/api-modelarts/CreateWorkflow.md): 新建Workflow工作流接口用于创建新的工作流定义。该接口适用于以下场景:当用户需要根据业务需求设计和配置新的工作流时,可以通过此接口定义工作流的名称、描述、步骤及其执行顺序、条件分支等。创建成功后,系统将返回新工作流的详细信息。若用户无权限操作或输入参数不合法,接口将返回相应的错误信息。可参考如何开发Workflow,创建工作流。无您 - [查询Workflow工作流 - ShowWorkflow](https://support.huaweicloud.com/api-modelarts/ShowWorkflow.md): 查询Workflow工作流接口用于查看系统中特定的工作流定义。该接口适用于以下场景:当用户需要查看和管理已定义的工作流时,可以通过此接口查询工作流的详细信息,包括名称、描述、步骤等。使用该接口的前提条件是用户具有查看权限。查询结果将根据用户提供的过滤条件返回。若用户无权限操作或输入参数不合法,接口将返回相应的错误信息。无您可以在API E - [修改Workflow工作流 - UpdateWorkflow](https://support.huaweicloud.com/api-modelarts/UpdateWorkflow.md): 修改Workflow工作流接口用于更新已存在的工作流定义。该接口适用于以下场景:当用户需要根据业务变化调整工作流的配置时,可以通过此接口修改工作流的名称、描述、步骤顺序、条件逻辑等。修改成功后,系统将返回更新后的工作流详细信息。若工作流不存在或用户无权限操作,接口将返回相应的错误信息。无您可以在API Explorer中调试该接口,支持自 - [总览Workflow工作流 - ShowWorkflowsOverview](https://support.huaweicloud.com/api-modelarts/ShowWorkflowsOverview.md): 总览Workflow工作流接口用于查看所有已创建的工作流的概览信息。该接口适用于以下场景:当用户需要管理多个工作流、查看所有工作流的概览信息时,用户可通过此接口。使用该接口的前提条件是用户具有查看工作流的权限,调用成功后,接口将返回工作流执行记录的概览信息。若用户未登录、权限不足或系统中不存在工作流,接口将返回相应的错误信息。无您可以在A - [查询Workflow待办事项 - ShowWorkflowsTodolist](https://support.huaweicloud.com/api-modelarts/ShowWorkflowsTodolist.md): 查询Workflow待办事项接口用于查看所有待处理的工作流任务信息。该接口适用于以下场景:当用户需要跟踪工作流中的任务进度、查看所有待处理的任务以便安排工作,或者在系统初始化时加载所有待办事项信息时,用户可通过此接口获取待办事项列表。使用该接口的前提条件是用户已登录系统且具有查看待办事项的权限。调用成功后,接口将返回包含所有待办事项详细信 - [在线服务鉴权 - CreateWorkflowServiceAuth](https://support.huaweicloud.com/api-modelarts/CreateWorkflowServiceAuth.md): 在线服务鉴权接口用于验证用户是否有权限访问特定的在线服务。该接口适用于以下场景:当用户需要访问某个在线服务、系统需要验证用户是否有权限,或者在用户登录后检查其访问权限时,用户可通过此接口获取鉴权结果。调用成功后,接口将返回包含鉴权结果的响应。若用户未登录、权限不足或在线服务不存在,接口将返回相应的错误信息。无您可以在API Explore - [创建在线服务包 - CreateWorkflowPurchasePool](https://support.huaweicloud.com/api-modelarts/CreateWorkflowPurchasePool.md): 创建在线服务包接口用于生成一个新的在线服务包。该接口适用于以下场景:当用户需要部署一个新的在线服务、将模型或应用打包以便部署,或者在系统中添加新的服务资源时,用户可通过此接口创建在线服务包。使用该接口的前提条件是用户已登录系统且具有创建在线服务包的权限,同时系统中必须有足够的资源支持创建新的服务包。调用成功后,接口将返回包含新创建的在线服 - [Workflow列表所有标签 - ShowWorkflowLabels](https://support.huaweicloud.com/api-modelarts/ShowWorkflowLabels.md): Workflow列表所有标签接口用于获取指定项目下所有工作流的标签信息。该接口适用于以下场景:当用户需要了解项目中所有工作流的标签配置,以便进行资源管理和筛选时,可以通过此接口获取标签列表。使用该接口的前提条件是用户已登录并具有查看工作流标签的权限。响应消息体中包含每个工作流的标签信息,如标签键和值。若用户无权限或项目下无工作流,接口将返 - [获取Execution列表 - ListWorkflowExecutions](https://support.huaweicloud.com/api-modelarts/ListWorkflowExecutions.md): 查询Workflow下的执行记录列表。获取Execution列表接口用于查询指定工作流的执行实例列表。该接口适用于以下场景:当用户需要监控工作流执行状态、排查执行异常或管理执行历史时,可通过此接口获取指定工作流的所有执行实例信息。使用该接口的前提条件是用户已登录系统并具备查看工作流的权限,且目标工作流已存在。查询操作完成后,接口将返回所有 - [新建Workflow Execution - CreateWorkflowExecution](https://support.huaweicloud.com/api-modelarts/CreateWorkflowExecution.md): 新建Workflow Execution接口用于启动一个工作流实例的执行。该接口适用于以下场景:当用户需要根据已定义的工作流启动新的执行实例时,可以通过此接口设置执行参数,如输入数据、执行者等。使用该接口的前提条件是工作流已存在且用户具有执行权限。启动成功后,系统将返回新执行实例的详细信息。若工作流不存在或用户无权限操作,接口将返回相应的 - [删除Workflow Execution - DeleteWorkflowExecution](https://support.huaweicloud.com/api-modelarts/DeleteWorkflowExecution.md): 删除Workflow Execution接口用于移除指定的工作流执行实例。该接口适用于以下场景:当工作流执行完成、配置错误或需要清理资源时,用户可通过此接口删除指定的执行实例。ShowWorkflowExecution使用该接口的前提条件是目标执行实例已存在且用户具有删除权限。删除操作完成后,执行实例将被永久移除,相关资源和配置也将被清理 - [查询Workflow Execution - ShowWorkflowExecution](https://support.huaweicloud.com/api-modelarts/ShowWorkflowExecution.md): 查询Workflow Execution接口用于查看工作流实例的执行情况。该接口适用于以下场景:当用户需要监控和管理已启动的工作流执行实例时,可以通过此接口查询执行状态、开始时间、结束时间、执行结果等信息。使用该接口的前提条件是用户具有查看权限。查询结果将根据用户提供的过滤条件返回。若用户无权限操作或输入参数不合法,接口将返回相应的错误信 - [更新Workflow Execution - UpdateWorkflowExecution](https://support.huaweicloud.com/api-modelarts/UpdateWorkflowExecution.md): 更新Workflow Execution接口用于修改指定工作流执行实例的状态或参数。该接口适用于以下场景:当用户需要纠正执行实例的配置错误、调整执行参数或恢复暂停的执行时,可通过此接口更新指定的执行实例。使用该接口的前提条件是目标执行实例已存在且用户具有更新权限,且执行实例处于可修改状态(如暂停状态)。更新操作完成后,执行实例的状态或参数 - [管理Workflow Execution - CreateWorkflowExecutionsActions](https://support.huaweicloud.com/api-modelarts/CreateWorkflowExecutionsActions.md): 管理Workflow Execution接口用于对指定工作流执行实例进行操作,如启动、暂停或终止。该接口适用于以下场景:当用户需要控制工作流执行实例的运行状态、处理执行异常或调整执行流程时,可通过此接口对指定的执行实例进行管理。使用该接口的前提条件是目标执行实例已存在且用户具有管理权限,且执行实例处于可操作状态(如运行中或暂停状态)。管理 - [管理Workflow StepExecution - CreateWorkflowStepExecutionsActions](https://support.huaweicloud.com/api-modelarts/CreateWorkflowStepExecutionsActions.md): 管理Workflow StepExecution接口用于对某些节点步骤进行重试、停止和继续操作。该接口适用于以下场景:当用户需要管理特定节点的执行情况时,可以通过此接口对指定节点步骤停止、继续,对失败节点可以重试。使用该接口的前提条件是用户具有管理工作流节点步骤的权限。操作完成后,响应消息体中将包含指定步骤执行的详细信息。若步骤执行不存在 - [获取Workflow工作流节点度量信息 - ShowWorkflowStepExecutionMetrics](https://support.huaweicloud.com/api-modelarts/ShowWorkflowStepExecutionMetrics.md): 获取Workflow工作流节点度量信息接口用于查询工作流中各节点的度量信息。该接口适用于以下场景:当用户需要监控工作流节点的性能指标,可以通过此接口获取详细的度量数据。使用该接口的前提条件是用户已登录且具有查看工作流节点度量信息的权限。操作完成后,响应消息体中将包含指定节点的度量信息。若节点不存在或用户无权限操作,接口将返回相应的错误信息 - [获取StepExecution列表 - ListWorkflowStepExecution](https://support.huaweicloud.com/api-modelarts/ListWorkflowStepExecution.md): 获取StepExecution列表接口用于查询指定工作流中各步骤的执行情况。该接口适用于以下场景:当用户需要监控工作流中各步骤的执行状态、执行时间或执行结果时,可以通过此接口获取详细的StepExecution列表。使用该接口的前提条件是用户已登录且具有查看工作流执行记录的权限。接口响应消息体中包含每个步骤的详细执行信息,如步骤ID、状态 - [获取Workflow Execution列表的所有标签 - ListExecutionLabels](https://support.huaweicloud.com/api-modelarts/ListExecutionLabels.md): 获取Workflow Execution列表的所有标签接口用于查询指定工作流执行记录中的所有标签。该接口适用于以下场景:当用户需要查看工作流执行记录的标签信息,以便进行分类、筛选或统计时,可以通过此接口获取所有标签的列表。使用该接口的前提条件是用户已登录且具有查看工作流执行记录的权限。接口响应消息体中包含每个标签的详细信息,如标签键和标签 - [新建消息订阅Subscription - CreateWorkflowSubscriptions](https://support.huaweicloud.com/api-modelarts/CreateWorkflowSubscriptions.md): 新建消息订阅Subscription接口用于创建新的消息订阅,以便用户接收工作流执行过程中的通知。该接口适用于以下场景:当用户需要在工作流执行的关键阶段(如开始、结束、失败等)接收通知时,可以通过此接口创建订阅。使用该接口的前提条件是用户已登录且具有创建消息订阅的权限。创建操作完成后,系统将生成一个新的订阅,并返回订阅的详细信息,包括订阅 - [删除消息订阅Subscription - DeleteWorkflowSubscription](https://support.huaweicloud.com/api-modelarts/DeleteWorkflowSubscription.md): 删除消息订阅Subscription接口用于移除已创建的消息订阅,停止接收工作流执行过程中的通知。该接口适用于以下场景:当用户不再需要接收特定工作流执行阶段的通知时,可以通过此接口删除相应的订阅。使用该接口的前提条件是用户已登录且具有删除消息订阅的权限。删除操作完成后,指定的订阅将被永久移除,用户将不再接收该订阅相关的通知。若订阅不存在或 - [查询消息订阅Subscription详情 - ShowWorkflowSubscription](https://support.huaweicloud.com/api-modelarts/ShowWorkflowSubscription.md): 查询消息订阅Subscription详情接口用于获取已创建的消息订阅的详细信息。该接口适用于以下场景:当用户需要查看特定消息订阅的配置和状态时,可以通过此接口获取订阅的详细信息,包括订阅ID、创建时间、订阅的主题和回调URL等。使用该接口的前提条件是用户已登录且具有查看消息订阅的权限。查询操作完成后,响应消息体中将包含指定订阅的详细信息。 - [更新消息订阅Subscription - UpdateWorkflowSubscription](https://support.huaweicloud.com/api-modelarts/UpdateWorkflowSubscription.md): 更新消息订阅Subscription接口用于修改已创建的消息订阅的配置。该接口适用于以下场景:当用户需要更新消息订阅的主题或其他配置信息时,可以通过此接口进行修改。使用该接口的前提条件是用户已登录且具有更新消息订阅的权限。更新操作完成后,指定的订阅配置将被更新,并返回更新后的订阅详细信息。若订阅不存在或用户无权限操作,接口将返回相应的错误 - [获取动态挂载存储信息列表 - ListDynamicStorages](https://support.huaweicloud.com/api-modelarts/ListDynamicStorages.md): 此接口用于获取指定Notebook实例下挂载的动态存储信息列表。适用场景:用户需要获取指定Notebook实例下挂载的动态存储的存储id、存储类型、挂载路径、挂载状态等信息的场景。若挂载失败,会返回相应错误信息。暂无约束。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并 - [动态挂载Notebook存储 - AttachDynamicStorage](https://support.huaweicloud.com/api-modelarts/AttachDynamicStorage.md): 动态挂载Notebook存储接口支持将存储动态挂载到运行中的Notebook实例的指定文件目录。调用该接口后,系统将在Notebook实例中异步挂载指定的存储实例,挂载完成后用户可在容器中以文件系统方式读写存储实例中的文件。若用户无权限访问指定实例或Notebook实例未运行,接口将返回相应的错误信息。支持的存储类型:对象存储OBS - - [获取动态挂载存储实例详情 - ShowDynamicStorage](https://support.huaweicloud.com/api-modelarts/ShowDynamicStorage.md): 获取动态挂载OBS实例详情接口用于获取已挂载到运行中Notebook实例中的存储实例的详细信息。适用场景:用户需要查看Notebook实例中已挂载的存储实例的详细信息时,可通过此接口获取。使用该接口的前提条件是用户已登录系统并具有访问目标Notebook实例的权限。调用该接口后,系统将返回指定Notebook实例中挂载的存储实例的详细信息 - [动态卸载Notebook存储 - DetachDynamicStorage](https://support.huaweicloud.com/api-modelarts/DetachDynamicStorage.md): 动态卸载Notebook存储接口用于从运行中的Notebook实例中卸载已挂载的动态存储实例。适用场景:用户需要清理或重新组织Notebook实例的挂载资源时,可通过此接口卸载指定的存储实例。使用该接口的前提条件是用户已登录系统并具有访问目标Notebook实例的权限,同时Notebook实例必须处于运行状态且存储实例处于MOUNTED - [修改训练配额 - ModifyTrainingQuotas](https://support.huaweicloud.com/api-modelarts/ModifyTrainingQuotas.md): 修改训练配额接口用于修改用户在ModelArts服务中的训练资源配额信息。该接口适用于以下场景:当管理员需要调整用户的训练资源配额(如作业个数配额、自动老化开关、配额告警通知等)时,可以通过此接口进行修改。使用该接口的前提条件是用户已登录并具有修改配额的权限。修改成功后,用户的训练资源配额将被更新。若用户无权限或配额信息无效,接口将返回相 - [查询训练作业指定任务的日志 - ShowTrainingJobLogsFromAom](https://support.huaweicloud.com/api-modelarts/ShowTrainingJobLogsFromAom.md): 查询训练作业指定任务的日志接口用于获取ModelArts平台上指定训练作业任务的实时运行日志。该接口适用于以下场景:当用户需要查看特定训练任务的运行日志以便排查问题或监控训练进度时,可以通过此接口获取日志内容。使用该接口的前提条件是用户已知训练作业ID和任务ID,并具有查看日志的权限。查询操作完成后,平台将返回包含日志内容、起止行号等信息 - [查询资源池规格最大可用资源 - ShowTrainingFlavorMaxAvailableResource](https://support.huaweicloud.com/api-modelarts/ShowTrainingFlavorMaxAvailableResource.md): 查询资源池规格最大可用资源接口用于获取指定资源池中指定资源规格可分配的最大CPU和内存资源。该接口适用于以下场景:当用户需要在创建训练作业前了解资源池中某规格的可用资源上限,以便合理选择规格和节点数时,可以通过此接口进行查询。使用该接口的前提条件是用户已知资源池ID和资源规格ID,并具有查看训练资源的权限。查询操作完成后,平台将返回该规格 - [按标签统计训练作业资源数量 - CountTrainingJobsByTags](https://support.huaweicloud.com/api-modelarts/CountTrainingJobsByTags.md): 按标签统计训练作业资源数量接口用于根据标签等条件查询当前项目下符合条件的训练作业总数。该接口适用于以下场景:当用户需要按标签键值、资源名称等条件统计训练作业数量时,可以通过此接口进行查询。使用该接口的前提条件是用户已登录并具有查看训练作业标签的权限。查询操作完成后,平台将返回符合条件的训练作业总数。若用户无权限操作,接口将返回相应的错误信 - [获取训练作业支持的公共规格 - ShowTrainingJobFlavors](https://support.huaweicloud.com/api-modelarts/ShowTrainingJobFlavors.md): 获取训练作业支持的公共规格接口用于获取ModelArts平台上支持的训练作业资源规格列表。该接口适用于以下场景:当用户需要了解平台支持的资源规格以进行训练作业配置时,可以通过此接口获取规格列表。使用该接口的前提条件是用户具有查看资源规格的权限。查询操作完成后,平台将返回包含支持的资源规格信息。若用户无权限操作,接口将返回相应的错误信息。您 - [创建训练作业 - CreateTrainingJob](https://support.huaweicloud.com/api-modelarts/CreateTrainingJob.md): 创建训练作业接口用于在ModelArts平台上启动新的训练任务。该接口适用于以下场景:当用户需要基于特定的数据集和算法模型进行机器学习训练时,可以通过此接口创建并配置训练作业。使用该接口的前提条件是用户已上传数据集和模型代码至ModelArts平台,并具有创建训练作业的权限。创建训练作业后,平台将根据配置的资源规格启动训练任务,用户可以通 - [查询训练作业详情 - ShowTrainingJobDetails](https://support.huaweicloud.com/api-modelarts/ShowTrainingJobDetails.md): 查询训练作业详情接口用于获取ModelArts平台上指定训练作业的详细信息。该接口适用于以下场景:当用户需要查看特定训练作业的运行状态和配置信息时,可以通过此接口获取作业详情。使用该接口的前提条件是用户已知训练作业ID,并具有查看作业详情的权限。查询操作完成后,平台将返回包含训练作业的状态、配置、日志等详细信息。若训练作业ID不存在或用户 - [更新训练作业 - ChangeTrainingJobDescription](https://support.huaweicloud.com/api-modelarts/ChangeTrainingJobDescription.md): 更新训练作业接口用于修改已存在的训练作业的描述、事件通知、作业优先级、允许被抢占等信息。该接口适用于以下场景:当用户需要更新训练作业的描述、事件通知、作业优先级、允许被抢占等信息时,可以通过此接口进行修改。使用该接口的前提条件是训练作业已存在且用户具有相应的权限。更新操作完成后,训练作业的描述、事件通知、作业优先级、允许被抢占等信息将被更 - [删除训练作业 - DeleteTrainingJob](https://support.huaweicloud.com/api-modelarts/DeleteTrainingJob.md): 删除训练作业接口用于从ModelArts平台上移除已创建的训练作业。该接口适用于以下场景:当用户需要清理已完成或不再需要的训练作业时,可以通过此接口删除指定的训练作业。使用该接口的前提条件是训练作业已存在且用户具有删除训练作业的权限。删除操作完成后,训练作业将从平台中永久移除,相关资源和配置也将被清理。若训练作业ID不存在或用户无权限操作 - [终止训练作业 - StopTrainingJob](https://support.huaweicloud.com/api-modelarts/StopTrainingJob.md): 终止训练作业接口用于停止ModelArts平台上正在运行的训练作业,只可终止创建中、等待中、运行中的作业。该接口适用于以下场景:当用户需要提前终止正在进行的训练作业时,可以通过此接口停止作业。使用该接口的前提条件是训练作业正在运行且用户具有终止作业的权限。终止操作完成后,训练作业将停止运行,资源将被释放。若训练作业ID不存在、状态不为运行 - [查询训练作业指定任务的日志(预览) - ShowTrainingJobLogsPreview](https://support.huaweicloud.com/api-modelarts/ShowTrainingJobLogsPreview.md): 查询训练作业指定任务的日志(预览)接口用于获取ModelArts平台上指定训练作业任务的日志信息。该接口适用于以下场景:当用户需要查看特定训练任务的运行日志时,可以通过此接口获取日志预览。使用该接口的前提条件是用户已知训练作业ID和任务ID,并具有查看日志的权限。查询操作完成后,平台将返回包含任务日志的预览信息。若训练作业ID或任务ID不 - [查询训练作业指定任务的日志(OBS链接) - ShowObsUrlOfTrainingJobLogs](https://support.huaweicloud.com/api-modelarts/ShowObsUrlOfTrainingJobLogs.md): 查询训练作业指定任务的日志(OBS链接)接口用于获取指定训练作业任务的日志文件在OBS(对象存储服务)中的访问链接。该接口适用于以下场景:当用户需要查看或下载训练作业任务的详细日志信息时,可以通过此接口获取日志文件的OBS链接。使用该接口的前提条件是训练作业任务已存在且用户具有相应的权限。查询操作完成后,接口将返回指定任务的日志文件的OB - [查询训练作业指定任务的运行指标 - ShowTrainingJobMetrics](https://support.huaweicloud.com/api-modelarts/ShowTrainingJobMetrics.md): 查询训练作业指定任务的运行指标接口用于获取ModelArts平台上指定训练作业任务的运行指标。该接口适用于以下场景:当用户需要查看特定训练任务的性能指标时,可以通过此接口获取运行指标。使用该接口的前提条件是用户已知训练作业ID和任务ID,并具有查看运行指标的权限。查询操作完成后,平台将返回包含任务的性能指标信息。若训练作业ID或任务ID不 - [查询训练作业列表 - ListTrainingJobs](https://support.huaweicloud.com/api-modelarts/ListTrainingJobs.md): 查询训练作业列表接口用于获取ModelArts平台上所有训练作业的列表。该接口适用于以下场景:当用户需要查看平台上的所有训练作业时,可以通过此接口获取作业列表。使用该接口的前提条件是用户具有查看训练作业列表的权限。查询操作完成后,平台将返回包含训练作业名称、ID、状态等信息的列表。若用户无权限操作,接口将返回相应的错误信息。您可以在API - [创建训练作业标签 - CreateTrainJobTags](https://support.huaweicloud.com/api-modelarts/CreateTrainJobTags.md): 创建训练作业标签接口用于为已存在的训练作业添加标签。该接口适用于以下场景:当用户需要对训练作业进行分类、标记或管理时,可以通过此接口为指定的训练作业添加一个或多个标签,当添加的标签key已存在,则覆盖该标签的value。使用该接口的前提条件是训练作业已存在且用户具有相应的操作权限。标签添加成功后,用户可以在训练作业列表中查看到相应的标签信 - [删除训练作业标签 - DeleteTrainJobTags](https://support.huaweicloud.com/api-modelarts/DeleteTrainJobTags.md): 删除训练作业标签接口用于移除已存在的训练作业上的指定标签。该接口适用于以下场景:当用户需要清理或重新组织训练作业的标签时,可以通过此接口删除指定的训练作业标签。使用该接口的前提条件是训练作业已存在且用户具有相应的操作权限。标签删除成功后,指定的标签将从训练作业中移除,用户可以在训练作业列表中查看到更新后的标签信息。若训练作业不存在、指定的 - [查询训练作业标签 - ShowTrainJobTags](https://support.huaweicloud.com/api-modelarts/ShowTrainJobTags.md): 查询训练作业标签接口用于获取已存在的训练作业上的标签信息。该接口适用于以下场景:当用户需要查看训练作业的标签以进行分类、标记或管理时,可以通过此接口查询指定训练作业的标签列表。使用该接口的前提条件是训练作业已存在且用户具有相应的操作权限。查询成功后,用户将获得训练作业上所有标签的详细信息。若训练作业不存在或用户无权限操作,接口将返回相应的 - [创建训练作业镜像保存任务 - CreateSaveImageJob](https://support.huaweicloud.com/api-modelarts/CreateSaveImageJob.md): 创建训练作业镜像保存任务接口用于为已存在的训练作业创建一个镜像保存任务。该接口适用于以下场景:当用户需要将训练作业的当前状态或模型保存为镜像,以便后续复用或分享时,可以通过此接口创建一个镜像保存任务。使用该接口的前提条件是训练作业已存在且用户具有相应的操作权限。镜像保存任务创建成功后,系统将开始保存训练作业的镜像,并在完成后通知用户。若训 - [查询训练作业资源列表(按标签筛选) - ListTrainingJobsByTags](https://support.huaweicloud.com/api-modelarts/ListTrainingJobsByTags.md): 查询训练作业资源列表接口用于按标签、资源名称等条件筛选项目下符合条件的训练作业资源,并返回每个作业的标签信息。该接口适用于以下场景:当用户需要通过标签或资源名称筛选训练作业,以进行资源分类管理或批量操作时,可以通过此接口获取符合条件的作业资源列表。使用该接口的前提条件是用户具有查看标签的权限。查询操作完成后,平台将返回符合条件的作业资源列 - [查询训练作业镜像保存任务 - ShowSaveImageJob](https://support.huaweicloud.com/api-modelarts/ShowSaveImageJob.md): 查询训练作业镜像保存任务接口用于获取ModelArts平台上指定训练作业的镜像保存任务信息。该接口适用于以下场景:当用户需要查看特定训练作业的镜像保存任务状态时,可以通过此接口获取任务信息。使用该接口的前提条件是用户已知训练作业ID,并具有查看镜像保存任务的权限。查询操作完成后,平台将返回包含镜像保存任务的状态、配置等信息。若训练作业ID - [获取训练作业事件列表 - ListTrainingJobEvents](https://support.huaweicloud.com/api-modelarts/ListTrainingJobEvents.md): 获取训练作业事件列表接口用于获取ModelArts平台上指定训练作业的事件列表。该接口适用于以下场景:当用户需要查看特定训练作业的事件记录时,可以通过此接口获取事件列表。使用该接口的前提条件是用户已知训练作业ID,并具有查看事件列表的权限。查询操作完成后,平台将返回包含训练作业的事件记录信息。若训练作业ID不存在或用户无权限操作,接口将返 - [查询项目下训练作业标签列表 - ListTrainingJobTags](https://support.huaweicloud.com/api-modelarts/ListTrainingJobTags.md): 查询项目下训练作业标签列表接口用于获取指定项目下所有训练作业已使用的标签集合,按标签key聚合,每个key下包含所有不同的value。该接口适用于以下场景:当用户需要了解项目下训练作业已使用的所有标签键值对,以便进行标签筛选、资源分类或管理时,可以通过此接口获取标签列表。使用该接口的前提条件是用户具有查看标签的权限。查询操作完成后,平台将 - [获取训练配额 - ShowTrainingQuotas](https://support.huaweicloud.com/api-modelarts/ShowTrainingQuotas.md): 获取训练配额接口用于查询用户在ModelArts服务中的训练资源配额信息。该接口适用于以下场景:当用户需要了解当前可用的训练资源配额,以便合理规划和管理训练任务时,可以通过此接口获取配额详情。使用该接口的前提条件是用户已登录并具有查看配额的权限。响应消息体中包含用户已创建的训练作业个数、剩余可创建个数等。若用户无权限或配额信息为空,接口将 - [获取训练作业流程阶段信息列表 - ListTrainingJobStages](https://support.huaweicloud.com/api-modelarts/ListTrainingJobStages.md): 获取训练作业流程阶段信息列表接口用于获取ModelArts平台上指定训练作业的流程阶段信息列表。该接口适用于以下场景:当用户需要查看特定训练作业的流程阶段记录时,可以通过此接口获取阶段信息列表。使用该接口的前提条件是用户已知训练作业ID,并具有查看阶段信息列表的权限。查询操作完成后,平台将返回包含训练作业的阶段信息记录。若训练作业ID不存 - [获取事件类型列表 - ListEventCategories](https://support.huaweicloud.com/api-modelarts/ListEventCategories.md): 获取事件类型列表接口用于获取训练管理中支持的事件类型列表。该接口适用于以下场景:当用户需要了解训练管理中支持的事件类型,以便在创建或管理训练任务时进行相关配置时,可以通过此接口获取事件类型列表。使用该接口的前提条件是用户已登录且具有访问训练管理的权限。获取操作完成后,响应消息体中将包含所有支持的事件类型及其描述。若用户无权限访问或系统中无 - [查询训练作业的路由规划信息 - ShowTrainingJobRoutePlan](https://support.huaweicloud.com/api-modelarts/ShowTrainingJobRoutePlan.md): 查询训练作业的路由规划信息接口用于获取指定训练作业在Ascend规格专属资源池下的路由规划(rank映射)结果。该接口适用于以下场景:当用户在Ascend 910规格专属资源池上创建了多节点(节点数不少于3)训练作业,且需要查询作业实际生效的rank映射关系以进行性能调优或问题定位时,可以通过此接口获取路由规划信息。使用该接口的前提条件是 - [查询训练作业的实例历史调度信息 - ListTrainingJobTasks](https://support.huaweicloud.com/api-modelarts/ListTrainingJobTasks.md): 查询训练作业实例历史调度信息。该接口适用于任务运维排查、调度历史追溯与资源分配查看等场景,可获取训练作业调度的实例 IP、节点 IP等信息并支持按调度次数查询指定记录,也可通过schedule_count参数查询具体的某一次调度的实例信息。需用户具备对应训练作业查看权限且传入合法项目 ID 与训练作业 ID,调用成功返回调度历史数据,非法 - [训练作业事件上报接口 - NotifyTrainingJobInformation](https://support.huaweicloud.com/api-modelarts/NotifyTrainingJobInformation.md): 训练事件上报给业务面您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使 - [查询精调训练作业详情 - ShowFtDetail](https://support.huaweicloud.com/api-modelarts/ShowFtDetail.md): 查询精调训练作业详情接口用于获取ModelArts平台上指定训练作业的详细信息。该接口适用于以下场景:当用户需要查看特定训练作业的运行状态和配置信息时,可以通过此接口获取作业详情。使用该接口的前提条件是用户已知训练作业ID,并具有查看作业详情的权限。查询操作完成后,平台将返回包含训练作业的状态、配置、日志等详细信息。若训练作业ID不存在或 - [查询精调训练任务指标信息 - ShowFtMetrics](https://support.huaweicloud.com/api-modelarts/ShowFtMetrics.md): 查询精调训练任务指标信息,如:训练loss等。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求 - [查询精调训练任务产物列表 - ListFtArtifacts](https://support.huaweicloud.com/api-modelarts/ListFtArtifacts.md): 查询精调训练任务产物列表。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。 - [发布精调训练产物为模型资产 - PublishFtArtifacts](https://support.huaweicloud.com/api-modelarts/PublishFtArtifacts.md): 训练任务运行成功后,将产生的模型信息发布到资产中心。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权 - [校验训练作业名称 - ValidateTrainingJobName](https://support.huaweicloud.com/api-modelarts/ValidateTrainingJobName.md): 校验训练作业名称接口用于校验ModelArts平台上创建训练作业的名称是否重复。该接口适用于以下场景:当用户需要创建训练作业时,可以通过此接口校验训练作业名称是否存在,新创建的名称不存在时才能创建成功。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调 - [获取训练作业支持的AI预置框架 - ShowTrainingJobEngines](https://support.huaweicloud.com/api-modelarts/ShowTrainingJobEngines.md): 获取训练作业支持的AI预置框架接口用于查询当前系统中支持的AI预置框架列表。该接口适用于以下场景:当用户需要了解系统中可用的AI预置框架,以便在创建训练作业时选择合适的框架时,可以通过此接口获取支持的框架列表。使用该接口的前提条件是用户具有相应的操作权限。查询成功后,用户将获得系统中所有支持的AI预置框架的详细信息。若用户无权限操作或查询 - [创建算法 - CreateAlgorithm](https://support.huaweicloud.com/api-modelarts/CreateAlgorithm.md): 创建算法接口用于在ModelArts平台上创建一个新的算法。该接口适用于以下场景:当用户需要将自定义的算法模型上传至平台并进行管理时,可以通过此接口创建算法。使用该接口的前提条件是用户已准备好算法代码和相关配置文件,并上传至ModelArts平台,或用户已构建好自定义的镜像并上传至ModelArts平台。平台将在验证代码路径及相关配置正确 - [查询算法列表 - ListAlgorithms](https://support.huaweicloud.com/api-modelarts/ListAlgorithms.md): 查询算法列表接口用于获取ModelArts平台上所有算法的列表。该接口适用于以下场景:当用户需要查看平台上的所有可用算法时,可以通过此接口获取算法列表。使用该接口的前提条件是用户具有查看算法列表的权限。查询操作完成后,平台将返回包含算法名称、ID等信息的列表。若用户无权限操作,接口将返回相应的错误信息。您可以在API Explorer中调 - [查询算法详情 - ShowAlgorithmByUuid](https://support.huaweicloud.com/api-modelarts/ShowAlgorithmByUuid.md): 查询算法详情接口用于获取ModelArts平台上指定算法的详细信息。该接口适用于以下场景:当用户需要查看特定算法的详细配置和属性时,可以通过此接口获取算法详情。使用该接口的前提条件是用户已知算法ID,并具有查看算法详情的权限。查询操作完成后,平台将返回包含算法名称、描述、版本等详细信息。若算法ID不存在或用户无权限操作,接口将返回相应的错 - [更新算法 - ChangeAlgorithm](https://support.huaweicloud.com/api-modelarts/ChangeAlgorithm.md): 更新算法接口用于修改已存在的算法信息。该接口适用于以下场景:当算法的描述、标签、模型文件等信息需要更新时,用户可以通过此接口进行修改。使用该接口的前提条件是算法已存在且用户具有相应的权限。更新操作完成后,算法信息将被更新,相关配置也将同步修改。若算法不存在或用户无权限操作,接口将返回相应的错误信息。您可以在API Explorer中调试该 - [删除算法 - DeleteAlgorithm](https://support.huaweicloud.com/api-modelarts/DeleteAlgorithm.md): 删除算法接口用于从ModelArts平台上移除已注册的算法。该接口适用于以下场景:当用户需要清理不再使用的算法时,可以通过此接口删除指定的算法。使用该接口的前提条件是算法已存在且用户具有删除算法的权限。删除操作完成后,算法将从平台中永久移除。若算法ID不存在或用户无权限操作,接口将返回相应的错误信息。您可以在API Explorer中调试 - [获取支持的超参搜索算法 - ShowSearchAlgorithms](https://support.huaweicloud.com/api-modelarts/ShowSearchAlgorithms.md): 获取支持的超参搜索算法接口用于查询系统中支持的所有超参搜索算法。该接口适用于以下场景:当用户需要了解系统支持的超参搜索算法,以便在创建或更新训练任务时选择合适的算法时,可以通过此接口获取相关信息。使用该接口的前提条件是用户具有访问权限。查询操作完成后,接口将返回系统支持的超参搜索算法列表。若用户无权限操作,接口将返回相应的错误信息。您可以 - [更新训练实验信息 - ChangeTrainingExperiment](https://support.huaweicloud.com/api-modelarts/ChangeTrainingExperiment.md): 更新训练实验信息接口用于修改ModelArts平台上已存在的训练实验的配置。该接口适用于以下场景:当用户需要调整训练实验的参数,如实验名称、描述时,可以通过此接口更新训练实验的信息。使用该接口的前提条件是用户已登录ModelArts平台并具有修改训练实验的权限,同时需要提供有效的实验ID和待更新的配置信息。更新操作完成后,系统将根据新的配 - [查询训练实验详情 - ShowTrainingExperimentDetails](https://support.huaweicloud.com/api-modelarts/ShowTrainingExperimentDetails.md): 查询训练实验详情接口用于获取指定训练实验的详细信息。该接口适用于以下场景:当用户需要查看训练实验的实验名称、描述、创建时间等详细信息时,可以通过此接口获取。使用该接口的前提条件是训练实验已存在且用户具有查看该实验的权限。查询操作完成后,将返回训练实验的详细信息,包括但不限于实验ID、名称、描述、创建时间等。若训练实验不存在或用户无权限操作 - [删除训练实验 - DeleteTrainingExperiment](https://support.huaweicloud.com/api-modelarts/DeleteTrainingExperiment.md): 删除训练实验接口用于移除已创建的训练实验。该接口适用于以下场景:当训练实验完成、配置错误或需要清理资源时,用户可以通过此接口删除指定的训练实验。使用该接口的前提条件是训练实验已存在且用户具有删除该实验的权限。删除操作完成后,训练实验将被永久移除,相关的配置和资源也将被清理。若训练实验不存在或用户无权限操作,接口将返回相应的错误信息。您可以 - [创建训练实验 - CreateTrainingExperiment](https://support.huaweicloud.com/api-modelarts/CreateTrainingExperiment.md): 创建训练实验接口用于在ModelArts平台上创建新的实验分类。该接口适用于以下场景:当用户需要将训练作业放入实验中分类,有序地进行管理,可以通过此接口创建训练实验,常用于多任务的版本管理等场景。使用该接口的前提条件是用户已登录ModelArts平台并具有创建训练实验的权限。创建操作完成后,系统将返回训练实验的详细信息,包括实验ID、当前 - [查询训练实验列表 - ListTrainingExperiments](https://support.huaweicloud.com/api-modelarts/ListTrainingExperiments.md): 查询训练实验列表接口用于获取ModelArts平台上用户已创建的训练实验的列表。该接口适用于以下场景:当用户需要查看所有或部分训练实验的概要信息,如实验名称、描述、创建时间等时,可以通过此接口查询训练实验列表。使用该接口的前提条件是用户已登录ModelArts平台并具有查看训练实验的权限。查询操作完成后,系统将返回符合条件的训练实验列表。 - [校验训练实验名称 - CheckTrainingExperiment](https://support.huaweicloud.com/api-modelarts/CheckTrainingExperiment.md): 校验训练实验名称接口用于新增训练实验前校验训练实验名称是否重复。该接口适用于以下场景:当用户需要创建新的训练实验时,可以通过此接口校验定义的实验名称是否已存在。使用该接口的前提条件是用户具有创建实验的权限。查询操作完成后,将返回实验名称是否重复的结果。若用户无权限操作,接口将返回相应的错误信息。您可以在API Explorer中调试该接口 - [创建发布算法资产 - CreateAlgorithmVersionToGallery](https://support.huaweicloud.com/api-modelarts/CreateAlgorithmVersionToGallery.md): 创建发布算法资产接口用于在算法管理中创建并发布新的算法资产。该接口适用于以下场景:当用户开发完成新的算法并希望将其发布为可复用的算法资产时,可以通过此接口创建并发布算法资产。使用该接口的前提条件是用户已登录且具有创建和发布算法资产的权限。创建发布操作完成后,系统将生成新的算法资产,并将其添加到算法资产列表中,用户可以通过算法ID进行管理和 - [查询超参搜索所有trial的结果 - ShowAutoSearchTrials](https://support.huaweicloud.com/api-modelarts/ShowAutoSearchTrials.md): 查询超参搜索所有trial的结果接口用于获取指定超参搜索任务中所有trial的详细结果。该接口适用于以下场景:当用户需要查看超参搜索任务中所有trial的性能指标和状态信息时,可以通过此接口获取详细结果。使用该接口的前提条件是超参搜索任务已存在且用户具有相应的权限。查询操作完成后,接口将返回所有trial的详细结果信息。若超参搜索任务不存 - [查询超参搜索某个trial的结果 - ShowAutoSearchPerTrial](https://support.huaweicloud.com/api-modelarts/ShowAutoSearchPerTrial.md): 查询超参搜索某个trial的结果接口用于获取指定超参搜索任务中某个特定trial的详细结果。该接口适用于以下场景:当用户需要查看超参搜索任务中某个特定trial的性能指标和状态信息时,可以通过此接口获取详细结果。使用该接口的前提条件是超参搜索任务已存在且用户具有相应的权限。查询操作完成后,接口将返回指定trial的详细结果信息。若超参搜索 - [获取超参敏感度分析结果 - ShowAutoSearchParamsAnalysis](https://support.huaweicloud.com/api-modelarts/ShowAutoSearchParamsAnalysis.md): 获取超参敏感度分析结果接口用于查询指定超参搜索任务的超参数敏感度分析结果。该接口适用于以下场景:当用户需要了解超参搜索任务中各个超参数对模型性能的影响程度时,可以通过此接口获取敏感度分析结果。使用该接口的前提条件是超参搜索任务已存在且用户具有相应的权限。查询操作完成后,接口将返回超参数敏感度分析的详细结果。若超参搜索任务不存在或用户无权限 - [获取某个超参敏感度分析图像的路径 - ShowAutoSearchParamAnalysisResultPath](https://support.huaweicloud.com/api-modelarts/ShowAutoSearchParamAnalysisResultPath.md): 获取某个超参敏感度分析图像的路径接口用于获取超参数敏感度分析结果的图像路径。该接口适用于以下场景:当用户需要查看某个训练作业中超参数的敏感度分析结果时,可以通过此接口获取相应的图像路径。使用该接口的前提条件是训练作业已存在且已完成超参数敏感度分析,用户具有查看该训练作业的权限。接口响应消息体中包含图像的路径信息。若训练作业不存在、未进行超 - [提前终止自动化搜索作业的某个trial - ShowAutoSearchTrialEarlyStop](https://support.huaweicloud.com/api-modelarts/ShowAutoSearchTrialEarlyStop.md): 提前终止自动化搜索作业的某个trial接口用于手动停止正在进行的自动化搜索作业中的某个试验。该接口适用于以下场景:当用户发现某个试验的性能不佳或需要优化资源使用时,可以通过此接口提前终止该试验。使用该接口的前提条件是自动化搜索作业已存在且正在进行,用户具有管理该作业的权限。提前终止操作完成后,指定的试验将被停止,相关资源将被释放。若自动化 - [获取自动化搜索作业yaml模板的信息 - ShowAutoSearchYamlTemplatesInfo](https://support.huaweicloud.com/api-modelarts/ShowAutoSearchYamlTemplatesInfo.md): 获取自动化搜索作业yaml模板的信息接口用于获取自动化搜索作业的yaml配置模板详情。该接口适用于以下场景:当用户需要创建或修改自动化搜索作业时,可以通过此接口获取yaml模板的详细信息,以便了解和配置作业的各项参数。使用该接口的前提条件是用户具有查看自动化搜索作业模板的权限。接口响应消息体中包含yaml模板的详细信息。若用户无权限操作, - [获取自动化搜索作业yaml模板的内容 - ShowAutoSearchYamlTemplateContent](https://support.huaweicloud.com/api-modelarts/ShowAutoSearchYamlTemplateContent.md): 获取自动化搜索作业yaml模板的内容接口用于获取自动化搜索作业的yaml配置文件的具体内容。该接口适用于以下场景:当用户需要创建或修改自动化搜索作业时,可以通过此接口获取yaml模板的具体内容,以便进行详细的配置和调整。使用该接口的前提条件是用户具有查看自动化搜索作业模板的权限。接口响应消息体中包含yaml模板的具体内容。若用户无权限操作 - [批量删除训练作业 - BatchDeleteTrainingJob](https://support.huaweicloud.com/api-modelarts/BatchDeleteTrainingJob.md): 批量删除训练作业接口用于一次性从ModelArts平台上移除多个已创建的训练作业。该接口适用于以下场景:当用户需要集中清理多个已完成或不再需要的训练作业时,可以通过此接口批量删除,避免逐个调用删除接口。使用该接口的前提条件是待删除的训练作业均已存在、属于同一工作空间,且用户具有删除训练作业的权限。删除操作完成后,训练作业将从平台中永久移除 - [更新服务配置 - UpdateInferService](https://support.huaweicloud.com/api-modelarts/UpdateInferService.md): 该接口适用于需要动态调整模型服务配置的场景,对模型的性能参数、资源池配置、服务调用配置等进行更新升级。通过调用此接口,用户可以在原有服务的情况下,升级成一个新的服务版本。调用此接口前,服务状态必须为“停止”、“失败”或“运行中”,且用户需具有修改服务的权限。更新成功后,新配置立即生效;若失败,服务保持原有配置并返回错误信息。常见异常包括参 - [创建服务 - CreateInferService](https://support.huaweicloud.com/api-modelarts/CreateInferService.md): 将模型部署为在线服务,适用于用户在开发或运维过程中需要将训练好的模型部署为在线服务,以便通过API或HTTP接口提供预测或处理能力的场景。调用此接口前,用户必须具有创建服务的权限,并提供合法的模型镜像路径和完整的服务配置信息(如服务名称、模型镜像路径、资源配置、升级配置等)。调用成功后,系统将成功创建并部署服务,服务状态变为“部署中”,并 - [删除指定服务列表 - BatchDeleteInferServices](https://support.huaweicloud.com/api-modelarts/BatchDeleteInferServices.md): 删除指定服务列表功能允许用户批量删除多个服务,适用于需要清理资源、释放计算能力或管理多个服务的场景。使用此功能前,请确保您具备删除服务的权限,并提供有效的服务ID列表。成功执行后,指定的服务将被终止运行并释放相关资源。若服务ID无效、权限不足或服务状态不允许删除,将返回相应的错误信息。您可以在API Explorer中调试该接口,支持自动 - [查询服务详情 - ShowInferService](https://support.huaweicloud.com/api-modelarts/ShowInferService.md): 通过服务ID查询对应的服务详情,调用者可以通过有效的服务ID获取服务的名称、状态、服务实例、配置参数等详细信息。调用者需具有足够的权限,且输入的服务ID必须有效。查询成功时返回服务详细信息,查询失败时返回特定的错误码和错误信息。若服务ID无效、版本号不存在或用户无权限,则返回400 Bad Request或403 Forbidden。您可 - [启动服务 - StartInferService](https://support.huaweicloud.com/api-modelarts/StartInferService.md): 使服务从"停止"或"失败"状态进入"部署中"状态,适用于用户需要重新启动已停止或启动失败的服务的情况。调用此接口前,服务状态必须为"停止"或"失败",且用户需具有启动服务的权限。调用成功后,服务状态将变为"部署中",系统将开始执行部署流程,包括资源准备、配置加载等。如果服务当前状态不是"停止"或"失败",或用户没有启动服务的权限,调用将返 - [查询服务列表 - ListInferServices](https://support.huaweicloud.com/api-modelarts/ListInferServices.md): 支持分页和筛选您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份 - [停止服务 - StopInferService](https://support.huaweicloud.com/api-modelarts/StopInferService.md): 使服务从"运行中"状态进入"停止中"最终变为"停止"状态,适用于用户需要停止正在运行的服务以节省资源成本的场景。用户需具有停止服务的权限。调用成功后,服务状态将变为"停止中",系统将开始执行停止流程,包括释放资源、保存状态等。如果用户没有停止服务的权限,调用将返回错误。您可以在API Explorer中调试该接口,支持自动认证鉴权。API - [获取在线服务事件列表 - ListInferServiceEvents](https://support.huaweicloud.com/api-modelarts/ListInferServiceEvents.md): 该接口适用于需要监控和管理在线服务事件的场景,例如用户或运维人员需要定期检查服务的日志事件,以及时发现和处理问题。通过调用此接口,用户可以获取当前在线服务的所有事件记录,包括事件类型、事件信息、时间、发生次数等信息。用户必须具有查询服务事件列表的权限,才能成功访问该接口。获取成功后,返回事件列表;若失败,返回具体的错误信息。常见异常包括权 - [停止在线服务部署 - StopInferDeployment](https://support.huaweicloud.com/api-modelarts/StopInferDeployment.md): 停止在线部署功能允许用户在特定状态下主动终止正在运行或处于其他可操作状态的部署实例。该功能适用于需要维护、升级或检测到异常的服务场景,支持在服务处于"运行中"、"部署中"、"失败"或"告警"状态时执行停止操作。使用此功能前,请确保部署实例处于可停止状态,并具备相应的API调用权限。成功执行后,部署将进入停止状态,释放相关资源并停止处理新的 - [中断服务部署 - CancelInferDeployment](https://support.huaweicloud.com/api-modelarts/CancelInferDeployment.md): 中断服务部署接口用于中断处于“升级中”或“部署中”状态的部署,使其快速停止。该接口适用于以下场景:当部署出现严重故障需要立即修复、资源需要快速释放以部署更高优先级的部署,或在测试环境中需要快速迭代时,用户可通过此接口中断指定部署。使用该接口的前提条件是部署当前状态为“升级中”或“部署中”,且用户具有中断部署的权限。若部署为“部署中”状态, - [查询服务部署列表 - ListInferDeployments](https://support.huaweicloud.com/api-modelarts/ListInferDeployments.md): 支持分页和筛选,适用于用户在管理控制台或通过API需要查看特定条件下(如服务状态、名称等)的部署列表的情况。调用此接口前,用户必须具有查询部署列表的权限,并提供合法的分页参数(如页码、每页条数)和筛选条件(如部署状态、名称等)。调用成功后,系统将返回符合筛选条件的部署列表,包含指定页码的数据,并返回总页数和总记录数。如果用户没有查询部署列 - [启动服务部署 - StartInferDeployment](https://support.huaweicloud.com/api-modelarts/StartInferDeployment.md): 使部署从“停止”或“失败”状态进入“部署中”状态,适用于用户需要重新启动已停止或启动失败的部署的情况。调用此接口前,部署状态必须为“停止”或“失败”,且用户需具有启动部署的权限。调用成功后,部署状态将变为“部署中”,系统将开始执行部署流程,包括资源准备、配置加载等。如果部署当前状态不是“停止”或“失败”,或用户没有启动部署的权限,调用将返 - [添加部署 - CreateInferDeployment](https://support.huaweicloud.com/api-modelarts/CreateInferDeployment.md): 将模型部署为在线服务您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使 - [查询服务部署详情 - ShowInferDeployment](https://support.huaweicloud.com/api-modelarts/ShowInferDeployment.md): 通过服务ID、部署ID查询对应的部署详情,调用者可以通过有效的服务ID、部署ID获取部署的名称、状态、服务实例、配置参数等详细信息。调用者需具有足够的权限,且输入的服务ID、部署ID必须有效。查询成功时返回部署详细信息,查询失败时返回特定的错误码和错误信息。若服务ID或者部署ID无效、版本号不存在或用户无权限,则返回400 Bad Req - [更新服务部署配置 - UpdateInferDeployment](https://support.huaweicloud.com/api-modelarts/UpdateInferDeployment.md): 该接口适用于需要动态调整模型服务部署配置的场景您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求 - [删除服务部署 - DeleteInferDeployment](https://support.huaweicloud.com/api-modelarts/DeleteInferDeployment.md): 该接口适用于删除服务的某个部署。若服务ID、部署ID无效、版本号不存在或用户无权限,则返回400 Bad Request或403 Forbidden您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的 - [切换部署到指定版本 - SwitchInferDeploymentVersion](https://support.huaweicloud.com/api-modelarts/SwitchInferDeploymentVersion.md): 此接口用于将部署切换到指定版本,适用于需要在不同版本间进行切换以测试或回滚的场景。请求需包含有效的服务ID、部署ID及目标版本号,版本号必须是已发布的有效版本。用户必须具有对目标服务部署的管理权限,并且部署处于运行状态。切换成功后,部署将立即使用新的版本。若服务ID无效、部署ID无效、版本号不存在或用户无权限,则返回400 Bad Req - [查询在线服务部署版本列表 - ListInferDeploymentVersions](https://support.huaweicloud.com/api-modelarts/ListInferDeploymentVersions.md): 此接口用于获取指定服务部署的版本列表,适用于需要了解当前服务部署可用版本的场景,例如进行版本选择或确认当前版本信息。请求需包含有效的服务ID、部署ID,也可通过排序参数对列表进行排序。用户必须具有对目标服务部署的查看权限。请求成功后,返回该服务部署的所有在线版本信息,包括版本号、发布时间和状态。若服务ID/部署ID无效或用户无权限,则返回 - [删除在线服务部署版本 - DeleteInferDeploymentVersion](https://support.huaweicloud.com/api-modelarts/DeleteInferDeploymentVersion.md): 此接口用于删除指定服务部署的某个在线版本,适用于需要清理不再使用的版本或优化资源管理的场景。请求需包含有效的服务ID、部署ID及版本号。用户必须具有对目标服务部署的管理权限,并且该版本当前未处于活跃状态。删除成功后,指定版本将从在线服务部署中移除,相关资源将被释放。若服务ID、部署ID无效、版本号不存在或用户无权限,则返回400 Bad - [查询在线服务部署版本详情 - ShowInferDeploymentVersion](https://support.huaweicloud.com/api-modelarts/ShowInferDeploymentVersion.md): 此接口用于获取指定服务部署版本的详细信息,适用于需要查看特定版本的详细配置和状态的场景,例如确认版本的功能、性能参数或发布历史。请求需包含有效的服务ID、部署ID及版本号。用户必须具有对目标服务部署的查看权限。请求成功后,返回该版本的详细信息,包括版本号、发布时间、配置参数和状态。若服务ID、部署ID无效、版本号不存在或用户无权限,则返回 - [手动服务扩缩容 - UpdateInferDeploymentScale](https://support.huaweicloud.com/api-modelarts/UpdateInferDeploymentScale.md): 该接口适用于模型服务实例扩缩容。通过调用此接口,用户可以在原有服务的情况下,对服务进行扩缩容,且不会增加新的版本;包括权限验证错误、服务状态错误和参数验证错误。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果 - [查询服务部署实例列表 - ListInferDeploymentInstances](https://support.huaweicloud.com/api-modelarts/ListInferDeploymentInstances.md): 本接口用于查询当前租户的服务部署实例列表,并支持根据服务部署实例的状态进行筛选,包括运行中和已删除状态,同时支持分页和关键词筛选。适用于需要管理和监控服务实例状态的场景。调用此接口前,确保已具备相应的查询权限,并提供可选的筛选条件和分页参数。返回的列表将包含每个服务部署实例的基本信息,如部署名字、最新更新时间、状态等。如果当前租户没有符合 - [查询服务部署的pod的列表 - ListInferDeploymentPods](https://support.huaweicloud.com/api-modelarts/ListInferDeploymentPods.md): 本接口用于查询指定服务部署的pod列表,并支持选择是否只获取当前运行中的pod。适用于需要管理和监控服务部署pod状态的场景。调用此接口前,确保已具备相应的查询权限,并提供有效的服务ID、部署ID和可选的筛选参数pod status(如是否只获取当前运行中的pod)。返回的列表将包含每个pod的基本信息,如pod名称、pod所在node的 - [删除服务部署的实例 - DeleteInferDeploymentInstance](https://support.huaweicloud.com/api-modelarts/DeleteInferDeploymentInstance.md): 本接口用于删除指定的单个部署的实例,适用于需要清理或释放不再使用的部署实例资源的场景。调用此接口前,确保已具备相应的删除权限,并提供有效的服务实例ID、部署ID。删除成功后,指定的服务部署实例将被彻底移除,不再对任何请求生效。如果提供的服务实例ID、部署ID无效、服务实例已删除或权限不足,将返回相应的异常信息,提示用户检查输入数据的有效性 - [删除Pod - DeleteInferDeploymentPod](https://support.huaweicloud.com/api-modelarts/DeleteInferDeploymentPod.md): 本接口用于删除指定的单个Pod,适用于需要清理或释放不再使用的Pod资源的场景。调用此接口前,确保已具备相应的删除权限,并提供有效的Pod ID。删除成功后,指定的Pod将被彻底移除,不再对任何服务请求生效。如果提供的Pod ID无效、Pod已删除或权限不足,将返回相应的异常信息,提示用户检查输入数据的有效性和权限。您可以在API Exp - [查询Pod事件 - ListInferDeploymentPodEvents](https://support.huaweicloud.com/api-modelarts/ListInferDeploymentPodEvents.md): 本接口用于查询指定Pod的Kubernetes事件,适用于需要监控和排查Pod运行状态的场景。调用此接口前,确保已具备相应的查询权限,并提供有效的Pod ID。返回的事件列表将包含每个事件的详细信息,如事件类型、发生次数、事件名称、事件信息、发生时间等。如果提供的Pod ID无效、Pod不存在或权限不足,将返回相应的异常信息,提示用户检查 - [创建HRA策略 - CreateInferHra](https://support.huaweicloud.com/api-modelarts/CreateInferHra.md): 本接口用于在已部署且支持HRA策略的服务上创建HRA策略,适用于需要根据业务负载或特定时间自动调整服务实例个数的场景。调用此接口前,确保服务已成功部署并获取了有效的服务ID,并提供详细的hra策略参数,如hra时间、实例个数范围、条件触发器等。创建成功后,系统将根据设定的策略自动调整服务实例个数,确保服务在指定时间内的性能和可用性。如果提 - [获取推理单元配比检测信息 - ShowInferHra](https://support.huaweicloud.com/api-modelarts/ShowInferHra.md): 本接口用于在已部署的服务上查看推理单元配比检测信息。调用此接口前,确保服务已成功部署并获取了有效的服务ID。查询成功后,返回服务对应的策略信息,如规则ID,规则名称,策略状态,HRA结果状态等。如果提供的服务ID无效、参数配置错误或系统资源不足,将返回相应的异常信息,提示用户检查输入数据的有效性或联系技术支持。您可以在API Explor - [修改指定部署的HRA策略配置 - UpdateInferHra](https://support.huaweicloud.com/api-modelarts/UpdateInferHra.md): 本接口用于在已创建HRA策略的服务上修改指定部署的HRA策略配置,适用于需要根据业务负载或特定时间自动调整服务实例个数的场景。调用此接口前,确保服务已成功部署并获取了有效的服务ID,部署ID,并提供详细的hra策略参数,如HRA规则列表、HRA结果状态、策略状态等。修改成功后,系统将根据设定的策略自动调整服务实例个数,确保服务在指定时间内 - [创建自动扩缩容策略 - CreateInferDeploymentHpa](https://support.huaweicloud.com/api-modelarts/CreateInferDeploymentHpa.md): 本接口用于在已部署的服务上创建定时扩缩容策略,适用于需要根据业务负载或特定时间自动调整服务实例个数的场景。调用此接口前,确保服务已成功部署并获取了有效的服务ID,并提供详细的扩缩容策略参数,如扩缩容时间、实例个数范围、条件触发器等。创建成功后,系统将根据设定的策略自动调整服务实例个数,确保服务在指定时间内的性能和可用性。如果提供的服务ID - [查看自动扩缩容策略 - ShowInferDeploymentHpa](https://support.huaweicloud.com/api-modelarts/ShowInferDeploymentHpa.md): 本接口用于在已部署的服务上查看自动扩缩容策略。调用此接口前,确保服务已成功部署并获取了有效的服务ID。查询成功后,返回服务对应的策略信息,如规则ID,规则名称,扩缩容类型,扩缩容状态,扩缩容cron表达式,目标实例数等。如果提供的服务ID无效、参数配置错误或系统资源不足,将返回相应的异常信息,提示用户检查输入数据的有效性或联系技术支持。您 - [删除自动扩缩容策略 - DeleteInferDeploymentHpa](https://support.huaweicloud.com/api-modelarts/DeleteInferDeploymentHpa.md): 本接口用于在已部署的服务上删除定时扩缩容策略,适用于需要根据业务负载或特定时间自动删除服务的场景。调用此接口前,确保服务已成功部署并获取了有效的服务ID,部署ID。如果提供的服务ID无效、参数配置错误或系统资源不足,将返回相应的异常信息,提示用户检查输入数据的有效性或联系技术支持。暂时为非开放接口,后端清理服务下的自动扩缩容策略规则使用。 - [修改自动扩缩容策略 - UpdateInferDeploymentHpa](https://support.huaweicloud.com/api-modelarts/UpdateInferDeploymentHpa.md): 本接口用于在已部署的服务上修改定时扩缩容策略,适用于需要根据业务负载或特定时间自动调整服务实例个数的场景。调用此接口前,确保服务已成功部署并获取了有效的服务ID,部署ID,并提供详细的扩缩容策略参数,如扩缩容时间、实例个数范围、条件触发器等。修改成功后,系统将根据设定的策略自动调整服务实例个数,确保服务在指定时间内的性能和可用性。如果提供 - [查看自动扩缩容策略事件 - ListInferDeploymentHpaEvents](https://support.huaweicloud.com/api-modelarts/ListInferDeploymentHpaEvents.md): 本接口用于在已部署的服务上查看自动扩缩容策略事件,适用于查看自动扩缩容策略变动历史记录。调用此接口前,确保获取了有效的用户项目ID,服务ID,部署ID。调用成功后,会返回策略事件ID,事件状态,规则执行信息,扩缩容前实例数,扩缩容后实例数,预设目标实例数,执行记录时间。如果提供的服务ID无效、参数配置错误或系统资源不足,将返回相应的异常信 - [删除资源标签 - DeleteInferServiceTag](https://support.huaweicloud.com/api-modelarts/DeleteInferServiceTag.md): 该接口适用于需要从资源(如模型、数据集、服务等)中移除特定标签的场景,例如在资源管理或分类中,用户可以通过删除标签来调整或清理资源的元数据。通过调用此接口,用户可以批量删除指定的标签。用户必须具有足够的权限,且目标资源需存在。删除成功后,资源将不再包含指定的标签信息;若失败,返回具体的错误信息。常见异常包括权限验证错误、资源不存在错误和参 - [添加标签 - CreateInferServiceTag](https://support.huaweicloud.com/api-modelarts/CreateInferServiceTag.md): 该接口适用于需要为资源(如模型、数据集、服务等)添加元数据标签的场景,例如在资源管理或分类中,用户可以通过添加标签来标注资源的用途、状态或其他属性。通过调用此接口,用户可以批量添加标签,如果标签key已存在,则更新其value。用户必须具有足够的权限,且目标资源需存在。添加成功后,资源将包含新的标签信息;若失败,返回具体的错误信息。常见异 - [查询资源标签 - ShowInferServiceTags](https://support.huaweicloud.com/api-modelarts/ShowInferServiceTags.md): 该接口适用于需要获取资源(如模型、数据集、服务等)的标签信息的场景,例如在资源管理或分类中,用户可以通过查询标签来了解资源的用途、状态或其他属性。通过调用此接口,用户可以通过资源ID获取指定资源的所有标签列表。用户必须具有足够的权限,且目标资源需存在。查询成功后,返回资源的标签列表;若失败,返回具体的错误信息。常见异常包括权限验证错误、资 - [查询某一类资源下的标签 - ListInferServiceTags](https://support.huaweicloud.com/api-modelarts/ListServiceTags-v2.md): 该接口适用于需要获取用户当前项目中某一类资源(如指定的Service)的标签信息的场景,例如在资源管理和监控中,用户可以通过查询标签来了解各类资源的分类和属性。通过调用此接口,用户可以获取指定Service在所有工作空间中的标签列表,但无权限的工作空间标签数据将被过滤不返回。用户必须具有足够的权限,且目标资源需存在。查询成功后,返回指定S - [通过标签反查资源列表 - ListInferServicesByTags](https://support.huaweicloud.com/api-modelarts/ListInferServicesByTags.md): 该接口适用于需要根据标签或资源名称查找相关资源的场景,例如在资源管理和搜索中,用户可以通过指定标签或进行模糊查询来查找符合特定条件的资源。通过调用此接口,用户可以基于多个标签或资源名称进行精确或模糊查询,若不传标签则返回所有资源。用户必须具有足够的权限,且目标资源需存在。查询成功后,返回符合条件的资源列表;若失败,返回具体的错误信息。常见 - [通过标签查询资源数量 - CountInferServicesByTags](https://support.huaweicloud.com/api-modelarts/CountInferServicesByTags.md): 该接口适用于需要统计和获取符合特定标签或资源名称条件的资源数量的场景,例如在资源管理和监控中,用户可以通过指定标签或资源名称进行精确或模糊查询来统计资源数量。通过调用此接口,用户可以基于多个标签或资源名称进行查询,若不传标签则返回所有资源的总数。用户必须具有足够的权限,且目标资源需存在。查询成功后,返回符合条件的资源总数;若失败,返回具体 - [创建应用密钥 - CreateInferApiKey](https://support.huaweicloud.com/api-modelarts/CreateInferApiKey.md): 本接口用于在系统中创建一个新的API_KEY,适用于需要为用户或应用程序生成访问凭证的场景。调用此接口前,确保已具备相应的创建权限,并提供必要的参数,如用户ID或应用程序ID。创建成功后,系统将生成一个唯一的API_KEY,并返回该API_KEY的详细信息,包括API_KEY值、创建时间等。如果提供的参数无效或系统中已存在相同的API_K - [创建临时应用密钥 - CreateInferTempApiKey](https://support.huaweicloud.com/api-modelarts/CreateInferTempApiKey.md): 本接口用于在系统中创建一个新的临时API_KEY,适用于需要为用户或应用程序生成临时访问凭证的场景。调用此接口前,确保已具备相应的创建权限,并提供必要的参数,如用户ID或应用程序ID。创建成功后,系统将生成一个唯一的API_KEY,并返回该API_KEY的详细信息,包括临时API_KEY值、创建时间等。如果提供的参数无效,将返回相应的异常 - [删除应用密钥 - DeleteInferApiKey](https://support.huaweicloud.com/api-modelarts/DeleteInferApiKey.md): 本接口用于删除指定的apikey,适用于管理员需要撤销对某个应用程序或用户的访问权限的场景。调用此接口前,确保已获取到需要删除的apikey,并确认apikey未在其他服务中使用。删除成功后,该apikey将无法再用于访问任何相关服务。如果尝试删除不存在或已删除的apikey,将返回相应的异常信息,提示用户检查apikey的有效性。您可以 - [查询应用密钥 - ListInferApiKeys](https://support.huaweicloud.com/api-modelarts/ListInferApiKeys.md): 本接口用于查询当前系统中的apikey列表,适用于管理员或用户需要查看和管理apikey的场景。调用此接口前,确保已具备相应的查询权限。返回的列表将包含每个apikey的基本信息,如apikey值、创建时间、绑定的服务等。如果当前系统中没有apikey,将返回空列表或相应的异常信息,提示用户检查查询条件。您可以在API Explorer中 - [绑定应用密钥 - BindInferApiKey](https://support.huaweicloud.com/api-modelarts/BindInferApiKey.md): 本接口用于将生成的apikey与指定服务进行绑定,适用于应用程序需要调用特定服务的场景。调用此接口前,确保已成功创建服务实例,并获取到有效的apikey。绑定成功后,apikey将作为服务调用时的身份验证凭证,确保仅授权用户能够访问该服务。如果尝试绑定已失效的apikey,将返回相应的异常信息,提示用户检查apikey的有效性和绑定状态。 - [解绑应用密钥 - UnbindInferApiKey](https://support.huaweicloud.com/api-modelarts/UnbindInferApiKey.md): 本接口用于将已绑定的apikey从指定服务中解绑,适用于需要撤销某个apikey对特定服务的访问权限的场景。调用此接口前,确保已获取到需要解绑的apikey,并确认该apikey当前绑定在指定服务上。解绑成功后,该apikey将不再对指定服务生效,但仍可继续用于其他服务。如果尝试解绑不存在或未绑定到指定服务的apikey,将返回相应的异常 - [批量绑定应用密钥 - BatchBindInferApiKeys](https://support.huaweicloud.com/api-modelarts/BatchBindInferApiKeys.md): 本接口用于将生成的多个apikey与指定服务进行批量绑定,用于访问特定服务。调用此接口前,确保已成功创建服务实例,并获取到有效的apikey。绑定成功后,apikey将作为服务调用时的身份验证凭证,确保仅授权用户能够访问该服务。如果尝试绑定已失效或已绑定当前服务的apikey将返回相应的异常信息,提示用户检查apikey的有效性和绑定状态 - [批量解绑应用密钥 - BatchUnbindInferApiKeys](https://support.huaweicloud.com/api-modelarts/BatchUnbindInferApiKeys.md): 本接口用于将已绑定的apikey从指定服务中批量解绑,适用于需要撤销多个apikey对特定服务的访问权限的场景。调用此接口前,确保已获取到需要解绑的多个apikey,并确认这些apikey当前绑定在指定服务上。解绑成功后,这些apikey将不再对指定服务生效,但仍可继续用于其他服务。如果尝试解绑不存在或未绑定到指定服务的apikey,将返 - [创建内网接入 - CreateInferIntranetConnection](https://support.huaweicloud.com/api-modelarts/CreateInferIntranetConnection.md): 本接口用于在指定Region中创建内网接入点,适用于需要为应用程序或服务配置内网连接的场景。调用此接口前,确保已具备相应的创建权限,并提供必要的参数,如Region ID、内网接入点名称和网络配置信息。创建成功后,系统将生成一个内网接入点,并返回该接入点的详细信息,包括接入点ID、创建时间、状态等。如果提供的参数无效或内网接入配置冲突,将 - [变更内网申请 - UpdateInferIntranetConnection](https://support.huaweicloud.com/api-modelarts/UpdateInferIntranetConnection.md): 本接口用于对当前租户的内网接入申请进行状态变更操作,支持通过(APPROVE)、拒绝(REJECT)、取消(CANCEL)和重试(RETRY)等操作。适用于需要管理内网接入申请审批流程的场景。调用此接口前,确保已具备相应的变更权限,并提供有效的内网申请ID和所需的操作类型。变更成功后,内网申请的状态将更新为指定的操作结果,并记录相关日志。 - [查询当前的内网接入申请列表 - ListInferIntranetConnectionApplications](https://support.huaweicloud.com/api-modelarts/ListInferIntranetConnectionApplications.md): 本接口用于查询当前所有的内网接入申请记录,适用于需要管理和监控内网接入申请状态的场景。调用此接口前,确保已具备相应的查询权限。返回的列表将包含每个内网接入申请的基本信息,如申请ID、创建时间、状态、Region ID等。如果当前租户没有内网接入申请记录,将返回空列表。如果调用时出现权限不足或其他系统异常,将返回相应的异常信息,提示用户检查 - [查询当前的内网接入审批列表 - ListInferIntranetConnectionReviews](https://support.huaweicloud.com/api-modelarts/ListInferIntranetConnectionReviews.md): 本接口用于查询当前所有的内网接入审批记录,适用于需要管理和监控内网接入审批状态的场景。调用此接口前,确保已具备相应的查询权限。返回的列表将包含每个内网接入审批的基本信息,如审批ID、申请时间、状态(如待审批、已批准、已拒绝)、申请者信息、Region ID等。如果当前租户没有内网接入审批记录,将返回空列表。如果调用时出现权限不足或其他系统 - [批量删除内网接入 - BatchDeleteInferIntranetConnections](https://support.huaweicloud.com/api-modelarts/BatchDeleteInferIntranetConnections.md): 本接口用于批量删除指定的内网接入点,适用于需要清理多个不再使用的内网接入点的场景。调用此接口前,确保已具备相应的删除权限,并提供一个有效的内网接入点ID列表。删除成功后,所指定的内网接入点将被彻底移除,不再对任何服务生效。如果提供的内网接入点ID列表中包含无效或已删除的ID,将返回相应的异常信息,提示用户检查ID的有效性。此外,如果调用时 - [修改添加自定义URL申请 - ModifyInferIntranetConnections](https://support.huaweicloud.com/api-modelarts/ModifyInferIntranetConnections.md): 本接口用于修改添加内网自定义URL请求,适用于需要同时更新或者添加多个内网接入点的场景。调用此接口前,确保调用者具备相应的更新权限,提供需要更新的参数,如IP地址、VPC ID、子网ID等。指定的内网接入点将添加新的配置,新的配置将对相关服务生效。如果提供的内网接入点ID列表中包含无效或不存在的ID,接口将返回相应的异常信息,提示用户检查 - [查询纳管资源池详情 - ShowInferServiceCluster](https://support.huaweicloud.com/api-modelarts/ShowInferServiceCluster.md): 该接口允许用户通过指定资源池的ID来查询纳管资源池的详细信息,包括实例ID、名称、Flavor规格、实例状态和实例可访问的URL。此功能适用于需要监控或管理云资源的用户,使用该接口前,用户需确保已拥有访问权限及正确的资源池ID。执行成功后,用户将获得所需的实例详情,可用于进一步的资源管理和配置。如果资源池ID无效或用户没有相应的访问权限, - [查询支持可切换规格列表 - ListInferClusterFlavors](https://support.huaweicloud.com/api-modelarts/ListInferClusterFlavors.md): 该接口允许用户查询当前资源实例支持的可切换规格列表,适用于需要调整实例资源配置的场景。使用该接口前,用户需确保已登录并拥有查询权限。执行成功后,用户将获得一个包含各种可切换规格的详细列表,包括规格ID、名称、资源配额等信息,可用于后续的实例规格变更操作。如果用户没有相应的查询权限或资源实例ID无效,接口将返回错误信息,如401 Unaut - [查询资产列表 - ListAsset](https://support.huaweicloud.com/api-modelarts/ListAsset.md): 查询资产列表接口用于在ModelArts平台上查询指定项目下的资产列表。该接口适用于以下场景:当用户需要在资产中心浏览、检索和管理资产时,可以通过此接口按需筛选所需资产。使用该接口的前提条件是用户已具备项目访问权限。平台将根据传入的查询条件返回符合条件的资产详情列表及总数。若请求参数格式错误或用户无权限操作,接口将返回相应的错误信息。您可 - [查询资产详情 - ShowAsset](https://support.huaweicloud.com/api-modelarts/ShowAsset.md): 查询资产详情接口用于在ModelArts平台上获取指定资产的详细信息。该接口适用于以下场景:当用户需要查看某个资产的完整元数据、存储位置、支持的操作及扩展信息时,可以通过此接口获取。使用该接口的前提条件是用户已具备项目访问权限,并已知目标资产的ID。平台将根据资产ID查询并返回资产的详情信息。若资产不存在或用户无权限操作,接口将返回相应的 - [更新资产 - UpdateAsset](https://support.huaweicloud.com/api-modelarts/UpdateAsset.md): 更新资产接口用于在ModelArts平台上修改指定资产的属性信息,包括资产名称、描述、系列、能力、启用状态、标签及自定义属性等。该接口适用于以下场景:当用户需要修改已有资产的元数据信息或调整资产状态时,可以通过此接口进行更新。使用该接口的前提条件是用户已具备项目访问权限,并已知目标资产的ID。平台将在校验资产存在性及归属权限后将更新应用到 - [删除资产 - DeleteAsset](https://support.huaweicloud.com/api-modelarts/DeleteAsset.md): 删除资产接口用于在ModelArts平台上删除指定的资产,支持通过forceDelete参数对数据集类型资产进行强制删除。该接口适用于以下场景:当用户需要清理不再使用的资产或释放存储资源时,可以通过此接口进行删除。使用该接口的前提条件是用户已具备项目访问权限,并已知目标资产的ID。平台将在校验资产存在性、归属权限及使用状态后执行禁用删除操 - [查询资产中心resource、doc目录下的内容 - ShowAssetResource](https://support.huaweicloud.com/api-modelarts/ShowAssetResource.md): 查询资产资源接口用于在ModelArts平台上获取指定资产中resource、doc等目录下的资源文件内容,如说明文档、芯片配置等。该接口适用于以下场景:当用户需要查看资产的附加文档、配置文件或其他静态资源时,可以通过此接口按资源名称获取对应内容。使用该接口的前提条件是用户已具备项目访问权限,并已知目标资产ID及资源文件名称。平台将根据资 - [查询README中的yaml内容 - ShowAssetExtendMessage](https://support.huaweicloud.com/api-modelarts/ShowAssetExtendMessage.md): 查询资产扩展信息接口用于在ModelArts平台上获取指定资产README文件中的YAML内容。该接口适用于以下场景:当用户需要查看预置资产的扩展元数据信息时,可以通过此接口解析README中的YAML片段并返回。使用该接口的前提条件是用户已具备项目访问权限,并已知目标资产ID。平台将根据资产ID读取对应README文件,解析其中的YAM - [通过asset code 和asset version查询资产详情 - ShowAssetByCodeAndVersion](https://support.huaweicloud.com/api-modelarts/ShowAssetByCodeAndVersion.md): 通过资产编码和版本查询资产详情接口用于在ModelArts平台上根据asset_code和版本asset_version查询指定资产的详细信息。该接口适用于以下场景:当用户已知资产编码和版本但无资产ID时,可以通过此接口获取资产的完整详情及可执行操作。使用该接口的前提条件是用户已具备项目访问权限,并已知目标资产的编码和版本号。平台将根据资 - [创建资源池 - CreatePool](https://support.huaweicloud.com/api-modelarts/CreatePool.md): 创建资源池接口用于在系统中创建新的资源池。该接口适用于以下场景:当需要为新业务分配资源、优化资源管理或进行资源隔离时,用户可通过此接口创建新的资源池,用于管理计算、存储、网络等资源。使用该接口的前提条件是用户具有管理员权限,并且系统中具备足够的资源支持新资源池的创建。创建操作完成后,新的资源池将被成功添加到系统中,并处于可用状态,可支持后 - [查询资源池列表 - ListPools](https://support.huaweicloud.com/api-modelarts/ListPools.md): 查询资源池列表接口用于获取系统中已创建的资源池信息。该接口适用于以下场景:当用户需要监控资源池状态、进行资源规划、管理资源分配或进行审计时,可通过此接口查询系统中现有的资源池列表。使用该接口的前提条件是用户具有相应的权限,并且系统中已存在资源池。查询操作完成后,接口将返回资源池列表,包含资源池ID、名称、类型、状态、资源配额等详细信息。若 - [查询资源池 - ShowPool](https://support.huaweicloud.com/api-modelarts/ShowPool.md): 查询资源池信息接口用于获取指定资源池的详细信息。该接口适用于以下场景:当用户需要查看特定资源池的详细配置、状态、资源使用情况或进行资源管理时,可通过此接口查询指定资源池的详细信息。使用该接口的前提条件是用户具有相应的权限,并且指定的资源池已存在于系统中。查询操作完成后,接口将返回资源池的详细信息,包括资源池ID、名称、类型、状态、资源配额 - [删除资源池 - DeletePool](https://support.huaweicloud.com/api-modelarts/DeletePool.md): 删除资源池接口用于移除指定的资源池。该接口适用于以下场景:当资源池不再需要、配置错误或需要清理资源时,用户可通过此接口删除指定的资源池。使用该接口的前提条件是资源池已存在且用户具有管理员权限。删除操作完成后,指定的资源池将被永久移除,相关资源和配置也将被清理。若资源池不存在、用户无权限操作或资源池被其他资源依赖,接口将返回相应的错误信息。 - [更新资源池 - PatchPool](https://support.huaweicloud.com/api-modelarts/PatchPool.md): 更新资源池接口用于修改指定资源池的配置和容量。该接口适用于以下场景:当资源池需要扩展容量、调整配置或优化性能时,用户可通过此接口更新资源池的相关信息。使用该接口的前提条件是资源池已存在且用户具有管理员权限。更新操作完成后,资源池的配置和容量将被更新,相关资源和配置也将被调整。若资源池不存在、用户无权限操作或资源池处于不可更新状态,接口将返 - [资源池监控 - ShowPoolMonitor](https://support.huaweicloud.com/api-modelarts/ShowPoolMonitor.md): 资源池监控接口用于获取指定资源池的实时或历史监控信息。该接口适用于以下场景:当需要实时查看资源池的资源使用情况、性能状态或历史数据时,用户可通过此接口获取资源池的监控数据。使用该接口的前提条件是资源池已存在且用户具有管理员权限。调用接口成功后,系统将返回资源池的监控信息,包括资源使用率、性能指标及历史趋势等数据。若资源池不存在、用户无权限 - [资源池统计 - ShowPoolStatistics](https://support.huaweicloud.com/api-modelarts/ShowPoolStatistics.md): 资源池统计接口用于获取指定资源池的统计信息。该接口适用于以下场景:当需要了解资源池的资源使用情况、分配情况或利用率时,用户可通过此接口获取资源池的统计数据。使用该接口的前提条件是资源池已存在且用户具有管理员权限。调用接口成功后,系统将返回资源池的统计信息,包括资源使用总量、已分配量、利用率及资源分配趋势等数据。若资源池不存在、用户无权限操 - [查询资源池节点自定义配置 - ShowPoolNodeConfig](https://support.huaweicloud.com/api-modelarts/ShowPoolNodeConfig.md): 查询资源池节点自定义配置接口用于获取指定资源池节点的自定义配置信息。该接口适用于以下场景:当需要查看资源池节点的详细配置、优化资源分配或管理节点资源时,用户可通过此接口获取节点的自定义配置数据。使用该接口的前提条件是资源池节点已存在且用户具有访问该节点的权限。调用接口成功后,系统将返回资源池节点的自定义配置信息,包括硬件规格、软件环境、网 - [创建资源池的订单id - CreateOrderId](https://support.huaweicloud.com/api-modelarts/CreateOrderId.md): 创建资源池订单ID接口用于生成资源池申请的订单标识。该接口适用于以下场景:当用户需要申请新资源池时(如业务扩展、资源不足或临时资源需求),可通过此接口提交按需转包周期订单的创建请求。使用该接口的前提条件是用户需具备资源申请权限,提交的资源池配置参数(如资源类型、容量、周期等)需符合系统校验规则,且当前仅支持按需转包周期订单类型。订单创建成 - [查询资源规格列表 - ListResourceFlavors](https://support.huaweicloud.com/api-modelarts/ListResourceFlavors.md): 查询资源规格列表接口用于获取可用的资源规格信息。该接口适用于以下场景:当需要查看或选择资源规格以创建资源池、分配资源或了解可用资源规格时,用户可通过此接口获取资源规格的详细信息。使用该接口的前提条件是用户具有相应的权限(如管理员权限或资源管理权限)。调用接口成功后,系统将返回资源规格的列表,包括规格ID、名称、CPU核数、内存大小、存储容 - [创建网络资源 - CreateNetwork](https://support.huaweicloud.com/api-modelarts/CreateNetwork.md): 创建网络资源接口用于在系统中创建新的网络资源。该接口适用于以下场景:当需要为业务扩展、资源规划或网络架构调整时,用户可通过此接口创建新的网络资源,如虚拟网络、子网或路由等。使用该接口的前提条件是用户具有管理员权限,并且系统中具备足够的资源支持新网络资源的创建。创建操作完成后,新的网络资源将被成功添加到系统中,并可用于后续的业务配置。若用户 - [查询网络资源列表 - ListNetworks](https://support.huaweicloud.com/api-modelarts/ListNetworks.md): 查询网络资源列表接口用于获取系统中已创建的网络资源信息。该接口适用于以下场景:当用户需要监控网络状态、进行资源规划、排查网络问题或进行审计时,可通过此接口查询系统中现有的网络资源列表。使用该接口的前提条件是用户具有相应的权限,并且系统中已存在网络资源。查询操作完成后,接口将返回网络资源列表,包含资源ID、类型、状态、创建时间等详细信息。若 - [查询网络资源 - ShowNetwork](https://support.huaweicloud.com/api-modelarts/ShowNetwork.md): 查询网络资源接口用于获取指定网络资源的详情信息。该接口适用于以下场景:当用户需要查看特定网络资源的详细配置、状态或属性时,可通过此接口查询指定网络资源的详细信息。使用该接口的前提条件是用户具有相应的权限,并且指定的网络资源已存在于系统中。查询操作完成后,接口将返回指定网络资源的详细信息,包括资源ID、类型、状态、配置参数等。若指定的网络资 - [删除网络资源 - DeleteNetwork](https://support.huaweicloud.com/api-modelarts/DeleteNetwork.md): 删除网络资源接口用于移除指定的网络资源。该接口适用于以下场景:当网络资源不再需要、配置错误或需要清理资源时,用户可通过此接口删除指定的网络资源。使用该接口的前提条件是网络资源已存在且用户具有管理员权限。删除操作完成后,指定的网络资源将被永久移除,相关配置和关联关系也将被清理。若指定的网络资源不存在、用户无权限操作或资源被其他资源依赖,接口 - [更新网络资源 - PatchNetwork](https://support.huaweicloud.com/api-modelarts/PatchNetwork.md): 更新网络资源接口用于修改指定网络资源的配置信息。该接口适用于以下场景:当需要调整网络资源的属性、修复配置错误或优化资源设置时,用户可通过此接口更新指定网络资源的详细信息。使用该接口的前提条件是网络资源已存在且用户具有管理员权限。更新操作完成后,指定网络资源的配置信息将被成功修改,系统将反映最新的资源状态和属性。若指定的网络资源不存在、用户 - [查询网络可用的IP - ShowNetworkAvailableIp](https://support.huaweicloud.com/api-modelarts/ShowNetworkAvailableIp.md): 查询网络可用的IP接口用于查找指定网络中未被占用的IP地址。该接口适用于以下场景:在网络规划、资源分配或故障排查时,用户需要快速获取可用的IP地址信息。使用该接口的前提条件是用户具有访问目标网络的权限,并且需要提供有效的网络范围(如子网掩码或IP段)。查询完成后,接口将返回指定网络中未被占用的IP地址列表,用户可以根据结果进行IP地址的分 - [查询OS的配置参数 - ShowOsConfig](https://support.huaweicloud.com/api-modelarts/ShowOsConfig.md): 查询OS的配置参数接口用于获取ModelArts OS服务的配置参数,如网络网段、用户资源配额等。该接口适用于以下场景:当需要了解当前ModelArts OS服务的网络配置、资源分配情况或进行系统管理时,用户可通过此接口查询相关的配置参数。使用该接口的前提条件是用户具有访问ModelArts OS服务的权限,且服务处于正常运行状态。查询操 - [查询插件模板 - ShowPluginTemplate](https://support.huaweicloud.com/api-modelarts/ShowPluginTemplate.md): 查询插件模板接口用于获取指定插件模板的详细信息。该接口适用于以下场景:当需要了解特定插件模板的配置、功能或使用方式时,用户可通过此接口查询插件模板的详细信息。使用该接口的前提条件是插件模板已存在且用户具有访问权限。查询操作完成后,用户将获得指定插件模板的详细信息,包括模板的配置参数、功能描述等,便于后续的插件开发或配置管理。若插件模板不存 - [查询插件模板列表 - ListPluginTemplates](https://support.huaweicloud.com/api-modelarts/ListPluginTemplates.md): 查询插件模板列表接口用于获取插件模板的基本信息列表。该接口适用于以下场景:当需要浏览或管理插件模板时,用户可通过此接口查询所有可用的插件模板信息,以便选择或进一步操作。使用该接口的前提条件是用户具有访问插件模板的权限,且插件模板服务处于正常运行状态。查询操作完成后,用户将获得插件模板的列表信息,包括模板名称、类型、版本等,便于后续的插件开 - [节点批量排水 - BatchDrainPoolNodes](https://support.huaweicloud.com/api-modelarts/BatchDrainPoolNodes.md): 节点批量排水接口用于集中停止指定节点的业务处理能力并释放相关资源。该接口适用于以下场景:当系统需进行紧急故障隔离、资源回收、版本升级或维护操作时,用户可通过此接口批量暂停目标节点的业务流量,确保操作期间服务稳定性。使用该接口的前提条件包括:目标节点已存在且用户具备管理员权限,节点需处于运行状态且未被锁定,资源池需满足排水后容量约束(如最小 - [查询资源池节点列表 - ListPoolNodes](https://support.huaweicloud.com/api-modelarts/ListPoolNodes.md): 查询资源池节点列表接口用于获取指定资源池中的节点信息列表。该接口适用于以下场景:当需要了解资源池中节点的分布、状态或资源使用情况时,用户可通过此接口查询资源池中的节点列表,以便进行资源监控、分配或管理。使用该接口的前提条件是资源池已创建且处于可用状态,且用户具有访问资源池的权限。查询操作完成后,用户将获得资源池中节点的详细信息,包括节点I - [批量删除节点 - BatchDeletePoolNodes](https://support.huaweicloud.com/api-modelarts/BatchDeletePoolNodes.md): 批量删除节点接口用于批量删除指定资源池中的节点。该接口适用于以下场景:当需要清理资源池中的冗余节点、重新分配资源或移除故障节点时,用户可通过此接口批量删除指定的节点。使用该接口的前提条件是资源池已创建且处于可用状态,用户具有删除节点的权限,且资源池中至少保留一个节点。删除操作完成后,指定的节点将被永久移除,资源池中剩余的节点将继续提供服务 - [批量更新节点 - BatchUpdatePoolNodes](https://support.huaweicloud.com/api-modelarts/BatchUpdatePoolNodes.md): 批量更新节点接口用于同时修改多个节点的配置或属性,支持批量操作时各节点独立执行更新流程。该接口适用于以下场景:当用户需统一升级节点软件版本、批量处理选中节点的资源标签、调整资源分配策略、应用安全补丁或同步配置变更时,可通过此接口批量更新目标节点,确保每个节点的更新过程互不影响。使用该接口的前提条件包括:目标节点已存在且用户具备管理员权限, - [批量对节点功能上锁 - BatchLockPoolNodes](https://support.huaweicloud.com/api-modelarts/BatchLockPoolNodes.md): 批量对节点功能上锁接口用于批量对指定节点的功能进行上锁操作,被上锁的功能在控制台将无法正常使用。该接口适用于以下场景:当需要临时禁用某些节点的功能以防止误操作、进行系统维护或测试时,用户可通过此接口批量对节点功能进行上锁。使用该接口的前提条件是节点功能已存在且用户具有管理员权限。上锁操作完成后,指定节点的功能将在控制台被禁用,无法进行相关 - [批量对节点功能解锁 - BatchUnlockPoolNodes](https://support.huaweicloud.com/api-modelarts/BatchUnlockPoolNodes.md): 批量对节点功能解锁接口用于批量解除指定节点功能的锁定状态,使被上锁的功能在控制台恢复正常可用状态。该接口适用于以下场景:当需要恢复被锁定的节点功能以正常使用、完成系统维护或测试后,用户可通过此接口批量对节点功能进行解锁。使用该接口的前提条件是节点功能已被上锁且用户具有管理员权限。解锁操作完成后,指定节点的功能将在控制台恢复正常,用户可以正 - [批量重启节点 - BatchRebootPoolNodes](https://support.huaweicloud.com/api-modelarts/BatchRebootPoolNodes.md): 批量重启节点接口用于批量重启指定资源池中的节点。该接口适用于以下场景:当需要对资源池中的节点进行系统更新、配置变更、故障恢复或维护操作时,用户可通过此接口批量重启指定的节点。使用该接口的前提条件是资源池已创建且处于可用状态,节点属于该资源池且处于运行状态,且用户具有重启节点的权限。重启操作完成后,指定的节点将被重新启动,资源池中的其他节点 - [重置节点 - BatchResetPoolNodes](https://support.huaweicloud.com/api-modelarts/BatchResetPoolNodes.md): 重置节点接口用于将指定节点恢复到初始状态,清除节点上的数据和配置。该接口适用于以下场景:当节点出现故障、配置错误、需要重新部署或进行系统恢复时,用户可通过此接口重置节点,使其恢复到出厂或初始状态。使用该接口的前提条件是节点已存在且用户具有管理员权限。重置操作完成后,节点上的所有数据和配置将被清除,节点将被重新启动并恢复到初始状态。若节点不 - [节点规格变更 - BatchResizePoolNodes](https://support.huaweicloud.com/api-modelarts/BatchResizePoolNodes.md): 节点规格变更接口用于调整指定节点的规格(如单实例节点规模(台)),例如将节点从8节点超节点扩容到16节点超节点。该接口适用于以下场景:当需要根据业务需求调整节点的资源容量、优化资源利用率或进行系统升级时,用户可通过此接口变更节点的规格。使用该接口的前提条件是节点已创建且处于可变更状态,目标规格在支持范围内,且用户具有管理员权限。规格变更完 - [批量迁移节点 - BatchMigratePoolNodes](https://support.huaweicloud.com/api-modelarts/BatchMigratePoolNodes.md): 批量迁移节点接口用于在资源池之间批量迁移节点,将节点从一个资源池迁移到另一个资源池。该接口适用于以下场景:当资源池的节点分布不均衡、需要进行集群维护或业务扩展时,用户可通过此接口将指定节点从一个资源池迁移到另一个资源池。使用该接口的前提条件是资源池中至少包含两个节点,且目标资源池具备足够的资源容量(如IP地址等)以接收迁移节点。若资源池只 - [批量为节点绑定逻辑子池 - BatchBindPoolNodes](https://support.huaweicloud.com/api-modelarts/BatchBindPoolNodes.md): 批量为节点绑定逻辑子池接口用于在物理专属池开启节点绑定功能时,对逻辑子池中的节点进行逻辑子池的换绑操作。该接口适用于以下场景:当需要重新分配资源、调整业务负载或优化资源使用效率时,用户可通过此接口将指定节点从当前逻辑子池迁移到另一个逻辑子池。使用该接口的前提条件是物理专属池已开启节点绑定功能,且目标逻辑子池已存在并具备足够的资源容量。绑定 - [查询资源池单个节点详情 - ShowPoolNode](https://support.huaweicloud.com/api-modelarts/ShowPoolNode.md): 查询资源池中的单个节点接口用于获取指定资源池内单个节点的详细信息。该接口适用于以下场景:当用户需要了解节点资源分配、详细信息时,可通过此接口获取节点的类型、状态、配置参数及关联服务等信息。使用该接口的前提条件是目标资源池已存在且用户具备查看权限,同时需提供有效的资源池标识符作为输入参数。接口调用后,系统将返回资源池中单个节点数据;若资源池 - [查询事件列表 - ListEvents](https://support.huaweicloud.com/api-modelarts/ListEvents.md): 查询事件列表接口用于获取系统中记录的事件信息。该接口适用于以下场景:当用户需要监控系统状态、排查问题或进行审计时,可通过此接口查询系统中发生的事件记录。使用该接口的前提条件是用户具有相应的权限,并且系统中已存在事件记录。查询操作完成后,接口将返回事件列表,包含事件ID、类型、时间、描述等信息。若用户无权限、事件记录不存在或查询参数有误,接 - [查询资源实时利用率 - ShowPoolRuntimeMetrics](https://support.huaweicloud.com/api-modelarts/ShowPoolRuntimeMetrics.md): 查询资源实时利用率接口用于获取当前项目下所有资源池的实时利用率信息。该接口适用于以下场景:当用户需要监控资源使用情况、进行资源优化、容量规划或故障排查时,可通过此接口查询资源池的实时利用率,包括CPU、内存、存储等资源的使用情况。使用该接口的前提条件是用户具有访问该项目的权限,并且资源池已存在且处于运行状态。查询操作完成后,接口将返回资源 - [查询资源池作业列表 - ListWorkloads](https://support.huaweicloud.com/api-modelarts/ListWorkloads.md): 查询专属资源池作业列表接口用于获取指定专属资源池中的作业信息列表。该接口适用于以下场景:当需要监控专属资源池的资源使用情况、查看作业状态或管理资源分配时,用户可通过此接口获取专属资源池中作业的详细信息。使用该接口的前提条件是专属资源池已存在且用户具有相应的权限(如管理员权限或资源管理权限)。调用接口成功后,系统将返回专属资源池中作业的列表 - [查询专属资源池作业统计信息 - ShowWorkloadStatistics](https://support.huaweicloud.com/api-modelarts/ShowWorkloadStatistics.md): 查询专属资源池作业统计信息接口用于获取指定专属资源池中作业的统计信息。该接口适用于以下场景:当需要了解专属资源池中作业的整体运行情况、资源使用效率或作业状态分布时,用户可通过此接口获取统计信息。使用该接口的前提条件是专属资源池已存在且用户具有相应的权限(如管理员权限或资源管理权限)。调用接口成功后,系统将返回专属资源池中作业的统计信息,包 - [批量创建资源池标签 - BatchCreatePoolTags](https://support.huaweicloud.com/api-modelarts/BatchCreatePoolTags.md): 批量创建资源池标签接口用于为指定资源池添加或更新多个标签信息。该接口适用于以下场景:当需要对资源池进行统一分类管理(如成本归属、环境标识)、批量配置元数据(如项目归属、负责人信息)或更新已有标签值时,管理员可通过此接口一次性操作多个标签。使用该接口的前提条件是目标资源池必须已存在且处于可管理状态,调用者需具备资源池标签管理权限,且提交的标 - [批量删除资源池标签 - BatchDeletePoolTags](https://support.huaweicloud.com/api-modelarts/BatchDeletePoolTags.md): 批量删除资源标签接口用于移除指定资源上的多个标签信息。该接口适用于以下场景:当需要清理冗余标签(如过期分类、无效元数据)、统一调整资源分类策略或因权限变更需批量移除标签时,管理员可通过此接口一次性删除多个标签。使用该接口的前提条件是目标资源必须已存在且处于可管理状态,调用者需具备资源标签管理权限,且待删除的标签必须已关联至该资源,系统标签 - [查询资源池的所有标签 - ListPoolTags](https://support.huaweicloud.com/api-modelarts/ListPoolTags.md): 查询资源池所有标签接口用于获取用户当前项目下资源池的所有标签信息,默认查询所有工作空间,但无权限的工作空间不会返回标签数据。该接口适用于以下场景:当需要管理、分类或统计资源池的标签信息时,用户可通过此接口获取资源池的标签数据。使用该接口的前提条件是用户具有访问资源池的权限且资源池已存在。调用接口成功后,系统将返回用户当前项目下所有可访问工 - [查询资源池上的标签 - ShowPoolTags](https://support.huaweicloud.com/api-modelarts/ShowPoolTags.md): 查询资源池的标签接口用于获取指定资源池的标签信息。该接口适用于以下场景:当需要查看、管理或统计特定资源池的标签信息时,用户可通过此接口获取资源池的标签数据。使用该接口的前提条件是资源池已存在且用户具有访问该资源池的权限。调用接口成功后,系统将返回指定资源池的标签信息,包括标签键和标签值。若资源池不存在、用户无权限访问或资源池未配置标签,接 - [查询OS的配额 - ShowOsQuota](https://support.huaweicloud.com/api-modelarts/ShowOsQuota.md): 查询OS配额接口用于获取ModelArts OS服务中部分资源的配额信息,如资源池配额、网络配额等。该接口适用于以下场景:当需要了解资源池或网络资源的使用限制、规划资源分配或监控资源使用情况时,用户可通过此接口获取相关配额信息。使用该接口的前提条件是ModelArts OS服务已部署且用户具有相应的权限(如管理员权限或资源管理权限)。调用 - [创建插件 - CreatePoolPlugin](https://support.huaweicloud.com/api-modelarts/CreatePoolPlugin.md): 创建插件实例接口用于在系统中创建一个新的插件实例。该接口适用于以下场景:当需要扩展系统功能、部署新的插件、更新现有插件配置或测试插件时,用户可通过此接口创建指定插件的实例。使用该接口的前提条件是插件已存在且用户具有管理员权限或插件管理权限。创建操作完成后,插件实例将被成功创建并处于可用状态,相关配置信息将被记录。若插件不存在、用户无权限操 - [查询插件列表 - ListPoolPlugins](https://support.huaweicloud.com/api-modelarts/ListPoolPlugins.md): 查询插件实例列表接口用于获取系统中已部署的插件实例信息。该接口适用于以下场景:当用户需要查看系统中已部署的插件实例、监控插件运行状态、管理插件配置或进行故障排查时,可通过此接口获取插件实例的详细信息。使用该接口的前提条件是用户具有查询权限且系统中已部署至少一个插件实例。调用该接口后,系统将返回所有插件实例的列表,包括插件名称、类型、状态、 - [查询节点配置模板 - ShowNodeConfigTemplate](https://support.huaweicloud.com/api-modelarts/ShowNodeConfigTemplate.md): 查询节点配置模板接口用于获取指定节点配置模板的详细信息。该接口适用于以下场景:当用户需要查看节点配置模板的内容、管理节点配置或进行相关操作时,可通过此接口获取指定节点配置模板的详细信息。使用该接口的前提条件是节点配置模板已存在且用户具有相应的访问权限。调用该接口后,系统将返回指定节点配置模板的详细信息,包括模板名称、版本、配置参数及描述等 - [查询资源池节点自定义配置模板 - ShowPoolNodeConfigTemplate](https://support.huaweicloud.com/api-modelarts/ShowPoolNodeConfigTemplate.md): 查询资源池节点自定义配置模板接口用于获取节点配置模板的结构定义与参数规范。该接口适用于以下场景:当需要了解节点自定义配置的模板结构(如参数字段、校验规则、示例值)、验证配置模板是否符合规范或进行配置模板选型时,用户可通过此接口获取模板的元数据(如参数说明、类型限制、依赖关系等)。使用该接口的前提条件是目标配置模板必须已注册至系统且处于可访 - [查询节点池列表 - ListNodePools](https://support.huaweicloud.com/api-modelarts/ListNodePools.md): 查询节点池列表接口用于获取指定节点池的列表信息。该接口适用于以下场景:当需要查看节点池的配置、状态或管理节点池资源时,用户可通过此接口获取节点池的详细信息。使用该接口的前提条件是节点池已存在且用户具有管理员权限。调用接口成功后,系统将返回节点池的列表,包括节点池ID、名称、节点数量、状态等详细信息。若节点池不存在、用户无权限操作或节点池当 - [创建节点池 - CreateNodePool](https://support.huaweicloud.com/api-modelarts/CreateNodePool.md): 创建节点池接口用于创建新的节点池。该接口适用于以下场景:当需要扩展计算资源、优化资源分配或部署新的服务时,用户可通过此接口创建指定配置的节点池。使用该接口的前提条件是用户具有管理员权限且节点池的配置参数(如节点数量、规格、网络配置等)已正确设置。创建操作完成后,节点池将被成功创建并处于可用状态,相关节点信息将被记录。若用户无权限操作、配置 - [查询指定节点池详情 - ShowNodePool](https://support.huaweicloud.com/api-modelarts/ShowNodePool.md): 查询指定节点池详情接口用于获取指定节点池的详细信息。该接口适用于以下场景:当需要查看节点池的配置、状态、资源使用情况或管理节点池时,用户可通过此接口获取节点池的详细信息。使用该接口的前提条件是节点池已存在且用户具有访问该节点池的权限。调用接口成功后,系统将返回节点池的详细信息,包括节点池ID、名称、节点数量、状态、创建时间、配置参数等。若 - [更新节点池 - PatchNodePool](https://support.huaweicloud.com/api-modelarts/PatchNodePool.md): 更新节点池接口用于修改指定节点池的配置信息。该接口适用于以下场景:当需要扩展节点池容量、调整节点规格、优化资源分配或修复节点池配置时,用户可通过此接口更新节点池的相关信息。使用该接口的前提条件是节点池已存在且用户具有管理员权限。更新操作完成后,节点池的配置将被更新,包括节点数量、规格、网络配置等参数。若节点池不存在、用户无权限操作或配置参 - [删除节点池 - DeleteNodePool](https://support.huaweicloud.com/api-modelarts/DeleteNodePool.md): 删除节点池接口用于移除已创建的节点池,包周期资源池不支持。该接口适用于以下场景:当节点池完成任务、配置错误或需要清理资源时,用户可通过此接口删除指定的节点池。使用该接口的前提条件是节点池已存在且用户具有管理员权限。删除操作完成后,节点池将被永久移除,相关资源和配置也将被清理。若节点池不存在、用户无权限操作或节点池处于不可删除状态(如包周期 - [查询节点池的节点列表 - ListNodePoolNodes](https://support.huaweicloud.com/api-modelarts/ListNodePoolNodes.md): 查询节点池的节点列表接口用于获取指定节点池中所有节点的详细信息。该接口适用于以下场景:当需要查看节点池的节点状态、资源使用情况或管理节点资源时,用户可通过此接口获取节点池中节点的详细信息。使用该接口的前提条件是节点池已存在且用户具有访问该节点池的权限。调用接口成功后,系统将返回节点池中所有节点的列表,包括节点ID、名称、状态、IP地址、资 - [查询订单详情 - ShowOrder](https://support.huaweicloud.com/api-modelarts/ShowOrder.md): 查询订单详情接口用于获取指定订单的详细信息。该接口适用于以下场景:当需要查看订单的状态、金额、商品信息或处理订单相关问题时,用户可通过此接口获取订单的详细数据。使用该接口的前提条件是订单已存在且用户具有访问该订单的权限。调用接口成功后,系统将返回订单的详细信息,包括订单号、商品列表、金额、支付状态、下单时间等。若订单不存在、用户无权限访问 - [计划事件授权 - AcceptScheduledEvent](https://support.huaweicloud.com/api-modelarts/AcceptScheduledEvent.md): 计划事件授权接口用于为指定的计划事件分配或调整权限。该接口适用于以下场景:当创建新的计划事件、调整现有计划事件的权限设置或变更权限分配时,用户可通过此接口为指定的计划事件授予或修改权限。使用该接口的前提条件是计划事件已存在且用户具有管理员权限。授权操作完成后,计划事件的权限设置将被更新,相关变更将被记录以便审计。若计划事件不存在、用户无权 - [查询计划事件列表 - ListScheduledEvents](https://support.huaweicloud.com/api-modelarts/ListScheduledEvents.md): 查询计划事件列表信息。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果 - [查询任务列表 - ListJobs](https://support.huaweicloud.com/api-modelarts/ListJobs.md): 查询任务列表接口用于获取当前用户下的任务列表。该接口适用于以下场景:当需要查看任务状态、管理任务进度或统计任务数量时,用户可通过此接口获取当前用户下所有任务的详细信息。使用该接口的前提条件是用户已登录系统且具有查看任务的权限。调用接口成功后,系统将返回当前用户下的任务列表,包括任务ID、名称、状态、创建时间等信息。若用户未登录、无权限访问 - [创建Lite Server - CreateDevServer](https://support.huaweicloud.com/api-modelarts/CreateDevServer.md): 创建Lite Server接口用于创建LiteServer弹性云服务器、裸金属服务器及超节点服务器。该接口适用于以下场景:用户需要根据业务需求快速部署和配置不同类型的服务器资源。使用该接口的前提条件是用户已登录且具有创建Lite Server的权限,并且需要提供服务器类型、规格、网络配置等必要参数。创建操作完成后,系统将返回新创建的Lit - [查询用户所有Lite Server实例列表 - ListDevServers](https://support.huaweicloud.com/api-modelarts/ListDevServers.md): 查询用户所有Lite Server实例列表接口用于获取用户名下所有Lite Server实例的详细信息。该接口适用于以下场景:用户需要查看其所有Lite Server实例的状态、配置等信息,以便进行资源管理和监控。使用该接口的前提条件是用户已登录且具有查看Lite Server实例的权限。调用此接口后,系统将返回用户名下所有Lite Se - [查询Lite Server实例详情 - ShowDevServer](https://support.huaweicloud.com/api-modelarts/ShowDevServer.md): 查询Lite Server实例详情接口用于获取指定Lite Server实例的详细信息。该接口适用于以下场景:用户需要查看特定Lite Server实例的配置、状态、网络信息等详细数据,以便进行故障排查、资源管理和监控。使用该接口的前提条件是用户已登录且具有查看Lite Server实例的权限,并且需要提供有效的实例ID。查询操作完成后, - [修改Lite Server实例名称 - UpdateDevServer](https://support.huaweicloud.com/api-modelarts/UpdateDevServer.md): 修改DevServer实例名称接口用于更改已创建的DevServer实例的名称。该接口适用于以下场景:当用户需要对DevServer实例进行重命名以更好地反映实例的功能或用途时,或者在实例名称不再符合当前项目命名规范时进行更新。使用该接口的前提条件是DevServer实例已存在且用户具有对该实例的管理权限。修改操作完成后,实例的新名称将立 - [停止Lite Server实例 - StopDevServer](https://support.huaweicloud.com/api-modelarts/StopDevServer.md): 停止Lite Server实例接口用于停止正在运行的Lite Server实例。该接口适用于以下场景:当用户需要停止Lite Server实例,以节省资源或进行维护时,可以通过此接口停止指定的Lite Server实例。使用该接口的前提条件是Lite Server实例已创建且处于运行状态,用户具有停止实例的权限。若Lite Server实 - [启动Lite Server实例 - StartDevServer](https://support.huaweicloud.com/api-modelarts/StartDevServer.md): 启动Lite Server实例接口用于启动已创建但未运行的Lite Server实例。该接口适用于以下场景:当用户需要开始使用Lite Server实例进行开发或测试时,可以通过此接口启动指定的Lite Server实例。使用该接口的前提条件是Lite Server实例已创建且处于停止状态,用户具有启动实例的权限。若Lite Server - [删除Lite Server实例 - DeleteDevServer](https://support.huaweicloud.com/api-modelarts/DeleteDevServer.md): 删除Lite Server实例接口用于移除已创建的Lite Server实例。该接口适用于以下场景:当Lite Server按需实例不再需要使用时或者创建失败的实例以及处于ERROR状态时,用户可通过此接口删除指定的Lite Server实例。使用该接口的前提条件是Lite Server实例已存在且用户具有管理员权限。删除操作完成后,Li - [创建Hyper Cluster - CreateHyperCluster](https://support.huaweicloud.com/api-modelarts/CreateHyperCluster.md): 创建Hyper Cluster接口用于在系统中创建一个新的Hyper Cluster。该接口适用于以下场景:当用户需要使用超节点网络时,可以通过此接口创建Hyper Cluster。使用该接口的前提条件是用户已登录并具有创建Hyper Cluster的权限,且系统中已配置了必要的资源。创建操作完成后,将生成一个新的超节点网络,并返回超节点 - [查询Hyper Cluster详情列表 - ListHyperCluster](https://support.huaweicloud.com/api-modelarts/ListHyperCluster.md): 查询Hyper Cluster详情列表接口用于获取所有Hyper Cluster的详细信息。该接口适用于以下场景:当用户需要了解系统中所有超节点网络的配置和状态时,可以通过此接口获取相关信息。使用该接口的前提条件是用户已登录并具有查询Hyper Cluster详情的权限。查询操作完成后,接口将返回所有超节点网络的详细信息,包括ID、名称、 - [查询Hyper Cluster实例详情 - GetHyperCluster](https://support.huaweicloud.com/api-modelarts/GetHyperCluster.md): 查询Hyper Cluster实例详情接口用于获取指定Hyper Cluster实例的详细信息。该接口适用于以下场景:当用户需要了解某个超节点网络的具体配置和状态,以便进行管理和监控时,可以通过此接口获取相关信息。使用该接口的前提条件是用户已登录并具有查询Hyper Cluster详情的权限,且指定的超节点网络已存在。查询操作完成后,接口 - [删除Hyper Cluster实例 - DeleteHyperCluster](https://support.huaweicloud.com/api-modelarts/DeleteHyperCluster.md): 删除Hyper Cluster实例接口用于移除已创建的Hyper Cluster。该接口适用于以下场景:当超节点网络配置错误或需要清理资源时,用户可通过此接口删除指定的超节点网络。使用该接口的前提条件是Hyper Cluster实例已存在且用户具有管理员权限。删除操作完成后,超节点网络将被永久移除,相关资源和配置也将被清理。若Hyper - [实时同步用户指定Lite Server实例状态 - SyncDevServers](https://support.huaweicloud.com/api-modelarts/SyncDevServers.md): 实时同步用户Lite Server实例状态接口用于实时获取并同步用户Lite Server实例的当前状态。该接口适用于以下场景:用户需要实时监控其Lite Server实例的运行状态,确保实例正常运行或及时发现并处理异常情况。使用该接口的前提条件是用户已登录并具有相应的权限,且Lite Server实例已创建并处于运行状态。接口调用成功后 - [创建Lite Server超节点标签 - CreateHyperinstanceTags](https://support.huaweicloud.com/api-modelarts/CreateHyperinstanceTags.md): 创建Lite Server超节点标签接口用于为Lite Server超节点添加自定义标签。该接口适用于以下场景:当用户需要对Lite Server超节点进行分类管理或标记特定信息时,可以通过此接口为指定的超节点创建标签。使用该接口的前提条件是Lite Server超节点已存在,用户具有创建标签的权限。创建操作完成后,标签将被成功添加到指定 - [删除Lite Server超节点标签 - DeleteHyperinstanceTags](https://support.huaweicloud.com/api-modelarts/DeleteHyperinstanceTags.md): 删除Lite Server超节点标签接口用于移除已创建的Lite Server超节点标签。该接口适用于以下场景:当用户需要清理不再需要的标签或修正标签错误时,可以通过此接口删除指定的超节点标签。使用该接口的前提条件是Lite Server超节点已存在,且该超节点上已存在要删除的标签,用户具有删除标签的权限。删除操作完成后,指定的标签将从超 - [查询Lite Server超节点标签 - QueryHyperinstanceTags](https://support.huaweicloud.com/api-modelarts/QueryHyperinstanceTags.md): 查询Lite Server超节点标签接口用于获取Lite Server超节点上的所有标签信息。该接口适用于以下场景:当用户需要查看或管理Lite Server超节点的标签时,可以通过此接口查询指定超节点上的所有标签。使用该接口的前提条件是Lite Server超节点已存在,用户具有查询标签的权限。查询操作完成后,接口将返回超节点上的所有标 - [重装Lite Server服务器操作系统镜像 - ReinstallDevServerOS](https://support.huaweicloud.com/api-modelarts/ReinstallDevServerOS.md): 重装Lite Server服务器操作系统镜像接口用于重新安装Lite Server服务器的操作系统镜像。该接口适用于以下场景:当用户需要更新操作系统版本、修复系统故障或重新配置系统环境时,可以通过此接口重装指定的Lite Server服务器操作系统镜像。使用该接口的前提条件是Lite Server服务器已存在且处于停止状态,用户具有重装操 - [切换Lite Server服务器操作系统镜像 - ChangeDevServerOS](https://support.huaweicloud.com/api-modelarts/ChangeDevServerOS.md): 切换Lite Server服务器操作系统镜像接口用于更换Lite Server服务器当前使用的操作系统镜像。该接口适用于以下场景:当用户需要更换操作系统以适应不同的开发或测试需求时,可以通过此接口切换指定的Lite Server服务器操作系统镜像。使用该接口的前提条件是Lite Server服务器已存在且处于停止状态,用户具有切换操作系统 - [切换Lite Server超节点服务器操作系统镜像 - ChangeHyperinstanceOS](https://support.huaweicloud.com/api-modelarts/ChangeHyperinstanceOS.md): 切换Lite Server超节点服务器操作系统镜像接口用于更换Lite Server超节点服务器当前使用的操作系统镜像。该接口适用于以下场景:当用户需要更换操作系统以适应不同的开发或测试需求时,可以通过此接口切换指定的Lite Server超节点服务器操作系统镜像。使用该接口的前提条件是Lite Server超节点服务器已存在且处于停止状 - [查询用户所有超节点实例详情 - ListHyperinstances](https://support.huaweicloud.com/api-modelarts/ListHyperinstances.md): 查询用户所有超节点实例详情接口用于获取用户所有Lite Server超节点实例的详细信息。该接口适用于以下场景:当用户需要查看其所有超节点实例的配置、状态和使用情况时,可以通过此接口获取相关信息。使用该接口的前提条件是用户已登录并具有查询超节点实例的权限。查询操作完成后,接口将返回所有超节点实例的详细信息,包括实例ID、操作系统、运行状态 - [查询指定超节点实例详情 - GetHyperinstance](https://support.huaweicloud.com/api-modelarts/GetHyperinstance.md): 查询指定超节点实例详情接口用于获取特定Lite Server超节点实例的详细信息。该接口适用于以下场景:当用户需要查看某个具体超节点实例的配置、状态和使用情况时,可以通过此接口获取相关信息。使用该接口的前提条件是用户已登录并具有查询超节点实例的权限,且指定的超节点实例已存在。查询操作完成后,接口将返回指定超节点实例的详细信息,包括实例ID - [删除Lite Server超节点实例 - DeleteHyperinstance](https://support.huaweicloud.com/api-modelarts/DeleteHyperinstance.md): 删除Lite Server超节点实例接口用于删除按需超节点实例同时移除处于ERROR状态的Lite Server超节点实例。该接口适用于以下场景:当超节点实例因创建失败、或其他原因进入ERROR状态;按需超节点实例,用户可以通过此接口删除指定的超节点实例。使用该接口的前提条件是用户已登录并具有删除超节点实例的权限,且指定的超节点实例是按需 - [重启Lite Server实例 - RebootDevServer](https://support.huaweicloud.com/api-modelarts/RebootDevServer.md): 重启Lite Server实例接口用于重启正在运行的Lite Server实例。该接口适用于以下场景:当用户需要重启实例以应用配置更改、解决运行问题或进行系统维护时,可以通过此接口重启指定的Lite Server实例。使用该接口的前提条件是Lite Server实例已创建且处于运行状态,用户具有重启实例的权限。重启操作完成后,Lite S - [启动Lite Server超节点服务器 - StartHyperinstance](https://support.huaweicloud.com/api-modelarts/StartHyperinstance.md): 启动Lite Server超节点服务器接口用于启动已创建但未运行的Lite Server超节点服务器。该接口适用于以下场景:当用户需要开始使用Lite Server超节点服务器进行开发或测试时,可以通过此接口启动指定的超节点服务器。使用该接口的前提条件是Lite Server超节点服务器已创建且处于停止状态,用户具有启动超节点服务器的权限 - [停止Lite Server超节点服务器 - StopHyperinstance](https://support.huaweicloud.com/api-modelarts/StopHyperinstance.md): 停止Lite Server超节点服务器接口用于停止正在运行的Lite Server超节点服务器。该接口适用于以下场景:当用户需要暂停使用Lite Server超节点服务器,以节省资源或进行维护时,可以通过此接口停止指定的超节点服务器。使用该接口的前提条件是Lite Server超节点服务器已创建且处于运行状态或者停止失败状态,用户具有停止 - [Lite Server服务器挂载磁盘 - AttachDevServerVolume](https://support.huaweicloud.com/api-modelarts/AttachDevServerVolume.md): Lite Server服务器挂载磁盘接口用于将额外的磁盘挂载到Lite Server服务器上。该接口适用于以下场景:当用户需要扩展Lite Server服务器的存储空间以满足更大的数据存储需求时,可以通过此接口将指定的磁盘挂载到服务器上。使用该接口的前提条件是Lite Server服务器已创建且处于运行状态、或者停止状态,用户具有挂载磁盘 - [Lite Server服务器卸载磁盘 - DetachDevServerVolume](https://support.huaweicloud.com/api-modelarts/DetachDevServerVolume.md): Lite Server服务器卸载磁盘接口用于从Lite Server服务器上卸载已挂载的磁盘。该接口适用于以下场景:当用户需要释放存储资源或重新分配磁盘时,可以通过此接口卸载指定的磁盘。使用该接口的前提条件是Lite Server服务器已创建且处于运行状态、或者停止状态,用户具有卸载磁盘的权限,且指定的磁盘已挂载到服务器上。卸载操作完成后 - [Lite Server服务器绑定EIP - BindDevServerPublicIP](https://support.huaweicloud.com/api-modelarts/BindDevServerPublicIP.md): Lite Server服务器绑定的EIP接口用于将弹性公网IP(EIP)绑定到Lite Server服务器上。该接口适用于以下场景:当用户需要为Lite Server服务器分配一个固定的公网IP地址,以便从外部网络访问服务器时,可以通过此接口将指定的EIP绑定到服务器上。使用该接口的前提条件是Lite Server服务器已创建且处于运行状 - [查询已绑定的EIP - ListDevServerPublicIP](https://support.huaweicloud.com/api-modelarts/ListDevServerPublicIP.md): 查询已绑定的EIP接口用于获取已绑定到Lite Server服务器上的弹性公网IP(EIP)信息。该接口适用于以下场景:当用户需要查看Lite Server服务器上已绑定的EIP及其详细信息时,可以通过此接口获取相关信息。使用该接口的前提条件是用户已登录并具有查询EIP的权限,且指定的Lite Server服务器已存在。查询操作完成后,接 - [查询规格列表 - ListDevServerFlavors](https://support.huaweicloud.com/api-modelarts/ListDevServerFlavors.md): 查询规格列表接口用于获取系统中所有可用的资源规格信息。该接口适用于以下场景:当用户需要了解可用的资源规格,以便在创建或调整Lite Server实例时选择合适的配置时,可以通过此接口获取规格列表。使用该接口的前提条件是用户已登录并具有查询规格的权限。查询操作完成后,接口将返回所有可用的资源规格信息,包括规格ID、CPU、内存、存储等详细配 - [创建RoCE网络 - CreateRoceNetwork](https://support.huaweicloud.com/api-modelarts/CreateRoceNetwork.md): 创建RoCE网络接口用于在系统中创建一个新的RoCE网络。该接口适用于以下场景:当用户需要为高性能计算或低延迟应用创建专用的RoCE网络时,可以通过此接口创建并配置RoCE网络。使用该接口的前提条件是用户已登录并具有创建RoCE网络的权限,且系统中已配置了必要的网络资源。创建操作完成后,将生成一个新的RoCE网络,并返回网络的详细信息,包 - [查询租户Lite Server列表 - ListAllDevServers](https://support.huaweicloud.com/api-modelarts/ListAllDevServers.md): 查询租户Lite Server列表接口用于获取指定租户的所有Lite Server实例信息。该接口适用于以下场景:当用户需要查看其租户下所有Lite Server实例的详细信息,以便进行管理和监控时,可以通过此接口获取相关信息。使用该接口的前提条件是用户已登录并具有查询租户Lite Server列表的权限。查询操作完成后,接口将返回租户下 - [查询Lite Server镜像详情 - GetDevServerImage](https://support.huaweicloud.com/api-modelarts/GetDevServerImage.md): 查询Lite Server镜像详情接口用于获取指定Lite Server镜像的详细信息。该接口适用于以下场景:当用户需要了解某个Lite Server镜像的具体配置和属性,以便在创建或调整Lite Server实例时选择合适的镜像时,可以通过此接口获取相关信息。使用该接口的前提条件是用户已登录并具有查询镜像详情的权限,且指定的镜像已存在。 - [查询Lite Server镜像列表 - ListDevServerImages](https://support.huaweicloud.com/api-modelarts/ListDevServerImages.md): 查询Lite Server镜像列表接口用于获取系统中所有可用的Lite Server镜像信息。该接口适用于以下场景:当用户需要了解可用的Lite Server镜像,以便在创建或调整Lite Server实例时选择合适的镜像时,可以通过此接口获取镜像列表。使用该接口的前提条件是用户已登录并具有查询镜像列表的权限。查询操作完成后,接口将返回所 - [查询租户Hyperinstance列表 - ListAllHyperinstances](https://support.huaweicloud.com/api-modelarts/ListAllHyperinstances.md): 查询租户Hyperinstance列表接口用于获取指定租户的所有Hyperinstance实例信息。该接口适用于以下场景:当用户需要查看其租户下所有Hyperinstance实例的详细信息,以便进行管理和监控时,可以通过此接口获取相关信息。使用该接口的前提条件是用户已登录并具有查询租户Hyperinstance列表的权限。查询操作完成后, - [扩容Lite Server超节点 - ScaleUpHyperinstance](https://support.huaweicloud.com/api-modelarts/ScaleUpHyperinstance.md): 扩容Lite Server超节点接口用于增加Lite Server超节点的资源容量。该接口适用于以下场景:当用户需要提升Lite Server超节点的性能,以支持更多的负载或更大的数据处理需求时,可以通过此接口进行扩容。使用该接口的前提条件是用户已登录并具有扩容超节点的权限,且指定的超节点已存在且处于运行状态。扩容操作完成后,超节点的资源 - [缩容Lite Server超节点 - ScaleDownHyperinstance](https://support.huaweicloud.com/api-modelarts/ScaleDownHyperinstance.md): 缩容Lite Server超节点接口用于减少Lite Server超节点的资源容量。该接口适用于以下场景:当用户需要降低Lite Server超节点的资源使用,以节省成本或优化资源分配时,可以通过此接口进行缩容。使用该接口的前提条件是用户已登录并具有缩容超节点的权限,且指定的超节点已存在且处于运行状态。缩容操作完成后,超节点的资源容量将根 - [查询Operation详情 - GetDevServerOperation](https://support.huaweicloud.com/api-modelarts/GetDevServerOperation.md): 查询Operation详情接口用于获取指定Operation的详细信息。该接口适用于以下场景:当用户需要了解某个Operation的具体执行情况和状态,以便进行故障排查或操作审计时,可以通过此接口获取相关信息。使用该接口的前提条件是用户已登录并具有查询Operation详情的权限,且指定的Operation已存在。查询操作完成后,接口将返 - [查询Lite Server超节点扩缩容支持规格列表及容量测算 - GetScaleEvaluationsDevServer](https://support.huaweicloud.com/api-modelarts/GetScaleEvaluationsDevServer.md): 查询Lite Server超节点扩缩容支持规格列表及容量测算接口用于获取Lite Server超节点支持的扩缩容规格列表,并进行容量测算。该接口适用于以下场景:当用户需要了解Lite Server超节点支持的扩缩容选项,以便在调整超节点资源时选择合适的规格,并评估扩缩容后的资源需求时,可以通过此接口获取相关信息。使用该接口的前提条件是用户 - [查询超节点hyperinstance-clusters逻辑容量测算结果 - ListHyperinstanceClustersCapacity](https://support.huaweicloud.com/api-modelarts/ListHyperinstanceClustersCapacity.md): 查询超节点hyperinstance-clusters逻辑容量测算结果接口用于获取指定超节点集群的逻辑容量测算结果。该接口适用于以下场景:当用户需要了解超节点集群的资源使用情况和容量规划,以便进行资源管理和优化时,可以通过此接口获取逻辑容量测算结果。使用该接口的前提条件是用户已登录并具有查询超节点集群逻辑容量的权限,且指定的超节点集群已存 - [查询实例的Tor信息 - GetTopologies](https://support.huaweicloud.com/api-modelarts/GetTopologies.md): 查询实例的Tor信息接口用于获取指定实例的Top-of-Rack(Tor)交换机相关信息。该接口适用于以下场景:当用户需要了解实例连接的Tor交换机的详细信息,以便进行网络配置时,可以通过此接口获取相关信息。使用该接口的前提条件是用户已登录并具有查询实例Tor信息的权限,且指定的实例已存在。查询操作完成后,接口将返回指定实例的Tor信息。 - [批量操作Lite Server实例 - BatchDevServersAction](https://support.huaweicloud.com/api-modelarts/BatchDevServersAction.md): 批量操作Lite Server实例接口用于对多个Lite Server实例进行统一操作,如启动、停止、重启或删除等。该接口适用于以下场景:当需要对多个Lite Server实例进行相同的操作,例如在维护期间批量停止实例、更新配置后批量重启实例或清理不再需要的实例时,用户可通过此接口高效地完成批量操作。使用该接口的前提条件是目标Lite S - [查询Lite Server Job详情 - GetDevServerJob](https://support.huaweicloud.com/api-modelarts/GetDevServerJob.md): 查询Lite Server Job详情接口用于获取指定Lite Server Job的详细信息。该接口适用于以下场景:当用户需要查看某个Lite Server Job的执行状态、配置参数、日志信息等详细数据时,可以通过此接口获取相关信息。使用该接口的前提条件是目标Lite Server Job已存在且用户具有查看权限。查询操作完成后,接口 - [查询Lite Server Job列表 - ListDevServerJobs](https://support.huaweicloud.com/api-modelarts/ListDevServerJobs.md): 查询Lite Server Job列表接口用于获取Lite Server Job的列表信息,并支持按照状态、ID等相关字段进行过滤。该接口适用于以下场景:当用户需要查看多个Lite Server Job的概要信息,例如在监控作业状态、排查问题或进行日常管理时,可以通过此接口获取符合过滤条件的Job列表。使用该接口的前提条件是用户具有查看权 - [批量删除Lite Server Job - DeleteDevServerJobs](https://support.huaweicloud.com/api-modelarts/DeleteDevServerJobs.md): 批量删除Lite Server Job接口用于批量移除已创建的Lite Server Job。该接口适用于以下场景:当多个Lite Server Job已完成、配置错误或需要清理资源时,用户可以通过此接口批量删除指定的Lite Server Job。使用该接口的前提条件是目标Lite Server Job已存在且用户具有管理员权限。删除操 - [创建Lite Server任务 - CreateDevServerJob](https://support.huaweicloud.com/api-modelarts/CreateDevServerJob.md): 创建Lite Server任务接口用于在Lite Server上创建新的任务。该接口适用于以下场景:当用户需要在Lite Server上启动新的开发、测试或部署任务时,可以通过此接口创建并配置任务。使用该接口的前提条件是用户具有创建任务的权限,并且提供的任务配置参数符合要求。创建操作完成后,新的Lite Server任务将被成功创建,并返 - [获取Lite Server Job模板列表 - ListDevServerJobTemplates](https://support.huaweicloud.com/api-modelarts/ListDevServerJobTemplates.md): 获取Lite Server Job模板列表接口用于获取可用的Lite Server Job模板列表。该接口适用于以下场景:当用户需要查看可用的Job模板,以便选择合适的模板来创建新的Lite Server任务时,可以通过此接口获取模板列表。查询操作完成后,接口将返回所有可用的Lite Server Job模板列表,包括模板ID、名称、描述 - [获取Lite Server Job模板详情 - GetDevServerJobTemplate](https://support.huaweicloud.com/api-modelarts/GetDevServerJobTemplate.md): 获取Lite Server Job模板详情接口用于获取指定Lite Server Job模板的详细信息。该接口适用于以下场景:当用户需要查看某个特定Job模板的详细配置,以便了解其参数设置、使用说明等信息时,可以通过此接口获取模板详情。查询操作完成后,接口将返回指定模板的详细信息,包括模板ID、名称、描述、配置参数等。若目标模板不存在,接 - [Lite Server服务器挂载网卡 - AttachDevServerPort](https://support.huaweicloud.com/api-modelarts/AttachDevServerPort.md): Lite Server服务器挂载网卡仅支持超节点相关资源。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权, - [Lite Server服务器卸载网卡 - DetachDevServerPort](https://support.huaweicloud.com/api-modelarts/DetachDevServerPort.md): Lite Server服务器卸载网卡接口用于从服务器中移除指定的网络接口卡。该接口适用于以下场景:当服务器需要进行硬件维护、资源回收或网络配置调整时,用户可通过此接口卸载不再使用的网卡设备。使用该接口的前提条件是目标网卡已正确安装并处于可操作状态,且用户具有系统管理员权限。卸载操作完成后,网卡将从服务器配置中移除,相关驱动和网络参数也将被 - [获取Lite Server 部署服务详情 - GetDevServerJobService](https://support.huaweicloud.com/api-modelarts/GetDevServerJobService.md): 根据服务id获取Lite Server部署服务详情。该接口适用于以下场景:当用户需要查看部署服务详情,以便查看已部署服务的状态、api等信息时,可以通过此接口获取服务详情。使用该接口的前提条件是用户具有查看服务的权限。查询操作完成后,接口将返回此部署服务的详细信息,包括名称、状态、描述、所用模型、实例详情等信息。若用户无权限操作或无相应i - [查询超节点Operation详情 - GetHyperinstanceOperation](https://support.huaweicloud.com/api-modelarts/GetHyperinstanceOperation.md): 查询Operation详情接口用于获取指定Operation的详细信息。该接口适用于以下场景:当用户需要了解某个Operation的具体执行情况和状态,以便进行故障排查或操作审计时,可以通过此接口获取相关信息。使用该接口的前提条件是用户已登录并具有查询Operation详情的权限,且指定的Operation已存在。查询操作完成后,接口将返 - [配置授权 - CreateAuthorization](https://support.huaweicloud.com/api-modelarts/CreateAuthorization.md): 配置授权接口用于配置ModelArts的授权。该接口适用于以下场景:当需要为IAM子用户设置访问ModelArts的权限时,管理员可通过此接口配置授权。使用该接口的前提条件是管理员具备IAM系统的Security Administrator权限,并且需要为子用户设置访问密钥。配置完成后,子用户将被授予访问ModelArts资源的权限,从而 - [查看授权列表 - GetAuthorizations](https://support.huaweicloud.com/api-modelarts/GetAuthorizations.md): 查看授权列表接口用于查看授权信息。该接口适用于以下场景:当用户需要了解当前的授权情况、审核权限分配或管理权限时,可通过此接口查看授权列表。使用该接口的前提条件是用户具备查看授权的权限。查看操作完成后,将返回授权列表,包括被授权的资源、授权类型以及授权内容等信息。若用户无权限查看或授权列表不存在,接口将返回相应的错误信息。您可以在API E - [删除授权 - DeleteAuthorizations](https://support.huaweicloud.com/api-modelarts/DeleteAuthorizations.md): 删除授权接口用于删除指定用户的授权或删除全量用户的授权。该接口适用于以下场景:当需要撤销特定用户的访问权限或在系统维护时清理所有用户的授权时,管理员可通过此接口删除指定用户的授权或全量用户的授权。使用该接口的前提条件是管理员具备删除授权的权限,并且需要指定要删除授权的用户或选择删除全量用户的授权。删除操作完成后,指定用户的授权将被移除,或 - [创建ModelArts委托 - CreateModelArtsAgency](https://support.huaweicloud.com/api-modelarts/CreateModelArtsAgency.md): 创建ModelArts委托接口用于创建包含OBS、SWR、IEF等依赖服务的ModelArts委托。该接口适用于以下场景:当需要配置ModelArts访问OBS、SWR、IEF等服务的权限时,用户可通过此接口创建委托。使用该接口的前提条件是用户具备创建委托的权限,并且需要在IAM系统中具备相应的权限。创建完成后,ModelArts将被授权 - [策略及授权项说明](https://support.huaweicloud.com/api-modelarts/modelarts_03_0146.md): 如果您需要对您所拥有的ModelArts进行精细的权限管理,您可以使用统一身份认证服务(Identity and Access Management,简称IAM),如果华为云账号已经能满足您的要求,不需要创建独立的IAM用户,您可以跳过本章节,不影响您使用ModelArts服务的其它功能。默认情况下,新建的IAM用户没有任何权限,您需要将 - [授权管理权限](https://support.huaweicloud.com/api-modelarts/modelarts_03_0167.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [工作空间管理权限](https://support.huaweicloud.com/api-modelarts/modelarts_03_0166.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [开发环境权限](https://support.huaweicloud.com/api-modelarts/modelarts_03_0365.md): IAM新版控制台:提供基于IAM5.0版本的系统身份策略。用户可以直接在IAM服务新版控制台进行场景级授权配置。IAM新版控制台授权管理操作场景的授权策略名称描述类型ModelArtsNotebookAllPolicyModelArts服务"模型开发-Notebook"的所有策略(读写)系统身份策略ModelArtsNotebookRea - [Workflow权限](https://support.huaweicloud.com/api-modelarts/modelarts_03_0363.md): 如果您需要使用管理控制台workflow的相关功能并进行权限管理,可参照如下表格进行操作。 - [训练作业权限](https://support.huaweicloud.com/api-modelarts/modelarts_03_0364.md): 如果您需要使用管理控制台模型训练的相关功能并进行权限管理,可参照如下表格进行操作。 - [推理在线服务权限(新版)](https://support.huaweicloud.com/api-modelarts/modelarts_03_0174.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [模型管理权限](https://support.huaweicloud.com/api-modelarts/modelarts_03_0164.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [推理在线服务权限(旧版)](https://support.huaweicloud.com/api-modelarts/modelarts_03_0165.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [专属资源池/轻量算力集群权限](https://support.huaweicloud.com/api-modelarts/modelarts_03_0362.md): IAM新版控制台:提供基于IAM5.0版本的系统身份策略。用户可以在IAM服务新版控制台创建新的自定义策略,将创建的自定义策略授权给用户所在的用户组。由于部分模块未完全对接IAM5.0,目前还需在IAM服务旧版控制台创建新的自定义策略,配置以下IAM3.0的策略,将创建的自定义策略授权给用户所在的用户组。详情可参照下表配置。IAM新版控制 - [轻量算力节点权限](https://support.huaweicloud.com/api-modelarts/modelarts_03_0366.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [资产管理权限](https://support.huaweicloud.com/api-modelarts/modelarts_03_0176.md): 如果您需要使用ModelArts管理控制台资产管理的相关功能并进行权限管理,可参照下文进行操作。 - [数据管理权限](https://support.huaweicloud.com/api-modelarts/modelarts_03_0161.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [查询数据集列表](https://support.huaweicloud.com/api-modelarts/ListDatasets.md): 根据指定条件分页查询用户创建的所有数据集。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。GET /v2/{project_id}/datasets无状态码: 200查询数据集列表状态码: 200OK请参见错误码。 - [创建数据集](https://support.huaweicloud.com/api-modelarts/CreateDataset.md): 创建数据集。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。POST /v2/{project_id}/datasets状态码: 201创建图像分类的数据集{ "workspace_id" : "0", "dataset_name" - [查询数据集详情](https://support.huaweicloud.com/api-modelarts/DescDataset.md): 查询数据集详情。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。GET /v2/{project_id}/datasets/{dataset_id}无状态码: 200查询数据集详情状态码: 200OK请参见错误码。 - [更新数据集](https://support.huaweicloud.com/api-modelarts/UpdateDataset.md): 修改数据集的基本信息,如数据集名称、描述、当前版本或标签等信息。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。PUT /v2/{project_id}/datasets/{dataset_id}状态码: 200更新数据集状态码: 200OK - [删除数据集](https://support.huaweicloud.com/api-modelarts/DeleteDataset.md): 删除数据集,但不删除数据集的源数据。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。DELETE /v2/{project_id}/datasets/{dataset_id}无无删除数据集状态码: 204No Content请参见错误码。 - [查询数据集的统计信息](https://support.huaweicloud.com/api-modelarts/GetDatasetStats.md): 查询数据集的统计信息。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。GET /v2/{project_id}/datasets/{dataset_id}/data-annotations/stats无状态码: 200查询数据集的统计信息状态 - [查询数据集监控数据](https://support.huaweicloud.com/api-modelarts/GetDatasetMetrics.md): 查询数据集在指定时间范围内的监控数据。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。GET /v2/{project_id}/datasets/{dataset_id}/metrics无状态码: 200查询数据集监控数据状态码: 200OK - [查询数据集的版本列表](https://support.huaweicloud.com/api-modelarts/ListDatasetVersions.md): 查询指定数据集的版本列表。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。GET /v2/{project_id}/datasets/{dataset_id}/versions无状态码: 200查询指定数据集的版本列表状态码: 200OK请参 - [创建数据集标注版本](https://support.huaweicloud.com/api-modelarts/CreateDatasetVersion.md): 创建数据集标注版本。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。POST /v2/{project_id}/datasets/{dataset_id}/versions状态码: 201创建数据集标注版本。设置版本名称为“V004”,数据集 - [查询数据集版本详情](https://support.huaweicloud.com/api-modelarts/DescribeDatasetVersion.md): 查询数据集版本详情。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。GET /v2/{project_id}/datasets/{dataset_id}/versions/{version_id}无状态码: 200查询数据集版本详情状态码: - [删除数据集标注版本](https://support.huaweicloud.com/api-modelarts/DeleteDatasetVersion.md): 删除数据集标注版本。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。DELETE /v2/{project_id}/datasets/{dataset_id}/versions/{version_id}无无删除数据集标注版本状态码: 204N - [查询样本列表](https://support.huaweicloud.com/api-modelarts/ListSamples.md): 分页查询样本列表。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。GET /v2/{project_id}/datasets/{dataset_id}/data-annotations/samples无状态码: 200分页查询样本列表状态码: - [批量添加样本](https://support.huaweicloud.com/api-modelarts/UploadSamplesJson.md): 批量添加样本。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。POST /v2/{project_id}/datasets/{dataset_id}/data-annotations/samples状态码: 200批量添加样本状态码: 200 - [批量删除样本](https://support.huaweicloud.com/api-modelarts/DeleteSamples.md): 批量删除样本。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。POST /v2/{project_id}/datasets/{dataset_id}/data-annotations/samples/delete状态码: 200批量删除样本状 - [查询单个样本信息](https://support.huaweicloud.com/api-modelarts/DescribeSample.md): 查询单个样本信息。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。GET /v2/{project_id}/datasets/{dataset_id}/data-annotations/samples/{sample_id}无状态码: 200 - [获取样本搜索条件](https://support.huaweicloud.com/api-modelarts/ListSearch.md): 获取样本搜索条件。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。GET /v2/{project_id}/datasets/{dataset_id}/data-annotations/search-condition无状态码: 200获取样 - [分页查询团队标注任务下的样本列表](https://support.huaweicloud.com/api-modelarts/ListWorkforceTaskSamples.md): 分页查询团队标注任务下的样本列表。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。GET /v2/{project_id}/datasets/{dataset_id}/workforce-tasks/{workforce_task_id}/d - [查询团队标注的样本信息](https://support.huaweicloud.com/api-modelarts/DescribeWorkforceTaskSample.md): 查询团队标注的样本信息,只有在验收任务发起后才能正确调用。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。GET /v2/{project_id}/datasets/{dataset_id}/workforce-tasks/{workforc - [查询数据集标签列表](https://support.huaweicloud.com/api-modelarts/ListLabels.md): 查询数据集下所有标签列表。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。GET /v2/{project_id}/datasets/{dataset_id}/data-annotations/labels无状态码: 200查询数据集下所有标 - [创建数据集标签](https://support.huaweicloud.com/api-modelarts/CreateLabels.md): 创建数据集标签。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。POST /v2/{project_id}/datasets/{dataset_id}/data-annotations/labels状态码: 200创建数据集标签。设置标签名称 - [批量修改标签](https://support.huaweicloud.com/api-modelarts/UpdateLabels.md): 批量修改标签。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。PUT /v2/{project_id}/datasets/{dataset_id}/data-annotations/labels状态码: 200批量修改标签状态码: 200OK - [批量删除标签](https://support.huaweicloud.com/api-modelarts/DeleteLabels.md): 批量删除标签。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。POST /v2/{project_id}/datasets/{dataset_id}/data-annotations/labels/delete状态码: 200删除名称为“st - [按标签名称更新单个标签](https://support.huaweicloud.com/api-modelarts/UpdateLabel.md): 按标签名称更新单个标签。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。PUT /v2/{project_id}/datasets/{dataset_id}/data-annotations/labels/{label_name}状态码: 2 - [按标签名称删除标签及仅包含此标签的文件](https://support.huaweicloud.com/api-modelarts/DeleteLabelAndSamples.md): 按标签名称删除标签及仅包含此标签的文件。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。DELETE /v2/{project_id}/datasets/{dataset_id}/data-annotations/labels/{label_ - [批量更新样本标签](https://support.huaweicloud.com/api-modelarts/UpdateSamples.md): 批量更新样本标签,包括添加、修改和删除样本标签。当请求体中单个样本的“labels”参数传空列表时,表示删除该样本的标签。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。PUT /v2/{project_id}/datasets/{datas - [查询数据集的团队标注任务列表](https://support.huaweicloud.com/api-modelarts/ListWorkforceTasks.md): 查询数据集的团队标注任务列表。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。GET /v2/{project_id}/datasets/{dataset_id}/workforce-tasks无状态码: 200查询数据集的团队标注任务列表状 - [创建团队标注任务](https://support.huaweicloud.com/api-modelarts/CreateWorkforceTask.md): 创建团队标注任务。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。POST /v2/{project_id}/datasets/{dataset_id}/workforce-tasks状态码: 200创建团队标注任务。设置任务名称为“task - [查询团队标注任务详情](https://support.huaweicloud.com/api-modelarts/DescWorkforceTask.md): 查询团队标注任务详情。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。GET /v2/{project_id}/datasets/{dataset_id}/workforce-tasks/{workforce_task_id}无状态码: 20 - [启动团队标注任务](https://support.huaweicloud.com/api-modelarts/StartWorkforceTask.md): 启动团队标注任务。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。POST /v2/{project_id}/datasets/{dataset_id}/workforce-tasks/{workforce_task_id}无启动团队标注任务 - [更新团队标注任务](https://support.huaweicloud.com/api-modelarts/UpdateWorkforceTask.md): 更新团队标注任务。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。PUT /v2/{project_id}/datasets/{dataset_id}/workforce-tasks/{workforce_task_id}无更新团队标注任务状 - [删除团队标注任务](https://support.huaweicloud.com/api-modelarts/DeleteWorkforceTask.md): 删除团队标注任务。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。DELETE /v2/{project_id}/datasets/{dataset_id}/workforce-tasks/{workforce_task_id}无无删除团队标 - [创建团队标注验收任务](https://support.huaweicloud.com/api-modelarts/StartWorkforceSamplingTask.md): 创建团队标注验收任务。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。POST /v2/{project_id}/datasets/{dataset_id}/workforce-tasks/{workforce_task_id}/accept - [查询团队标注验收任务报告](https://support.huaweicloud.com/api-modelarts/GetWorkforceSamplingTask.md): 查询团队标注验收任务报告。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。GET /v2/{project_id}/datasets/{dataset_id}/workforce-tasks/{workforce_task_id}/accep - [更新团队标注验收任务状态](https://support.huaweicloud.com/api-modelarts/UpdateWorkforceSamplingTask.md): 在团队标注任务完成验收前确认验收范围以及是否覆盖已标注的数据,以此更新样本状态。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。PUT /v2/{project_id}/datasets/{dataset_id}/workforce-task - [查询团队标注任务统计信息](https://support.huaweicloud.com/api-modelarts/ListWorkforceTaskStats.md): 查询团队标注任务统计信息。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。GET /v2/{project_id}/datasets/{dataset_id}/workforce-tasks/{workforce_task_id}/data- - [查询团队标注任务成员的进度信息](https://support.huaweicloud.com/api-modelarts/GetWorkforceTaskMetrics.md): 查询数据集团队标注任务中成员标注进展的统计信息。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。GET /v2/{project_id}/datasets/{dataset_id}/workforce-tasks/{workforce_tas - [团队成员查询团队标注任务列表](https://support.huaweicloud.com/api-modelarts/ListWorkerTasks.md): 团队成员查询团队标注任务列表。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。GET /v2/{project_id}/workforces/worker-tasks无状态码: 200团队成员查询团队标注任务列表状态码: 200OK请参见错误 - [提交验收任务的样本评审意见](https://support.huaweicloud.com/api-modelarts/AcceptSamples.md): 提交验收任务的样本评审意见。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。POST /v2/{project_id}/datasets/{dataset_id}/workforce-tasks/{workforce_task_id}/acc - [团队标注审核](https://support.huaweicloud.com/api-modelarts/ReviewSamples.md): 团队标注审核。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。POST /v2/{project_id}/datasets/{dataset_id}/workforce-tasks/{workforce_task_id}/data-annot - [批量更新团队标注样本的标签](https://support.huaweicloud.com/api-modelarts/UpdateWorkforceTaskSamples.md): 批量更新团队标注样本的标签。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。PUT /v2/{project_id}/datasets/{dataset_id}/workforce-tasks/{workforce_task_id}/data - [查询标注团队列表](https://support.huaweicloud.com/api-modelarts/ListWorkforces.md): 查询标注团队列表。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。GET /v2/{project_id}/workforces无状态码: 200查询标注团队列表状态码: 200OK请参见错误码。 - [创建标注团队](https://support.huaweicloud.com/api-modelarts/CreateWorkforce.md): 创建标注团队。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。POST /v2/{project_id}/workforces状态码: 201创建标注团队。设置标注团队名称为“team-123”。状态码: 201Created请参见错误码。 - [查询标注团队详情](https://support.huaweicloud.com/api-modelarts/DescWorkforce.md): 查询标注团队详情。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。GET /v2/{project_id}/workforces/{workforce_id}无状态码: 200查询标注团队详情状态码: 200OK请参见错误码。 - [更新标注团队](https://support.huaweicloud.com/api-modelarts/UpdateWorkforce.md): 更新标注团队。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。PUT /v2/{project_id}/workforces/{workforce_id}无更新标注团队状态码: 200OK请参见错误码。 - [删除标注团队](https://support.huaweicloud.com/api-modelarts/DeleteWorkforce.md): 删除标注团队。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。DELETE /v2/{project_id}/workforces/{workforce_id}无状态码: 204删除标注团队状态码: 204No Content请参见错误码。 - [向标注成员发送邮件](https://support.huaweicloud.com/api-modelarts/SendEmails.md): 向标注成员发送邮件。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。POST /v2/{project_id}/datasets/{dataset_id}/workforce-tasks/{workforce_task_id}/notify状 - [查询所有团队的标注成员列表](https://support.huaweicloud.com/api-modelarts/ListAllWorkers.md): 查询所有团队的标注成员列表。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。GET /v2/{project_id}/workforces/workers无状态码: 200查询所有团队的标注管理员状态码: 200OK请参见错误码。 - [查询标注团队的成员列表](https://support.huaweicloud.com/api-modelarts/ListWorkers.md): 查询标注团队的成员列表。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。GET /v2/{project_id}/workforces/{workforce_id}/workers无状态码: 200查询标注团队的成员列表状态码: 200OK请 - [创建标注团队的成员](https://support.huaweicloud.com/api-modelarts/CreateWorker.md): 创建标注团队的成员。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。POST /v2/{project_id}/workforces/{workforce_id}/workers无创建标注团队的成员。设置成员角色为“2”,即团队管理员角色。状 - [批量删除标注团队成员](https://support.huaweicloud.com/api-modelarts/BatchDeleteWorkers.md): 批量删除标注团队成员。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。POST /v2/{project_id}/workforces/{workforce_id}/workers/batch-delete状态码: 200批量删除标注团队成员 - [查询标注团队成员详情](https://support.huaweicloud.com/api-modelarts/DescWorker.md): 查询标注团队成员详情。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。GET /v2/{project_id}/workforces/{workforce_id}/workers/{worker_id}无状态码: 200查询标注团队成员详情状 - [更新标注团队成员](https://support.huaweicloud.com/api-modelarts/UpdateWorker.md): 更新标注团队成员。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。PUT /v2/{project_id}/workforces/{workforce_id}/workers/{worker_id}无更新标注团队成员状态码: 200OK请参见 - [删除标注团队成员](https://support.huaweicloud.com/api-modelarts/DeleteWorker.md): 删除标注团队成员。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。DELETE /v2/{project_id}/workforces/{workforce_id}/workers/{worker_id}无无删除标注团队成员状态码: 204N - [查询数据集导入任务列表](https://support.huaweicloud.com/api-modelarts/ListImportTasks.md): 分页查询数据集导入任务列表。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。GET /v2/{project_id}/datasets/{dataset_id}/import-tasks无状态码: 200获取数据集导入任务列表状态码: 200 - [创建导入任务](https://support.huaweicloud.com/api-modelarts/ImportTask.md): 创建数据集的导入任务:从存储系统导入样本、标签到数据集。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。POST /v2/{project_id}/datasets/{dataset_id}/import-tasks状态码: 200创建导入( - [查询数据集导入任务的详情](https://support.huaweicloud.com/api-modelarts/DescImportTask.md): 查询数据集导入任务的详情。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。GET /v2/{project_id}/datasets/{dataset_id}/import-tasks/{task_id}无状态码: 200查询导入任务详情状态 - [查询数据集导出任务列表](https://support.huaweicloud.com/api-modelarts/GetExportTasksStatusOfDataset.md): 分页查询数据集导出任务列表。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。GET /v2/{project_id}/datasets/{dataset_id}/export-tasks无状态码: 200分页查询导出任务列表状态码: 200O - [创建数据集导出任务](https://support.huaweicloud.com/api-modelarts/ExportTask.md): 创建数据集导出任务,可导出至OBS或新数据集。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。POST /v2/{project_id}/datasets/{dataset_id}/export-tasks状态码: 200创建导出(导出到OB - [查询数据集导出任务的状态](https://support.huaweicloud.com/api-modelarts/GetExportTaskStatusOfDataset.md): 查询数据集导出任务的状态。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。GET /v2/{project_id}/datasets/{resource_id}/export-tasks/{task_id}无状态码: 200查询导出任务(导出 - [同步数据集](https://support.huaweicloud.com/api-modelarts/SyncDataSource.md): 从数据集输入位置同步数据至数据集,包含样本及标注信息。文本类数据集不支持此操作。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。POST /v2/{project_id}/datasets/{dataset_id}/sync-data无无同步 - [查询数据集同步任务的状态](https://support.huaweicloud.com/api-modelarts/SyncDataSourceState.md): 查询数据集同步任务的状态。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。GET /v2/{project_id}/datasets/{dataset_id}/sync-data/status无状态码: 200获取数据集同步状态状态码: 20 - [查询智能标注的样本列表](https://support.huaweicloud.com/api-modelarts/ListAutoAnnotationSamples.md): 查询数据集中智能标注的样本列表。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。GET /v2/{project_id}/datasets/{dataset_id}/auto-annotations/samples无状态码: 200查询智能标 - [查询单个智能标注样本的信息](https://support.huaweicloud.com/api-modelarts/DescribeAutoAnnotationSample.md): 查询单个智能标注样本的信息。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。GET /v2/{project_id}/datasets/{dataset_id}/auto-annotations/samples/{sample_id}无状态码 - [分页查询智能任务列表](https://support.huaweicloud.com/api-modelarts/ListTasks.md): 分页查询智能任务列表,包括“智能标注”和“自动分组”两大类智能任务。可通过指定“type”参数来单独查询某类任务的列表。“智能标注”是指基于当前标注阶段的标签及图片学习训练,选中系统中已有的模型进行智能标注,快速完成剩余图片的标注操作。“智能标注”又包含“主动学习”和“预标注”两类。“主动学习”表示系统将自动使用半监督学习、难例筛选等多种 - [启动智能任务](https://support.huaweicloud.com/api-modelarts/CreateTask.md): 启动智能任务,支持启动“智能标注”和“自动分组”两大类智能任务。可通过指定请求体中的“task_type”参数来启动某类任务。数据路径或工作路径位于KMS加密桶的数据集,不支持启动主动学习和自动分组任务,支持预标注任务。“智能标注”是指基于当前标注阶段的标签及图片学习训练,选中系统中已有的模型进行智能标注,快速完成剩余图片的标注操作。“智 - [获取智能任务的信息](https://support.huaweicloud.com/api-modelarts/AutoAnnotationProgress.md): 获取智能任务的详细信息,支持查询“智能标注”和“自动分组”两大类智能任务。可通过指定路径参数“task_id”来查询某个具体任务的详情。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。GET /v2/{project_id}/datasets - [停止智能任务](https://support.huaweicloud.com/api-modelarts/StopAutoAnnotation.md): 停止智能任务,支持停止“智能标注”和“自动分组”两大类智能任务。可通过指定路径参数“task_id”来停止某个具体任务。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。POST /v2/{project_id}/datasets/{datas - [查询处理任务列表](https://support.huaweicloud.com/api-modelarts/ListProcessorTasks.md): 查询处理任务列表,包括“特征分析”任务和“数据处理”两大类任务。可通过指定“task_type”参数来单独查询某类任务的列表。“特征分析”是指基于图片或目标框对图片的各项特征,如模糊度、亮度进行分析,并绘制可视化曲线,帮助处理数据集。“特征分析”是指基于图片或目标框对图片的各项特征,如模糊度、亮度进行分析,并绘制可视化曲线,帮助处理数据集 - [创建处理任务](https://support.huaweicloud.com/api-modelarts/CreateProcessorTask.md): 创建处理任务,支持创建“特征分析”任务和“数据处理”两大类任务。可通过指定请求体中的复合参数“template”的“id”字段来创建某类任务。“特征分析”是指基于图片或目标框对图片的各项特征,如模糊度、亮度进行分析,并绘制可视化曲线,帮助处理数据集。“特征分析”是指基于图片或目标框对图片的各项特征,如模糊度、亮度进行分析,并绘制可视化曲线 - [查询数据处理的算法类别](https://support.huaweicloud.com/api-modelarts/GetProcessorTaskItems.md): 查询数据处理的算法类别。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。GET /v2/{project_id}/processor-tasks/items无状态码: 200查询数据处理算法类别的列表状态码: 200OK请参见错误码。 - [查询处理任务详情](https://support.huaweicloud.com/api-modelarts/DescribeProcessorTask.md): 查询处理任务详情,支持查询“特征分析”任务和“数据处理”两大类任务。可通过指定路径参数“task_id”来查询某个具体任务的详情。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。GET /v2/{project_id}/processor-t - [更新处理任务](https://support.huaweicloud.com/api-modelarts/UpdateProcessorTask.md): 更新处理任务,支持更新“特征分析”任务和“数据处理”两大类任务,仅支持更新任务的描述。可通过指定路径参数“task_id”来更新某个具体任务。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。PUT /v2/{project_id}/proce - [删除处理任务](https://support.huaweicloud.com/api-modelarts/DeleteProcessorTask.md): 删除处理任务,支持删除“特征分析”任务和“数据处理”两大类任务。可通过指定路径参数“task_id”来删除某个具体任务。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。DELETE /v2/{project_id}/processor-tas - [查询数据处理任务的版本列表](https://support.huaweicloud.com/api-modelarts/ListProcessorTaskVersions.md): 查询数据处理任务的版本列表。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。GET /v2/{project_id}/processor-tasks/{task_id}/versions无状态码: 200查询数据处理任务版本列表状态码: 20 - [创建数据处理任务版本](https://support.huaweicloud.com/api-modelarts/CreateProcessorTaskVersion.md): 创建数据处理任务版本。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。POST /v2/{project_id}/processor-tasks/{task_id}/versions状态码: 200创建数据校验任务的版本。设置任务名称为“PR - [查询数据处理任务的版本详情](https://support.huaweicloud.com/api-modelarts/DescProcessorTaskVersion.md): 查询数据处理任务的版本详情。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。GET /v2/{project_id}/processor-tasks/{task_id}/versions/{version_id}无状态码: 200查询数据处理 - [删除数据处理任务的版本](https://support.huaweicloud.com/api-modelarts/DeleteProcessorTaskVersion.md): 删除数据处理任务的版本。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。DELETE /v2/{project_id}/processor-tasks/{task_id}/versions/{version_id}无无删除数据处理任务的版本状 - [查询数据处理任务版本的结果展示](https://support.huaweicloud.com/api-modelarts/ListProcessorTaskVersionResults.md): 查询数据处理任务版本的结果展示。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。GET /v2/{project_id}/processor-tasks/{task_id}/versions/{version_id}/results无状态码: - [停止数据处理任务的版本](https://support.huaweicloud.com/api-modelarts/StopProcessorTaskVersion.md): 停止数据处理任务的版本。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。POST /v2/{project_id}/processor-tasks/{task_id}/versions/{version_id}/stop无无停止数据处理任务的 - [创建开发环境实例](https://support.huaweicloud.com/api-modelarts/modelarts_03_0110.md): 创建开发环境实例,用于代码开发。该接口为异步操作,创建开发环境实例的状态请通过查询开发环境实例详情接口获取。POST /v1/{project_id}/demanager/instances参数说明如表1所示。参数说明参数是否必选参数类型说明project_id是String用户项目ID。获取方法请参见获取项目ID和名称。请求参数如表2所 - [查询开发环境实例列表](https://support.huaweicloud.com/api-modelarts/modelarts_03_0111.md): 该接口用于查询开发环境实例列表,用户可按需查询满足条件的开发环境实例列表。GET /v1/{project_id}/demanager/instances?de_type={de_type}&provision_type={provision_type}&status={status}&sortby={sortby}&order={ord - [查询开发环境实例详情](https://support.huaweicloud.com/api-modelarts/modelarts_03_0112.md): 该接口用于查询开发环境实例详情。GET /v1/{project_id}/demanager/instances/{instance_id}参数说明如表1所示参数说明参数是否必选参数类型说明project_id是String用户项目ID。获取方法请参见获取项目ID和名称。instance_id是String实例ID。无请求参数。响应参数如 - [更新开发环境实例信息](https://support.huaweicloud.com/api-modelarts/modelarts_03_0113.md): 该接口用于更新开发环境实例的描述信息或自动停止信息。PUT /v1/{project_id}/demanager/instances/{instance_id}参数说明如表1所示。参数说明参数是否必选参数类型说明project_id是String用户项目ID。获取方法请参见获取项目ID和名称。instance_id是String实例ID。 - [删除开发环境实例](https://support.huaweicloud.com/api-modelarts/modelarts_03_0114.md): 该接口用于删除开发环境实例。DELETE /v1/{project_id}/demanager/instances/{instance_id}参数说明如表1所示。参数说明参数是否必选参数类型说明project_id是String用户项目ID。获取方法请参见获取项目ID和名称。instance_id是String实例ID。无请求参数。响应参 - [管理开发环境实例](https://support.huaweicloud.com/api-modelarts/modelarts_03_0115.md): 该接口用于启动、停止、重启、排队、取消排队开发环境Notebook实例。POST /v1/{project_id}/demanager/instances/{instance_id}/action参数说明如表1所示。参数说明参数是否必选参数类型说明。project_id是String用户项目ID。获取方法请参见获取项目ID和名称。inst - [创建训练作业](https://support.huaweicloud.com/api-modelarts/modelarts_03_0045.md): 创建一个训练作业。该接口为异步接口,作业状态请通过查询训练作业列表和查询训练作业版本详情接口获取。POST /v1/{project_id}/training-jobs参数说明如表1所示。参数说明参数是否必选参数类型说明project_id是String用户项目ID。获取方法请参见获取项目ID和名称。请求参数如表2所示。请求参数参数是否必 - [查询训练作业列表](https://support.huaweicloud.com/api-modelarts/modelarts_03_0046.md): 根据指定条件查询用户创建的训练作业。GET /v1/{project_id}/training-jobs参数说明如表1所示。路径参数参数是否必选参数类型说明project_id是String用户项目ID。获取方法请参见获取项目ID和名称。无。响应参数如表3所示。响应参数参数参数类型说明is_successBoolean请求是否成功。err - [查询训练作业版本详情](https://support.huaweicloud.com/api-modelarts/modelarts_03_0047.md): 根据作业ID查看指定的训练作业详情。GET /v1/{project_id}/training-jobs/{job_id}/versions/{version_id}参数说明如表1所示。参数说明参数是否必选参数类型说明project_id是String用户项目ID。获取方法请参见获取项目ID和名称。job_id是Long训练作业的ID。v - [删除训练作业版本](https://support.huaweicloud.com/api-modelarts/modelarts_03_0048.md): 删除训练作业一个版本。此接口为异步接口,作业状态请通过查询训练作业列表和查询训练作业版本详情接口获取。DELETE /v1/{project_id}/training-jobs/{job_id}/versions/{version_id}参数说明如表1所示。参数说明参数是否必选参数类型说明project_id是String用户项目ID。获 - [查询训练作业版本列表](https://support.huaweicloud.com/api-modelarts/modelarts_03_0049.md): 根据作业ID查看指定的训练作业版本。GET /v1/{project_id}/training-jobs/{job_id}/versions参数说明如表1所示。路径参数参数是否必选参数类型说明project_id是String用户项目ID。获取方法请参见获取项目ID和名称。job_id是Long训练作业的ID。无。响应参数如表3所示。响应 - [创建训练作业版本](https://support.huaweicloud.com/api-modelarts/modelarts_03_0050.md): 创建一个训练作业版本。该接口为异步接口,作业状态请通过查询训练作业列表和查询训练作业版本详情接口获取。POST /v1/{project_id}/training-jobs/{job_id}/versions参数说明如表1所示。参数说明参数是否必选参数类型说明project_id是String用户项目ID。获取方法请参见获取项目ID和名称 - [停止训练作业版本](https://support.huaweicloud.com/api-modelarts/modelarts_03_0051.md): 停止训练作业。此接口为异步接口,作业状态请通过查询训练作业列表和查询训练作业版本详情接口获取。POST /v1/{project_id}/training-jobs/{job_id}/versions/{version_id}/stop参数说明如表1所示。参数说明参数是否必选参数类型说明project_id是String用户项目ID。获取 - [更新训练作业描述](https://support.huaweicloud.com/api-modelarts/modelarts_03_0052.md): 更新训练作业的描述。PUT /v1/{project_id}/training-jobs/{job_id}参数说明如表1所示。参数说明参数是否必选参数类型说明project_id是String用户项目ID。获取方法请参见获取项目ID和名称。job_id是Long训练作业的ID。请求消息如表2所示。请求参数参数是否必选参数类型说明job_d - [删除训练作业](https://support.huaweicloud.com/api-modelarts/modelarts_03_0053.md): 删除训练作业。此接口为异步接口,作业状态请通过查询训练作业列表和查询训练作业版本详情接口获取。DELETE /v1/{project_id}/training-jobs/{job_id}参数说明如表1所示。参数说明参数是否必选参数类型说明project_id是String用户项目ID。获取方法请参见获取项目ID和名称。job_id是Lon - [获取训练作业日志的文件名](https://support.huaweicloud.com/api-modelarts/modelarts_03_0054.md): 获取训练作业日志的文件名。GET /v1/{project_id}/training-jobs/{job_id}/versions/{version_id}/log/file-names参数说明如表1所示。参数说明参数是否必选参数类型说明project_id是String用户项目ID。获取方法请参见获取项目ID和名称。job_id是Lon - [查询预置算法](https://support.huaweicloud.com/api-modelarts/modelarts_03_0056.md): 查看预置模型的详情。GET /v1/{project_id}/built-in-algorithms参数说明如表1所示。参数说明参数是否必选参数类型说明project_id是String用户项目ID。获取方法请参见获取项目ID和名称。请求参数如表2所示。响应参数如表3所示。响应参数参数参数类型说明is_successBoolean请求是否 - [查询训练作业日志](https://support.huaweicloud.com/api-modelarts/modelarts_03_0149.md): 按行来查询训练作业日志详细信息。GET /v1/{project_id}/training-jobs/{job_id}/versions/{version_id}/aom-log参数说明如表1所示。路径参数参数是否必选参数类型说明project_id是String用户项目ID。获取方法请参见获取项目ID和名称。job_id是Long训练作 - [创建训练作业参数](https://support.huaweicloud.com/api-modelarts/modelarts_03_0058.md): 创建训练作业参数。POST /v1/{project_id}/training-job-configs参数说明如表1所示。参数说明参数是否必选参数类型说明project_id是String用户项目ID。获取方法请参见获取项目ID和名称。请求参数如表2所示。参数说明参数是否必选参数类型说明config_name是String训练作业参数名称 - [查询训练作业参数列表](https://support.huaweicloud.com/api-modelarts/modelarts_03_0059.md): 根据指定条件查询用户创建的训练作业参数。GET /v1/{project_id}/training-job-configs参数说明如表1所示。参数说明参数是否必选参数类型说明project_id是String用户项目ID。获取方法请参见获取项目ID和名称。请求参数如表2所示。响应参数如表3所示。响应参数参数参数类型说明is_success - [更新训练作业参数](https://support.huaweicloud.com/api-modelarts/modelarts_03_0060.md): 更新训练作业参数。PUT /v1/{project_id}/training-job-configs/{config_name}参数说明如表1所示。参数说明参数是否必选参数类型说明project_id是String用户项目ID。获取方法请参见获取项目ID和名称。config_name是String训练作业参数的名称。请求参数如表2所示。参 - [删除训练作业参数](https://support.huaweicloud.com/api-modelarts/modelarts_03_0061.md): 删除训练作业参数。DELETE /v1/{project_id}/training-job-configs/{config_name}参数说明如表1所示。参数说明参数是否必选参数类型说明project_id是String用户项目ID。获取方法请参见获取项目ID和名称。config_name是String训练作业参数的名称。无请求参数。响应 - [查询训练作业参数详情](https://support.huaweicloud.com/api-modelarts/modelarts_03_0062.md): 查看指定的训练作业参数详情。GET /v1/{project_id}/training-job-configs/{config_name}参数说明如表1所示。路径参数参数是否必选参数类型说明project_id是String用户项目ID。获取方法请参见获取项目ID和名称。config_name是String训练作业参数的名称。无。响应参数 - [创建可视化作业](https://support.huaweicloud.com/api-modelarts/modelarts_03_0064.md): 创建可视化作业。该接口为异步接口,作业状态请通过查询可视化作业列表与查询可视化作业详情接口获取。POST /v1/{project_id}/visualization-jobs参数说明如表1所示。参数说明参数是否必选参数类型说明project_id是String用户项目ID。获取方法请参见获取项目ID和名称。请求参数如表2所示。响应参数如 - [查询可视化作业列表](https://support.huaweicloud.com/api-modelarts/modelarts_03_0065.md): 根据指定条件查询用户创建的可视化作业列表。GET /v1/{project_id}/visualization-jobs参数说明如表1所示。参数说明参数是否必选参数类型说明project_id是String用户项目ID。获取方法请参见获取项目ID和名称。无请求参数。响应参数如表3所示。响应参数参数参数类型说明is_successBoole - [查询可视化作业详情](https://support.huaweicloud.com/api-modelarts/modelarts_03_0066.md): 根据作业名称查看指定的可视化作业详情。GET /v1/{project_id}/visualization-jobs/{job_id}参数说明如表1所示。参数说明参数是否必选参数类型说明project_id是String用户项目ID。获取方法请参见获取项目ID和名称。job_id是String可视化作业ID。无请求参数。响应参数如表2所示 - [更新可视化作业描述](https://support.huaweicloud.com/api-modelarts/modelarts_03_0067.md): 更新可视化作业的描述。PUT /v1/{project_id}/visualization-jobs/{job_id}参数说明如表1所示。参数说明参数是否为必选参数类型说明project_id是String用户项目ID。获取方法请参见获取项目ID和名称。job_id是String可视化作业ID。请求参数如表2所示。请求参数参数是否为必选参 - [删除可视化作业](https://support.huaweicloud.com/api-modelarts/modelarts_03_0068.md): 删除可视化作业。此接口为异步接口,作业状态请通过查询可视化作业列表与查询可视化作业详情接口获取。DELETE /v1/{project_id}/visualization-jobs/{job_id}参数说明如表1所示。参数说明参数是否为必选参数类型说明project_id是String用户项目ID。获取方法请参见获取项目ID和名称。job - [停止可视化作业](https://support.huaweicloud.com/api-modelarts/modelarts_03_0069.md): 停止可视化作业。此接口为异步接口,作业状态请通过查询可视化作业列表与查询可视化作业详情接口获取。POST /v1/{project_id}/visualization-jobs/{job_id}/stop参数说明如表1所示。参数说明参数是否为必选参数类型说明project_id是String用户项目ID。获取方法请参见获取项目ID和名称。 - [重启可视化作业](https://support.huaweicloud.com/api-modelarts/modelarts_03_0070.md): 重启可视化作业。此接口为异步接口,作业状态请通过查询可视化作业列表与查询可视化作业详情接口获取。POST /v1/{project_id}/visualization-jobs/{job_id}/restart参数说明如表1所示。参数说明参数是否为必选参数类型说明project_id是String用户项目ID。获取方法请参见获取项目ID和 - [查询作业资源规格](https://support.huaweicloud.com/api-modelarts/modelarts_03_0072.md): 查看指定作业类型的资源规格。创建训练作业和预测作业需要指定资源规格。GET /v1/{project_id}/job/resource-specs参数说明如表1所示。参数说明参数是否必选参数类型说明project_id是String用户项目ID。获取方法请参见获取项目ID和名称。查询检索参数说明参数是否为必选参数类型说明job_type否 - [查询作业引擎规格](https://support.huaweicloud.com/api-modelarts/modelarts_03_0073.md): 查看指定作业的引擎类型和版本。创建训练作业和预测作业需要指定引擎规格。GET /v1/{project_id}/job/ai-engines参数说明如表1所示。参数说明参数是否必选参数类型说明project_id是String用户项目ID。获取方法请参见获取项目ID和名称。查询检索参数说明参数是否为必选参数类型说明job_type否Str - [作业状态参考](https://support.huaweicloud.com/api-modelarts/modelarts_03_0074.md): 作业状态如表1所示。 - [查询模型runtime](https://support.huaweicloud.com/api-modelarts/ShowModelEngineAndRuntime.md): 查询模型AI引擎以及runtime。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限 - [查询AI应用列表](https://support.huaweicloud.com/api-modelarts/ListModels.md): 查询AI应用列表,可以根据不同的检索参数进行查询。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限 - [创建AI应用](https://support.huaweicloud.com/api-modelarts/CreateModel.md): 导入元模型创建AI应用。执行代码、模型需先上传至OBS(训练作业生成的模型已默认存储到OBS)。使用模板导入模型与不使用模板导入这两类导入方式的Body参数要求不一样。以下Body参数说明中以模板参数表示适合使用模板导入模型时填写的参数,非模板参数表示适合不使用模板导入时填写的参数,公共参数表示与导入方式无关的参数。使用模板导入模型时(m - [查询AI应用详情](https://support.huaweicloud.com/api-modelarts/ShowModel.md): 查询AI应用详情,根据AI应用ID查询AI应用的详细信息。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权, - [删除AI应用](https://support.huaweicloud.com/api-modelarts/DeleteModel.md): 删除AI应用,根据AI应用ID删除指定AI应用,cascade取值为true时除了删除AI应用ID指定的AI应用,还会删除其他与指定AI应用同名不同版本的AI应用;默认只删除当前AI应用ID所对应的AI应用。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码 - [获取APP列表](https://support.huaweicloud.com/api-modelarts/ListApigApps.md): 获取APIG APP基本信息列表,用户只能获取自己创建的APP信息。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与 - [创建APP](https://support.huaweicloud.com/api-modelarts/CreateApigApp.md): 创建API网关应用(简称APP),每个用户最多只能创建5个APP,有需求可以申请增加配额。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需 - [查询APP详情](https://support.huaweicloud.com/api-modelarts/ShowApigApp.md): 查询指定的APP详情。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果 - [删除APP](https://support.huaweicloud.com/api-modelarts/DeleteApigApp.md): 删除指定的APP,只有APP的创建用户才可以删除APP,且APP没有绑定的API。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。 - [增加AppCode](https://support.huaweicloud.com/api-modelarts/CreateApigAppCode.md): 为指定API网关应用创建新的AppCode,只有APP的创建用户才可以创建AppCode,且只有共享/专享版APIG的APP才能创建AppCode。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的 - [重置AppCode](https://support.huaweicloud.com/api-modelarts/ResetApigAppCode.md): 重置指定API网关应用的指定的AppCode,只有APP的创建用户才可以重置AppCode,且只有共享/专享版APIG的APP才支持AppCode。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的 - [删除AppCode](https://support.huaweicloud.com/api-modelarts/DeleteApigAppCode.md): 删除指定API网关应用的指定的AppCode,只有APP的创建用户才可以删除AppCode,且只有共享/专享版APIG的APP才支持AppCode。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的 - [重置AppSecret](https://support.huaweicloud.com/api-modelarts/ResetApigAppSecret.md): 重置指定API网关应用的AppSecret,只有APP的创建用户才可以重置AppSecret。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API - [获取用户绑定APP的api列表](https://support.huaweicloud.com/api-modelarts/ShowApisBindToApp.md): 获取用户绑定app的API列表。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授 - [注册API并授权给APP](https://support.huaweicloud.com/api-modelarts/CreateAndAuthAppAuthApi.md): 注册API并将API授权给APP,只有对服务有更新权限的华为云用户可以调用。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使 - [删除API](https://support.huaweicloud.com/api-modelarts/DeleteAppAuthApi.md): 删除指定的API,只有对API所属服务有删除权限的用户才可以删除API。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角 - [授权API至APP](https://support.huaweicloud.com/api-modelarts/AuthorizeApiToApigApps.md): 将指定的API授权给APP。API的认证方式必须为APP认证,APP的创建用户必须是API所属服务的创建者,且请求用户对API所属服务必须有更新权限。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下 - [更新API授权](https://support.huaweicloud.com/api-modelarts/UpdateAuthApiToApigApps.md): 更新API的授权关系。API的认证方式必须为APP认证,APP的创建用户必须是API所属服务的创建者,且请求用户对API所属服务必须有更新权限。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的IA - [解除API对APP的授权](https://support.huaweicloud.com/api-modelarts/DeleteApiAppAuth.md): 解除指定的API对APP的授权,请求用户对API所属服务必须有更新权限。同URL:/v1/{project_id}/app-auth/{service_id}/apis/{api_id}/auths您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功 - [获取API授权关系列表](https://support.huaweicloud.com/api-modelarts/ShowApiAuthInfos.md): 获取指定的API与APP授权关系列表,API的认证方式必须是APP认证,管理员可以获取所有API的授权信息,普通用户只能获取自己有访问权限的服务下的API的授权信息。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限 - [创建API](https://support.huaweicloud.com/api-modelarts/CreateAppAuthApi.md): 创建API,未将API授权给APP。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限 - [查询API](https://support.huaweicloud.com/api-modelarts/GetAppAuthApiInfo.md): 查询指定API详情。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使 - [查询API和APP](https://support.huaweicloud.com/api-modelarts/GetServiceAppAuthApiAuthInfo.md): 查询服务授权的API、APP信息。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和 - [查询APP的API认证信息](https://support.huaweicloud.com/api-modelarts/GetAppAuthApisInfo.md): 查询APP的API认证信息。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项 - [查询APP是否存在](https://support.huaweicloud.com/api-modelarts/ApigAppExists.md): 查询APP是否存在。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使 - [通过patch操作对服务进行更新](https://support.huaweicloud.com/api-modelarts/PatchServiceV2.md): 通过patch操作对服务进行更新。patch的格式可以参照json patch。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如 - [查询服务监控信息](https://support.huaweicloud.com/api-modelarts/ShowServiceMonitorInfo.md): 查询服务监控信息。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用 - [查询服务列表](https://support.huaweicloud.com/api-modelarts/ListServices.md): 查询模型服务列表。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用 - [部署服务](https://support.huaweicloud.com/api-modelarts/CreateService.md): 将模型部署为服务。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用 - [查询支持的服务部署规格](https://support.huaweicloud.com/api-modelarts/ShowServiceSpecifications.md): 查询支持的服务部署规格列表。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项 - [查询服务详情](https://support.huaweicloud.com/api-modelarts/ShowService.md): 查询模型服务详情,根据服务ID查询服务详情。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请 - [更新服务配置](https://support.huaweicloud.com/api-modelarts/UpdateService.md): 更新模型服务配置。也可以使用此接口启停服务。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请 - [删除服务](https://support.huaweicloud.com/api-modelarts/DeleteService.md): 删除模型服务,仅可删除本人名下的服务。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权 - [更新模型服务的单个属性](https://support.huaweicloud.com/api-modelarts/modelarts_03_b365c2c5-17ff-4f1b-87ea-540eead28225.md): 更新模型服务的单个属性,目前只支持instance_count(更新模型服务实例数量),仅运行中、告警、异常状态下的在线服务可以执行该操作。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的IAM用 - [查询专属资源池列表](https://support.huaweicloud.com/api-modelarts/ListClusters.md): 查询专属资源池列表。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使 - [查询服务事件日志](https://support.huaweicloud.com/api-modelarts/ShowServiceEvents.md): 查询服务事件日志,包含服务的操作记录及部署过程中的关键动作、部署失败原因。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用 - [启动停止边缘节点服务实例](https://support.huaweicloud.com/api-modelarts/UpdateEdgeNodeStatus.md): 启动停止边缘节点服务实例。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。 - [查询服务更新日志](https://support.huaweicloud.com/api-modelarts/ShowServiceUpdateLogs.md): 查询实时服务更新日志。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果 - [添加资源标签](https://support.huaweicloud.com/api-modelarts/BatchCreateServiceTags.md): 给指定服务添加标签(目前只支持在线服务),当添加的标签key已存在,则覆盖该标签的value。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API - [删除资源标签](https://support.huaweicloud.com/api-modelarts/BatchDeleteServiceTags.md): 删除服务(目前只支持在线服务)的标签,支持批量删除。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权 - [查询推理服务标签](https://support.huaweicloud.com/api-modelarts/ListServiceTags.md): 查询当前项目下的推理服务标签,默认查询所有工作空间,无权限不返回标签数据。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用 - [查询推理VPC访问通道信息的API](https://support.huaweicloud.com/api-modelarts/ShowInternalChannelVpcepApi.md): 该接口用于查询推理VPC访问通道。您可以在API Explorer中调试该接口,支持自动认证鉴权。API Explorer可以自动生成SDK代码示例,并提供SDK代码示例调试功能。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和 - [状态码](https://support.huaweicloud.com/api-modelarts/modelarts_03_0094.md): 状态码如表1所示。 - [错误码](https://support.huaweicloud.com/api-modelarts/modelarts_03_0095.md): 当您调用API时,如果遇到“APIGW”开头的错误码,请参见API网关错误码进行处理。 - [获取项目ID和名称](https://support.huaweicloud.com/api-modelarts/modelarts_03_0147.md): 在调用接口的时候,部分请求中需要填入项目ID或项目名称,所以需要获取到项目ID和名称。有如下两种获取方式:从控制台获取项目ID和名称调用API获取项目ID从控制台获取项目ID(project_id)和名称(project name)的步骤如下:注册并登录管理ModelArts控制台。在页面右上角鼠标悬浮在用户名上,然后在下拉列表中单击我的 - [获取账号名和账号ID](https://support.huaweicloud.com/api-modelarts/modelarts_03_0148.md): 在调用接口的时候,部分请求中需要填入账号名(domain name)和账号ID(domain_id)。获取步骤如下:注册并登录管理控制台。鼠标移动至用户名,在下拉列表中单击我的凭证。在API凭证页面的查看账号名和账号ID。获取账号名和ID在API凭证页面的查看账号名和账号ID。 - [获取用户名和用户ID](https://support.huaweicloud.com/api-modelarts/modelarts_03_0006.md): 在调用接口的时候,部分请求中需要填入用户名(user name)和用户ID(user_id)。获取步骤如下:注册并登录管理控制台。鼠标移动至用户名,在下拉列表中单击我的凭证。在API凭证页面,查看IAM用户名和IAM用户ID。获取用户名和ID在API凭证页面,查看IAM用户名和IAM用户ID。 ## SDK参考 - [SDK概述](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_sdk_0002.md): 本文介绍了ModelArts服务提供的SDK,列举了最新版本SDK的获取地址。ModelArts SDK方案有两类:方案一:(推荐使用)UnionSDK,是根据API统一自动生成,其接口参数与服务的API一致。方案二:基于业务逻辑编排开发的SDK,具体请参见ModelArts SDK参考(旧版)。本文档介绍的SDK是方案一,即UnionS - [文档导读](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0001.md): ModelArts的SDK提供了新方案,新方案的SDK基于API统一自动生成,其接口参数与服务的API一致,并且SDK语言丰富,推荐使用,具体参考SDK概述。本文档是ModelArts SDK的旧版方案,新用户不推荐使用。本文档指导您如何安装和配置开发环境、如何通过调用ModelArts SDK提供的接口函数进行二次开发。 - [SDK简介](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0002.md): ModelArts服务软件开发工具包(ModelArts SDK)是对ModelArts服务提供的REST API进行的Python封装,以简化用户的开发工作。用户直接调用ModelArts SDK即可完成训练作业等任务。ModelArts SDK目前只提供Python语言的SDK,推荐使用3.10.x版本。ModelArts SDK目前 - [快速开始](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0003.md): ModelArts SDK目前仅支持在ModelArts开发环境Notebook和本地PC两种环境使用。不支持在ModelArts 的训练作业和推理在线服务中使用。ModelArts SDK已经集成在ModelArts开发环境Notebook中,可以直接使用,无需进行Session鉴权。登录ModelArts控制台,在“开发环境 > No - [(可选)本地服务器安装ModelArts SDK](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0004.md): 如果需要在个人PC或虚拟机上使用ModelArts SDK,则需要在本地环境中安装ModelArts SDK,安装后可直接调用ModelArts SDK轻松管理数据集、创建ModelArts训练作业及创建AI应用,并将其部署为在线服务。本地ModelArts SDK不支持进行训练作业调测、模型调试和在开发环境中部署本地服务进行调试,当前仅 - [(可选)Session鉴权](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0123.md): Session模块的主要作用是实现与公有云资源的鉴权,并初始化ModelArts SDK Client、OBS Client。当成功建立Session后,您可以直接调用ModelArts的SDK接口。ModelArts开发环境Notebook不需要Session鉴权,可以直接使用。示例代码如下:from modelarts.session - [用户名密码认证模式](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0154.md): 本模式支持OBS管理、训练管理、模型管理、服务管理的鉴权。账号与用户的概念介绍,请参见IAM基本概念。获取您的账号、用户名等信息,请参见获取用户名、用户ID、项目名称、项目ID。使用账号认证username填写您的账号名。from modelarts.session import Session session = Session(use - [用户AK-SK认证模式](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0155.md): 本模式支持OBS管理、训练管理、模型管理、服务管理模块的鉴权。其中,各参数说明如下:access_key和secret_key获取方式如下:登录管理控制台,可单击控制台右上角的账户名,在菜单栏中单击我的凭证,进入我的凭证页面。在我的凭证 > 访问密钥中,单击新增访问密钥。在“新增访问密钥”弹窗中,填写该密钥的描述说明,单击确定。根据提示单 - [OBS管理概述](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0217.md): ModelArts SDK 1.1.3支持对OBS进行管理,主要涵盖上传下载文件和文件夹。具体包括如下操作:上传文件至OBS上传文件夹至OBS从OBS下载文件从OBS下载文件夹 - [文件传输(推荐)](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0437.md): 该接口支持上传本地文件和文件夹至OBS,支持下载OBS文件和文件夹至本地,推荐使用该接口。在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。 - [上传文件至OBS](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0218.md): 在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。示例代码执行后,本地源文件file1.txt被上传至bucket-name桶的dir1文件夹下,路径为obs://bucket-name/dir1/file1.txt。其中,桶名称和文件夹的名称均可以按照业 - [上传文件夹至OBS](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0219.md): 在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参考Session鉴权。示例代码执行后,本地源文件夹/ma-user/被上传至bucket-name桶的dir1文件夹下,路径为obs://bucket-name/dir1/ma-user/。其中,桶名称和文件夹的名称均可以按照业 - [从OBS下载文件](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0220.md): 在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参考Session鉴权。示例代码执行后,OBS源文件file1.txt被下载至/home/ma-user/file1.txt。 - [从OBS下载文件夹](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0221.md): 在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参考Session鉴权。示例代码执行后,OBS源文件夹dir1被下载至本地/home/ma-user/work/dir1/。下载到本地的路径需要有写权限。 - [查询数据集列表](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0327.md): 分页查询用户的数据集列表。示例一:查询数据集列表from modelarts.session import Session from modelarts.dataset import Dataset session = Session() # 查询数据集列表 dataset_list = Dataset.list_datasets(ses - [创建数据集](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0328.md): 创建数据集,支持从OBS中导入数据。创建数据集支持两种用法:根据标注类型创建数据集,一个数据集只能支持一种标注任务类型。create_dataset(session,dataset_name=None, dataset_type=None, data_sources=None, work_path=None, **kwargs)根据数据类 - [查询数据集详情](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0329.md): 查询数据集的详细信息,包括数据集的样本信息、版本信息等。查询数据集详情from modelarts.session import Session from modelarts.dataset import Dataset session = Session() dataset = Dataset(session, dataset_id) - [更新数据集](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0330.md): 更新数据集的名称和描述信息。更新数据集名称from modelarts.session import Session from modelarts.dataset import Dataset session = Session() dataset = Dataset(session, dataset_id) dataset.updat - [删除数据集](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0331.md): 根据数据集ID删除指定的数据集删除数据集from modelarts.session import Session from modelarts.dataset import Dataset session = Session() Dataset.delete_dataset(session, dataset_id="68ZXdK6CZ - [查询数据集版本列表](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0333.md): 查询数据集的版本列表。查询数据集版本列表from modelarts.session import Session from modelarts.dataset import Dataset session = Session() dataset = Dataset(session, dataset_id) version_list = - [创建数据集版本](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0334.md): 为数据集创建新的版本。示例一:为数据集创建新的版本from modelarts.session import Session from modelarts.dataset import Dataset session = Session() dataset = Dataset(session, dataset_id) create_ve - [查询数据集版本详情](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0335.md): 根据版本ID查询数据集指定版本的详细信息。查询数据集指定版本的详细信息from modelarts.session import Session from modelarts.dataset import Dataset session = Session() dataset = Dataset(session, dataset_id) - [删除数据集版本](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0336.md): 删除数据集的指定版本。删除数据集指定版本from modelarts.session import Session from modelarts.dataset import Dataset session = Session() dataset = Dataset(session, dataset_id) dataset.delete - [查询样本列表](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0338.md): 查询数据集的样本列表,不支持表格类型数据集。示例一:查询数据集样本列表from modelarts.session import Session from modelarts.dataset import Dataset session = Session() dataset = Dataset(session, dataset_id) - [查询单个样本详情](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0339.md): 根据样本ID查询数据集中指定样本的详细信息。根据ID查询数据集中样本的详细信息from modelarts.session import Session from modelarts.dataset import Dataset session = Session() dataset = Dataset(session, dataset - [批量删除样本](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0340.md): 根据样本的ID列表批量删除数据集中的样本。批量删除数据集中的样本from modelarts.session import Session from modelarts.dataset import Dataset session = Session() dataset = Dataset(session, dataset_id) sa - [查询导入任务列表](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0342.md): 查询数据集导入任务列表。查询数据集导入任务列表from modelarts.session import Session from modelarts.dataset import Dataset session = Session() dataset = Dataset(session, dataset_id) list_tasks_ - [创建导入任务](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0343.md): 支持从OBS中导入新的数据,导入方式包括目录导入和Manifest文件导入。不同类型的数据集支持的导入方式如表1所示。示例一:物体检测数据集目录导入from modelarts.session import Session from modelarts.dataset import Dataset session = Session() - [查询导入任务状态](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0344.md): 根据任务ID查询数据集导入任务的状态和详情。查询数据集导入任务的详情from modelarts.session import Session from modelarts.dataset import Dataset session = Session() dataset = Dataset(session, dataset_id) - [查询导出任务列表](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0346.md): 查询数据集导出任务列表。查询数据集导出任务列表from modelarts.session import Session from modelarts.dataset import Dataset session = Session() dataset = Dataset(session, dataset_id) list_tasks_ - [创建导出任务](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0347.md): 将当前数据集的样本导出到指定的OBS路径下。仅支持图像分类、物体检测、图像分割和自由格式数据集。导出数据集到OBS目录from modelarts.session import Session from modelarts.dataset import Dataset session = Session() dataset = Data - [查询导出任务状态](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0348.md): 根据任务ID查询数据集导出任务的状态和详情。查询数据集导出任务状态from modelarts.session import Session from modelarts.dataset import Dataset session = Session() dataset = Dataset(session, dataset_id) t - [Manifest管理概述](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0350.md): 在ModelArts使用过程中,需要做数据标注、模型训练、推理、数据集管理、市场发布等业务,这些业务都基于数据集进行的。为了规范对数据集的使用,适配各个使用场景,同时兼顾数据集管理的灵活性,本文档描述数据集管理的接口和描述规范——Manifest文件。Manifest文件中定义了标注对象和标注内容的对应关系。Manifest文件中也可以只 - [解析Manifest文件](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0351.md): 解析Manifest文件,支持本地和OBS。如果是OBS,需要Session信息。通过Manifest路径来解析获取Manifest的信息。from modelarts.session import Session from modelarts.dataset.format.manifest import Manifest path - [创建和保存Manifest文件](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0352.md): 需要先创建包含Manifest信息的对象,然后保存。Manifest信息请见表2。路径支持本地和OBS,如果是OBS,需要Session信息。在保存Manifest文件之前需要先创建包含Manifest信息的对象,包括Sample样本信息及其标签信息Annotation,然后将若干个样本组成Manifest。保存的时候调用save接口,将 - [解析Pascal VOC文件](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0353.md): 解析xml文件支持本地和OBS,如果是OBS,需要Session信息。指定xml路径,通过调用parse_xml来解析获取xml文件的信息。from modelarts.dataset.format.voc.pascal_voc import PascalVoc from modelarts.session import Session - [创建和保存Pascal VOC文件](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0354.md): 需要先创建包含Pascal VOC信息的对象,然后保存。Pascal VOC信息请见表2。路径支持本地和OBS,如果是OBS,需要Session信息。在保存Pascal VOC的XML文件之前需要先创建包含Pascal VOC信息的对象,包括voc object信息等。保存的时候调用save_xml接口,将session信息传入,即可保存 - [创建标注任务](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0380.md): 基于数据集创建标注任务。示例一:基于图像类型的数据集创建物体检测标注任务。from modelarts.session import Session from modelarts.dataset import Dataset session = Session() dataset = Dataset(session, dataset_i - [查询数据集的标注任务列表](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0381.md): 查询当前数据集的所有标注任务列表。示例一:查询数据集下所有的标注任务,根据标注任务创建时间降序排序。from modelarts.session import Session from modelarts.dataset import Dataset session = Session() dataset = Dataset(sessi - [查询标注任务详情](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0382.md): 查询标注任务的详细信息。查询标注任务的详情。 - [创建训练作业](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0422.md): 在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。ModelArts SDK不支持通过在AI Gallery中订阅的算法创建训练作业。示例一:提交常用框架训练作业Estimator中同时指定framework_type和framework_version, - [使用SDK调测单机训练作业](https://support.huaweicloud.com/sdkreference-modelarts/modelarts-distributed-0003.md): 代码中涉及到的OBS路径,请用户替换为自己的实际OBS路径。代码是以PyTorch为例编写的,不同的AI框架之间,整体流程是完全相同的,仅需修改6和10中的framework_type参数值即可,例如:MindSpore框架,此处framework_type=Ascend-Powered-Engine。代码如下:这里只列出最常用的一种方式 - [使用SDK调测多机分布式训练作业](https://support.huaweicloud.com/sdkreference-modelarts/modelarts-distributed-0005.md): 代码中涉及到的OBS路径,请用户替换为自己的实际OBS路径。代码是以PyTorch为例编写的,不同的AI框架之间,整体流程是完全相同的,仅需修改7和11中的 framework_type参数值即可,例如:MindSpore框架,此处framework_type=Ascend-Powered-Engine。参数解释:code_dir:必选参 - [查询训练作业列表](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0423.md): 在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。 - [查询训练作业详情](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0424.md): 在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。方式一:根据指定的job_id查询。from modelarts.session import Session from modelarts.estimatorV2 import Estimator ses - [更新训练作业描述](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0425.md): 在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。方式一:根据指定的job_id更新。from modelarts.session import Session from modelarts.estimatorV2 import Estimator ses - [删除训练作业](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0426.md): 在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。方式一:根据指定的job_id删除。方式二:根据创建训练作业生成的训练作业对象删除。无成功响应参数。 - [终止训练作业](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0427.md): 终止训练作业,只可终止创建中、等待中、运行中的作业。在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。方式一:根据指定的job_id终止。from modelarts.session import Session from modelarts.estima - [查询训练日志](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0428.md): 在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。方式一:根据指定的job_id查询。from modelarts.session import Session from modelarts.estimatorV2 import Estimator ses - [查询训练作业的运行指标](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0429.md): 在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。方式一:根据指定的job_id查询。方式二:根据创建训练作业生成的训练作业对象查询。 - [查询资源规格列表](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0431.md): 在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。 - [查询引擎规格列表](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0432.md): 在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。 - [模型调试](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0223.md): 训练完成后,可先在开发环境Notebook中创建本地模型,在开发环境Notebook调试完成后再部署到推理服务上。只支持使用ModelArts Notebook部署本地服务。在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。本地模型创建好后,可部署为本地服 - [导入模型](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0194.md): 导入模型功能包括:初始化已存在的模型,根据模型ID生成模型对象。创建模型。模型对象的属性,请参见查询模型详情。以PyTorch为例,编写模型文件。PyTorch模型包结构可参考模型包规范介绍。在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。方式1:初始化 - [查询模型列表](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0195.md): 在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。场景1:查询当前用户所有模型from modelarts.session import Session from modelarts.model import Model session = Sessi - [查询模型对象列表](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0196.md): 在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。场景1:查询当前用户所有模型对象from modelarts.session import Session from modelarts.model import Model session = Sess - [查询模型详情](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0197.md): 查询当前模型对象的信息。在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。方式1:根据导入模型生成的模型对象进行模型详情查询from modelarts.session import Session from modelarts.model import - [删除模型](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0198.md): 删除模型对象。在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。方式1:根据导入模型或模型调试生成的模型对象进行模型对象删除from modelarts.session import Session from modelarts.model import - [服务管理概述](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0200.md): 服务管理,包括将已创建成功的模型部署为在线服务或本地服务。可以实现在线预测、本地预测、服务详情查询、查看服务日志等功能。这里的在线服务包括predictor和transformer两类,都包括下文描述的功能,本章节以predictor服务为例进行说明。本章节的示例代码都是在ModelArts Notebook中实现的,如果在其它开发环境使 - [在开发环境中部署本地服务进行调试](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0202.md): 可以通过部署本地服务来进行调试,即在导入模型或模型调试后,在开发环境Notebook中部署Predictor进行本地推理。只支持使用ModelArts Notebook部署本地服务。开发环境本地服务Predictor和在线服务Predictor说明部署开发环境本地服务Predictor,即将模型文件部署在开发环境中,其环境规格取决于开发环 - [部署在线服务](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0201.md): 部署在线服务包括:已部署为在线服务的初始化。部署在线服务predictor。部署批量服务transformer。部署服务返回服务对象Predictor,其属性包括服务管理章节下的所有功能。在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。方式1:已部署为在 - [查询服务详情](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0203.md): 查询当前服务对象的详细信息。在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。方式1:根据部署在线服务生成的服务对象进行服务详情查询from modelarts.session import Session from modelarts.model imp - [推理服务测试](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0204.md): 推理服务在线测试支持文件、图片、json三种格式。通过部署为在线服务Predictor可以完成在线推理预测。在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。场景:部署在线服务Predictor的推理预测from modelarts.session imp - [查询服务列表](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0205.md): 获取当前用户服务列表。在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。场景1:查询当前用户所有服务from modelarts.session import Session from modelarts.model import Predictor - [查询服务对象列表](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0206.md): 获取当前用户服务对象列表。在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。场景1:查询当前用户所有服务对象from modelarts.session import Session from modelarts.model import Predicto - [更新服务配置](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0207.md): 更新当前服务对象配置。在ModelArts Notebook平台,Session鉴权无需输入鉴权参数;其它平台的Session鉴权请参考Session鉴权。方式1:根据部署在线服务生成的服务对象进行更新服务配置from modelarts.session import Session from modelarts.model import - [查询服务监控信息](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0208.md): 查询当前服务对象监控信息。在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。方式1:根据部署在线服务生成的服务对象进行查询服务监控from modelarts.session import Session from modelarts.model impo - [查询服务日志](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0209.md): 查询当前服务对象的日志信息。在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。方式1:根据部署在线服务生成的服务对象进行查询服务日志from modelarts.session import Session from modelarts.model imp - [删除服务](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0211.md): 删除服务存在如下两种删除方式。根据部署在线服务生成的服务对象删除服务。根据查询服务对象列表返回的服务对象删除服务。在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。方式1:根据部署在线服务生成的服务对象删除服务from modelarts.session - [轻量算力节点生命周期管理应用示例](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0475.md): 轻量算力节点生命周期管理包括轻量算力节点实例和超节点实例,可以覆盖轻量算力节点资源的创建、启动、状态查询等多个完整生命周期,服务支持用户在拥有大于python 3.7.x版本且小于3.10.x版本的平台对自己的Server实例进行端到端的生命周期管理。本章节主要讲解如何通过Python版SDK完成管理。本文主要介绍如何使用SDK完成模型训 - [查询用户所有轻量算力节点实例列表](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0453.md): 在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。 - [创建轻量算力节点](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0454.md): 在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。 - [查询轻量算力节点实例详情](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0455.md): 在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。 - [删除轻量算力节点实例](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0456.md): 在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。 - [实时同步用户所有轻量算力节点实例状态](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0457.md): 在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。 - [启动轻量算力节点实例](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0458.md): 在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。 - [停止轻量算力节点实例](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0459.md): 在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。 - [创建轻量算力节点超节点标签](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0460.md): 在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。 - [删除轻量算力节点超节点标签](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0461.md): 在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。 - [查询轻量算力节点超节点标签](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0462.md): 在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。 - [重装轻量算力节点服务器操作系统镜像](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0463.md): 在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。 - [切换轻量算力节点服务器操作系统镜像](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0464.md): 在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。 - [切换轻量算力节点超节点服务器操作系统镜像](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0465.md): 在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。 - [查询用户所有超节点实例详情](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0466.md): 在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。 - [查询指定超节点实例详情](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0467.md): 在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。 - [删除轻量算力节点超节点实例](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0468.md): 在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。 - [重启轻量算力节点实例](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0469.md): 在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。 - [启动轻量算力节点超节点服务器(开机)](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0470.md): 在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。 - [停止轻量算力节点超节点服务器(关机)](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0471.md): 在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。 - [轻量算力节点服务器挂载磁盘(仅Snt9b23机器支持)](https://support.huaweicloud.com/sdkreference-modelarts/modelarts_04_0472.md): 在ModelArts Notebook平台,Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。 ## CLI参考 - [如何使用CLI](https://support.huaweicloud.com/clir-modelarts/modelarts_cli_01.md): 华为云命令行工具服务(Koo Command Line Interface,KooCLI,原名HCloud CLI)是为发布在API Explorer上的云服务API提供的命令行管理工具。您可以通过此工具调用API Explorer中ModelArts开放的API,管理和使用您的ModelArts资源。关于KooCLI的详细信息,请参见什 - [CLI命令参考](https://support.huaweicloud.com/clir-modelarts/ModelArts-cli.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 ## 常见问题 - [使用ModelArts时提示“权限不足”,如何解决?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0148.md): 当您使用ModelArts时如果提示权限不足,请您按照如下指导对相关服务和用户进行授权,并检查用户权限。本案例中以OBS权限不足为例,介绍如何为用户授予OBS服务权限。其他权限不足的场景也可以参考本案例操作,只是授权范围不同。不同业务场景下的授权范围请参考权限依赖和委托章节。由于ModelArts的使用权限依赖OBS服务的授权,您需要为用 - [在Notebook中如何实现IAM用户隔离?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_4181.md): 开发环境如果需要实现IAM用户隔离,即多个IAM用户之间无法查看、修改和删除他人创建的Notebook。目前有两种方案:方案一:删除modelarts:notebook:listAllNotebooks细粒度权限。方案二:使用工作空间功能。 - [如何获取访问密钥?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0004.md): 登录华为云,在页面右上方单击控制台,进入华为云管理控制台。控制台入口在控制台右上角的账户名下方,单击我的凭证,进入我的凭证页面。我的凭证在我的凭证页面,选择访问密钥>新增访问密钥,如图3所示。单击新增访问密钥填写该密钥的描述说明,单击确定。根据提示单击立即下载,下载密钥。新增访问密钥密钥文件会直接保存到浏览器默认的下载文件夹中。打开名称为 - [使用ModelArts时提示“权限不足”,如何解决?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0148.md): 当您使用ModelArts时如果提示权限不足,请您按照如下指导对相关服务和用户进行授权,并检查用户权限。本案例中以OBS权限不足为例,介绍如何为用户授予OBS服务权限。其他权限不足的场景也可以参考本案例操作,只是授权范围不同。不同业务场景下的授权范围请参考权限依赖和委托章节。由于ModelArts的使用权限依赖OBS服务的授权,您需要为用 - [在Notebook中如何实现IAM用户隔离?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_4181.md): 开发环境如果需要实现IAM用户隔离,即多个IAM用户之间无法查看、修改和删除他人创建的Notebook。目前有两种方案:方案一:删除modelarts:notebook:listAllNotebooks细粒度权限。方案二:使用工作空间功能。 - [如何获取访问密钥?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0004.md): 登录华为云,在页面右上方单击控制台,进入华为云管理控制台。控制台入口在控制台右上角的账户名下方,单击我的凭证,进入我的凭证页面。我的凭证在我的凭证页面,选择访问密钥>新增访问密钥,如图3所示。单击新增访问密钥填写该密钥的描述说明,单击确定。根据提示单击立即下载,下载密钥。新增访问密钥密钥文件会直接保存到浏览器默认的下载文件夹中。打开名称为 - [在ModelArts中如何查看OBS目录下的所有文件?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0077.md): 在使用Notebook或训练作业时,需要查看目录下的所有文件,您可以通过如下方式实现:通过OBS管理控制台进行查看。使用当前账户登录OBS管理控制台,去查找对应的OBS桶、文件夹、文件。使用当前账户登录OBS管理控制台,去查找对应的OBS桶、文件夹、文件。通过接口判断路径是否存在。在已有的Notebook实例,或者创建一个Notebook - [如何创建OBS桶用于ModelArts存储数据?](https://support.huaweicloud.com/modelarts_faq/modelarts_08_0003.md): 由于ModelArts本身没有数据存储的功能,ModelArts使用对象存储服务(Object Storage Service,简称OBS)进行数据存储以及模型的备份和快照,实现安全、高可靠和低成本的存储需求。AI开发过程中的输入数据、输出数据、中间缓存数据都可以在OBS桶中进行存储、读取。因此,建议您在使用ModelArts之前先创建一 - [在ModelArts中如何查看OBS目录下的所有文件?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0077.md): 在使用Notebook或训练作业时,需要查看目录下的所有文件,您可以通过如下方式实现:通过OBS管理控制台进行查看。使用当前账户登录OBS管理控制台,去查找对应的OBS桶、文件夹、文件。使用当前账户登录OBS管理控制台,去查找对应的OBS桶、文件夹、文件。通过接口判断路径是否存在。在已有的Notebook实例,或者创建一个Notebook - [如何创建OBS桶用于ModelArts存储数据?](https://support.huaweicloud.com/modelarts_faq/modelarts_08_0003.md): 由于ModelArts本身没有数据存储的功能,ModelArts使用对象存储服务(Object Storage Service,简称OBS)进行数据存储以及模型的备份和快照,实现安全、高可靠和低成本的存储需求。AI开发过程中的输入数据、输出数据、中间缓存数据都可以在OBS桶中进行存储、读取。因此,建议您在使用ModelArts之前先创建一 - [如何定位Workflow运行报错](https://support.huaweicloud.com/modelarts_faq/modelarts_05_4200.md): 使用run模式运行工作流报错时,分析解决思路如下:确认安装的SDK包是否是最新版本,避免出现包版本不一致问题。检查编写的SDK代码是否符合规范,具体可参考相应的代码示例。检查运行过程中输入的内容是否正确,格式是否与提示信息中要求的一致。根据具体报错信息定位到报错的代码行,分析上下文逻辑。服务部署节点运行报错输入服务相关的参数后,执行报错如 - [如何定位Workflow运行报错](https://support.huaweicloud.com/modelarts_faq/modelarts_05_4200.md): 使用run模式运行工作流报错时,分析解决思路如下:确认安装的SDK包是否是最新版本,避免出现包版本不一致问题。检查编写的SDK代码是否符合规范,具体可参考相应的代码示例。检查运行过程中输入的内容是否正确,格式是否与提示信息中要求的一致。根据具体报错信息定位到报错的代码行,分析上下文逻辑。服务部署节点运行报错输入服务相关的参数后,执行报错如 - [在ModelArts数据集中添加图片对图片大小有限制吗?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0102.md): 在数据管理功能中,针对物体检测或图像分类的数据集,在数据集中上传更多的图片时,是有限制的。要求单张图片大小不超过8MB,且只支持JPG、JPEG、PNG和BMP四种格式的图片。解决方案:方法1:使用导入功能。将图片上传至OBS任意目录,通过“从OBS目录导入”方式导入到已有数据集。方法2:使用同步数据源功能。将图片上传到数据集输入目录下( - [如何将本地标注的数据导入ModelArts?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0139.md): ModelArts支持通过导入数据集的操作,导入更多数据。本地标注的数据,当前支持从OBS目录导入或从Manifest文件导入两种方式。导入之后您还可以在ModelArts数据管理模块中对数据进行重新标注或修改标注情况。从OBS目录导入或从Manifest文件导入的详细操作指导和规范说明请参见导入数据。 - [在ModelArts中数据标注完成后,标注结果存储在哪里?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0193.md): ModelArts管理控制台,提供了数据可视化能力,您可以在控制台查看详细数据以及标注信息。如需了解标注结果的存储路径,请参见如下说明。针对ModelArts中的数据集,在创建数据集时,需指定数据集输入位置和数据集输出位置。两个参数填写的均是OBS路径。数据集输入位置即原始数据存储的OBS路径。数据集输出位置,指在ModelArts完成数 - [在ModelArts中如何将标注结果下载至本地?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0194.md): ModelArts数据集中的标注信息和数据在发布后,将以manifest格式存储在数据集输出位置对应的OBS路径下。路径获取方式:在ModelArts管理控制台(旧版),进入资产管理 > 数据集。选择需查看数据集,单击名称左侧小三角,展开数据集详情。可获得数据集输出位置指定的OBS路径。进入OBS管理控制台,根据上述步骤获得的路径,找到对 - [在ModelArts中进行团队标注时,为什么团队成员收不到邮件?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0195.md): 团队标注时,成员收不到邮件的可能原因如下:当数据集中的所有数据已完成标注,即“未标注”数据为空时,创建的团队标注任务,因为没有数据需要标注,不会给团队成员发送标注邮件。在发起团队标注任务时,请确保数据集中存在“未标注”数据。只有当创建团队标注任务时,标注人员才会收到邮件。创建标注团队及添加标注团队的成员并不会发送邮件。请确保您的邮箱已完成 - [ModelArts团队标注的数据分配机制是什么?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0255.md): 目前不支持用户自定义成员任务分配,数据是平均分配的。当数量和团队成员人数不成比例,无法平均分配时,则将多余的几张图片,随机分配给团队成员。如果样本数少于待分配成员数时,部分成员会存在未分配到样本的情况。样本只会分配给labeler,比如10000张都是未标注,且5个都是labeler的话,那就是每个人分2000。 - [如何将两个ModelArts数据集合并?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0254.md): 目前不支持直接合并。但是可以参考如下操作方式,将两个数据集的数据合并在一个数据集中。例如需将数据集A和数据集B进行合并。分别将数据集A和数据集B进行发布。发布后可获得数据集A和数据集B的Manifest文件。可通过数据集的数据集输出位置获得此文件。创建一个空数据集C,即无任何输出,其输入位置选择一个空的OBS文件夹。在数据集C中,执行导入 - [在ModelArts中同一个账户,图片展示角度不同是为什么?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0367.md): 有的图片存在旋转角度等属性,不同的浏览器的处理策略不同,对浏览器的兼容性如表1和表2所示。L代表last,L3-产品版本上线时最新的3个稳定浏览器版本。如果您当前使用的浏览器版本过低,将在一定程度上影响页面的显示效果,系统会提示您尽快对浏览器进行升级。如果您当前使用的浏览器不支持访问管理控制台,系统会建议您对浏览器进行升级或安装支持的浏览 - [在ModelArts中智能标注完成后新加入数据需要重新训练吗?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0368.md): 智能标注完成后,需要对标注结果进行确认。如果未确认标注结果,直接加入新数据,重新智能标注,会将待确认的数据和新加入的数据全部重新训练。如果确认标注结果后,再加入新数据,只重新训练标注新的数据。 - [在ModelArts中如何将图片划分到验证集或者训练集?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0506.md): 目前只能指定切分比例,随机将样本划分到训练集或者验证集,不支持指定。在发布数据集时,仅“图像分类”、“物体检测”、“文本分类”和“声音分类”类型数据集支持进行数据切分功能。一般默认不启用该功能。启用后,需设置对应的训练验证比例。输入“训练集比例”,数值只能是0~1区间内的数。设置好“训练集比例”后,“验证集比例”自动填充。“训练集比例”加 - [在ModelArts中物体检测标注时能否自定义标签?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0507.md): 可以通过修改数据集给标签添加自定义属性来设置一些自定义的属性。 - [ModelArts数据集新建的版本找不到怎么办?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0511.md): 版本列表是可以缩放的,请缩小页面后查找。单击数据集名称,进入数据集概览页,在概览页选择“版本管理”,可对页面进行缩小。 - [如何切分ModelArts数据集?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3144.md): 在发布数据集时,仅“图像分类”、“物体检测”、“文本分类”和“声音分类”类型数据集支持进行数据切分功能。一般默认不启用该功能。启用后,需设置对应的训练验证比例。输入“训练集比例”,数值只能是0~1区间内的数。设置好“训练集比例”后,“验证集比例”自动填充。“训练集比例”加“验证集比例”等于1。“训练集比例”即用于训练模型的样本数据比例;“ - [如何删除ModelArts数据集中的图片?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3142.md): 登录ModelArts管理控制台(旧版),左侧菜单栏选择“数据准备 > 数据标注”,进入数据标注列表,单击需要删除图片的数据集,进入标注详情页。在“全部”、“未标注”或“已标注”页面中,依次选中需要删除的图片,或者“选择当前页”选中该页面所有图片,然后单击删除。在弹出的对话框中,根据实际情况选择是否勾选“同时删除OBS源文件”,确认信息无 - [数据集图片无法显示,如何解决?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0125.md): 创建的数据集,在进行标注时无法显示图片,单击单张图片也无法查看。或者数据集中提示图片加载异常。可能由于用户本地网络原因,无法正常访问OBS导致图片无法正常加载。可能由于没有OBS桶的访问权限导致,请检查数据集输入位置所在的OBS桶,是否具有访问权限。可能是OBS桶加密或者OBS文件加密导致。可能跟OBS桶的存储类别有关,并行文件系统不支持 - [在ModelArts数据集中添加图片对图片大小有限制吗?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0102.md): 在数据管理功能中,针对物体检测或图像分类的数据集,在数据集中上传更多的图片时,是有限制的。要求单张图片大小不超过8MB,且只支持JPG、JPEG、PNG和BMP四种格式的图片。解决方案:方法1:使用导入功能。将图片上传至OBS任意目录,通过“从OBS目录导入”方式导入到已有数据集。方法2:使用同步数据源功能。将图片上传到数据集输入目录下( - [如何将本地标注的数据导入ModelArts?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0139.md): ModelArts支持通过导入数据集的操作,导入更多数据。本地标注的数据,当前支持从OBS目录导入或从Manifest文件导入两种方式。导入之后您还可以在ModelArts数据管理模块中对数据进行重新标注或修改标注情况。从OBS目录导入或从Manifest文件导入的详细操作指导和规范说明请参见导入数据。 - [在ModelArts中数据标注完成后,标注结果存储在哪里?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0193.md): ModelArts管理控制台,提供了数据可视化能力,您可以在控制台查看详细数据以及标注信息。如需了解标注结果的存储路径,请参见如下说明。针对ModelArts中的数据集,在创建数据集时,需指定数据集输入位置和数据集输出位置。两个参数填写的均是OBS路径。数据集输入位置即原始数据存储的OBS路径。数据集输出位置,指在ModelArts完成数 - [在ModelArts中如何将标注结果下载至本地?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0194.md): ModelArts数据集中的标注信息和数据在发布后,将以manifest格式存储在数据集输出位置对应的OBS路径下。路径获取方式:在ModelArts管理控制台(旧版),进入资产管理 > 数据集。选择需查看数据集,单击名称左侧小三角,展开数据集详情。可获得数据集输出位置指定的OBS路径。进入OBS管理控制台,根据上述步骤获得的路径,找到对 - [在ModelArts中进行团队标注时,为什么团队成员收不到邮件?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0195.md): 团队标注时,成员收不到邮件的可能原因如下:当数据集中的所有数据已完成标注,即“未标注”数据为空时,创建的团队标注任务,因为没有数据需要标注,不会给团队成员发送标注邮件。在发起团队标注任务时,请确保数据集中存在“未标注”数据。只有当创建团队标注任务时,标注人员才会收到邮件。创建标注团队及添加标注团队的成员并不会发送邮件。请确保您的邮箱已完成 - [ModelArts团队标注的数据分配机制是什么?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0255.md): 目前不支持用户自定义成员任务分配,数据是平均分配的。当数量和团队成员人数不成比例,无法平均分配时,则将多余的几张图片,随机分配给团队成员。如果样本数少于待分配成员数时,部分成员会存在未分配到样本的情况。样本只会分配给labeler,比如10000张都是未标注,且5个都是labeler的话,那就是每个人分2000。 - [如何将两个ModelArts数据集合并?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0254.md): 目前不支持直接合并。但是可以参考如下操作方式,将两个数据集的数据合并在一个数据集中。例如需将数据集A和数据集B进行合并。分别将数据集A和数据集B进行发布。发布后可获得数据集A和数据集B的Manifest文件。可通过数据集的数据集输出位置获得此文件。创建一个空数据集C,即无任何输出,其输入位置选择一个空的OBS文件夹。在数据集C中,执行导入 - [在ModelArts中同一个账户,图片展示角度不同是为什么?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0367.md): 有的图片存在旋转角度等属性,不同的浏览器的处理策略不同,对浏览器的兼容性如表1和表2所示。L代表last,L3-产品版本上线时最新的3个稳定浏览器版本。如果您当前使用的浏览器版本过低,将在一定程度上影响页面的显示效果,系统会提示您尽快对浏览器进行升级。如果您当前使用的浏览器不支持访问管理控制台,系统会建议您对浏览器进行升级或安装支持的浏览 - [在ModelArts中智能标注完成后新加入数据需要重新训练吗?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0368.md): 智能标注完成后,需要对标注结果进行确认。如果未确认标注结果,直接加入新数据,重新智能标注,会将待确认的数据和新加入的数据全部重新训练。如果确认标注结果后,再加入新数据,只重新训练标注新的数据。 - [在ModelArts中如何将图片划分到验证集或者训练集?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0506.md): 目前只能指定切分比例,随机将样本划分到训练集或者验证集,不支持指定。在发布数据集时,仅“图像分类”、“物体检测”、“文本分类”和“声音分类”类型数据集支持进行数据切分功能。一般默认不启用该功能。启用后,需设置对应的训练验证比例。输入“训练集比例”,数值只能是0~1区间内的数。设置好“训练集比例”后,“验证集比例”自动填充。“训练集比例”加 - [在ModelArts中物体检测标注时能否自定义标签?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0507.md): 可以通过修改数据集给标签添加自定义属性来设置一些自定义的属性。 - [ModelArts数据集新建的版本找不到怎么办?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0511.md): 版本列表是可以缩放的,请缩小页面后查找。单击数据集名称,进入数据集概览页,在概览页选择“版本管理”,可对页面进行缩小。 - [如何切分ModelArts数据集?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3144.md): 在发布数据集时,仅“图像分类”、“物体检测”、“文本分类”和“声音分类”类型数据集支持进行数据切分功能。一般默认不启用该功能。启用后,需设置对应的训练验证比例。输入“训练集比例”,数值只能是0~1区间内的数。设置好“训练集比例”后,“验证集比例”自动填充。“训练集比例”加“验证集比例”等于1。“训练集比例”即用于训练模型的样本数据比例;“ - [如何删除ModelArts数据集中的图片?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3142.md): 登录ModelArts管理控制台(旧版),左侧菜单栏选择“数据准备 > 数据标注”,进入数据标注列表,单击需要删除图片的数据集,进入标注详情页。在“全部”、“未标注”或“已标注”页面中,依次选中需要删除的图片,或者“选择当前页”选中该页面所有图片,然后单击删除。在弹出的对话框中,根据实际情况选择是否勾选“同时删除OBS源文件”,确认信息无 - [数据集图片无法显示,如何解决?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0125.md): 创建的数据集,在进行标注时无法显示图片,单击单张图片也无法查看。或者数据集中提示图片加载异常。可能由于用户本地网络原因,无法正常访问OBS导致图片无法正常加载。可能由于没有OBS桶的访问权限导致,请检查数据集输入位置所在的OBS桶,是否具有访问权限。可能是OBS桶加密或者OBS文件加密导致。可能跟OBS桶的存储类别有关,并行文件系统不支持 - [ModelArts的Notebook是否支持Keras引擎?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0042.md): 开发环境中的Notebook支持。训练作业和模型部署(即推理)暂时不支持。Keras是一个用Python编写的高级神经网络API,它能够以TensorFlow、CNTK或者Theano作为后端运行。Notebook开发环境支持tf.keras。在ModelArts管理控制台,创建一个Notebook实例,镜像选择TensorFlow-1. - [如何在ModelArts的Notebook中上传下载OBS文件?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0024.md): 在Notebook中可以通过调用ModelArts的Moxing接口或者SDK接口与OBS交互,将Notebook中的文件上传至OBS,或者下载OBS中的文件至Notebook中。使用OBS客户端上传文件的操作指导:上传文件MoXing是ModelArts自研的分布式训练加速框架,构建于开源的深度学习引擎TensorFlow、PyTorc - [ModelArts的Notebook实例upload后,数据会上传到哪里?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0045.md): 针对这个问题,有两种情况:如果您创建的Notebook使用OBS存储实例时单击upload后,数据将直接上传到该Notebook实例对应的OBS路径下,即创建Notebook时指定的OBS路径。单击upload后,数据将直接上传到该Notebook实例对应的OBS路径下,即创建Notebook时指定的OBS路径。如果您创建的Noteboo - [在ModelArts中如何将Notebook A的数据复制到Notebook B中?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3172.md): 目前不支持直接将Notebook A的数据复制到Notebook B,如果需要复制数据,可参考如下步骤操作:将Notebook A的数据上传至OBS;下载OBS中的数据至Notebook B。文件的上传下载详细操作请参考如何在ModelArts的Notebook中上传下载OBS文件?。 - [在ModelArts的Notebook中如何对OBS的文件重命名?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0085.md): 由于OBS管理控制台不支持对OBS的文件重命名,当您需要对OBS文件进行重命名时需要通过调用MoXing API实现,在已有的或者新创建的Notebook中,执行如下命令,通过接口对OBS中的文件进行重命名。具体操作如下:如下示例为将文件obs_file.txt重命名为obs_file_2.txt。import moxing as mox - [在ModelArts的Notebook中如何使用pandas库处理OBS桶中的数据?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0112.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [在ModelArts的Notebook中,如何访问其他账号的OBS桶?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0252.md): 创建Notebook时选择OBS存储,这种情况下只能访问到自己账号下的桶,无法访问到其他账号的OBS桶。如果需要在Notebook中,访问其他账号的OBS文件,前提是,需获取目标OBS桶的读写权限。首先,请联系OBS桶的创建者,参考对其他账号授予桶的读写权限指导,授予当前账号OBS桶的读写权限。此操作指导是某一华为云账号将其OBS桶权限授 - [在ModelArts的Notebook中JupyterLab默认工作路径是什么?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0256.md): 带OBS存储的Notebook实例JupyterLab文件默认存储路径,为创建Notebook时指定的OBS路径。在文件列表的所有文件读写操作都是基于所选择的OBS路径下的内容操作的,跟当前实例空间没有关系。如果用户需要将内容同步到实例空间,需使用JupyterLab上传下载功能。JupyterLab文件默认存储路径,为创建Noteboo - [如何查看ModelArts的Notebook使用的cuda版本?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_01651.md): 登录ModelArts管理控制台,在左侧导航栏按需选择以下操作。新版控制台:选择模型开发与训练 > Notebook,进入Notebook页面。旧版控制台:选择开发空间 > Notebook,进入Notebook页面。新版控制台:选择模型开发与训练 > Notebook,进入Notebook页面。旧版控制台:选择开发空间 > Notebo - [在ModelArts的Notebook中如何获取本机外网IP?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0240.md): 本机的外网IP地址可以在主流搜索引擎中搜索“IP地址查询”获取。 - [ModelArts的Notebook有代理吗?如何关闭?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3213.md): Notebook有代理。执行env | grep proxy命令查询Notebook代理。执行unset https_proxy unset http_proxy命令关闭代理。 - [在ModelArts的Notebook中内置引擎不满足使用需要时,如何自定义引擎IPython Kernel?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_4195.md): 当前Notebook默认内置的引擎环境不能满足用户诉求,用户可以新建一个conda env按需搭建自己的环境。本小节以搭建一个“python3.6.5和tensorflow1.2.0”的IPython Kernel为例进行展示。创建conda env。在Notebook的Terminal中执行如下命令。其中,my-env是虚拟环境名称,用 - [在ModelArts的Notebook中如何将git clone的py文件变为ipynb文件?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3161.md): 在ModelArts的Notebook中如何将git clone的py文件变为ipynb文件?在ipynb文件中,执行%load XXX.py命令,即可将py文件内容加载到ipynb中。以“test.py”文件为例,下图展示了如何将“test.py”的文件内容加载到ipynb文件中。 - [在ModelArts的Notebook实例重启时,数据集会丢失吗?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3163.md): ModelArts提供的Notebook实例是以ma-user启动的,用户进入实例后,工作目录默认是/home/ma-user/work。创建实例,/home/ma-user/work目录下挂载的数据,在实例停止、重新启动后依然保留,容器内部非挂载的目录内容会还原。 - [在ModelArts的Notebook的Jupyterlab可以安装插件吗?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3164.md): Jupyter可以安装插件。目前Jupyter插件多数采用wheel包的形式发布,一次性完成前后端插件的安装,安装时注意使用Jupyter服务依赖的环境/modelarts/authoring/notebook-conda/bin/pip进行安装,不要使用默认的Anaconda(kernel依赖的python环境)的pip进行安装。使用命 - [在ModelArts的Notebook的CodeLab中能否使用昇腾卡进行训练?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3166.md): 有以下两种情况。在旧版ModelArts管理控制台总览页面的“常用功能”区域打开CodeLab,使用CPU或GPU资源,无法使用昇腾卡训练。CodeLab如果您使用的是新版控制台,请在左侧导航栏最下方单击返回旧版,然后在总览页面打开CodeLab。仅“华北-北京四”区域支持CodeLab功能。如果您使用的是新版控制台,请在左侧导航栏最下方 - [如何在ModelArts的Notebook的CodeLab上安装依赖?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3167.md): ModelArts CodeLab中已安装Jupyter、Python程序包等多种环境,您也可以使用pip install在Notebook或Terminal中安装依赖包。登录旧版ModelArts管理控制台,在总览页面的常用功能 > 开发工具区域下方,单击CodeLab卡片进入CodeLab。如果您使用的是新版控制台,请在左侧导航栏最下 - [在ModelArts的Notebook中安装远端插件时不稳定要怎么办?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0299.md): 方法一:离线包安装方式(推荐)到VS Code插件官网vscode_marketplace搜索待安装的Python插件,Python插件路径。单击进入Python插件的Version History页签后,下载该插件的离线安装包,如图所示。Python插件离线安装包在本地VS Code环境中,将下载好的.vsix文件拖动到远端Notebo - [在ModelArts的Notebook中实例重新启动后要怎么连接?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0300.md): 可以在本地的ssh config文件中对这个Notebook配置参数“StrictHostKeyChecking no”和“UserKnownHostsFile=/dev/null”,如下参考所示:提示:因为SSH登录时会忽略known_hosts文件,有安全风险 - [在ModelArts的Notebook中使用VS Code调试代码无法进入源码怎么办?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0301.md): 如果已有launch.json文件,请直接看步骤三。步骤一:打开launch.json文件方法一:单击左侧菜单栏的Run(Ctrl+Shift+D)按钮,再单击create a launch.json file。如下图所示:方法二:单击上侧菜单栏中的Run > Open configurations按钮方法一:单击左侧菜单栏的Run(Ct - [在ModelArts的Notebook中使用VS Code如何查看远端日志?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0305.md): 在VS Code环境中执行Ctrl+Shift+P搜show logs选择Remote Server。也可在如下截图的红框处切换至其他的Log - [在ModelArts的Notebook中如何打开VS Code的配置文件settings.json?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0306.md): 在VS Code环境中执行Ctrl+Shift+P搜Open User Settings (JSON) - [在ModelArts的Notebook中如何设置VS Code背景色为豆沙绿?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0307.md): 在VS Code的配置文件settings.json中添加如下参数"workbench.colorTheme": "Atom One Light", "workbench.colorCustomizations": { "[Atom One Light]": { "editor.background": "#C7EDCC", " - [在ModelArts的Notebook中如何设置VS Code远端默认安装的插件?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0308.md): 在VS Code的配置文件settings.json中添加remote.SSH.defaultExtensions参数,如自动安装Python和Maven插件,可配置如下。其中,插件名称可以单击VS Code的某个插件后获取,如下所示。 - [在ModelArts的VS Code中如何把本地插件安装到远端或把远端插件安装到本地?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0309.md): 在VS Code的环境中执行Ctrl+Shift+P搜install local,按需选择即可 - [在ModelArts的Notebook中,如何使用昇腾多卡进行调试?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3173.md): 昇腾多卡训练任务是多进程多卡模式,跑几卡需要起几个python进程。昇腾底层会读取环境变量:RANK_TABLE_FILE,开发环境已经设置,用户无需关注。比如跑八卡,可以如下片段代码:其中,train.py中设置环境变量DEVICE_ID: - [在ModelArts的Notebook中使用不同的资源规格训练时为什么训练速度差不多?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3147.md): 如果用户的代码中训练任务是单进程的,使用Notebook 8核64GB,72核512GB训练的速度是基本一致的,例如用户用的是2核4GB的资源,使用4核8GB,或者8核64GB效果是一样的。如果用户的代码中训练任务是多进程的,使用Notebook 72核512GB训练速度要优于8核64GB。 - [在ModelArts的Notebook中使用MoXing时,如何进行增量训练?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0076.md): 在使用MoXing构建模型时,如果您对前一次训练结果不满意,可以在更改部分数据和标注信息后,进行增量训练。在完成标注数据或数据集的修改后,您可以在mox.run中,修改log_dir参数,并新增checkpoint_path参数。其中log_dir参数建议设置为一个新的目录,checkpoint_path参数设置为上一次训练结果输出路径, - [在ModelArts的Notebook中如何查看GPU使用情况?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0082.md): 创建Notebook时,当您选择的类型为GPU时,查看GPU使用情况具体操作如下:登录ModelArts管理控制台,按需选择以下操作。新版控制台:选择模型开发与训练 > Notebook,进入Notebook页面。旧版控制台:选择开发空间 > Notebook,进入Notebook页面。新版控制台:选择模型开发与训练 > Notebook - [在ModelArts的Notebook中如何在代码中打印GPU使用信息?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0374.md): 用户可通过shell命令或python命令查询GPU使用信息。执行nvidia-smi命令。依赖CUDA nvccwatch -n 1 nvidia-smi依赖CUDA nvcc执行gpustat命令。pip install gpustatgpustat -cp -i使用Ctrl+C可以退出。使用Ctrl+C可以退出。执行nvidia-m - [在ModelArts的Notebook中JupyterLab的目录、Terminal的文件和OBS的文件之间的关系是什么?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0245.md): JupyterLab目录的文件与Terminal中work目录下的文件相同。即用户在Notebook中新建的,或者是从OBS目录中同步的文件。挂载OBS存储的Notebook,JupyterLab目录的文件可以与OBS的文件进行同步,使用JupyterLab文件上传下载功能。Terminal的文件与JupyterLab目录的文件相同。挂载 - [如何在ModelArts的Notebook实例中使用ModelArts数据集?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0377.md): ModelArts上创建的数据集存放在OBS中,可以将OBS中的数据下载到Notebook中使用。Notebook中读取OBS数据方式请参见如何在ModelArts的Notebook中上传下载OBS文件?。 - [pip介绍及常用命令](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3113.md): pip是通用的python包的管理工具。它提供了对Python包的查找、下载、安装和卸载的功能。 - [在ModelArts的Notebook中不同规格资源/cache目录的上限是多少?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3151.md): 创建Notebook时,可以根据业务数据量的大小选择资源。ModelArts会挂载硬盘至“/cache”目录,用户可以使用此目录来储存临时文件。“/cache”与代码目录共用资源,不同资源规格有不同的容量。不建议在/cache盘中存放重要数据。容器崩溃、节点故障或资源不足(如内存或存储限制被突破)等异常情况都可能导致实例重启,从而导致/c - [资源超分对在ModelArts的Notebook实例有什么影响?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_4183.md): Notebook超分,是指一个节点中CPU、内存共享的场景。为了充分利用资源,在专属池中存在超分情况。举例:一个专属池中有1个8U64G的CPU节点,如创建2U8G规格的Notebook,因为超分最多可启动 8U/(2U*0.6)= 6.67个Notebook实例。这里的0.6就是超分比率。即启动该Notebook实例最少需要1.2U的C - [如何在Notebook中安装外部库?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0022.md): ModelArts Notebook中已安装Jupyter、Python程序包等多种环境,包括TensorFlow、MindSpore、PyTorch、Spark等。您也可以使用pip install在Notebook或Terminal中安装外部库。例如,通过JupyterLab在TensorFlow-1.8的环境中安装Shapely。打 - [在ModelArts的Notebook中,访问外网速度不稳定怎么办?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_4211.md): 为了方便AI开发者在使用Notebook时访问外部资源,ModelArts提供了一个免费的共享网络代理服务。借助这个代理,开发者可以更加便捷地下载所需的各类资源,助力开发工作的顺利进行。由于该网络代理免费且共享,其性能会受到实时访问量大小的显著影响。当众多用户同时使用代理进行资源下载时,网络带宽会被大量占用,从而导致代理速度下降,下载速度 - [Notebook是否支持使用gdb工具?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_4300.md): Notebook目前不支持gdb工具的使用。gdb工具的运行依赖开启特权容器(privileged container)的Docker,而开发环境的容器出于安全考虑,无法开启特权容器,因此不支持在Notebook中使用gdb工具。 - [CodeLab打开Terminal后超时](https://support.huaweicloud.com/modelarts_faq/modelarts_05_4302.md): 在Codelab创建Notebook后,打开Terminal,如果2分钟以上不使用Terminal,窗口会重连。方案一:在超时前重连。方案二:直接创建Notebook,超时时间会延长。具体步骤,请参见创建Notebook实例。 - [为什么在ModelArts的Notebook中训练出现昇腾910的NPU-2 AIcore使用率低,但HBM使用率高的情况?](https://support.huaweicloud.com/modelarts_faq/modelarts_notebook_4303.md): 在ModelArts的Notebook中训练出现NPU的昇腾910的NPU-2 AIcore使用率低,但高带宽内存HBM(High Bandwidth Memory)使用率高的情况,可能有以下原因:代码适配问题未充分利用NPU特性:PyTorch在GPU和NPU上运行时,底层的计算模型和优化策略有所不同。虽然代码在GPU上可以正常运行,但 - [如何在ModelArts的Notebook或轻量算力节点查看CANN路径?](https://support.huaweicloud.com/modelarts_faq/modelarts_notebook_4304.md): 通过环境变量查询CANN安装后通常会设置相应的环境变量。您可以通过查看这些环境变量来获取安装路径。最常用的环境变量是ASCEND_HOME_PATH。打开终端,执行以下命令:echo $ASCEND_HOME_PATH如果该环境变量已设置,终端将输出CANN的安装路径。通过环境变量查询示例CANN安装后通常会设置相应的环境变量。您可以通过 - [为什么自定义规格的Notebook在设置空闲停止后长时间未停止?](https://support.huaweicloud.com/modelarts_faq/modelarts_notebook_4305.md): 用户创建了一个自定义规格的Notebook实例(例如:0.5核CPU + 1 GiB内存),并开启了空闲自动停止功能(例如:将空闲时间设置为15分钟)。然而,该实例在长时间无操作后并未按预期自动停止。平台判定Notebook实例是否空闲的依据是实例的资源占用率是否持续低于预设的阈值。只有当CPU、内存等关键资源的占用率均低于该阈值时,才会 - [在Notebook中上传远端文件时,出现“确认取消上传吗”对话框,如何处理?](https://support.huaweicloud.com/modelarts_faq/modelarts_notebook_4306.md): 在Notebook中上传远端文件时,单击上传,出现“确认取消上传吗”对话框。您可以任选以下方式解决问题。方式一:忽略“确认取消上传吗”对话框,刷新浏览器,重新上传文件。方式二:打开Terminal命令行窗口。Terminal在Terminal中,通过wget命令下载文件。# 下载单个文件 wget ${文件链接} # 指定输出文件名 - [远程主机不满足VS Code服务器对GLIBC和libstdc++的版本要求怎么办?](https://support.huaweicloud.com/modelarts_faq/modelarts_notebook_4309.md): 通过VS Code远程连接Notebook实例时,出现以下报错:您的远程主机上安装的GLIBC或libstdc++版本无法满足VS Code远程开发插件的要求。任选以下方式进行解决。方式一:使用VS Code 1.85.2或者1.86.2版本且Notebook实例使用的镜像GLIBC<2.28。具体操作,请参见安装VS Code软件。您可 - [当前所选资源池不支持开启选择容器运行用户ID,怎么办?](https://support.huaweicloud.com/modelarts_faq/modelarts_notebook_4307.md): 创建Notebook时,“环境配置 > 选择容器运行用户 ID”无法开启,显示“当前所选资源池不支持开启选择容器运行用户ID”。公共资源池不支持使用root启动Notebook实例。华为云ModelArts针对专属资源池网络进行安全加固和优化,仅新网络模式下专属资源池支持root启动Notebook实例,旧网络模式的专属资源池无法支持此功 - [如何在Notebook中离线安装本地VS Code对应版本的VS Code Server?](https://support.huaweicloud.com/modelarts_faq/modelarts_notebook_4310.md): 您可以参照以下步骤,在Notebook中离线安装本地VS Code对应版本的VS Code Server。打开VS Code,选择Help>About,并记下“Commit”的ID码。确认创建Notebook实例使用的镜像的系统架构,可以在Notebook中打开Terminal,通过命令uname -m查看。下载对应版本的vscode-s - [在Code Server中打开.ipynb文件,首次执行代码单元格有明显延迟,怎么办?](https://support.huaweicloud.com/modelarts_faq/modelarts_notebook_4308.md): 在Code Server中打开.ipynb文件时,首次执行代码单元格(Cell)出现明显延迟(约30秒以上)。当前使用的镜像环境中缺少ipykernel依赖包。当用户首次运行Notebook文件时,Code Server会自动触发后台安装流程,由于需从官方源下载并编译依赖项,导致初始化过程耗时较长。建议您手动安装ipykernel。在Co - [Notebook实例中为什么会自动出现.modelarts目录?](https://support.huaweicloud.com/modelarts_faq/modelarts_notebook_4311.md): 当您在创建或启动Notebook实例时,Notebook会自动在$WORK_DIR/.modelarts目录下生成配置文件和脚本,用于支持pipeline、性能分析插件、AI Agent插件以及Code Server等功能。本文介绍.modelarts配置目录的结构和各文件的用途。$WORK_DIR为Notebook实例的工作目录,$IN - [ModelArts的Notebook是否支持Keras引擎?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0042.md): 开发环境中的Notebook支持。训练作业和模型部署(即推理)暂时不支持。Keras是一个用Python编写的高级神经网络API,它能够以TensorFlow、CNTK或者Theano作为后端运行。Notebook开发环境支持tf.keras。在ModelArts管理控制台,创建一个Notebook实例,镜像选择TensorFlow-1. - [如何在ModelArts的Notebook中上传下载OBS文件?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0024.md): 在Notebook中可以通过调用ModelArts的Moxing接口或者SDK接口与OBS交互,将Notebook中的文件上传至OBS,或者下载OBS中的文件至Notebook中。使用OBS客户端上传文件的操作指导:上传文件MoXing是ModelArts自研的分布式训练加速框架,构建于开源的深度学习引擎TensorFlow、PyTorc - [ModelArts的Notebook实例upload后,数据会上传到哪里?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0045.md): 针对这个问题,有两种情况:如果您创建的Notebook使用OBS存储实例时单击upload后,数据将直接上传到该Notebook实例对应的OBS路径下,即创建Notebook时指定的OBS路径。单击upload后,数据将直接上传到该Notebook实例对应的OBS路径下,即创建Notebook时指定的OBS路径。如果您创建的Noteboo - [在ModelArts中如何将Notebook A的数据复制到Notebook B中?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3172.md): 目前不支持直接将Notebook A的数据复制到Notebook B,如果需要复制数据,可参考如下步骤操作:将Notebook A的数据上传至OBS;下载OBS中的数据至Notebook B。文件的上传下载详细操作请参考如何在ModelArts的Notebook中上传下载OBS文件?。 - [在ModelArts的Notebook中如何对OBS的文件重命名?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0085.md): 由于OBS管理控制台不支持对OBS的文件重命名,当您需要对OBS文件进行重命名时需要通过调用MoXing API实现,在已有的或者新创建的Notebook中,执行如下命令,通过接口对OBS中的文件进行重命名。具体操作如下:如下示例为将文件obs_file.txt重命名为obs_file_2.txt。import moxing as mox - [在ModelArts的Notebook中如何使用pandas库处理OBS桶中的数据?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0112.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [在ModelArts的Notebook中,如何访问其他账号的OBS桶?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0252.md): 创建Notebook时选择OBS存储,这种情况下只能访问到自己账号下的桶,无法访问到其他账号的OBS桶。如果需要在Notebook中,访问其他账号的OBS文件,前提是,需获取目标OBS桶的读写权限。首先,请联系OBS桶的创建者,参考对其他账号授予桶的读写权限指导,授予当前账号OBS桶的读写权限。此操作指导是某一华为云账号将其OBS桶权限授 - [在ModelArts的Notebook中JupyterLab默认工作路径是什么?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0256.md): 带OBS存储的Notebook实例JupyterLab文件默认存储路径,为创建Notebook时指定的OBS路径。在文件列表的所有文件读写操作都是基于所选择的OBS路径下的内容操作的,跟当前实例空间没有关系。如果用户需要将内容同步到实例空间,需使用JupyterLab上传下载功能。JupyterLab文件默认存储路径,为创建Noteboo - [如何查看ModelArts的Notebook使用的cuda版本?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_01651.md): 登录ModelArts管理控制台,在左侧导航栏按需选择以下操作。新版控制台:选择模型开发与训练 > Notebook,进入Notebook页面。旧版控制台:选择开发空间 > Notebook,进入Notebook页面。新版控制台:选择模型开发与训练 > Notebook,进入Notebook页面。旧版控制台:选择开发空间 > Notebo - [在ModelArts的Notebook中如何获取本机外网IP?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0240.md): 本机的外网IP地址可以在主流搜索引擎中搜索“IP地址查询”获取。 - [ModelArts的Notebook有代理吗?如何关闭?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3213.md): Notebook有代理。执行env | grep proxy命令查询Notebook代理。执行unset https_proxy unset http_proxy命令关闭代理。 - [在ModelArts的Notebook中内置引擎不满足使用需要时,如何自定义引擎IPython Kernel?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_4195.md): 当前Notebook默认内置的引擎环境不能满足用户诉求,用户可以新建一个conda env按需搭建自己的环境。本小节以搭建一个“python3.6.5和tensorflow1.2.0”的IPython Kernel为例进行展示。创建conda env。在Notebook的Terminal中执行如下命令。其中,my-env是虚拟环境名称,用 - [在ModelArts的Notebook中如何将git clone的py文件变为ipynb文件?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3161.md): 在ModelArts的Notebook中如何将git clone的py文件变为ipynb文件?在ipynb文件中,执行%load XXX.py命令,即可将py文件内容加载到ipynb中。以“test.py”文件为例,下图展示了如何将“test.py”的文件内容加载到ipynb文件中。 - [在ModelArts的Notebook实例重启时,数据集会丢失吗?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3163.md): ModelArts提供的Notebook实例是以ma-user启动的,用户进入实例后,工作目录默认是/home/ma-user/work。创建实例,/home/ma-user/work目录下挂载的数据,在实例停止、重新启动后依然保留,容器内部非挂载的目录内容会还原。 - [在ModelArts的Notebook的Jupyterlab可以安装插件吗?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3164.md): Jupyter可以安装插件。目前Jupyter插件多数采用wheel包的形式发布,一次性完成前后端插件的安装,安装时注意使用Jupyter服务依赖的环境/modelarts/authoring/notebook-conda/bin/pip进行安装,不要使用默认的Anaconda(kernel依赖的python环境)的pip进行安装。使用命 - [在ModelArts的Notebook的CodeLab中能否使用昇腾卡进行训练?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3166.md): 有以下两种情况。在旧版ModelArts管理控制台总览页面的“常用功能”区域打开CodeLab,使用CPU或GPU资源,无法使用昇腾卡训练。CodeLab如果您使用的是新版控制台,请在左侧导航栏最下方单击返回旧版,然后在总览页面打开CodeLab。仅“华北-北京四”区域支持CodeLab功能。如果您使用的是新版控制台,请在左侧导航栏最下方 - [如何在ModelArts的Notebook的CodeLab上安装依赖?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3167.md): ModelArts CodeLab中已安装Jupyter、Python程序包等多种环境,您也可以使用pip install在Notebook或Terminal中安装依赖包。登录旧版ModelArts管理控制台,在总览页面的常用功能 > 开发工具区域下方,单击CodeLab卡片进入CodeLab。如果您使用的是新版控制台,请在左侧导航栏最下 - [在ModelArts的Notebook中安装远端插件时不稳定要怎么办?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0299.md): 方法一:离线包安装方式(推荐)到VS Code插件官网vscode_marketplace搜索待安装的Python插件,Python插件路径。单击进入Python插件的Version History页签后,下载该插件的离线安装包,如图所示。Python插件离线安装包在本地VS Code环境中,将下载好的.vsix文件拖动到远端Notebo - [在ModelArts的Notebook中实例重新启动后要怎么连接?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0300.md): 可以在本地的ssh config文件中对这个Notebook配置参数“StrictHostKeyChecking no”和“UserKnownHostsFile=/dev/null”,如下参考所示:提示:因为SSH登录时会忽略known_hosts文件,有安全风险 - [在ModelArts的Notebook中使用VS Code调试代码无法进入源码怎么办?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0301.md): 如果已有launch.json文件,请直接看步骤三。步骤一:打开launch.json文件方法一:单击左侧菜单栏的Run(Ctrl+Shift+D)按钮,再单击create a launch.json file。如下图所示:方法二:单击上侧菜单栏中的Run > Open configurations按钮方法一:单击左侧菜单栏的Run(Ct - [在ModelArts的Notebook中使用VS Code如何查看远端日志?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0305.md): 在VS Code环境中执行Ctrl+Shift+P搜show logs选择Remote Server。也可在如下截图的红框处切换至其他的Log - [在ModelArts的Notebook中如何打开VS Code的配置文件settings.json?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0306.md): 在VS Code环境中执行Ctrl+Shift+P搜Open User Settings (JSON) - [在ModelArts的Notebook中如何设置VS Code背景色为豆沙绿?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0307.md): 在VS Code的配置文件settings.json中添加如下参数"workbench.colorTheme": "Atom One Light", "workbench.colorCustomizations": { "[Atom One Light]": { "editor.background": "#C7EDCC", " - [在ModelArts的Notebook中如何设置VS Code远端默认安装的插件?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0308.md): 在VS Code的配置文件settings.json中添加remote.SSH.defaultExtensions参数,如自动安装Python和Maven插件,可配置如下。其中,插件名称可以单击VS Code的某个插件后获取,如下所示。 - [在ModelArts的VS Code中如何把本地插件安装到远端或把远端插件安装到本地?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0309.md): 在VS Code的环境中执行Ctrl+Shift+P搜install local,按需选择即可 - [在ModelArts的Notebook中,如何使用昇腾多卡进行调试?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3173.md): 昇腾多卡训练任务是多进程多卡模式,跑几卡需要起几个python进程。昇腾底层会读取环境变量:RANK_TABLE_FILE,开发环境已经设置,用户无需关注。比如跑八卡,可以如下片段代码:其中,train.py中设置环境变量DEVICE_ID: - [在ModelArts的Notebook中使用不同的资源规格训练时为什么训练速度差不多?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3147.md): 如果用户的代码中训练任务是单进程的,使用Notebook 8核64GB,72核512GB训练的速度是基本一致的,例如用户用的是2核4GB的资源,使用4核8GB,或者8核64GB效果是一样的。如果用户的代码中训练任务是多进程的,使用Notebook 72核512GB训练速度要优于8核64GB。 - [在ModelArts的Notebook中使用MoXing时,如何进行增量训练?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0076.md): 在使用MoXing构建模型时,如果您对前一次训练结果不满意,可以在更改部分数据和标注信息后,进行增量训练。在完成标注数据或数据集的修改后,您可以在mox.run中,修改log_dir参数,并新增checkpoint_path参数。其中log_dir参数建议设置为一个新的目录,checkpoint_path参数设置为上一次训练结果输出路径, - [在ModelArts的Notebook中如何查看GPU使用情况?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0082.md): 创建Notebook时,当您选择的类型为GPU时,查看GPU使用情况具体操作如下:登录ModelArts管理控制台,按需选择以下操作。新版控制台:选择模型开发与训练 > Notebook,进入Notebook页面。旧版控制台:选择开发空间 > Notebook,进入Notebook页面。新版控制台:选择模型开发与训练 > Notebook - [在ModelArts的Notebook中如何在代码中打印GPU使用信息?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0374.md): 用户可通过shell命令或python命令查询GPU使用信息。执行nvidia-smi命令。依赖CUDA nvccwatch -n 1 nvidia-smi依赖CUDA nvcc执行gpustat命令。pip install gpustatgpustat -cp -i使用Ctrl+C可以退出。使用Ctrl+C可以退出。执行nvidia-m - [在ModelArts的Notebook中JupyterLab的目录、Terminal的文件和OBS的文件之间的关系是什么?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0245.md): JupyterLab目录的文件与Terminal中work目录下的文件相同。即用户在Notebook中新建的,或者是从OBS目录中同步的文件。挂载OBS存储的Notebook,JupyterLab目录的文件可以与OBS的文件进行同步,使用JupyterLab文件上传下载功能。Terminal的文件与JupyterLab目录的文件相同。挂载 - [如何在ModelArts的Notebook实例中使用ModelArts数据集?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0377.md): ModelArts上创建的数据集存放在OBS中,可以将OBS中的数据下载到Notebook中使用。Notebook中读取OBS数据方式请参见如何在ModelArts的Notebook中上传下载OBS文件?。 - [pip介绍及常用命令](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3113.md): pip是通用的python包的管理工具。它提供了对Python包的查找、下载、安装和卸载的功能。 - [在ModelArts的Notebook中不同规格资源/cache目录的上限是多少?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3151.md): 创建Notebook时,可以根据业务数据量的大小选择资源。ModelArts会挂载硬盘至“/cache”目录,用户可以使用此目录来储存临时文件。“/cache”与代码目录共用资源,不同资源规格有不同的容量。不建议在/cache盘中存放重要数据。容器崩溃、节点故障或资源不足(如内存或存储限制被突破)等异常情况都可能导致实例重启,从而导致/c - [资源超分对在ModelArts的Notebook实例有什么影响?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_4183.md): Notebook超分,是指一个节点中CPU、内存共享的场景。为了充分利用资源,在专属池中存在超分情况。举例:一个专属池中有1个8U64G的CPU节点,如创建2U8G规格的Notebook,因为超分最多可启动 8U/(2U*0.6)= 6.67个Notebook实例。这里的0.6就是超分比率。即启动该Notebook实例最少需要1.2U的C - [如何在Notebook中安装外部库?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0022.md): ModelArts Notebook中已安装Jupyter、Python程序包等多种环境,包括TensorFlow、MindSpore、PyTorch、Spark等。您也可以使用pip install在Notebook或Terminal中安装外部库。例如,通过JupyterLab在TensorFlow-1.8的环境中安装Shapely。打 - [在ModelArts的Notebook中,访问外网速度不稳定怎么办?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_4211.md): 为了方便AI开发者在使用Notebook时访问外部资源,ModelArts提供了一个免费的共享网络代理服务。借助这个代理,开发者可以更加便捷地下载所需的各类资源,助力开发工作的顺利进行。由于该网络代理免费且共享,其性能会受到实时访问量大小的显著影响。当众多用户同时使用代理进行资源下载时,网络带宽会被大量占用,从而导致代理速度下降,下载速度 - [Notebook是否支持使用gdb工具?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_4300.md): Notebook目前不支持gdb工具的使用。gdb工具的运行依赖开启特权容器(privileged container)的Docker,而开发环境的容器出于安全考虑,无法开启特权容器,因此不支持在Notebook中使用gdb工具。 - [CodeLab打开Terminal后超时](https://support.huaweicloud.com/modelarts_faq/modelarts_05_4302.md): 在Codelab创建Notebook后,打开Terminal,如果2分钟以上不使用Terminal,窗口会重连。方案一:在超时前重连。方案二:直接创建Notebook,超时时间会延长。具体步骤,请参见创建Notebook实例。 - [为什么在ModelArts的Notebook中训练出现昇腾910的NPU-2 AIcore使用率低,但HBM使用率高的情况?](https://support.huaweicloud.com/modelarts_faq/modelarts_notebook_4303.md): 在ModelArts的Notebook中训练出现NPU的昇腾910的NPU-2 AIcore使用率低,但高带宽内存HBM(High Bandwidth Memory)使用率高的情况,可能有以下原因:代码适配问题未充分利用NPU特性:PyTorch在GPU和NPU上运行时,底层的计算模型和优化策略有所不同。虽然代码在GPU上可以正常运行,但 - [如何在ModelArts的Notebook或轻量算力节点查看CANN路径?](https://support.huaweicloud.com/modelarts_faq/modelarts_notebook_4304.md): 通过环境变量查询CANN安装后通常会设置相应的环境变量。您可以通过查看这些环境变量来获取安装路径。最常用的环境变量是ASCEND_HOME_PATH。打开终端,执行以下命令:echo $ASCEND_HOME_PATH如果该环境变量已设置,终端将输出CANN的安装路径。通过环境变量查询示例CANN安装后通常会设置相应的环境变量。您可以通过 - [为什么自定义规格的Notebook在设置空闲停止后长时间未停止?](https://support.huaweicloud.com/modelarts_faq/modelarts_notebook_4305.md): 用户创建了一个自定义规格的Notebook实例(例如:0.5核CPU + 1 GiB内存),并开启了空闲自动停止功能(例如:将空闲时间设置为15分钟)。然而,该实例在长时间无操作后并未按预期自动停止。平台判定Notebook实例是否空闲的依据是实例的资源占用率是否持续低于预设的阈值。只有当CPU、内存等关键资源的占用率均低于该阈值时,才会 - [在Notebook中上传远端文件时,出现“确认取消上传吗”对话框,如何处理?](https://support.huaweicloud.com/modelarts_faq/modelarts_notebook_4306.md): 在Notebook中上传远端文件时,单击上传,出现“确认取消上传吗”对话框。您可以任选以下方式解决问题。方式一:忽略“确认取消上传吗”对话框,刷新浏览器,重新上传文件。方式二:打开Terminal命令行窗口。Terminal在Terminal中,通过wget命令下载文件。# 下载单个文件 wget ${文件链接} # 指定输出文件名 - [远程主机不满足VS Code服务器对GLIBC和libstdc++的版本要求怎么办?](https://support.huaweicloud.com/modelarts_faq/modelarts_notebook_4309.md): 通过VS Code远程连接Notebook实例时,出现以下报错:您的远程主机上安装的GLIBC或libstdc++版本无法满足VS Code远程开发插件的要求。任选以下方式进行解决。方式一:使用VS Code 1.85.2或者1.86.2版本且Notebook实例使用的镜像GLIBC<2.28。具体操作,请参见安装VS Code软件。您可 - [当前所选资源池不支持开启选择容器运行用户ID,怎么办?](https://support.huaweicloud.com/modelarts_faq/modelarts_notebook_4307.md): 创建Notebook时,“环境配置 > 选择容器运行用户 ID”无法开启,显示“当前所选资源池不支持开启选择容器运行用户ID”。公共资源池不支持使用root启动Notebook实例。华为云ModelArts针对专属资源池网络进行安全加固和优化,仅新网络模式下专属资源池支持root启动Notebook实例,旧网络模式的专属资源池无法支持此功 - [如何在Notebook中离线安装本地VS Code对应版本的VS Code Server?](https://support.huaweicloud.com/modelarts_faq/modelarts_notebook_4310.md): 您可以参照以下步骤,在Notebook中离线安装本地VS Code对应版本的VS Code Server。打开VS Code,选择Help>About,并记下“Commit”的ID码。确认创建Notebook实例使用的镜像的系统架构,可以在Notebook中打开Terminal,通过命令uname -m查看。下载对应版本的vscode-s - [在Code Server中打开.ipynb文件,首次执行代码单元格有明显延迟,怎么办?](https://support.huaweicloud.com/modelarts_faq/modelarts_notebook_4308.md): 在Code Server中打开.ipynb文件时,首次执行代码单元格(Cell)出现明显延迟(约30秒以上)。当前使用的镜像环境中缺少ipykernel依赖包。当用户首次运行Notebook文件时,Code Server会自动触发后台安装流程,由于需从官方源下载并编译依赖项,导致初始化过程耗时较长。建议您手动安装ipykernel。在Co - [Notebook实例中为什么会自动出现.modelarts目录?](https://support.huaweicloud.com/modelarts_faq/modelarts_notebook_4311.md): 当您在创建或启动Notebook实例时,Notebook会自动在$WORK_DIR/.modelarts目录下生成配置文件和脚本,用于支持pipeline、性能分析插件、AI Agent插件以及Code Server等功能。本文介绍.modelarts配置目录的结构和各文件的用途。$WORK_DIR为Notebook实例的工作目录,$IN - [在ModelArts训练得到的模型欠拟合怎么办?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0170.md): 模型复杂化。对同一个算法复杂化。例如回归模型添加更多的高次项,增加决策树的深度,增加神经网络的隐藏层数和隐藏单元数等。弃用原来的算法,使用一个更加复杂的算法或模型。例如用神经网络来替代线性回归,用随机森林来代替决策树。对同一个算法复杂化。例如回归模型添加更多的高次项,增加决策树的深度,增加神经网络的隐藏层数和隐藏单元数等。弃用原来的算法, - [在ModelArts中训练好的模型如何获取?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0360.md): 使用自定义算法或者订阅算法训练生成的模型,会存储至用户指定的OBS路径中,供用户下载。 - [在ModelArts上如何获得RANK_TABLE_FILE用于分布式训练?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0380.md): ModelArts会帮用户生成RANK_TABLE_FILE文件,文件位置固定为"/user/config/jobstart_hccl.json"。如果训练作业需要指定ranktable,需要在启动命令或启动脚本中添加如下命令以新增环境变量: - [在ModelArts上训练模型如何配置输入输出数据?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0265.md): ModelArts支持用户上传自定义算法创建训练作业。上传自定义算法前,请完成创建算法并上传至OBS桶。创建算法请参考开发用于预置框架训练的代码。创建训练作业请参考创建训练作业指导。运行在ModelArts的模型读取存储在OBS服务的数据,或者输出至OBS服务指定路径,输入和输出数据需要配置3个地方:训练代码中需解析输入路径参数和输出路径 - [在ModelArts上如何提升训练效率并减少与OBS的交互?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0114.md): 在使用ModelArts进行自定义深度学习训练时,训练数据通常存储在对象存储服务(OBS)中,且训练数据较大时(如200GB以上),每次都需要使用GPU/NPU资源池进行训练,且训练效率低。希望提升训练效率,同时减少与对象存储OBS的交互。可通过如下方式进行调整优化。对于ModelArts提供的GPU/NPU资源池,每个训练节点会挂载50 - [在ModelArts中使用Moxing复制数据时如何定义路径变量?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3176.md): mox这个函数怎么定义以变量的形式填写OBS路径?变量定义参考如下示例: - [在ModelArts上如何创建引用第三方依赖包的训练作业?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0063.md): ModelArts支持训练模型过程中安装第三方依赖包。在训练代码目录下放置pip-requirements.txt文件后,在训练启动文件被执行前系统会执行如下命令,以安装用户指定的Python Packages。仅使用预置框架创建的训练作业支持在训练模型时引用依赖包。pip-requirements.txt文件命名支持以下4种格式,文档中 - [在ModelArts训练时如何安装C++的依赖库?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0088.md): 在训练作业的过程中,会使用到第三方库。以C++为例,请参考如下操作步骤进行安装:将源码下载至本地并上传到OBS。使用OBS客户端上传文件的操作请参见上传文件。将上传到OBS的源码使用Moxing复制到开发环境Notebook中。以下为使用EVS挂载的开发环境,将数据复制至notebook中的代码示例:import moxing as mo - [在ModelArts训练作业中如何判断文件夹是否复制完毕?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0092.md): 您可以在训练作业启动文件的脚本中,通过如下方式获取复制和被复制文件夹大小,根据结果判断是否复制完毕:其中,get_size为获取文件或文件夹的大小。recursive=True表示类型为文件夹,True表示是文件夹,False为文件。如果输出结果为一致,表示文件夹复制已完毕。如果输出结果不一致,表示复制未结束。 - [如何在ModelArts训练作业中加载部分训练好的参数?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0091.md): 在训练作业时,需要从预训练的模型中加载部分参数,初始化当前模型。请您通过如下方式加载:通过如下代码,您可以查看所有的参数。from moxing.tensorflow.utils.hyper_param_flags import mox_flags print(mox_flags.get_help())通过如下方式控制载入模型时需要恢复的 - [ModelArts训练时使用os.system('cd xxx')无法进入文件夹怎么办?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0097.md): 当在训练作业的启动脚本中使用os.system('cd xxx')无法进入相应的文件夹时,建议使用如下方法: - [在ModelArts训练代码中,如何获取依赖文件所在的路径?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0280.md): 由于用户本地开发的代码需要上传至ModelArts后台,训练代码中涉及依赖文件的路径时,用户设置有误的场景较多。因此推荐通用的解决方案:使用os接口得到依赖文件的绝对路径,避免报错。以下示例展示如何通过os接口获得其他文件夹下的依赖文件路径。文件目录结构:在启动文件代码中,建议用户参考以下方式获取其他依赖文件所在路径,即示例中的“othe - [如何获取ModelArts训练容器中的文件实际路径?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3217.md): 如果容器中的文件实际路径不清楚,可以使用Python获取当前文件路径的方法获取。也可在搜索引擎寻找其他获取文件路径的方式,使用获取到的路径进行文件读写。 - [ModelArts训练中不同规格资源“/cache”目录的大小是多少?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0090.md): 在创建训练作业时可以根据训练作业的大小选择资源。ModelArts会挂载硬盘至/cache目录,用户可以使用此目录来储存临时文件。/cache与代码目录共用资源,不同资源规格有不同的容量。k8s磁盘的驱逐策略是90%,所以可以正常使用的磁盘大小应该是cache目录容量 x 0.9。裸机的本地磁盘为物理磁盘,无法扩容,如果存储的数据量大,建 - [ModelArts训练作业为什么存在/work和/ma-user两种超参目录?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0515.md): 创建训练作业时,输入输出参数的超参目录有的是/work,有的是/ma-user。这是创建训练作业选用的算法有差异导致的。如果选择的算法是使用旧版镜像创建的,那么创建训练作业时输入输出参数的超参目录就是/work。创建算法如果选择的算法不是使用旧版镜像创建的,那么创建训练作业时输入输出参数的超参目录就是/ma-user。 - [如何查看ModelArts训练作业资源占用情况?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0089.md): 在ModelArts管理控制台,选择模型训练>训练作业,进入训练作业列表页面。在训练作业列表中,单击目标作业名称,查看该作业的详情。您可以在资源占用情况页签查看到如下指标信息。CPU:CPU使用率(cpuUsage)百分比(Percent)。MEM:物理内存使用率(memUsage)百分比(Percent)。GPU:GPU使用率(gpUt - [如何将在ModelArts中训练好的模型下载或迁移到其他账号?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0121.md): 通过训练作业训练好的模型可以下载,然后将下载的模型上传存储至其他账号对应区域的OBS中。登录ModelArts管理控制台,在左侧导航栏中选择模型与训练 > 训练作业(新版控制台)或模型训练 > 训练作业(旧版控制台),进入训练作业列表。在训练作业列表中,单击目标训练作业名称,查看该作业的详情。在左侧获取输出位置下的路径,即为训练模型的下载 - [创建训练调试态时,哪些环境变量是受保护的?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0093.md): 自定义环境变量约束以MA_开头的变量作用:由ModelArts平台内部使用,用于管理服务配置、资源分配等核心功能。约束:禁止用户手动设置,干预可能导致服务初始化失败或行为异常。作用:由ModelArts平台内部使用,用于管理服务配置、资源分配等核心功能。约束:禁止用户手动设置,干预可能导致服务初始化失败或行为异常。特定关键变量ENABLE - [在ModelArts训练得到的模型欠拟合怎么办?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0170.md): 模型复杂化。对同一个算法复杂化。例如回归模型添加更多的高次项,增加决策树的深度,增加神经网络的隐藏层数和隐藏单元数等。弃用原来的算法,使用一个更加复杂的算法或模型。例如用神经网络来替代线性回归,用随机森林来代替决策树。对同一个算法复杂化。例如回归模型添加更多的高次项,增加决策树的深度,增加神经网络的隐藏层数和隐藏单元数等。弃用原来的算法, - [在ModelArts中训练好的模型如何获取?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0360.md): 使用自定义算法或者订阅算法训练生成的模型,会存储至用户指定的OBS路径中,供用户下载。 - [在ModelArts上如何获得RANK_TABLE_FILE用于分布式训练?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0380.md): ModelArts会帮用户生成RANK_TABLE_FILE文件,文件位置固定为"/user/config/jobstart_hccl.json"。如果训练作业需要指定ranktable,需要在启动命令或启动脚本中添加如下命令以新增环境变量: - [在ModelArts上训练模型如何配置输入输出数据?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0265.md): ModelArts支持用户上传自定义算法创建训练作业。上传自定义算法前,请完成创建算法并上传至OBS桶。创建算法请参考开发用于预置框架训练的代码。创建训练作业请参考创建训练作业指导。运行在ModelArts的模型读取存储在OBS服务的数据,或者输出至OBS服务指定路径,输入和输出数据需要配置3个地方:训练代码中需解析输入路径参数和输出路径 - [在ModelArts上如何提升训练效率并减少与OBS的交互?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0114.md): 在使用ModelArts进行自定义深度学习训练时,训练数据通常存储在对象存储服务(OBS)中,且训练数据较大时(如200GB以上),每次都需要使用GPU/NPU资源池进行训练,且训练效率低。希望提升训练效率,同时减少与对象存储OBS的交互。可通过如下方式进行调整优化。对于ModelArts提供的GPU/NPU资源池,每个训练节点会挂载50 - [在ModelArts中使用Moxing复制数据时如何定义路径变量?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3176.md): mox这个函数怎么定义以变量的形式填写OBS路径?变量定义参考如下示例: - [在ModelArts上如何创建引用第三方依赖包的训练作业?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0063.md): ModelArts支持训练模型过程中安装第三方依赖包。在训练代码目录下放置pip-requirements.txt文件后,在训练启动文件被执行前系统会执行如下命令,以安装用户指定的Python Packages。仅使用预置框架创建的训练作业支持在训练模型时引用依赖包。pip-requirements.txt文件命名支持以下4种格式,文档中 - [在ModelArts训练时如何安装C++的依赖库?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0088.md): 在训练作业的过程中,会使用到第三方库。以C++为例,请参考如下操作步骤进行安装:将源码下载至本地并上传到OBS。使用OBS客户端上传文件的操作请参见上传文件。将上传到OBS的源码使用Moxing复制到开发环境Notebook中。以下为使用EVS挂载的开发环境,将数据复制至notebook中的代码示例:import moxing as mo - [在ModelArts训练作业中如何判断文件夹是否复制完毕?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0092.md): 您可以在训练作业启动文件的脚本中,通过如下方式获取复制和被复制文件夹大小,根据结果判断是否复制完毕:其中,get_size为获取文件或文件夹的大小。recursive=True表示类型为文件夹,True表示是文件夹,False为文件。如果输出结果为一致,表示文件夹复制已完毕。如果输出结果不一致,表示复制未结束。 - [如何在ModelArts训练作业中加载部分训练好的参数?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0091.md): 在训练作业时,需要从预训练的模型中加载部分参数,初始化当前模型。请您通过如下方式加载:通过如下代码,您可以查看所有的参数。from moxing.tensorflow.utils.hyper_param_flags import mox_flags print(mox_flags.get_help())通过如下方式控制载入模型时需要恢复的 - [ModelArts训练时使用os.system('cd xxx')无法进入文件夹怎么办?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0097.md): 当在训练作业的启动脚本中使用os.system('cd xxx')无法进入相应的文件夹时,建议使用如下方法: - [在ModelArts训练代码中,如何获取依赖文件所在的路径?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0280.md): 由于用户本地开发的代码需要上传至ModelArts后台,训练代码中涉及依赖文件的路径时,用户设置有误的场景较多。因此推荐通用的解决方案:使用os接口得到依赖文件的绝对路径,避免报错。以下示例展示如何通过os接口获得其他文件夹下的依赖文件路径。文件目录结构:在启动文件代码中,建议用户参考以下方式获取其他依赖文件所在路径,即示例中的“othe - [如何获取ModelArts训练容器中的文件实际路径?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3217.md): 如果容器中的文件实际路径不清楚,可以使用Python获取当前文件路径的方法获取。也可在搜索引擎寻找其他获取文件路径的方式,使用获取到的路径进行文件读写。 - [ModelArts训练中不同规格资源“/cache”目录的大小是多少?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0090.md): 在创建训练作业时可以根据训练作业的大小选择资源。ModelArts会挂载硬盘至/cache目录,用户可以使用此目录来储存临时文件。/cache与代码目录共用资源,不同资源规格有不同的容量。k8s磁盘的驱逐策略是90%,所以可以正常使用的磁盘大小应该是cache目录容量 x 0.9。裸机的本地磁盘为物理磁盘,无法扩容,如果存储的数据量大,建 - [ModelArts训练作业为什么存在/work和/ma-user两种超参目录?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0515.md): 创建训练作业时,输入输出参数的超参目录有的是/work,有的是/ma-user。这是创建训练作业选用的算法有差异导致的。如果选择的算法是使用旧版镜像创建的,那么创建训练作业时输入输出参数的超参目录就是/work。创建算法如果选择的算法不是使用旧版镜像创建的,那么创建训练作业时输入输出参数的超参目录就是/ma-user。 - [如何查看ModelArts训练作业资源占用情况?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0089.md): 在ModelArts管理控制台,选择模型训练>训练作业,进入训练作业列表页面。在训练作业列表中,单击目标作业名称,查看该作业的详情。您可以在资源占用情况页签查看到如下指标信息。CPU:CPU使用率(cpuUsage)百分比(Percent)。MEM:物理内存使用率(memUsage)百分比(Percent)。GPU:GPU使用率(gpUt - [如何将在ModelArts中训练好的模型下载或迁移到其他账号?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0121.md): 通过训练作业训练好的模型可以下载,然后将下载的模型上传存储至其他账号对应区域的OBS中。登录ModelArts管理控制台,在左侧导航栏中选择模型与训练 > 训练作业(新版控制台)或模型训练 > 训练作业(旧版控制台),进入训练作业列表。在训练作业列表中,单击目标训练作业名称,查看该作业的详情。在左侧获取输出位置下的路径,即为训练模型的下载 - [创建训练调试态时,哪些环境变量是受保护的?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0093.md): 自定义环境变量约束以MA_开头的变量作用:由ModelArts平台内部使用,用于管理服务配置、资源分配等核心功能。约束:禁止用户手动设置,干预可能导致服务初始化失败或行为异常。作用:由ModelArts平台内部使用,用于管理服务配置、资源分配等核心功能。约束:禁止用户手动设置,干预可能导致服务初始化失败或行为异常。特定关键变量ENABLE - [在线服务预测时,如何提高预测速度?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0017.md): 在线推理服务预测时,有以下几种方式提高预测性能。部署在线推理服务时,您可以选择性能更好、算力更加充沛的资源池提高预测性能。资源池的算力基础直接决定推理的响应速度和并发承载能力,优先匹配高性能资源能从硬件层面释放推理潜力。部署在线推理服务时,合理配置部署副本数。如果部署副本设置为1,性能完全依赖单个副本,且可靠性不足,单点故障会导致服务不可 - [修改服务部署后,升级在线服务部署能否保持原API接口不变?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0019.md): ModelArts提供多版本支持和灵活的流量策略,您可以通过修改服务部署进行部署升级或切换部署运行的在线服务版本,实现服务版本的平滑过渡升级。修改服务部署升级在线服务部署时,在线服务预测API不会变化。在线服务版本的操作如下。在线服务已存在多个版本部署配置。登录ModelArts管理控制台,在左侧菜单栏中选择模型推理>在线推理,进入在线服 - [在线服务的API接口组成规则是什么?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0021.md): 部署在线推理服务后,用户可以获取API接口用于访问推理预测。预测API接口组成规则如下:示例如下: - [在线服务运行中但是预测失败时,如何排查报错是不是推理服务原因导致的?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0023.md): 在线推理服务启动后,当在线推理服务进入到运行中状态后,进行预测,预测请求发出后,收到的响应不符合预期,无法判断是不是推理服务的问题导致的不符合预期。在线推理服务启动后,ModelArts提供两种方式的预测:方式1:在ModelArts控制台的服务详情页面的预测页签进行预测。方式2:在ModelArts控制台的服务详情页面的服务页签获取到调 - [在线服务处于运行中状态时,如何填写推理请求的request header和request body?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0025.md): 部署在线推理服务完成且在线推理服务处于运行中状态时,通过ModelArts console的调用指南页签可以获取到推理请求的地址,但是不知道如何填写推理请求的header及body。在线推理服务部署完成且服务处于运行中状态后,可以通过服务页签的调用URL对推理服务发起预测请求,出于安全考虑,ModelArts会通过相关的认证鉴权机制避免在 - [在线服务一直处于部署中/修改中,如何排查原因?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0026.md): 部署服务后,服务一直处于部署中的状态。进入服务详情页,在事件页签查看服务事件,有“部署【XXX】有Pod容器启动失败”等类似报错出现。Pod的一些异常事件会在服务事件中上报,只显示原因概述。Pod未就绪时,服务不认为实例就绪且可用,从而导致一直处于部署中的状态。登录ModelArts管理控制台,在左侧菜单栏中选择模型推理 > 在线推理,进 - [ModelArts在线服务预测请求体大小限制是多少?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0028.md): 服务部署完成且服务处于运行中后,可以往该服务发送推理的请求,请求的内容根据模型的不同可以是文本,图片,语音,视频等内容。当使用调用指南页签中显示的调用地址(华为云APIG网关服务的地址)预测时,对请求体的大小限制是12MB,超过12MB时,请求会被拦截。如果是从ModelArts console的预测页签进行的预测,由于console的网 - [在线服务部署或者实例重启时,如何及时感知业务容器异常?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0027.md): 在云服务部署场景中,用户通常会使用对象存储-OBS桶、对象存储-并行文件系统、高性能弹性文件存储SFS Turbo来存储和管理模型权重文件。在部署模型服务或者实例重启时,系统需要从这些存储服务中下载文件并挂载到业务容器中以完成服务部署。然而,在实际运行过程中,当依赖的存储服务出现异常(如网络中断、服务不可用或磁盘空间不足)时,系统无法有效 - [在线服务预测时,如何提高预测速度?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0017.md): 在线推理服务预测时,有以下几种方式提高预测性能。部署在线推理服务时,您可以选择性能更好、算力更加充沛的资源池提高预测性能。资源池的算力基础直接决定推理的响应速度和并发承载能力,优先匹配高性能资源能从硬件层面释放推理潜力。部署在线推理服务时,合理配置部署副本数。如果部署副本设置为1,性能完全依赖单个副本,且可靠性不足,单点故障会导致服务不可 - [修改服务部署后,升级在线服务部署能否保持原API接口不变?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0019.md): ModelArts提供多版本支持和灵活的流量策略,您可以通过修改服务部署进行部署升级或切换部署运行的在线服务版本,实现服务版本的平滑过渡升级。修改服务部署升级在线服务部署时,在线服务预测API不会变化。在线服务版本的操作如下。在线服务已存在多个版本部署配置。登录ModelArts管理控制台,在左侧菜单栏中选择模型推理>在线推理,进入在线服 - [在线服务的API接口组成规则是什么?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0021.md): 部署在线推理服务后,用户可以获取API接口用于访问推理预测。预测API接口组成规则如下:示例如下: - [在线服务运行中但是预测失败时,如何排查报错是不是推理服务原因导致的?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0023.md): 在线推理服务启动后,当在线推理服务进入到运行中状态后,进行预测,预测请求发出后,收到的响应不符合预期,无法判断是不是推理服务的问题导致的不符合预期。在线推理服务启动后,ModelArts提供两种方式的预测:方式1:在ModelArts控制台的服务详情页面的预测页签进行预测。方式2:在ModelArts控制台的服务详情页面的服务页签获取到调 - [在线服务处于运行中状态时,如何填写推理请求的request header和request body?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0025.md): 部署在线推理服务完成且在线推理服务处于运行中状态时,通过ModelArts console的调用指南页签可以获取到推理请求的地址,但是不知道如何填写推理请求的header及body。在线推理服务部署完成且服务处于运行中状态后,可以通过服务页签的调用URL对推理服务发起预测请求,出于安全考虑,ModelArts会通过相关的认证鉴权机制避免在 - [在线服务一直处于部署中/修改中,如何排查原因?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0026.md): 部署服务后,服务一直处于部署中的状态。进入服务详情页,在事件页签查看服务事件,有“部署【XXX】有Pod容器启动失败”等类似报错出现。Pod的一些异常事件会在服务事件中上报,只显示原因概述。Pod未就绪时,服务不认为实例就绪且可用,从而导致一直处于部署中的状态。登录ModelArts管理控制台,在左侧菜单栏中选择模型推理 > 在线推理,进 - [ModelArts在线服务预测请求体大小限制是多少?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0028.md): 服务部署完成且服务处于运行中后,可以往该服务发送推理的请求,请求的内容根据模型的不同可以是文本,图片,语音,视频等内容。当使用调用指南页签中显示的调用地址(华为云APIG网关服务的地址)预测时,对请求体的大小限制是12MB,超过12MB时,请求会被拦截。如果是从ModelArts console的预测页签进行的预测,由于console的网 - [在线服务部署或者实例重启时,如何及时感知业务容器异常?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0027.md): 在云服务部署场景中,用户通常会使用对象存储-OBS桶、对象存储-并行文件系统、高性能弹性文件存储SFS Turbo来存储和管理模型权重文件。在部署模型服务或者实例重启时,系统需要从这些存储服务中下载文件并挂载到业务容器中以完成服务部署。然而,在实际运行过程中,当依赖的存储服务出现异常(如网络中断、服务不可用或磁盘空间不足)时,系统无法有效 - [如何将Keras的.h5格式的模型导入到ModelArts中?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0119.md): ModelArts不支持直接导入.h5格式的模型。您可以先将Keras的.h5格式转换为TensorFlow的格式,然后再导入ModelArts中。从Keras转TensorFlow操作指导请参见其官网指导。 - [ModelArts导入模型时,如何编写模型配置文件中的安装包依赖参数?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0161.md): 从OBS中或者从容器镜像中导入模型时,开发者需要编写模型配置文件。模型配置文件描述模型用途、模型计算框架、模型精度、推理代码依赖包以及模型对外API接口。配置文件为JSON格式。配置文件中的“dependencies”,表示配置模型推理代码需要的依赖包,需要提供依赖包名、安装方式和版本约束的信息,详细参数见模型配置文件编写说明。导入模型时 - [在ModelArts中使用自定义镜像创建在线服务,如何修改端口?](https://support.huaweicloud.com/modelarts_faq/modelarts_01_0019.md): 当模型配置文件中定义了具体的端口号,例如:8443,创建模型没有配置端口,或者配置了其他端口号,均会导致服务部署失败。您需要把模型中的端口号配置为8443,才能保证服务部署成功。修改默认端口号,具体操作如下:登录ModelArts控制台,左侧菜单选择“模型管理”;单击“创建”,进入创建模型界面,元模型选择“从容器镜像中选择”,选择自定义镜 - [ModelArts平台是否支持多模型导入?](https://support.huaweicloud.com/modelarts_faq/modelarts_01_1027.md): ModelArts平台从对象存储服务(OBS)中导入模型包适用于单模型场景。如果有多模型复合场景,推荐使用自定义镜像方式,通过从容器镜像(SWR)中选择元模型的方式创建模型部署服务。制作自定义镜像请参考从0-1制作自定义镜像并创建AI应用。 - [在ModelArts中导入模型对于镜像大小有什么限制?](https://support.huaweicloud.com/modelarts_faq/modelarts_13_0211.md): ModelArts部署使用的是容器化部署,容器运行时有空间大小限制,当用户的模型文件或者其他自定义文件,系统文件超过容器引擎空间大小时,会提示镜像内空间不足。当前,公共资源池容器引擎空间的大小最大支持50G,专属资源池容器引擎空间的默认为50G,专属资源池容器引擎空间可在创建资源池时自定义设置,设置专属资源池容器引擎空间不会造成额外费用增 - [ModelArts在线服务和批量服务有什么区别?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0356.md): 在线服务将模型部署为一个Web服务,您可以通过管理控制台或者API接口访问在线服务。将模型部署为一个Web服务,您可以通过管理控制台或者API接口访问在线服务。批量服务批量服务可对批量数据进行推理,完成数据处理后自动停止。批量服务可对批量数据进行推理,完成数据处理后自动停止。批量服务一次性推理批量数据,处理完服务结束。在线服务提供API接 - [ModelArts在线服务和边缘服务有什么区别?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0180.md): 在线服务将模型部署为一个Web服务,您可以通过管理控制台或者API接口访问在线服务。将模型部署为一个Web服务,您可以通过管理控制台或者API接口访问在线服务。边缘服务云端服务是集中化的离终端设备较远,对于实时性要求高的计算需求,把计算放在云上会引起网络延时变长、网络拥塞、服务质量下降等问题。而终端设备通常计算能力不足,无法与云端相比。在 - [在ModelArts中部署模型时,为什么无法选择Ascend Snt3资源?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0118.md): 由于Ascend Snt3资源有限,当资源售罄后,您在部署上线时,无法选择Ascend Snt3资源(公共资源池)进行推理,即在部署页面中,“Ascend: 1* Snt3 (8GB) | ARM: 3 核 6GB”资源为灰色,无法选择。解决方案:方法1:如果您希望使用公共资源池下的Ascend Snt3,可以等待其他用户释放,即 - [ModelArts线上训练得到的模型是否支持离线部署在本地?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0365.md): 通过ModelArts预置算法训练得到的模型是保存在OBS桶里的,模型支持下载到本地。在训练作业列表找到需要下载模型的训练作业,单击名称进入详情页,获取训练输出路径。获取训练输出位置单击“输出路径”,跳转至OBS对象路径,下载训练得到的模型。在本地环境进行离线部署。具体请参见模型调试章节在本地导入模型,参见服务调试章节,将模型离线部署在本 - [ModelArts在线服务预测请求体大小限制是多少?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3134.md): 服务部署完成且服务处于运行中后,可以往该服务发送推理的请求,请求的内容根据模型的不同可以是文本,图片,语音,视频等内容。当使用调用指南页签中显示的调用地址(华为云APIG网关服务的地址)预测时,对请求体的大小限制是12MB,超过12MB时,请求会被拦截。如果是从ModelArts console的预测页签进行的预测,由于console的网 - [ModelArts部署在线服务时,如何避免自定义预测脚本python依赖包出现冲突?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0100.md): 导入模型时,需同时将对应的推理代码及配置文件放置在模型文件夹下。使用Python编码过程中,推荐采用相对导入方式(Python import)导入自定义包。如果ModelArts推理框架代码内部存在同名包,而又未采用相对导入,将会出现冲突,导致部署或预测失败。 - [ModelArts在线服务预测时,如何提高预测速度?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0289.md): 部署在线服务时,您可以选择性能更好的实例规格提高预测速度。例如使用GPU资源代替CPU资源。部署在线服务时,您可以增加实例数。如果实例数设置为1,表示后台的计算模式是单机模式;如果实例数设置大于1,表示后台的计算模式为分布式的。您可以根据实际需求进行选择。如果实例数设置为1,表示后台的计算模式是单机模式;如果实例数设置大于1,表示后台的计 - [在ModelArts中调整模型后,部署新版本模型能否保持原API接口不变?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0219.md): ModelArts提供多版本支持和灵活的流量策略,您可以通过使用灰度发布,实现模型版本的平滑过渡升级。修改服务部署新版本模型或者切换模型版本时,原服务预测API不会变化。调整模型版本的操作可以参考如下的步骤。已存在部署完成的服务。已完成模型调整,创建模型。登录ModelArts管理控制台,在左侧导航栏中选择部署上线 > 在线服务,默认进入 - [ModelArts在线服务的API接口组成规则是什么?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0364.md): 模型部署成在线服务后,用户可以获取API接口用于访问推理。API接口组成规则如下:示例如下: - [ModelArts在线服务处于运行中时,如何填写request header和request body?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3136.md): 部署在线服务完成且在线服务处于运行中状态时,通过ModelArts console的调用指南tab页签可以获取到推理请求的地址,但是不知道如何填写推理请求的header及body。在线服务部署完成且服务处于运行中状态后,可以通过调用指南页签的调用地址对模型发起预测请求,出于安全考虑,ModelArts会通过相关的认证鉴权机制避免在线服务被 - [如何将Keras的.h5格式的模型导入到ModelArts中?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0119.md): ModelArts不支持直接导入.h5格式的模型。您可以先将Keras的.h5格式转换为TensorFlow的格式,然后再导入ModelArts中。从Keras转TensorFlow操作指导请参见其官网指导。 - [ModelArts导入模型时,如何编写模型配置文件中的安装包依赖参数?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0161.md): 从OBS中或者从容器镜像中导入模型时,开发者需要编写模型配置文件。模型配置文件描述模型用途、模型计算框架、模型精度、推理代码依赖包以及模型对外API接口。配置文件为JSON格式。配置文件中的“dependencies”,表示配置模型推理代码需要的依赖包,需要提供依赖包名、安装方式和版本约束的信息,详细参数见模型配置文件编写说明。导入模型时 - [在ModelArts中使用自定义镜像创建在线服务,如何修改端口?](https://support.huaweicloud.com/modelarts_faq/modelarts_01_0019.md): 当模型配置文件中定义了具体的端口号,例如:8443,创建模型没有配置端口,或者配置了其他端口号,均会导致服务部署失败。您需要把模型中的端口号配置为8443,才能保证服务部署成功。修改默认端口号,具体操作如下:登录ModelArts控制台,左侧菜单选择“模型管理”;单击“创建”,进入创建模型界面,元模型选择“从容器镜像中选择”,选择自定义镜 - [ModelArts平台是否支持多模型导入?](https://support.huaweicloud.com/modelarts_faq/modelarts_01_1027.md): ModelArts平台从对象存储服务(OBS)中导入模型包适用于单模型场景。如果有多模型复合场景,推荐使用自定义镜像方式,通过从容器镜像(SWR)中选择元模型的方式创建模型部署服务。制作自定义镜像请参考从0-1制作自定义镜像并创建AI应用。 - [在ModelArts中导入模型对于镜像大小有什么限制?](https://support.huaweicloud.com/modelarts_faq/modelarts_13_0211.md): ModelArts部署使用的是容器化部署,容器运行时有空间大小限制,当用户的模型文件或者其他自定义文件,系统文件超过容器引擎空间大小时,会提示镜像内空间不足。当前,公共资源池容器引擎空间的大小最大支持50G,专属资源池容器引擎空间的默认为50G,专属资源池容器引擎空间可在创建资源池时自定义设置,设置专属资源池容器引擎空间不会造成额外费用增 - [ModelArts在线服务和批量服务有什么区别?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0356.md): 在线服务将模型部署为一个Web服务,您可以通过管理控制台或者API接口访问在线服务。将模型部署为一个Web服务,您可以通过管理控制台或者API接口访问在线服务。批量服务批量服务可对批量数据进行推理,完成数据处理后自动停止。批量服务可对批量数据进行推理,完成数据处理后自动停止。批量服务一次性推理批量数据,处理完服务结束。在线服务提供API接 - [ModelArts在线服务和边缘服务有什么区别?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0180.md): 在线服务将模型部署为一个Web服务,您可以通过管理控制台或者API接口访问在线服务。将模型部署为一个Web服务,您可以通过管理控制台或者API接口访问在线服务。边缘服务云端服务是集中化的离终端设备较远,对于实时性要求高的计算需求,把计算放在云上会引起网络延时变长、网络拥塞、服务质量下降等问题。而终端设备通常计算能力不足,无法与云端相比。在 - [在ModelArts中部署模型时,为什么无法选择Ascend Snt3资源?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0118.md): 由于Ascend Snt3资源有限,当资源售罄后,您在部署上线时,无法选择Ascend Snt3资源(公共资源池)进行推理,即在部署页面中,“Ascend: 1* Snt3 (8GB) | ARM: 3 核 6GB”资源为灰色,无法选择。解决方案:方法1:如果您希望使用公共资源池下的Ascend Snt3,可以等待其他用户释放,即 - [ModelArts线上训练得到的模型是否支持离线部署在本地?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0365.md): 通过ModelArts预置算法训练得到的模型是保存在OBS桶里的,模型支持下载到本地。在训练作业列表找到需要下载模型的训练作业,单击名称进入详情页,获取训练输出路径。获取训练输出位置单击“输出路径”,跳转至OBS对象路径,下载训练得到的模型。在本地环境进行离线部署。具体请参见模型调试章节在本地导入模型,参见服务调试章节,将模型离线部署在本 - [ModelArts在线服务预测请求体大小限制是多少?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3134.md): 服务部署完成且服务处于运行中后,可以往该服务发送推理的请求,请求的内容根据模型的不同可以是文本,图片,语音,视频等内容。当使用调用指南页签中显示的调用地址(华为云APIG网关服务的地址)预测时,对请求体的大小限制是12MB,超过12MB时,请求会被拦截。如果是从ModelArts console的预测页签进行的预测,由于console的网 - [ModelArts部署在线服务时,如何避免自定义预测脚本python依赖包出现冲突?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0100.md): 导入模型时,需同时将对应的推理代码及配置文件放置在模型文件夹下。使用Python编码过程中,推荐采用相对导入方式(Python import)导入自定义包。如果ModelArts推理框架代码内部存在同名包,而又未采用相对导入,将会出现冲突,导致部署或预测失败。 - [ModelArts在线服务预测时,如何提高预测速度?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0289.md): 部署在线服务时,您可以选择性能更好的实例规格提高预测速度。例如使用GPU资源代替CPU资源。部署在线服务时,您可以增加实例数。如果实例数设置为1,表示后台的计算模式是单机模式;如果实例数设置大于1,表示后台的计算模式为分布式的。您可以根据实际需求进行选择。如果实例数设置为1,表示后台的计算模式是单机模式;如果实例数设置大于1,表示后台的计 - [在ModelArts中调整模型后,部署新版本模型能否保持原API接口不变?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0219.md): ModelArts提供多版本支持和灵活的流量策略,您可以通过使用灰度发布,实现模型版本的平滑过渡升级。修改服务部署新版本模型或者切换模型版本时,原服务预测API不会变化。调整模型版本的操作可以参考如下的步骤。已存在部署完成的服务。已完成模型调整,创建模型。登录ModelArts管理控制台,在左侧导航栏中选择部署上线 > 在线服务,默认进入 - [ModelArts在线服务的API接口组成规则是什么?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0364.md): 模型部署成在线服务后,用户可以获取API接口用于访问推理。API接口组成规则如下:示例如下: - [ModelArts在线服务处于运行中时,如何填写request header和request body?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3136.md): 部署在线服务完成且在线服务处于运行中状态时,通过ModelArts console的调用指南tab页签可以获取到推理请求的地址,但是不知道如何填写推理请求的header及body。在线服务部署完成且服务处于运行中状态后,可以通过调用指南页签的调用地址对模型发起预测请求,出于安全考虑,ModelArts会通过相关的认证鉴权机制避免在线服务被 - [不在同一个主账号下,如何使用他人的自定义镜像创建Notebook?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_4185.md): 不是同一个主账号,用户A需要使用用户B的自定义镜像创建Notebook,此时需要用户B将此镜像共享给用户A,用户A将此共享镜像Pull下来注册后方可在Notebook中使用。详细操作如下:用户B的操作:登录容器镜像服务控制台,进入我的镜像页面。单击需要共享的镜像名称,进入镜像详情页。在共享页签,单击共享镜像,在新窗口中输入共享的账号名称等 - [如何登录并上传镜像到SWR?](https://support.huaweicloud.com/modelarts_faq/docker-modelarts_0018.md): 本章节介绍如何上传镜像到容器镜像服务SWR。登录容器镜像服务控制台,选择区域。单击右上角创建组织,输入组织名称完成组织创建。您可以自定义组织名称,本示例使用deep-learning,实际操作时请重新命名一个组织名称。后续所有命令中使用到组织名称deep-learning时,均需要替换为此处实际创建的组织名称。单击右上角登录指令,获取登录 - [在Dockerfile中如何给镜像设置环境变量?](https://support.huaweicloud.com/modelarts_faq/docker-modelarts_0019.md): 在Dockerfile中,可使用ENV指令来设置环境变量,具体信息请参考Dockerfile指导。 - [如何通过docker镜像启动容器?](https://support.huaweicloud.com/modelarts_faq/docker-modelarts_0119.md): Notebook保存后的镜像有Entrypoint参数,如图1。Entrypoint参数中指定的可执行文件或命令会覆盖镜像的默认启动命令,Entrypoint中指定的执行命令内容不在镜像中预置,在本地环境通过docker run启动通过Notebook保存的镜像,报错创建容器任务失败,启动文件或目录不存在,如图2。因此需要设置--entr - [如何在ModelArts的Notebook中配置Conda源?](https://support.huaweicloud.com/modelarts_faq/docker-modelarts_0009.md): 用户可以在Notebook开发环境中自行安装开发依赖包,方便使用。常见的依赖安装支持pip和Conda,pip源已经配置好,可以直接使用安装,Conda源需要多一步配置。本章节介绍如何在Notebook开发环境中配置Conda源。Conda软件已经预置在镜像中,具体操作可以参见https://mirror.tuna.tsinghua.ed - [ModelArts的自定义镜像软件版本匹配有哪些注意事项?](https://support.huaweicloud.com/modelarts_faq/docker-modelarts_6019.md): 如果您的自定义镜像涉及NCCL、CUDA、OFED等软件库,当您制作自定义镜像时,您需要确保镜像中的软件库和ModelArts的软件库相匹配。您镜像中的软件版本需要满足以下要求:NCCL版本 ≥ 2.7.8。OFED版本 ≥ MLNX_OFED_LINUX-5.4-3.1.0.0。CUDA版本需要参考专属资源池的GPU驱动版本,自主进行适 - [镜像在SWR上显示只有13GB,安装少量的包,然后镜像保存过程会提示超过35GB大小保存失败,为什么?](https://support.huaweicloud.com/modelarts_faq/docker-modelarts_6025.md): 我的镜像在SWR侧看,只有13GB左右,在开发环境Notebook镜像管理注册,启动Notebook实例后,安装一些包后,镜像保存过程会提示超过35GB大小,保存失败?SWR侧看到的大小是镜像压缩后的大小,解压后实际大小一般是压缩后的2.5~3倍,所以才会安装少量的包后,镜像大小超过35GB。 - [如何保证自定义镜像能不因为超过35GB而保存失败?](https://support.huaweicloud.com/modelarts_faq/docker-modelarts_6026.md): 可以从如下几方面考虑:请选择较小的基础镜像创建Notebook实例,这样在实例中可操作的空间才会大,可自由安装的包才能更多,一般建议原始的启动Notebook的基础镜像在SWR侧查看大小不要超过6GB。镜像保存主要保存在/home/ma-user路径下除挂载路径/home/ma-user/work以外的目录,请将数据集等放到work路径下 - [如何减小本地或ECS构建镜像的目的镜像的大小?](https://support.huaweicloud.com/modelarts_faq/docker-modelarts_6027.md): 减小目的镜像大小的最直接的办法就是选择尽可能小且符合自己诉求的镜像,比如您需要制作一个PyTorch2.1+Cuda12.2的镜像,官方如果没有提供对应的PyTorch或者Cuda版本的镜像,优选一个没有PyTorch环境或没有安装Cuda的镜像,而不是选择一个PyTorch引擎和Cuda都不满足的镜像,如MindSpore+Cuda11 - [镜像过大,卸载原来的包重新打包镜像,最终镜像会变小吗?](https://support.huaweicloud.com/modelarts_faq/docker-modelarts_6028.md): 不会,反而会变大。因为Docker镜像的层原因,当前的镜像是基于原来的镜像制作,而原来的镜像层数是无法改变的,层不变的情况下,大小是不变的,卸载包或者删除数据集,会新增镜像层,镜像反而会变大,这和传统概念的存储不一样。 - [在ModelArts镜像管理注册镜像报错ModelArts.6787怎么处理?](https://support.huaweicloud.com/modelarts_faq/docker-modelarts_6029.md): 在“镜像管理”界面注册镜像时报错“ModelArts.6787:镜像***无法使用,在SWR路径下***无法找到指定镜像,请在SWR控制台检查镜像及访问权限配置,或使用其他镜像并重试”。报错主要有如下原因:该镜像是主账号注册的private镜像,子账号在使用,而主账号没有给子账号赋SWR权限,子账号从SWR Console界面看不到该镜像 - [用户如何设置默认的kernel?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0096.md): 用户希望打开Notebook默认的kernel为自己自定义的kernel。解决方式:在Terminal里执行如下命令在镜像里指定环境变量。# python-3.7.10这里指用户想设置的kernel名称 export KG_DEFAULT_KERNEL_NAME=python-3.7.10单击操作列的更多>保存镜像,保存成功后然后重新启动 - [不在同一个主账号下,如何使用他人的自定义镜像创建Notebook?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_4185.md): 不是同一个主账号,用户A需要使用用户B的自定义镜像创建Notebook,此时需要用户B将此镜像共享给用户A,用户A将此共享镜像Pull下来注册后方可在Notebook中使用。详细操作如下:用户B的操作:登录容器镜像服务控制台,进入我的镜像页面。单击需要共享的镜像名称,进入镜像详情页。在共享页签,单击共享镜像,在新窗口中输入共享的账号名称等 - [如何登录并上传镜像到SWR?](https://support.huaweicloud.com/modelarts_faq/docker-modelarts_0018.md): 本章节介绍如何上传镜像到容器镜像服务SWR。登录容器镜像服务控制台,选择区域。单击右上角创建组织,输入组织名称完成组织创建。您可以自定义组织名称,本示例使用deep-learning,实际操作时请重新命名一个组织名称。后续所有命令中使用到组织名称deep-learning时,均需要替换为此处实际创建的组织名称。单击右上角登录指令,获取登录 - [在Dockerfile中如何给镜像设置环境变量?](https://support.huaweicloud.com/modelarts_faq/docker-modelarts_0019.md): 在Dockerfile中,可使用ENV指令来设置环境变量,具体信息请参考Dockerfile指导。 - [如何通过docker镜像启动容器?](https://support.huaweicloud.com/modelarts_faq/docker-modelarts_0119.md): Notebook保存后的镜像有Entrypoint参数,如图1。Entrypoint参数中指定的可执行文件或命令会覆盖镜像的默认启动命令,Entrypoint中指定的执行命令内容不在镜像中预置,在本地环境通过docker run启动通过Notebook保存的镜像,报错创建容器任务失败,启动文件或目录不存在,如图2。因此需要设置--entr - [如何在ModelArts的Notebook中配置Conda源?](https://support.huaweicloud.com/modelarts_faq/docker-modelarts_0009.md): 用户可以在Notebook开发环境中自行安装开发依赖包,方便使用。常见的依赖安装支持pip和Conda,pip源已经配置好,可以直接使用安装,Conda源需要多一步配置。本章节介绍如何在Notebook开发环境中配置Conda源。Conda软件已经预置在镜像中,具体操作可以参见https://mirror.tuna.tsinghua.ed - [ModelArts的自定义镜像软件版本匹配有哪些注意事项?](https://support.huaweicloud.com/modelarts_faq/docker-modelarts_6019.md): 如果您的自定义镜像涉及NCCL、CUDA、OFED等软件库,当您制作自定义镜像时,您需要确保镜像中的软件库和ModelArts的软件库相匹配。您镜像中的软件版本需要满足以下要求:NCCL版本 ≥ 2.7.8。OFED版本 ≥ MLNX_OFED_LINUX-5.4-3.1.0.0。CUDA版本需要参考专属资源池的GPU驱动版本,自主进行适 - [镜像在SWR上显示只有13GB,安装少量的包,然后镜像保存过程会提示超过35GB大小保存失败,为什么?](https://support.huaweicloud.com/modelarts_faq/docker-modelarts_6025.md): 我的镜像在SWR侧看,只有13GB左右,在开发环境Notebook镜像管理注册,启动Notebook实例后,安装一些包后,镜像保存过程会提示超过35GB大小,保存失败?SWR侧看到的大小是镜像压缩后的大小,解压后实际大小一般是压缩后的2.5~3倍,所以才会安装少量的包后,镜像大小超过35GB。 - [如何保证自定义镜像能不因为超过35GB而保存失败?](https://support.huaweicloud.com/modelarts_faq/docker-modelarts_6026.md): 可以从如下几方面考虑:请选择较小的基础镜像创建Notebook实例,这样在实例中可操作的空间才会大,可自由安装的包才能更多,一般建议原始的启动Notebook的基础镜像在SWR侧查看大小不要超过6GB。镜像保存主要保存在/home/ma-user路径下除挂载路径/home/ma-user/work以外的目录,请将数据集等放到work路径下 - [如何减小本地或ECS构建镜像的目的镜像的大小?](https://support.huaweicloud.com/modelarts_faq/docker-modelarts_6027.md): 减小目的镜像大小的最直接的办法就是选择尽可能小且符合自己诉求的镜像,比如您需要制作一个PyTorch2.1+Cuda12.2的镜像,官方如果没有提供对应的PyTorch或者Cuda版本的镜像,优选一个没有PyTorch环境或没有安装Cuda的镜像,而不是选择一个PyTorch引擎和Cuda都不满足的镜像,如MindSpore+Cuda11 - [镜像过大,卸载原来的包重新打包镜像,最终镜像会变小吗?](https://support.huaweicloud.com/modelarts_faq/docker-modelarts_6028.md): 不会,反而会变大。因为Docker镜像的层原因,当前的镜像是基于原来的镜像制作,而原来的镜像层数是无法改变的,层不变的情况下,大小是不变的,卸载包或者删除数据集,会新增镜像层,镜像反而会变大,这和传统概念的存储不一样。 - [在ModelArts镜像管理注册镜像报错ModelArts.6787怎么处理?](https://support.huaweicloud.com/modelarts_faq/docker-modelarts_6029.md): 在“镜像管理”界面注册镜像时报错“ModelArts.6787:镜像***无法使用,在SWR路径下***无法找到指定镜像,请在SWR控制台检查镜像及访问权限配置,或使用其他镜像并重试”。报错主要有如下原因:该镜像是主账号注册的private镜像,子账号在使用,而主账号没有给子账号赋SWR权限,子账号从SWR Console界面看不到该镜像 - [用户如何设置默认的kernel?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0096.md): 用户希望打开Notebook默认的kernel为自己自定义的kernel。解决方式:在Terminal里执行如下命令在镜像里指定环境变量。# python-3.7.10这里指用户想设置的kernel名称 export KG_DEFAULT_KERNEL_NAME=python-3.7.10单击操作列的更多>保存镜像,保存成功后然后重新启动 - [ModelArts支持使用ECS创建专属资源池吗?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0141.md): 不支持。创建资源池时,只能选择界面提供的“未售罄”节点规格进行创建。专属资源池的节点规格后台是对应的ECS资源,但是无法使用账号下购买的ECS,作为ModelArts专属资源池。 - [在ModelArts中1个节点的专属资源池,能否部署多个服务?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0229.md): 支持。在部署服务时,选择专属资源池,在选择计算节点规格时选择自定义规格,设置小一些或者选择小规格的服务节点规格,当资源池节点可以容纳多个服务节点规格时,就可以部署多个服务。如果使用此方式进行部署推理,选择的规格务必满足模型的要求,当设置的规格过小,无法满足模型的最小推理要求时,则会出现部署失败或预测失败的情况。 - [在ModelArts中公共资源池和专属资源池的区别是什么?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3131.md): 专属资源池:提供独享的计算资源,可用于训练作业、部署服务。专属资源池不与其他用户共享,更加高效。在使用专属资源池之前,您需要先创建一个专属资源池,在ModelArts平台创建训练作业、部署模型时,均通过专属资源池的计算资源进行实例下发。专属资源池说明物理资源池逻辑资源池资源队列(原逻辑子池)为用户提供独立的计算集群、网络,不同用户间的专属 - [ModelArts中的作业为什么一直处于等待中?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0363.md): 当前训练任务排队的逻辑是先进先出,前面的任务没运行完后面的任务不会运行,有可能会造成小任务被“饿死”,需要用户注意。饿死指的是前面的任务被一个大的任务堵着(例如是64卡),需要等空闲64卡这个任务才能运行,64卡的任务后面跟着1卡的。即使现在空出来30卡,这个1卡的任务也排不上。如果是公共资源池,一般是由于其他用户占用资源导致。有以下方法 - [ModelArts控制台为什么能看到创建失败被删除的专属资源池?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3179.md): 在控制台页面操作删除专属资源池后,后端服务需要进行资源实例释放。在资源实例释放过程中,用户依然可以查询到资源池。如果需要创建专属资源池,建议等待5min后再创建,且不要使用已创建过的专属资源池名称来命名新建的专属资源池。如果做UI自动化测试,建议用例用随机串替代。 - [ModelArts训练专属资源池如何与SFS弹性文件系统配置对等连接?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3180.md): 配置训练专属资源池与SFS弹性文件系统的对等连接,需要资源池打通VPC,使得资源池与SFS弹性文件系统所配置的VPC相同。配置完成后,在创建训练作业时,就可以看到SFS的配置选项。打通VPC步骤请参考打通VPC。 - [升级GPU驱动时一直处于升级中(升级耗时超过30分钟)或驱动异常如何处理?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3181.md): 当基于ModelArts专属资源池(或标准算力集群)升级GPU驱动时如果发现驱动状态长期(超过30分钟)处于升级中或者显示驱动异常,可以通过重启对应节点恢复。如果无法重启或者重启后无法恢复,请联系华为侧排查。节点重启详细操作请参见节点重启。 - [模型部署作业类型状态一直处于环境初始化中,kubeinfer插件状态异常如何处理?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3182.md): ModelArts专属池模型部署作业类型启用需依赖Kubeinfer插件处于正常运行状态,若该插件状态异常,模型部署作业类型将显示为"环境初始化中"。针对Kubeinfer插件状态异常,建议您按以下步骤排查:确认资源池是否满足插件配额要求,可通过资源池详情页“节点”页签查看所有节点资源占用情况。核查资源池节点数量是否小于插件副本数,若存在 - [ModelArts支持使用ECS创建专属资源池吗?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0141.md): 不支持。创建资源池时,只能选择界面提供的“未售罄”节点规格进行创建。专属资源池的节点规格后台是对应的ECS资源,但是无法使用账号下购买的ECS,作为ModelArts专属资源池。 - [在ModelArts中1个节点的专属资源池,能否部署多个服务?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0229.md): 支持。在部署服务时,选择专属资源池,在选择计算节点规格时选择自定义规格,设置小一些或者选择小规格的服务节点规格,当资源池节点可以容纳多个服务节点规格时,就可以部署多个服务。如果使用此方式进行部署推理,选择的规格务必满足模型的要求,当设置的规格过小,无法满足模型的最小推理要求时,则会出现部署失败或预测失败的情况。 - [在ModelArts中公共资源池和专属资源池的区别是什么?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3131.md): 专属资源池:提供独享的计算资源,可用于训练作业、部署服务。专属资源池不与其他用户共享,更加高效。在使用专属资源池之前,您需要先创建一个专属资源池,在ModelArts平台创建训练作业、部署模型时,均通过专属资源池的计算资源进行实例下发。专属资源池说明物理资源池逻辑资源池资源队列(原逻辑子池)为用户提供独立的计算集群、网络,不同用户间的专属 - [ModelArts中的作业为什么一直处于等待中?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0363.md): 当前训练任务排队的逻辑是先进先出,前面的任务没运行完后面的任务不会运行,有可能会造成小任务被“饿死”,需要用户注意。饿死指的是前面的任务被一个大的任务堵着(例如是64卡),需要等空闲64卡这个任务才能运行,64卡的任务后面跟着1卡的。即使现在空出来30卡,这个1卡的任务也排不上。如果是公共资源池,一般是由于其他用户占用资源导致。有以下方法 - [ModelArts控制台为什么能看到创建失败被删除的专属资源池?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3179.md): 在控制台页面操作删除专属资源池后,后端服务需要进行资源实例释放。在资源实例释放过程中,用户依然可以查询到资源池。如果需要创建专属资源池,建议等待5min后再创建,且不要使用已创建过的专属资源池名称来命名新建的专属资源池。如果做UI自动化测试,建议用例用随机串替代。 - [ModelArts训练专属资源池如何与SFS弹性文件系统配置对等连接?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3180.md): 配置训练专属资源池与SFS弹性文件系统的对等连接,需要资源池打通VPC,使得资源池与SFS弹性文件系统所配置的VPC相同。配置完成后,在创建训练作业时,就可以看到SFS的配置选项。打通VPC步骤请参考打通VPC。 - [升级GPU驱动时一直处于升级中(升级耗时超过30分钟)或驱动异常如何处理?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3181.md): 当基于ModelArts专属资源池(或标准算力集群)升级GPU驱动时如果发现驱动状态长期(超过30分钟)处于升级中或者显示驱动异常,可以通过重启对应节点恢复。如果无法重启或者重启后无法恢复,请联系华为侧排查。节点重启详细操作请参见节点重启。 - [模型部署作业类型状态一直处于环境初始化中,kubeinfer插件状态异常如何处理?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3182.md): ModelArts专属池模型部署作业类型启用需依赖Kubeinfer插件处于正常运行状态,若该插件状态异常,模型部署作业类型将显示为"环境初始化中"。针对Kubeinfer插件状态异常,建议您按以下步骤排查:确认资源池是否满足插件配额要求,可通过资源池详情页“节点”页签查看所有节点资源占用情况。核查资源池节点数量是否小于插件副本数,若存在 - [ModelArts SDK、OBS SDK和MoXing的区别是什么?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0151.md): ModelArts服务提供的SDK,可调用ModelArts功能。您可以下载SDK至本地调用接口,也可以在ModelArts Notebook中直接调用。ModelArts SDK提供了OBS管理、训练管理、模型管理、服务管理等几个模块功能。目前,仅提供了Python语言的ModelArts SDK接口。详细指导文档:《ModelArts - [ModelArts的API或SDK支持模型下载到本地吗?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0201.md): ModelArts的API和SDK不支持模型下载到本地,但训练作业输出的模型是存放在对象存储服务(OBS)里面的,您可以通过OBS的API或SDK下载存储在OBS中的文件,具体请参见从OBS下载文件。 - [ModelArts通过OBS的API访问OBS中的文件,属于内网还是公网访问?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0228.md): 在同一区域,ModelArts通过OBS的API访问OBS中的文件属于内网通信,不消耗公网流量费。如果是通过互联网从OBS下载数据到本地,这时候会产生OBS公网流量费。OBS的详细计费说明可以参见计费项。 - [调用ModelArts API接口创建训练作业和部署服务时,如何填写资源池的参数?](https://support.huaweicloud.com/modelarts_faq/modelarts_01_1026.md): 调用API接口创建训练作业时,“pool_id”为“资源池ID”。调用API接口部署在线服务时,“pool_name”为“资源池ID”。 - [ModelArts SDK、OBS SDK和MoXing的区别是什么?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0151.md): ModelArts服务提供的SDK,可调用ModelArts功能。您可以下载SDK至本地调用接口,也可以在ModelArts Notebook中直接调用。ModelArts SDK提供了OBS管理、训练管理、模型管理、服务管理等几个模块功能。目前,仅提供了Python语言的ModelArts SDK接口。详细指导文档:《ModelArts - [ModelArts的API或SDK支持模型下载到本地吗?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0201.md): ModelArts的API和SDK不支持模型下载到本地,但训练作业输出的模型是存放在对象存储服务(OBS)里面的,您可以通过OBS的API或SDK下载存储在OBS中的文件,具体请参见从OBS下载文件。 - [ModelArts通过OBS的API访问OBS中的文件,属于内网还是公网访问?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_0228.md): 在同一区域,ModelArts通过OBS的API访问OBS中的文件属于内网通信,不消耗公网流量费。如果是通过互联网从OBS下载数据到本地,这时候会产生OBS公网流量费。OBS的详细计费说明可以参见计费项。 - [调用ModelArts API接口创建训练作业和部署服务时,如何填写资源池的参数?](https://support.huaweicloud.com/modelarts_faq/modelarts_01_1026.md): 调用API接口创建训练作业时,“pool_id”为“资源池ID”。调用API接口部署在线服务时,“pool_name”为“资源池ID”。 - [A系列裸金属服务器如何进行RoCE性能带宽测试?](https://support.huaweicloud.com/modelarts_faq/modelarts_15_0034.md): 本文主要指导如何在A系列裸金属服务器上测试RoCE性能带宽。A系列裸金属服务器已经安装了IB驱动。(网卡设备名称可以使用ibstatus或者ibstat获取。Ant8裸金属服务器使用Ubuntu20.04操作系统默认已经安装IB驱动。)方法1:使用mlx硬件计数器,估算ROCE网卡收发流量统计300s内流量,统计脚本如下:上述获取的值*4 - [A系列裸金属服务器节点内如何进行NVLINK带宽性能测试方法?](https://support.huaweicloud.com/modelarts_faq/modelarts_15_0035.md): 本文指导如何进行节点内NVLINK带宽性能测试,适用的环境为:Ant8或者Ant1裸金属服务器, 且服务器中已经安装相关驱动软件,以及Pytorch2.0。A系列裸金属服务器,单台服务器间是走NVLINK,可以通过相关命令查询拓扑模式:正常模式-NVLINK全互通,带宽约为370GB/s。基本符合预期,且证明Ant裸金属服务器内部卡间确实 - [如何将Ubuntu20.04内核版本从低版本升级至5.4.0-144-generic?](https://support.huaweicloud.com/modelarts_faq/modelarts_15_0036.md): Ubuntu20.04内核版本从低版本升级至5.4.0-144-generic。第一条命令为安装Linux内核头文件和内核镜像,其中版本为5.4.0-144-generic。第二条命令为重新生成GRUB引导程序的配置文件,用于在启动计算机时加载操作系统, 命令将使用新安装的内核镜像更新GRUB的配置文件,以便在下次启动时加载新的内核。 - [如何禁止Ubuntu 20.04内核自动升级?](https://support.huaweicloud.com/modelarts_faq/modelarts_15_0037.md): 在Ubuntu 20.04每次内核升级后,系统需要重新启动以加载新内核。如果您已经安装了自动更新功能,则系统将自动下载和安装可用的更新,这可能导致系统在不经意间被重启,如果使用的软件依赖于特定版本的内核,那么当系统自动更新到新的内核版本时,可能会出现兼容性问题。在使用Ubuntu20.04时,建议手动控制内核的更新。禁用自动更新可能会导致 - [哪里可以了解Atlas800训练服务器硬件相关内容](https://support.huaweicloud.com/modelarts_faq/modelarts_15_0038.md): 本文提供Atlas800训练服务器硬件相关指南,包括三维视图、备件信息、HCCL常用方法以及网卡配置信息。Atlas 800 训练服务器(型号9000)是基于华为鲲鹏920+Snt9处理器的AI训练服务器,实现完全自主可控,广泛应用于深度学习模型开发和AI训练服务场景,可单击此处查看硬件三维视图。Atlas 800 训练服务器 1.0.1 - [使用A系列裸金属服务器有哪些注意事项?](https://support.huaweicloud.com/modelarts_faq/modelarts_15_0039.md): 使用A系列裸金属服务器时有如下注意事项:nvidia-fabricmanager版本号必须和nvidia-driver版本号保持一致。NCCL必须和CUDA版本相匹配,可单击此处可查看配套关系和安装方法。使用该裸金属服务器制作自定义镜像时, 必须清除残留文件,请参考清理文件。 - [A系列裸金属服务器如何更换NVIDIA和CUDA?](https://support.huaweicloud.com/modelarts_faq/modelarts_15_0040.md): 当裸金属服务器预置的NVIDIA版本和业务需求不匹配时,需要更换NVIDIA驱动和CUDA版本。本文介绍华为云A系列裸金属服务器(Ubuntu20.04系统)如何从“NVIDIA 525+CUDA 12.0”更换为“NVIDIA 515+CUDA 11.7”。查看使用apt包管理方式安装的nvidia软件包, 执行如下命令实现查看和卸载。 - [A系列裸金属服务器如何进行RoCE性能带宽测试?](https://support.huaweicloud.com/modelarts_faq/modelarts_15_0034.md): 本文主要指导如何在A系列裸金属服务器上测试RoCE性能带宽。A系列裸金属服务器已经安装了IB驱动。(网卡设备名称可以使用ibstatus或者ibstat获取。Ant8裸金属服务器使用Ubuntu20.04操作系统默认已经安装IB驱动。)方法1:使用mlx硬件计数器,估算ROCE网卡收发流量统计300s内流量,统计脚本如下:上述获取的值*4 - [A系列裸金属服务器节点内如何进行NVLINK带宽性能测试方法?](https://support.huaweicloud.com/modelarts_faq/modelarts_15_0035.md): 本文指导如何进行节点内NVLINK带宽性能测试,适用的环境为:Ant8或者Ant1裸金属服务器, 且服务器中已经安装相关驱动软件,以及Pytorch2.0。A系列裸金属服务器,单台服务器间是走NVLINK,可以通过相关命令查询拓扑模式:正常模式-NVLINK全互通,带宽约为370GB/s。基本符合预期,且证明Ant裸金属服务器内部卡间确实 - [如何将Ubuntu20.04内核版本从低版本升级至5.4.0-144-generic?](https://support.huaweicloud.com/modelarts_faq/modelarts_15_0036.md): Ubuntu20.04内核版本从低版本升级至5.4.0-144-generic。第一条命令为安装Linux内核头文件和内核镜像,其中版本为5.4.0-144-generic。第二条命令为重新生成GRUB引导程序的配置文件,用于在启动计算机时加载操作系统, 命令将使用新安装的内核镜像更新GRUB的配置文件,以便在下次启动时加载新的内核。 - [如何禁止Ubuntu 20.04内核自动升级?](https://support.huaweicloud.com/modelarts_faq/modelarts_15_0037.md): 在Ubuntu 20.04每次内核升级后,系统需要重新启动以加载新内核。如果您已经安装了自动更新功能,则系统将自动下载和安装可用的更新,这可能导致系统在不经意间被重启,如果使用的软件依赖于特定版本的内核,那么当系统自动更新到新的内核版本时,可能会出现兼容性问题。在使用Ubuntu20.04时,建议手动控制内核的更新。禁用自动更新可能会导致 - [哪里可以了解Atlas800训练服务器硬件相关内容](https://support.huaweicloud.com/modelarts_faq/modelarts_15_0038.md): 本文提供Atlas800训练服务器硬件相关指南,包括三维视图、备件信息、HCCL常用方法以及网卡配置信息。Atlas 800 训练服务器(型号9000)是基于华为鲲鹏920+Snt9处理器的AI训练服务器,实现完全自主可控,广泛应用于深度学习模型开发和AI训练服务场景,可单击此处查看硬件三维视图。Atlas 800 训练服务器 1.0.1 - [使用A系列裸金属服务器有哪些注意事项?](https://support.huaweicloud.com/modelarts_faq/modelarts_15_0039.md): 使用A系列裸金属服务器时有如下注意事项:nvidia-fabricmanager版本号必须和nvidia-driver版本号保持一致。NCCL必须和CUDA版本相匹配,可单击此处可查看配套关系和安装方法。使用该裸金属服务器制作自定义镜像时, 必须清除残留文件,请参考清理文件。 - [A系列裸金属服务器如何更换NVIDIA和CUDA?](https://support.huaweicloud.com/modelarts_faq/modelarts_15_0040.md): 当裸金属服务器预置的NVIDIA版本和业务需求不匹配时,需要更换NVIDIA驱动和CUDA版本。本文介绍华为云A系列裸金属服务器(Ubuntu20.04系统)如何从“NVIDIA 525+CUDA 12.0”更换为“NVIDIA 515+CUDA 11.7”。查看使用apt包管理方式安装的nvidia软件包, 执行如下命令实现查看和卸载。 - [轻量算力集群资源池如何进行NCCl Test?](https://support.huaweicloud.com/modelarts_faq/usermanual-modelarts-lite-0041.md): ModelArts提供AI诊断功能,用户可以通过NCCL Test,测试节点GPU状态,并且测试多个节点间的通信速度。测试使用的最大数据:取值范围[1, 1024],单位可选为“B”、“KB”、“MB”、“GB”、“TB”。测试使用的最大数据须大于开始测试使用的最小数据。开始测试使用的最小数据:取值范围[1, 1024],单位可选为“B” - [升级GPU驱动时一直处于升级中(升级耗时超过30分钟)或驱动异常如何处理?](https://support.huaweicloud.com/modelarts_faq/modelarts-lite-0041.md): 当基于ModelArts轻量算力集群升级GPU驱动时如果发现驱动状态长期(超过30分钟)处于升级中或者显示驱动异常,可以通过重启对应节点恢复。如果无法重启或者重启后无法恢复,请联系华为侧排查。节点重启详细操作请参见节点重启。 - [安装kubeinfer插件状态异常如何处理?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3183.md): Kubeinfer插件状态异常,建议您按以下步骤排查:确认资源池是否满足插件配额要求,可通过资源池详情页侧边栏“节点管理”查看所有节点资源占用情况。核查资源池节点数量是否小于插件副本数,若存在该情况,可通过编辑插件将副本数调整为当前节点数量以恢复服务。 - [创建轻量算力集群资源池的属主用户离职或委托不足时如何处理?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3184.md): 创建轻量算力集群时会将创建者标记为该集群的属主,其他用户操作该集群使用属主的委托,当属主因部门变更或离职导致委托不足或不存在时,其他有权限的用户可能将无法使用该资源池,请联系华为侧运维替换资源池的属主,需提供一个有权限的新用户名和用户ID,用户权限通过ModelArts权限管理查询,用户ID从IAM用户页查询。属主权限不足报错信息为“no - [轻量算力集群资源池如何进行NCCl Test?](https://support.huaweicloud.com/modelarts_faq/usermanual-modelarts-lite-0041.md): ModelArts提供AI诊断功能,用户可以通过NCCL Test,测试节点GPU状态,并且测试多个节点间的通信速度。测试使用的最大数据:取值范围[1, 1024],单位可选为“B”、“KB”、“MB”、“GB”、“TB”。测试使用的最大数据须大于开始测试使用的最小数据。开始测试使用的最小数据:取值范围[1, 1024],单位可选为“B” - [升级GPU驱动时一直处于升级中(升级耗时超过30分钟)或驱动异常如何处理?](https://support.huaweicloud.com/modelarts_faq/modelarts-lite-0041.md): 当基于ModelArts轻量算力集群升级GPU驱动时如果发现驱动状态长期(超过30分钟)处于升级中或者显示驱动异常,可以通过重启对应节点恢复。如果无法重启或者重启后无法恢复,请联系华为侧排查。节点重启详细操作请参见节点重启。 - [安装kubeinfer插件状态异常如何处理?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3183.md): Kubeinfer插件状态异常,建议您按以下步骤排查:确认资源池是否满足插件配额要求,可通过资源池详情页侧边栏“节点管理”查看所有节点资源占用情况。核查资源池节点数量是否小于插件副本数,若存在该情况,可通过编辑插件将副本数调整为当前节点数量以恢复服务。 - [创建轻量算力集群资源池的属主用户离职或委托不足时如何处理?](https://support.huaweicloud.com/modelarts_faq/modelarts_05_3184.md): 创建轻量算力集群时会将创建者标记为该集群的属主,其他用户操作该集群使用属主的委托,当属主因部门变更或离职导致委托不足或不存在时,其他有权限的用户可能将无法使用该资源池,请联系华为侧运维替换资源池的属主,需提供一个有权限的新用户名和用户ID,用户权限通过ModelArts权限管理查询,用户ID从IAM用户页查询。属主权限不足报错信息为“no ## 故障排除 - [ModelArts中提示OBS相关错误](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0157.md): 在ModelArts中引用OBS桶路径时,提示找不到用户创建的OBS桶或提示ModelArts.2791:非法的OBS路径。在对OBS桶操作时,出现Error: stat:403错误。Notebook中下载OBS文件时提示Permission denied。OBS桶与ModelArts不在同一个区域导致。没有他人OBS桶的访问权限。Mod - [ModelArts中提示ModelArts.7211: 账号已受限](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0320.md): 在ModelArts控制台提示“ModelArts.7211: 账号已受限”。可能是账号欠费导致。查看华为云账号是否欠费,可以通过以下步骤进行:登录华为云官网的费用中心。在“总览”页面,您可以查看可用额度。如果可用额度为负数,则表示账号存在欠费,建议充值。 - [ModelArts作业挂载SFS Turbo失败](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0002.md): 专属资源池下,打通专属池与sfs的VPC,页面显示打通成功,创建开发环境、训练、推理作业失败,报错SFS Turbo挂载失败。资源池网段与SFS Turbo配置冲突,可能导致作业挂载文件系统失败。创建作业时,选择所在VPC子网网段与资源池容器网段、服务网段均无冲突SFS Turbo文件系统。 - [Notebook提示磁盘空间已满](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0006.md): 在使用Notebook时,提示磁盘空间已满:No Space left on Device。在Notebook执行代码时,出现如下报错,提示:Disk quota exceeded。在JupyterLab浏览器左侧导航删除文件后,会默认放入回收站占用内存,导致磁盘空间不足。磁盘配额不足。查看虚拟机所使用的存储空间,再查看回收站文件占用内存 - [Notebook中使用Conda安装Keras 2.3.1报错](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0261.md): 使用Conda安装Keras 2.3.1版本报错。可能是Conda网络不通,请使用pip install命令安装。执行!pip install keras==2.3.1命令安装Keras。 - [Notebook中安装依赖包报错ERROR: HTTP error 404 while getting xxx](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0270.md): 在Notebook中安装依赖包时报错,报错截图如下:pypi源没有这个包或源不可用。使用别的源下载。 - [Notebook中已安装对应库,仍报错import numba ModuleNotFoundError: No module named 'numba'](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0271.md): 在Notebook中使用!pip install numba命令安装了numba库且运行正常(且已保存为自定义镜像), 然后使用DataArts执行此脚本的任务时提示没有这个库。客户创建了多个虚拟环境,numba库安装在了python-3.7.10中,如图1所示。在Terminal中执行conda deactivate命令退出当前虚拟环境 - [JupyterLab中文件保存失败,如何解决?](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_3145.md): JupyterLab中保存文件时报错如下:浏览器安装了第三方插件proxy进行了拦截,导致无法进行保存。在Notebook中的运行文件超过指定大小就会提示此报错。jupyter页面打开时间太长。网络环境原因,是否有连接网络代理。关掉插件然后重新保存。减少文件大小。重新打开jupyter页面。请检查网络。 - [用户结束kernelgateway进程后报错Server Connection Error,如何恢复?](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0293.md): 当kernelgateway进程被结束后,出现如下报错,以及选不到Kernel。用户误操作引起的。打开Terminal窗口,执行以下命令启动kernelgateway服务。API_TYPE=kernel_gateway.jupyter_websocket LOG_DIR="/home/ma-user/log" mkdir -p ${LOG - [创建Notebook失败,查看事件显示JupyterProcessKilled](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0269.md): 创建Notebook失败,在Notebook详情页面的事件页签,查看事件显示JupyterProcessKilled。出现此故障是因为Jupyter进程被清理掉了,一般情况Notebook会自动重启的,如果没有自动重启,创建一直失败,请确认是否是自定义镜像的问题。排查是否是自定义镜像的问题。自定义镜像构建完成,在ModelArts镜像管理 - [创建Notebook实例后无法打开页面,如何处理?](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_0021.md): 如果您在创建Notebook实例之后,打开Notebook时,因报错导致无法打开页面,您可以根据以下对应的错误码来排查解决。Notebook打开后黑屏,由于代理问题导致,切换代理。打开Notebook时显示空白,请清理浏览器缓存后尝试重新打开。检查浏览器是否安装了过滤广告组件,如果是,请关闭该组件。如果是IAM用户在创建实例时出现此错误, - [使用pip install时出现“没有空间”的错误](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_0044.md): 在Notebook实例中,使用pip install时,出现“No Space left...”的错误。建议使用pip install --no-cache **命令安装,而不是使用pip install **。加上--no-cache参数,可以解决很多此类报错。 - [出现“save error”错误,可以运行代码,但是无法保存](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_0051.md): 如果当前Notebook还可以运行代码,但是无法保存,保存时会提示“save error”错误。大多数原因是华为云WAF安全拦截导致的。当前页面,即用户的输入或者代码运行的输出有一些字符被华为云拦截,认为有安全风险。出现此问题时,请提交工单,联系专业的工程师帮您核对并处理问题。 - [单击Notebook的打开按钮时报“请求超时”错误?](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_0127.md): 单击Notebook的打开按钮时出现“请求超时”错误。当Notebook容器因内存溢出等原因导致崩溃时,如果此时单击Notebook的打开按钮时,将会出现“请求超时”错误。请耐心等待容器恢复,约几十秒,再重新单击打开按钮即可。 - [出现ModelArts.6333错误,如何处理?](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0042.md): 在使用Notebook过程中,界面出现“ModelArts.6333”报错信息。可能由于实例过负载引起故障,Notebook正在自动恢复中,请刷新页面并等待几分钟。常见原因是内存占用满。当出现此错误时,Notebook会自动恢复,您可以刷新页面,等待几分钟。由于出现此错误,常见原因是内存占用满导致的,您可以尝试使用如下方法,从根本上解决错 - [打开Notebook实例提示token不存在或者token丢失如何处理?](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0260.md): 把已打开的Notebook URL发送给他人使用,他人无法打开,报错“……lost token or incorrect token……”。原因是由于其他人没有此账号的令牌导致。在此URL末尾加上Notebook实例的token。出于安全考虑,不建议通过此方式传播Notebook实例,防止实例被恶意利用。URL参考示例:https://e - [创建Notebook失败,报错ModelArts.6720,存储路径不存在](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0013.md): 在ModelArts管理控制台创建Notebook失败,报错:创建Notebook时,高性能弹性文件服务SFS Turbo的文件系统目录不存在(例如报错中的/work/)。登录弹性文件服务(SFS Turbo)的API Explore,在搜索框中输入CreateFsDir,使用CreateFsDir接口创建目录。关于参数说明,请参见创建目 - [Notebook运行代码报错,在'/tmp'中找不到文件](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0008.md): 使用Notebook运行代码,报错:根据报错提示,需要排查是否将大量数据被保存在/tmp中。进入到Terminal界面。在/tmp目录下,执行命令du -sh *,查看该目录下的空间占用情况。sh-4.3$cd /tmp sh-4.3$du -sh * 4.0K core-js-banners 0 npm-19-41ed - [Notebook无法执行代码,如何处理?](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_0059.md): 当Notebook出现无法执行时,您可以根据如下几种情况判断并处理。如果只是Cell的执行过程卡死或执行时间过长,如图1中的第2个和第3个Cell,导致第4个Cell无法执行,但整个Notebook页面还有反应,其他Cell也还可以单击,则直接单击下图中红色方框处的interrupt the kernel,停止所有Cell的执行,同时会保 - [运行训练代码,出现dead kernel,并导致实例崩溃](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_0050.md): 在Notebook实例中运行训练代码,如果数据量太大或者训练层数太多,亦或者其他原因,导致出现“内存不够”问题,最终导致该容器实例崩溃。出现此问题后,系统将自动重启Notebook,来修复实例崩溃的问题。此时只是解决了崩溃问题,如果重新运行训练代码仍将失败。如果您需要解决“内存不够”的问题,建议您创建一个新的Notebook,使用更高规格 - [如何解决训练过程中出现的cudaCheckError错误?](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_0167.md): Notebook中,运行训练代码出现如下错误。因为编译的时候需要设置setup.py中编译的参数arch和code和电脑的显卡匹配。对于GP Vnt1的显卡,GPU算力为-gencode arch=compute_70,code=[sm_70,compute_70],设置setup.py中的编译参数即可解决。 - [开发环境提示空间不足,如何解决?](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0116.md): 开发环境提示空间不足。开发环境空间不足。当提示空间不足时,推荐使用EVS类型的Notebook实例。参考如何在Notebook中上传下载OBS文件?操作指导,针对原有的Notebook,首先将代码和数据上传至OBS桶中。然后创建一个EVS类型的Notebook,将此OBS中的文件下载至Notebook本地(指新建的EVS类型Noteboo - [如何处理使用opencv.imshow造成的内核崩溃?](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_0168.md): 当在Notebook中使用opencv.imshow后,会造成Notebook崩溃。opencv的cv2.imshow在jupyter这样的client/server环境下存在问题。 而matplotlib不存在这个问题。参考如下示例进行图片显示。注意opencv加载的是BGR格式, 而matplotlib显示的是RGB格式。Python - [使用Windows下生成的文本文件时报错找不到路径?](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_0169.md): 当在Notebook中使用Windows下生成的文本文件时,文本内容无法正确读取,可能报错找不到路径。Notebook是Linux环境,和Windows环境下的换行格式不同,Windows下是CRLF,而Linux下是LF。可以在Notebook中转换文件格式为Linux格式。shell语言: - [创建Notebook文件后,右上角的Kernel状态为“No Kernel”如何处理?](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0246.md): 现象:创建Notebook文件后,右上角的Kernel状态为“No Kernel”。可能因为用户工作目录下的code.py和创建kernel依赖的import code文件名称冲突。查看/home/ma-user/log/下以“kernelgateway”开头的最新日志文件,搜索“Starting kernel”附近的日志。如果看到如下 - [git插件密码失效如何解决?](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0256.md): 在JupyterLab中使用git插件时,当git clone私有仓库和git push文件时会出现如下报错:原因为Github已取消密码授权方式,此时在git clone私有仓库和git push文件时需要在授权方式框中输入token。使用token替换原先的密码授权方式,在git clone私有仓库和git push文件时,需要在授权 - [在ModelArts控制台界面上单击VS Code接入并在新界面单击打开,VS Code打开后未进行远程连接](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_3115.md): 如果本地为Linux系统,见原因分析二。自动安装VS Code插件ModelArts-HuaweiCloud失败。方法一:检查VS Code网络是否正常。在VS Code插件市场上搜索ModelArts-HuaweiCloud,如果显示如下则网络异常,请切换代理或使用其他网络。操作完成后再次执行搜索,如果显示如下则网络正常,请回到Mode - [VS Code连接开发环境失败时的排查方法](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_4190.md): VS Code连接开发环境失败时,请参考以下步骤进行基础排查。在ModelArts管理控制台查看Notebook实例状态是否正常,确保实例无问题。在VS Code Terminal里执行如下命令,检测SSH命令是否可用。ssh -i <密钥相对路径> -p <端口> ma-user@<域名/ip>如果SSH命令不可用,请执行以下命令,排查 - [远程连接出现弹窗报错:Could not establish connection to xxx](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_3116.md): 执行VS Code Remote SSH连接失败。单击弹窗右上角关闭弹窗,查看OUTPUT中的具体报错信息,并参考后续章节列举的几种常见报错解决问题。 - [连接远端开发环境时,一直处于"Setting up SSH Host xxx: Downloading VS Code Server locally"超过10分钟以上,如何解决?](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_3117.md): 当前本地网络原因,导致远程自动安装VS Code Server时间过长。打开VS Code,选择Help>About,并记下“Commit”的ID码。确认创建Notebook实例使用的镜像的系统架构,可以在Notebook中打开Terminal,通过命令uname -m查看。下载对应版本的vscode-server,根据Commit码和N - [连接远端开发环境时,一直处于"Setting up SSH Host xxx: Copying VS Code Server to host with scp"超过10分钟以上,如何解决?](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_3126.md): 连接远端开发环境时,一直处于"Setting up SSH Host xxx: Copying VS Code Server to host with scp"超过10分钟以上。通过查看日志发现本地vscode-scp-done.flag显示成功上传,但远端未接收到。关闭VS Code所有窗口后,回到ModelArts控制台界面再次单击界 - [连接远端开发环境时,一直处于"ModelArts Remote Connect: Connecting to instance xxx..."超过10分钟以上,如何解决?](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_3127.md): 连接远端开发环境时,一直处于"ModelArts Remote Connect: Connecting to instance xxx..."超过10分钟以上。报错示例如下:单击Cancel,并回到ModelArts控制台界面再次单击界面上的VS Code接入按钮。 - [远程连接处于retry状态如何解决?](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_3118.md): 之前下载VS Code server失败,有残留信息,导致本次无法下载。方法一(本地):打开命令面板(Windows: Ctrl+Shift+P,macOS:Cmd+Shift+P),搜索“Kill VS Code Server on Host”,选择出问题的实例进行自动清除,然后重新进行连接。方法二(远端):在VS Code的Termi - [报错“The VS Code Server failed to start”如何解决?](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_3119.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [报错“Permissions for 'x:/xxx.pem' are too open”如何解决?](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_3120.md): 原因分析一:密钥文件未放在指定路径,详情请参考安全限制或VS Code文档。请参考解决方法一处理。原因分析二:当操作系统为macOS/Linux时,可能是密钥文件或放置密钥的文件夹权限问题,请参考解决方法二处理。解决方法一:请将密钥放在如下路径或其子路径下:Windows:C:\Users\{{user}}macOS/Linux: Use - [报错“Bad owner or permissions on C:\Users\Administrator/.ssh/config”如何解决?](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_3211.md): VS Code连接开发环境时报错“Bad owner or permissions on C:\Users\Administrator/.ssh/config”。文件夹.ssh的权限不仅是Windows当前用户拥有,或者当前用户权限不足,故修改权限即可。找到.ssh文件夹。一般位于C:\Users,例如C:\Users\xxx。C:\Us - [报错“Connection permission denied (publickey)”如何解决?](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0301.md): VS Code连接开发环境时报错“Connection permission denied (publickey). Please make sure the key file is correctly selected and the file permission is correct. You can view the instan - [报错“ssh: connect to host xxx.pem port xxxxx: Connection refused”如何解决?](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_3121.md): 实例处于非运行状态。请前往ModelArts控制台查看实例是否处于运行状态,如果实例已停止,请执行启动操作,如果实例处于其他状态比如“错误”,请尝试先执行停止然后执行启动操作。待实例变为“运行中”后,再次执行远程连接。 - [报错"ssh: connect to host ModelArts-xxx port xxx: Connection timed out"如何解决?](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_3125.md): 通过SSH连接到Notebook实例时,出现以下错误信息:SSH连接到云端Notebook实例时网络不通。大多数情况下,这是由于本地网络的安全配置导致的。请按照以下步骤进行排查:SSH直连排查VS Code的Remote-SSH本质是调用本地的SSH客户端。在VS Code所在节点打开终端(Windows下可以是PowerShell、cm - [报错“Load key "C:/Users/xx/test1/xxx.pem": invalid format”如何解决?](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_3122.md): 密钥文件内容不正确或格式不正确。请使用正确的密钥文件进行远程访问,如果本地没有正确的密钥文件或文件已损坏,可以尝试:登录控制台,搜索“密码安全中心 DEW”,选择“密钥对管理 > 账号密钥对”页签,查看并下载正确的密钥文件。如果密钥不支持下载且已无法找到之前下载的密钥,建议创建新的开发环境实例并创建新的密钥文件。 - [报错“An SSH installation couldn't be found”或者“Could not establish connection to instance xxx: 'ssh' ...”如何解决?](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_3123.md): 或VS Code连接Notebook一直提示选择证书,且提示信息除标题外,都是乱码。选择证书后,如上图所示仍然没有反应且无法进行连接。当前环境未装OpenSSH或者OpenSSH未安装在默认路径下,详情请参考VS Code文档。如果当前环境未安装OpenSSH,请下载并安装OpenSSH。当通过“可选功能”未能成功安装时,请手动下载Ope - [报错“no such identity: C:/Users/xx/test.pem: No such file or directory”如何解决?](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_3124.md): 报错“no such identity: C:/Users/xx/test.pem: No such file or directory”。密钥文件不存在于该路径下,或者该路径下密钥文件名被修改。重新选择密钥路径。 - [报错“Host key verification failed.'或者'Port forwarding is disabled.”如何解决?](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_3128.md): 或Notebook实例重新启动后,公钥发生变化,OpenSSH核对公钥发出警告。在VS Code中使用命令方式进行远程连接时,增加参数"-o StrictHostKeyChecking=no"ssh -tt -o StrictHostKeyChecking=no -i ${IdentityFile} ${User}@${HostName} - [报错“Failed to install the VS Code Server.”或“tar: Error is not recoverable: exiting now.”如何解决?](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_0304.md): 或可能为/home/ma-user/work磁盘空间不足。删除/home/ma-user/work路径下无用文件。 - [VS Code连接远端Notebook时报错“XHR failed”](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_3129.md): VS Code连接远端Notebook时报错“XHR failed”。可能是所在环境的网络有问题,无法自动下载VS Code Server,请手动安装。打开VS Code,选择Help>About,并记下“Commit”的ID码。确认创建Notebook实例使用的镜像的系统架构,可以在Notebook中打开Terminal,通过命令una - [VS Code连接后长时间未操作,连接自动断开](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_3168.md): VS Code SSH连接后,长时间未操作,窗口未关闭,再次使用发现VS Code在重连环境,无弹窗报错。左下角显示如下图:查看VS Code Remote-SSH日志发现,连接在大约2小时后断开了:用户SSH交互操作停止后一段时间,防火墙对空闲连接进行了断开操作,SSH默认配置中不存在超时主动断连的动作,但是防火墙会关闭超时空闲连接(参 - [VS Code自动升级后,导致远程连接时间过长](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_3169.md): 由于VS Code自动升级,导致连接时需要重新下载新版vscode-server。禁止VS Code自动升级。单击左下角选择Settings项,搜索Update: Mode,将其设置为none。 - [使用SSH连接,报错“Connection reset”如何解决?](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_3212.md): 可能是用户网络限制原因。比如部分企业网络的SSH是默认屏蔽的。用户重新进行申请SSH权限。 - [使用MobaXterm工具SSH连接Notebook后,经常断开或卡顿,如何解决?](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_3220.md): MobaXterm成功连接到开发环境后,过一段时间会自动断开。配置MobaXterm工具时,没有勾选SSH keepalive或专业版MobaXterm工具的Stop server after时间设置太短。如果使用的是专业版的MobaXterm工具,请执行步骤3。 - [VS Code连接开发环境时报错Missing GLIBC,Missing required dependencies](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_4194.md): VS Code连接开发环境时报错如下:该问题为用户使用VS Code 1.86版本软件导致的,需要用户使用较低版本的VS Code 。使用VS Code 1.85版本软件。下载链接:https://code.visualstudio.com/updates/v1_85。 - [使用VSCode-huawei,报错:卸载了‘ms-vscode-remote.remot-sdh’,它被报告存在问题](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_419.md): 使用华为自研的VS Code软件时,报错“卸载了‘ms-vscode-remote.remot-sdh’,它被报告存在问题”。Remote - SSH只能在开源的VSCode软件中使用。推荐使用开源VS Code软件。 - [使用VS Code连接实例时,发现VS Code端的实例目录和云上目录不匹配](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0304.md): 用户使用VS Code连接实例时,发现VS Code端的实例目录和云上目录不匹配。实例连接错误,可能是配置文件写的不规范导致连接到别的实例。检查用户.ssh配置文件(路径一般在C:\Users\{User}\.ssh\config下),检查每组配置文件是否规范:Host必须放在每组配置的第一行,作为每组配置的唯一ID。如下,第一组配置文件 - [多用户共享同一Notebook实例时,VS Code连接异常,如何处理?](https://support.huaweicloud.com/trouble-modelarts/toctopics/zh-cn_topic_0000002656069302.md): 多用户共享同一Notebook实例时,使用VS Code Remote-SSH连接可能出现以下异常:VS Code连接Notebook实例失败或反复断开。某个插件无法加载、功能异常(如代码补全不生效、语法高亮丢失)。插件配置频繁被重置或覆盖。VS Code远程连接时,会在Notebook实例内下载并运行VS Code Server,本地客 - [本地通过SSH连接Notebook实例的故障排查](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_4195.md): 当SSH出现故障时,可能由以下原因导致: - [本地通过SSH连接Notebook实例时,报错:Bad permissions/Permission denied (publickey)](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_4201.md): 本地通过SSH连接Notebook实例时,报错:本地密钥不匹配或本地密钥文件权限不正确。在JupyterLab执行以下命令,检测服务端SSH是否正常。$CONDA_BIN/python $COMMON_DIR/ssh_availability_check.pyterminal命令示例如果执行结果如下,表示远端SSH服务正常,应该是密钥存在 - [在ModelArts打开Notebook访问正常,使用SSH/VS Code访问时权限报错:Permission denied (publickey)](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_4197.md): 通过ModelArts管理控制台打开的Notebook访问正常,使用SSH/VS Code访问时权限报错:执行passwd -S ma-user命令后:如果结果中出现L,表示用户被锁定,需要使用passwd命令解锁用户。如果结果中出现P,表示用户状态正常,可以排查其它可能原因。解锁用户在Notebook中打开Terminal窗口,依次执行 - [用户修改/home/ma-user/.ssh目录权限导致SSH无法使用,报错:Permission denied (publickey)](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_4198.md): 用户修改/home/ma-user/.ssh目录权限导致SSH连接Notebook无法使用,报错:服务端/home/ma-user目录、SSH目录权限不正确。权限不正确示例如下:解决方案有以下两种,请按需选择:在制作镜像时直接删除/home/ma-user/.ssh目录(用户无需配置SSH,Notebook启动时会自动生成)。参考以下命令 - [用户使用SSH连接Notebook实例时,同时建立的连接数超过10个,报错:ssh_exchange_identification: Connection closed by remote host](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_4199.md): 用户使用SSH连接Notebook实例时,同时建立的连接数超过10个,导致连接被拒绝,报错:同时建立的连接数超过10个,导致连接被拒绝。您可以执行以下命令,查看连接数。断开不使用的SSH连接。重启Notebook。具体操作,请参见启动/停止/删除实例。 - [SSH偶现拒绝访问问题,报错:Not allowed at this time](https://support.huaweicloud.com/trouble-modelarts/modelarts_notebook_0001.md): 执行SSH命令连接Notebook时,一直报错:Not allowed at this time。存在攻击者通过持续暴力破解SSH服务端触发段错误(libnss_systemd.so.2),导致服务端进入90秒拒绝服务状态,正常用户无法访问。具体流程如下:用户的Notebook SSH地址被其他用户频繁访问,且访问时未携带用户名,例如:s - [用户使用自定义镜像创建Notebook,本地通过SSH连接Notebook时,报错:The OS version does not match](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_4200.md): 用户使用自定义镜像创建Notebook,并开启远程SSH。本地通过SSH连接Notebook实例时,连接被拒绝,报错:镜像内置的OpenSSH版本不兼容或低于8.0。您可以直接使用Notebook预置镜像,或者使用预置镜像制作自定义镜像。更多信息,请参见创建Notebook实例和Notebook的自定义镜像制作方法。 - [用户删除“/home/ma-user/log”目录导致SSH无法使用,报错:Connection reset](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_4204.md): 本地通过SSH连接Notebook实例时,连接被拒绝,报错:用户删除SSH日志输出依赖的父目录/home/ma-user/log导致。在Notebook中打开Terminal窗口,依次执行以下命令重新创建log目录。检查目录创建成功后,重新通过SSH连接Notebook实例。 - [Notebook自定义镜像故障基础排查](https://support.huaweicloud.com/trouble-modelarts/docker-modelarts_6024.md): 当制作的自定义镜像使用出现故障时,可能由以下原因导致:用户自定义镜像没有ma-user用户及ma-group用户组;用户自定义镜像中/home/ma-user目录,属主和用户组不是ma-user和ma-group;用户自定义镜像必须满足用户目录/home/ma-user权限为750,不能为其他权限;用户制作的自定义镜像,在本地执行dock - [镜像保存时报错“there are processes in 'D' status, please check process status using 'ps -aux' and kill all the 'D' status processes”或“Buildimge,False,Error response from daemon,Cannot pause container xxx”如何解决?](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0264.md): 在Notebook里保存镜像时报错“there are processes in 'D' status, please check process status using 'ps -aux' and kill all the 'D' status processes”。在Notebook里保存镜像时报错“Buildimge,False, - [镜像保存时报错“container size %dG is greater than threshold %dG”如何解决?](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0265.md): 在Notebook里保存镜像时报错“container size %dG is greater than threshold %dG”。Notebook容器当前的大小超过了阈值。需要减少容器大小。Notebook容器的大小分为两部分:镜像大小和容器中新安装文件的大小。因此有两种方法来解决该问题:减少容器中新安装文件的大小删除用户在Note - [保存镜像时报错“too many layers in your image”如何解决?](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0266.md): 保存镜像时报错“too many layers in your image”。用户创建Notebook时所选用的镜像是经过多次保存的自定义镜像或用户自行注册的镜像,基于该镜像所创建的Notebook已经无法再执行镜像保存的操作了。使用公共镜像或其他的自定义镜像来创建Notebook,完成镜像保存操作。 - [镜像保存时报错“The container size (xG) is greater than the threshold (25G)”如何解决?](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0268.md): 镜像保存时报错“The container size (30G) is greater than the threshold (25G)”,镜像创建失败。镜像保存本质是通过在资源集群节点上的agent中进行了docker commit,再配合一系列自动化操作来上传和更新管理数据等。每次Commit都会带来额外的一些开销,层数越多镜像越大, - [镜像保存时报错“BuildImage,True,Commit successfully|PushImage,False,Task is running.”](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0294.md): 镜像保存时报错BuildImage,True,Commit successfully|PushImage,False,Task is running.镜像过大Push任务一直在运行,或实例节点有问题。以对应租户的华为云账号登录SWR服务,查看镜像是否已经推送成功。如果推送成功,请重新注册镜像。如果未推送成功,联系SRE查看对应实例的节点是 - [使用自定义镜像创建Notebook后打开没有Kernel](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0295.md): 使用自定义镜像创建实例启动后,打开JupyterLab>新建Notebook,选不到Kernel。自定义镜像的Python环境没有注册。在Terminal里执行命令排查实例存在几个Conda环境。conda env list执行如下命令分别切换到对应环境查看是否有ipykernel包。conda activate base# base替换 - [用户自定义镜像自建的conda环境会检测到一些额外的包,影响用户程序,如何解决?](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0296.md): 用户的自定义镜像运行在Notebook里会检测到一些额外的pip包。如下图所示,左侧为自定义镜像运行在本地环境,右侧为运行在Notebook里。Notebook自带moxing、modelart-sdk等功能,会将这些包嵌入到用户Conda环境。如果不需要使用moxing、sdk等功能,可以暂时删除modelarts.pth文件。执行如下 - [用户使用ma-cli制作自定义镜像失败,报错文件不存在(not found)](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0297.md): 用户使用ma-cli制作自定义镜像失败,报错文件目录不存在。复制的文件需要放在Dockerfile同级文件夹或者子目录中,不能放在Dockerfile上层目录。查看用户Dockerfile中的COPY命令中的文件的路径。将要复制的文件放到Dockerfile同级目录或子目录中,如图,Dockerfile在./.ma/customize_f - [用户使用Torch报错Unexpected error from cudaGetDeviceCount](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0298.md): 在Notebook执行兼容GPU的脚本时报错不兼容,但是通过nvcc --version排查显示是兼容。报错如下:先排查CUDA和Torch版本是否兼容。# CUDA版本 nvcc --version # nvidia-smi版本 nvidia-smi # Torch版本(要确定用户用的哪个conda下的python) python - - [使用Notebook创建Conda环境报错“CondaHTTPError: HTTP 404 NOT FOUND for url...”如何解决?](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0299.md): 在使用Notebook创建Conda环境并指定Python版本时,系统报错HTTP 404 NOT FOUND,提示依赖的包libuuid和readline在Conda源中没有找到。具体错误信息如下:镜像源缺少依赖包。通过添加额外的Conda频道,可以解决依赖包缺失的问题。执行以下命令,添加pkgs/free频道。conda config - [旧版镜像启动后无权限访问](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0318.md): 用户使用2023年06月之前注册的镜像,创建Notebook实例后运行正常,SSH可以连接,但是网页端打开后无法访问,报错如下:2023年06月之前的Notebook为1.0版本,该版本已下线,需要使用新版Notebook。确认实例是否为Notebook 1.0的启动方式。创建Notebook实例时开启SSH远程开发。更多信息,请参见创建 - [Notebook中无法打开“checkpoints”文件夹](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_3171.md): checkpoints是Notebook的关键字,如果用户创建文件夹命名为checkpoints,则在JupyterLab上无法打开、重命名和删除。此时可以在Terminal里使用命令行打开checkpoints,或者新建文件夹将checkpoints里的数据移动到新的文件夹下。操作步骤:打开Terminal,用命令行进行操作。方法一:执 - [创建新版Notebook无法使用已购买的专属资源池,如何解决?](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_318.md): 已购买专属资源池,但创建Notebook时该资源池不可选择,无法创建Notebook。提示:当前专属资源池不支持Notebook,请到专属资源池页面设置作业类型支持Notebook。新购买的专属资源池,需要初始化环境才能用于创建Notebook。请到专属资源池页面初始化开发环境。新版控制台:选择“资源管理 > 专属算力资源 > 资源池”。 - [在Notebook中使用tensorboard命令打开日志文件报错Permission denied](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_4186.md): 在Notebook的Terminal中执行tensorboard --logdir ./命令,报错[Errno 13] Permission denied……。当前目录下包含没有权限的文件。建议用户新建一个文件夹(例如:tb_logs),将tensorboard的日志文件(例如:tb.events)放到新建的文件夹下,然后执行tensor - [wget不识别no_proxy通配符,怎么办?](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0306.md): 在wget 1.20以下版本中,no_proxy环境变量配置的通配符(如*.obs.com)不生效,导致下载请求仍然通过代理服务器。no_proxy:环境变量,用于指定无需通过代理服务器访问的域名列表。通配符:如*,可以匹配任意字符的符号(例如*.obs.com匹配a.obs.com、b.obs.com等)。wget 1.20以下版本对n - [使用root用户启动Notebook实例,出现权限异常报错](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0309.md): 用户创建Notebook实例时,使用root用户启动Notebook实例,如果自定义镜像中root用户的UID/GID非0,容器启动时会使用镜像中root的UID值,导致权限异常。root的UID/GID必须为0Linux系统依赖UID=0识别root权限,修改此值会导致系统服务(如sudo、SSH、包管理器)崩溃,文件权限混乱,甚至无法 - [读取文件报错,如何正确读取文件](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0018.md): 创建训练作业如何读取json和npy文件。训练作业如何使用cv2库读取文件。如何在MXNet环境下使用torch包。训练作业读取文件,出现如下报错:NotFoundError (see above for traceback): Unsuccessful TensorSliceReader constructor: Failed to f - [TensorFlow-1.8作业连接OBS时反复出现提示错误](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0019.md): 基于TensorFlow-1.8启动训练作业,并在代码中使用tf.gfile模块连接OBS,启动训练作业后会频繁打印如下日志信息:这是TensorFlow-1.8中会出现的情况,该日志是Info级别的,并不是错误信息,可以通过设置环境变量来屏蔽INFO级别的日志信息。环境变量的设置一定要在import tensorflow或者import - [TensorFlow在OBS写入TensorBoard到达5GB时停止](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0022.md): ModelArts训练作业出现如下报错:OBS限制单次上传文件大小为5GB,TensorFlow保存summary可能是本地缓存,在每次触发flush时将该summary文件覆盖OBS上的原文件。当超过5GB后,由于达到了OBS单次导入文件大小的上限,导致无法继续写入。如果在运行训练作业的过程中出现该问题,建议处理方法如下:推荐使用本地缓 - [保存模型时出现Unable to connect to endpoint错误](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0020.md): 训练作业保存模型时日志报错,具体信息如下:InternalError (see above for traceback): Unable to connect to endpointOBS连接不稳定可能会出现报错,Unable to connect to endpoint。对于OBS连接不稳定的现象,通过增加代码来解决。您可以在代码最前面 - [OBS复制过程中提示“BrokenPipeError: Broken pipe”](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0042.md): 训练作业在使用MoXing复制数据时,日志中出现报错BrokenPipeError: [Errno xx] Broken pipe。出现该问题的可能原因如下:在大规模分布式作业上,每个节点都在复制同一个桶的文件,导致OBS桶限流。OBS Client连接数过多,进程/线程之间的轮询,导致一个OBS Client与服务端连接30S内无响应, - [日志提示“ValueError: Invalid endpoint: obs.xxxx.com”](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0048.md): 训练作业中使用Tensorboard直接写入到OBS路径,在日志中出现报错信息ValueError: Invalid endpoint: obs. xxxx.com。出现该问题的可能原因:直接在OBS上写tensorboard文件,存在不稳定的风险。建议先将Tensorboard文件写到本地,然后再复制回OBS。在创建训练作业前,推荐您先 - [日志提示“errorMessage:The specified key does not exist”](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0035.md): 在用moxing访问OBS路径时,出现如下错误:ERROR:root: stat:404 errorCode:NoSuchKey errorMessage:The specified key does not exist.出现该问题的可能原因如下:桶中的对象不存在,请检查OBS路径中的内容是否存在。具体错误码请参见OBS官方文档。检查OB - [tensorboard显示502 bad gateway](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0146.md): 启动tensorboard后,打开tensorboard提示502 bad gateway,或者偶现502 bad gateway。出现该问题的可能原因如下:启动tensorboard对应的summary目录错误,导致tensorboard启动失败。启动tensorboard对应的summary目录过大,导致tensorboard加载su - [无法导入模块](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0014.md): ModelArts训练作业导入模块时日志报错:训练作业导入模块时日志出现前两条报错信息,可能原因如下:代码如果在本地运行,需要将project_dir加入到PYTHONPATH或者将整个project_dir安装到site-package中才能运行。但是在ModelArts可以将project_dir加入到sys.path中解决该问题。使 - [训练作业日志中提示“No module named .*”](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0015.md): 用户请按照以下思路进行逐步排查:检查依赖包是否存在检查依赖包路径是否能被识别检查训练作业使用的资源规格是否正确建议与总结如果依赖包不存在,您可以使用以下两种方式完成依赖包的安装。方式一(推荐使用):在创建我的算法时,需要在代码目录下放置相应的文件或安装包。请根据依赖包的类型,在代码目录下放置对应文件:依赖包为开源安装包时在代码目录中创建一 - [如何安装第三方包,安装报错的处理方法](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0015.md): ModelArts如何安装自定义库函数,例如apex。ModelArts训练环境安装第三方包时出现如下报错:xxx.whl is not a supported wheel on this platform由于安装的文件名格式不支持,导致出现xxx.whl is not a supported wheel on this platform - [下载代码目录失败](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0023.md): 训练作业运行时下载失败,出现如下报错,请参见图1:在创建训练作业时指定的代码目录不存在导致训练失败。请您根据报错原因排查创建训练作业时指定的代码目录,即OBS桶的路径是否正确。有两种方法判断是否存在。使用当前账户登录OBS管理控制台,去查找对应的OBS桶、文件夹、文件是否存在。通过接口判断路径是否存在。在代码中执行如下命令,检查路径是否存 - [训练作业日志中提示“No such file or directory”](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0014.md): 训练作业运行失败,日志中提示“No such file or directory”。例如:找不到训练输入的数据路径时,会提示“No such file or directory”。例如:找不到训练启动文件时,也会提示“No such file or directory”。找不到训练输入数据路径,可能是报错的路径填写不正确。用户请按照以下思 - [训练过程中无法找到so文件](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0044.md): ModelArts训练作业运行时,日志中遇到如下报错,导致训练失败:编译生成so文件的cuda版本与训练作业的cuda版本不一致。编译环境的cuda版本与训练环境不一致,训练作业运行就会报错。例如:使用cuda版本为10的开发环境tf-1.13中编译生成的so包,在cuda版本为9.0训练环境中tf-1.12训练会报该错。编译环境和训练环 - [ModelArts训练作业无法解析参数,日志报错](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0012.md): ModelArts训练作业无法解析参数,遇到如下报错,导致无法正常运行:运行参数中未定义该参数。在训练环境中,系统可能会传入在Python脚本里没有定义的其他参数名称,导致参数无法解析,日志报错。参数定义中增加该参数的定义,代码示例如下:parser.add_argument('--init_method', default='tcp:/ - [训练输出路径被其他作业使用](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0029.md): 在创建训练作业时出现如下报错:操作失败!Other running job contain train_url: /bucket-20181114/code_hxm/根据报错信息判断,在创建训练作业时,同一个训练输出路径在被其他作业使用。一个训练输出路径只能被一个处于运行中、排队中或初始化状态的作业使用。当出现此报错时,建议检查并重新填写 - [PyTorch1.0引擎提示“RuntimeError: std:exception”](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0036.md): 在使用PyTorch1.0镜像时,必现如下报错:“RuntimeError: std:exception”PyTorch1.0镜像中的libmkldnn软连接与原生torch的冲突,具体可参看文档。按照issues中的说明,应该是环境中的库冲突了,因此在启动脚本最开始之前,添加如下代码。import os os.system("rm /h - [MindSpore日志提示“ retCode=0x91, [the model stream execute failed]”](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0054.md): 使用mindspore进行训练时,出现如下报错:[ERROR] RUNTIME(3002)model execute error, retCode=0x91, [the model stream execute failed]出现该问题的可能原因如下:数据读入的速度跟不上模型迭代的速度。减少预处理shuffle操作。dataset = d - [使用moxing适配OBS路径,pandas读取文件报错](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0033.md): 使用moxing适配OBS路径,然后用较高版本的pandas读取OBS文件报出如下错误:1.‘can't decode byte xxx in position xxx’ 2.‘OSError:File isn't open for writing’出现该问题的可能原因如下:moxing对高版本的pandas兼容性不够。在适配OBS路径后 - [日志提示“Please upgrade numpy to >= xxx to use this pandas version”](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0052.md): 在安装其他包的时候,有依赖冲突,对numpy库有其他要求,但是发现numpy卸载不了。出现如下类似错误:your numpy version is 1.14.5.Please upgrade numpy to >= 1.15.4 to use this pandas version出现该问题的可能原因如下:conda和pip包混装,有一些 - [重装的包与镜像装CUDA版本不匹配](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0047.md): 在现有镜像基础上,重新装了引擎版本,或者编译了新的CUDA包,出现如下错误:1.“RuntimeError: cuda runtime error (11) : invalid argument at /pytorch/aten/src/THC/THCCachingHostAllocator.cpp:278” 2.“libcudart.s - [创建训练作业提示错误码ModelArts.2763](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0159.md): 创建训练作业时,提示ModelArts.2763 : 选择的支持实例无效,请检查请求中信息的合法性。用户选择的训练规格资源和算法不匹配。例如:算法支持的是GP规格,创建训练作业时选择了ASCEND规格的资源类型。查看算法代码中设置的训练资源规格。检查创建训练作业时所选的资源规格是否正确,重新创建训练作业选择正确的资源规格。 - [训练作业日志中提示 “AttributeError: module '***' has no attribute '***'”](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0150.md): 训练日志中出现AttributeError: module '***' has no attribute '***'错误。如:AttributeError: module 'torch' has no attribute 'concat'。出现该问题的可能原因如下:对应python包使用错误,该python包确实没有对应的变量或者方法第三 - [系统容器异常退出](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0141.md): 在训练创建后出现“系统容器异常退出”的故障。出现该问题的可能原因如下:OBS相关错误。OBS文件不存在。The specified key does not exist。用户OBS权限不足。OBS限流。OBS其他问题。OBS文件不存在。The specified key does not exist。用户OBS权限不足。OBS限流。OBS - [下载或读取文件报错,提示超时、无剩余空间](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0011.md): 训练过程中复制数据/代码/模型时出现如下报错:出现该问题的可能原因如下。磁盘空间不足。分布式作业时,有些节点的docker base size配置未生效,容器内“/”根目录空间未达到50GB,只有默认的10GB,导致作业训练失败。实际存储空间足够,却依旧报错“No Space left on device”。同一目录下创建较多文件,为了加 - [复制数据至容器中空间不足](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0043.md): ModelArts训练作业运行时,日志中遇到如下报错,导致数据无法复制至容器中。数据下载至容器的位置空间不足。请排查是否将数据下载至/cache目录下,GP规格资源的每个节点会有一个/cache目录,空间大小为4TB。并确认该目录下并发创建的文件数量是否过大,占用过多存储空间会出现inode耗尽的情况,导致空间不足。请排查是否使用的是GP - [Tensorflow多节点作业下载数据到/cache显示No space left](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0025.md): 创建训练作业,Tensorflow多节点作业下载数据到/cache显示:“No space left”。TensorFlow多节点任务会启动parameter server(简称ps)和worker两种角色,ps和worker会被调度到相同的机器上。由于训练数据对于ps没有用,因此在代码中ps相关的逻辑不需要下载训练数据。如果ps也下载数 - [日志文件的大小达到限制](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0032.md): ModelArts训练作业在运行过程中报错,提示日志文件的大小已达到限制:根据报错信息,可以判断是日志文件的大小已达到限制。出现该报错之后,日志不再增加,后台将继续运行。请您在启动文件中减少无用日志输出。 - [日志提示"write line error"](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0031.md): 在程序运行过程中,刷出大量错误日志[ModelArts Service Log]modelarts-pipe: write line error。并且问题是必现问题,每次运行到同一地方的时候,出现错误。出现该问题的可能原因如下:程序运行过程中,产生了core文件,core文件占满了"/"根目录空间。本地数据、文件保存将"/cache"目录 - [日志提示“No space left on device”](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0041.md): 训练过程中复制数据/代码/模型时出现如下报错:出现该问题的可能原因如下。磁盘空间不足。分布式作业时,有些节点的docker base size配置未生效,容器内“/”根目录空间未达到50G,只有默认的10GB,导致作业训练失败。实际存储空间足够,却依旧报错“No Space left on device”。同一目录下创建较多文件,为了加快 - [OOM导致训练作业失败](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0044.md): 因为OOM导致的训练作业失败,会有如下几种现象。错误码返回137,如下图所示。Modelarts Service Log Trainina end with return code: 137 Modelarts Service Log]handle outputs of training job日志中有报错,含有“killed”相关字段, - [常见的磁盘空间不足的问题和解决办法](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0142.md): 该章节用于统一整体所有的常见的磁盘空间不足的问题和解决办法。减少相关问题文档的重复内容。训练过程中复制数据/代码/模型时出现如下报错:出现该问题的可能原因如下:本地数据、文件保存将"/cache"目录空间用完。数据处理过程中对数据进行解压,导致数据大小膨胀,将"/cache"目录空间用完。数据未保存至/cache目录或者/home/ma- - [日志提示“ Network is unreachable”](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0034.md): 在使用pytorch时,将torchvision.models中的pretrained置为了True,日志中出现如下报错:‘OSError: [Errno 101] Network is unreachable’出现该问题的可能原因如下:因为安全性问题,ModelArts内部训练机器不能访问外网。将pretrained改成false,提前 - [运行训练作业时提示URL连接超时](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0021.md): 训练作业在运行时提示URL连接超时,具体报错如下:由于安全性问题在ModelArts上不能联网下载。如果在运行训练作业时提示连接超时,请您将需要联网下载的数据提前下载至本地,并上传至OBS中。 - [训练作业访问OBS时,日志提示“stat:403 reason:Forbidden”](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0045.md): 训练作业访问OBS时,出现如下报错:出现该问题的可能原因如下:OBS服务的权限出现问题,导致无法正常读取数据请检查OBS权限配置,如未解决问题可参考OBS文档的已配置OBS权限,仍然无法访问OBS(403 AccessDenied)。在创建训练作业前,推荐您先使用ModelArts开发环境调试训练代码,避免代码迁移过程中的错误。直接使用线 - [日志提示"Permission denied"](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0046.md): 训练作业访问挂载的EFS,或者是执行.sh启动脚本时,出现如下错误:OSError: [Errno 13]Permission denied: '/xxx/xxxx'bash: /bin/ln: Permission denied自定义镜像中,bash:/home/ma-user/.pip/pip.conf:Permission Deni - [日志提示"No CUDA-capable device is detected"](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0032.md): 在程序运行过程中,出现如下类似错误。1.‘failed call to cuInit: CUDA_ERROR_NO_DEVICE: no CUDA-capable device is detected’ 2.‘No CUDA-capable device is detected although requirements are ins - [日志提示“RuntimeError: connect() timed out”](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0043.md): 使用pytorch进行分布式训练时,日志中出现报错RuntimeError: connect() timed out。出现该问题的可能原因如下:如果在此之前是有进行数据复制的,每个节点复制的速度不是同一个时间完成的,然后有的节点没有复制完,其他节点进行torch.distributed.init_process_group()导致超时。如 - [日志提示“cuda runtime error (10) : invalid device ordinal at xxx”](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0049.md): 训练作业失败,日志报出如下错误:可以从以下角度排查:请检查CUDA_VISIBLE_DEVICES设置的值是否与作业规格匹配。例如您选择4卡规格的作业,实际可用的卡ID为0、1、2、3,但是您在进行cuda相关的运算时,例如"tensor.to(device="cuda:7")",将张量搬到了7号GP卡上,超过了实际可用的ID号。如果cu - [日志提示“RuntimeError: Cannot re-initialize CUDA in forked subprocess”](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0051.md): 在使用pytorch启动多进程的时候,出现如下报错:RuntimeError: Cannot re-initialize CUDA in forked subprocess出现该问题的可能原因如下:multiprocessing启动方式有误。可以参考官方文档,如下:"""run.py:""" #!/usr/bin/env python i - [训练作业找不到GP](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0033.md): 训练作业运行出现如下报错:根据错误信息判断,报错原因为训练作业运行程序读取不到GP。根据报错提示,请您排查代码,是否已添加以下配置,设置该程序可见的GP:其中,0为服务器的GP编号,可以为0,1,2,3等,表明对程序可见的GP编号。如果未进行添加配置则该编号对应的GP不可用。 - [日志提示“pandas.errors.ParserError: Error tokenizing data. C error: Expected .* fields”](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0050.md): 使用pandas读取csv数据表时,日志报出如下错误导致训练作业失败:pandas.errors.ParserError: Error tokenizing data. C error: Expected 4 fieldcsv中文件的每一行的列数不相等。可以使用以下方法处理:校验csv文件,将多出字段的行删除。在代码中忽略错误行,参考如下 - [日志提示“max_pool2d_with_indices_out_cuda_frame failed with error code 0”](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0037.md): pytroch1.3镜像中,去升级了pytroch1.4的版本,导致之前在pytroch1.3跑通的代码报错如下:“RuntimeError:max_pool2d_with_indices_out_cuda_frame failed with error code 0”出现该问题的可能原因如下:pytorch1.4引擎与之前pytorch - [训练作业失败,返回错误码139](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0039.md): 训练作业运行失败,返回错误码139,如下图所示:出现该问题的可能原因如下pip源中的pip包更新了,之前能跑通的代码,在包更新之后产生了不兼容的情况,例如transformers包,导致import的时候出现了错误。用户代码问题,出现了内存越界、非法访问内存空间的情况。未知系统问题导致,建议先尝试复制作业,复制后仍然失败,建议提工单定位。 - [训练作业失败,如何使用开发环境调试训练代码?](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0057.md): 在创建训练作业前,推荐您先使用ModelArts开发环境调试训练代码,避免代码迁移过程中的错误。直接使用线上notebook环境调试请参考使用JupyterLab开发模型。配置本地IDE(Pycharm或者VSCode)连接云上环境调试请参考使用本地IDE开发模型。直接使用线上notebook环境调试请参考使用JupyterLab开发模型 - [日志提示“ '(slice(0, 13184, None), slice(None, None, None))' is an invalid key”](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0059.md): 训练过程中出现如下报错:TypeError: '(slice(0, 13184, None), slice(None, None, None))' is an invalid key出现该问题的可能原因如下:切分数据时,选择的数据不对。尝试如下代码:X = dataset.iloc[:,:-1].values在创建训练作业前,推荐您先使用 - [日志报错“DataFrame.dtypes for data must be int, float or bool”](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0058.md): 训练过程中出现如下报错:DataFrame.dtypes for data must be int, float or bool出现该问题的可能原因如下:训练数据中出现了非int、float、bool类型数据。可参考如下代码,将错误列进行转换:from sklearn import preprocessing lbl = preproc - [日志提示“CUDNN_STATUS_NOT_SUPPORTED. ”](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0056.md): 在pytorch训练时,出现如下报错:RuntimeError: cuDNN error: CUDNN_STATUS_NOT_SUPPORTED. This error may appear if you passed in a non-contiguous input.出现该问题的可能原因如下:数据输入不连续,cuDNN不支持的类型。禁 - [日志提示“Out of bounds nanosecond timestamp”](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0053.md): 在使用pandas.to_datetime转换时间时,出现如下报错:pandas._libs.tslibs.np_datetime.OutOfBoundsDatetime: Out of bounds nanosecond timestamp: 1-01-02 13:20:00出现该问题的可能原因如下:时间值越界,请参考官方文档。校验时间 - [日志提示“Unexpected keyword argument passed to optimizer”](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0055.md): 在使用keras时,升级版本>=2.3.0之后,之前跑通的代码出现如下报错:TypeError: Unexpected keyword argument passed to optimizer: learning_rate出现该问题的可能原因是learning_rate的参数名称写错了。keras官方文档中说明参数lr已重命名为learn - [日志提示“no socket interface found”](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0038.md): 在pytorch镜像运行分布式作业时,设置NCCL日志级别,代码如下:import os os.environ["NCCL_DEBUG"] = "INFO"会出现如下错误:可能原因如下:原因1:未设置环境变量NCCL_IB_TC、NCCL_IB_GID_INDEX、NCCL_IB_TIMEOUT,因此会导致通信速度慢且不稳定,最后造成IB - [日志提示“Runtimeerror: Dataloader worker (pid 46212 ) is killed by signal: Killed BP”](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0060.md): 训练作业日志运行出现如下报错:Runtimeerror: Dataloader worker (pid 46212 ) is killed by signal: Killed BP。由于batch size过大,导致Dataloader进程退出。请调小batch size的数值。 - [日志提示“AttributeError: 'NoneType' object has no attribute 'dtype'”](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0063.md): 代码在Notebook的keras镜像中可以正常运行,在训练模块使用tensorflow.keras训练报错时,出现如下报错:AttributeError: 'NoneType' object has no attribute 'dtype'。训练镜像的numpy版本与Notebook中不一致。在代码中打印出numpy的版本,查看是否为1 - [日志提示“No module name 'unidecode'”](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0064.md): 从mindspore开源gitee中master分支下载的tacotron2模型,修改配置文件后上传ModelArts准备训练,日志报错提示:No module name 'unidecode'。requirements.txt的Unidecode名字写错了,应该把U改成小写,所以导致训练作业的环境没有装上unidecode模块。将req - [分布式Tensorflow无法使用“tf.variable”](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0016.md): 多机或多卡使用tf.variable会造成以下错误:分布式Tensorflow不能使用tf.variable要使用tf.get_variable。请您将启动文件中的tf.variable替换为tf.get_variable。 - [MXNet创建kvstore时程序被阻塞,无报错](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0026.md): 使用kv_store = mxnet.kv.create('dist_async')方式创建kvstore时程序被阻塞。如,执行如下代码,如果无法输出end,表明程序阻塞。worker阻塞的原因可能是连不上server。将如下代码放在启动文件里import mxnet之前可以看到节点间相互通信状态,同时ps能够重新发送。其中,os.env - [日志出现ECC错误,导致训练作业失败](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0028.md): 训练作业日志运行出现如下报错:RuntimeError: CUDA error: uncorrectable ECC error encountered由于ECC错误,导致作业运行失败。当ECC错误且计数超过64时,系统会自动隔离故障节点,重启训练作业确认故障是否解决。如果未隔离的节点导致训练作业再次失败或卡死,请联系技术支持处理。 - [超过最大递归深度导致训练作业失败](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0034.md): ModelArts训练作业报错:递归深度超过了Python默认的递归深度,导致训练失败。如果超过最大递归深度,建议您在启动文件中增大递归调用深度,具体操作如下: - [使用预置算法训练时,训练失败,报“bndbox”错误](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0041.md): 使用预置算法创建训练作业,训练失败,日志中出现如下报错。用于训练的数据集中,使用了“非矩形框”标注。而预置使用算法不支持“非矩形框”标注的数据集。此问题有两种解决方法:方法1:使用常用框架自行编码开发模型,支持“多边形”标注的数据集。方法2:修改数据集,使用矩形标注。然后再启动训练作业。 - [训练作业状态显示“审核作业初始化”](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0030.md): 当创建训练作业的算法来源选择自定义镜像创建训练作业时,训练作业状态显示审核作业初始化。自定义镜像首次运行时,需要先审核镜像。通过审核之后才可创建作业,即当前状态为审核作业初始化。 - [训练作业进程异常退出](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0074.md): 训练作业运行失败,日志中出现如下类似报错:日志显示训练进程的退出码为137。训练进程表示用户的代码启动后的进程,所以这里的退出码是用户的训练作业代码返回的。常见的错误码还包括247、139等。退出码137或者247可能是内存溢出造成的。请减少数据量、减少batch_size,优化代码,合理聚合、复制数据。请注意,数据文件大小不等于内存占用 - [训练作业进程被kill](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0075.md): 用户进程被Kill表示用户进程因外部因素被Kill或者中断,表现为日志中断。CPU软锁在解压大量文件可能会出现此情况并造成节点重启。可以适当在解压大量文件时,加入sleep。比如每解压1w个文件,就停止1s。在解压大量文件可能会出现此情况并造成节点重启。可以适当在解压大量文件时,加入sleep。比如每解压1w个文件,就停止1s。存储限制根 - [日志提示“label_map.pbtxt cannot be found”](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0061.md): 使用目标检测算法训练时,训练作业日志运行出现如下报错:ERROR:root:label_map.pbtxt cannot be found. It will take a long time to open every annotation files to generate a tmp label_map.pbtxt。算法要求标注框为矩 - [日志提示“root: XXX valid number is 0”](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0160.md): 日志提示“root: XXX valid number is 0”,表示训练集/验证集/测试集的有效样本量为0,例如:该日志表示数据集中的有效样本量为0,可能有如下原因:数据未标注。标注的数据是不符合规格的(如目标检测算法要求标注为矩形框,但是提供数据标注为非矩形框)。请您检查数据是否已标注,或检查数据标注是否符合算法要求。 - [日志提示“ValueError: label_map not match”](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0161.md): 日志提示“ValueError: label_map not match”,且打印出标签数据,如:训练集中的标签个数与验证集中的个数不一致,导致该错误发生。例如,训练集中的标签共有4个,验证集中的标签只有3个。请您保持数据中训练集和验证集的标签数量一致。 - [日志提示“Please set the train_url to an empty obs directory”](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0162.md): 日志提示“Please set the train_url to an empty obs directory”。对于不支持断点训练的模型,如果选择训练输出路径不是空目录,会出现该报错。对于不支持断点训练的模型,请您将模型的输出路径train_url设置为空目录。 - [日志提示“UnboundLocalError: local variable 'epoch'”](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0062.md): 使用YOLOv5算法增量训练时出现如下报错:UnboundLocalError: local variable 'epoch' referenced before assignment。增量训练作业设置的epochs参数有误,该问题是由YOLOv5的增量训练机制引起:如果第二次增量训练的epochs数值和第一次常规训练的epochs数值设 - [使用订阅算法训练结束后没有显示模型评估结果](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0163.md): AI Gallery中的YOLOv5算法,训练结束后没有显示模型评估结果。未标注的图片过多,导致没有模型评估结果。对所有训练数据进行标注。 - [使用python3.6-torch1.4版本镜像环境安装MMCV报错](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0120.md): 日志报错中存在AssertionError: MMCV==1.2.5 is used but incompatible. Please install mmcv>=1.3.1, <=1.5.0。MMCV的依赖与PyTorch版本不匹配。可参考链接的内容,根据PyTorch和CUDA版本安装对应版本的MMCV。 - [训练作业卡死检测定位](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0108_1.md): 训练作业在运行中可能会因为某些未知原因导致作业卡死,如果不能及时发现,就会导致无法及时释放资源,从而造成极大的资源浪费。为了节省训练资源成本,提高使用体验,ModelArts提供了卡死检测功能,能自动识别作业是否卡死,并在日志详情界面上展示,同时能配置通知及时提醒用户作业卡死。卡死检测主要是通过监控作业进程的状态和资源利用率来判定作业是否 - [复制数据卡死](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0110.md): 调用mox.file.copy_parallel复制数据时卡死。复制文件和文件夹均可采用:import moxing as mox mox.file.set_auth(is_secure=False)复制单个大文件5G以上时可采用:from moxing.framework.file import file_io查看当前moxing调用的 - [训练前卡死](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0111.md): 作业为多节点训练,且还未开始训练时发生卡死,可以在代码中加入os.environ["NCCL_DEBUG"] = "INFO",查看NCCL DEBUG信息。日志中还未出现NCCL DEBUG信息时已卡死。检查代码,检查是否有参数中未传入master_ip和rank参数等问题。分布式训练的日志中,发现有的节点含有GDR信息,而有的节点无G - [训练中途卡死](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0112.md): 检测每个节点日志是否有报错信息,某个节点报错但作业未退出导致整个训练作业卡死。查看报错原因,解决报错。作业卡在sync-batch-norm中或者训练速度变慢。pytorch如果开了sync-batch-norm,多机会慢,因开了sync-batch-norm以后,每一个iter里面每个batch-norm层都要做同步,通信量很大,而且要 - [训练最后一个epoch卡死](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0113.md): 通过日志查看数据切分是否对齐,如果未对齐,容易导致部分进程完成训练退出,而部分训练进程因未收到其他进程反馈卡死,如下图同一时间有的进程在epoch48,而有的进程在epoch49。使用tensor的切分操作对齐数据。 - [训练作业运行失败排查指导](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0124.md): 训练作业的状态出现运行失败的现象。查看训练作业的日志,出现报错MoxFileNotExistsException(resp, 'file or directory or bucket not found.')。原因:Moxing在进行文件复制时,未找到train_data_obs目录。处理建议:修改train_data_obs目录为正确地 - [训练作业运行失败,出现NCCL报错](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0001.md): 训练作业的状态运行失败,查看训练作业的日志,存在NCCL的报错,例如NCCL timeout、RuntimeError: NCCL communicator was aborted on rank 7、NCCL WARN Bootstrap : no socket interface found或NCCL INFO Call to con - [自定义镜像训练作业失败定位思路](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0117_1.md): 使用自定义镜像训练作业时,训练失败。确定镜像来源确认该自定义镜像的基础镜像是否来源于ModelArts提供的基础镜像,推荐用户使用ModelArts的基础镜像构建自定义镜像,具体请参见使用ModelArts的基础镜像构建新的训练镜像。如镜像来源于第三方,设法找到自定义镜像的制作者咨询,制作者一般对镜像如何使用更加了解。确认该自定义镜像的基 - [使用自定义镜像创建的训练作业一直处于运行中](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0122.md): 使用自定义镜像创建训练作业,训练作业的状态一直处于运行中。日志打印如下内容,表示自定义镜像的CPU架构与资源池节点的CPU架构不一致。常见场景为使用自定义镜像创建作业时选择的资源类型和规格错误。例如,自定义镜像是ARM CPU架构,应选用NPU规格的资源,却使用X86 CPU/X86 GP规格的资源。 - [使用自定义镜像创建训练作业找不到启动文件](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0194.md): 使用自定义镜像创建训练作业,出现如下报错,提示找不到运行的主文件:no such file or directory。根据报错提示可以判断是运行命令的启动文件目录不正确导致运行失败。需要排查执行命令的启动文件目录是否正确,具体操作如下:在ModelArts管理控制台,使用训练的自定义镜像创建训练作业时,创建方式选择自定义算法,启动方式选择 - [训练作业的监控内存指标持续升高直至作业失败](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0127.md): 训练作业的状态为运行失败。训练作业的监控内存指标持续升高,导致最后训练作业失败。查询训练作业的日志和监控信息,是否存在明确的OOM报错信息。是,训练作业的日志里存在OOM报错,执行2。否,训练作业的日志里没有OOM报错,但是存在监控指标异常,执行3。是,训练作业的日志里存在OOM报错,执行2。否,训练作业的日志里没有OOM报错,但是存在监 - [订阅算法物体检测YOLOv3_ResNet18(Ascend)训练失败报错label_map.pbtxt cannot be found](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0129.md): 使用订阅算法物体检测YOLOv3_ResNet18(Ascend) 进行训练作业,训练失败报错label_map.pbtxt cannot be found。该报错信息表示验证集中有label在训练集中不存在,可能由于在发布数据集版本进行数据切分时,训练集比例填写为0导致发布的数据全部为验证集,所以出现上述报错。重新发布数据,切分比例为0 - [训练作业训练失败报错:TypeError: unhashable type: ‘list’](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0130.md): 使用订阅算法图像分类-EfficientNetB4进行训练报错:TypeError: unhashable type: ‘list’。可能由于使用了多标签分类导致(即一个图片用了1个以上的标签)。使用单标签分类的数据集进行训练。 - [创建训练作业界面无云存储名称和挂载路径排查思路](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0132.md): 创建训练作业界面没有云存储名称和挂载路径这两个选项。用户的专属资源池没有进行网络打通,或者用户没有创建过SFS。在专属资源池列表中,单击资源池ID/名称,进入详情页。单击右上角配置NAS VPC,检查是否开启了NAS VPC。详情页面的NAS VPC名称和NAS 子网ID如果为空则证明没有开启,单击右上角配置NAS VPC即可。如果单击开 - [创建训练作业时出现“实例挂卷失败”的事件](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0119.md): 训练作业的状态一直在创建中,查看训练作业的事件,有异常信息实例挂卷失败,详情为“Unable to mount volumes for pod xxx ... list of unmounted volumes=[nfs-x]”。用户账号下的SFS Turbo所在的VPC网络需要与专属资源池所在的网络打通,运行于该专属资源池的训练作业才能 - [训练作业性能降低](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0135.md): 使用ModelArts平台训练算法训练耗时增加。可能存在如下原因:平台上的代码经过修改优化、训练参数有过变更。训练的GPU硬件工作出现异常。请您对作业代码进行排查分析,确认是否对训练代码和参数进行过修改。检查资源分配情况(cpu/mem/gpu/snt9/infiniband)是否符合预期。通过CloudShell登录到Linux工作页面 - [训练作业精度问题](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0136.md): 使用ModelArts平台训练算法时,出现模型精度异常问题,常见问题如下:训练精度/验证精度低于预期。相同代码多次训练结果不一致。loss不收敛、震荡或出现NaN。可能存在如下原因:训练代码或训练参数发生变更。学习率、batch size、epoch、optimizer、scheduler等参数被修改;随机种子未固定;混合精度、梯度裁剪、 - [Cann软件与Ascend驱动版本不匹配](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0139.md): 训练失败并提示“Cann软件与Ascend驱动版本不匹配”。当昇腾规格的训练作业在ModelArts训练平台上运行时,会自动对Cann软件与Ascend驱动的版本匹配情况进行检查。如果平台发现版本不匹配,则会立即训练失败,避免后续无意义的运行时长。专属资源池的Ascend驱动版本需与训练基础镜像中的Cann软件版本匹配。ModelArts - [训练作业的日志出现detect failed(昇腾预检失败)](https://support.huaweicloud.com/trouble-modelarts/modelarts_trouble_0145.md): 训练启动的日志出现如下相关错误:出现该问题的可能原因如下:用户的自定义镜像中无ascend_check工具,导致启动预检失败。用户的自定义镜像中的ascend相关工具不可用,导致预检失败。通过给训练作业加环境变量“MA_DETECT_TRAIN_INJECT_CODE”并将对应的值设置成0,就可以将预检功能关闭。环境变量说明参考查看训练容 - [设置健康检查后,服务一直处于“部署中”](https://support.huaweicloud.com/trouble-modelarts/inference2.0-modelarts-0057.md): 配置健康检查后,服务状态一直处于“部署中”,查看模型日志未发现服务有明显错误。一般情况都是模型的端口配置有问题。平台默认使用在线服务的健康检查配置和调用接口的端口号进行健康检查,如果模型的健康检查端口与推理预测端口号不一致,则会导致健康检查失败。服务健康检查地址 = 图中的协议 + 健康检查url + 容器端口号检查模型开放的健康检查地址 - [在线服务使用模型预热功能出现报错如何处理](https://support.huaweicloud.com/trouble-modelarts/inference2.0-modelarts-0058.md): 可能原因:服务选择了已经预热的权重,在服务部署时,报错,模型预热任务可能被删除。服务选择了已经预热的权重,在服务升级或者扩容时报该错误,模型预热任务可能被删除。解决方案:重新预热模型权重,等待模型预热成功后,在推理平台选择对应的模型预热,部署或升级服务。服务修改场景:重新预热模型权重,等待模型预热成功后,在推理平台选择对应的模型预热,升级 - [在线服务使用模型预热功能出现Pod事件报错](https://support.huaweicloud.com/trouble-modelarts/inference2.0-modelarts-0059.md): 在线服务部署成功后,服务事件中报有Pod调度失败,在线服务事件页面查看Pod事件存在Insufficient,didn't match pod affinity rules等字样。Insufficient通常表示节点资源不足(如CPU/Memory),Pod affinity rules指Pod亲和性规则要求Pod必须调度到满足特定标签的 - [在线服务升级回滚失败](https://support.huaweicloud.com/trouble-modelarts/inference2.0-modelarts-0060.md): 服务事件中有异常、告警事件,事件信息包含:升级回滚失败、资源不足等关键字。资源池资源不足,回滚作业一直等待资源启动部署。释放或者增加资源池资源,方法如下。方法一:升级部署:缩减部署的实例数、修改部署单元的单元实例规格。登录ModelArts管理控制台,在左侧菜单栏中选择模型推理>在线推理,进入在线服务管理页面。单击目标服务名称,进入服务详 - [在线服务创建部署失败](https://support.huaweicloud.com/trouble-modelarts/inference2.0-modelarts-0061.md): 在线服务部署创建失败。登录ModelArts管理控制台,在左侧导航栏选择模型推理 > 在线推理,在服务列表中,单击部署失败的服务名称,进入服务详情页面。在服务详情页面,切换到事件页签,查看事件信息。在服务事件中出现异常事件:部署【XXX】创建失败。事件中提示的错误信息包含“部署时间超过N分钟”部署时间超过N分钟事件中提示的错误信息包含“资 - [在线服务部署实例异常](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0050.md): 在线服务的“部署”因实例异常,状态变为“告警、异常”。登录ModelArts管理控制台,在左侧导航栏中选择模型推理 > 在线推理,在服务列表中,单击服务名称,进入服务详情页面。在服务详情页面,切换到事件页签,查看事件信息。在服务事件中出现异常事件:“部署【XXX】状态由运行中转变为告警、“部署【XXX】状态由运行中转变为异常。事件中提示的 - [镜像导致在线服务部署实例异常](https://support.huaweicloud.com/trouble-modelarts/inference2.0-modelarts-0040.md): 在线服务的部署因镜像异常,状态变为告警或异常。查看日志:登录ModelArts管理控制台,在左侧菜单栏中选择模型推理 > 在线推理,进入在线推理管理页面。单击具体的在线服务名称,进入在线服务的详情页面。切换至日志页签,查看日志。未对接LTS时,仅展示运行中的容器日志,最多500行。对接LTS,可单击右上角...>修改服务>高级配置,勾选日 - [在线服务所在集群出现硬件故障排查](https://support.huaweicloud.com/trouble-modelarts/inference2.0-modelarts-0041.md): 在线服务的部署因硬件故障,状态可能变为告警或异常。服务部署单元开启故障自动重启时,会进行硬件故障的检测。当前推理平台可以监测到的故障类型有NPU卡故障、交换机故障、隔离码等。当检测到硬件故障时,推理平台根据用户配置的自动重建策略进行重调度,如果有冗余节点会优先调度到冗余节点。重调度期间,会尝试自动恢复,当事件中打印节点故障恢复时,表示当前 - [推理多机部署实例跨超节点调度导致业务报错](https://support.huaweicloud.com/trouble-modelarts/inference2.0-modelarts-0042.md): 推理多机部署实例跨超节点调度会导致业务报错,解决方法是通过设置节点亲和让实例调度到同一个超节点。登录ModelArts管理控制台,在左侧菜单栏中选择模型推理 > 在线推理,进入在线服务管理页面。单击目标服务名称,进入服务详情页面,切换到部署页签。选择要升级的部署卡片,单击升级,进入服务“升级部署”页面。在“升级部署”页面,在对应的单元配置 - [在线服务创建部署报错ModelArts.8118](https://support.huaweicloud.com/trouble-modelarts/inference2.0-modelarts-0085.md): 在线服务部署配置完成,提交时报错“ModelArts.8118:专属资源池xxx的memory资源不足,无法完成部署”。查看是否有热备节点导致,热备节点的资源不算入可用余量。方法一:减少资源使用配额,例如:减少部署副本数、减少单元副本数量、减少使用的单元规格资源等,确保资源使用配额小于可用资源。方法二:在推理服务详情页的部署页签,在资源配 - [在线服务预测报错ModelArts.020X](https://support.huaweicloud.com/trouble-modelarts/inference2.0-modelarts-0064.md): 请求使用IAM认证时token有误导致请求被拦截。常见报错如下:ModelArts.0201 未携带tokenModelArts.0203 token不合法ModelArts.0204 token解析失败请求头中未携带iam token,请检查请求头中“x-auth-token”是否正确填写。用户Token的获取请参见获取Token认证。 - [在线服务预测报错ModelArts.4104](https://support.huaweicloud.com/trouble-modelarts/inference2.0-modelarts-0065.md): 在线服务部署完成且服务已经处于“运行中”的状态,向服务发起推理请求,报错“ModelArts.4104”。ModelArts.4104表示该请求的请求体大小超过了服务部署时设置的请求体最大值。查看服务请求体大小限制,确认请求是否超限,如超限,请减小请求体大小或者修改服务请求体大小限制。 - [在线服务预测报错ModelArts.4206](https://support.huaweicloud.com/trouble-modelarts/inference2.0-modelarts-0066.md): 在线服务部署完成且服务已经处于“运行中”的状态,向服务发起推理请求,报错“ModelArts.4206”。ModelArts.4206表示该API的请求流量超过了设定值。服务部署时支持配置“每秒请求上限”,当请求流量大于该设定值时会抛出该错误。查看当前服务流量限制,如果当前限制不满足使用要求,在服务列表中单击操作列更多>修改服务,在服务网 - [在线服务预测报错ModelArts.8910](https://support.huaweicloud.com/trouble-modelarts/inference2.0-modelarts-0067.md): 在线服务部署完成且服务已经处于“运行中”的状态,向服务发起推理请求,报错“ModelArts.8910”。服务部署时会指定使用的应用层协议“http”或者“https”,当实际预测使用时使用的协议与配置的不同时,则会返回这个错误。在服务列表中单击服务名称,进入服务详情页查看服务的基本信息,单击右上角修改服务,将服务网络配置中的服务协议修改 - [在线服务预测报错ModelArts.8803](https://support.huaweicloud.com/trouble-modelarts/inference2.0-modelarts-0082.md): 在线服务部署完成且服务已经处于“运行中”的状态,向服务发起推理请求,报错“ModelArts.8803”。常见报错信息为:Request Failed: EOF。ModelArts.8803报错指的是推理转发组件将请求转发至推理服务端时失败。报错Request Failed: EOF触发条件为客户端请求超时时间大于推理服务端连接超时时间。 - [在线服务预测请求超时](https://support.huaweicloud.com/trouble-modelarts/inference2.0-modelarts-0081.md): 在线服务部署完成且服务已经处于运行中的状态,向服务发起推理请求,报错CF2.E00003。CF2.E00003表示该请求响应超时。方法1:在大模型 API 调用中,max_tokens 与响应耗时呈线性正相关,可适当减小预测请求中的max_tokens。方法2:在线推理-服务信息的高可用配置中,可以修改服务的请求超时时间,详情请见修改在线 - [在线服务推理的预测性能相比轻算力节点部署有所下降](https://support.huaweicloud.com/trouble-modelarts/inference2.0-modelarts-0046.md): 用户使用ModelArts部署服务后进行性能压测时,部分性能指标可能略低于用户使用轻算力节点进行部署。由于影响推理性能的因素很多,平台无法对模型推理性能(如时延、吞吐量)做出统一的对外 SLA 承诺。ModelArts提供的模型部署功能支持高可用部署与弹性扩缩容等功能。为支持主流负载均衡算法、高可用调度分发等功能,平台在预测链路上有多个高 - [Pod模型配置加载失败报错:ModelArts.8501](https://support.huaweicloud.com/trouble-modelarts/inference2.0-modelarts-0069.md): 在线服务部署过程中或者实例重启等场景,在Pod事件列表中,事件详细信息中出现ModelArts.8501错误码,报错:A system-related error (such as disk full error, disk corruption, etc.) occurred during the OBS download proces - [Pod模型配置加载失败报错:ModelArts.8502](https://support.huaweicloud.com/trouble-modelarts/inference2.0-modelarts-0070.md): 在线服务部署过程中或者实例重启等场景,在Pod事件列表中,事件详细信息中出现ModelArts.8502错误码,报错:A download error (such as network issues, permission issues, etc.) occurred during the OBS download process。用户在 - [Pod模型配置加载失败报错:ModelArts.8503](https://support.huaweicloud.com/trouble-modelarts/inference2.0-modelarts-0071.md): 在线服务部署过程中或者实例重启等场景,在Pod事件列表中,事件详细信息中出现ModelArts.8503错误码,报错:Insufficient disk space detected before downloading the OBS file。用户在部署在线服务时,指定模型来源为对象存储服务 OBS,且开启了本地存储加速能力,在推理平 - [Pod模型配置加载失败报错:ModelArts.8504或者ModelArts.8505](https://support.huaweicloud.com/trouble-modelarts/inference2.0-modelarts-0072.md): 在线服务部署过程中或者实例重启等场景,在Pod事件列表中,事件详细信息中出现ModelArts.8504,报错:The model warmup file does not exist;或者出现ModelArts.8505错误码,报错:The model warmup task status is not successful。用户在部署 - [Pod模型配置加载失败报错:ModelArts.8506或者ModelArts.8507](https://support.huaweicloud.com/trouble-modelarts/inference2.0-modelarts-0073.md): 在线服务部署过程中或者用实例重启等场景,在Pod事件列表中,事件详细信息中出现ModelArts.8506,报错:An error occurred while mounting the SFS Turbo. Please check whether the related configurations are correct;或者Mod - [创建模型失败,如何定位和处理问题?](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0204.md): 创建模型失败有两种场景:创建模型时直接报错或者是调用API报错和创建模型任务下发成功,但最终模型创建失败。创建模型时直接报错或者是调用API报错。一般都是输入参数不合法导致的。您可以根据提示信息进行排查修改即可。创建模型任务下发成功,但最终模型创建失败。需要从以下几个方面进行排查:在模型详情页面,查看“事件”页签中的事件信息。根据事件信息 - [导入模型提示该账号受限或者没有操作权限](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0205.md): 在导入AI应用时,提示用户账号受限。提示用户账号受限,常见原因有如下几种:导入模型账号欠费导致被冻结;导入模型账号没有对应工作空间的权限;导入模型账号为子账号,主账号没有给子账号赋予模型相关权限。权限说明请参见:策略及授权项说明;权限说明请参见:策略及授权项说明;确认是账号欠费冻结,补交对应欠费,等待账号解冻即可;如果是导入模型没有对应的 - [用户创建模型时构建镜像或导入文件失败](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0206.md): 用户创建模型时,构建镜像失败,失败日志中提示下载obs文件失败(Get object size from OBS failed!)。下载obs文件失败用户创建模型时,事件提示:复制模型文件失败,请检查OBS权限是否正常(Failed to copy model file due to obs exception. Please Check - [创建模型时,OBS文件目录对应镜像里面的目录结构是什么样的?](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0207.md): 创建模型时,元模型来源指定的OBS目录下存放了自定义的文件和文件夹,都会复制到镜像中去。复制进去的路径是什么,怎么读取对应的文件或者文件夹里面的内容?通过OBS导入模型时,ModelArts会将指定的OBS目录下的所有文件和文件夹复制到镜像中的指定路径下,镜像内路径可以通过self.model_path获取。获取镜像内的路径方法见模型推理 - [通过OBS导入模型时,如何编写打印日志代码才能在ModelArts日志查询界面看到日志](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0208.md): 用户通过OBS导入模型时,选择使用基础镜像,用户自己编写了部分推理代码实现自己的推理逻辑,出现故障后希望通过故障日志排查定位故障原因,但是通过logger打印日志无法在“在线服务”的日志中查看到部分内容。推理服务的日志如果需要显示出来,需要代码中将日志打印到Console控制台。当前推理基础镜像使用的python的log模块,采用的是默认 - [通过OBS创建模型时,构建日志中提示pip下载包失败](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0209.md): 通过OBS创建模型构建失败,查看构建日志,提示pip下载包失败。如下载numpy 1.16版本失败。一般下载包失败时,可能有如下几个原因:pip源中不存在该包,当前默认pip源为pypi.org中的包,请在pypi.org中查看是否有对应版本的包并查看包安装限制。下载的包与对应基础镜像架构不匹配,如arm系统下载了x86的包,python - [通过自定义镜像创建模型失败](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0210.md): 通过用户自定义镜像创建模型失败。可能原因如下:导入模型使用的镜像地址不合法或实际镜像不存在用户给ModelArts的委托中没有SWR相关操作权限用户为子账号,没有主账号SWR的权限使用的是非自己账号的镜像使用的镜像为公开镜像到SWR检查下对应的镜像是否存在,对应镜像的镜像地址是否和实际地址一致,大小写,拼写等是否一致。检查用户给Model - [导入模型后部署服务,提示磁盘不足](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_021.md): 用户在导入模型后,部署服务时,提示磁盘空间不足:“No space left on device”。ModelArts部署使用的是容器化部署,容器运行时有空间大小限制,当用户的模型文件或者其他自定义文件,系统文件超过Docker size大小时,会提示镜像内空间不足。公共资源池容器Docker size的大小最大支持50G,专属资源池Do - [创建模型成功后,部署服务报错,如何排查代码问题](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0212.md): 创建模型成功后,部署服务失败,如何定位是模型代码编写有问题。用户自定义镜像或者通过基础镜像导入的模型时,用户自己编写了很多自定义的业务逻辑,这些逻辑有问题将会导致服务部署或者预测失败,需要能够排查出哪里有问题。服务部署失败后,进入服务详情界面,查看服务部署日志,明确服务部署失败原因(用户代码输出需要使用标准输入输出函数,否则输出的内容不会 - [自定义镜像导入配置运行时依赖无效](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0243.md): 通过API接口选择自定义镜像导入创建模型,配置了运行时依赖,没有正常安装pip依赖包。自定义镜像导入不支持配置运行时依赖,系统不会自动安装所需要的pip依赖包。重新构建镜像。在构建镜像的dockerfile文件中安装pip依赖包,例如安装Flask依赖包。 - [通过API接口查询模型详情,model_name返回值出现乱码](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0249.md): 通过API接口查询模型详情,model_name返回值出现乱码。例如model_name为query_vec_recall_model,但是api接口返回结果是query_vec_recall_model_b。当模型名称包含下划线时,下划线涉及转义处理。需要在请求中增加exact_match参数,且参数值设置为true,确保model_n - [导入模型提示模型或镜像大小超过限制](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0257.md): 在导入模型时,提示模型或镜像大小超过限制。如果使用的是OBS导入或者训练导入,则是基础镜像、模型文件、代码、数据文件和下载安装软件包的大小总和超过了限制。如果使用的是自定义镜像导入,则是解压后镜像和镜像下载文件的大小总和超过了限制。精简模型或镜像后,重新导入。 - [导入模型提示单个模型文件超过5G限制](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0258.md): 在导入模型时,提示单个模型文件大小超过5G限制。在不使用动态加载的情况下,系统对单个模型文件的限制大小为5G,超过时无法进行导入。精简模型文件后,重新导入。使用动态加载功能进行导入。使用动态加载 - [订阅的模型一直处于等待同步状态](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0259.md): 订阅的模型一直处于等待同步状态。订阅的模型一直处于等待同步状态,可能原因如下:由于ModelArts的数据存储、模型导入以及部署上线等功能依赖OBS、SWR等服务,需获取依赖服务的授权后,才能正常使用ModelArts的相关功能。您未被授权执行该操作。执行同步操作时报错:ModelArts.0108: 您未被授权执行该操作。订阅已过期。执 - [创建模型失败,提示模型镜像构建任务超时,没有构建日志](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0262.md): 创建模型失败,构建日志提示超时“Model image build task timed out”,没有详细构建日志。imagePacker构建镜像有超时时间限制,默认值为30min(各区域可能存在差异)。当模型镜像构建时间太长,构建日志最后未能完成构建任务,构建超时中断,即会出现“Model image build task timed - [自定义镜像模型部署为在线服务时出现异常](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0062.md): 在部署在线服务时,部署失败。进入在线服务详情页面,事件页签,提示failed to pull image, retry later,同时在日志页签中,无任何信息。出现此问题现象,通常是因为您部署的模型过大导致的。解决方法如下:精简模型,重新导入模型和部署上线。购买专属资源池,在部署上线为在线服务时,使用专属资源池进行部署。 - [部署的在线服务状态为告警](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0065.md): 在部署在线服务时,状态显示为告警。使用状态为告警的服务进行预测,可能存在预测失败的风险,请从以下4个角度进行排查,并重新部署。后台预测请求过多。如果您使用API接口进行预测,请检查是否预测请求过多。大量的预测请求会导致部署的在线服务进入告警状态。如果您使用API接口进行预测,请检查是否预测请求过多。大量的预测请求会导致部署的在线服务进入告 - [服务启动失败](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0195.md): 当服务事件中出现如下事件时,表示容器启动失败。服务启动失败的原因比较多样,可能有如下几种情况:AI应用本身问题,无法启动镜像中配置的端口错误健康检查配置有问题模型推理代码customize_service.py编写有问题镜像拉取失败资源不足,服务调度失败如果创建模型使用的镜像本身有问题,需要在创建模型之前,参考从0-1制作自定义镜像并创建 - [服务部署、启动、升级和修改时,拉取镜像失败如何处理?](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_3152.md): 服务部署、启动、升级和修改时,拉取镜像失败。节点磁盘不足,镜像大小过大。首先考虑优化镜像,减小节点磁盘的占用。优化镜像无法解决问题,请联系系统管理员处理。 - [服务部署、启动、升级和修改时,镜像不断重启如何处理?](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_3153.md): 服务部署、启动、升级和修改时,镜像不断重启。容器镜像代码错误根据容器日志进行排查,修复代码,重新创建模型,部署服务。 - [服务部署、启动、升级和修改时,容器健康检查失败如何处理?](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_3154.md): 服务部署、启动、升级和修改时,容器健康检查失败。容器提供的健康检查接口调用失败。容器健康检查接口调用失败,原因可能有两种:镜像健康检查配置问题模型健康检查配置问题根据容器日志进行排查,查看健康检查接口失败的具体原因。镜像健康检查配置问题,需修复代码后重新制作镜像创建模型后部署服务。了解镜像健康接口配置请参考模型配置文件编写说明中healt - [服务部署、启动、升级和修改时,资源不足如何处理?](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_3155.md): 启动服务失败,报错:资源不足,服务调度失败。(Schedule failed due to insufficient resources. Retry later.或ModelArts.3976:No resources are available for the selected specification.)实例配置的规格过大,CPU - [模型使用CV2包部署在线服务报错](https://support.huaweicloud.com/trouble-modelarts/modelarts_01_00171.md): 使用CV2包部署在线服务报错。使用OBS导入元模型,会用到服务侧的标准镜像,标准镜像里面没有CV2依赖的so的内容。所以ModelArts不支持从对象存储服务(OBS)导入CV2模型包。需要您把CV2包制作为自定义镜像,上传至容器镜像服务(SWR),选择从容器镜像中导入元模型,部署在线服务。如何制作自定义镜像请参考从0-1制作自定义镜像并 - [服务状态一直处于“部署中”](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_3187.md): 服务状态一直处于“部署中”,查看模型日志未发现服务有明显错误。一般情况都是模型的端口配置有问题。建议您首先检查创建模型的端口是否正确。模型的端口没有配置,如您在自定义镜像配置文件中修改了端口号,需要在部署模型时,配置对应的端口号,使新的模型重新部署服务。如何修改默认端口号,请参考使用自定义镜像创建在线服务,如何修改默认端口。 - [服务启动后,状态断断续续处于“告警中”](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_3188.md): 预测流量不大但频繁出现以下报错Backend service internal error. Backend service read timed outSend the request from gateway to the service failed due to connection refused, please confirm - [服务部署失败,报错No Module named XXX](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_3189.md): 服务部署失败,报错:No Module named XXXNo Module named XXX,表示模型中没有导入对应依赖模块。依赖模块没有导入,需要您在模型推理代码中导入缺失依赖模块。例如您的模型是Pytorch框架,部署为在线服务时出现告警:ModuleNotFoundError: No module named ‘model_se - [IEF节点边缘服务部署失败](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0193.md): 部署边缘服务时,出现“异常”状态。部署边缘服务时,使用到IEF纳管的边缘节点,就需要用户给ModelArts的委托赋予Tenant Administrator权限,否则将无法成功部署边缘服务。具体可参见IEF的权限说明。在ModelArts管理控制台,选择“权限管理”。在用户名对应的“授权内容”列,单击“查看权限”,确认用户的委托权限是否 - [批量服务输入/输出obs目录不存在或者权限不足](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0251.md): 输入输出目录不存在,报如下错误"error_code": "ModelArts.3551", "error_msg": "OBS path xxxx does not exist."当访问目录权限不足时,报如下错误"error_code": "ModelArts.3567", "error_msg": "OBS error occurs - [部署在线服务出现报错No CUDA runtime is found](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0196.md): 部署在线服务出现报错No CUDA runtime is found,using CUDA_HOME='/usr/local/cuda'。从日志报错信息No CUDA runtime is found分析,是cuda runtime没有找到。建议您按以下步骤排查处理:确认部署在线服务时是否选择了GP规格。在customize_servic - [使用AI市场物体检测YOLOv3_Darknet53算法训练后部署在线服务报错](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0245.md): 使用AI市场物体检测YOLOv3_Darknet53算法进行训练,将数据集切分后进行部署在线服务报错,日志如下:TypeError: Cannot interpret feed_dict key as Tensor: The name 'images:0' refers to a Tensor which does not exist. - [使用预置AI算法部署在线服务报错gunicorn:error:unrecognized arguments](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0248.md): 使用预置AI算法部署在线服务报错gunicorn:error:unrecognized arguments...根据报错日志分析,模型目录下存在多余文件“/home/mind/model/v0432/cdn_short.pt”。在模型目录中删除“/home/mind/model/v0432/cdn_short.pt”文件,重新导入模型后进 - [内存不足如何处理?](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0272.md): 在部署或升级在线服务时,如果部署或升级失败,并且在事件中出现如下类似提示。内存不足提示样例1运行中服务出现告警时,在事件中出现建议:内存不足,请增加内存。内存不足提示样例2部署或升级时出现该提示,可能原因是选择的计算节点规格内存太小,无法满足应用部署,请增大内存规格。运行中服务告警中出现该提示,可能代码有问题导致内存溢出或者业务使用量太大 - [在线服务数量限制默认为11个:ModelArts.3520](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0307.md): ModelArts.3520:在线服务数量限制默认为11个。若您需要继续部署新的在线服务,请先删除已有的在线服务,或提交工单申请扩大ModelArts在线服务数量配额。在线服务数量限制默认为11个,超出了此数量。先删除已有的在线服务,再重试。提交工单申请扩大ModelArts在线服务数量配额。 - [部署服务时报错pod has unbound immediate PersistentVolumeClaims](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0317.md): 服务配置存储挂载,在部署服务时事件中有异常:资源不足,服务调度失败。pod has unbound immediate PersistentVolumeClaims。如果服务配置了存储挂载,在创建对应的存储卷时,存储卷声明(PersistentVolumeClaims)关联存储卷(PersistentVolume)有一定的时延,当检测服务 - [服务预测失败](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0216.md): 在线服务部署完成且服务已经处于“运行中”的状态,向服务发起推理请求,预测失败。服务预测需要经过客户端、外部网络、APIG、Dispatch、模型服务多个环节。每个环节出现都会导致服务预测失败。出现APIG.XXXX类型的报错,表示请求在APIG(API网关)出现问题而被拦截。常见问题请参见服务预测失败,报错APIG.XXXX。其他被API - [服务预测失败,报错APIG.XXXX](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_3204.md): 请求在APIG(API网关)出现问题被拦截,报错APIG.XXXX。常见报错:APIG.0101 预测地址错误APIG.0201 请求体内容过大APIG.0301 鉴权失败APIG.1009 AppKey和AppSecret不匹配查看更多的APIG(API网关)错误码含义及处理方案可参考API错误码API错误码。当预测的地址有问题时,AP - [在线服务预测报错ModelArts.4206](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0217.md): 在线服务部署完成且服务已经处于“运行中”的状态,向服务发起推理请求,报错“ModelArts.4206”。ModelArts.4206表示该API的请求流量超过了设定值。为了保证服务的平稳运行,ModelArts对单个API的推理请求流量做了限制,同时为了保证推理服务可以稳定运行在合理区间,ModelArts将限流值设定在一个较高区间。降 - [在线服务预测报错ModelArts.4302](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0218.md): 在线服务部署完成且服务已经处于“运行中”的状态后,向运行的服务发起推理请求,报错ModelArts.4302。服务预测报错ModelArts.4302有多种场景,以下主要介绍两种场景:"error_msg": "Gateway forwarding error. Failed to invoke backend service due - [在线服务预测报错ModelArts.4503](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0219.md): 在线服务部署完成且服务已经处于“运行中”的状态后,向运行的服务发起推理请求,报错ModelArts.4503。服务预测报错ModelArts.4503有多种场景,常见场景如下:通信出错请求报错:{"error_code":"ModelArts.4503","error_msg":"Failed to respond due to back - [在线服务预测报错MR.0105](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0192.md): 部署为在线服务,服务处于运行中状态,预测时报错:{ "erno": "MR.0105", "msg": "Recognition failed","words_result": {}}。请在“在线服务”详情页面的日志页签中查看对应的报错日志,分析报错原因。从上图报错日志判断,预测失败是模型推理代码编写有问题。根据日志报错提示,append - [在线服务预测报错ModelArts.2803](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0220.md): 服务预测报错:Method Not Allowed服务预测默认注册的API需要使用POST方法调用。如您使用了GET方法,APIG(API网关)将会拦截请求。使用POST方法调用。 - [请求超时返回Timeout](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0221.md): 服务预测请求超时,报错{"error_code": "ModelArts.4205","error_msg":"Connection time out."}。请求超时,大概率是APIG(API网关)拦截问题。需排查APIG(API网关)和模型。优先排查APIG(API网关)是否是通的,可以在本地使用curl命令排查,命令行:curl -k - [自定义镜像导入模型部署上线调用API报错](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_3186.md): 部署上线调用API报错,排查项如下:确认配置文件模型的接口定义中有没有POST方法。确认配置文件里url是否有定义路径。例如:“/predictions/poetry”(默认为“/”)。确认API调用中body体中的调用路径是否拼接自定义路径。如:“{API接口地址}/predictions/poetry”。 - [在线服务预测报错DL.0105](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0253.md): 在线服务预测报错DL.0105,报错日志:“TypeError:‘float’object is not subscriptable”。根据报错日志分析,是因为一个float数据被当做对象下标访问了。将模型推理代码中的x[0][i]修改为x[i],重新部署服务进行预测。 - [时序预测-time_series_v2算法部署在线服务预测报错](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0252.md): 在线服务预测报错:ERROR: data is shorter than windows。该报错说明预测使用的数据行数小于window超参值。在使用订阅算法时序预测-time_series_v2训练时,超参:window设置为60。训练完成并创建模型后,部署在线服务,进行预测,当预测的数据行数小于window超参值时,日志中有报错信息:E - [使用MoXing复制数据报错](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0036.md): 调用moxing.file.copy_parallel()将文件从开发环境的OBS桶中复制到其他OBS桶里,但是桶内没有出现目标文件。使用MoXing复制数据不成功,出现报错。如:ModelArts开发环境使用MoXing复制OBS数据报错:keyError: 'request-id'ModelArts使用MoXing复制报错:No fi - [Pytorch Mox日志反复输出](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0010.md): ModelArts训练作业算法来源选用常用框架的Pytorch引擎,在训练作业运行时Pytorch Mox日志会每个epoch都打印Mox版本,具体日志如下:Pytorch通过spawn模式创建了多个进程,每个进程会调用多进程方式使用Mox下载数据。此时子进程会不断销毁重建,Mox也就会不断的被导入,导致打印很多Mox的版本信息。为避免训 - [训练作业使用MoXing复制数据较慢,重复打印日志](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0037.md): ModelArts训练作业使用MoXing复制数据较慢。重复打印日志INFO:root:Listing OBS。复制数据慢的可能原因如下:直接从OBS上读数据会造成读数据变成训练的瓶颈,导致迭代缓慢。由于环境或网络问题,读OBS时遇到读取数据失败情况,从而导致整个作业失败。直接从OBS上读数据会造成读数据变成训练的瓶颈,导致迭代缓慢。由于 - [MoXing如何访问文件夹并使用get_size读取文件夹大小?](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0038.md): 使用MoXing无法访问文件夹。使用MoXing的get_size读取文件夹大小,显示为0。使用MoXing访问文件夹,需添加参数:recursive=True,默认为False。获取一个OBS文件夹的大小:获取一个OBS文件的大小: - [MoXing安装失败或使用卡死](https://support.huaweicloud.com/trouble-modelarts/modelarts_05_4202.md): 安装MoXing报错Invalid version。使用MoXing出现卡死现象。24.1版本以上的pip限制了Python库的版本号命名规则,旧版本MoXing不符合。旧版本MoXing并发下载时调用了Python原生库queue,该库存在卡死风险。升级MoXing版本到2.3.11及以上,对上述问题进行了修复。 - [安装ModelArts SDK报错“ERROR: Could not install packages due to an OSError”](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0198.md): 安装ModelArts SDK报错,完整报错信息“ERROR: Could not install packages due to an OSError: [WinError 2] The system cannot find the file specified: 'c:\python39\Scripts\ephemeral-port- - [ModelArts SDK下载文件目标路径设置为文件名,部署服务时报错](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0199.md): ModelArts SDK在OBS下载文件时,目标路径设置为文件名,在本地IDE运行不报错,部署为在线服务时报错。代码如下:报错信息如下:用户代码中设置的目标路径(local_path)有误。需要将local_path路径设置为文件夹且后缀必须以“/”结尾。 - [调用API创建训练作业,训练作业异常](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0200.md): 调用API接口创建训练作业(专属资源池为CPU规格),训练作业状态由“创建中”转变为“异常”,训练作业详情界面“规格信息”为“--”。调用接口传入了CPU规格的专属资源池不支持的参数。检查API请求的请求体中是否存在“flavor_id”参数,CPU规格的专属资源池不支持使用“flavor_id”参数。 - [用户执行huaweicloud.com相关API超时](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0300.md): 用户在Notebook里通过request请求接口时超时:GET pangu-xxx.cn-southwest-2.myhuaweicloud.com。在Notebook中访问公网需要通过代理,访问huawei.com不通过公网代理,huaweicloud.com域名在no_proxy/NO_PROXY中包含,就访问不了。执行以下命令查看 - [创建资源池失败](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0291.md): 在使用专属资源池时(如资源扩缩容、创建VPC、创建VPC-子网、打通VPC),如果提示相关资源配额受限,请提交工单处理。例如创建专属资源池时,创建失败,提示配额不足,请单击申请最大配额,在“新建工单”页面,根据您的需求,填写相关参数。其中,“问题描述”项请填写需要调整的内容和申请原因。填写完毕后,勾选协议并单击“提交”。登录ModelAr - [资源池节点故障定位](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0292.md): 对于专属资源池,ModelArts平台在识别到节点故障后,通过给K8S节点增加污点的方式(taint)将节点隔离避免新作业调度到该节点而受到影响,并且使本次作业不受污点影响。当前可识别的故障类型如下,可通过隔离码及对应检测方法定位故障。节点故障事件会上报到AOM,您可以在AOM配置短信、邮件等通知方式。以下步骤基于AOM2.0配置。规则类 - [资源池推理服务一直初始化中如何解决](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0302.md): 创建资源池时作业类型选择了推理服务,资源池创建成功后推理一直显示“环境初始化。专属池网段和推理微服务dispatcher网段冲突,导致专属池上的VPCEP终端节点无法创建,该region无法使用此网段创建包含推理服务的资源池。选择其他网段的ModelArts网络重建资源池即可解决网段冲突问题。 - [专属资源池关联SFS Turbo显示异常](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0303.md): 专属资源池关联SFS Turbo时显示异常,关联失败。网络操作解除关联SFS Turbo后状态仍显示已关联且无报错信息,而解除关联按钮置灰不可操作。同时该网络的解除关联SFS Turbo按钮置灰不可操作。ModelArts缺少SFS Turbo委托权限导致关联或解除关联失败。需要您给ModelArts配置SFS Turbo委托权限,配置步 - [模型预热失败如何处理](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0214.md): ModelArts专属资源池提供了模型预热功能,用户可在控制台配置预热任务,将权重文件预先缓存到内存中的加速目录,从而缩短服务初始化时间,提升用户体验。用户在发起创建或修改模型预热任务请求时,由于相关配置或资源池环境不符合条件,可能会遇到请求报错的情况,建议根据错误码信息,排查请求报错原因,采取相应的解决措施,具体错误码含义及解决方案详见 - [公共池训练作业排队超过设置的配额后,无法提交作业](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0308.md): 公共池训练作业排队超过设置的配额后,无法提交作业。存在默认排队任务配额(如上图的为150),超过默认排队配额训练作业会报错。公共资源池排队任务存在默认配额,超过默认排队配额,训练作业会报错。用户可以删除不使用的训练作业或者提工单申请修改配额。 - [模型预热异常或部分成功如何处理](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0310.md): 在模型预热过程中,可能会遇到预热异常或部分成功的情况。这些情况通常表现为模型加载失败、响应超时或部分功能未正常启动。 当遇到预热异常时,首先检查模型文件是否完整且未损坏。确认模型文件无误后,检查资源是否充足,包括内存和CPU使用情况。 如果预热部分成功,建议根据对应状态的错误信息,采取相应的解决措施。模型预热状态部分成功或异常。创建或 - [PCIeErrorFound事件处理建议](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0321.md): 可能造成客户的业务中断,客户无法使用该NPU卡。查到昇腾PCI设备信息中包含rev ff字段,表明有设备硬件版本(revision)未被正确识别或报告,上报PCIe链路异常事件。可能是驱动或固件异常导致,也可能是硬件故障。登录机器,执行命令查询NPU PCI设备信息。如果查到包含rev ff字段的PCI设备,则表明存在PICe链路异常情况 - [LspciCardNotFound事件处理建议](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0322.md): 可能造成客户的业务中断,客户无法使用该NPU卡。lspci查到的NPU卡数少于实际该规格应发卡数。可能是驱动或固件异常导致丢卡,也可能是硬件故障丢卡。登录机器,执行命令查询NPU PCIe设备信息。如果查询到的PCIe设备数少于该机器规格应发卡数,则表明是PCIe设备丢失。lspci -d 19e5:| grep -E 'd100|d50 - [GpuRoceNicConfigIncorrect事件处理建议](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0323.md): 可能造成客户的业务中断,无法使用该GPU卡。有RoCE网卡存在多个不同的IP,或者有RoCE网卡没有配置IP。RoCE网卡配置错误。服务器上有RoCE配置残留。登录机器,执行命令查询RoCE网卡配置信息。如果查询到有RoCE网卡存在多个不同IP,或者有RoCE网卡没有IP,则表明存在RoCE网卡配置错误故障。show_gids如果确认是G - [ReadOnlyFileSystem事件处理建议](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0324.md): 裸金属服务器无法正常使用(OS变为只读),造成客户业务中断。当前机器中,“/”或“/docker”或“/home”目录出现只读。文件系统损坏,硬件故障,或者操作系统故障。登录机器,执行命令查询当前系统已挂载的文件系统,如果发现“/”、“/docker”和“/home”三个挂载点,RO列有值为1,则说明文件系统只读。lsblk如果确认是OS - [NpuDriverFirmwareMismatch事件处理建议](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0325.md): 可能造成客户的业务中断,客户无法使用NPU卡。NPU驱动固件是有配套关系的,当前机器上驱动固件可能不匹配。客户更新驱动导致,驱动固件不匹配。登录机器,执行命令查询NPU驱动是否正常。npu-smi info执行命令查看NPU驱动固件版本匹配情况,如果发现Compatibility字段值为非OK时,则表明当前机器上驱动固件不匹配。npu-s - [RoCELinkStatusDown事件处理建议](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0326.md): 可能造成客户业务中断,无法使用NPU卡。检测到当前机器上有NPU RoCE网口状态为down。若对端交换机故障隔离功能参数配置过小,会使对端交换机对应端口触发故障隔离,导致NPU侧网口down。登录机器,执行命令查询NPU网口状态。如下图所示,即2号和4号网口状态为down。for i in $(seq 07);do hccn_tool - [RoCEHealthStatusError事件处理建议](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0327.md): 可能造成客户业务中断,客户无法使用该NPU卡。当前服务器中NPU芯片存在异常。NPU卡存在异常。登录机器,执行命令查询NPU卡回显信息。npu-smi info执行命令查询NPU网卡健康状态。如果查询到有NPU卡状态为非Success,则表明其健康状态异常。for i in $(seq 07);do hccn_tool -i $i -ne - [HccnConfNotExisted事件处理建议](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0328.md): 可能会引起网络方面的异常,导致客户业务中断。RoCE网络配置文件/etc/hccn.conf丢失。配置文件/etc/hccn.conf可能被删除。登录机器,执行命令查看roce网卡配置文件是否存在。ls /etc/hccn.conf如果确认是RoCE网卡配置文件/etc/hccn.conf不存在。收集上述排查信息,联系运维人员协助处理。此 - [MountDiskSystem事件处理建议](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0329.md): 可能影响客户业务中断,服务器异常。/etc/fstab 是Linux系统中用于定义系统启动时自动挂载的文件系统。该告警检测到fstab文件中磁盘挂载命令中设备UUID填写错误,并且命令中也没有nofail字段进行容错处理。客户修改/etc/fstab文件进行磁盘挂载,挂载命令中设备UUID填错,并没有添加nofail配置容错。登录机器,执 - [RoCEUdpConfigError事件处理建议](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0330.md): 可能导致多台机器间通信异常,导致客户业务中断。NPU RoCE哈希端口未散列配置。端口散列配置脚本未执行。登录机器,通过命令查询RoCE端口情况。如果查询到端口数量为1,则存在RoCE UDP端口未散列配置故障。for i in $(seq 07);do echo "==============> $i"; hccn_tool -i $i - [KernelUpgradeWarning事件处理建议](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0331.md): 操作系统异常,可能导致客户业务中断。当前操作系统内核与发放机器时操作系统内核版本不一致。客户执行了升级内核操作或者更新系统中已安装软件包(upgrade)。登录机器,通过命令查询操作系统当前内核版本。uname -r确认客户下单时选择的操作系统内核版本,如果和步骤1中查到的内核版本不一致,则表明该系统执行了内核升级。明确客户升级系统内核的 - [NpuToolsWarning事件处理建议](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0332.md): NPU驱动异常,可能导致用户业务中断。NPU环境相关检测命令异常。npu-smi 命令不可用,可能是NPU驱动异常hccn_tool 命令不可用,可能是NPU驱动异常ascend-dmi命令不可用,可能没有安装ToolBox工具登录机器,执行命令查询npu-smi工具是否正常。npu-smi info执行命令查询hccn_tool命令工具 - [NPUSMICardNotFound事件处理建议](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0333.md): NPU卡无法正常使用。npu-smi info查询缺少设备。可能是由于昇腾驱动问题或NPU掉卡。建议客户隔离该节点。不同客户处理方式不同,一般使用K8s管理的,通过打污点标签达成隔离目标。训练任务退出后重新执行,推理任务可重新发起请求。若该节点本来没有任务运行,跳过此步骤。故障节点执行重启尝试恢复,重启后执行npu-smi info 命令 - [NPUErrorCodeWarning事件处理建议](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0334.md): NPU当前存在故障,可能导致客户业务终止。NPU出现错误码告警。此事件涵盖大量重要及以上的NPU错误码,可以根据这些错误码进一步定位错误原因。具体故障影响及修复建议详见Snt9b或超节点Snt9b23的《黑匣子错误码信息列表》和《健康管理故障定义》文档,查询时注意匹配对应的HDK版本。超节点Snt9b23相关文档链接Snt9b2相关文档链 - [NpuL1SwitchPortPartialFunctionFailure事件处理建议](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0335.md): 可能导致通信性能降低,影响业务正常运行。NPU的L1 1520交换机端口局部功能失效。L1 1520交换机软件或硬件故障。查看事件上报的详情信息,事件详情信息示例如下:四分之一降Lane:“Port real lanes are less than quarter of the configured lanes. event_type: - [NpuL1SwitchFault事件处理建议](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0336.md): 业务可能受到影响终止。NPU的L1 1520交换机发生故障。L1 1520交换机软件或硬件故障。查看事件上报的详情信息列,事件详情信息示例如下:The L1 1520 switch is faulty, alarm_id 139591683, fault_id 4294967295. switch chip id 2, switch po - [NpuRoceIPAddressMismatch事件处理建议](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0337.md): 机器参数面网络异常,多机任务无法执行。RoCE网卡的实际IP地址与配置文件hccn.conf中的IP地址不一致。配置的IP地址未生效。1. 清空 /etc/hccn.conf 文件内容,然后重启服务器。2. 若重启后问题仍未解决,建议提工单,联系运维人员协助处理。此告警恢复后,关闭工单时清除方式选择清除网管告警即可。无 - [GPU裸金属服务器使用EulerOS内核误升级如何解决](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0274.md): GP Vnt1裸金属服务器,操作系统为EulerOS 2.9(基于CentOS制作的Linux发行版),经常遇到服务器重启后,操作系统内核无故升级,导致系统上原安装的nvidia-driver等软件无法使用,只能卸载重新安装。分析EulerOS内核是如何在不知情的情况下升级的:首先查看当前操作系统内核。[root@Server-ddff - [GPU A系列裸金属服务器没有任务但GPU被占用如何解决](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0275.md): 服务器没有任务,但GPU显示被占用。截图示例如下: - [GPU A系列裸金属服务器无法获取显卡如何解决](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0276.md): 在A系列裸金属服务器上使用PyTorch一段时间后,出现获取显卡失败的现象,报错如下:Error 802原因为缺少fabricmanager,可能由于以下原因导致nvidia-fabricmanager.service不工作:可能系统资源不足、如内存不足、内存泄露。硬件故障、如IB网络或者GPU互联设备故障等。没安装nvidia-fabr - [GPU裸金属服务器无法Ping通如何解决](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0277.md): 在华为云使用GPU裸金属服务器时, 服务器绑定EIP(华为云弹性IP服务)后,出现无法ping通弹性公网IP现象。查看当前GPU裸金属服务器的安全组的入方向规则的配置,发现仅开通了TCP协议的22端口。ping命令是一种基于ICMP协议(Internet Control Message Protocol)的网络诊断工具,利用ICMP协议向 - [GPU A系列裸金属服务器RoCE带宽不足如何解决?](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0278.md): GP Ant8支持RoCE网卡, Ubuntu20.04场景,在进行nccl-tests时,总线带宽理论峰值可达90GB/s,但实际测试下来的结果只有35GB/s。nv_peer_mem是一个Linux内核模块,它允许支持P2P(Peer-to-Peer)的NV GPU直接进行内存访问(DMA)。这意味着数据可以直接在多个GPU之间传输, - [使用SFS盘出现报错rpc_check_timeout:939 callbacks suppressed](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0282.md): 弹性文件服务(Scalable File Service,SFS)提供按需扩展的高性能文件存储(NAS),可以在裸金属服务器中通过网络协议挂载使用,SFS支持NFS和CIFS的网络协议。在使用裸金属服务器时, 将数据放在SFS盘中, 并发建立多个NFS链接、并发的读写数据、做大模型训练。 但有时候会出现读取速度变慢的现象,并且SFS提示报 - [华为云CCE集群纳管GPU裸金属服务器由于CloudInit导致纳管失败的解决方案](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0283.md): 创建出3台GPU裸金属服务器,使用A节点制作镜像,用于在CCE纳管裸金属服务器时,使用该镜像,但是纳管后发现服务器A纳管失败,剩下两台服务器纳管成功。在CCE纳管过程中,需要通过cloudinit userdata机制拉取cce-agent,但是在服务器上查看没有拉cce-agent的动作,理论上该动作是cloudinit中的脚本在创建时 - [裸金属服务器EulerOS升级NetworkManager-config-server导致SSH连接故障解决方案](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0285.md): 裸金属服务器EulerOS 2.8系统下,使用yum update -y命令,导致软件NetworkManager-config-server升级到高版本,出现SSH连接故障无法访问。查看yum命令历史,发现执行了“yum update -y”,“yum update -y”命令是用于在Linux操作系统上更新软件包的命令。其中,选项-y - [资源池创建失败的原因与解决方法?](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0288.md): 本文主要介绍在ModelArts资源池创建失败时,如何查找失败原因,并解决问题。您可以参考以下步骤,查看资源池创建失败的报错信息,并根据相应的解决方法解决问题:登录ModelArts控制台,左侧导航栏单击“资源管理 > 轻量算力资源 > 轻量算力集群”(旧版控制台:资源管理 > 轻量算力集群),单击资源池列表右上角的“失败记录”右侧数字, - [如何定位和处理Cluster资源池节点故障](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0287.md): 对于ModelArts 轻量算力集群,每个节点会以DaemonSet方式部署node-agent组件,该组件会检测节点状态,并将检测结果写到K8S NodeCondition中。同时,节点故障指标默认会上报到AOM,您可在AOM配置告警通知。当发生节点异常时,在故障初步分析阶段,您可先按表1识别是否为亚健康并自助进行处理,如果不是,则为故 - [特权池信息数据显示均为0%如何解决?](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0289.md): 特权池基本信息页面数据均显示为0%(如CPU使用率、内存使用率、加速卡使用率、加速卡显存使用率)。原因是集群没有安装ICAgent。新建特权池时默认会安装ICAgent,可能由于用户自行卸载ICAgent,导致资源池数据显示异常。登录“应用运维管理”控制台,在“配置管理 > Agent管理”中,选择未安装ICAgent的集群,并单击“安装 - [重置节点后无法正常使用?](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0305.md): 当ModelArts 轻量算力集群的CCE集群在资源池上只有一个节点,且用户设置了volcano为默认调度器时,在ModelArts侧进行重置节点的操作后,节点无法正常使用,节点上的POD会调度失败。在ModelArts侧进行节点重置后,modelarts-os会向节点添加准入污点,进行节点准入,而因为集群volcano没有污点容忍,且集 - [如何根据Cluster节点故障自动恢复业务](https://support.huaweicloud.com/trouble-modelarts/modelarts_13_0315.md): AI服务器单点硬件故障不可避免,在大规模算力使用场景下,资源池规模越大存在硬件故障的可能性越高。当发生硬件故障时可能会影响节点上服务的正常运行。轻量算力集群节点巡检到故障后,会上报故障信息到k8s节点和AOM云服务,详情请见Cluster节点故障上报。ModelArts提供故障感知、通知能力,配合业务在原生k8s中进行快速恢复。针对故障节 ## AI Gallery - [AI Gallery使用流程](https://support.huaweicloud.com/aimarket-modelarts/ma_gallery_0001.md): AI Gallery提供了模型、数据集等AI数字资产的共享,为高校科研机构、解决方案集成商、企业级/个人开发者等群体,提供安全、开放的共享及交易环节,加速AI资产的开发与落地,保障AI开发生态链上各参与方高效地实现各自的商业价值。本节主要介绍在AI Gallery中管理资产的整体流程。在AI Gallery中,需要先将本地数据上传到AI - [自定义模型规范](https://support.huaweicloud.com/aimarket-modelarts/ma_gallery_0055.md): AI Gallery除了支持托管文本生成和文本问答任务类型的模型,还支持托管其他任务类型的模型,其他任务类型的模型被称为自定义模型。但是托管的自定义模型要满足规范才支持使用AI Gallery工具链服务。模型基础设置里的任务类型选择除文本问答和文本生成之外的类型。上传模型文件时需要确认待上传的文件是否满足自定义模型规范。如果模型要支持训练 - [自定义镜像规范](https://support.huaweicloud.com/aimarket-modelarts/ma_gallery_0057.md): AI Gallery支持托管自定义镜像,但是托管的自定义镜像要满足规范才支持使用AI Gallery工具链服务。如果自定义镜像要支持训练,则需要满足自定义镜像规范(训练)。如果自定义镜像要支持推理,则需要满足自定义镜像规范(推理)。当托管自定义镜像到AI Gallery时,如果镜像要支持AI Gallery的模型调优,则需要在README - [使用AI Gallery SDK构建自定义模型](https://support.huaweicloud.com/aimarket-modelarts/ma_gallery_0046.md): AI Gallery的Transformers库支持部分开源的模型结构框架,并对昇腾系列显卡进行了训练/推理性能优化,可以做到开箱即用。如果你有自己从头进行预训练的模型,AI Gallery也支持使用SDK构建自定义模型接入AI Gallery。AI Gallery使用的Transformers机器学习库是一个开源的基于Transform - [托管模型到AI Gallery](https://support.huaweicloud.com/aimarket-modelarts/ma_gallery_0043.md): AI Gallery上每个资产的文件都会存储在线上的AI Gallery存储库(简称AI Gallery仓库)里面。每一个模型实例视作一个资产仓库,模型实例与资产仓库之间是一一对应的关系。例如,模型名称为“Test”,则AI Gallery仓库有个名为“Test”的仓库,其中只存放Test模型实例的全部文件。支持本地文件托管至AI Gal - [发布模型到AI Gallery](https://support.huaweicloud.com/aimarket-modelarts/ma_gallery_0005.md): 除了Gallery提供的已有资产外,还可以将个人创建的资产发布至Gallery货架上,供其他AI开发者使用,实现资产共享。登录AI Gallery,选择右上角“我的Gallery”。在左侧“我的资产 > 模型”下,选择未发布的模型,单击模型名称,进入模型详情页。在模型详情页,单击右侧“发布”,在发布模型页面编辑发布信息后,单击“发布”。发 - [管理AI Gallery模型](https://support.huaweicloud.com/aimarket-modelarts/ma_gallery_0007.md): 资产发布上架后,准确、完整的资产介绍有助于提升资产的排序位置和访问量,能更好的支撑用户使用该资产。在模型详情页,选择“模型介绍”页签,单击右侧“编辑介绍”。编辑模型基础设置和模型描述。模型介绍的参数说明参数名称说明基础设置中文名称显示模型的名称,不可编辑。许可证模型遵循的使用许可协议,根据业务需求选择合适的许可证类型。语言选择使用模型时支 - [托管数据集到AI Gallery](https://support.huaweicloud.com/aimarket-modelarts/ma_gallery_0044.md): AI Gallery上每个资产的文件都会存储在线上的AI Gallery存储库(简称AI Gallery仓库)里面。每一个数据集实例视作一个资产仓库,数据集实例与资产仓库之间是一一对应的关系。例如,数据集名称为“Test”,则AI Gallery仓库有个名为“Test”的仓库,其中只存放Test模型实例的全部文件。支持本地文件托管至AI - [发布数据集到AI Gallery](https://support.huaweicloud.com/aimarket-modelarts/ma_gallery_0064.md): 除了Gallery提供的已有资产外,还可以将个人创建的资产发布至Gallery货架上,供其他AI开发者使用,实现资产共享。登录AI Gallery,选择右上角“我的Gallery”。在“我的资产 > 数据集”下,选择未发布的数据集,单击数据集名称,进入数据集详情页。在数据集详情页,单击右侧“发布”,在发布数据集页面编辑发布信息后,单击“发 - [管理AI Gallery数据集](https://support.huaweicloud.com/aimarket-modelarts/ma_gallery_0065.md): 资产发布上架后,准确、完整的资产介绍有助于提升资产的排序位置和访问量,能更好的支撑用户使用该资产。在数据集详情页,选择“数据集介绍”页签,单击右侧“编辑介绍”。编辑数据集基础设置和数据集描述。数据集介绍的参数说明参数名称说明基础设置中文名称显示数据集的名称,不可编辑。许可证数据集遵循的使用许可协议,根据业务需求选择合适的许可证类型。语言选 - [托管工作流到AI Gallery](https://support.huaweicloud.com/aimarket-modelarts/ma_gallery_0058.md): AI Gallery上每个资产的文件都会存储在线上的AI Gallery存储库(简称AI Gallery仓库)里面。每一个工作流实例视作一个资产仓库,工作流与资产仓库之间是一一对应的关系。例如,工作流名称为“Test”,则AI Gallery仓库有个名为“Test”的仓库,其中只存放Test工作流实例的全部文件。支持本地文件托管至AI G - [发布工作流到AI Gallery](https://support.huaweicloud.com/aimarket-modelarts/ma_gallery_0059.md): 除了Gallery提供的已有资产外,还可以将个人创建的资产发布至Gallery货架上,供其他AI开发者使用,实现资产共享。登录AI Gallery,选择右上角“我的工作台”。在左侧“我的资产 > 工作流”下,选择未发布的工作流,单击工作流名称,进入工作流详情页。在工作流详情页,单击左侧“发布”,在发布工作流页面编辑发布信息后,单击“发布” - [管理AI Gallery工作流](https://support.huaweicloud.com/aimarket-modelarts/ma_gallery_0060.md): 在工作流详情页,选择“工作流介绍”页签,单击右侧“编辑介绍”。编辑工作流基础设置和工作流描述。工作流介绍的参数说明参数名称说明基础设置中文名称显示工作流的名称,不可编辑。许可证工作流遵循的使用许可协议,根据业务需求选择合适的许可证类型。语言选择使用工作流时支持的输入输出语言。行业领域可以选择工作流所属的行业领域。工作流描述-资产的READ - [托管Skill到AI Gallery](https://support.huaweicloud.com/aimarket-modelarts/ma_gallery_0011.md): AI Gallery上每个资产的文件都会存储在线上的AI Gallery存储库(简称AI Gallery仓库)里面。每一个Skill实例视作一个资产仓库,Skill与资产仓库之间是一一对应的关系。例如,Skill名称为“Test”,则AI Gallery仓库有个名为“Test”的仓库,其中只存放Test Skill实例的全部文件。支持本地 - [发布Skill到AI Gallery](https://support.huaweicloud.com/aimarket-modelarts/ma_gallery_0012.md): 除了Gallery提供的已有资产外,还可以将个人创建的资产发布至Gallery货架上,供其他AI开发者使用,实现资产共享。登录AI Gallery,选择右上角“我的工作台”。在左侧“我的资产 > Skills”下,选择未发布的Skill,单击工作流名称,进入Skill详情页。在Skill详情页,单击左侧“发布”,在发布Skill页面编辑发 - [管理AI Gallery Skills](https://support.huaweicloud.com/aimarket-modelarts/ma_gallery_0013.md): 在Skill详情页,选择“Skill介绍”页签,单击右侧“编辑介绍”。编辑Skill基础设置和工作流描述。Skill介绍的参数说明参数名称说明基础设置中文名称显示Skill的名称,不可编辑。许可证Skill遵循的使用许可协议,根据业务需求选择合适的许可证类型。语言选择使用Skill时支持的输入输出语言。行业领域可以选择Skill所属的行业 - [托管工作流到AI Gallery](https://support.huaweicloud.com/aimarket-modelarts/ma_gallery_0015.md): AI Gallery上每个资产的文件都会存储在线上的AI Gallery存储库(简称AI Gallery仓库)里面。每一个本体实例视作一个资产仓库,本体与资产仓库之间是一一对应的关系。例如,本体名称为“Test”,则AI Gallery仓库有个名为“Test”的仓库,其中只存放Test本体实例的全部文件。支持本地文件托管至AI Galle - [发布本体到AI Gallery](https://support.huaweicloud.com/aimarket-modelarts/ma_gallery_0016.md): 除了Gallery提供的已有资产外,还可以将个人创建的资产发布至Gallery货架上,供其他AI开发者使用,实现资产共享。登录AI Gallery,选择右上角“我的Gallery”。在左侧“我的资产 > 本体”下,选择未发布的本体,单击本体名称,进入本体详情页。在本体详情页,单击右侧“发布”,在发布本体页面编辑发布信息后,单击“发布”。发 - [管理AI Gallery本体](https://support.huaweicloud.com/aimarket-modelarts/ma_gallery_0017.md): 在本体详情页,选择“本体介绍”页签,单击右侧“编辑介绍”。编辑本体基础设置和本体描述。本体介绍的参数说明参数名称说明基础设置中文名称显示本体的名称,不可编辑。许可证本体遵循的使用许可协议,根据业务需求选择合适的许可证类型。语言选择使用本体时支持的输入输出语言。行业领域可以选择本体所属的行业领域。本体描述-资产的README内容,支持添加资 - [托管提示词到AI Gallery](https://support.huaweicloud.com/aimarket-modelarts/ma_gallery_0019.md): AI Gallery上每个资产的文件都会存储在线上的AI Gallery存储库(简称AI Gallery仓库)里面。每一个提示词实例视作一个资产仓库,提示词与资产仓库之间是一一对应的关系。例如,提示词名称为“Test”,则AI Gallery仓库有个名为“Test”的仓库,其中只存放Test提示词实例的全部文件。支持本地文件托管至AI G - [发布提示词到AI Gallery](https://support.huaweicloud.com/aimarket-modelarts/ma_gallery_0020.md): 除了Gallery提供的已有资产外,还可以将个人创建的资产发布至Gallery货架上,供其他AI开发者使用,实现资产共享。登录AI Gallery,选择右上角“我的工作台”。在左侧“我的资产 > 提示词”下,选择未发布的提示词,单击提示词名称,进入提示词详情页。在提示词详情页,单击左侧“发布”,在发布提示词页面编辑发布信息后,单击“发布” - [管理AI Gallery提示词](https://support.huaweicloud.com/aimarket-modelarts/ma_gallery_0021.md): 在提示词详情页,选择“提示词介绍”页签,单击右侧“编辑介绍”。编辑提示词基础设置和提示词描述。提示词介绍的参数说明参数名称说明基础设置中文名称显示提示词的名称,不可编辑。许可证提示词遵循的使用许可协议,根据业务需求选择合适的许可证类型。语言选择使用提示词时支持的输入输出语言。行业领域可以选择提示词所属的行业领域。提示词描述-资产的READ - [托管工具到AI Gallery](https://support.huaweicloud.com/aimarket-modelarts/ma_gallery_0024.md): AI Gallery上每个资产的文件都会存储在线上的AI Gallery存储库(简称AI Gallery仓库)里面。每一个工具实例视作一个资产仓库,工具与资产仓库之间是一一对应的关系。例如,工具名称为“Test”,则AI Gallery仓库有个名为“Test”的仓库,其中只存放Test工具实例的全部文件。支持本地文件托管至AI Galle - [发布工具到AI Gallery](https://support.huaweicloud.com/aimarket-modelarts/ma_gallery_0025.md): 除了Gallery提供的已有资产外,还可以将个人创建的资产发布至Gallery货架上,供其他AI开发者使用,实现资产共享。登录AI Gallery,选择右上角“我的工作台”。在左侧“我的资产 > 工具”下,选择未发布的工具,单击工具名称,进入工具详情页。在工具详情页,单击左侧“发布”,在发布工具页面编辑发布信息后,单击“发布”。发布工具的 - [管理AI Gallery工具](https://support.huaweicloud.com/aimarket-modelarts/ma_gallery_0026.md): 在工具详情页,选择“工具介绍”页签,单击右侧“编辑介绍”。编辑工具基础设置和工具描述。工具介绍的参数说明参数名称说明基础设置中文名称显示工具的名称,不可编辑。许可证工具遵循的使用许可协议,根据业务需求选择合适的许可证类型。语言选择使用工具时支持的输入输出语言。行业领域可以选择工具所属的行业领域。工具描述-资产的README内容,支持添加资 - [发布和管理AI Gallery项目](https://support.huaweicloud.com/aimarket-modelarts/ma_gallery_0023.md): 在AI Gallery中,您可以将个人开发的Notebook代码免费分享给他人使用。在ModelArts的Notebook或者CodeLab中已创建好ipynb文件,开发指导可参见开发工具。登录ModelArts管理控制台,选择开发环境 > Notebook。打开运行中的Notebook实例进入JupyterLab页面,在待分享的ipyn - [托管镜像到AI Gallery](https://support.huaweicloud.com/aimarket-modelarts/ma_gallery_0070.md): 登录AI Gallery,单击右上角我的工作台进入我的工作台页面。单击左上方创建资产,选择镜像后进行参数配置。创建镜像参数名称说明英文名称必填项,镜像的英文名称。如果没有填写中文名称,则资产发布后,在镜像页签上会显示该英文名称。中文名称镜像的中文名称。如果填写了中文名称,则资产发布后,在镜像页签上会显示该中文名称。描述填写资产简介,镜像发 - [发布镜像到AI Gallery](https://support.huaweicloud.com/aimarket-modelarts/ma_gallery_0067.md): 除了Gallery提供的已有资产外,还可以将个人创建的资产发布至Gallery货架上,供其他AI开发者使用,实现资产共享。登录AI Gallery,选择右上角“我的工作台”。在“我的资产 > 镜像”下,选择未发布的镜像,单击镜像名称,进入镜像详情页。在镜像详情页,单击左侧“发布”,在发布镜像页面编辑发布信息后,单击“发布”。发布镜像的参数 - [管理AI Gallery镜像](https://support.huaweicloud.com/aimarket-modelarts/ma_gallery_0068.md): 资产发布上架后,准确、完整的资产介绍有助于提升资产的排序位置和访问量,能更好的支撑用户使用该资产。在镜像详情页,选择“镜像介绍”页签,单击右侧“编辑介绍”。编辑镜像基础设置和镜像描述。镜像介绍的参数说明参数名称说明基础设置中文名称显示镜像的名称,不可编辑。README.md-资产的README内容,支持添加资产的简介、使用场景、使用方法等 - [计算规格说明](https://support.huaweicloud.com/aimarket-modelarts/ma_gallery_0031.md): AI Gallery提供了多种计算规格供用户按需选用。只要用户的账号费用充足,就可以持续使用资源,详细计费说明请参见计费说明。AI Gallery的计费规则如表1所示。 - [AI Gallery简介](https://support.huaweicloud.com/aimarket-modelarts/modelarts_18_0001.md): AI Gallery算法、镜像、模型、Workflow等AI数字资产的共享,为高校科研机构、AI应用开发商、解决方案集成商、企业级/个人开发者等群体,提供安全、开放的共享及交易环节,加速AI资产的开发与落地,保障AI开发生态链上各参与方高效地实现各自的商业价值。AI Gallery中,资产集市支持Notebook代码样例、数据集、算法、镜 - [免费资产和商用资产](https://support.huaweicloud.com/aimarket-modelarts/modelarts_18_0050.md): AI Gallery既有免费分享的AI资产,也有商业售卖的AI资产。免费资产无需支付费用,只需要支付在使用过程中消耗的硬件资源,硬件资源费用将根据实际使用情况由华为云ModelArts等管理控制台向使用方收取。当前支持免费分享和订阅的资产类型有:Notebook代码样例、数据集、算法、模型、镜像。当前支持免费分享和订阅的资产类型有:Not - [入驻AI Gallery](https://support.huaweicloud.com/aimarket-modelarts/modelarts_18_0002.md): 如果需要在AI Gallery中发布HiLens、报名实践活动或发布AI说,则需要先完成入驻AI Gallery。如果没有入驻过AI Gallery,在报名实践活动或发布AI说时,将跳转至欢迎入驻AI Gallery页面。在欢迎入驻AI Gallery页面,填写昵称和邮箱,并根据提示获取验证码。阅读并同意《华为云AI Gallery数字内 - [我的Gallery介绍](https://support.huaweicloud.com/aimarket-modelarts/modelarts_18_0053.md): “我的Gallery”可以查看各类AI资产的发布订阅情况和个人资料等。在AI Gallery页面中,单击右上角我的Gallery我的主页进入个人中心页面。 - [查找和收藏资产](https://support.huaweicloud.com/aimarket-modelarts/modelarts_18_0060.md): AI Gallery共享了算法、Notebook代码样例、数据集、镜像、模型、Workflow等多种AI资产,为了方便快速搜索相关资产,提供了多种快速搜索方式以及收藏功能,提升资产的查找效率。在各类资产模块页面,通过如下几种搜索方式可以提高资产的查找效率,快速找到适合的算法、模型、数据集、镜像、Workflow等资产。当搜索到感兴趣的免费 - [订阅免费算法](https://support.huaweicloud.com/aimarket-modelarts/modelarts_18_0004.md): 在AI Gallery中,您可以查找并订阅免费满足业务需要的算法,直接用于创建训练作业。AI Gallery中分享的算法支持免费订阅,但在使用过程中如果消耗了硬件资源进行部署,管理控制台将根据实际使用情况收取硬件资源的费用。注册并登录华为云,且创建好OBS桶用于存储数据和模型。登录AI Gallery。选择资产集市 > 算法,进入算法页面 - [订阅免费模型](https://support.huaweicloud.com/aimarket-modelarts/modelarts_18_0055.md): 在AI Gallery中,您可以查找并订阅免费的模型,包括ModelArts模型和HiLens技能。订阅成功的模型可以直接用于ModelArts模型部署和HiLens技能安装。AI Gallery中分享的模型支持免费订阅,但在使用过程中如果消耗了硬件资源进行部署,管理控制台将根据实际使用情况收取硬件资源的费用。注册并登录华为云,且创建好O - [下载数据](https://support.huaweicloud.com/aimarket-modelarts/modelarts_18_0005.md): 在AI Gallery中,您可以下载满足业务需要的数据集。注册并登录华为云,且创建好OBS桶用于存储数据。登录“AI Gallery”。选择资产集市 > 数据集,进入数据页面,该页面展示了所有共享的数据集。搜索业务所需的数据集,请参见查找和收藏资产。单击目标数据集进入详情页面。在详情页面可以查看数据集的描述、预览、限制、版本和评论等信息。 - [使用Notebook代码样例](https://support.huaweicloud.com/aimarket-modelarts/modelarts_18_0054.md): 在AI Gallery中,您可以查找并直接打开使用Notebook实例。注册并登录华为云,详细操作请参见准备工作。登录“AI Gallery”。选择资产集市 > Notebook,进入Notebook页面,该页面展示了所有共享的Notebook实例。搜索业务所需的Notebook实例,请参见查找和收藏资产。单击目标Notebook实例进入 - [使用镜像](https://support.huaweicloud.com/aimarket-modelarts/modelarts_18_0082.md): 在AI Gallery中,您可以查找共享的镜像并用于AI开发。登录“AI Gallery”。选择资产集市 > 镜像,进入镜像页面,该页面展示了所有共享的镜像。搜索业务所需的镜像,请参见查找和收藏资产。单击目标镜像进入详情页面。在详情页面您可以查看镜像的AI引擎框架、使用芯片、镜像URL、包含的依赖项等信息。在详情页面您可以查看镜像的AI引 - [使用AI案例](https://support.huaweicloud.com/aimarket-modelarts/modelarts_18_0061.md): 在AI Gallery中,您可以根据您的业务场景和诉求,查找并订阅相应的场景化AI案例。订阅后可以一键运行案例。AI Gallery中分享的案例支持免费订阅,但在使用过程中如果消耗了硬件资源进行部署,管理控制台将根据实际使用情况收取硬件资源的费用。注册并登录华为云,且创建好OBS桶用于存储数据和模型。登录“AI Gallery”。选择案例 - [订阅Workflow](https://support.huaweicloud.com/aimarket-modelarts/modelarts_18_0063.md): 在AI Gallery中,您可以查找并订阅免费的Workflow。订阅成功的Workflow通过AI Gallery导入后可以直接在ModelArts控制台使用。AI Gallery中分享的Workflow支持免费订阅,但在使用过程中如果消耗了硬件资源进行部署,管理控制台将根据实际使用情况收取硬件资源的费用。注册并登录华为云,且创建好OB - [发布免费算法](https://support.huaweicloud.com/aimarket-modelarts/modelarts_18_0007.md): 在AI Gallery中,您可以将个人开发的算法免费分享给他人使用。在ModelArts的算法管理中已准备好待发布的算法。创建算法的相关操作请参见创建算法。创建算法时,算法代码存储的OBS桶内不能存在文件和文件夹重名的情况,这样算法可能会发布失败。如果算法发布成功,则代码开放会失败。创建算法时,算法代码存储的OBS桶内不能存在文件和文件夹 - [发布免费模型](https://support.huaweicloud.com/aimarket-modelarts/modelarts_18_0056.md): 在AI Gallery中,您可以个人开发的模型免费分享给他人使用,包括ModelArts模型和HiLens技能。如果是发布ModelArts模型,已经在ModelArts的AI应用管理中准备好待发布的模型。在AI应用管理界面创建模型的相关操作请参见创建模型不同方式的场景介绍。使用容器镜像导入的模型和其他训练产生的模型都支持发布至AI Ga - [发布数据](https://support.huaweicloud.com/aimarket-modelarts/modelarts_18_0008.md): 在AI Gallery中,您可以将个人数据集分享给他人使用。ModelArts数据管理模块在重构升级中,对未使用过数据管理的用户不可见。建议新用户选择发布OBS或本地的数据集。本地或对象存储服务(OBS)中已准备好待发布的数据集,或ModelArts的数据集列表存在待发布的数据集。进入AI Gallery首页,选择“资产集市 > 数据集” - [报名实践活动(实践)](https://support.huaweicloud.com/aimarket-modelarts/modelarts_18_0058.md): 在AI Gallery中,可以报名参加正在进行中的实践活动。进入AI Gallery首页,单击“实践”,在下拉框中单击“实践 >”,进入实践首页。在实践页面,有“进行中”、“即将开始”和“已结束”三种状态的实践活动筛选方式。查找实践活动单击右上方的“我的实践”可以跳转到个人中心(“我的Gallery > 我的实践”),查看个人已参加的实践 - [发布技术文章(AI说)](https://support.huaweicloud.com/aimarket-modelarts/modelarts_18_0059.md): AI Gallery中的AI说,是一个AI开发人员的交流园地。在这里可以阅读其他用户分享的技术文章,并参与评论。也可以发布分享个人技术文章。已入驻AI Gallery。进入AI Gallery首页,单击AI说,在下拉框中单击“AI说 >”,进入AI说首页。在AI说页面,单击右侧“说一说”进入发布页面。在AI说发布页面,填写相关信息。发布技 - [注册伙伴](https://support.huaweicloud.com/aimarket-modelarts/modelarts_18_0066.md): 仅当暂未注册伙伴的用户可以注册伙伴。在AI Gallery页面中,单击右上角我的Gallery我的主页进入个人中心页面。左侧菜单栏选择“解决方案”进入解决方案列表页,单击右上方“发布”进入合作伙伴申请页面。如果已经是伙伴用户,则会进入发布解决方案页面。如果已经是伙伴用户,则会进入发布解决方案页面。根据界面提示,填写注册成为合作伙伴需要提供 - [发布解决方案](https://support.huaweicloud.com/aimarket-modelarts/modelarts_18_0067.md): 如果你已经注册成为了AI Gallery平台上的合作伙伴,AI Gallery支持发布共享你的解决方案。在AI Gallery页面中,单击右上角我的Gallery我的主页进入个人中心页面。左侧菜单栏选择“解决方案”进入解决方案列表页,单击右上方的“发布”,进入发布解决方案页面。根据界面提示填写解决方案的相关信息,单击下方的“提交”。在解决 - [发布需求](https://support.huaweicloud.com/aimarket-modelarts/modelarts_18_0070.md): 如果你已经注册成为了AI Gallery平台上的合作伙伴,你可以在AI Gallery上发布你的需求。在AI Gallery页面中,单击右上角我的Gallery我的主页进入个人中心页面。左侧菜单栏选择“我的需求”进入我的需求列表页,单击右上方的“发布”,进入发布需求页面。填入需求的相关信息。单击“提交”,AI Gallery的运营人员将会 ## 更多文档 - [ModelArts使用流程](https://support.huaweicloud.com/usermanual-standard-modelarts/umn-standard-modelarts-0001.md): 本章节旨在帮助您了解ModelArts的基本使用方法,帮助您快速上手ModelArts服务。面向熟悉代码编写和调测,熟悉常见AI引擎的开发者,ModelArts不仅提供了在线代码开发环境,还提供了从数据准备、模型训练、模型管理到模型部署上线的端到端开发流程(即AI全流程开发)。本文档介绍了如何在ModelArts管理控制台完成AI开发,如 - [快速配置ModelArts委托授权](https://support.huaweicloud.com/usermanual-standard-modelarts/umn-standard-modelarts-0003.md): 为了完成AI计算的各种操作,AI平台ModelArts在任务执行过程中需要访问用户的其他服务,典型的就是训练过程中,需要访问OBS读取用户的训练数据。在这个过程中,就出现了ModelArts服务“代表”用户去访问其他云服务的情形。从安全角度出发,ModelArts服务代表用户访问任何云服务之前,均需要先获得用户的委托,而这个动作就是一个用 - [创建IAM用户并授权使用ModelArts](https://support.huaweicloud.com/usermanual-standard-modelarts/umn-standard-modelarts-0004.md): 快速配置ModelArts委托授权章节中介绍的一键式自动授权方式创建的委托的权限比较大,基本覆盖了依赖服务的全部权限。如果华为云账号已经能满足您的要求,不需要创建独立的IAM用户,您可以跳过本章节,不影响您使用ModelArts服务的其他功能。ModelArts作为一个完备的AI开发平台,支持用户对其进行细粒度的权限配置,以达到精细化资源 - [创建并管理工作空间](https://support.huaweicloud.com/usermanual-standard-modelarts/umn-standard-modelarts-0005.md): ModelArts的工作空间是为企业客户提供的高阶功能,用于将资源划分为多个逻辑隔离的空间,并支持以空间维度进行访问权限的限定。开通工作空间后,系统会默认创建一个“default”空间,用户之前创建的所有资源均在此空间下。用户可以创建多个工作空间,每个新工作空间相当于一个独立的“ModelArts分身”,不同工作空间之间互不影响,便于管理 - [如何创建OBS桶用于ModelArts存储数据?](https://support.huaweicloud.com/usermanual-standard-modelarts/modelarts_08_0003.md): 由于ModelArts本身没有数据存储的功能,ModelArts使用对象存储服务(Object Storage Service,简称OBS)进行数据存储以及模型的备份和快照,实现安全、高可靠和低成本的存储需求。AI开发过程中的输入数据、输出数据、中间缓存数据都可以在OBS桶中进行存储、读取。因此,建议您在使用ModelArts之前先创建一 - [专属资源池功能介绍](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0003.md): 资源池是一种集中管理和分配计算(CPU、内存)、存储(硬盘空间)、网络(带宽、IP地址)等资源的机制,实现资源的高效利用、灵活分配和动态管理。ModelArts专属资源池提供了在使用ModelArts进行AI开发(包括创建Workflow工作流、创建Notebook实例、创建训练作业和创建推理服务)所需的计算资源。您可根据业务所需购买使用 - [不同机型对应的软件配套版本](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0085.md): 弹性集群资源池支持选择弹性裸金属或弹性云服务器作为节点资源。由于不同机型节点的操作系统和适用的CCE集群版本等存在差异,为方便您进行镜像制作、软件升级等操作,本文将详细介绍各机型对应的软件配套版本。 - [创建专属资源池](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0004.md): 在AI开发过程中,由于业务需求的多样化和资源使用的复杂性,为满足特定业务对资源确定性、安全性、高效性的严格要求,创建专属资源池成为必要举措。专属资源池是一种为特定用户、业务或项目专门划分和预留的资源集合,这些资源在物理或逻辑上与其他资源隔离开来,以确保特定需求能够得到满足。ModelArts专属资源池提供了在使用ModelArts进行AI - [查看专属资源池列表和详情](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0005.md): 本章节旨在帮助用户查看资源池列表及详情,涵盖列表页与详情页的核心内容及基础操作。详情页通过控制台页面的页签分类呈现功能模块,包括概览(展示基本信息与作业列表)、资源队列、节点、节点池、预热任务、事件、监控及插件等八大模块。用户可通过单击对应页签切换视图,实现对资源池配置状态、运行数据及扩展功能的集中管理。这种结构化设计有效解决了资源信息分 - [扩缩容专属资源池](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0006.md): 当专属资源池创建完成,使用一段时间后,由于用户AI开发业务的变化,对于资源池资源量的需求可能会产生变化,面对这种场景,ModelArts专属资源池提供了扩缩容功能,用户可以根据自己的需求动态调整资源池规模。对已有规格实例数扩缩容,即增加或减少资源池已有规格的实例数量,增加实例数即扩容,减少实例数即缩容。扩缩容规格实例数适用于调整资源池的整 - [升级专属资源池驱动](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0009.md): 当专属资源池中的节点含有GPU/NPU资源时,资源池节点性能如果无法满足现有业务,升级驱动可以修复已知问题、提升性能或者支持新功能,确保资源池性能和兼容性得到优化。ModelArts提供升级专属资源池GPU/NPU驱动的功能,您可根据自身业务需要通过ModelArts控制台升级专属资源池内节点池的GPU/NPU驱动。驱动升级有两种升级方式 - [管理专属资源池节点](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0059.md): 专属资源池支持对故障节点进行修复操作,目前提供了热备节点、重置节点和重启节点等方式。华为云技术支持在故障定位和性能诊断时,部分运维操作需要用户授权才可进行,本章节同时也介绍了如何进行授权操作。视频介绍功能介绍热备节点作为专属资源池内的备用节点,能够在普通节点故障时自动进行切换,可以提升资源池整体的可用性和容错能力,有效避免单个节点故障造成 - [事件中心页面授权运维](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0007.md): 华为云会对节点的软硬件设备进行故障检测和日常运维,当节点由于不可恢复故障需要进行硬件维护时,会推送计划事件到控制台的事件中心。您可以在事件中心,查看具体的事件信息、事件类型、事件状态、事件描述等信息,可以授权华为技术支持对故障节点进行运维或重部署节点。系统维护: 系统维护操作要对主机下电维修,需要运维人员在机房实际重新插拔设备或更换备机, - [修改专属资源池支持的作业类型](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0008.md): ModelArts含有许多“作业”类型(作业为统称,并非单指训练作业),其中有一部分是可以运行在专属资源池上的,包括“训练”、“推理”服务及“开发环境”。专属资源池提供了动态设置作业类型的功能,您可以在创建资源池时、创建完成后,对资源池支持的作业类型进行编辑(新增或减少)。当前支持的“作业类型”有“训练作业”、“开发环境”、“模型部署”和 - [迁移专属资源池和网络至其他工作空间](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0045.md): 专属资源池的工作空间关联了企业项目,企业项目涉及到账单归集。为隔离不同子用户操作资源的权限,ModelArts提供了工作空间功能,管理员可以根据工作空间,隔离不同子用户操作工作空间内资源的权限。ModelArts提供迁移资源池和网络的功能,可以将资源池和网络迁移到新的目标空间,迁移完成后,资源池将与目标工作空间关联,您可以在目标工作空间中 - [配置专属资源池可访问公网](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0012.md): 当您使用专属资源池创建作业时(如训练作业),如果作业运行过程中需要专属资源池访问外网,首先专属资源池通过打通VPC的方式,使得专属资源池和已绑定EIP的弹性云服务器实现网络对等连接;然后对已绑定EIP的弹性云服务器配置公网NAT网关,实现公网访问;通过这种方式专属资源池不用另外配置公网NAT网关即可访问公网。在配置专属资源池公网的过程中, - [关联专属资源池的网络至SWR企业仓](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0084.md): 当前用户在专属资源池中使用SWR企业仓下发训练作业时面临网络连接障碍,由于专属资源池与SWR企业仓之间缺乏自动化的网络打通机制,导致每次作业下发都需要手动配置网络连接,显著增加了操作复杂度。为解决这一问题,ModelArts创新性地提供SWR企业仓关联功能,通过建立专属资源池与SWR企业仓的自动化网络通道,不仅实现了镜像仓库与计算资源的无 - [关联专属资源池的网络至SFS Turbo](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0096.md): 关联SFS Turbo主要是在不需要打通VPC的情况下,可直接在Notebook及训练环境中挂载SFS盘,并访问相应数据。使用SFS Turbo作为数据存储介质,当前在安全隔离上是弱隔离等级,即同一租户内所有用户对同一个SFS Turbo均有相同权限。若您有更高的安全需求,推荐使用OBS桶作为数据存储介质,并为不同OBS桶配置安全策略。使 - [变更专属资源池超节点规格](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0074.md): 当专属资源池创建完成,使用一段时间后,由于用户AI开发业务的变化,对于资源池资源量的需求可能会产生变化,面对这种场景,ModelArts专属资源池提供了针对超节点池变更规格功能,用户可以根据自己的需求动态调整超节点规格。超节点不同规格价格不同,在变更规格后,价格根据目标规格会产生变化,以变更后的目标规格配置价格计费。具体费用可参见Mode - [使用TMS标签实现资源分组管理](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0063.md): ModelArts支持对接标签管理服务(Tag Management Service,简称TMS),在ModelArts中创建资源消耗性任务时,可以为这些任务配置标签,通过标签实现资源的多维分组管理。ModelArts支持配置标签的任务有:创建训练作业、创建Notebook、创建推理在线服务、创建ModelArts专属资源池、创建轻量算力 - [管理专属资源池的资源队列](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0079.md): 在ModelArts专属资源池管理场景中,用户需要通过拆分资源队列实现资源的精细化分配,但传统手动调整资源配额的方式存在操作繁琐、资源利用率低等问题。为此,ModelArts提供资源队列管理功能,支持用户在资源池详情页的"资源队列"页签中,通过"创建资源队列"按钮建立多个队列,并为每个队列配置保障配额(最低资源保障)和配额上限(最大资源限 - [管理专属资源池的节点池](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0080.md): 在专属资源池节点管理场景中,用户面临节点配置分散、批量操作困难等管理挑战。为解决这一问题,ModelArts创新性地引入节点池管理机制,通过将单个或多个节点纳入统一节点池,实现批量配置、驱动升级等集中化管理。用户可通过本章节完成节点池的创建、配置修改、状态查看及删除操作,系统支持在节点池维度进行资源调度和版本控制,显著提升节点管理效率并降 - [在专属资源池添加模型预热](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0081.md): 在专属资源池部署模型服务时,用户常面临服务初始化耗时过长的挑战。当首次部署或服务重启时,系统需从对象存储加载权重文件至本地环境,该过程可能因网络带宽限制或文件体积过大导致显著延迟。如何有效缩短这一初始化阶段的等待时间,成为提升用户体验的关键问题。针对此场景,ModelArts专属资源池创新性地提供模型预热功能作为解决方案:用户可通过控制台 - [删除/退订专属资源池和网络](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0010.md): 业务结束,资源长期闲置等情况下,如果资源池内无正在运行的任务且已完成数据备份和迁移,可删除专属资源池和网络,释放资源。在删除资源池前,请确保所有重要数据已备份,避免因误操作导致数据丢失。如果资源池中存在正在运行的任务或作业,建议先停止或迁移这些任务,再进行释放操作。当AI业务开发不再需要使用专属资源池时,您可以删除/退订专属资源池,释放资 - [专属资源池插件概述](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0065.md): 在资源池功能扩展场景中,用户面临业务需求多样化与资源池基础功能的适配性矛盾。为解决这一问题,ModelArts构建了插件化扩展体系,通过提供多种类型插件实现功能按需加载。系统采用智能安装策略,部分插件根据业务场景自动预装,其余插件支持手动安装,用户可通过插件广场搜索并查看插件详情。在资源池详情页的插件管理模块,用户可实时查看已安装插件列表 - [节点故障检测(ModelArts Node Agent)](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0068.md): ModelArts节点故障检测是一款监控集群节点异常事件的插件,以及对接第三方监控平台功能的组件。每个k8s的资源池默认都会安装,它是一个在每个节点上运行的守护程序,可从不同的守护进程中搜集节点问题。创建专属资源池时自动安装。当前不支持用户自助升级。 - [指标监控插件(ModelArts Metric Collector)](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0078.md): 指标监控插件(Metrics Collector)是默认内置插件,以节点守护程序运行,可采集节点及各类作业监控指标,并上报到AOM。指标列表请见在AOM控制台查看ModelArts所有监控指标。创建资源池时自动安装。不支持卸载。存量资源池,需要将节点故障检测(ModelArts Node Agent)插件版本升级到最新版本,自动安装该插件 - [AI套件(NV GPU)](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0069.md): AI套件(NV GPU)插件是用于支持在容器中管理GPU设备的插件,当集群中使用GPU节点时,必须安装此插件。创建专属资源池时,仅实例规格类型选择“GPU”时自动安装。对节点池的GPU驱动升级前,请您先将 AI 套件 - GPU 版本升级至1.2.24及以上。插件升级完成前,请勿进行GPU驱动升级,否则可能会导致驱动升级卡住或者失败。插件 - [AI套件(ModelArts Device Plugin)](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0070.md): AI套件(ModelArts Device Plugin)是支持容器里使用ModelArts Device Plugin设备的管理插件。创建专属资源池时,仅实例规格类型选择“NPU”时自动安装。创建Notebook、创建训练作业、部署在线服务、部署批量服务时,升级ModelArts Device Plugin插件会影响作业调度,请谨慎执行 - [Volcano调度器(Volcano Scheduler)](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0071.md): Volcano 是一个基于 Kubernetes 的批处理平台,提供了机器学习、深度学习、生物信息学、基因组学及其他大数据应用所需要而 Kubernetes 当下缺失的一系列特性。Volcano提供了高性能任务调度引擎、高性能异构芯片管理、高性能任务运行管理等通用计算能力,通过接入AI、大数据、基因、渲染等诸多行业计算框架服务终端用户,最 - [节点本地域名解析加速(NodeLocal DNSCache)](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0072.md): 节点本地域名解析加速(NodeLocal DNSCache)是基于社区NodeLocal DNSCache提供的插件,通过在集群节点上作为守护程序集运行DNS缓存代理,提高集群DNS性能。启用NodeLocal DNSCache之后,DNS查询所遵循的路径如下图所示。其中解析线路说明如下:①:已注入DNS本地缓存的Pod,默认会通过Nod - [云原生日志采集插件](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0073.md): 云原生日志采集插件(原名log-agent)是基于开源fluent-bit和opentelemetry构建的云原生日志、K8s事件采集插件。log-agent插件支持将集群中训练、推理实例的容器标准输出日志采集到lts中。日志系统的核心功能在于记录业务组件的全生命周期状态数据(包括启动初始化、退出、运行时信息及异常事件等),主要服务于组件 - [云原生监控插件(kube-prometheus-stack)](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0075.md): 云原生监控插件(原名kube-prometheus-stack)通过使用Prometheus-operator和Prometheus,提供简单易用的端到端Kubernetes集群监控能力。使用云原生监控插件可将监控数据与监控中心对接,在监控中心控制台查看监控数据,配置告警等。开源社区地址:https://github.com/promet - [KubeInfer(ModelArts Infers Operator)](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0083.md): 在AI应用开发与部署过程中,用户经常需要在创建专属资源池时集成特定的插件以支持模型推理等关键功能。然而,传统的插件安装方式往往需要手动配置,不仅耗时费力,还容易出错,影响AI应用的快速上线。为了提升用户体验,华为云ModelArts平台在创建专属资源池,选择新版推理作业时,支持KubeInfer(ModelArts Infers Oper - [ModelArts LWS](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0087.md): ModelArts LWS(LeaderWorkerSet)是一款开源大模型推理模型部署插件。它将一组Pod作为一个整体进行部署,可用于承载分布式推理任务,提供灵活的升级和恢复策略。升级过程中将短暂影响业务创建功能 (预计恢复极快),请尽量避开业务高峰期操作。创建专属资源池作业类型选择模型部署时,自动安装该插件。 - [ModelArts HRA](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0094.md): HRA 是一款基于 xPyD 框架构建的高效弹性部署方案。它通过对 P 与 D 组件进行解耦并支持独立伸缩,能够精准匹配不同模块的负载需求,显著提升集群的资源利用率与整体调度效率。在资源池中安装指定插件。登录ModelArts管理控制台,在左侧菜单栏中选择“资源管理 > 专属算力资源 > 资源池”。单击资源池名称,进入资源池详情页。在资源 - [Everest](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0095.md): CSI(Container Storage Interface)是Kubernetes社区推荐的存储插件标准,用于实现容器编排平台与各类存储系统的统一对接。基于CSI标准,CCE提供自研的存储插件,即CCE容器存储(Everest)插件。该插件可无缝对接多种IaaS存储服务,包括云硬盘(块存储)、文件存储、对象存储和极速文件存储等,为容器 - [ModelArts Infers Proxy](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0097.md): ModelArts Infers Proxy 是大模型推理场景下的高阶负载均衡组件,作为请求调度的核心模块,为推理服务提供请求转发、服务发现、负载均衡、流控等能力。Proxy 是集群级别的插件,多推理服务共享。插件安装时会根据集群节点数自动选择合适的规格,当资源池规模较大时,默认副本数和配置可能存在瓶颈,支持用户自助配置副本数和资源规格。 - [ModelArts资源监控概述](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0032.md): 为了满足用户对资源使用的监控诉求,ModelArts提供了多种监控查看方式。方式一:通过ModelArts控制台查看您在可通过ModelArts控制台的总览页或各模块资源监控页签查看监控指标。具体涉及以下几个方面:通过ModelArts控制台的总览页查看,具体请参见通过ModelArts控制台查看监控指标。训练作业:用户在运行训练作业时, - [在ModelArts控制台查看监控指标](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0060.md): 本章节中提到的总览页是基于旧版控制台的总览页。控制台界面为旧版样式。在总览页查看全部事件时,如果顶部事件总数和底部的“总条数”数量不一致,请刷新重试。在ModelArts控制台的总览页,支持查看生产概况(即总体作业运行数量)、资源占用情况、训练作业资源利用情况。您可以单击生产概况的链接、资源池名称、训练作业,跳转到对应界面查看更多详情。训 - [在AOM控制台查看ModelArts所有监控指标](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0033.md): 在资源池监控管理场景中,用户需要实时掌握计算资源(GPU、NPU、CPU、Memory等)及开发环境、训练作业、推理服务的资源消耗情况。传统手动监控方式存在数据分散、时效性差等问题。ModelArts通过构建自动化监控体系,定期采集资源池中各节点及作业的关键资源使用数据,并将这些数据统一上报至AOM监控平台,用户无需切换系统即可在AOM控 - [操作流程](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0042.md): Grafana支持灵活而又复杂多样的监控视图和模板,可以满足绝大部分情况下用户的诉求。将Grafana的数据源配置完成后,就可以通过Grafana查看AOM保存的所有ModelArts的所有指标。通过Grafana插件查看AOM中的监控指标的操作流程如下:安装配置Grafana安装配置Grafana有在Windows上安装配置Grafan - [在Windows上安装配置Grafana](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0036.md): 本章节适用于在Windows操作系统的PC中安装配置Grafana。下载Grafana安装包。进入下载链接,单击Download the installer,等待下载成功即可。进入下载链接,单击Download the installer,等待下载成功即可。安装Grafana。双击安装包,按照指示流程安装完成即可。双击安装包,按照指示流程 - [在Linux上安装配置Grafana](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0037.md): 本章节适用于在Linux操作系统的PC中安装配置Grafana。一台可访问外网的Ubuntu服务器。如果没有请具备以下条件:准备一台ECS服务器(建议规格选8U或者以上,镜像选择Ubuntu,建议选择22.04版本,本地存储100G),具体操作请参考《购买弹性云服务器》。购买弹性公网IP,并绑定到购买的弹性云服务器ECS上,具体操作请参见 - [在Notebook上安装配置Grafana](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0038.md): 本章节适用于在ModelArts的Notebook中安装配置Grafana。已创建CPU或GPU类型的Notebook实例,并处于运行中。打开Terminal。在Terminal中依次执行以下命令,下载并安装Grafana。mkdir -p /home/ma-user/work/grfcd /home/ma-user/work/grfwg - [配置Grafana数据源](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0039.md): 在Grafana配置数据源后,即可通过Grafana查看ModelArts的监控数据。已安装Grafana。获取Grafana数据源配置代码。进入AOM管理控制台。AOM管理控制台在左侧导航栏中选择“Prometheus监控 > 实例列表”,在实例列表中单击“Prometheus_AOM_Default”实例。Prometheus_AOM - [配置仪表盘查看指标数据](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0040.md): Grafana中可以自定义配置各种视图的仪表盘,ModelArts也提供了针对集群的配置模板。本章节通过使用ModelArts提供的模板查看指标和创建Dashboards查看指标的方式,说明如何进行仪表盘配置。Grafana的更多使用请参考Grafana官方文档。ModelArts提供了集群视图、节点视图、用户视图、任务视图和任务详细视图 - [ModelArts支持的事件监控的事件说明](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0043.md): 事件监控提供了故障节点的计划事件类型数据上报、查询和告警的功能。方便您将业务中的各类重要事件或对云资源的操作事件收集到云监控服务,并在事件发生时进行告警,授权华为技术支持对故障节点进行运维。事件收集到云监控服务后,用户可以切换到CES服务界面查看事件监控数据。本节定义了ModelArts的昇腾服务器支持计划事件监控的事件说明。当前支持的站 - [使用CTS审计专属资源池和轻量算力集群服务操作](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0091.md): ModelArts专属资源池和轻量算力集群支持对接云审计CTS服务,通过云审计服务,您可以记录与ModelArts专属资源池和轻量算力集群相关的操作事件,便于日后的查询、审计和回溯。云审计服务管理控制台保存最近7天的ModelArts专属资源池和轻量算力集群的操作记录。已开通云审计服务。详细操作请参见《云审计服务用户指南》。登录CTS云审 - [什么是Workflow](https://support.huaweicloud.com/usermanual-standard-modelarts/modelarts_workflow_0269.md): 在介绍Workflow之前,先了解MLOps的概念。MLOps(Machine Learning Operation)是机器学习(Machine Learning)和DevOps(Development and Operations)的组合实践。机器学习开发流程主要可以定义为四个步骤:项目设计、数据工程、模型构建、部署落地。AI开发并不是 - [运行第一条Workflow](https://support.huaweicloud.com/usermanual-standard-modelarts/modelarts_workflow_0272.md): 了解Workflow的功能与构成后,可通过订阅Workflow的方式尝试运行首条工作流,进一步了解Workflow的运行过程。数据集准备。订阅工作流。运行工作流。前往AI Gallery,在“资产集市>数据>数据集”页面下载常见生活垃圾图片。单击下载,选择云服务区域,推荐选择华北-北京四,单击确定。进入“下载详情”页面,填写下述参数。下载 - [查找Workflow工作流](https://support.huaweicloud.com/usermanual-standard-modelarts/modelarts_workflow_0276.md): 在Workflow列表页,您可以通过搜索框,根据工作流的属性类型快速搜索过滤到相应的工作流,可节省您的时间。登录ModelArts管理控制台,在左侧导航栏选择开发空间 > Workflow,进入Workflow总览页面。在工作流列表上方的搜索框中,根据您需要的属性类型,例如名称、状态、当前节点、启动时间、运行时长或标签等,过滤出相应的工作 - [查看Workflow工作流运行记录](https://support.huaweicloud.com/usermanual-standard-modelarts/modelarts_workflow_0285.md): 运行记录是展示某条工作流所有运行状态数据的地方。在Workflow列表页,单击某条工作流的名称,进入该工作流的详情页面。在工作流的详情页,左侧区域即为该条工作流的所有运行记录。查看运行记录您可以对当前工作流的所有运行记录,进行删除、编辑以及重新运行的操作。删除:如果该条运行记录不再需要,您可以单击“删除”,在弹出的确认框中单击“确定”即可 - [管理Workflow工作流](https://support.huaweicloud.com/usermanual-standard-modelarts/modelarts_workflow_0284.md): 登录ModelArts管理控制台,在左侧导航栏选择开发空间>Workflow,进入Workflow总览页面。有以下三种操作方式运行工作流。工作流列表页:单击操作栏的“启动”按钮,出现启动Workflow询问弹窗,单击“确定”。工作流运行页面:单击右上角的“启动”按钮,出现启动Workflow询问弹窗,单击“确定”。工作流参数配置页面:单击 - [重试/停止/运行Workflow节点](https://support.huaweicloud.com/usermanual-standard-modelarts/modelarts_workflow_0287.md): 重试当单个节点运行失败时,用户可以通过重试按钮重新执行当前节点,无需重新启动工作流。在当前节点的运行状况页面,单击“重试”。在重试之前您也可以前往权限管理页面修改配置,节点重试启动后新修改的配置信息可以在当前执行中立即生效。当单个节点运行失败时,用户可以通过重试按钮重新执行当前节点,无需重新启动工作流。在当前节点的运行状况页面,单击“重试 - [开发第一条Workflow](https://support.huaweicloud.com/usermanual-standard-modelarts/modelarts_workflow_0296.md): 本章节提供了一个基于图像分类算法,构建包含训练单节点的Workflow的样例。更多节点的构建参数请参考创建Workflow节点。本案例提供了两种安装开发环境的方法,您可根据使用习惯选择。方法一:使用JupyterLab打开Notebook实例准备环境登录ModelArts管理控制台,进入开发空间>Notebook。单击创建,进入创建页面, - [开发Workflow的核心概念介绍](https://support.huaweicloud.com/usermanual-standard-modelarts/modelarts_workflow_0292.md): Workflow是一个有向无环图(Directed Acyclic Graph,DAG),由节点和节点之间的关系描述组成。节点与节点之间的依赖关系由单箭头的线段来表示,依赖关系决定了节点的执行顺序,示例中的工作流在启动后将从左往右顺序执行。DAG也支持多分支结构,用户可根据实际场景进行灵活设计,在多分支场景下,并行分支的节点支持并行运行, - [配置Workflow参数](https://support.huaweicloud.com/usermanual-standard-modelarts/modelarts_workflow_0353.md): 参数相关的配置使用Placeholder对象来表示,以占位符的形式实现用户数据运行时配置的能力,当前支持的数据类型包括:int、str、bool、float、Enum、dict、list。开发者可根据场景需要,将节点中的相关字段(如算法超参)通过Placeholder的形式透出,支持设置默认值,供用户修改配置使用。int类型参数from - [配置Workflow的输入输出目录](https://support.huaweicloud.com/usermanual-standard-modelarts/modelarts_workflow_0357.md): 统一存储主要用于工作流的目录管理,帮助用户统一管理一个工作流中的所有存储路径,主要分为以下两个功能:输入目录管理:开发者在编辑开发工作流时可以对所有数据的存储路径做统一管理,规定用户按照自己的目录规划来存放数据,而存储的根目录可以根据用户自己的需求自行配置。该方式只做目录的编排,不会自动创建新的目录。输出目录管理:开发者在编辑开发工作流时 - [创建Workflow数据集节点](https://support.huaweicloud.com/usermanual-standard-modelarts/modelarts_workflow_0364.md): 通过对ModelArts数据集能力进行封装,实现新版数据集的创建功能。主要用于通过创建数据集对已有数据(已标注/未标注)进行统一管理的场景,后续常见数据集导入节点或者数据集标注节点。您可以使用CreateDatasetStep来构建数据集创建节点,CreateDatasetStep及相关对象结构如下。主要包含两种场景的用例。基于未标注数据 - [创建Workflow数据集标注节点](https://support.huaweicloud.com/usermanual-standard-modelarts/modelarts_workflow_0368.md): 通过对ModelArts数据集能力进行封装,实现数据集的标注功能。数据集标注节点主要用于创建标注任务或对已有的标注任务进行卡点标注,主要用于需要对数据进行人工标注的场景。您可以使用LabelingStep来构建数据集标注节点,LabelingStep结构如下:主要包含三种场景的用例:场景一:基于用户指定的数据集创建标注任务,并等待用户标注 - [创建Workflow数据集导入节点](https://support.huaweicloud.com/usermanual-standard-modelarts/modelarts_workflow_0372.md): 通过对ModelArts数据集能力进行封装,实现数据集的数据导入功能。数据集导入节点主要用于将指定路径下的数据导入到数据集或者标注任务中,主要应用场景如下:适用于数据不断迭代的场景,可以将一些新增的原始数据或者已标注数据导入到标注任务中,并通过后续的数据集标注节点进行标注。对于一些已标注好的原始数据,可以直接导入到数据集或者标注任务中,并 - [创建Workflow数据集版本发布节点](https://support.huaweicloud.com/usermanual-standard-modelarts/modelarts_workflow_0376.md): 通过对ModelArts数据集能力进行封装,实现数据集的版本自动发布的功能。数据集版本发布节点主要用于将已存在的数据集或者标注任务进行版本发布,每个版本相当于数据的一个快照,可用于后续的数据溯源。主要应用场景如下:对于数据标注这种操作,可以在标注完成后自动帮助用户发布新的数据集版本,结合as_input的能力提供给后续节点使用。当模型训练 - [创建Workflow训练作业节点](https://support.huaweicloud.com/usermanual-standard-modelarts/modelarts_workflow_0380.md): 该节点通过对算法、输入、输出的定义,实现ModelArts作业管理的能力。主要用于数据处理、模型训练、模型评估等场景。主要应用场景如下:当需要对图像进行增强,对语音进行除噪等操作时,可以使用该节点进行数据的预处理。对于一些物体检测,图像分类等模型场景,可以根据已有的数据使用该节点进行模型的训练。您可以使用JobStep来构建作业类型节点, - [创建Workflow模型注册节点](https://support.huaweicloud.com/usermanual-standard-modelarts/modelarts_workflow_0385.md): 通过对ModelArts模型管理的能力进行封装,实现将训练后的结果注册到模型管理中,便于后续服务部署、更新等步骤的执行。主要应用场景如下:注册ModelArts训练作业中训练完成的模型。注册自定义镜像中的模型。您可以使用ModelStep来构建模型注册节点,ModelStep结构如下:主要包含六种场景的用例:基于JobStep的输出注册模 - [创建Workflow服务部署节点](https://support.huaweicloud.com/usermanual-standard-modelarts/modelarts_workflow_0389.md): 通过对ModelArts服务管理能力的封装,实现Workflow新增服务和更新服务的能力。主要应用场景如下:将模型部署为一个Web Service。更新已有服务,支持灰度更新等能力。您可以使用ServiceStep来构建服务部署节点,ServiceStep结构如下表4 ServiceConfig示例:如果您没有特殊需求,可直接使用内置的默 - [Workflow多分支运行介绍](https://support.huaweicloud.com/usermanual-standard-modelarts/modelarts_workflow_0395.md): 当前支持两种方式实现多分支的能力,条件节点只支持双分支的选择执行,局限性较大,推荐使用配置节点参数控制分支执行的方式,可以在不添加新节点的情况下完全覆盖ConditionStep的能力,使用上更灵活。构建条件节点控制分支执行主要用于执行流程的条件分支选择,可以简单地进行数值比较来控制执行流程,也可以根据节点输出的metric相关信息决定后 - [构建条件节点控制分支执行](https://support.huaweicloud.com/usermanual-standard-modelarts/modelarts_workflow_0394.md): 主要用于执行流程的条件分支选择,可以简单地进行数值比较来控制执行流程,也可以根据节点输出的metric相关信息决定后续的执行流程。主要应用场景如下:可以用于需要根据不同的输入值来决定后续执行流程的场景。例如:需要根据训练节点输出的精度信息来决定是重新训练还是进行模型的注册操作时可以使用该节点来实现流程的控制。您可以使用ConditionS - [配置节点参数控制分支执行](https://support.huaweicloud.com/usermanual-standard-modelarts/modelarts_workflow_0398.md): 支持单节点通过参数配置或者获取训练输出的metric指标信息来决定执行是否跳过,同时可以基于此能力完成对执行流程的控制。主要用于存在多分支选择执行的复杂场景,在每次启动执行后需要根据相关配置信息决定哪些分支需要执行,哪些分支需要跳过,达到分支部分执行的目的,与ConditionStep的使用场景类似,但功能更加强大。当前该能力适用于数据集 - [配置多分支节点数据](https://support.huaweicloud.com/usermanual-standard-modelarts/modelarts_workflow_0399.md): 仅用于存在多分支执行的场景,在编写构建工作流节点时,节点的数据输入来源暂不确定,可能是多个依赖节点中任意一个节点的输出。只有当依赖节点全部执行完成后,才会根据实际执行情况自动获取有效输出作为输入。案例中的Workflow存在两个并行分支,并且同时只有一条分支会执行,由condition_step的相关配置决定。model_step的输入来 - [编排Workflow](https://support.huaweicloud.com/usermanual-standard-modelarts/modelarts_workflow_0400.md): Workflow的编排主要在于每个节点的定义,您可以参考创建Workflow节点章节,按照自己的场景需求选择相应的代码示例模板进行修改。编排过程主要分为以下几个步骤。梳理场景,了解预置Step的功能,确定最终的DAG结构。单节点功能,如训练、推理等在ModelArts相应服务中调试通过。根据节点功能选择相应的代码模板,进行内容的补充。根据 - [发布Workflow到ModelArts](https://support.huaweicloud.com/usermanual-standard-modelarts/modelarts_workflow_0403.md): 发布Workflow到ModelArts有两种方式,这两种方式的区别在发布Workflow至运行态后,需要在Workflow页面配置输入输出等参数;而发布Workflow至运行态并运行通过对代码进行改造,用户直接在SDK侧发布并运行工作流,节省了前往控制台配置运行的操作。工作流编写完成后,可以进行固化保存,调用Workflow对象的rel - [发布Workflow到AI Gallery](https://support.huaweicloud.com/usermanual-standard-modelarts/modelarts_workflow_0404.md): Workflow支持发布到AI Gallery,分享给其他用户使用,执行如下代码即可完成发布。发布完成后可前往查看相应的资产信息,资产权限默认为private,可在资产的console页面自行修改。进入AI Gallery。单击“我的Gallery>我的资产>Workflow”,进入我的Workflow页面。在“我的发布”页签中查看发布到 - [在Workflow中更新已部署的服务](https://support.huaweicloud.com/usermanual-standard-modelarts/modelarts_workflow_0407.md): 大部分场景下的工作流都是第一次运行部署新服务,后续进行模型迭代时,需要对已部署的服务进行更新。因此需要在同一条工作流中,同时支持服务的部署及更新能力。代码编写示例如下:其中ServiceStep节点包含两个输入,一个是模型列表对象,另一个是在线服务对象,此时在运行态通过开关的方式来控制部署/更新服务,如下图所示:在线服务开关默认关闭,节点 - [在Workflow中使用大数据能力(MRS)](https://support.huaweicloud.com/usermanual-standard-modelarts/modelarts_workflow_0410.md): 该节点通过调用MRS服务,提供大数据集群计算能力。主要用于数据批量处理、模型训练等场景。需要使用MRS Spark组件进行大量数据的计算时,可以根据已有数据使用该节点进行训练计算。在华为云MRS服务下查看自己账号下可用的MRS集群,如果没有,则需要创建,当前需要集群有Spark组件,安装时,注意勾选上。您可以使用MrsStep来创建作业类 - [在Workflow中指定仅运行部分节点](https://support.huaweicloud.com/usermanual-standard-modelarts/modelarts_workflow_0409.md): Workflow通过支持预置场景的方式来实现部分运行的能力,在开发工作流时按照场景的不同对DAG进行划分,之后在运行态可选择任意场景单独运行。具体代码示例如下所示:该示例中Workflow包含了五个节点(节点相关定义已省略),在policy中定义了两个预置场景:模型训练和服务部署,工作流发布至运行态后,部分运行的开关默认关闭,节点全部运行 - [数据准备使用流程](https://support.huaweicloud.com/usermanual-standard-modelarts/dataprepare-modelarts-0001.md): ModelArts是面向AI开发者的一站式开发平台,能够支撑开发者从数据到模型的全流程开发过程,包含数据处理、算法开发、模型训练、模型部署等操作。并且提供AI Gallery功能,能够在市场内与其他开发者分享数据、算法、模型等。为了能帮用户快速准备大量高质量的数据,ModelArts数据管理提供了全流程的数据准备、数据处理和数据标注能力。 - [创建ModelArts数据集](https://support.huaweicloud.com/usermanual-standard-modelarts/dataprepare-modelarts-0004.md): 在ModelArts进行数据准备,首先需要先创建一个数据集,后续的操作如数据导入、数据分析、数据标注等,都是基于数据集来进行的。数据集功能仅在以下Region支持:华北-北京四、华北-北京一、华东-上海一、华南-广州、西南-贵阳一、中国-香港、亚太-新加坡、亚太-曼谷、亚太-雅加达、拉美-圣地亚哥、拉美-圣保罗一、拉美-墨西哥城二。当前M - [数据导入方式介绍](https://support.huaweicloud.com/usermanual-standard-modelarts/dataprepare-modelarts-0008.md): 数据集创建完成后,您还可以通过导入数据的操作,接入更多数据。ModelArts支持从不同数据源导入数据。从OBS导入数据到ModelArts数据集从MRS导入数据到ModelArts数据集从本地上传数据到ModelArts数据集文件型数据集支持从两种数据源导入数据:OBS和本地上传。导入后,导入目录下的数据会复制至数据集的数据源路径下。O - [从OBS导入数据到数据集场景介绍](https://support.huaweicloud.com/usermanual-standard-modelarts/dataprepare-modelarts-0011.md): OBS导入数据方式分为OBS目录和Manifest文件两种。OBS目录:指需要导入的数据集已提前存储至OBS目录中。此时需选择用户具备权限的OBS路径,且OBS路径内的目录结构需满足规范,详细规范请参见从OBS目录导入数据规范说明。当前只有图像分类、物体检测、表格、文本分类和声音分类类型的数据集,支持从OBS目录导入数据。其他类型只支持M - [从OBS目录导入数据到数据集](https://support.huaweicloud.com/usermanual-standard-modelarts/dataprepare-modelarts-0012.md): 已存在创建完成的数据集。准备需要导入的数据,具体可参见从OBS目录导入数据规范说明。需导入的数据,已存储至OBS中。Manifest文件也需要存储至OBS。详细指导请参见如何创建OBS桶用于ModelArts存储数据。确保数据存储的OBS桶与ModelArts在同一区域,并确保用户具有OBS桶的操作权限。不同类型的数据集,导入操作界面的示 - [从Manifest文件导入数据到数据集](https://support.huaweicloud.com/usermanual-standard-modelarts/dataprepare-modelarts-0014.md): 已存在创建完成的数据集。准备需要导入的数据,具体可参见从Manifest文件导入规范说明。需导入的数据,已存储至OBS中。Manifest文件也需要存储至OBS。确保数据存储的OBS桶与ModelArts在同一区域,并确保用户具有OBS桶的操作权限。不同类型的数据集,导入操作界面的示意图存在区别,请参考界面信息了解当前类型数据集的示意图。 - [从OBS目录导入数据规范说明](https://support.huaweicloud.com/usermanual-standard-modelarts/dataprepare-modelarts-0013.md): 导入数据集时,使用存储在OBS的数据时,数据的存储目录以及文件名称需满足ModelArts的规范要求。当前只有图像分类、物体检测、图像分割、文本分类和声音分类标注类型支持按标注格式导入。其中,“表格”类型的数据集,支持从OBS和MRS等数据源导入数据。从OBS目录导入数据时,当前操作用户需具备此OBS路径的读取权限。同时确保数据存储的OB - [从Manifest文件导入规范说明](https://support.huaweicloud.com/usermanual-standard-modelarts/dataprepare-modelarts-0015.md): Manifest文件中定义了标注对象和标注内容的对应关系。此导入方式是指导入数据集时,使用Manifest文件。选择导入Manifest文件时,可以从OBS导入。当从OBS导入Manifest文件时,需确保当前用户具备Manifest文件所在OBS路径的权限。Manifest文件编写规范要求较多,推荐使用OBS目录导入方式导入新数据。一般 - [从DWS导入数据到ModelArts数据集](https://support.huaweicloud.com/usermanual-standard-modelarts/dataprepare-modelarts-0018.md): ModelArts支持从DWS导入表格数据,用户需要选择对应的DWS集群,并输入需要对应的数据库名、表名以及用户名和密码。所导入表的schema(列名和类型)需要跟数据集相同。DWS的详细功能说明,请参考DWS用户指南。集群名称:系统自动将当前账号下的DWS集群展现在列表中,您可以在下拉框中选择您所需的DWS集群。数据库名称:根据选择的D - [从DLI导入数据到ModelArts数据集](https://support.huaweicloud.com/usermanual-standard-modelarts/dataprepare-modelarts-0016.md): 表格数据集支持从DLI导入数据。从DLI导入数据,用户需要选择DLI队列、数据库和表名称。所选择的表的schema(列名和类型)需与数据集一致,支持自动获取所选择表的schema。DLI的详细功能说明,请参考DLI用户指南。队列名称:系统自动将当前账号下的DLI队列展现在列表中,用户可以在下拉框中选择需要的队列。数据库名称:根据选择的队列 - [从MRS导入数据到ModelArts数据集](https://support.huaweicloud.com/usermanual-standard-modelarts/dataprepare-modelarts-0017.md): ModelArts支持从MRS服务中导入存储在HDFS上的csv格式的数据,首先需要选择已有的MRS集群,并从HDFS文件列表选择文件名称或所在目录,导入文件的列数需与数据集schema一致。MRS的详细功能说明,请参考MRS用户指南。集群名称:系统自动将当前账号下的MRS集群展现在此列表中,但是流式集群不支持导入操作。请在下拉框中选择您 - [从本地上传数据到ModelArts数据集](https://support.huaweicloud.com/usermanual-standard-modelarts/dataprepare-modelarts-0019.md): 已存在创建完成的数据集。创建一个空的OBS桶,OBS桶与ModelArts在同一区域,并确保用户具有OBS桶的操作权限。文件型和表格型数据均支持从本地上传。从本地上传的数据存储在OBS目录中,请先提前创建OBS桶。从本地上传的数据单次最多支持100个文件同时上传,总大小不超过5GB。不同类型的数据集,导入操作界面的示意图存在区别,请参考界 - [数据处理场景介绍](https://support.huaweicloud.com/usermanual-standard-modelarts/dataprocess-modelarts-00001.md): 数据处理功能仅在以下Region支持:华北-北京四、华北-北京一、华东-上海一、华南-广州。ModelArts平台提供的数据处理功能,基本目的是从大量的、杂乱无章的、难以理解的数据中抽取或者生成对某些特定的人们来说是有价值、有意义的数据。当数据采集和接入之后,数据一般是不能直接满足训练要求的。为了保障数据质量,以免对后续操作(如数据标注、 - [创建ModelArts数据校验任务](https://support.huaweicloud.com/usermanual-standard-modelarts/dataprocess-modelarts-00013.md): 数据已准备完成:已经创建数据集或者已经将数据上传至OBS。确保您使用的OBS与ModelArts在同一区域。登录ModelArts控制台,在左侧的导航栏中选择数据准备>数据处理,进入数据处理页面。在数据处理页面,单击创建进入创建数据处理页面。在创建数据处理页面,填写相关算法参数。填写基本信息。基本信息包括名称、版本和描述。其中版本信息由系 - [创建ModelArts数据清洗任务](https://support.huaweicloud.com/usermanual-standard-modelarts/dataprocess-modelarts-00015.md): 数据已准备完成:已经创建数据集或者已经将数据上传至OBS。确保您使用的OBS与ModelArts在同一区域。登录ModelArts控制台,在左侧的导航栏中选择数据准备>数据处理,进入数据处理页面。在数据处理页面,单击创建进入创建数据处理页面。在创建数据处理页面,填写相关算法参数。填写基本信息。基本信息包括名称、版本和描述。其中版本信息由系 - [创建ModelArts数据选择任务](https://support.huaweicloud.com/usermanual-standard-modelarts/dataprocess-modelarts-00016.md): 数据已准备完成:已经创建数据集或者已经将数据上传至OBS。确保您使用的OBS与ModelArts在同一区域。登录ModelArts控制台,在左侧的导航栏中选择数据准备 > 数据处理,进入数据处理页面。在数据处理页面,单击创建进入创建数据处理页面。在创建数据处理页面,填写相关算法参数。填写基本信息。基本信息包括名称、版本和描述。其中版本信息 - [创建ModelArts数据增强任务](https://support.huaweicloud.com/usermanual-standard-modelarts/dataprocess-modelarts-00017.md): 数据已准备完成:已经创建数据集或者已经将数据上传至OBS。确保您使用的OBS与ModelArts在同一区域。登录ModelArts控制台,在左侧的导航栏中选择数据准备>数据处理,进入数据处理页面。在数据处理页面,单击创建进入创建数据处理页面。在创建数据处理页面,填写相关算法参数。填写基本信息。基本信息包括名称、版本和描述。其中版本信息由系 - [管理和查看数据处理任务](https://support.huaweicloud.com/usermanual-standard-modelarts/dataprocess-modelarts-00014.md): 当已有的数据处理任务不再使用时,您可以删除数据处理任务。请注意,数据处理任务删除后不可恢复,请谨慎操作。处于完成、失败、已停止、运行失败、部署中状态的训练作业,您可以单击操作列的删除,删除对应的数据处理任务。登录ModelArts控制台,在左侧的导航栏中选择数据准备>数据处理,进入数据处理页面。在数据处理列表中,单击数据处理任务名称,进入 - [数据标注场景介绍](https://support.huaweicloud.com/usermanual-standard-modelarts/datalabel-modelarts_0002.md): 由于模型训练过程需要大量有标签的数据,因此在模型训练之前需对没有标签的数据添加标签。您可以通过创建单人标注作业或团队标注作业对数据进行手工标注,或对任务启动智能标注添加标签,快速完成对图片的标注操作,也可以对已标注图片修改或删除标签进行重新标注。ModelArts为用户提供了标注数据的能力:人工标注:用户创建单人标注作业,对数据进行手工标 - [创建ModelArts人工标注作业](https://support.huaweicloud.com/usermanual-standard-modelarts/datalabel-modelarts_0004.md): 由于模型训练过程需要大量有标签的数据,因此在模型训练之前需对没有标签的数据添加标签。您可以通过创建单人标注作业或团队标注作业对数据进行手工标注,或对任务启动智能标注添加标签,快速完成对图片的标注操作,也可以对已标注图片修改或删除标签进行重新标注。数据标注功能仅在以下Region支持:华北-北京四、华北-北京一、华东-上海一、华南-广州、西 - [人工标注图片数据](https://support.huaweicloud.com/usermanual-standard-modelarts/datalabel-modelarts_0005.md): 由于模型训练过程需要大量有标签的图片数据,因此在模型训练之前需对没有标签的图片添加标签。您可以通过手工标注或智能一键标注的方式添加标签,快速完成对图片的标注操作,也可以对已标注图片修改或删除标签进行重新标注。针对图像分类场景,开始标注前,您需要了解:图片标注支持多标签,即一张图片可添加多个标签。标签名是由中文、大小写字母、数字、中划线或下 - [人工标注文本数据](https://support.huaweicloud.com/usermanual-standard-modelarts/datalabel-modelarts_0009.md): 由于模型训练过程需要大量有标签的数据,因此在模型训练之前需对没有标签的文本添加标签。您也可以对已标注文本进行修改、删除和重新标注。针对文本分类场景,是对文本的内容按照标签进行分类处理,开始标注前,您需要了解:文本标注支持多标签,即一个标注对象可添加多个标签。标签名是由中文、大小写字母、数字、中划线、下划线或特殊符号组成,且不超过1024位 - [人工标注音频数据](https://support.huaweicloud.com/usermanual-standard-modelarts/datalabel-modelarts_0013.md): 由于模型训练过程需要大量有标签的音频数据,因此在模型训练之前需对没有标签的音频添加标签。通过ModelArts您可对音频进行一键式批量添加标签,快速完成对音频的标注操作,也可以对已标注音频修改或删除标签进行重新标注。音频标注涉及到的标注标签和声音内容只支持中文和英文,不支持小语种。声音分类是对声音进行分类。语音内容是对语音内容进行标注。语 - [人工标注视频数据](https://support.huaweicloud.com/usermanual-standard-modelarts/datalabel-modelarts_0017.md): 由于模型训练过程需要大量有标签的视频数据,因此在模型训练之前需对没有标签的视频添加标签。通过ModelArts您可对视频添加标签,快速完成对视频的标注操作,也可以对已标注视频修改或删除标签进行重新标注。视频标注仅针对视频帧进行标注。登录ModelArts控制台,在左侧菜单栏中选择数据准备> 数据标注,进入数据标注管理页面。在标注作业列表右 - [管理标注数据](https://support.huaweicloud.com/usermanual-standard-modelarts/modelarts_23_0347.md): ModelArts会自动将数据集中新增的数据同步至标注作业,包含数据及当前标注作业支持的标注信息。为了快速获取数据集中最新数据,可在标注作业详情页的全部、未标注或已标注页签中,单击同步新数据,快速将数据集中的数据添加到标注作业中。问题现象:将已标注好的数据上传至OBS,同步数据后,显示为未标注。原因分析:可能是OBS桶设置了自动加密导致此 - [创建智能标注作业](https://support.huaweicloud.com/usermanual-standard-modelarts/datalabel-modelarts_0019.md): 除了人工标注外,ModelArts还提供了智能标注功能,快速完成数据标注,为您节省70%以上的标注时间。智能标注是指基于当前标注阶段的标签及图片学习训练,选中系统中已有的模型进行智能标注,快速完成剩余图片的标注操作。数据标注功能仅在以下Region支持:华北-北京四、华北-北京一、华东-上海一、华南-广州、西南-贵阳一、中国-香港、亚太- - [确认智能标注作业的数据难例](https://support.huaweicloud.com/usermanual-standard-modelarts/datalabel-modelarts_0020.md): 在数据量很大的标注任务中,标注初期由于已标注图片不足,智能标注的结果无法直接用于训练。如果对所有的未标注数据一一进行调整确认仍然需要较大的人力和时间成本。为了更快地完成标注任务,在对未标注数据进行智能标注的任务中,ModelArts嵌入了自动难例发现功能。该功能会对剩余未标注图片的标注优先级给出建议。因为标注优先级高的图片的智能标注结果未 - [使用自动分组智能标注作业](https://support.huaweicloud.com/usermanual-standard-modelarts/dataprepare-modelarts-0022.md): 为了提升智能标注算法精度,可以均衡标注多个类别,有助于提升智能标注算法精度。ModelArts内置了分组算法,您可以针对您选中的数据,执行自动分组,提升您的数据标注效率。自动分组可以理解为数据标注的预处理,先使用聚类算法对未标注图片进行聚类,再根据聚类结果进行处理,可以分组打标或者清洗图片。例如,用户通过搜索引擎搜索XX,将相关图片下载并 - [团队标注使用说明](https://support.huaweicloud.com/usermanual-standard-modelarts/datalabel-modelarts_0023.md): 数据标注任务中,一般由一个人完成,但是针对数据集较大时,需要多人协助完成。ModelArts提供了团队标注功能,可以由多人组成一个标注团队,针对同一个数据集进行标注管理。团队标注功能仅在以下Region支持:华北-北京四、华北-北京一、华东-上海一、华南-广州、中国-香港、亚太-新加坡、亚太-曼谷。团队标注功能当前仅支持图像分类、物体检测 - [创建和管理团队](https://support.huaweicloud.com/usermanual-standard-modelarts/datalabel-modelarts_0024.md): 团队标注功能是以团队为单位进行管理,数据集启用团队标注功能时,必须指定一个团队。一个团队可以添加多个成员。新添加的团队,其成员列表为空。您需要根据实际情况添加即将参与标注任务的成员信息。一个账号最多可添加10个团队。一个团队最多支持添加100个成员,当超过100时,建议分为多个团队进行管理。如果数据集需要启用团队标注功能,当前账号至少拥有 - [创建团队标注任务](https://support.huaweicloud.com/usermanual-standard-modelarts/datalabel-modelarts_0027.md): 如果您在创建标注作业时,即启用团队标注,且指派了某一团队负责标注,系统将默认基于此团队创建一个标注任务。您可以在创建数据标注任务后,在“我创建的”页面查看此任务。您还可以重新创建一个团队标注任务,指派给同一团队的不同成员,或者指派给其他标注团队。从控制台的数据准备 >数据标注页面进入,创建标注作业时,打开“启用团队标注”开关,同时指定一个 - [审核并验收团队标注任务结果](https://support.huaweicloud.com/usermanual-standard-modelarts/datalabel-modelarts_0030.md): 团队标注成员完成后,团队审核者可以对标注结果进行审核。登录ModelArts控制台,左侧菜单栏选择“数据准备>数据标注”,在数据标注页面选择“我参与的”,在任务列表“操作”列单击审核,发起审核。发起审核在审核页面中,审核人员可以查看“未审核”、“已审核”、“审核通过”、“审核不通过”的样本。标注结果审核审核人员可以在审核页面的右侧选择“审 - [管理团队和团队成员](https://support.huaweicloud.com/usermanual-standard-modelarts/dataprocess-modelarts-00018.md): 团队中的成员,当其信息发生变化时,可以编辑其基本情况。在团队详情区域,选择需修改的成员。在成员所在行的操作列,单击修改。在弹出的对话框中,修改其描述或角色。成员的邮箱无法修改,如果需要修改邮箱地址,建议先删除此成员,然后再基于新的邮箱地址添加新成员。角色支持Labeler、Reviewer和Team Manager,Team Manage - [管理标注作业](https://support.huaweicloud.com/usermanual-standard-modelarts/dataprepare-modelarts-0023.md): 在ModelArts数据标注页面可查看用户自己创建的标注作业。登录ModelArts控制台,在左侧菜单栏选择“数据准备>数据标注”,进入数据标注页面。在“我创建的”页签,可查看自己创建的标注作业。用户可查看自己创建的标注作业的相关信息。我创建的在“我参与的”页签,可查看参与过标注的标注作业。用户可查看标注作业详细信息,包括标注团队的成员、 - [发布ModelArts数据集中的数据版本](https://support.huaweicloud.com/usermanual-standard-modelarts/dataprepare-modelarts-0026.md): ModelArts在数据准备过程中,针对同一数据源的数据,对不同时间处理或标注后的数据,按照版本进行区分方便后续模型构建和开发时选择对应的数据集版本进行使用。针对刚创建的数据集(未发布前),无数据集版本信息,必须执行发布操作后,才能应用于模型开发或训练。数据集版本,默认按V001、V002递增规则进行命名,您也可以在发布时自定义设置。您可 - [分析ModelArts数据集中的数据特征](https://support.huaweicloud.com/usermanual-standard-modelarts/dataprepare-modelarts-0024.md): 基于图片或目标框对图片的各项特征,如模糊度、亮度进行分析,并绘制可视化曲线,帮助处理数据集。您还可以选择数据集的多个版本,查看其可视化曲线,进行对比分析。只有“图片”的数据集,且版本标注类型为物体检测和图像分类的数据集版本支持数据特征分析。只有发布后的数据集支持数据特征分析。发布后的Default格式数据集版本支持数据特征分析。数据特征分 - [导出ModelArts数据集中的数据到OBS](https://support.huaweicloud.com/usermanual-standard-modelarts/dataprepare-modelarts-0033.md): 针对数据集中的数据,用户可以选中部分数据或者通过条件筛选出需要的数据,当需要将数据集中的数据存储至OBS用于后续导出使用时,可通过此种方式导出成新的数据集。用户可以通过任务历史查看数据导出的历史记录。目前只有“图像分类”、“物体检测”、“图像分割”类型的数据集支持导出功能。“图像分类”只支持导出txt格式的标注文件。“物体检测”只支持导出 - [导出ModelArts数据集中的数据为新数据集](https://support.huaweicloud.com/usermanual-standard-modelarts/dataprepare-modelarts-0032.md): 针对数据集中的数据,用户可以选中部分数据或者通过条件筛选出需要的数据,导出成新的数据集。用户可以通过任务历史查看数据导出的历史记录。本章主要介绍将ModelArts数据集中的数据为新数据集的方式,新导出的数据集可直接在ModelArts控制台数据集列表中显示。目前只有“图像分类”、“物体检测”、“图像分割”类型的数据集支持导出功能。“图像 - [导出ModelArts数据集中的数据到AI Gallery](https://support.huaweicloud.com/usermanual-standard-modelarts/dataprepare-modelarts-0034.md): 针对数据集中的数据,用户可以选中部分数据或者通过条件筛选出需要的数据,导出到AI Gallery。用户可以通过任务历史查看数据导出的历史记录。发布到AI Gallery中的数据集,可以设置是否公开,将数据集公开给其他人使用。目前只有“图像分类”、“物体检测”、“图像分割”类型的数据集支持导出功能。“图像分类”只支持导出txt格式的标注文件 - [入门案例:快速创建一个物体检测的数据集](https://support.huaweicloud.com/usermanual-standard-modelarts/dataprepare-modelarts-0003.md): 本节以准备训练物体检测模型的数据为例,介绍如何针对样例数据,进行数据分析、数据标注等操作,完成数据准备工作。在实际业务开发过程中,可以根据业务需求选择数据管理的一种或多种功能完成数据准备。此次操作分为以下流程:准备工作创建数据集数据分析数据标注数据发布数据导出在使用ModelArts数据管理的功能前,需要先完成以下准备工作。用户在使用数据 - [概述](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-0001.md): 魔坊(ModelArts)是华为云提供的一站式AI开发与训推平台,提供算法开发、模型训练、部署上线、资源管理等全生命周期工具链。模型训练是ModelArts的核心模块,支持用户通过界面化操作及API等方式创建训练任务。您可以使用训练模块快速迭代模型参数、验证不同数据集与超参数组合,训练出满足要求的模型。AI模型开发的过程,称之为Model - [准备工作](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-0136.md): 由于训练作业运行需消耗资源,为了避免训练失败请确保账户无欠费。详见模型训练计费项。检查是否配置了访问授权。如果未配置,请参见快速配置ModelArts委托授权完成操作。在启动模型训练任务前,您需要准备计算资源完成后续模型训练任务。ModelArts提供了如下不同种类训练资源,请参考使用:公共算力资源:在创建训练作业时称为公共资源池。公共资 - [训练场景说明](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-0137.md): ModelArts为不同经验水平和业务需求的开发者提供了多种灵活的模型训练场景。这些场景覆盖了从“零代码快速验证”到“企业级自动化生产”的完整路径,帮助用户根据任务复杂度、模型类型、开发成熟度以及自动化程度,选择最适合的训练路径。以下对训练场景进行详细说明。ModelArts为新手、快速原型验证和教学演示设计的最简便入口。用户无需编写代码 - [创建一键训练作业](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-0138.md): 如果您的任务属于常见的标准任务(如文本生成),不希望关心底层的训练脚本、超参调优和资源配置时,推荐使用一键训练。您只需要准备好数据集、选择对应的任务类型,平台会自动完成算法选择、训练参数配置和资源调度,最终直接产出可部署的模型。这种场景的核心价值是"零代码、快速见效",帮助用户在最短时间内跑通从数据到模型的完整闭环,非常适合原型验证和业务 - [创建自定义训练作业](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-0006.md): 本章节内容仅适用于控制台界面为新版样式的站点,请参考新旧控制台说明了解如何切换新旧控制台。如需在旧版控制台创建训练作业,请参考创建训练作业(旧版控制台页面)。在模型开发过程中,如何高效地优化模型性能是一个关键挑战。传统的模型训练方式往往需要反复尝试不同的模型结构、数据集和超参数组合,这不仅耗时耗力,还可能导致训练效果不理想。针对这一问题, - [创建精调训练作业](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-0007.md): 在大模型训练中,精调(或“微调”)(Fine-tuning) 是指通过特定领域的数据集对已经做过全量预训练模型(Pre-trained Model, PT)进行二次训练的方法。通过精调能够更新模型权重,使模型能够更有效地应对具体的任务需求。这一阶段使模型能够精确执行如文案生成、代码生成和专业问答等特定场景中的任务。在模型开发过程中,精调的 - [使用API创建训练作业](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-0139.md): 当您需要基于特定数据集和算法模型执行机器学习训练时,可以使用ModelArts API创建和配置训练作业。 训练作业创建成功后,平台将根据配置的资源规格自动启动训练作业,您可以通过作业ID监控训练进度和状态。通过API创建训练作业特别适合以下场景,是生产环境中最推荐的训练作业创建方式:自动化生产流水线:将训练作业集成到CI/CD流水线或M - [增量模型训练](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-1420.md): 增量训练(Incremental Learning)是机器学习领域中的一种训练方法,它允许人工智能(AI)模型在已经学习了一定知识的基础上,增加新的训练数据到当前训练流程中,扩展当前模型的知识和能力,而不需要从头开始。增量训练不需要一次性存储所有的训练数据,缓解了存储资源有限的问题;另一方面,增量训练节约了重新训练中需要消耗大量算力、时间 - [优先级和调度策略](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-0105.md): 使用专属资源池训练作业时,支持在创建训练作业时设置任务优先级,也支持作业在长时间处于等待中的状态时调整优先级。如通过调整作业优先级可以减少作业的排队时长。在用户运行训练作业过程中,需要对训练作业做优先级划分。例如部分低优先级任务用于测试或简单的非关键实验,当存在高优先级作业时,高优先级作业能够比低优先级作业更快进入调度队列。在资源使用高峰 - [管理训练容器环境变量](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-0104.md): 本章节展示了训练容器环境中预置的环境变量,方便用户查看,主要包括以下类型。路径相关环境变量分布式训练作业环境变量NCCL(Nvidia Collective multi-GPU Communication Library)环境变量OBS环境变量PIP源环境变量API网关地址环境变量作业元信息环境变量为了避免新设置的环境变量与系统环境变量冲 - [示例:将本地PyTorch训练代码迁移到ModelArts](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-0148.md): 本实践旨在指导开发者将本地已调试完成的PyTorch训练脚本,改造为可在ModelArts训练作业中运行的标准形态,内容涵盖数据路径改造、运行环境准备、单机多卡/多机多卡分布式改造,以及从GPU迁移至昇腾NPU的代码适配四个部分,并分别给出改造前后的代码示例。代码必须先在本地调试好,再上传华为云平台进行训练,否则会出现各种难以解释的问题, - [分布式训练功能介绍](https://support.huaweicloud.com/usermanual-standard-modelarts/modelarts-distributed-0001.md): 分布式训练是指在多个计算节点(如多台服务器或GPU设备)上并行执行深度学习任务,以加快模型训练速度或处理更大规模的数据。通过将训练任务分配到多个节点上,每个节点负责计算模型的一部分,然后通过通信机制将计算结果同步,最终完成整个模型的训练。这种方式可以显著提高训练效率,尤其适用于复杂模型和大规模数据集的场景。ModelArts提供了对分布式 - [创建多机多卡的分布式训练(DistributedDataParallel)](https://support.huaweicloud.com/usermanual-standard-modelarts/modelarts-distributed-0008.md): 在深度学习领域,随着模型复杂度的不断提升和训练规模的不断扩大,传统的单机训练方式已难以满足实际需求。在这一背景下,如何在多机多卡环境下实现高效的分布式训练成为了亟待解决的关键问题。针对这一问题,本章节将详细介绍基于PyTorch引擎的多机多卡数据并行训练方法。本文不仅提供具体的代码适配操作过程,还通过完整的代码示例帮助读者更好地理解和实践 - [自定义镜像训练作业配置实例间SSH免密互信](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-0032.md): 在使用自定义镜像进行分布式训练时,如果未配置训练作业实例间的SSH免密互信,将会导致训练任务失败。为确保实例间的通信顺畅,必须预先配置实例间SSH免密互信,确保分布式训练任务顺利进行。配置实例间SSH免密互信涉及代码适配和训练作业参数配置,本文提供了一个操作示例。准备一个预装OpenSSH的自定义镜像,使用的训练框架是MPI或Horovo - [超节点亲和组实例数配置](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-0011.md): 大模型训练中通常会采取多种并行策略,通过分布式计算来提高模型的训练效率和扩展性。其中模型并行中的allreduce通信以及MoE专家并行中的alltoall通信对卡间的互联带宽要求非常高,受限于硬件的组网,这些通信开销较大的阶段往往成为限制训练性能的瓶颈。昇腾新一代硬件Snt9b23,使用HCCS总线将多个计算节点的NPU互联进行大带宽互 - [示例:创建DDP分布式训练(PyTorch+GPU)](https://support.huaweicloud.com/usermanual-standard-modelarts/modelarts-distributed-0011.md): 在分布式训练场景中,使用PyTorch的DistributedDataParallel(DDP)功能是实现高效训练的重要方式。为了帮助用户更好地理解和应用这一功能,本文将详细介绍torch.distributed.launch命令启动训练作业PyTorchDDP训练的方法,并提供对应的代码示例。需要有GPU加速卡资源池。在创建训练任务之前 - [示例:创建DDP分布式训练(PyTorch+NPU)](https://support.huaweicloud.com/usermanual-standard-modelarts/modelarts-distributed-0012.md): 在深度学习领域,使用PyTorch的DistributedDataParallel(DDP)功能在Ascend加速卡上进行分布式训练是一种高效的方式。然而,如何通过自定义镜像和自定义启动命令来实现这一目标,是用户在实际操作中可能遇到的挑战。针对这一问题,本文提供了一种解决方案:通过配置训练作业的自定义镜像,并结合自定义启动命令,用户可以轻 - [创建并调试训练作业](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-0042.md): 在AI模型开发过程中,高效的调试环境是确保模型质量的关键环节。传统开发模式中,开发人员需要在本地环境中完成模型调试,再进行云端部署,这一过程往往面临环境配置复杂、资源利用率低等问题。ModelArts训练作业的调试模式提供了一套完整的云端开发解决方案,有效解决了上述问题。该方案主要包含以下核心功能:云化开发环境支持集成JupyterLab - [使用Cloud Shell调试生产训练作业](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-0119.md): ModelArts提供了Cloud Shell,可以登录运行中的容器,用于调试生产环境的训练作业。仅专属资源池支持使用Cloud Shell登录训练容器,且训练作业必须处于运行中状态。使用主用户账号登录华为云管理控制台,单击右上角用户名,在下拉框中选择统一身份认证,进入统一身份认证(IAM)服务。在统一身份认证服务页面的左侧导航选择权限管 - [SSH远程开发](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts_0299.md): 本节操作介绍在Windows环境中使用方式一:使用CMD工具连接云上训练作业实例和方式二: 使用MobaXterm工具连接云上训练作业实例两种方式远程登录云上实例的操作步骤。使用SSH连接训练作业实例的约束限制如下:本地用户密钥和权限必须匹配。本地用户密钥需要存放在指定目录下。Windows:C:\Users\{{user}}macOS/ - [保存调试模式训练作业镜像](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-1423.md): 在使用镜像进行开发和调试的过程中,用户可能会对镜像环境修改和优化。如果用户在完成镜像修改后,希望保留当前的镜像环境以备后续开发使用,此时可以在控制台使用"保存镜像"功能,将当前的镜像环境保存,用于后续的开发和调试工作。在镜像保存时,需要注意以下几点:安装的依赖包将被保留,但训练数据、代码等需要持久化存储的内容不会被保存在最终生成的容器镜像 - [模型训练存储加速](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-1421.md): 针对AI训练场景中大模型Checkpoint保存和加载带来的I/O挑战,华为云提供了基于对象存储服务OBS+高性能弹性文件服务SFS Turbo的AI云存储解决方案,如下图所示。SFS Turbo HPC型支持和OBS数据联动,您可以通过SFS Turbo HPC型文件系统来加速对OBS对象存储中的数据访问,并将生成的结果数据异步持久化到 - [训练作业动态路由加速](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-0004.md): 在分布式训练场景下,由于多节点之间的数据交互频繁,网络通信效率往往成为性能瓶颈。传统方式下,训练作业的网络通信存在带宽利用率低、数据传输延迟高等问题,这会直接影响训练效率和资源利用率。针对这一技术挑战,用户可能会问:如何有效优化分布式训练中的网络通信性能?ModelArts提供了一项动态路由加速功能,通过智能优化训练作业的网络通信路径,显 - [MoXing基础功能](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-moxing-0002.md): 在使用ModelArts服务时,您可能会遇到需要访问对象存储服务(OBS)的情况。OBS是一个基于对象的海量存储服务,与传统的本地文件系统不同,无法直接通过文件路径访问OBS上的文件。直接访问OBS文件时会遇到以下问题:无法像访问本地文件那样使用open()方法。需要通过网络请求进行文件读写操作。使用OBS Python SDK接口可能较 - [模型高可用功能说明](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-0121.md): 在长时间、大规模的模型训练中,受限于硬件稳定性、网络波动等原因,训练作业难免会出现中断。如果训练作业能够在中断后快速恢复,将极大地提高训练设备的利用率,降低用户训练的时间成本和算力损失。ModelArts提供了模型训练高可用功能,包括断点续训练、故障检测、自动重启、故障节点隔离、卡死检测、算子重执行和失败日志分析等能力,用于提升训练作业在 - [高可用性配置场景](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-0122.md): 本章推荐一些常用场景的高可用配置,给您在配置高可用训练作业时提供一些配置参考。 - [高可靠性前置准备:断点续训练](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-0023.md): 通过本章,您将了解到断点续训练的相关原理、配置方法、配置建议和注意事项。由于内容较多,为便于您找到关心的内容,本节开头先做一个简单的内容分类。请参照如下分类,阅读您关心的内容。了解断点续训的概念及为什么需要断点续训,请您参考什么是断点续训练和为什么需要配置断点续训练。了解如何配置断点续训,请您参考如何配置CheckPoint。了解配置Ch - [开启和查看高可用配置](https://support.huaweicloud.com/usermanual-standard-modelarts/modelarts_trouble_0003.md): 通过本章,您将了解到ModelArts高可用配置方法、配置建议和查看高可用配置任务。由于内容较多,为便于您找到关心的内容,本节开头先做一个简单的内容分类。请参照如下分类,阅读您关心的内容。了解如何开启高可用配置。ModelArts提供了两种开启高可用配置的方法,分别是通过ModelArts控制台创建训练作业,设置“高可用配置”开启和通过创 - [故障检测机制](https://support.huaweicloud.com/usermanual-standard-modelarts/modelarts_trouble_0108.md): ModelArts提供了容错检测和卡死检测两大类故障检测机制,用于保证模型训练作业的高可用性。本章将详细介绍两种故障检测机制的原理和检测规则。本节将通过视频介绍和容错检查场景原理介绍ModelArts容错检查的执行原理。如果您想了解如何配置高可用性,请参考开启和查看高可用配置。用户在训练模型过程中,存在因硬件故障而产生的训练失败场景。针对 - [故障恢复机制](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-0012.md): 用户在创建训练作业时可以通过设置自动重启的方式开启和查看高可用配置,当训练作业所在节点故障或训练作业检查到异常时,系统会自动触发训练作业故障恢复机制,通过重启进程或重建作业等手段尝试恢复训练业务。不同恢复策略的及差异如表1所示。容错恢复主要是通过重启进程或重建作业恢复训练业务,为了避免丢失训练进度、浪费算力,开启此功能前请确认代码已适配断 - [算子重执行](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-14191.md): 算子重执行是指当因为通信链路故障导致训练作业中通信算子报错,借助HCCL能力实现失败算子重新执行,保障训练作业不失败。在超节点大模型训练场景,集群通信链路存在闪断的情况,此时通信算子会执行报错,算子重执行可以很好的避免由于链路闪断故障造成的整个作业失败,提升训练作业的通信稳定性。在昇腾新一代硬件Snt9b23构建的超节点集群中,每个超节点 - [观测、日志与故障诊断](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-0098.md): 在ModelArts中训练作业遇到问题时,可首先查看日志,多数场景下的问题可以通过日志报错信息直接定位。ModelArts提供了训练作业失败定位与分析功能,如果训练作业运行失败,ModelArts会自动识别导致作业失败的原因,在训练全量日志界面上给出提示。提示包括三部分:失败的可能原因、推荐的解决方案以及对应的日志(底色标红部分)。Mod - [查看训练作业列表和详情](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-0027.md): 本章节内容仅适用于控制台界面为新版样式的站点,请参考新旧控制台说明了解如何切换新旧控制台。如需在查看旧版控制台作业详情,请参考创建训练作业(旧版)。在使用ModelArts平台的模型训练功能时,您可能需要查看当前正在进行的训练作业列表及其详细信息,以确保训练过程顺利进行。通过作业列表页面,您可以轻松掌握每个作业的状态,调整列表展示内容,根 - [训练作业流程可视化](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-1431.md): 在机器学习训练过程中,用户通常需要监控训练作业的执行状态。然而,传统的监控方式往往难以提供全面的作业运行信息,导致用户无法及时掌握训练进度。通过作业流程可视化功能模块,用户可以实时查看训练作业的详细运行状态。该功能支持多维度的信息展示,包括作业调度情况、环境准备状态以及作业执行进度等关键环节。用户只需进入可视化界面,即可一目了然地掌握训练 - [查看训练作业事件](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-0092.md): 在训练作业的整个生命周期中,从用户可见的开始阶段起,系统后台会记录每一个关键事件点,用户可以随时在对应训练作业的详情页面查看这些记录。这样,用户能够清晰地了解训练作业的进展和状态,确保信息的透明度和可追溯性。方便用户更清楚地了解训练作业运行过程,遇到任务异常时,更加准确地排查定位问题。当前支持的作业事件如下所示:训练作业创建成功训练作业创 - [查看训练作业日志](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-0014.md): 训练日志记录了训练作业的运行过程和异常信息,帮助用户快速定位作业运行中出现的问题。用户代码中的标准输出和标准错误信息都会在训练日志中显示。当在ModelArts中遇到训练作业问题时,用户可以首先查看日志,大多数情况下,问题可以通过日志中的报错信息直接定位。训练日志包括普通训练日志和Ascend相关日志。普通日志:当使用Ascend之外的资 - [查看训练作业监控指标](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-1424.md): 在训练作业运行过程中,如果用户能在模型训练出问题(例如loss值异常)的情况下能收到告警并及时处理,可以节省大量时间和资源,避免无效运行作业导致的浪费。同时通过指标监控可以实时掌握训练作业的进度,了解模型在不同阶段的训练状态。当前ModelArts训练作业模块在训练作业详情页的监控页签中提供了训练作业占用的CPU、GPU或NPU资源使用情 - [智能运维](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-0018.md): 训练作业运行过程中,ModelArts平台会对训练作业进行全方位的实时监测,确保作业的正常运行。训练作业详情中提供智能运维功能,便于用户对作业的监测和运维。当训练作业运行结束后,如果作业状态是“失败”或者“已终止”, 可以在“智能运维”中根据需要选择诊断工具对作业进行诊断。不同工具的诊断范围和诊断时间存在差异,请根据需要选择诊断类型。故障 - [查看训练作业资源占用情况](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-0015.md): 当前ModelArts训练作业模块在训练作业详情页的监控页签中提供了训练作业的资源使用情况监控,可以查看当前训练作业整体或单个节点占用的CPU、GPU或NPU资源使用情况。支持查看整个训练周期内的监控数据,具体数据参见表1。训练作业的资源占用情况系统会自动保存30天,过期会被清除。在ModelArts管理控制台的左侧导航栏中选择模型开发与 - [查看模型评估结果](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-0016.md): 训练作业运行结束后,ModelArts可为您的模型进行评估,并且给出调优诊断和建议。针对使用预置算法创建训练作业,无需任何配置,即可查看此评估结果(由于每个模型情况不同,系统将自动根据您的模型指标情况,给出一些调优建议,请仔细阅读界面中的建议和指导,对您的模型进行进一步的调优)。针对用户自己编写训练脚本或自定义镜像方式创建的训练作业,则需 - [查看训练作业标签](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-0108.md): 通过给训练作业添加标签,可以标识云资源,便于快速搜索训练作业。在ModelArts管理控制台的左侧导航栏中选择模型开发与训练模型训练(旧版控制台:模型训练 > 训练作业)。在训练作业列表中,单击作业名称进入训练作业详情页面。在训练作业详情页面,单击标签页签查看标签信息。支持添加、修改、删除标签。标签详细用法请参见使用TMS标签实现资源分组 - [复制、停止或删除训练作业](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-0017.md): 登录ModelArts管理控制台。在左侧导航栏中,选择模型训练训练作业(新版为“模型训练”),进入训练作业列表。单击进入训练作业详情。当您需要修改训练作业的算法时,可以在训练作业详情页面右上角,单击另存为算法。在创建算法页面中,会自动填充上一次训练作业的算法参数配置,您可以根据业务需求在原来算法配置基础上修改。新版控制台不支持此功能。订阅 - [使用CTS审计ModelArts训练作业](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-0026.md): ModelArts训练支持对接云审计CTS服务,通过云审计服务,您可以记录与ModelArts相关的操作事件,便于日后的查询、审计和回溯。在您开启了云审计服务后,系统会记录ModelArts的相关操作,且控制台保存最近7天的操作记录。本节介绍如何在云审计服务管理控制台查看最近7天的操作记录。已开通云审计服务。详细操作请参见《云审计服务用户 - [模型训练实践汇总](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-0145.md): 本章汇总了模型训练所有相关实践案例,请根据实际需求获取对应案例。 - [模型训练使用流程](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-0002.md): AI模型开发的过程,称之为Modeling,一般包含两个阶段:开发阶段:准备并配置环境,调试代码,使代码能够开始进行深度学习训练,推荐在ModelArts开发环境中调试。实验阶段:调整数据集、调整超参等,通过多轮实验,训练出理想的模型,推荐在ModelArts训练中进行实验。两个过程可以相互转换。如开发阶段代码稳定后,则会进入实验阶段,通 - [准备模型训练镜像](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-1417.md): ModelArts平台提供了TensorFlow,PyTorch,MindSpore等常用深度学习任务的基础镜像,镜像里已经安装好运行任务所需软件。当基础镜像里的软件无法满足您的程序运行需求时,您还可以基于这些基础镜像制作一个新的镜像并进行训练。ModelArts中预置的训练基础镜像如下表所示。场景一:预置镜像满足ModelArts训练平 - [预置框架启动文件的启动流程说明](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-1415.md): ModelArts训练服务为用户预置了多种主流AI框架,并针对不同框架的特点进行了专门的适配优化。在使用这些预置框架进行模型训练时,用户需要根据所选框架的特点,相应地调整训练启动命令,以确保训练任务能够顺利执行。ModelArts提供4种预置框架,便于用户在创建训练作业时根据需求直接调整使用。4种框架如下:本章节详细介绍基于不同的预置框架 - [开发用于预置框架训练的代码](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-0008.md): 在使用ModelArts平台完成算法开发时,开发者需要利用预置框架来构建和训练模型。然而,预置框架虽然提供了基础功能,但可能无法完全满足特定的业务需求,需要进行定制化开发。为了确保预置框架能够与具体的业务需求完美结合,开发者需要在使用预置框架创建算法之前,预先完成算法代码的开发工作。通过预先开发,可以确保预置框架能够高效地支持模型训练和优 - [开发用于自定义镜像训练的代码](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-1416.md): 在使用ModelArts进行模型训练时,平台提供了多种预置框架和算法,能够满足大部分用户的需求。然而,当预置框架和算法确实无法满足需求时,ModelArts提供了自定义镜像训练的功能,为用户提供了一个灵活的解决方案。通过构建自定义镜像,用户可以完全定制训练环境,满足特定需求。自定义镜像的制作要求用户对容器相关知识有比较深刻的了解,除非订阅 - [创建训练作业](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-0022.md): 本章节内容适用控制台界面为旧版样式的华为云站点。在模型开发过程中,如何高效地优化模型性能是一个关键挑战。传统的模型训练方式往往需要反复尝试不同的模型结构、数据集和超参数组合,这不仅耗时耗力,还可能导致训练效果不理想。针对这一问题,ModelArts的训练模块提供了一套完整的解决方案。它支持创建训练作业、实时监控训练进展以及管理训练版本,帮 - [创建算法](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-0003.md): 机器学习从有限的观测数据中学习一般性的规律,并利用这些规律对未知的数据进行预测。为了获取更准确的预测结果,用户需要选择一个合适的算法来训练模型。针对不同的场景,ModelArts提供大量的算法样例。以下章节提供了关于业务场景、算法学习方式、算法实现方式的指导。ModelArts提供如下方式实现模型训练前的算法准备。使用订阅算法ModelA - [自动模型优化介绍](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-0031.md): ModelArts训练支持超参搜索功能,自动实现模型超参搜索,为您的模型匹配最合适的超参。在模型训练过程中,有很多超参需要根据任务进行调整,比如learning_rate、weight_decay等,这一工作往往需要一个有经验的算法工程师花费一定精力和大量时间进行手动调优。ModelArts支持的超参搜索功能,在无需算法工程师介入的情况下 - [创建自动模型优化的训练作业](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-0036.md): 如果用户使用的AI引擎为pytorch_1.8.0-cuda_10.2-py_3.7-ubuntu_18.04-x86_64和tensorflow_2.1.0-cuda_10.1-py_3.7-ubuntu_18.04-x86_64,并且优化的超参类型为float类型,ModelArts支持用户使用超参搜索功能。在0代码修改的基础下,实现 - [训练大盘监控](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-monitoring-0001.md): 在使用ModelArts进行模型训练时,用户需要实时监控训练任务的运行状态,以确保训练过程的顺利进行。然而,有时用户可能需要更详细的数据分析和管理,而不仅仅是实时监控。为此,ModelArts管理控制台提供了全面的监控和数据导出功能。通过导航至“模型训练 > 训练作业 > 大盘监控”(旧版控制台),用户可以一站式查看训练作业的概览、健康监 - [管理训练实验](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-0020.md): 当训练作业的数量较多时,可能会遇到难以快速定位作业或不便跟踪的情况。为了便于管理训练作业,ModelArts引入了训练实验的概念,类似于对训练作业进行分组管理。用户可以根据需求将作业归类到不同的训练实验中,实现分类管理。每个训练实验可以包含多个同类型的作业。在管理训练实验时,支持以下操作:将单个作业纳入实验、在已有的实验中创建作业、查看实 - [查看训练作业列表和详情](https://support.huaweicloud.com/usermanual-standard-modelarts/develop-modelarts-0013.md): 本章节内容适用控制台界面为旧版样式的华为云站点。在使用ModelArts平台的模型训练功能时,您可能需要查看当前正在进行的训练作业列表及其详细信息,以确保训练过程顺利进行。通过作业列表页面,您可以轻松掌握每个作业的状态,调整列表展示内容,根据需要的属性类型进行筛选过滤,快速查找训练作业,并将训练作业导出为Excel表到本地。单击具体作业, - [推理部署使用场景](https://support.huaweicloud.com/usermanual-standard-modelarts/inference-modelarts-0001.md): 推理部署(Inference Deployment)是人工智能和机器学习领域中的一个重要环节。推理部署是指将训练好的机器学习或深度学习模型,从开发环境转移到实际生产环境中,使其能够对新的、未见过的数据进行预测或推理的过程,确保模型在实际应用中高效、稳定运行,同时满足实时性和资源限制的要求。简单来说,就是让模型在实际应用中发挥作用,根据输入 - [创建模型不同方式的场景介绍](https://support.huaweicloud.com/usermanual-standard-modelarts/inference-modelarts-0003.md): AI开发和调优往往需要大量的迭代和调试,数据集、训练代码或参数的变化都可能会影响模型的质量,如不能统一管理开发流程元数据,可能会出现无法重现最优模型的现象。ModelArts的模型可导入所有训练生成的元模型、上传至对象存储服务(OBS)中的元模型和容器镜像中的元模型,可对所有迭代和调试的模型进行统一管理。创建模型、管理模型版本等功能目前是 - [从训练作业中导入模型文件创建模型](https://support.huaweicloud.com/usermanual-standard-modelarts/inference-modelarts-0006.md): 在ModelArts中创建训练作业,并完成模型训练,在得到满意的模型后,可以将训练后得到的模型导入至模型管理,方便统一管理,同时支持将模型快速部署上线为服务。针对使用订阅算法的训练作业,无需推理代码和配置文件,其生成的模型可直接导入ModelArts。使用容器化部署,导入的元模型有大小限制,详情请参见导入模型对于镜像大小限制。请确保训练作 - [从OBS中导入模型文件创建模型](https://support.huaweicloud.com/usermanual-standard-modelarts/inference-modelarts-0008.md): 针对使用常用框架完成模型开发和训练的场景,可以将您的模型导入至ModelArts中,创建为模型,并进行统一管理。针对创建模型的模型,需符合ModelArts的模型包规范,推理代码和配置文件也需遵循ModelArts的要求,详细说明请参见模型包结构介绍、模型配置文件编写说明、模型推理代码编写说明。使用容器化部署,导入的元模型有大小限制,详情 - [从容器镜像中导入模型文件创建模型](https://support.huaweicloud.com/usermanual-standard-modelarts/inference-modelarts-0009.md): 针对ModelArts目前不支持的AI引擎,您可以通过自定义镜像的方式将编写的模型导入ModelArts。关于自定义镜像规范和说明,请参见模型镜像规范。使用容器化部署,导入的元模型有大小限制,详情请参见导入模型对于镜像大小限制。当自定义镜像更新以后,需要同步更新镜像版本号,或者使用该镜像创建模型时打开镜像复制功能,否则会存在使用新创建的模 - [从AI Gallery订阅模型](https://support.huaweicloud.com/usermanual-standard-modelarts/inference-modelarts-0011.md): 在AI Gallery中,支持订阅官方发布或者他人分享的模型,订阅后的模型,可推送至ModelArts模型管理中,进行统一管理。订阅模型与云服务订阅模型的区别:在管理控制台,模型管理所在位置不同。订阅模型统一管理在模型管理>订阅模型页面中,而云服务订阅模型管理在模型管理>云服务订阅模型页面中。模型来源不同。订阅模型,模型来源于AI Gal - [模型包结构介绍](https://support.huaweicloud.com/usermanual-standard-modelarts/inference-modelarts-0055.md): 创建模型时,如果是从OBS中导入元模型,则需要符合一定的模型包规范。模型包规范适用于单模型场景,如果是多模型场景(例如含有多个模型文件)推荐使用自定义镜像方式。ModelArts推理平台不支持的AI引擎,推荐使用自定义镜像方式。请参考模型镜像规范和制作自定义镜像用于推理,制作自定义镜像。更多的自定义脚本代码示例,请参考自定义脚本代码示例。 - [模型配置文件编写说明](https://support.huaweicloud.com/usermanual-standard-modelarts/inference-modelarts-0056.md): 模型开发者发布模型时需要编写配置文件config.json。模型配置文件描述模型用途、模型计算框架、模型精度、推理代码依赖包以及模型对外API接口。配置文件为JSON格式,参数说明如表1所示。如下代码以TensorFlow引擎为例,您可以根据实际使用的引擎类型修改model_type参数后使用。模型输入key:imagesvalue:图片 - [模型推理代码编写说明](https://support.huaweicloud.com/usermanual-standard-modelarts/inference-modelarts-0057.md): 本章节介绍了在ModelArts中模型推理代码编写的通用方法及说明,针对常用AI引擎的自定义脚本代码示例(包含推理代码示例),请参见自定义脚本代码示例。本文在编写说明下方提供了一个TensorFlow引擎的推理代码示例以及一个在推理脚本中自定义推理逻辑的示例。ModelArts推理因API网关(APIG)的限制,模型单次预测的时间不能超过 - [自定义引擎创建模型规范](https://support.huaweicloud.com/usermanual-standard-modelarts/inference-modelarts-0128.md): 使用自定义引擎创建模型,用户可以通过选择自己存储在SWR服务中的镜像作为模型的引擎,指定预先存储于OBS服务中的文件目录路径作为模型包来创建模型,轻松地应对ModelArts平台预置引擎无法满足个性化诉求的场景。ModelArts将自定义引擎类型的模型部署为服务时,会先将模型相关的SWR镜像下载至集群中,用“uid=1000, gid=1 - [自定义脚本代码示例](https://support.huaweicloud.com/usermanual-standard-modelarts/inference-modelarts-0078.md): 从OBS中导入模型文件创建模型时,模型文件包需符合ModelArts的模型包规范,推理代码和配置文件也需遵循ModelArts的要求。本章节提供针对常用AI引擎的自定义脚本代码示例(包含推理代码示例)。模型推理代码编写的通用方法及说明请见模型推理代码编写说明。TensorFlow存在两种接口类型,keras接口和tf接口,其训练和保存模型 - [实时推理的部署及使用流程](https://support.huaweicloud.com/usermanual-standard-modelarts/inference-modelarts-0097.md): 在线服务(旧版)已下线,届时将为您上线全新升级的在线服务,支持多机多卡等多种全新体验。在创建完模型后,可以将模型部署为一个在线服务。当在线服务的状态处于运行中,则表示在线服务已部署成功,部署成功的在线服务,将为用户提供一个可调用的API,此API为标准RESTful API。访问在线服务时,您可以根据您的业务需求,分别确认使用何种认证方式 - [部署模型为在线服务](https://support.huaweicloud.com/usermanual-standard-modelarts/inference-modelarts-0018.md): 在线推理是指利用部署在远程服务器或云平台上的 AI/机器学习模型,通过网络接收用户输入的数据或问题,并实时返回处理结果或决策的过程。在线推理是一种基于云端模型的实时交互式服务,提供低延迟、高可用性的 AI 智能服务,让用户无需本地部署复杂模型即可获得强大的分析、预测、理解等能力,适用于需要快速响应和交互的场景。ModelArts提供在线部 - [通过Token认证的方式访问在线服务](https://support.huaweicloud.com/usermanual-standard-modelarts/inference-modelarts-0023.md): Token在计算机系统中代表令牌(临时)的意思。拥有Token就代表拥有某种权限。Token认证就是在调用API的时候将Token加到请求消息头,从而通过身份认证,获得操作API的权限。如果在线服务的状态处于运行中,则表示在线服务已部署成功,部署成功的在线服务,将为用户提供一个可调用的API,此API为标准RESTful API。通过To - [通过AK/SK认证的方式访问在线服务](https://support.huaweicloud.com/usermanual-standard-modelarts/inference-modelarts-0024.md): AK/SK认证是华为云ModelArts平台用于身份验证的一种方式,其中AK(Access Key)和SK(Secret Key)是用于访问华为云服务的密钥。如果在线服务的状态处于运行中,则表示在线服务已部署成功。部署成功的在线服务,将为用户提供一个可调用的API,此API为标准RESTful API。用户可以通过AK/SK签名认证方式调 - [通过APP认证的方式访问在线服务](https://support.huaweicloud.com/usermanual-standard-modelarts/inference-modelarts-0025.md): 部署在线服务支持开启APP认证,即ModelArts会为服务注册一个支持APP认证的接口,为此接口配置APP授权后,用户可以使用授权应用的AppKey+AppSecret或AppCode调用该接口。针对在线服务的APP认证,具体操作流程如下。开启支持APP认证功能:开启支持APP认证功能,选择已有APP应用或者创建新的APP应用。在线服务 - [通过公网访问通道的方式访问在线服务](https://support.huaweicloud.com/usermanual-standard-modelarts/inference-modelarts-0105.md): ModelArts推理默认使用公网访问在线服务,您可以使用标准的HTTPS协议或WebSocket协议访问在线服务。在线服务部署成功后,将为用户提供一个可调用的API,此API为标准RESTful API。您可以在服务详情页面,调用指南页签中查看API接口公网地址。调用API访问在线服务时,对预测请求体大小和预测时间有限制:请求体的大小不 - [通过VPC访问通道的方式访问在线服务](https://support.huaweicloud.com/usermanual-standard-modelarts/inference-modelarts-0134.md): 如果您希望在自己账号的VPC内部节点访问ModelArts推理的在线服务,可以使用VPC访问通道的功能,用户通过在自己账号的指定VPC下创建终端节点,连接到ModelArts的终端节点服务,即可在自己的VPC节点中访问在线服务。使用VPC访问通道访问在线服务适用于需要高安全性和低延迟的场景,例如内部系统之间的通信。调用API访问在线服务时 - [通过VPC高速访问通道的方式访问在线服务](https://support.huaweicloud.com/usermanual-standard-modelarts/inference-modelarts-0099.md): 访问在线服务的实际业务中,用户可能会存在如下需求:高吞吐量、低时延TCP或者RPC请求因此,ModelArts提供了VPC直连的高速访问通道功能以满足用户的需求。使用VPC直连的高速访问通道,用户的业务请求不需要经过推理平台,而是直接经VPC对等连接发送到实例处理,访问速度更快。此访问方式适用于需要高带宽和低延迟的场景,例如实时数据处理、 - [使用WebSocket协议的方式访问在线服务](https://support.huaweicloud.com/usermanual-standard-modelarts/inference-modelarts-0106.md): WebSocket是一种网络传输协议,可在单个TCP连接上进行全双工通信,位于OSI模型的应用层。WebSocket协议在2011年由IETF标准化为RFC 6455,后由RFC 7936补充规范。Web IDL中的WebSocket API由W3C标准化。WebSocket使得客户端和服务器之间的数据交换变得更加简单,允许服务端主动向客 - [使用Server-Sent Events协议的方式访问在线服务](https://support.huaweicloud.com/usermanual-standard-modelarts/inference-modelarts-0124.md): Server-Sent Events(SSE)是一种服务器向客户端推送数据的技术,它是一种基于HTTP的推送技术,服务器可以向客户端推送事件。这种技术通常用于实现服务器向客户端单向推送实时数据,例如实时新闻更新、股票价格等。SSE主要解决了客户端与服务器之间的单向实时通信需求(例如大模型回答的流式输出),相较于WebSocket(双向实时 - [将模型部署为批量推理服务](https://support.huaweicloud.com/usermanual-standard-modelarts/inference-modelarts-0039.md): 批量推理将多个输入数据批量处理,一次性返回所有结果。ModelArts支持将模型部署为批量服务,批量服务可对批量数据进行推理,完成数据处理后自动停止。批量推理适用于对大量数据进行离线分析和处理的场景,如大数据分析、批量数据标注、模型评估等。本章节主要介绍如何在ModelArts部署模型为批量推理服务,并查看批量服务预测结果。在ModelA - [查看ModelArts模型详情](https://support.huaweicloud.com/usermanual-standard-modelarts/inference-modelarts-0005.md): 当模型创建成功后,您可在模型列表页查看所有创建的模型。模型列表页包含以下信息。单击模型的“版本数量”,可查看版本列表信息。版本列表中包含以下信息。当模型创建成功后,您可以进入模型详情页查看模型的信息。登录ModelArts管理控制台,在左侧菜单栏中选择模型管理,进入自定义模型列表页面。单击目标模型名称,进入模型详情页面。您可以查看模型的基 - [查看ModelArts模型事件](https://support.huaweicloud.com/usermanual-standard-modelarts/inference-modelarts-0118.md): 创建模型的(从用户可看见创建模型任务开始)过程中,每一个关键事件点在系统后台均有记录,用户可随时在对应模型的详情页面进行查看。方便用户更清楚地了解创建模型过程,遇到任务异常时,更加准确地排查定位问题。可查看的事件点包括:创建模型的过程中,关键事件支持手动/自动刷新。在ModelArts管理控制台的左侧导航栏中选择模型管理,在模型列表中,您 - [管理ModelArts模型版本](https://support.huaweicloud.com/usermanual-standard-modelarts/inference-modelarts-0013.md): 为方便溯源和模型反复调优,在ModelArts中提供了模型版本管理的功能,您可以基于版本对模型进行管理。已在ModelArts中创建模型。在模型页面,单击操作列的创建新版本进入创建新版本页面,参数配置除版本外,将默认选择上一个版本的配置信息,您可以对参数配置进行修改,参数说明请参见创建模型。单击立即创建,完成新版本的创建操作。在模型管理页 - [发布ModelArts模型](https://support.huaweicloud.com/usermanual-standard-modelarts/inference-modelarts-0014.md): 针对ModelArts中创建的模型,支持以下发布方式:发布至AI GalleryAI Gallery是在ModelArts的基础上构建的开发者生态社区,提供算法、模型、数据集等内容的共享,为高校科研机构、模型开发商、解决方案集成商、企业级个人开发者等群体,提供安全、开放的共享,加速AI资产的开发与落地。发布至AI Gallery的资产是免 - [查看在线服务详情](https://support.huaweicloud.com/usermanual-standard-modelarts/inference-modelarts-0019.md): 当模型部署为在线服务成功后,您可以进入在线服务页面,来查看服务详情。登录ModelArts管理控制台,在左侧菜单栏中选择模型部署 > 在线服务,进入在线服务管理页面。单击目标服务名称,进入服务详情页面。您可以查看服务的名称、状态等信息,详情说明请参见表1。在线服务配置参数说明名称在线服务名称。状态在线服务当前状态。来源在线服务的来源。服务 - [查看在线服务的事件](https://support.huaweicloud.com/usermanual-standard-modelarts/inference-modelarts-0119.md): 服务的(从用户可看见部署服务任务开始)整个生命周期中,每一个关键事件点在系统后台均有记录,用户可随时在对应服务的详情页面进行查看。方便用户更清楚地了解服务部署和运行过程,遇到任务异常时,更加准确地排查定位问题。可查看的事件点包括:服务部署和运行过程中,关键事件支持手动/自动刷新。在ModelArts管理控制台的左侧导航栏中选择模型部署 > - [管理在线服务生命周期](https://support.huaweicloud.com/usermanual-standard-modelarts/inference-modelarts-0088.md): 您可以对处于运行完成、异常和停止状态的服务进行启动操作,部署中状态的服务无法启动。启动服务,当服务处于运行中状态后,ModelArts将开始计费。您可以通过如下方式启动服务:登录ModelArts管理控制台,在左侧菜单栏中选择模型部署,进入目标服务类型管理页面。您可以单击操作列的启动,启动服务。登录ModelArts管理控制台,在左侧菜单 - [修改在线服务配置](https://support.huaweicloud.com/usermanual-standard-modelarts/inference-modelarts-0087.md): 对于已部署的服务,您可以修改服务的基本信息以匹配业务变化,更换模型的版本号,实现服务升级。您可以通过如下两种方式修改服务的基本信息:方式一:通过服务管理页面修改服务信息方式二:通过服务详情页面修改服务信息服务已部署成功,“部署中”的服务不支持修改服务信息进行升级。服务升级关系着业务实现,不当的升级操作会导致升级期间业务中断的情况,请谨慎操 - [在云监控平台查看在线服务性能指标](https://support.huaweicloud.com/usermanual-standard-modelarts/modelarts_23_0186.md): SYS.ModelArts为使用户更好地掌握自己的ModelArts在线服务和对应模型负载的运行状态,云服务平台提供了云监控。您可以使用该服务监控您的ModelArts在线服务和对应模型负载,执行自动实时监控、告警和通知操作,帮助您更好地了解服务和模型的各项性能指标。通过设置ModelArts在线服务和模型负载告警规则,用户可自定义监控目 - [集成在线服务API至生产环境中应用](https://support.huaweicloud.com/usermanual-standard-modelarts/inference-modelarts-0028.md): 针对已完成调测的API,可以将在线服务API集成至生产环境中应用。确保在线服务一直处于运行中状态,否则会导致生产环境应用不可用。ModelArts在线服务提供的API是一个标准的RESTful API,可使用HTTPS协议访问。ModelArts提供了SDK用于调用在线服务API,SDK调用方式请参见《SDK参考》>“场景1:部署在线服务 - [设置在线服务故障自动重启](https://support.huaweicloud.com/usermanual-standard-modelarts/inference-modelarts-0135.md): 当系统检测到Snt9b硬件故障时,自动复位Snt9b芯片并重启推理在线服务,提升了推理在线服务的恢复速度。仅支持使用Snt9b资源的同步在线服务。只支持针对整节点资源复位,请确保部署的在线服务为8*N卡规格,请谨慎评估对部署在该节点的其他服务的影响。用户可以在部署在线服务任务时,勾选高级选项的现在配置,可以看到故障自动重启参数,打开开关即 - [查看批量服务详情](https://support.huaweicloud.com/usermanual-standard-modelarts/inference-modelarts-0126.md): 当模型部署为批量服务成功后,您可以进入批量服务页面,来查看服务详情。登录ModelArts管理控制台,在左侧菜单栏中选择模型部署>批量服务,进入批量服务管理页面。单击目标服务名称,进入服务详情页面。您可以查看服务的名称、状态等信息,详情说明请参见表1。批量服务参数参数说明名称批量服务名称。服务ID批量服务的ID。状态批量服务当前状态。任务 - [查看批量服务的事件](https://support.huaweicloud.com/usermanual-standard-modelarts/inference-modelarts-0131.md): 服务的(从用户可看见部署服务任务开始)整个生命周期中,每一个关键事件点在系统后台均有记录,用户可随时在对应服务的详情页面进行查看。方便用户更清楚地了解服务部署和运行过程,遇到任务异常时,更加准确地排查定位问题。可查看的事件点包括:服务部署和运行过程中,关键事件支持手动/自动刷新。在ModelArts管理控制台的左侧导航栏中选择模型部署 > - [管理批量服务生命周期](https://support.huaweicloud.com/usermanual-standard-modelarts/inference-modelarts-0132.md): 您可以对处于运行完成、异常和停止状态的服务进行启动操作,部署中状态的服务无法启动。启动服务,当服务处于运行中状态后,ModelArts将开始计费。您可以通过如下方式启动服务:登录ModelArts管理控制台,在左侧菜单栏中选择模型部署,进入目标服务类型管理页面。您可以单击操作列的启动,启动服务。登录ModelArts管理控制台,在左侧菜单 - [修改批量服务配置](https://support.huaweicloud.com/usermanual-standard-modelarts/inference-modelarts-0133.md): 对于已部署的服务,您可以修改服务的基本信息以匹配业务变化,更换模型的版本号,实现服务升级。您可以通过如下两种方式修改服务的基本信息:方式一:通过服务管理页面修改服务信息方式二:通过服务详情页面修改服务信息服务已部署成功,“部署中”的服务不支持修改服务信息进行升级。服务升级关系着业务实现,不当的升级操作会导致升级期间业务中断的情况,请谨慎操 - [模型的自定义镜像制作流程](https://support.huaweicloud.com/usermanual-standard-modelarts/modelarts_23_0219.md): 如果您使用了ModelArts不支持的AI引擎开发模型,也可通过制作自定义镜像,导入ModelArts创建为模型,并支持进行统一管理和部署为服务。基础镜像:镜像制作的一个基本概念,您可以在基础镜像上构建业务镜像。基础镜像可以是ModelArts预置镜像或统一镜像。场景一:预置镜像的环境软件满足要求,只需要导入模型包,就能用于创建模型,通过 - [在Notebook中通过镜像保存功能制作自定义镜像用于推理](https://support.huaweicloud.com/usermanual-standard-modelarts/docker-modelarts_6002.md): 本文详细介绍如何将本地已经制作好的模型包导入ModelArts的开发环境Notebook中进行调试和保存,然后将保存后的镜像部署到推理。本案例仅适用于华为云北京四和上海一站点。操作流程如下:步骤一:在Notebook中复制模型包步骤二:在Notebook中调试模型步骤三:Notebook中保存镜像步骤四:使用保存成功的镜像用于推理部署登录 - [在Notebook中通过Dockerfile从0制作自定义镜像用于推理](https://support.huaweicloud.com/usermanual-standard-modelarts/docker-modelarts_0031.md): 针对ModelArts目前不支持的AI引擎,您可以通过自定义镜像的方式将编写的模型导入ModelArts,创建为模型。本文详细介绍如何在ModelArts的开发环境Notebook中使用基础镜像构建一个新的推理镜像,并完成模型的创建,部署为在线服务。本案例仅适用于华为云北京四和上海一站点。操作流程如下:步骤一:在Notebook中构建一个 - [在ECS中通过Dockerfile从0制作自定义镜像用于推理](https://support.huaweicloud.com/usermanual-standard-modelarts/modelarts_23_0270.md): 针对ModelArts目前不支持的AI引擎,您可以针对该引擎构建自定义镜像,并将镜像导入ModelArts,创建为模型。本文详细介绍如何使用自定义镜像完成模型的创建,并部署成在线服务。操作流程如下:本地构建镜像:在本地制作自定义镜像包,镜像包规范可参考创建模型的自定义镜像规范。本地验证镜像并上传镜像至SWR服务:验证自定义镜像的API接口 - [ModelArts支持云审计的关键操作](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0015.md): ModelArts支持对接云审计CTS服务,通过云审计服务,您可以记录与ModelArts相关的操作事件,便于日后的查询、审计和回溯。已开通云审计服务。详细操作请参见《云审计服务用户指南》。对于表8中购买套餐包和订购人工智能云套餐操作的审计日志查看,仅支持华北-北京四、华北-北京一和华东-上海一Region。 - [查看ModelArts相关审计日志](https://support.huaweicloud.com/usermanual-standard-modelarts/resmgmt-modelarts_0016.md): 在您开启了云审计服务后,系统会记录ModelArts的相关操作,且控制台保存最近7天的操作记录。本节介绍如何在云审计服务管理控制台查看最近7天的操作记录。登录云审计服务管理控制台。在管理控制台左上角单击图标,选择区域。在左侧导航栏中,单击事件列表,进入事件列表页面。事件列表支持通过筛选来查询对应的操作事件。当前事件列表支持四个维度的组合查