网络
虚拟私有云 VPC
弹性公网IP EIP
弹性负载均衡 ELB
NAT网关 NAT
云专线 DC
虚拟专用网络 VPN
云连接 CC
VPC终端节点 VPCEP
企业路由器 ER
企业交换机 ESW
全球加速 GA
企业连接 EC
云原生应用网络 ANC
安全与合规
安全技术与应用
Web应用防火墙 WAF
企业主机安全 HSS
云防火墙 CFW
安全云脑 SecMaster
DDoS防护 AAD
数据加密服务 DEW
数据库安全服务 DBSS
云堡垒机 CBH
数据安全中心 DSC
云证书管理服务 CCM
威胁检测服务 MTD
态势感知 SA
认证测试中心 CTC
边缘安全 EdgeSec
应用中间件
微服务引擎 CSE
分布式消息服务Kafka版
分布式消息服务RabbitMQ版
分布式消息服务RocketMQ版
API网关 APIG
分布式缓存服务 DCS
多活高可用服务 MAS
事件网格 EG
管理与监管
统一身份认证服务 IAM
消息通知服务 SMN
云监控服务 CES
应用运维管理 AOM
应用性能管理 APM
云日志服务 LTS
云审计服务 CTS
标签管理服务 TMS
配置审计 Config
应用身份管理服务 OneAccess
资源访问管理 RAM
组织 Organizations
资源编排服务 RFS
优化顾问 OA
IAM 身份中心
云运维中心 COC
资源治理中心 RGC
解决方案
高性能计算 HPC
SAP
混合云灾备
开天工业工作台 MIW
Haydn解决方案工厂
数字化诊断治理专家服务
云生态
云商店
合作伙伴中心
华为云开发者学堂
华为云慧通差旅
开发与运维
软件开发生产线 CodeArts
需求管理 CodeArts Req
流水线 CodeArts Pipeline
代码检查 CodeArts Check
编译构建 CodeArts Build
部署 CodeArts Deploy
测试计划 CodeArts TestPlan
制品仓库 CodeArts Artifact
移动应用测试 MobileAPPTest
CodeArts IDE Online
开源镜像站 Mirrors
性能测试 CodeArts PerfTest
应用管理与运维平台 ServiceStage
云应用引擎 CAE
开源治理服务 CodeArts Governance
华为云Astro轻应用
CodeArts IDE
Astro工作流 AstroFlow
代码托管 CodeArts Repo
漏洞管理服务 CodeArts Inspector
联接 CodeArtsLink
软件建模 CodeArts Modeling
Astro企业应用 AstroPro
CodeArts盘古助手
华为云Astro大屏应用
计算
弹性云服务器 ECS
Flexus云服务
裸金属服务器 BMS
云手机服务器 CPH
专属主机 DeH
弹性伸缩 AS
镜像服务 IMS
函数工作流 FunctionGraph
云耀云服务器(旧版)
VR云渲游平台 CVR
Huawei Cloud EulerOS
云化数据中心 CloudDC
网络
虚拟私有云 VPC
弹性公网IP EIP
弹性负载均衡 ELB
NAT网关 NAT
云专线 DC
虚拟专用网络 VPN
云连接 CC
VPC终端节点 VPCEP
企业路由器 ER
企业交换机 ESW
全球加速 GA
企业连接 EC
云原生应用网络 ANC
CDN与智能边缘
内容分发网络 CDN
智能边缘云 IEC
智能边缘平台 IEF
CloudPond云服务
安全与合规
安全技术与应用
Web应用防火墙 WAF
企业主机安全 HSS
云防火墙 CFW
安全云脑 SecMaster
DDoS防护 AAD
数据加密服务 DEW
数据库安全服务 DBSS
云堡垒机 CBH
数据安全中心 DSC
云证书管理服务 CCM
威胁检测服务 MTD
态势感知 SA
认证测试中心 CTC
边缘安全 EdgeSec
大数据
MapReduce服务 MRS
数据湖探索 DLI
表格存储服务 CloudTable
可信智能计算服务 TICS
推荐系统 RES
云搜索服务 CSS
数据可视化 DLV
数据接入服务 DIS
数据仓库服务 GaussDB(DWS)
数据治理中心 DataArts Studio
湖仓构建 LakeFormation
智能数据洞察 DataArts Insight
应用中间件
微服务引擎 CSE
分布式消息服务Kafka版
分布式消息服务RabbitMQ版
分布式消息服务RocketMQ版
API网关 APIG
分布式缓存服务 DCS
多活高可用服务 MAS
事件网格 EG
开天aPaaS
应用平台 AppStage
开天企业工作台 MSSE
开天集成工作台 MSSI
API中心 API Hub
云消息服务 KooMessage
交换数据空间 EDS
云地图服务 KooMap
云手机服务 KooPhone
组织成员账号 OrgID
云空间服务 KooDrive
管理与监管
统一身份认证服务 IAM
消息通知服务 SMN
云监控服务 CES
应用运维管理 AOM
应用性能管理 APM
云日志服务 LTS
云审计服务 CTS
标签管理服务 TMS
配置审计 Config
应用身份管理服务 OneAccess
资源访问管理 RAM
组织 Organizations
资源编排服务 RFS
优化顾问 OA
IAM 身份中心
云运维中心 COC
资源治理中心 RGC
区块链
区块链服务 BCS
数字资产链 DAC
华为云区块链引擎服务 HBS
解决方案
高性能计算 HPC
SAP
混合云灾备
开天工业工作台 MIW
Haydn解决方案工厂
数字化诊断治理专家服务
价格
成本优化最佳实践
专属云商业逻辑
云生态
云商店
合作伙伴中心
华为云开发者学堂
华为云慧通差旅
其他
管理控制台
消息中心
产品价格详情
系统权限
客户关联华为云合作伙伴须知
公共问题
宽限期保留期
奖励推广计划
活动
云服务信任体系能力说明
开发与运维
软件开发生产线 CodeArts
需求管理 CodeArts Req
流水线 CodeArts Pipeline
代码检查 CodeArts Check
编译构建 CodeArts Build
部署 CodeArts Deploy
测试计划 CodeArts TestPlan
制品仓库 CodeArts Artifact
移动应用测试 MobileAPPTest
CodeArts IDE Online
开源镜像站 Mirrors
性能测试 CodeArts PerfTest
应用管理与运维平台 ServiceStage
云应用引擎 CAE
开源治理服务 CodeArts Governance
华为云Astro轻应用
CodeArts IDE
Astro工作流 AstroFlow
代码托管 CodeArts Repo
漏洞管理服务 CodeArts Inspector
联接 CodeArtsLink
软件建模 CodeArts Modeling
Astro企业应用 AstroPro
CodeArts盘古助手
华为云Astro大屏应用
存储
对象存储服务 OBS
云硬盘 EVS
云备份 CBR
高性能弹性文件服务 SFS Turbo
弹性文件服务 SFS
存储容灾服务 SDRS
云硬盘备份 VBS
云服务器备份 CSBS
数据快递服务 DES
云存储网关 CSG
专属分布式存储服务 DSS
数据工坊 DWR
地图数据 MapDS
键值存储服务 KVS
容器
云容器引擎 CCE
云容器实例 CCI
容器镜像服务 SWR
云原生服务中心 OSC
应用服务网格 ASM
华为云UCS
数据库
云数据库 RDS
数据复制服务 DRS
文档数据库服务 DDS
分布式数据库中间件 DDM
云数据库 GaussDB
云数据库 GeminiDB
数据管理服务 DAS
数据库和应用迁移 UGO
云数据库 TaurusDB
人工智能
AI开发平台ModelArts
华为HiLens
图引擎服务 GES
图像识别 Image
文字识别 OCR
自然语言处理 NLP
内容审核 Moderation
图像搜索 ImageSearch
医疗智能体 EIHealth
企业级AI应用开发专业套件 ModelArts Pro
人脸识别服务 FRS
对话机器人服务 CBS
语音交互服务 SIS
人证核身服务 IVS
视频智能分析服务 VIAS
城市智能体
自动驾驶云服务 Octopus
盘古大模型 PanguLargeModels
IoT物联网
设备接入 IoTDA
全球SIM联接 GSL
IoT数据分析 IoTA
路网数字化服务 DRIS
IoT边缘 IoTEdge
设备发放 IoTDP
企业应用
域名注册服务 Domains
云解析服务 DNS
企业门户 EWP
ICP备案
商标注册
华为云WeLink
华为云会议 Meeting
隐私保护通话 PrivateNumber
语音通话 VoiceCall
消息&短信 MSGSMS
云管理网络
SD-WAN 云服务
边缘数据中心管理 EDCM
云桌面 Workspace
应用与数据集成平台 ROMA Connect
ROMA资产中心 ROMA Exchange
API全生命周期管理 ROMA API
政企自服务管理 ESM
视频
实时音视频 SparkRTC
视频直播 Live
视频点播 VOD
媒体处理 MPC
视频接入服务 VIS
数字内容生产线 MetaStudio
迁移
主机迁移服务 SMS
对象存储迁移服务 OMS
云数据迁移 CDM
迁移中心 MGC
专属云
专属计算集群 DCC
开发者工具
SDK开发指南
API签名指南
DevStar
华为云命令行工具服务 KooCLI
Huawei Cloud Toolkit
CodeArts API
云化转型
云架构中心
云采用框架
用户服务
账号中心
费用中心
成本中心
资源中心
企业管理
工单管理
客户运营能力
国际站常见问题
支持计划
专业服务
合作伙伴支持计划
我的凭证
华为云公共事业服务云平台
工业软件
工业数字模型驱动引擎
硬件开发工具链平台云服务
工业数据转换引擎云服务

创建Standard专属资源池

更新时间:2024-11-27 GMT+08:00
分享

本章节主要介绍创建Standard专属资源池的详细操作。

前提条件

  • 已经创建虚拟私有云。
  • 已经创建子网。

步骤一:创建网络

ModelArts网络是承载ModelArts资源池节点的网络连接,基于华为云的VPC进行封装,对用户仅提供网络名称以及CIDR网段的选择项,为了防止在打通VPC的时候有网段的冲突,因此提供了多个CIDR网段的选项,用户可以根据自己的实际情况进行选择。虚拟私有云VPC是一套为实例构建的逻辑隔离的、由用户自主配置和管理的虚拟网络环境。为云服务器、云容器、云数据库等资源构建隔离的、用户自主配置和管理的虚拟网络环境,提升用户资源的安全性,简化用户的网络部署。

  1. 登录ModelArts管理控制台,在左侧导航栏中选择“AI专属资源池 > 弹性集群Cluster”,默认进入“Standard资源池”页面。
  2. 切换到“网络”页签,单击“创建”,弹出“创建网络”页面。
  3. 在“创建网络”弹窗中填写网络信息。
    • 网络名称:创建网络时默认生成网络名称,也可自行修改。
    • 网段类型:可选“预置”和“自定义”。自定义网络建议使用网段:10.0.0.0/8~24、172.16.0.0/12~24、192.168.0.0/16~24,子网掩码可选范围8-28。
    • IPV6:开启IPv6功能后,将自动为子网分配IPv6网段,暂不支持自定义设置IPv6网段,该功能一旦开启,将不能关闭。(如果创建网络时未勾选开启IPv6,也可在创建网络后在操作列单击“更多>启用IPv6”,如图2
    图1 创建网络
    图2 启用IPv6
    说明:
    • 单用户最多可创建15个网络。
    • 网段设置以后不能修改,避免与将要打通的VPC网段冲突。可能冲突的网段包括:
      • 用户的VPC网段
      • 容器网段(固定是172.16.0.0/16)
      • 服务网段(固定是10.247.0.0/16)
  4. 确认无误后,单击“确定”

步骤二:打通VPC(可选)

通过打通VPC,可以方便用户跨VPC使用资源,提升资源利用率。

  1. “网络”页签,单击网络列表中某个网络操作列的“打通VPC”
    图3 打通VPC
  2. 在打通VPC弹框中,打开“打通VPC”开关,在下拉框中选择可用的VPC和子网。
    说明:

    需要打通的对端网络不能和当前网段重叠。

    图4 打通VPC参数选择
    • 如果没有VPC可选,可以单击右侧的“创建虚拟私有云”,跳转到网络控制台,申请创建虚拟私有云。
    • 如果没有子网可选,可以单击右侧的“创建子网”,跳转到网络控制台,创建可用的子网。
    • 支持1个VPC下多个子网的打通,如果VPC下有多个子网,会显示“+”,单击“+”即可添加子网(上限10个)。
    • 如果需要使用打通VPC的方式实现专属资源池访问公网,由于要访问的公网地址不确定,一般是建议用户在VPC中创建SNAT。此场景下,在打通VPC后,专属资源池中作业访问公网地址,默认不能转发到用户VPC的SNAT,需要提交工单联系技术支持在专属资源池VPC的路由中添加指向对等连接的缺省路由。当您开启默认路由后,在打通VPC时,会将ModelArts网络0.0.0.0/0路由作为默认路由,此时无需提交工单添加缺省路由即可完成网络配置。

步骤三:创建Standard专属资源池

  1. 登录ModelArts管理控制台,在左侧菜单栏中选择“AI专属资源池 > 弹性集群Cluster”。
  2. 在“Standard资源池”页签,单击“购买AI专属集群”,进入购买AI专属集群界面,参见下表填写参数。
    表1 AI专属集群的参数说明

    参数名称

    子参数

    说明

    计费模式

    -

    计费模式可以选择“包年/包月”“按需计费”

    • 包年/包月是预付费模式,按订单的购买周期计费,适用于可预估资源使用周期的场景,价格比按需计费模式更优惠。
    • 按需计费是后付费模式,按云服务器的实际使用时长计费,可以随时开通/删除云服务器。

    集群规格

    集群名称

    Standard专属资源池的名称。

    只能以小写字母开头,由小写字母、数字、中划线(-)组成,不能以中划线结尾。

    购买方案

    ModelArts Standard场景下选择“ModelArts Standard(标准版)”

    “ModelArts Lite Elastic Cluster(原生接口)”用于ModelArts Lite Cluster场景,相关资料请见《ModelArts Lite Cluster用户指南》。该参数仅在贵阳一区域显示。

    资源池类型

    可选物理资源池和逻辑资源池。逻辑资源池与规格有关,如果无逻辑规格则不显示逻辑资源池。

    物理资源池不支持弹性资源,优势是提供更高的隔离性,物理隔离,网络专属,且支持网络打通等。

    逻辑资源池支持弹性资源,优势是创建、扩缩容更快。

    作业类型

    根据业务需要,选择该资源池支持的作业类型,包括“开发环境”、“训练作业”和“推理服务”。

    集群高级配置

    • 集群规格:可以保持默认或选择自定义。选择自定义时,支持设置集群规模、开启控制节点高可用开关。
      • 集群规模:表示资源池支持管理的最大实例数量,请根据业务场景选择。
      • 控制节点高可用:开启后,系统为您的集群创建三个控制平面节点,确保集群的可靠性。如果集群规模为1000/2000节点,则必须开启。如果关闭高可用,您的集群只会创建一个控制平面节点。资源池创建后,控制节点高可用的开启或关闭状态不可修改。
    • 控制节点分布:可以选择随机分配,也可以指定可用区。控制节点推荐尽可能随机分布在不同可用区以提高容灾能力。
      • 随机分配:系统会随机分配控制节点的可用区,尽可能将控制节点随机分布在不同可用区以提高容灾能力 。如果某可用区资源不足,将分配至资源充足的可用区,优先保障集群创建成功,可能无法保障可用区级容灾。
      • 指定可用区:自定义选择控制节点的可用区。

    网络

    MA网络

    指定资源池运行的网络,可以与该网络中的其他云服务资源实例互通。仅物理资源池需要设置网络。

    在下拉框中选择,如果没有可用网络,单击右侧的“创建”,创建一个可用的网络。创建网络相关可以参考步骤一:创建网络章节。

    IPv6网络

    开启IPv6功能。如果开启了此功能,要求资源池绑定的网络也开启IPv6功能,网络开启IPv6可以参考步骤一:创建网络章节。该功能一旦开启,将不能关闭。

    默认规格

    CPU架构

    CPU架构指的是中央处理器(CPU)的指令集和设计规范。支持X86和ARM64两种不同的CPU架构。请根据实际需要选择。

    实例规格类型

    支持CPU、GPU、Ascend三种芯片规格资源,根据实际需要选择。

    实例规格

    在下拉框中选择需要使用的规格。平台分配的资源规格包含了一定的系统损耗,实际可用的资源量小于规格标称的资源。实际可用的资源量可在专属资源池创建成功后,在详情页的“节点”页签中查看。

    当前部分规格为受限购买(如Ascend规格),需要提前联系客户经理申请开通资源规格,预计1~3个工作日内开通(如果无客户经理可提交工单反馈)。

    可用区

    您可以根据实际情况选择随机分配”“指定AZ”。可用区是在同一区域下,电力、网络隔离的物理区域。可用区之间内网互通,不同可用区之间物理隔离。

    • 随机分配:系统自动分配可用区。
    • 指定AZ:指定资源池节点在哪个可用区域。考虑系统容灾时,推荐指定节点在同一个可用区。可设置可用区的实例数。

    实例数

    选择专属资源池的实例数,选择的实例数越多,计算性能越强。

    当“可用区”选择“指定AZ”时,实例数会根据可用区的数据自动计算,此处无需再次设置。

    说明:

    单次创建时,实例数建议不大于30,否则可能触发限流导致创建失败。

    部分规格支持整柜购买,此时实例数量会显示为“数量*整柜”,购买的实例总数为两者的乘积。整柜购买可实现不同任务间的物理隔离,避免通信冲突,在任务规模增大的同时保证计算性能线性度不下降。整柜下的实例生命周期需保持一致,需要一起创建、一起删除。

    节点高级配置

    开启“节点高级配置”开关后,支持设置实例的操作系统。

    存储配置

    部分规格支持“存储配置”开关,该参数默认关闭。

    系统盘

    打开“存储配置”开关后,可以看到每个实例默认自带的系统盘的磁盘类型、大小或数量。

    部分规格没有携带系统盘,在创建专属资源池时支持设置系统盘的磁盘类型和大小。

    容器盘

    打开“存储配置”开关后,可以看到每个实例自带的容器盘的磁盘类型、大小和数量。容器盘的类型只能是本地盘或云硬盘,不允许修改。

    部分规格没有携带容器盘,在创建专属资源池时支持设置容器盘的磁盘类型和大小。此时,磁盘类型仅支持云硬盘(包括通用SSO、高IO和超高IO)。

    添加容器数据盘

    部分规格支持额外挂载容器数据盘,可以看到“添加容器数据盘”参数,单击该参数前面的+号,可以给专属资源池的每个实例额外挂载容器数据盘,此处挂载的盘都是EVS云硬盘,会单独收费。

    支持设置挂载盘的磁盘类型、大小和数量,具体取值以控制台实际显示为准。

    容器盘高级配置-指定磁盘空间

    容器盘空间默认划分为两块,一块用于存放容器引擎 (Docker/Containerd) 工作目录、容器镜像的数据和镜像元数据;另一块用于Kubelet组件和EmptyDir临时存储等。通过“指定磁盘空间”参数设置这两块分区大小的比例。容器引擎空间的剩余容量将会影响镜像下载和容器的启动及运行。

    容器盘的类型是本地盘时,不支持设置“指定磁盘空间”

    容器盘高级配置-容器引擎空间大小

    该参数限制的是POD容器空间分配的大小。仅支持整数, 默认值与最小值为50GiB,不同规格的最大值不同,数值有效范围请参考界面提示。自定义设置容器引擎空间大小不会造成额外费用增加。

    该参数限制了单个POD作业使用磁盘的大小。

    容器盘高级配置-写入模式

    部分规格支持设置磁盘的写入模式,写入模式包括“线性”“条带化”

    • 线性:线性逻辑卷是将一个或多个物理卷整合为一个逻辑卷,实际写入数据时会先往一个基本物理卷上写入,当存储空间占满时再往另一个基本物理卷写入。
    • 条带化:创建逻辑卷时指定条带化,当实际写入数据时会将连续的数据分成大小相同的块,然后依次存储在多个物理卷上,实现数据的并发读写从而提高读写性能。条带化模式的存储池不支持扩容。

    新增规格

    支持添加多个规格。限制如下:

    • 添加的多个规格项中,不能有相同的规格。
    • 选择多个规格的CPU架构必须相同。例如都是X86,或者都是ARM。
    • 如果选择了多个GPU或NPU规格,由于不同规格的参数网络平面不互通,分布式训练时训练速度会受到影响。如果您要做分布式训练,建议您只选择一个GPU或NPU规格。
    • 一个资源池中,最多可添加10种规格。

    资源调度与切分

    自定义驱动

    默认关闭。部分GPU和Ascend规格资源池允许自定义安装驱动。集群中默认会安装驱动,无需用户操作。只有需要指定驱动版本时,需要开启。

    GPU驱动/Ascend驱动

    打开“自定义驱动”开关,显示此参数,选择GPU/Ascend驱动。如果实例规格类型为GPU则显示“GPU驱动”,如果实例规格类型为Ascend则显示“Ascend驱动”。

    开启高可用冗余

    -

    • 开启高可用冗余:是否开启资源池的高可用冗余,超节点默认开启高可用冗余。
    • 冗余节点分布策略:冗余节点的分布策略,超节点仅支持step均分:每个超节点内预留相同数量的冗余节点。
    • 冗余实例数:此规格设置的高可用冗余实例数量。冗余系数指的是冗余节点分布策略为step均分时,每个超节点内预留的冗余节点数量。
    说明:

    当前仅Snt9C规格支持该功能。

    高级配置

    集群描述(可选)

    输入集群描述信息,方便查找区分集群。

    标签

    单击“添加新标签”,可以为Standard资源池配置标签信息,通过标签实现资源的分组管理。此处的标签信息可以同源标签管理服务TMS中预定义的标签信息,也可以输入自定义标签。也可以在创建完成后的Standard资源池详情页面中通过“标签”页签设置标签信息。

    说明:

    TMS预定义标签对所有支持标签功能的服务资源可见。自定义标签只对自己服务可见。

    网段

    可选默认和自定义。

    • 默认:系统随机分配一个不冲突的网段供用户使用,因后续不支持修改建议商用场景选择手动分配,确保网段符合用户诉求。
    • 自定义:需要自定义K8S容器网段和K8S服务网段。
      • K8S容器网段:集群下容器使用的网段,决定了集群下容器的数量上限。创建后不可修改。
      • K8S服务网段:同一集群下容器互相访问时使用的Service资源的网段。决定了Service资源的上限。 创建后不可修改。

    购买时长

    -

    选择购买时长。只有选择“包年/包月”计费模式时才需填写。

    自动续费

    是否自动续费。只有选择“包年/包月”计费模式时才需填写。

    • 按月购买:自动续费周期为1个月。
    • 按年购买:自动续费周期为1年。
  3. 单击“立即购买”,即可创建专属资源池。
    • 当资源池创建成功后,资源池的状态会变成“运行中”,当“节点个数”中的“可用”和“总数”值大于0时,资源池才能下发任务。
    • 可以将鼠标放在“创建中”字样上,查看当前创建过程详情。如果单击查看详情,可跳转到“操作记录”中。
    • 可以在资源池列表左上角“操作记录”中查看资源池的任务记录。

常见问题

创建专属资源池时,能选到规格但最终创建时发生报错,提示无可用资源?

由于专属资源的可选规格是动态监测的,因此在极少数情况下会出现,规格在购买界面可以被选择,但由于没有及时支付和创建资源池,导致该规格售罄创建失败。

建议您在创建界面更换规格重新创建资源池。

为什么无法使用资源池节点上的全部CPU资源?

由于资源池节点上会安装系统、插件等内容,因此不能完全使用所有资源。例如:资源池节点是8U,节点分配给系统组件部分CPU,可用的资源会小于8U。

建议您在启动任务前,在该资源池的详情页中,单击“节点”页签,查看实际可用的CPU资源。

提示

您即将访问非华为云网站,请注意账号财产安全

文档反馈

文档反馈

意见反馈

0/500

标记内容

同时提交标记内容