更新时间:2026-08-29 GMT+08:00
分享

约束与限制

本节介绍ModelArts服务在使用过程中的约束和限制。

规格限制

表1 规格说明

资源类型

规格

说明

计算资源

所有按需计费、包年/包月、套餐包中的计算资源规格,包括CPU、GPU和NPU

购买的所有类型的计算资源均不支持跨Region使用。

计算资源

套餐包

套餐包仅用于公共资源池,不能用于专属资源池。

功能限制

表2 功能约束与限制

功能

使用限制

专属资源池

  • 单次创建专属资源池时,节点数建议不大于30,否则可能触发限流导致创建失败。更多信息,请参见创建专属资源池
  • 专属资源池扩缩容:
    • 只支持对状态为“运行中”的进行,且不能缩容到0。
    • 缩容操作有可能影响正在运行中的任务,且该动作不可回退,该机型若存在本地盘,则本地盘上的数据会被清除,不可恢复,请谨慎操作。由于资源池启用了开发环境,缩容后可能导致已经创建的使用EVS存储的Notebook不可用。
    • 包周期的专属资源池扩缩容,只能增加规格,不能减少规格。
  • 专属资源池状态处于“运行中”时,才能修改资源池的作业类型。
  • Vnt1机型不提供SLA(Service Level Agreement)承诺。
  • Ant8机型不支持使用570及以上版本驱动。
  • 事件中心页面授权运维:
    • 当前中国站所有站点均支持此功能,国际站部分站点(香港、约翰内斯堡和新加坡)站点支持此功能。
    • 仅Snt9b、超节点Snt9b21和超节点Snt9b23支持通过计划事件发起硬件维护。
    • 超节点重部署需要在物理超节点内操作。当超节点达到满配48台时,不支持重部署操作,该情况下会直接推送超节点系统维护计划事件。
    • 如果计划事件不满足事件状态,授权处理按钮为置灰状态。
    • 节点本地盘恢复和超节点本地盘恢复操作将会导致本地盘数据丢失,授权前请先迁移业务和备份数据。本地盘恢复后需要登录到轻量算力节点内完成本地盘分区。
  • 专属资源池驱动升级时:
    • 专属资源池状态处于运行中,且目标节点池中的节点需要含有GPU/NPU资源,节点池驱动处于运行中。
    • 对于资源队列,需要开启节点绑定后才能进行驱动升级。
    • 节点池驱动升级时,资源队列下绑定的节点不会升级到节点池指定的驱动版本。如果要升级该资源队列下节点的驱动,需要在对应的资源队列进行驱动升级。如需升级整个节点池,需先关闭节点绑定
    • GPU节点池驱动升级前,需要将该资源池的插件“AI 套件 - GPU”升级到1.2.24及以上。
    • 对于逻辑资源池,需要开启节点绑定后才能进行驱动升级,请提交工单联系工程师开启节点绑定。
  • 迁移专属资源池和网络至其他工作空间:
    • 需要确保资源池当前状态为“运行中”,且没有正在进行的作业或任务。
    • 如果资源池中有正在运行的作业,需先停止或迁移这些作业。
    • 子用户仅限于对自己创建的工作空间下的资源池和网络进行迁移操作。
  • 配置专属资源池可访问公网时:
    • 已拥有部署SNAT的弹性云服务器。
    • 待部署SNAT的弹性云服务器操作系统为Linux操作系统。
    • 待部署SNAT的弹性云服务器网卡已配置为单网卡。
  • 关联专属资源池的网络至SFS Turbo时:
    • 关联SFS Turbo功能,仅适用于HPC型的文件系统。对应文件系统类型为**MB/s/TiB
    • 一个SFS盘最多可关联1个网络。已关联的SFS Turbo无法再次关联。
    • 需避免vpc网段与sfsturbo文件系统网段冲突:详情请参见网段配置建议
  • 变更专属资源池超节点规格时:
    • 仅针对状态为“运行中”的超节点专属资源池进行规格变更。
    • 变更规格过程中,请勿对涉及的节点进行其他操作。
    • 扩容时,不影响业务和数据。
    • 缩容时,被删除节点上的业务会被终止。
  • 在专属资源池添加模型预热时:
    • 当前仅部分站点(西南-贵阳一,华东二)支持此功能。
    • 物理池有模型预热作业时不能创建资源队列。
    • 物理池有资源队列时不能创建物理池模型预热作业,需要绑定节点后为子池创建模型预热作业。
    • 模型预热任务占用资源池节点内存空间。在资源池同时使用训练作业及推理作业的场景下,为保障训练作业不受模型预热任务影响,建议通过创建资源队列隔离推理、训练场景并开启节点绑定,然后在推理作业资源队列中创建模型预热任务。
    • 预热任务将文件预热到资源池实例内创建目录/tmp/warmup/权重预热ID,请不要登录实例进入此目录,此操作可能导致预热任务无法删除。 建议模型预热任务占用内存总量不超过资源池资源规格内存的50%

Notebook

  • 使用自定义镜像做Notebook开发时,镜像中集成的模型、框架、代码和数据等由使用者保证其稳定性、性能和精度,并承担开源内容使用风险。使用者可通过ModelArts平台的标准输出和日志等方式分析和解决问题。
  • Notebook提供的免费访问公网代理的带宽为多个用户共享,高峰时段多用户同时使用时不保证带宽性能。对公网访问性能有高要求的场景,建议使用自建公网代理。
  • Notebook挂载的扩展存储为OBS的对象桶或并行文件系统时,OBS文件数量过多会导致访问性能下降。对性能有高要求的场景,建议使用SFS Turbo高性能文件系统或者EVS存储。
  • 在Notebook中部署在线服务不支持对外提供推理服务。
  • 不建议在Notebook中执行高IO、高CPU和高内存消耗的任务(如重型训练作业),此类任务会导致CPU或内存超负荷、容器崩溃、实例重启并进入运行错误状态。训练作业建议在训练平台执行。
  • 不建议在Notebook中使用SCP命令将文件复制到本地,存在性能问题。
  • Notebook实例删除后不可恢复,挂载的EVS云硬盘数据也将被删除,请谨慎操作。对象存储OBS(对象桶和并行文件系统)及SFS Turbo的挂载数据不受影响。
  • 只有Notebook实例状态为“停止”时,才能变更Notebook实例镜像。
  • 只有Notebook实例状态为“停止”、“运行中”或“启动失败”时,才能变更Notebook实例规格。
  • Notebook实例的存储配置采用云硬盘EVS,最大支持4096GB,达到上限后不允许扩容。单次最大扩容100GB。
  • Notebook实例停止后,扩容后的EVS容量仍然有效。EVS计费按照扩容后的容量计算。EVS一经使用即产生费用,请在停止Notebook实例后,确认不使用EVS时及时删除数据,释放资源,避免产生费用。
  • Notebook中保存的镜像大小不超过35GB,镜像层数不能超过125层。否则镜像会保存失败。

训练作业

  • 当使用自定义镜像做模型训练时,训练镜像中所集成的训练模型、训练框架、训练代码和训练数据等由使用者来保证其稳定性、性能和精度,并承担开源内容使用风险。使用者通过ModelArts平台的标准输出日志、CloudShell等手段来分析和解决问题。
  • 当使用SFS turbo服务保存分布式训练的源代码文件时,在挂载SFS turbo共享目录中编译执行python源代码会存在共享锁冲突访问,建议将SFS turbo中源代码拷贝到容器目录做编译执行。
  • 训练日志仅保留30天,超过30天会被清理。如果用户需要永久保存日志,请在创建训练作业时,打开永久保存日志开关设置作业日志路径即可将日志转存至OBS路径。Ascend训练场景下,默认要求填写作业日志在OBS的存放路径,其他资源的训练场景下,永久保存日志开关需要用户手动开启。
  • 仅专属资源池支持使用Cloud Shell登录训练容器,且训练作业必须处于“运行中”状态。
  • 在训练管理的“创建算法”页面,来源于AI Gallery中订阅的算法不支持另存为新算法。
  • 训练作业卡死检测目前支持资源类型为GPU/NPU的训练作业,不支持资源类型为CPU的训练作业。
  • 仅使用新版专属资源池训练时才支持设置训练作业优先级。公共资源池和旧版专属资源池均不支持设置训练作业优先级。
  • 仅支持PyTorch和MindSpore框架的分布式训练和调测,如果MindSpore要进行多机分布式训练调试,则每台机器上都必须有8张卡。
  • 使用自定义镜像创建训练作业时,镜像大小推荐15GB以内,最大不要超过资源池的容器引擎空间大小的一半。镜像过大会直接影响训练作业的启动时间。ModelArts公共资源池的容器引擎空间为50G,专属资源池的容器引擎空间的默认为50G,支持在创建专属资源池时自定义容器引擎空间。
  • 用于训练的自定义镜像的默认用户必须是“uid”为“1000”的用户。

推理部署(新版)

  • 当使用自定义镜像做模型推理时,推理镜像中所集成的三方模型、推理框架和推理代码等由使用者来保证其稳定性、性能和精度,并承担开源内容使用风险。使用者可以通过ModelArts平台的标准输出日志、CloudShell等手段来分析和解决问题。
  • 只支持使用专属资源池部署的在线服务使用CloudShell访问推理容器,且在线服务必须处于“运行中”状态。

轻量算力节点

  • 轻量算力节点资源开通:
    • 轻量算力节点超节点当前仅支持“包年/包月”计费模式。
    • 轻量算力节点普通节点(ECS或BMS)的所有资源规格均支持“包年/包月”计费模式。
    • 轻量算力节点仅支持ModelArts工作空间default模式。
  • 轻量算力节点开机或关机操作:
    • 只有处于“已停止/启动失败”状态的轻量算力节点可以执行开机操作。
    • 只有处于“运行中/停止失败”状态的轻量算力节点可以执行关机操作。
    • 普通节点和超节点的子节点支持批量开机或关机操作,超节点本身不支持批量操作。
  • 同步轻量算力节点服务器状态:
    • 支持普通节点(弹性服务器ECS或裸金属服务器BMS)服务器状态和磁盘信息同步。
    • 对于超节点,不支持超节点的父节点服务器状态同步。
    • 对于超节点,仅支持子节点的磁盘信息同步。
    • 对于超节点的子节点,不支持在ECS侧修改服务器状态,比如重启、关机等操作。
  • 切换或重置轻量算力节点服务器操作系统:
    • 节点状态要求:轻量算力节点状态只有处于“已停止”“重置OS失败”“切换OS失败”时,才可以切换或重置操作系统。否则可能会导致操作失败,因为系统盘无法被卸载,导致无限循环卸载盘。
    • 操作系统要求:目标操作系统必须是该Region下的IMS公共镜像或者私有共享镜像。
    • 普通节点和超节点的子节点支持切换操作系统或重置操作系统,同时也支持批量操作。
    • 超节点本身仅支持切换操作系统,但不支持重置操作系统。超节点本身不支持批量切换操作系统。
  • 修改轻量算力节点名称:
    • 订单中的服务器名称会一直保持下单购买时设置的名称。后期修改服务器名称后,不会在订单中同步更新。
    • 轻量算力节点的资源类型为裸金属服务器BMS、弹性云服务器ECS时,在BMS和ECS侧修改服务器名称后,不会自动同步到轻量算力节点,需要手动同步。
    • 轻量算力节点的资源类型为超节点时,仅支持修改子节点服务器的名称。超节点本身的名称不支持修改。
    • 当轻量算力节点状态为“运行中”“停止”时,允许修改服务器名称,其他状态不支持修改服务器名称。
    • 轻量算力节点名称不能为空。
    • 未勾选“允许重名”按钮时,如果输入的名称已存在,系统将提示“云服务已被使用”。
  • 事件中心页面授权运维:
    • 当前中国站所有站点均支持此功能,国际站部分站点(香港、约翰内斯堡和新加坡)站点支持此功能。
    • 仅Snt9b、超节点Snt9b21和超节点Snt9b23支持通过计划事件发起硬件维护。
    • 超节点重部署需要在物理超节点内操作。当超节点达到满配48台时,不支持重部署操作,该情况下会直接推送超节点系统维护计划事件。
    • 如果计划事件不满足事件状态,授权处理按钮为置灰状态。
    • 节点本地盘恢复和超节点本地盘恢复操作将会导致本地盘数据丢失,授权前请先迁移业务和备份数据。本地盘恢复后需要登录到轻量算力节点内完成本地盘分区。
  • 重启轻量算力节点服务器:
    • 只有处于“运行中”“重启失败”状态时,才可进行重启操作。
    • 普通节点和超节点均支持重启操作。
    • 普通节点和超节点的子节点支持批量重启操作,超节点本身不支持批量操作。
  • 轻量算力节点超节点规格变更:

    扩容

    • 仅适用于超节点(Snt9b23)扩容。
    • 超节点扩容时,子节点个数不超过48个。
    • 待扩容节点处于可用状态时,才支持扩容。
    • 扩容时不影响原有节点上的业务。

    缩容

    • 仅适用于超节点(Snt9b23)缩容。
    • 超节点的子节点个数为1个时,不支持缩容。
    • 待缩容节点处于非运作的中间态,例如:切换操作系统、重启中、启动中、停止中等时,不支持缩容操作。
    • 缩容时会影响原有节点上的业务,配套的云硬盘也会被随之释放,请确保已完成相应节点的业务迁移,避免数据丢失。
  • 轻量算力节点超节点系统盘扩容:
    • 超节点系统盘扩容通过在轻量算力节点控制台详情页中跳转至EVS页面实现,依赖EVS扩容特性。
    • 仅支持超节点的系统盘扩容,不支持超节点的系统盘缩容。
    • 普通节点不支持系统盘扩缩容,在EVS页面强制扩缩容系统盘,可能会导致扩缩容失败。
  • 超节点定期压测:
    • 仅支持超节点Snt9b23。
    • 压测使用工具Ascend DMI,其不支持在同一个设备里同时开启多个进程来测试性能数据,多进程测试时,可能导致测试结果不准确或者失败等不可预测情况。
    • 性能测试和故障诊断会影响训练或推理业务,执行命令前请确保无业务运行。
    • 为保证返回检测结果的正确性和准确性,请单独执行各个检测命令。
    • Ascend DMI工具只能对在位的NPU卡进行检查,为保证测试结果的准确性,请先执行npu-smi info命令检查NPU卡是否正常在位。
  • 开启超节点HCCL通信算子级重执行机制:
    • 仅Snt9b23超节点支持。
    • 开启算子重执行会对性能带来轻微的影响。
    • 重执行依赖VPC平面(非参数面)网络进行通信域内状态协商,如果VPC平面不同,则无法重执行。
    • 对于HCCS平面,如果链路没有恢复,路由未收敛,则无法重执行。
    • 重执行依赖故障发生时一个通信域中所有卡都停在同一通信算子处,否则无法重执行,成功率约为95%。
    • 使用inplace方式的通信算子可能导致UserIn数据被污染,从而影响重执行的可靠性。尽管重执行支持约80%通信算子的inplace方式,但对于Torch框架中的all_reduce、all_gather和reduce_scatter等算子,重执行仍不支持其inplace操作。
    • RoH/RoCE平面因为闪断或断链触发的借轨,在同一通信域只允许执行一次,且不支持回切。借轨状态下,业务可持续,但应尽快保存checkpoint,维修故障。
  • 超节点绑定弹性网卡:
    • 网卡绑定功能仅支持Snt9b23超节点资源,其他资源类型不支持。
    • 不同规格资源支持绑定特定数量的网卡。
    • 主网卡不支持删除解绑操作。
    • 解绑办卡仅支持对已停止的节点进行操作。
  • NPU日志收集:
    • 一键日志采集功能仅支持Snt9b和Snt9b21系列的普通节点、Snt9b23的超节点。。手动收集日志功能支持300IDuo、Snt9b、Snt9b23和Snt9b21系列。
    • 同一个任务最多支持选择50个普通节点或超节点的子节点。
    • 同一时间节点上最多同时支持一个任务,任务开始后无法中断请您规划好任务优先级。
    • 请确保待节点无业务运行,日志收集任务中的命令执行可能导致当前业务中断或异常。
    • 请确保用于收集日志的目录空间需大于1GB。
  • 使用CES监控轻量算力节点NPU资源或事件:
    • 监控需要用到CES Agent插件,Agent有严格的资源占用限制,当资源占用超过阈值后出现Agent熔断情况,详细的资源占用说明请参考CES产品文档相关章节:CES Agent性能说明
    • 通过Ascend-dmi执行NPU压测命令可能会导致丢失部分NPU指标数据。
    • 监控Agent已在轻量算力节点提供的公共镜像中经过充分测试,如果您使用自己的镜像,建议测试后再部署到生产环境,防止信息错误。
  • 管理CloudPond的NPU资源:
    • 轻量算力节点仅支持对CloudPond的Snt9b资源进行纳管,不支持GPU、CPU资源纳管。
    • 仅新版的轻量算力节点购买界面支持发放CloudPond类型的资源。
  • 退订或删除轻量算力节点资源:
    • 包年/包月的轻量算力节点普通节点、整柜资源或超节点资源才支持退订,按需计费方式不支持退订。
    • 包年/包月的轻量算力节点普通节点、整柜资源或超节点资源处于“创建失败”“错误”状态下时,可以直接删除。
    • 包年/包月的轻量算力节点普通节点、整柜资源或超节点资源在宽限期和冻结期,无法通过“退订”功能释放资源,此时系统支持直接通过“释放”功能释放资源。
    • 包年/包月场景下,退订和释放操作均是以整个订单维度执行,不支持单独释放或退订整柜资源下的单个子节点,也不支持单独释放或退订超节点下面的单个子节点。
    • 删除包年包月的轻量算力节点资源时,对于ECS和BMS类型的服务器和超节点资源,删除时会自动删除创建Server页面时设置的数据盘。创建完Server后又单独挂载的数据盘,不会删除。
    • 删除按需计费的轻量算力节点资源时,对于ECS和BMS类型的服务器,删除时不会删除创建Server页面时设置的数据盘。创建完Server后又单独挂载的数据盘,也不会删除。对于超节点资源,删除时会删除创建Server页面时设置的数据盘,创建完Server后又单独挂载的数据盘,不会删除。
    • 普通节点资源支持批量退订、批量删除、批量释放操作,超节点不支持批量操作。
  • Vnt1机型不提供SLA(Service Level Agreement)承诺。
  • Ant8机型不支持使用570及以上版本驱动。

轻量算力集群

  • 扩缩容轻量算力集群:
    • 包年/包月的资源池仅支持扩容操作。
    • 只支持对状态为“运行中”的轻量算力集群资源池进行扩缩容,且不能缩容到0。
  • 升级轻量算力集群驱动:
    • 轻量算力集群状态处于运行中,且目标节点池中的节点需要含有GPU/NPU资源,节点池驱动处于运行中。
    • GPU节点池驱动升级前,需要将该资源池的插件“AI 套件 - GPU”升级到1.2.24及以上。
  • 事件中心页面授权运维:
    • 当前中国站所有站点均支持此功能,国际站部分站点(香港、约翰内斯堡和新加坡)站点支持此功能。
    • 仅Snt9b、超节点Snt9b21和超节点Snt9b23支持通过计划事件发起硬件维护。
    • 超节点重部署需要在物理超节点内操作。当超节点达到满配48台时,不支持重部署操作,该情况下会直接推送超节点系统维护计划事件。
    • 如果计划事件不满足事件状态,授权处理按钮为置灰状态。
    • 节点本地盘恢复和超节点本地盘恢复操作将会导致本地盘数据丢失,授权前请先迁移业务和备份数据。本地盘恢复后需要登录到轻量算力节点内完成本地盘分区。
  • Vnt1机型不提供SLA(Service Level Agreement)承诺。
  • Ant8机型不支持使用570及以上版本驱动。

ModelArts与OBS交互

  • ModelArts不支持从加密的OBS桶中读取数据,创建OBS桶时,请勿开启桶加密。
  • ModelArts不支持跨区域访问OBS桶,请确保使用的OBS与ModelArts在同一区域。

相关文档