
# AI容器概述
AI容器是云容器引擎CCE提供的AI容器调度平台，支撑大规模AI开发、训练、推理业务。随着大模型参数规模持续增长，AI训练与推理作业对底层基础设施提出了异构算力调度复杂、分布式训练通信瓶颈、推理服务高并发治理等多方面挑战，传统容器调度能力难以满足。AI容器以CCE容器集群为底座，以高性能工作负载调度引擎Volcano为核心，针对上述挑战提供资源管理与监控运维、性能加速、工作负载编排调度、智能弹性等能力，帮助企业快速构建云原生AI基础设施。
AI容器适用于大规模LLM分布式训练、PD（Prefill-Decode）分离推理部署、多租户GPU/NPU集群管理等典型场景。
#### 功能优势
- **预置AI应用模板，部署更快捷**
  预置开箱即用的场景化配置，简化复杂的参数调优过程，打通从模型部署到推理应用的全链路闭环，驱动AI应用敏捷构建。
  

- **一体化底座，运维更省心**
  统一接入和管理AI业务所需的复杂底层资源，包括GPU、NPU、RDMA（Remote Direct Memory Access）、高性能缓存、分布式存储等，并提供面向AI任务的监控视角和故障发现能力，大幅增强AI基础设施的运维能力。
  

- **智能调度，成本更优**
  针对AI计算类任务的特性，提供[组调度](https://support.huaweicloud.com/usermanual-cce/cce_10_0778.html)、[装箱调度](https://support.huaweicloud.com/usermanual-cce/cce_10_0773.html)、[拓扑感知调度](https://support.huaweicloud.com/usermanual-cce/cce_10_1125.html)、[GPU虚拟化调度](https://support.huaweicloud.com/usermanual-cce/cce_10_0643.html)、[NPU紧凑型缩容](https://support.huaweicloud.com/usermanual-cce/cce_10_1024.html)等调度策略，减少资源碎片，提升集群的资源利用率。
  
 
#### 能力概览
AI容器提供以下核心能力：
| 能力                                                                        | 说明                                                                        |
|:---|:---|
| [推理负载](https://support.huaweicloud.com/usermanual-cce/cce_10_11511.html)  | 支持AI模型推理服务的部署与管理，包括推理框架、推理网关及PD分离等高级推理架构。                                 |
| [训练任务](https://support.huaweicloud.com/usermanual-cce/cce_10_1152.html)   | 基于Volcano管理AI训练作业，支持通过Volcano Job创建和管理分布式训练任务，通过Volcano队列实现多租户资源分配与优先级调度。 |
| [AI应用模板](https://support.huaweicloud.com/usermanual-cce/cce_10_1154.html) | 提供开箱即用的场景化AI应用模板，一键部署推理应用，简化从模型到服务的全链路操作。                                 |
   
