
# 推理部署介绍
ModelArts提供的AI模型推理服务管理平台，旨在帮助用户快速将AI模型部署为可运行的推理服务，并为推理服务提供API能力，供用户集成到自定义的应用中。
ModelArts支持将模型部署为一个在线服务，并且提供在线的测试UI与监控功能。部署成功的在线服务，将为用户提供一个可调用的API。在线推理常用于对实时性要求较高的场景，如在线智能客服、自动驾驶中的实时决策等。
#### 产品架构
ModelArts推理部署采用云原生微服务架构，旨在提供高可用、高并发、低延迟的模型推理服务。其核心架构分层如下：
- 接入层：提供标准的RESTful API接口，支持HTTPS加密传输，内置高性能网关，支持多种负载均衡调度算法用来分发流量。
- 服务层： 推理引擎：支持多种后端引擎（如vLLM，Triton Inference Server，TensorFlow Serving，PyTorch Serve，MindSpore Serving等），适配不同框架模型。
  调度与管理：负责实例的弹性伸缩、健康检查、版本管理和灰度发布。
  
- 资源层：底层对接GPU/NPU裸金属服务器及容器引擎（CCE），实现算力的弹性供给。
- 监控层：实时监控QPS、延迟、GPU/NPU利用率、错误率、首Token时延、吞吐量等关键指标。
 
#### 核心能力
- **资源调度优化**
  传统调度方式难以满足分布式推理多角色编排的复杂需求，PD分离部署中角色协同调度与资源配比要求高，易导致任务分配低效、部署复杂。KubeInfer支持多单元推理实例资源编排，基于Volcano Gang调度和弹性Gang调度实现多角色统一调度与弹性降级，帮助客户多机器规模部署推理服务。同时提供高可用调度、高利用率调度、高性能调度、亲和调度四种差异化策略，满足业务高可靠、资源高效利用、低延迟通信、定制化管控等诉求。
  
- **弹性推理能力**
  支持部署维度的手动扩缩容和自动扩缩容（周期触发和指标触发），提升资源利用率。PD分离场景提供弹性降级（降P补D）能力，故障时通过减少P角色副本释放资源优先满足D角色需求，服务降级形态维持业务连续性，资源恢复后自动恢复全量副本。滚动升级配合优雅停机，实现资源扩展或缩减过程中平滑切换，确保业务连续性和稳定性。
  
- **请求调度优化**
  智能路由策略：平台提供6种精细化路由策略（轮询、源IP哈希、优先最小连接数、优先最小首Token时延、综合负载、SLO优先级），能够根据业务诉求灵活分发流量，确保请求得到及时处理。静态负载均衡支持轮询、源IP哈希、最小连接数策略。智能路由仅专属资源池支持，同一部署只能选择一种策略。
  
- **高可靠性**
  四级故障自动重建：支持Pod级、单元副本级、单元级、部署副本级四级故障自动重建，根据故障影响范围自动选择重建粒度，配合故障自动重启（硬件故障后调度迁移）和健康检查自愈机制，实现故障影响最小化。优雅停机保障服务下线、升级、缩容过程中在途请求平滑结束，避免强制中断。
  
- **易用性**
  开箱即用：预置大量模型资产（DeepSeek、GLM、Qwen3等系列），支持一键部署，快速完成推理服务部署。支持预置模型自定义部署和从vLLM-Ascend开源社区直接拉取模型部署，满足不同场景需求。
  
 
#### 相关术语解释
表1推理部署模式介绍 
| 推理部署模式        | 定义                                                                                                                                                                                                                                        | 特点                                                  | 适用场景                                                                                                                              |
|:---|:---|:---|:---|
| 基础模式（单机部署）    | 仅使用一台机器中的一张AI加速卡完成推理的部署模式，是最简单基础的运行模式。 1个推理单元就能完成推理，不在部署形态上区分推理角色、不做分布式拆分，所有推理计算、前后处理都在同一实例完成，是轻量、简单、易维护的部署形态。即仅创建1个推理单元，就可以承载推理服务的功能。  | 仅需配置1个推理单元，该单元独立承载完整推理服务。                           | 结构简单，无需复杂的分布式通信配置，调试门槛低。 小参数量模型训练、小型推理服务、个人开发者调试学习，当模型体积和数据量较小，单卡显存可容纳完整模型与数据时优先选择。 |
| 多角色分离（多机PD混部） | PD混部（Prefill-Decode 混合部署）是指将大模型推理的预填充（Prefill）和解码（Decode）两个阶段部署在同一组计算节点（如NPU/GPU）上，共享KV Cache资源，适用于资源受限或需简化架构的场景。对于混部场景，如果是使用vLLM框架，建议第一个单元为vLLM的master节点，剩余的worker节点放在其他单元。                                                              | 配置多个单元，将Prefill、Decode单元部署在同一计算节点。                  | 共享KV Cache资源，适用于资源受限或需简化架构的场景。                                                                                                    |
| 多角色分离（多机PD分离） | 全称Prefill-Decode分离架构，是专门针对大语言模型推理阶段的优化技术架构，核心是将LLM推理的两个核心阶段------计算密集型的Prefill（预填充）阶段和访存密集型的Decode（解码）阶段解耦，分别分配到不同计算单元（GPU/AI芯片）上独立执行。                                                                                                    | 配置多个单元，将Prefill、Decode单元部署在不同物理节点，完全隔离资源，性能最优但成本更高。 | 适用于大规模推理任务、可用性和容错性高、需要资源隔离和优化的场景。                                                                                                 |
   
表2推理部署术语介绍 
| 术语   | 解释                                                                                                                                                                                                                                  |
|:---|:---|
| 服务   | 推理平台的资源载体，核心是把已有的模型部署到生产环境，对外提供实时预测、逻辑推理的能力。                                                                                                                                                                                        |
| 部署   | 用于管理模型的部署和更新，支持滚动更新和回滚，确保模型的高可用性和负载均衡。                                                                                                                                                                                              |
| 部署副本 | 部署可以管理多个副本，确保模型的高可用性和负载均衡。部署包含一个或多个副本，每个副本由一组独立运行的单元组成，且所有副本的配置完全一致。                                                                                                                                                                |
| 单元   | 单元是推理服务部署中最小的逻辑部署单元，是系统中承担不同功能的容器的集合。例如PD分离部署模式下，单元P和D分别代表Prefill和Decode。 基础模式下，一个部署副本包含1个单元。 多角色分离模式下，一个部署副本可包含多个"单元"，每个单元有自己的镜像、规格等配置。 |
| Pod  | Pod是Kubernetes中最小的可部署计算单元，对应推理服务运行态的实际容器。                                                                                                                                                                                           |
   
图1一张图说明部署，部署副本，单元和Pod的关系   
![](https://support.huaweicloud.com/inference-modelarts/figure/zh-cn_image_0000002665496305.png)
#### 功能概览
表3新推理支持的功能概览 
| 分类                                                             | 支持的特性                                                                |
|:---|:---|
| 基础信息                                                           | 支持同步推理，包含单机部署、多机PD混部、多机PD分离部署多种场景。                                   |
| 基础信息                                                           | 支持异步推理。                                                              |
| 镜像配置                                                           | 支持SWR镜像：自有镜像，共享镜像、SWR企业版镜像。                                          |
| 镜像配置                                                           | 支持ModelArts预置镜像。                                                     |
| 镜像配置                                                           | 支持在ModelArts镜像管理功能中已注册镜像。                                            |
| 镜像配置                                                           | 支持选择镜像时，选择预热的镜像（该功能受限使用，需要提工单申请开通）。                                  |
| 模型配置                                                           | 模型配置支持OBS、PFS、SFS Turbo挂载。                                           |
| 模型配置                                                           | 模型配置支持选择预热模型。                                                        |
| 其他配置                                                           | 支持设置环境变量，启动命令。                                                       |
| 其他配置                                                           | 支持对服务进行健康检查。                                                         |
| 其他配置                                                           | 支持亲和调度：单机部署支持亲和调度，支持选择亲和节点的IP；多机多卡支持亲和调度，支持role可选择亲和节点的IP。           |
| 其他配置                                                           | 支持优雅停机。                                                              |
| 其他配置                                                           | 支持故障自动重启。                                                            |
| 其他配置                                                           | 支持设置推理服务流量限制。                                                        |
| 其他配置                                                           | 支持对推理服务设置请求大小限制、请求超时时间。                                              |
| 其他配置                                                           | 支持滚动升级，并按照百分比设置整个推理服务的最大浪涌实例数和最大无效实例数。                               |
| 访问协议和认证方式                                                      | 支持对推理服务设置协议：WebSocket、Server-Sent Events（SSE）、HTTP/HTTPS。            |
| 访问协议和认证方式                                                      | 推理服务认证方式：无认证、IAM Token、API-KEY。                                      |
| 日志管理      | 支持对推理服务查看实时日志。                                                       |
| 日志管理      | 支持对推理服务查看LTS日志。                                                      |
| 请求调度策略     | 推理服务支持对静态负载均衡策略进行配置，支持轮询、源IP哈希、最小连接负载均衡策略。                           |
| 请求调度策略     | 推理服务支持优先最小首Token时延、综合负载、SLO优先级。                                      |
| 访问网络                                                           | 通过公网访问在线服务。                                                          |
| 访问网络                                                           | 支持内网接入申请查询、创建、审批、修改、删除操作。                                            |
| 访问网络                                                           | 支持通过弹性负载均衡ELB连接内网访问在线服务。                                             |
| 流量权重                                                           | 支持配置镜像流量，流量权重。                                                       |
| 监控   | 支持查看服务级别的指标统计请求QPS，请求服务数，当前连接数，服务请求时延，资源指标 CPU，NPU, 内存，显存使用率，服务网络流速。 |
| 监控   | 支持自定义监控指标。                                                           |
| 监控   | 支持查看大语言模型相关指标：首Token时延，增量token时延，输入输出token数。                         |
| 授权管理        | 支持创建API-KEY, 并绑定解绑到具体的服务。                                            |
| 扩缩容                                                            | 支持手动扩缩容，手动修改实例数。                                                     |
| 扩缩容                                                            | 支持自动扩缩容，通过设置扩缩容规则自动触发实例数修改。                                          |
   
#### 推理服务部署流程
1. 准备推理镜像，详情请参见[准备推理镜像](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0003.html)。
2. 提前准备好模型、代码文件，并上传到OBS、OBS并行文件系统或SFS Turbo。
3. 创建资源池，详情请参见[创建专属资源池](https://support.huaweicloud.com/resmgmt-modelarts/resmgmt-modelarts_0004.html)。
4. 配置在线服务信息，详情请参见[配置服务信息](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0016.html)。
5. 部署在线服务，详情参见[推理在线服务单机部署](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0004.html)、[推理在线服务多机PD混部](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0038.html)或[推理在线服务多机PD分离部署](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0086.html)
6. 测试并调试在线服务，详情请参见[测试在线服务](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0100.html)。
 
#### 推理服务访问流程
当在线服务的状态处于"运行中"，则表示在线服务已部署成功，部署成功的在线服务，将为用户提供一个可调用的API，此API为标准RESTful API。访问在线服务时，您可以根据您的业务需求，分别确认使用何种认证方式、访问通道、传输协议，以上三个要素共同构成您的访问请求，三者可自由组合互不影响（例如不同的认证方式可以搭配不同的访问通道、不同的传输协议）。
图2认证方式、访问通道、传输协议   
![](https://support.huaweicloud.com/inference-modelarts/figure/zh-cn_image_0000002704360811.png)
当前ModelArts支持以下认证方式访问在线服务（案例中均以HTTPS请求为例）：
- [无认证](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0006.html)：无需认证。
- [Token认证](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0007.html)：基于华为云IAM（Identity and Access Management）服务的认证方式。Token具有时效性，有效期为24小时，需要使用同一个Token鉴权时，可以缓存起来，避免频繁调用。
- [API Key认证](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0008.html)：API Key认证是另一种常见的认证方式，适用于需要简单认证的API的场景。需要在华为云控制台生成API Key，然后在调用API时，将API Key放在请求头中。
ModelArts支持通过以下几种方式调用API访问在线服务（案例中均以HTTPS请求为例）：
- [通过公网访问通道的方式访问在线服务](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0010.html)：ModelArts推理默认使用公网访问在线服务。在线服务部署成功后，将为用户提供一个可调用的API，此API为标准RESTful API。
- [通过内网访问在线服务](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0011.html)：ModelArts提供内网接入功能，通过创建内网接入申请，实现自动创建VPCEP，打通VPC与推理在线服务的内网连接。
- [通过弹性负载均衡ELB访问在线服务](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0104.html)：通过弹性负载均衡实现外网安全高效访问内网ModelArts在线服务。
在线服务的API默认为HTTPS访问，同时还支持以下的传输协议：
- [使用WebSocket协议的方式访问在线服务](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0013.html)：WebSocket使得客户端和服务器之间的数据交换变得更加简单，允许服务端主动向客户端推送数据。在WebSocket API中，浏览器和服务器只需要完成一次握手，两者之间就可以建立持久性的连接，并进行双向数据传输。
- [使用Server-Sent Events协议的方式访问在线服务](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0014.html)：Server-Sent Events（SSE）访问主要解决了客户端与服务器之间的单向实时通信需求（例如大模型回答的流式输出），相较于WebSocket（双向实时），它更加轻量级且易于实现。
 
