
# 场景化部署
在人工智能应用落地的过程中，推理部署的效率、灵活性与性能优化是决定业务成败的关键。ModelArts推理服务致力于提供全场景、全栈式的 AI 推理部署能力，从开箱即用的便捷体验到深度定制的极致性能优化，满足不同规模、不同复杂度业务场景的需求。
本章节概述ModelArts在推理部署方面的场景化能力：一键部署、预置模型自定义部署、开源社区（vLLM-Ascend）模型部署、ModelArts自研框架Ascend-vLLM高性能部署和用户完全自定义部署。
#### 一键部署：极速上线，零门槛体验
ModelArts平台中预置了大量模型资产，并针对这些资产提供了"一键部署"能力。对于想要快速体验平台推理部署能力的用户，该模式极大简化了部署流程，用户无需关心底层环境配置、依赖安装或服务编排，即可在几分钟内获得一个部署完整的推理服务。
支持一键部署的模型资产覆盖了主流第三方模型如DeepSeek系列、GLM系列、Qwen3系列等模型，提供了兼容OpenAI的API及全链路模型服务。
图1模型一键部署快速入门   
![](https://support.huaweicloud.com/inference-modelarts/figure/zh-cn_image_0000002673038045.png)
一键部署相关快速入门案例请参见：
[推理入门：一键完成DeepSeek-V4-Flash模型部署](https://support.huaweicloud.com/qs-modelarts/modelarts_ds4_001.html)
[推理入门：一键完成GLM-5.1模型部署](https://support.huaweicloud.com/qs-modelarts/modelarts_06_0009.html)
[推理入门：一键完成Qwen3-32B-64k模型部署](https://support.huaweicloud.com/qs-modelarts/modelarts_06_0002.html)
更多模型资产和调用介绍可以参见《[快速调用预置模型](https://support.huaweicloud.com/model-call-modelarts/model-call-modelarts-0001.html)》章节。
#### 预置模型的自定义部署：灵活定制，精准适配
除了一键快速部署外，ModelArts还支持对预置模型资产进行深度自定义部署。用户可在保留平台自动化优势的同时，注入个性化配置，实现模型与业务逻辑的无缝衔接。
**自定义能力包括：**
- 模型参数调优：支持修改推理引擎参数（如 batch size、max tokens、temperature 等），以平衡延迟与吞吐量。
- 环境变量注入：通过自定义环境变量配置业务密钥、日志级别、监控端点等。
- 启动脚本定制：允许用户注入自定义启动命令或预处理脚本，实现模型加载前的数据准备或后处理逻辑。
具体的部署指导请参见[推理在线服务单机部署](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0004.html)，部署时模型来源选择平台资产。仅专属资源池支持此部署方式。
图2基于平台资产自定义部署   
![](https://support.huaweicloud.com/inference-modelarts/figure/zh-cn_image_0000002673198871.png)
#### 从vllm-ascend开源社区拉取模型：生态融合，前沿可用
ModelArts 积极拥抱开源生态，支持与 Ascend 社区紧密协作。用户可直接从[vllm-ascend开源社区](https://docs.vllm.ai/projects/ascend/zh-cn/v0.18.0/index.html)拉取经过适配优化的大语言模型（LLM），实现前沿模型在华为云昇腾算力上的快速部署。
**关键特性**：
- 社区模型直连：支持拉取 vllm-ascend 社区发布的模型权重与配置。
- 昇腾原生适配：所拉取模型均已针对 Ascend NPU 进行算子优化与内存管理调优，确保在昇腾硬件上高效运行。
- 版本同步更新：紧跟社区迭代，用户可便捷获取最新模型版本与性能补丁。
**适用场景**：
- 希望使用最新开源大模型（如 Llama、Qwen、ChatGLM 等）的企业。
- 需要利用昇腾算力进行大模型推理，但缺乏底层适配经验的团队。
- 参与开源生态共建，希望快速验证社区模型效果的研究者。
 
#### Ascend-vLLM框架部署：极致性能，大规模并发
针对大语言模型高并发、低延迟的严苛要求，ModelArts提供基于Ascend-vLLM框架的专用部署方案。该方案深度融合昇腾 NPU 硬件特性与 vLLM 高效推理引擎，实现推理性能的极致优化。
**技术亮点**：
- PagedAttention 优化：在昇腾 NPU 上实现高效的注意力内存管理，显著降低显存碎片，提升 KV Cache 利用率。
- 连续批处理（Continuous Batching）：动态调度请求，最大化 NPU 计算单元利用率，提升吞吐量。
- 多卡并行推理：支持张量并行、流水线并行等策略，轻松部署千亿参数级大模型。
- 低延迟保障：针对首字延迟（TTFT）和端到端延迟进行专项优化，满足实时交互场景需求。
**适用场景：**
- 高并发在线服务（如智能客服、实时翻译、代码助手）。
- 千亿参数大模型的推理部署。
- 对推理延迟和吞吐量有极致要求的生产环境。
 
#### 自定义模型与镜像部署：完全掌控，私有化适配
对于拥有自研模型、特殊业务逻辑或严格合规要求的企业用户，ModelArts 支持完全自定义的模型与镜像部署。用户可自主准备模型文件（如 \`.ckpt\`, \`.safetensors\`, \`.onnx\` 等）及包含所有依赖环境的 Docker 镜像，实现从代码到环境的完全掌控。
核心能力
- 任意模型格式支持：不受限于平台预置模型，支持上传任何格式的模型文件，包括经过私有化微调、量化或剪枝后的模型。
- 自定义 Docker 镜像：用户可构建包含特定 Python 版本、C++ 依赖、自定义推理服务代码（如 Flask/FastAPI 封装）的 Docker 镜像，并推送至 SWR（软件仓库）。
- 全生命周期管理：支持自定义健康检查、启动探针、就绪探针，以及自定义日志采集和监控指标上报。
- 安全与合规：模型数据与运行环境完全隔离，满足金融、政务等对数据主权和代码审计有严格要求的行业规范。
适用场景
- 自研模型部署：企业内部研发的非开源模型或经过深度私有化训练的模型。
- 复杂业务逻辑集成：推理服务中需要嵌入复杂的业务校验、数据脱敏、多模型串联（Pipeline）等逻辑。
- 遗留系统迁移：将本地 IDC 或私有云中的现有推理服务平滑迁移至云端，保持代码和环境的一致性。
- 特殊依赖环境：需要安装非标准库、特定版本驱动或专有软件许可证的场景。
此部署方案指导参考本文档的[自定义部署服务](https://support.huaweicloud.com/inference-modelarts/inference2.0-modelarts-0083.html)章节完成。
#### 总结：选择适合您的部署路径
表1选择适合您的部署路径 
| 部署模式               | 核心特点           | 推荐用户          | 典型场景               |
|:---|:---|:---|:---|
| 一键部署               | 极简、快速、自动化      | 初学者、快速验证团队    | 原型开发、通用模型试用        |
| 预置模型自定义部署          | 灵活、可配置、平衡易用与定制 | 业务开发者、算法工程师   | 业务适配、参数调优、集成中间件    |
| vllm-ascend 社区模型拉取 | 生态开放、前沿模型、昇腾适配 | 开源爱好者、研究团队    | 最新开源模型快速部署、社区模型验证  |
| Ascend-vLLM 框架部署   | 高性能、低延迟、大规模并发  | 生产环境运维、大模型专家  | 高并发在线服务、千亿模型推理     |
| 自定义模型与镜像部署         | 完全掌控、私有化、高度灵活  | 资深架构师、合规敏感型企业 | 自研模型、复杂业务逻辑、遗留系统迁移 |
   
ModelArts 推理服务通过上述多层次、场景化的部署能力，帮助用户从"模型可用"走向"模型好用"，最终实现"模型高效用"，加速 AI 应用从实验室到生产环境的落地进程。
