更新时间:2026-08-18 GMT+08:00
分享

场景化部署

在人工智能应用落地的过程中,推理部署的效率、灵活性与性能优化是决定业务成败的关键。ModelArts推理服务致力于提供全场景、全栈式的 AI 推理部署能力,从开箱即用的便捷体验到深度定制的极致性能优化,满足不同规模、不同复杂度业务场景的需求。

本章节概述ModelArts在推理部署方面的场景化能力:一键部署、预置模型自定义部署、开源社区(vLLM-Ascend)模型部署、ModelArts自研框架Ascend-vLLM高性能部署和用户完全自定义部署。

一键部署:极速上线,零门槛体验

ModelArts平台中预置了大量模型资产,并针对这些资产提供了“一键部署”能力。对于想要快速体验平台推理部署能力的用户,该模式极大简化了部署流程,用户无需关心底层环境配置、依赖安装或服务编排,即可在几分钟内获得一个部署完整的推理服务。

支持一键部署的模型资产覆盖了主流第三方模型如DeepSeek系列、GLM系列、Qwen3系列等模型,提供了兼容OpenAI的API及全链路模型服务。

图1 模型一键部署快速入门

一键部署相关快速入门案例请参见:

推理入门:一键完成DeepSeek-V4-Flash模型部署

推理入门:一键完成GLM-5.1模型部署

推理入门:一键完成Qwen3-32B-64k模型部署

更多模型资产和调用介绍可以参见《快速调用预置模型》章节。

预置模型的自定义部署:灵活定制,精准适配

除了一键快速部署外,ModelArts还支持对预置模型资产进行深度自定义部署。用户可在保留平台自动化优势的同时,注入个性化配置,实现模型与业务逻辑的无缝衔接。

自定义能力包括:

  • 模型参数调优:支持修改推理引擎参数(如 batch size、max tokens、temperature 等),以平衡延迟与吞吐量。
  • 环境变量注入:通过自定义环境变量配置业务密钥、日志级别、监控端点等。
  • 启动脚本定制:允许用户注入自定义启动命令或预处理脚本,实现模型加载前的数据准备或后处理逻辑。

具体的部署指导请参见推理在线服务单机部署,部署时模型来源选择平台资产。仅专属资源池支持此部署方式。

图2 基于平台资产自定义部署

从 vllm-ascend 开源社区拉取模型:生态融合,前沿可用

ModelArts 积极拥抱开源生态,支持与 Ascend 社区紧密协作。用户可直接从vllm-ascend开源社区拉取经过适配优化的大语言模型(LLM),实现前沿模型在华为云昇腾算力上的快速部署。

关键特性

  • 社区模型直连:支持拉取 vllm-ascend 社区发布的模型权重与配置。
  • 昇腾原生适配:所拉取模型均已针对 Ascend NPU 进行算子优化与内存管理调优,确保在昇腾硬件上高效运行。
  • 版本同步更新:紧跟社区迭代,用户可便捷获取最新模型版本与性能补丁。

适用场景

  • 希望使用最新开源大模型(如 Llama、Qwen、ChatGLM 等)的企业。
  • 需要利用昇腾算力进行大模型推理,但缺乏底层适配经验的团队。
  • 参与开源生态共建,希望快速验证社区模型效果的研究者。

Ascend-vLLM框架部署:极致性能,大规模并发

针对大语言模型高并发、低延迟的严苛要求,ModelArts提供基于Ascend-vLLM框架的专用部署方案。该方案深度融合昇腾 NPU 硬件特性与 vLLM 高效推理引擎,实现推理性能的极致优化。

技术亮点

  • PagedAttention 优化:在昇腾 NPU 上实现高效的注意力内存管理,显著降低显存碎片,提升 KV Cache 利用率。
  • 连续批处理(Continuous Batching):动态调度请求,最大化 NPU 计算单元利用率,提升吞吐量。
  • 多卡并行推理:支持张量并行、流水线并行等策略,轻松部署千亿参数级大模型。
  • 低延迟保障:针对首字延迟(TTFT)和端到端延迟进行专项优化,满足实时交互场景需求。

适用场景:

  • 高并发在线服务(如智能客服、实时翻译、代码助手)。
  • 千亿参数大模型的推理部署。
  • 对推理延迟和吞吐量有极致要求的生产环境。

基于Ascend-vLLM框架的部署方案指导请参见实践案例《ModelArts推理平台大模型通用部署指导》。

自定义模型与镜像部署:完全掌控,私有化适配

对于拥有自研模型、特殊业务逻辑或严格合规要求的企业用户,ModelArts 支持完全自定义的模型与镜像部署。用户可自主准备模型文件(如 `.ckpt`, `.safetensors`, `.onnx` 等)及包含所有依赖环境的 Docker 镜像,实现从代码到环境的完全掌控。

核心能力

- 任意模型格式支持:不受限于平台预置模型,支持上传任何格式的模型文件,包括经过私有化微调、量化或剪枝后的模型。

- 自定义 Docker 镜像:用户可构建包含特定 Python 版本、C++ 依赖、自定义推理服务代码(如 Flask/FastAPI 封装)的 Docker 镜像,并推送至 SWR(软件仓库)。

- 全生命周期管理:支持自定义健康检查、启动探针、就绪探针,以及自定义日志采集和监控指标上报。

- 安全与合规:模型数据与运行环境完全隔离,满足金融、政务等对数据主权和代码审计有严格要求的行业规范。

适用场景

- 自研模型部署:企业内部研发的非开源模型或经过深度私有化训练的模型。

- 复杂业务逻辑集成:推理服务中需要嵌入复杂的业务校验、数据脱敏、多模型串联(Pipeline)等逻辑。

- 遗留系统迁移:将本地 IDC 或私有云中的现有推理服务平滑迁移至云端,保持代码和环境的一致性。

- 特殊依赖环境:需要安装非标准库、特定版本驱动或专有软件许可证的场景。

此部署方案指导参考本文档的自定义部署服务章节完成。

总结:选择适合您的部署路径

表1 选择适合您的部署路径

部署模式

核心特点

推荐用户

典型场景

一键部署

极简、快速、自动化

初学者、快速验证团队

原型开发、通用模型试用

预置模型自定义部署

灵活、可配置、平衡易用与定制

业务开发者、算法工程师

业务适配、参数调优、集成中间件

vllm-ascend 社区模型拉取

生态开放、前沿模型、昇腾适配

开源爱好者、研究团队

最新开源模型快速部署、社区模型验证

Ascend-vLLM 框架部署

高性能、低延迟、大规模并发

生产环境运维、大模型专家

高并发在线服务、千亿模型推理

自定义模型与镜像部署

完全掌控、私有化、高度灵活

资深架构师、合规敏感型企业

自研模型、复杂业务逻辑、遗留系统迁移

ModelArts 推理服务通过上述多层次、场景化的部署能力,帮助用户从“模型可用”走向“模型好用”,最终实现“模型高效用”,加速 AI 应用从实验室到生产环境的落地进程。

相关文档