服务说明书
客户业务概述
随着行业AI模型在各场景中的广泛应用,模型上线后的持续运维与保障已成为企业必须面对的常规课题。在实际生产运行中,推理性能抖动、资源占用异常、数据分布变化及系统级故障等问题时有发生,直接影响模型的稳定性和业务效果。同时,模型训练涉及分布式并行策略、精调算法选型、性能瓶颈诊断等专业领域,推理部署涉及量化方案、框架配置、吞吐延迟调优等复杂环节,客户在自主实施过程中面临技术门槛高、试错成本大、效率低等挑战。此外,企业在昇腾NPU上大规模部署AI推理服务后,请求延迟、吞吐量、NPU利用率、HBM使用率等核心指标的持续监测与主动运维需求激增,但超60%的企业缺乏NPU专业运维能力,容器巡检、告警响应、故障定位等运维工作依赖外部专业服务支撑。客户亟需一套覆盖模型训推全流程的技术支持与持续运维保障体系,以保障AI模型长期稳定运行,支撑业务场景创新提速、降本增效。
业务方案
针对客户在AI模型运行阶段面临的监控运维缺失与训推技术门槛高的痛点,华为云推出AI模型运行支持服务,面向客户模型投产后的运行阶段,提供以下两大核心服务:一是AI模型监控与运维服务,通过核心指标监控、分级告警响应与故障处置、主动运维及定期报告等能力,帮助客户实时掌握模型运行健康状况、快速定位异常根因并恢复服务,保障模型SLA达标;二是AI模型技术支持订阅服务,通过工具使用咨询、量化方案选型、训练优化支持等能力,帮助客户降低技术门槛、提升模型训推效率。服务以客户为实施责任主体,华为侧提供技术支持与指导,助力客户保障AI模型长期稳定运行。
服务描述
在企业大规模部署昇腾NPU推理服务与AI模型训练的场景下,华为云推出AI模型运行支持服务,提供模型训推全流程技术支持与推理运行监控运维两大核心能力,协助客户解决模型部署复杂度高、训练框架配置困难、训练故障诊断能力不足、量化方案选型困难、核心监控指标缺失及7×24小时持续监控保障等问题,可获得模型运行稳定性、训推效率及技术门槛降低方面的显著提升。
服务内容
AI模型运行支持服务包含以下服务规格,客户可根据自身技术能力与业务需求选择对应的服务规格:
- AI模型监控与运维服务(基础版)
针对请求延迟、吞吐量、NPU资源占用等核心指标进行监控;5×8小时告警响应与基础故障处置;主动运维(容器状态巡检、日志检查等);按周/月维度输出运行状态总览、关键指标趋势、异常事件记录等服务报告。适用场景:客户希望将AI模型推理运维工作整体委托华为管理,需求以基础监控和日常运维为主,适合模型业务负载稳定、对SLA要求一般的场景。
服务规格
服务内容
适用场景
产品来源
AI模型监控与运维服务-基础版
针对请求延迟、吞吐量、NPU资源占用等核心指标进行监控;5×8小时告警响应与基础故障处置;主动运维(容器状态巡检、日志检查等);按周/月维度输出运行状态总览、关键指标趋势、异常事件记录等服务报告。
客户希望将AI模型推理运维工作整体委托华为管理,需求以基础监控和日常运维为主,适合模型业务负载稳定、对SLA要求一般的场景。
自研
AI模型监控与运维服务-标准版
全量指标监控采集,配置全量可视化面板与动态告警阈值;7×24小时分级告警响应与智能收敛降噪;日常运维操作;故障快速定位与恢复,确保模型SLA达标;按日/周/月维度输出服务报告,涵盖运行状态总览、关键指标趋势、异常事件处理明细、资源消耗统计及业务影响评估,并附优化建议。
客户希望将AI模型推理运维工作整体委托华为管理,需要全方位的监控告警与性能优化能力,适合模型业务负载较高、对SLA要求严格的场景。
自研
AI模型技术支持订阅服务
面向模型训练与推理全流程提供技术支持,包括工具使用咨询、报错日志解读、推理Profiling分析、样例选型与部署演示、量化方案选型与验证、推理调优方案、推理模型部署支持、训练框架安装指导、分布式环境初始化、数据集优化方案、训练优化方案、训练故障诊断、训练调参建议、并行策略调整、收敛性分析、模型使用诊断与建议等。
面向三方模型,客户为实施责任主体,华为侧提供技术支持与指导。适合客户自主实施过程中面临技术门槛高、试错成本大、效率低等挑战的场景。
自研
- AI模型监控与运维服务(标准版)
全量指标监控采集,配置全量可视化面板与动态告警阈值;7×24小时分级告警响应与智能收敛降噪;日常运维操作;故障快速定位与恢复,确保模型SLA达标;按日/周/月维度输出服务报告,涵盖运行状态总览、关键指标趋势、异常事件处理明细、资源消耗统计及业务影响评估,并附优化建议。适用场景:客户希望将AI模型推理运维工作整体委托华为管理,需要全方位的监控告警与性能优化能力,适合模型业务负载较高、对SLA要求严格的场景。
服务规格
服务内容
适用场景
产品来源
AI模型监控与运维服务-基础版
针对请求延迟、吞吐量、NPU资源占用等核心指标进行监控;5×8小时告警响应与基础故障处置;主动运维(容器状态巡检、日志检查等);按周/月维度输出运行状态总览、关键指标趋势、异常事件记录等服务报告。
客户希望将AI模型推理运维工作整体委托华为管理,需求以基础监控和日常运维为主,适合模型业务负载稳定、对SLA要求一般的场景。
自研
AI模型监控与运维服务-标准版
全量指标监控采集,配置全量可视化面板与动态告警阈值;7×24小时分级告警响应与智能收敛降噪;日常运维操作;故障快速定位与恢复,确保模型SLA达标;按日/周/月维度输出服务报告,涵盖运行状态总览、关键指标趋势、异常事件处理明细、资源消耗统计及业务影响评估,并附优化建议。
客户希望将AI模型推理运维工作整体委托华为管理,需要全方位的监控告警与性能优化能力,适合模型业务负载较高、对SLA要求严格的场景。
自研
AI模型技术支持订阅服务
面向模型训练与推理全流程提供技术支持,包括工具使用咨询、报错日志解读、推理Profiling分析、样例选型与部署演示、量化方案选型与验证、推理调优方案、推理模型部署支持、训练框架安装指导、分布式环境初始化、数据集优化方案、训练优化方案、训练故障诊断、训练调参建议、并行策略调整、收敛性分析、模型使用诊断与建议等。
面向三方模型,客户为实施责任主体,华为侧提供技术支持与指导。适合客户自主实施过程中面临技术门槛高、试错成本大、效率低等挑战的场景。
自研
服务范围
- 服务覆盖范围
- AI模型监控与运维服务(基础版/标准版)
- 服务启动与环境调研:与客户对接,了解模型部署架构与业务场景;确认监控指标范围与告警策略(基础版为基础告警策略,标准版为全栈监控指标范围与告警分级策略);制定运维作业计划(标准版含SLA标准)。
- 实时监测配置与部署:部署监控环境;配置核心/全量监控指标采集(请求延迟、吞吐量、NPU利用率、HBM使用率等);配置基础/全量可视化面板,设置基础/动态告警阈值;验证监控数据采集完整性与准确性。
- 告警响应与故障处置:基础版提供5×8小时监控值守与告警响应;标准版提供7×24小时监控值守与分级告警响应,智能收敛降噪;日常运维操作(容器状态巡检、日志检查);重大问题升级处理;标准版含故障快速定位与恢复,确保模型SLA达标。
- 定期分析与报告输出:基础版按周、月维度生成服务报告;标准版按日、周、月维度生成服务报告,内容涵盖运行状态总览、关键指标趋势图、异常事件处理明细、资源消耗统计及业务影响评估,并附优化建议。
- AI模型技术支持订阅服务
- 工具使用咨询:Benchmark工具、Profiling分析工具等使用方法解答,训练工具(MindSpeed/Megatron/DeepSpeed)、推理框架(vLLM)等使用方法解答。
- 报错日志解读:针对训练/推理报错日志,解读错误原因并给出初步排查方向(仅解读指引)。
- 推理Profiling结果分析:对推理过程中的Profiling结果进行分析。
- 推理模型部署支持:样例选型、样例部署演示、关键代码讲解、客户实操指导、参数调优(批处理/并发)。
- 量化方案选型与验证:根据精度与性能需求,推荐W8A8/W4A16/GPTQ/AWQ等量化方案,指导客户完成量化模型转换与精度验证,对比量化前后的精度损失与性能提升。
- 推理调优方案(脚本式调优):推荐量化方案、推理框架选型(vLLM)、并发与批处理策略,优化部署方案。
- 训练框架安装指导:指导客户完成PyTorch+torch_npu、MindSpeed等训练框架及CANN工具链的安装配置与环境变量设置。
- 分布式环境初始化:指导客户完成集群节点间SSH互信配置、网络连通性检查、HCCL通信域与rank table文件生成。
- 数据集优化方案:随机采样1k条分析进行数据集优化。
- 训练优化方案(脚本式调优):推荐并行策略、精调算法选型、训练超参建议,1种算法(如LoRA),迭代次数不超过3次。
- 训练故障诊断:针对loss异常、梯度异常、OOM、通信超时等问题进行根因分析。
- 调参建议:提供学习率调整、梯度裁剪、warmup策略、权重衰减等调参建议。
- 并行策略调整:调整TP/PP/DP并行度配置。
- 收敛性分析:分析训练loss曲线与评估指标,判断收敛趋势是否正常。
- 模型使用诊断与建议:针对客户在模型训练或推理使用过程中遇到的问题进行系统性诊断。
- AI模型监控与运维服务(基础版/标准版)
- 服务不覆盖范围
- 本服务不包含AI模型的开发、训练实施与代码编写。服务以客户为实施责任主体,华为侧提供技术支持与指导。
- 本服务不包含AI模型的部署实施操作(模型加载、推理服务部署由客户自行完成,华为提供指导)。
- 本服务不包含客户业务系统、应用系统的基础架构运维与网络运维。
- 本服务不包含非昇腾NPU平台的模型监控与技术支持。
- 销售限制:仅限基于MA平台、且由华为部署或训练的三方模型。
- 本服务不包含专业服务禁止销售的软件、软件开发、代码、工具、硬件等内容。
服务流程
| 服务阶段 | 里程碑说明 |
|---|---|
| 服务启动与环境调研 | 与客户对接,了解模型部署架构与业务场景;确认监控指标范围与告警策略(基础版/标准版);制定运维作业计划与SLA标准。 |
| 实时监测配置与部署 | 部署监控环境;配置核心/全量监控指标采集;配置可视化面板与告警阈值;验证监控数据采集完整性与准确性。 |
| 告警响应与故障处置 | 基础版5×8/标准版7×24小时监控值守与告警响应;日常运维操作(容器状态巡检、日志检查);重大问题升级处理;标准版含故障快速定位与恢复,确保SLA达标。 |
| 定期分析与报告输出 | 基础版按周/月维度生成服务报告;标准版按日/周/月维度生成服务报告,涵盖运行状态总览、关键指标趋势、异常事件处理明细、资源消耗统计及业务影响评估,附优化建议。 |
服务交付件
- AI模型监控与运维服务
服务规格
交付件
验收报告
AI模型监控与运维服务-基础版
《用户场景调研与运维作业计划报告》、《AI模型运行周报/月报》
同交付件
AI模型监控与运维服务-标准版
《用户场景调研与运维作业计划报告》、《AI模型运行日报/周报/月报》
同交付件
- AI模型技术支持订阅服务
服务规格
交付件
验收报告
AI模型技术支持订阅服务
《AI模型技术支持订阅服务支持报告》、《推理优化建议书》、《训练调优记录单》
同交付件
责任矩阵
- 共同责任
- 双方商定并确认具体的业务需求及目标。
- 双方商定并确认项目管理计划。
- 双方商定并确认方案内容并评审。
- 完成合同签订。
- 华为责任
- 华为云需明确此次项目的负责人,因特殊情况导致华为人员变更,需要提前3个工作日知会客户,直至项目最终验收完成。
- 华为云得到客户授权后,授权数据仅限用于AI模型运行支持服务中涉及的服务内容,不得超出限定范围。
- 客户责任
- 客户指派一位项目负责人协助华为云实施服务。此负责人应负责双方之协调及管理,负责审核、验收华为云提供的服务。
- 客户必须提供业务系统相关的信息(包括但不限于应用架构、部署架构、资源数量和性能),并提供模型部署环境与MA平台访问权限。
- 责任分工矩阵表
- AI模型监控与运维服务
以下为职责描述案例,可酌情修改;
R=责任方/Responsibility
S=协助方/Support
序号
服务流程
工作内容
华为
客户
1
服务启动与环境调研
与客户对接,了解模型部署架构与业务场景;确认监控指标范围与告警策略;制定运维作业计划
R
S
2
实时监测配置与部署
部署监控环境;配置核心/全量监控指标采集;配置可视化面板与告警阈值;验证监控数据采集完整性
R
S
3
告警响应与故障处置
监控值守与告警响应;日常运维操作;重大问题升级处理;故障快速定位与恢复
R
S
- AI模型技术支持订阅服务
以下为职责描述案例,可酌情修改;
R=责任方/Responsibility
S=协助方/Support
序号
服务流程
工作内容
华为
客户
1
使用答疑与调优支持
工具使用咨询、报错日志解读、推理Profiling分析
R
S
2
推理模型部署支持
样例选型、部署演示、关键代码讲解、参数调优、量化方案选型与验证
R
S
3
训练优化支持
训练框架安装指导、分布式环境初始化、训练优化方案、训练故障诊断、调参建议
R
S
- AI模型监控与运维服务
验收标准
周期计费模式:以服务方(华为云)入场为起始标志,基于合同/订单完成交付天数为终止标志,服务到期后自动通过验收。华为按各服务子项提交标准交付件,客户在华为云官网Console点击确认验收,或线下签字且盖章作为服务验收通过依据。
- AI模型监控与运维服务
华为按各服务子项提交标准交付件,客户在华为云官网Console点击确认验收,或线下签字且盖章作为服务验收通过依据。
- AI模型技术支持订阅服务
华为按各服务子项提交标准交付件,客户在华为云官网Console点击确认验收,或线下签字且盖章作为服务验收通过依据。
验收流程
- 验收流程仅针对华为负责的文档类交付件。
- 交付件的验收以SOW中对交付件的描述和要求为准。
- 对交付件的验收应着重于对文档实质内容的验收,凡交付件实质内容符合本工作说明书约定的,应予通过验收和接受。少量格式、词汇、修饰等方面的不符不应被作为不验收的理由,但华为应就格式、词汇、修饰等方面的不符处按客户要求在合理的时间内进行修改。
- 乙方负责输出项目交付件并自检,合格后提交验收申请
- 甲方对交付件进行评审,评审通过后在交付件上签字。若评审有问题,乙方根据评审意见进行整改,重新提交验收申请。
- 乙方收到评审意见后,应3个工作日内完成对交付件的修改,并提交修改后的交付件给甲方验收。
- 甲方在收到乙方提交的交付件后,应在3个工作日内反馈意见给乙方,以上过程不应超过1次。如果乙方在交付件提交给甲方后的3个工作日内尚未收到甲方的书面反馈意见,则该轮提交的交付件将被视为已被甲方接受并作为最终版本验收通过。
免责条款及服务声明
华为云基于现有责任和限制条件条款,针对AI模型运行支持服务作以下声明:
- 本服务以客户为实施责任主体,华为侧提供技术支持与指导,不承担模型开发、训练实施与代码编写的责任。
- 服务的有效实施依赖于客户提供的模型部署环境、MA平台访问权限及相关资源信息。
- 服务范围内涉及的技术支持与运维操作,以合同/SOW约定的工作内容与交付件为准。
- 因客户环境、第三方模型本身或非华为原因导致的服务延期或无法完成,华为不承担相关责任。