资源规划
该解决方案主要部署如下资源,不同产品的花费仅供参考,实际以收费账单为准,具体请参考华为云官网价格。“请注意,此处列出的资源成本规划仅涵盖‘快速部署’阶段产生的资源及相关费用。后续在‘魔坊(ModelArts)模型训推平台’上实际使用服务时,将产生额外的计费项目。”
| 华为云服务 | 配置示例 | 数量 | 一次完整流程预估(1小时)花费 |
|---|---|---|---|
| Flexus云服务器X实例 |
| 1台 | 西南-贵阳一:0.387元 华北-乌兰察布一:0.401元 |
| 弹性公网IP EIP |
| 1个 | 0.8元/GB |
| 对象存储服务OBS |
| 1个 | 费用包括存储空间、请求费用、流量费用两部分,详细请参考每月账单。 |
| 合计 | - | 西南-贵阳一:0.387元+ 弹性公网IP EIP费用+OBS实际使用费用 华北-乌兰察布一:0.401元+ 弹性公网IP EIP费用+OBS实际使用费用 |
| 序号 | 模型分类 | 模型名称 | 是否支持fp16/bf16推理 | 是否支持W8A8量化 | v0/v1 后端 | 最小卡数(64G显存) | 最大序列(K) max-model-len | 开源权重获取地址 |
|---|---|---|---|---|---|---|---|---|
| 1 | 大语言模型 | Qwen3-14B | √ | x | v1 | 1 | 32 | |
| 2 | Qwen3-30B-A3B-Instruct-2507 | √ | x | v1 | 2 | 32 | ||
| 3 | Qwen3-32B | √ | x | v1 | 2 | 32 | ||
| 4 | DeepSeek-R1-Distill-Llama-70B | √ | x | v1 | 4 | 32 | https://huggingface.co/deepseek-ai/DeepSeek-R1-Distill-Llama-70B | |
| 5 | Embedding&Rerank | Qwen3-Embedding-8B | √ | x | v0 | 1 | 40 | |
| 6 | Qwen3-Reranker-8B | √ | x | v0 | 1 | 40 | ||
| 7 | bge-reranker-v2-m3 | √ | x | v0 | 1 | 8 | ||
| 8 | bge-large-zh-v1.5 | √ | x | v0 | 1 | 0.5 | ||
| 9 | bge-m3 | √ | x | v0 | 1 | 8 | ||
| 10 | 多模态 | Qwen3-VL-30B-A3B-Instruct | √ | x | v1 | 2 | 32 | |
| 11 | Qwen3-VL-32B-Instruct | √ | x | v1 | 2 | 32 |
| 序号 | 模型名称 | 是否支持fp16/bf16推理 | 是否支持W8A8量化 | 是否支持W4A8量化 | v0/v1 后端 | 最小卡数(64G显存) | 最大序列(K) max-model-len | 开源权重获取地址 |
|---|---|---|---|---|---|---|---|---|
| 1 | Qwen3.6-35B-A3B | √ | x | x | v1 | 2 | 128 | |
| 2 | Qwen3.6-27B | √ | x | x | v1 | 2 | 128 | |
| 3 | Qwen3-Next-80B-A3B-Instruct | √ | x | x | v1 | 4 | 128 | https://modelscope.cn/models/Qwen/Qwen3-Next-80B-A3B-Instruct/files |
| 4 | GLM-5.1-w4a8 | x | x | √ | v1 | 8 | 36 | / |
| 5 | Owen3.5-122B-A10B | √ | x | x | v1 | 8 | 256 | / |
| 6 | DeepSeek-V4-Flash-w8a8-mtp | x | √ | x | x | 8 | 128 | / |
| 7 | DeepSeek-V4-Flash-0731-w8a8 | x | √ | x | x | 8 | 128 | / |