
# 资源规划
该解决方案主要部署如下资源，不同产品的花费仅供参考，实际以收费账单为准，具体请参考华为云[官网价格](https://www.huaweicloud.com/pricing.html?tab=detail#/ocr)。"请注意，此处列出的资源成本规划仅涵盖'快速部署'阶段产生的资源及相关费用。后续在'魔坊（ModelArts）模型训推平台'上实际使用服务时，将产生额外的计费项目。"
表1资源和成本规划(按需计费) 
| 华为云服务         | 配置示例                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                       | 数量 | 一次完整流程预估（1小时）花费                                                                                         |
|:---|:---|:---|:---|
| Flexus云服务器X实例 | - 区域：西南-贵阳一、华北-乌兰察布一  - 计费模式：按需计费  - 规格：Flexus云服务器X实例 \| 性能模式（开启）\| kx1.4u.8g \| 4核 \| 8 GB  - 镜像：Huawei Cloud EulerOS 2.0 Standard 64 bit for ARM(10GiB)  - 系统盘：通用型SSD \| 100GB   | 1台 | 西南-贵阳一：0.387元 华北-乌兰察布一：0.401元                                                |
| 弹性公网IP EIP    | - 按需计费：0.8元/GB  - 区域：西南-贵阳一、华北-乌兰察布一  - 计费模式：按需计费  - 线路：动态BGP  - 公网带宽：按流量计费  - 带宽大小：300Mbit/s                                        | 1个 | 0.8元/GB                                                                                                 |
| 对象存储服务OBS     | - 桶策略：私有  - 数据冗余存储策略：单AZ存储  - 区域：西南-贵阳一、华北-乌兰察布一                                                                                                                                                                                                                                                              | 1个 | 费用包括存储空间、请求费用、流量费用两部分，详细请参考每月账单。                                                                        |
| 合计            | -                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                          |    | 西南-贵阳一：0.387元+ 弹性公网IP EIP费用+OBS实际使用费用 华北-乌兰察布一：0.401元+ 弹性公网IP EIP费用+OBS实际使用费用 |
   
该解决方案支持一键部署的模型列表：
 表2支持的模型及其最小卡数和最大序列（6.5.908版本） 
| 序号 | 模型分类              | 模型名称                          | 是否支持fp16/bf16推理 | 是否支持W8A8量化 | v0/v1 后端 | 最小卡数（64G显存） | 最大序列(K) max-model-len | 开源权重获取地址                                                           |
|:---|:---|:---|:---|:---|:---|:---|:---|:---|
| 1  | 大语言模型             | Qwen3-14B                     | √               | x          | v1       | 1           | 32                                               | <https://huggingface.co/Qwen/Qwen3-14B>                            |
| 2  | 大语言模型             | Qwen3-30B-A3B-Instruct-2507   | √               | x          | v1       | 2           | 32                                               | <https://huggingface.co/Qwen/Qwen3-30B-A3B>                        |
| 3  | 大语言模型             | Qwen3-32B                     | √               | x          | v1       | 2           | 32                                               | <https://huggingface.co/Qwen/Qwen3-32B>                            |
| 4  | 大语言模型             | DeepSeek-R1-Distill-Llama-70B | √               | x          | v1       | 4           | 32                                               | <https://huggingface.co/deepseek-ai/DeepSeek-R1-Distill-Llama-70B> |
| 5  | Embedding\&Rerank | Qwen3-Embedding-8B            | √               | x          | v0       | 1           | 40                                               | <https://huggingface.co/Qwen/Qwen3-Embedding-8B>                   |
| 6  | Embedding\&Rerank | Qwen3-Reranker-8B             | √               | x          | v0       | 1           | 40                                               | <https://huggingface.co/Qwen/Qwen3-Reranker-8B>                    |
| 7  | Embedding\&Rerank | bge-reranker-v2-m3            | √               | x          | v0       | 1           | 8                                                | <https://huggingface.co/BAAI/bge-reranker-v2-m3>                   |
| 8  | Embedding\&Rerank | bge-large-zh-v1.5             | √               | x          | v0       | 1           | 0.5                                              | <https://huggingface.co/BAAI/bge-large-zh-v1.5>                    |
| 9  | Embedding\&Rerank | bge-m3                        | √               | x          | v0       | 1           | 8                                                | <https://huggingface.co/BAAI/bge-m3>                               |
| 10 | 多模态               | Qwen3-VL-30B-A3B-Instruct     | √               | x          | v1       | 2           | 32                                               | <https://huggingface.co/Qwen/Qwen3-VL-30B-A3B-Instruct>            |
| 11 | 多模态               | Qwen3-VL-32B-Instruct         | √               | x          | v1       | 2           | 32                                               | <https://huggingface.co/Qwen/Qwen3-VL-32B-Instruct>                |
   
 表3支持的模型及其最小卡数和最大序列（开源版本） 
| 序号 | 模型名称                        | 是否支持fp16/bf16推理 | 是否支持W8A8量化 | 是否支持W4A8量化 | v0/v1 后端 | 最小卡数（64G显存） | 最大序列(K) max-model-len | 开源权重获取地址                                                              |
|:---|:---|:---|:---|:---|:---|:---|:---|:---|
| 1  | Qwen3.6-35B-A3B             | √               | x          | x          | v1       | 2           | 128                                            | <https://modelscope.cn/models/Qwen/Qwen3.6-35B-A3B/files>             |
| 2  | Qwen3.6-27B                 | √               | x          | x          | v1       | 2           | 128                                            | <https://modelscope.cn/models/Qwen/Qwen3.6-27B/files>                 |
| 3  | Qwen3-Next-80B-A3B-Instruct | √               | x          | x          | v1       | 4           | 128                                            | <https://modelscope.cn/models/Qwen/Qwen3-Next-80B-A3B-Instruct/files> |
| 4  | GLM-5.1-w4a8                | x               | x          | √          | v1       | 8           | 36                                             | /                                                                     |
| 5  | Owen3.5-122B-A10B           | √               | x          | x          | v1       | 8           | 256                                            | /                                                                     |
| 6  | DeepSeek-V4-Flash-w8a8-mtp  | x               | √          | x          | x        | 8           | 128                                            | /                                                                     |
| 7  | DeepSeek-V4-Flash-0731-w8a8 | x               | √          | x          | x        | 8           | 128                                            | /                                                                     |
   
