更新时间:2026-09-04 GMT+08:00
分享

资源规划

该解决方案主要部署如下资源,不同产品的花费仅供参考,实际以收费账单为准,具体请参考华为云官网价格。“请注意,此处列出的资源成本规划仅涵盖‘快速部署’阶段产生的资源及相关费用。后续在‘魔坊(ModelArts)模型训推平台’上实际使用服务时,将产生额外的计费项目。”

表1 资源和成本规划(按需计费)

华为云服务

配置示例

数量

一次完整流程预估(1小时)花费

Flexus云服务器X实例

  • 区域:西南-贵阳一、华北-乌兰察布一
  • 计费模式:按需计费
  • 规格:Flexus云服务器X实例 | 性能模式(开启)| kx1.4u.8g | 4核 | 8 GB
  • 镜像:Huawei Cloud EulerOS 2.0 Standard 64 bit for ARM(10GiB)
  • 系统盘:通用型SSD | 100GB

1台

西南-贵阳一:0.387元

华北-乌兰察布一:0.401元

弹性公网IP EIP

  • 按需计费:0.8元/GB
  • 区域:西南-贵阳一、华北-乌兰察布一
  • 计费模式:按需计费
  • 线路:动态BGP
  • 公网带宽:按流量计费
  • 带宽大小:300Mbit/s

1个

0.8元/GB

对象存储服务OBS

  • 桶策略:私有
  • 数据冗余存储策略:单AZ存储
  • 区域:西南-贵阳一、华北-乌兰察布一

1个

费用包括存储空间、请求费用、流量费用两部分,详细请参考每月账单。

合计

-

  

西南-贵阳一:0.387元+ 弹性公网IP EIP费用+OBS实际使用费用

华北-乌兰察布一:0.401元+ 弹性公网IP EIP费用+OBS实际使用费用

该解决方案支持一键部署的模型列表:
表2 支持的模型及其最小卡数和最大序列(6.5.908版本

序号

模型分类

模型名称

是否支持fp16/bf16推理

是否支持W8A8量化

v0/v1 后端

最小卡数(64G显存)

最大序列(K)

max-model-len

开源权重获取地址

1

大语言模型

Qwen3-14B

x

v1

1

32

https://huggingface.co/Qwen/Qwen3-14B

2

Qwen3-30B-A3B-Instruct-2507

x

v1

2

32

https://huggingface.co/Qwen/Qwen3-30B-A3B

3

Qwen3-32B

x

v1

2

32

https://huggingface.co/Qwen/Qwen3-32B

4

DeepSeek-R1-Distill-Llama-70B

x

v1

4

32

https://huggingface.co/deepseek-ai/DeepSeek-R1-Distill-Llama-70B

5

Embedding&Rerank

Qwen3-Embedding-8B

x

v0

1

40

https://huggingface.co/Qwen/Qwen3-Embedding-8B

6

Qwen3-Reranker-8B

x

v0

1

40

https://huggingface.co/Qwen/Qwen3-Reranker-8B

7

bge-reranker-v2-m3

x

v0

1

8

https://huggingface.co/BAAI/bge-reranker-v2-m3

8

bge-large-zh-v1.5

x

v0

1

0.5

https://huggingface.co/BAAI/bge-large-zh-v1.5

9

bge-m3

x

v0

1

8

https://huggingface.co/BAAI/bge-m3

10

多模态

Qwen3-VL-30B-A3B-Instruct

x

v1

2

32

https://huggingface.co/Qwen/Qwen3-VL-30B-A3B-Instruct

11

Qwen3-VL-32B-Instruct

x

v1

2

32

https://huggingface.co/Qwen/Qwen3-VL-32B-Instruct

表3 支持的模型及其最小卡数和最大序列(开源版本)

序号

模型名称

是否支持fp16/bf16推理

是否支持W8A8量化

是否支持W4A8量化

v0/v1 后端

最小卡数(64G显存)

最大序列(K)

max-model-len

开源权重获取地址

1

Qwen3.6-35B-A3B

x

x

v1

2

128

https://modelscope.cn/models/Qwen/Qwen3.6-35B-A3B/files

2

Qwen3.6-27B

x

x

v1

2

128

https://modelscope.cn/models/Qwen/Qwen3.6-27B/files

3

Qwen3-Next-80B-A3B-Instruct

x

x

v1

4

128

https://modelscope.cn/models/Qwen/Qwen3-Next-80B-A3B-Instruct/files

4

GLM-5.1-w4a8

x

x

v1

8

36

/

5

Owen3.5-122B-A10B

x

x

v1

8

256

/

6

DeepSeek-V4-Flash-w8a8-mtp

x

x

x

8

128

/

7

DeepSeek-V4-Flash-0731-w8a8

x

x

x

8

128

/

相关文档