更新时间:2026-10-10 GMT+08:00

资源规划

该解决方案主要部署如下资源,不同产品的花费仅供参考,实际以收费账单为准,具体请参考华为云官网价格。“请注意,此处列出的资源成本规划仅涵盖‘快速部署’阶段产生的资源及相关费用。后续在‘AI开发平台ModelArts’上实际使用服务时,将产生额外的计费项目。”

表1 资源和成本规划(按需计费)

华为云服务

配置示例

数量

一次完整流程预估(1小时)花费

Flexus云服务器X实例

  • 区域:中国-香港
  • 计费模式:按需计费
  • 规格:Flexus云服务器X实例 | 性能模式(开启)| kc1.xlarge.2 | 4核 | 8 GB
  • 镜像:Huawei Cloud EulerOS 2.0 标准版 64位 ARM版(10GiB)
  • 系统盘:通用型SSD | 100GB

1台

$0.14 USD

弹性公网IP EIP

  • 按需计费:$0.16 USD/GB
  • 区域:中国-香港
  • 计费模式:按需计费
  • 线路:动态BGP
  • 公网带宽:按流量计费
  • 带宽大小:300Mbit/s

1个

$0.16 USD/GB

对象存储服务OBS

  • 区域:中国-香港
  • 桶策略:私有
  • 数据冗余存储策略:单AZ存储

1个

费用包括存储空间、请求费用、流量费用两部分,详细请参考每月账单。

合计

-

  

$0.14 USD+ 弹性公网IP EIP费用+OBS实际使用费用

该解决方案支持一键部署的模型列表:
表2 支持的模型及其最小卡数和最大序列(开源版本)

序号

模型名称

是否支持fp16/bf16推理

是否支持W8A8量化

是否支持W4A8量化

v0/v1 后端

最小卡数(64G显存)

最大序列(K)

max-model-len

开源权重获取地址

1

Qwen3.6-35B-A3B

√

x

x

v1

2

128

https://modelscope.cn/models/Qwen/Qwen3.6-35B-A3B/files

2

DeepSeek-V4-Flash-0731-w8a8

x

√

x

x

8

128

/

3

Qwen3.8-27B-W8A8

x

√

√

v1

1

256

https://modelscope.cn/models/Eco-Tech/Qwen3.8-27B-w8a8/files

4

Qwen3-ASR-1.7B

√

x

x

v1

1

32

https://modelscope.cn/models/Qwen/Qwen3-ASR-1.7B/files

5

Qwen3-TTS-12Hz-1.7B-CustomVoice

√

x

x

v1

1

32

https://modelscope.cn/models/Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice/files

6

Qwen3-TTS-12Hz-1.7B-VoiceDesign

√

x

x

v1

1

32

https://modelscope.cn/models/Qwen/Qwen3-TTS-12Hz-1.7B-VoiceDesign/files

7

MinerU

√

x

x

v1

1

/

https://modelscope.cn/models/OpenDataLab/MinerU2.5-Pro-2605-1.2B/files