# 快速体验DeepSeek-V4-Flash模型
本案例用于指导用户使用MaaS的DeepSeek-V4-Flash模型服务，快速实现对话问答。
#### 计费说明
在调用预置模型推理服务的过程中，输入内容首先会被分词（tokenize），转换为模型可识别的Token。在调用MaaS预置服务时，将根据实际使用的Tokens数量进行计费。详细信息，请参见[推理服务计费项](https://support.huaweicloud.com/price-maas/price-maas-0002.html)。
#### 约束限制
该功能仅支持"西南-贵阳一"区域。
#### 准备工作
请参考[配置委托授权使用MaaS](https://support.huaweicloud.com/permission-maas/maas-modelarts-0016.html)进行授权。
#### 步骤一：开通DeepSeek-V4-Flash模型服务
1. 在[MaaS控制台](https://console.huaweicloud.com/modelarts/#/model-studio/homepage)左侧导航栏，选择"模型推理 \> 在线推理"。
2. 在"预置服务"页签，单击DeepSeek-V4-Flash模型服务操作列的"开通服务"。
3. 在开通预置模型服务对话框，默认已勾选DeepSeek-V4-Flash模型服务，确认并勾选"我已阅读并同意上述说明，及《MaaS 模型即服务声明》"，单击"一键开通"。 当DeepSeek-V4-Flash模型服务的付费状态为开通，表示DeepSeek-V4-Flash模型服务已开通。
   
 
#### 步骤二：在线体验DeepSeek-V4-Flash模型服务
在"模型推理 \> 在线推理 \> 预置服务"页面的"操作"列，使用预置的DeepSeek-V4-Flash模型服务进行API调用或在线体验。
图1预置服务   
![](https://support.huaweicloud.com/bestpractice-maas/figure/zh-cn_image_0000002696429749.png "点击放大")
- [API调用]
  本案例以Postman为例进行API调用。"API调用说明"页面提供了模型调用的相关信息，您可以按照页面提示修改相关参数后进行调用。关于调用参数的说明，请参见[对话Chat/Post](https://support.huaweicloud.com/model-call-maas/model-call-018.html)。
  1. 在DeepSeek-V4-Flash服务右侧的"操作"列，单击"API调用"，选择版本。
  
  2. 在"API调用说明"页面，单击"创建 API Key"。
     图2API调用说明   
     ![](https://support.huaweicloud.com/bestpractice-maas/figure/zh-cn_image_0000002666470046.png "点击放大") 
  
  3. 在"创建 API Key"页面，填写标签、描述和权限信息后，单击"确定"。 标签在创建完成后，不支持修改。关于API Key参数说明，请参见[创建API Key](https://support.huaweicloud.com/model-call-maas/model-call-049.html)。
     图3创建API Key   
     ![](https://support.huaweicloud.com/bestpractice-maas/figure/zh-cn_image_0000002696469837.png "点击放大")
     
     
  
  4. 在"您的API Key"对话框，复制密钥并保存至安全位置。保存完毕后，单击"我已保存，确认关闭"。 单击"我已保存，确认关闭"后将无法再次查看密钥。
     
  
  5. 下载Postman软件并安装，您也可以直接在Chrome浏览器添加Postman扩展程序（也可使用其他支持发送post请求的软件）。Postman推荐使用7.24.0版本。
  
  6. 打开Postman，在Postman界面填写参数。
     - 选择POST任务，将模型服务的API地址复制到POST后面的方框。
     
     - Headers页签的Key值填写为"Authorization"，Value值为"Bearer"加空格加API KEY的内容。
     
     - Body页签选择"raw"，选择JSON(application/json)类型，在下方文本框中填写请求体。 请求体样例如下。
       ```
       {
               "model": "deepseek-v4-flash", 
               "messages": [
                   {"role": "system", "content": "You are a helpful assistant."},
                   {"role": "user", "content": "你好"}
               ]
           }
       ```
       
      
  
  7. 单击"send"发送请求，结果会在"Response"下的对话框里显示。
   
- [在线体验]
  在DeepSeek-V4-Flash服务右侧的"操作"列，单击"在线体验"或"更多 \> 在线体验"，选择版本，跳转到"文本对话"页面，即可开始问答体验。更多信息，请参见[在MaaS体验文本对话](https://support.huaweicloud.com/model-call-maas/model-call-055.html)。
  图4文本对话   
  ![](https://support.huaweicloud.com/bestpractice-maas/figure/zh-cn_image_0000002666470050.png "点击放大")
  对于生成的内容，您可以在模型对话框左下方，单击![](https://support.huaweicloud.com/bestpractice-maas/figure/zh-cn_image_0000002696469839.png)图标复制回答，也可以单击![](https://support.huaweicloud.com/bestpractice-maas/figure/zh-cn_image_0000002666629936.png)图标重新生成回答。
  如果您需要开启新对话，可以在页面右上角单击"开启新对话"，在对话框单击"确定"。开启新对话将清除全部对话，无法保留对话记录。
  您还可以在页面左上方，单击"模型参数"，按需拖动或直接输入数值配置推理参数，获得更好的推理效果。单击"恢复默认"可以将参数值调回默认值。
  图5设置推理参数   
  ![](https://support.huaweicloud.com/bestpractice-maas/figure/zh-cn_image_0000002696429753.png "点击放大")
  表1参数设置 
  | 参数             | 说明                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                          | 取值样例 |
  |:---|:---|:---|
  | 温度/Temperature | 设置推理温度，用于控制生成文本的随机性和创造性，Temperature数值越大随机性越大。 - 数值较低，输出结果更加集中和确定。  - 数值较高，输出结果更加随机，更有创意性。   取值范围：0\~2 默认值：不同模型的默认值不同，请以实际环境为准。                                                                                                                                                                                         | 0.7    |
  | 核采样/top_p       | 设置推理核采样，用于调整输出文本的多样性。top_p数值越大，生成文本的多样性就越高。 - 数值较低，输出可选的tokens类型越少，更有确定性。  - 数值较高，输出可选的tokens类型越多，更有多样性。   取值范围：0.1\~1 默认值：不同模型的默认值不同，请以实际环境为准。 详细解释：top_p可以设置tokens候选列表的大小，将可能性之和刚好超过设定值P的top tokens列入候选名单，然后从候选名单中随机采样，生成一个token。   | 1      |
  | top_k         | 用于控制输出tokens的多样性。top_k值越大输出的tokens类型越丰富。选择在模型的输出结果中选择概率最高的前K个结果。 - 数值较低，输出可选的tokens类型越少，更有确定性。  - 数值较高，输出可选的tokens类型越多，更有多样性。   取值范围：1\~1000 默认值：20 详细解释：top_k可以设置保留概率最高的前K个tokens，从中随机抽取一个token作为最终输出。这种方法可以限制输出序列的长度，并仍然保持样本的一定多样性。 | 20       |
     
#### 后续操作
- **[在MaaS查看在线推理的调用数据和监控指标](https://support.huaweicloud.com/call-statistics-maas/maas-modelarts-0074.html)：**MaaS提供调用统计功能，支持查看模型服务在指定时间段内的调用数据和监控指标详情，帮助您了解服务的使用情况和性能变化，从而更有效地进行模型评估、问题定位、故障排除和性能优化。
 
