# 如何为智能体匹配最佳奖惩机制
在准备好高质量的数据集后，接下来就是最核心的创建模型优化任务环节。
强化学习的核心在于"奖惩机制"的配置，本章节中主要介绍不同类型智能体的配置策略，然后您再参考指引完成平台上的具体操作。
在模型优化中，可以不按照客服智能体、RAG智能体这种方式进行划分，而是**按照"智能体最终的输出形态"进行分类**。输出形式直接决定了您使用哪种奖惩配置。
表1奖罚机制选型 
| 智能体输出型态              | 推荐奖罚机制             | 核心配置                    | 参考示例                                                                                  |
|:---|:---|:---|:---|
| 预定义标签/数字ID/极简JSON | 规则奖励-精确匹配奖励       | 正则提取+比对               | [意图识别/分类场景](https://support.huaweicloud.com/ops-agentarts/agentarts_14_0116.html)   |
| 数值计算结果             | 规则奖励-数学准确性奖励+思维链格式奖励 | 正则提取+比对                 | [工具调用/数学计算场景](https://support.huaweicloud.com/ops-agentarts/agentarts_14_0117.html)  |
| 长篇非结构化文本           | 生成式奖励              | 裁判模型+评分标准             | [开放式问答场景](https://support.huaweicloud.com/ops-agentarts/agentarts_14_0118.html)       |
| 多步工具调用（含过程校验）      | 自适应奖励              | Python代码+trajectory轨迹 | [插件/MCP工具调用场景](https://support.huaweicloud.com/ops-agentarts/agentarts_14_0129.html) |
   
#### 类别一：严格结构化输出/意图分类场景
- **业务场景：**意图分类场景、单选/多选/判断场景、状态判断场景（如审批流程中使用"通过、驳回"决定下一节点如何运行）等。
- **智能体输出特征：**模型需输出预定义的标签（如"通过"/"驳回"、"积极"/"消极"）、数字编码或极简JSON（如 {"reference_output": "A"}）。在这些场景中，大模型常犯的毛病是"过度热情"，喜欢在答案前后加上"好的，根据您的要求，输出如下..."等解释性废话，导致下游无法直接读取结果。
- **强化学习奖罚策略配置：** 这种场景下，需要采用严格的字符串完全匹配，不仅验证答案正确性，更要求输出内容与标准答案字面完全一致（包括格式、标点、空格等）。在创建模型优化任务中，**奖罚机制建议使用规则奖励中的精确匹配奖励，并配合正则表达式使用** 。通过正则精确提取目标内容，如果提取结果与标准答案存在任何差异系统将直接予以负分惩罚（如输出"通过"而非"验证结果为：通过"，或包含额外的解释文字）。这种严格约束可快速训练模型输出规范格式。**具体的正则表达式配置示例，请参考[意图识别/分类场景](https://support.huaweicloud.com/ops-agentarts/agentarts_14_0116.html)。**
 
#### 类别二：数值计算/工具调用参数生成场景
- **业务场景：**数学运算解答场景、工具调用参数提取场景、工程物理规则推导场景。
- **智能体输出特征：** 这类任务的核心难点有两个。
  - 答案形式多样性：模型输出可能与标准答案形式不同但实质等价（如输出0.5而标准答案是1/2，或输出1.0而标准答案是1）。
  
  - 输出答案前需要先进行推导：模型必须经过严密的推导才能得出正确结论，不能直接给出答案。
   
- **强化学习奖罚策略配置：** 在创建模型优化任务时，推荐组合使用"思维链格式奖励 + 数学准确性奖励"两种奖罚机制。
  - 约束思考过程：使用"思维链格式奖励"，通过正则表达式强制要求模型在输出最终答案前，例如必须使用 \<think\>...\</think\>标签展示思考过程，没有思考过程，直接扣分。这能极大提升小尺寸模型的逻辑严密性。
  
  - 包容格式差异：使用"数学准确性奖励"，底层算法会调用专属的符号计算引擎，将模型输出的结果转化为数学符号与标准答案进行比对，并默认容忍1%的浮点数相对误差。
  
  - 具体的思维链格式奖励与数学准确性奖励配置示例，请参考[工具调用/数学计算场景](https://support.huaweicloud.com/ops-agentarts/agentarts_14_0117.html)。
   
 
#### 类别三：开放式生成场景
- **业务场景：**智能客服话术生成场景、文章总结提取场景、代码编写场景、多轮对话连贯性维持场景。
- **智能体输出特征：**输出通常是长篇非结构化文本。同一个问题，有多种正确的回答方式。评判重点不在于字面是否一致，而在于逻辑是否自洽、语气是否符合品牌调性、以及事实是否准确。
- **强化学习奖罚策略配置：**在创建模型优化任务时，推荐使用"生成式奖励"，即引入一个"裁判模型"对输出结果进行评分。生成式奖励的核心在于编写一套评分标准。您需要像给人类阅卷老师写标准一样，用自然语言明确指出"满分是什么样"、"什么情况扣分"、"什么情况一票否决"。裁判大模型会阅读您的评分标准（平台预置了评分标准的模板，您可以直接修改使用），对比标准答案，打出一个0.0 \~ 1.0的评分。
- 评分标准编写示例：
  - 1.0分：信息完全准确，格式符合预期
  
  - 0.5-0.9分：基本正确，但有轻微格式问题或语气不够自然
  
  - 0分：包含事实性错误或严重幻觉（一票否决）
  
  
  具体的评分标准编写示例，请参考[开放式问答场景](https://support.huaweicloud.com/ops-agentarts/agentarts_14_0118.html)。
  
 
#### 类别四：插件/MCP/多步工具调用场景
- **业务场景：**企业知识检索助手、运维诊断助手、业务办理助手、办公自动化助手等需要调用插件、MCP多个工具协同完成任务的场景。
- **智能体输出特征：**模型不仅要给出最终答案，还需要根据用户问题判断是否调用工具、调用哪个工具、如何填写参数、是否继续发起下一步工具调用，以及如何整合多步调用结果形成最终回复。
- **强化学习奖罚策略配置：**
  表2策略说明 
  | 业务关注点         | 推荐奖惩机制     | 说明                                                   |
  |:---|:---|:---|
  | 仅关注最终结果是否正确  | 规则奖励或生成式奖励 | 根据输出形态选择，详见类别一至三。                                   |
  | 需校验工具调用过程 | 自适应奖励     | 通过读取trajectory.steps对工具调用轨迹进行精确打分，详见 插件/MCP工具调用场景。 |
     
  
 
