# 模型优化的原理
用好智能体的优化功能，不需要熟练掌握复杂的算法原理，但了解优化背后的运行逻辑，能极大地帮助您设计出高质量的训练任务。
#### 强化学习简介
模型优化的底层技术是强化学习（Reinforcement Learning, RL）。强化学习本质上是一种"通过在环境中试错来学习"的机制。
可借助一个典型的工程案例进行理解--教导一辆汽车（车载计算机智能体）如何自动泊车：
- 智能体：车载计算机。
- 环境：停车场、车辆动态特性、雷达和摄像头的传感器读数。
- 动作：打方向盘、踩刹车、加速等。
- 奖励：如果车辆准确停入车位中，系统给出一个高分奖励；如果压线或者撞到障碍物，给出一个负分惩罚。
在训练初期，车载计算机会像新手司机一样，尝试各种随机的操作（有时甚至撞上周边物体）。但通过成千上万次的"尝试-反馈-修正"，它会逐渐掌握规律：当看到边距变窄（观测值）时，打方向盘（动作）能获得更好的停车效果（奖励）。最终，学会了精准泊车。
**模型优化的本质与此完全一致**，只不过的"车"变成了大语言模型，"停车场"变成了您的Agent业务场景。
- 智能体：被训练的模型。
- 环境：您在AgentArts中创建好的Agent运行环境（包括预设Prompt、知识库、插件、MCP等。
- 动作：Agent生成的回复文本、推理过程、工具选择、工具参数填写，以及在单次任务中发起的多步工具调用过程等。
- 奖励：系统通过对比模型输出与您的标准答案，利用"奖励规则（正则/数值）"或"生成式裁判打分"给出分数。
通过模型优化功能不断做题并获取分数反馈，原本"不太聪明"的小尺寸模型就能逐渐掌握在您这个专属业务场景下的作答技巧。
#### 模型优化运行机制
![](https://support.huaweicloud.com/ops-agentarts/zh-cn_image_0000002589002147.png)
整个模型优化过程分为三个紧密相连的阶段：
**阶段一：准备任务配置信息**
准备需要优化的Agent以及训练数据，选择基础模型，设置奖励规则。
![](https://support.huaweicloud.com/ops-agentarts/public_sys-resources/note_3.0-zh-cn.png)
训练启动后，数据集中的问题将送入Agent环境，数据集的使用方式如下：
- 问题字段（input）将送入Agent环境，触发模型作答（此时Agent中的模型已被替换为被训模型）。
- 答案字段（reference_output）将作为裁判中心的评分基准：
- 使用规则裁判时，答案需与预期结果精确匹配。
- 使用大模型裁判时，系统将对回答的语义质量进行综合评分。
 
**阶段二：在线强化学习**
这是整个模型优化的核心。系统不会让模型死记硬背，模型通过在真实环境中反复探索与反馈来调整行为，而非直接拟合固定答案，因此具备更强的泛化能力。具体过程如下：
- 模型置换：系统会将被训模型直接置换到您的Agent中。
- 循环训练：模型针对问题生成回答，裁判中心依据规则或大模型裁判进行打分，系统依据得分的高低，通过强化学习算法（GRPO）反向更新模型内部参数。模型进入一个"尝试作答 \> 自动打分 \> 自我进化"的循环，得分高就巩固记忆，得分低就纠正行为。
- 群组对比：GRPO算法针对同一个问题，让模型同时生成多个不同的候选回答并分别打分，通过组内对比强化高分回答的生成策略、抑制低分回答，让模型逐步学会输出更高质量的回答。
![](https://support.huaweicloud.com/ops-agentarts/public_sys-resources/note_3.0-zh-cn.png)
如果智能体中配置了插件、MCP这种工具能力，训练时这些能力会随Agent环境一同保留。模型会在一次任务中按真实链路完成多步工具交互，系统再结合最终结果或运行轨迹进行打分与更新。
**阶段三：评估与部署**
在不断的循环进化中，系统会阶段性地为您保存"模型快照"。您只需结合训练监控看板上的得分图表，挑选出综合得分最高且表现最稳定的一个快照，通过部署替换Agent中的原模型，即可完成能力升级。
**运行示例：以客服意图分类为例**
假设您有一个电信客服意图分类工作流，训练数据中有一条：问题="宽带用着怎么断了"，标准答案="故障报修"。
1. 系统将小尺寸模型替换到工作流的意图识别节点中。
2. 模型收到问题"宽带断了"，同时生成多个候选回答（GRPO群组对比）。
3. 裁判中心用精准匹配规则分别打分：回答"故障报修"得高分，回答"根据您的描述，应该是故障报修"得低分（含多余废话）。
4. 系统对比各个回答的得分，强化"故障报修"这种简洁输出的生成策略，抑制带废话的输出。
5. 重复以上过程数百次，模型逐渐学会只输出纯净的意图标签。
 
#### 模型优化与传统模型微调（SFT）的区别
初次接触模型优化功能，容易将"模型优化"等同于"用一批数据去微调一个大模型"。实际上，两者在定位和运行机制上存在着本质的差异：
表1模型优化与SFT差异对比 
| 对比维度     | 传统大模型微调                                                                                     | 模型优化                                                                                                                                                                       |
|:---|:---|:---|
| 核心目的    | **行为克隆。**让模型模仿示范数据中的行为模式，包括对话风格、指令遵循方式、工具调用模式和输出格式等。                                      | **对齐优化与单点突破。**强化纠正模型的特定行为偏差，让模型学会探索最优解，例如严格遵循复杂输出格式、提高数学/逻辑推理的准确率等。                                                                                                         |
| 学习机制     | **离线模仿学习。**模型看着标准答案逐Token计算概率误差并模仿，不涉及与真实环境的在线交互。                                        | **在线试错。**模型被置于真实的Agent交互环境中（受Prompt、工具约束），自主生成完整动作序列，根据最终得分反推并修正自己的策略。                                                                                                   |
| 数据要求    | **构造成本高。**需要高质量的"输入 \> 输出"示范数据。如果涉及复杂推理任务，还需人工编写完整的中间推理步骤（思维链），构建成本显著上升。数据量通常数万条。          | **结果导向，标注门槛低。**仅需提供问题和最终标准答案，无需人工编写中间的推理步骤，模型会通过RL算法自行探索正确的思考路径。                                                                                                          |
| 算法特性与局限 | **易过拟合。**在充足且高质量的数据下能有效学习目标行为；局限在于数据覆盖不到的场景容易泛化不足，过度训练容易过拟合（退化为"只背答案"），且难以超越示范数据本身的质量上限。 | **精准打击，防遗忘。**GRPO算法通过直接对"最终结果"进行高强度奖惩，格式遵循能力远超SFT；同时，算法底层自带参考模型约束，能在提升单点能力的同时，最大程度防止模型丢失原本的通用认知能力。局限在于：奖励规则设计不当可能导致"奖励作弊"（模型学会钻规则漏洞骗取高分而非真正优化输出），且训练效果对数据质量和奖惩配置的合理性高度敏感。 |
   
接下来您可以：
- 快速体验： [示例：一键快速体验模型优化](https://support.huaweicloud.com/ops-agentarts/agentarts_14_0122.html)
- 从零开始： [示例：创建模型优化任务](https://support.huaweicloud.com/ops-agentarts/agentarts_14_0096.html)
- 准备数据： [准备优化数据集](https://support.huaweicloud.com/ops-agentarts/agentarts_14_0099.html)
 
