更新时间:2026-09-14 GMT+08:00
分享

模型优化的原理

用好智能体的优化功能,不需要熟练掌握复杂的算法原理,但了解优化背后的运行逻辑,能极大地帮助您设计出高质量的训练任务。

强化学习简介

模型优化的底层技术是强化学习(Reinforcement Learning, RL)。强化学习本质上是一种“通过在环境中试错来学习”的机制。

可借助一个典型的工程案例进行理解--教导一辆汽车(车载计算机智能体)如何自动泊车:

  • 智能体:车载计算机。
  • 环境:停车场、车辆动态特性、雷达和摄像头的传感器读数。
  • 动作:打方向盘、踩刹车、加速等。
  • 奖励:如果车辆准确停入车位中,系统给出一个高分奖励;如果压线或者撞到障碍物,给出一个负分惩罚。

在训练初期,车载计算机会像新手司机一样,尝试各种随机的操作(有时甚至撞上周边物体)。但通过成千上万次的“尝试-反馈-修正”,它会逐渐掌握规律:当看到边距变窄(观测值)时,打方向盘(动作)能获得更好的停车效果(奖励)。最终,学会了精准泊车。

模型优化的本质与此完全一致,只不过的“车”变成了大语言模型,“停车场”变成了您的Agent业务场景。

  • 智能体:被训练的模型。
  • 环境:您在AgentArts中创建好的Agent运行环境(包括预设Prompt、知识库、插件、MCP等。
  • 动作:Agent生成的回复文本、推理过程、工具选择、工具参数填写,以及在单次任务中发起的多步工具调用过程等。
  • 奖励:系统通过对比模型输出与您的标准答案,利用“奖励规则(正则/数值)”或“生成式裁判打分”给出分数。

通过模型优化功能不断做题并获取分数反馈,原本“不太聪明”的小尺寸模型就能逐渐掌握在您这个专属业务场景下的作答技巧。

模型优化运行机制

整个模型优化过程分为三个紧密相连的阶段:

阶段一:准备任务配置信息

准备需要优化的Agent以及训练数据,选择基础模型,设置奖励规则。

训练启动后,数据集中的问题将送入Agent环境,数据集的使用方式如下:

  • 问题字段(input)将送入Agent环境,触发模型作答(此时Agent中的模型已被替换为被训模型)。
  • 答案字段(reference_output)将作为裁判中心的评分基准:
  • 使用规则裁判时,答案需与预期结果精确匹配。
  • 使用大模型裁判时,系统将对回答的语义质量进行综合评分。

阶段二:在线强化学习

这是整个模型优化的核心。系统不会让模型死记硬背,模型通过在真实环境中反复探索与反馈来调整行为,而非直接拟合固定答案,因此具备更强的泛化能力。具体过程如下:

  • 模型置换:系统会将被训模型直接置换到您的Agent中。
  • 循环训练:模型针对问题生成回答,裁判中心依据规则或大模型裁判进行打分,系统依据得分的高低,通过强化学习算法(GRPO)反向更新模型内部参数。模型进入一个“尝试作答 > 自动打分 > 自我进化”的循环,得分高就巩固记忆,得分低就纠正行为。
  • 群组对比:GRPO算法针对同一个问题,让模型同时生成多个不同的候选回答并分别打分,通过组内对比强化高分回答的生成策略、抑制低分回答,让模型逐步学会输出更高质量的回答。

如果智能体中配置了插件、MCP这种工具能力,训练时这些能力会随Agent环境一同保留。模型会在一次任务中按真实链路完成多步工具交互,系统再结合最终结果或运行轨迹进行打分与更新。

阶段三:评估与部署

在不断的循环进化中,系统会阶段性地为您保存“模型快照”。您只需结合训练监控看板上的得分图表,挑选出综合得分最高且表现最稳定的一个快照,通过部署替换Agent中的原模型,即可完成能力升级。

运行示例:以客服意图分类为例

假设您有一个电信客服意图分类工作流,训练数据中有一条:问题=“宽带用着怎么断了”,标准答案=“故障报修”。

  1. 系统将小尺寸模型替换到工作流的意图识别节点中。
  2. 模型收到问题“宽带断了”,同时生成多个候选回答(GRPO群组对比)。
  3. 裁判中心用精准匹配规则分别打分:回答“故障报修”得高分,回答“根据您的描述,应该是故障报修”得低分(含多余废话)。
  4. 系统对比各个回答的得分,强化“故障报修”这种简洁输出的生成策略,抑制带废话的输出。
  5. 重复以上过程数百次,模型逐渐学会只输出纯净的意图标签。

模型优化与传统模型微调(SFT)的区别

初次接触模型优化功能,容易将“模型优化”等同于“用一批数据去微调一个大模型”。实际上,两者在定位和运行机制上存在着本质的差异:

表1 模型优化与SFT差异对比

对比维度

传统大模型微调

模型优化

核心目的

行为克隆。让模型模仿示范数据中的行为模式,包括对话风格、指令遵循方式、工具调用模式和输出格式等。

对齐优化与单点突破。强化纠正模型的特定行为偏差,让模型学会探索最优解,例如严格遵循复杂输出格式、提高数学/逻辑推理的准确率等。

学习机制

离线模仿学习。模型看着标准答案逐Token计算概率误差并模仿,不涉及与真实环境的在线交互。

在线试错。模型被置于真实的Agent交互环境中(受Prompt、工具约束),自主生成完整动作序列,根据最终得分反推并修正自己的策略。

数据要求

构造成本高。需要高质量的“输入 > 输出”示范数据。如果涉及复杂推理任务,还需人工编写完整的中间推理步骤(思维链),构建成本显著上升。数据量通常数万条。

结果导向,标注门槛低。仅需提供问题和最终标准答案,无需人工编写中间的推理步骤,模型会通过RL算法自行探索正确的思考路径。

算法特性与局限

易过拟合。在充足且高质量的数据下能有效学习目标行为;局限在于数据覆盖不到的场景容易泛化不足,过度训练容易过拟合(退化为“只背答案”),且难以超越示范数据本身的质量上限。

精准打击,防遗忘。GRPO算法通过直接对“最终结果”进行高强度奖惩,格式遵循能力远超SFT;同时,算法底层自带参考模型约束,能在提升单点能力的同时,最大程度防止模型丢失原本的通用认知能力。局限在于:奖励规则设计不当可能导致“奖励作弊”(模型学会钻规则漏洞骗取高分而非真正优化输出),且训练效果对数据质量和奖惩配置的合理性高度敏感。

接下来您可以:

相关文档