更新时间:2026-09-17 GMT+08:00
分享

什么是模型优化

什么是模型优化

模型优化是AgentArts平台提供的一种基于强化学习算法的Agent优化服务。

在传统的Agent开发流程中,开发者只能通过不断地修改系统提示词(Prompt)或外挂知识库来改善效果。当您发现通过调整提示词无法进一步提升准确率,或者受限于成本和响应速度无法使用超大尺寸模型时,模型优化就是您的下一站。

您只需提供少量Agent运行的数据,对智能体或工作流中的大模型进行端到端的训练,通过自动化的“试错”与“反馈”机制,让模型在特定业务场景下学会更精准的推理与表达。

其核心机制是:将一个小尺寸模型置入您的Agent运行环境中,让模型针对您提供的业务问题反复试错作答,系统根据您定义的奖励规则自动打分,高分巩固、低分纠正,逐步让模型学会在专属场景下输出更精准的结果。详见模型优化的原理。

模型优化聚焦于Agent中模型的能力优化,当前可以对单智能体中的模型、工作流大模型节点/意图识别节点中的模型进行定向调优。

为什么需要模型优化

为什么要在复杂的Agent开发之外,再引入一套模型层面的优化机制?这主要为了解决开发者在真实业务落地时面临的成本、速度与准确率的三大痛点:

平衡成本与推理速度,以小博大:

  • 现状痛点:通用大模型(如千亿参数级模型)虽然面面俱到、准确率高,但其推理成本极其昂贵,且响应延迟(首字时间)往往无法满足高并发的业务需求。
  • 模型优化价值:模型优化功能专注于小尺寸模型进行专项训练。通过强化学习,可以让小模型在特定领域“单点突出”,这些小尺寸模型在您限定的Agent专属场景中,其表现可以无限逼近甚至超越同尺寸的大模型。以极低的推理成本和极快的响应速度,实现“小而美”的应用效果。

突破提示词工程准确率上限:

  • 现状痛点:Prompt调优本质上是引导模型生成预期结果,难以修正模型深层的逻辑缺陷或幻觉行为。例如为了让模型输出完美的JSON格式,您在Prompt里写满了“绝对强制”、“必须遵守”、“请务必”,但通用模型依然会在某些时候“胡言乱语”或遗漏字段。
  • 模型优化价值:模型优化不依赖人工编写的死板指令,而是通过“奖励机制”引导模型自主探索最优解。它能从数据中学习隐含的推理模式,从根本上修正模型的输出习惯,解决Prompt无法触及的深层逻辑问题。

优化对象的配置要求

创建优化任务时,平台会对所选的智能体或工作流进行校验。请确保您的优化对象满足以下要求:

单智能体

  • 智能体可包含Prompt、知识库、插件、MCP等能力,平台支持在保留这些能力的前提下对其中的模型进行优化训练。
  • 智能体中不能包含工作流。
  • 智能体中配置的插件总数不能超过5个,MCP总数不能超过5个。

工作流

开始节点到被优化的大模型节点之间的路径上,不能存在需要用户交互的节点(如问答节点这种需要暂停等待用户输入的节点),否则训练过程无法自动运行。

如果工作流中存在循环结构(即节点之间形成回路),被优化的大模型节点不能位于循环路径中。

适用场景与边界

当您的Agent遇到以下瓶颈,且通过调整提示词、调整知识库、调整工具等手段依然无法有效解决,并确定是模型返回引入的问题后,可以使用模型优化功能:

推荐使用

严格格式输出与意图路由场景

  • 痛点:意图识别节点偶尔会输出多余的解释性废话,导致下游的 JSON 解析脚本崩溃。
  • 模型优化效果:强制模型按照特定格式输出,仅输出如 {"result": 10} 这种极度干净、100% 符合正则表达式的结构化数据。详见意图识别/分类场景。

复杂逻辑推导与数学计算场景

  • 痛点:Agent 在调用计算工具或进行逻辑推理时,过程容易跑偏,或者数值计算经常出现微小误差。

    倾向于自行推算而非调用计算工具,导致结果出现误差。

    不给出具体数值,而是返回表达式(如输出 (a+b)/2 而非计算结果)。

    在选择题场景中,不直接回答选项(如"A"),而是展开解释具体内容,影响下游解析。

  • 模型优化效果:通过“思维链格式奖励”和“数学准确性奖励”,逼迫模型在给出最终答案前必须进行深度的<think>思考,并确保最终输出的数值与标准答案绝对等价(如容忍1.0等于1的合理误差)。详见工具调用/数学计算场景。

精准工具调用场景

  • 痛点:面对数量多且参数复杂的工具,模型常常选错工具或填错必填参数。
  • 模型优化效果:让小模型在特定的工具集中反复试错练习,大幅提升其在当前专属业务环境下的工具调用准确率。详见插件/MCP工具调用场景。

不推荐使用

  • 简单问答任务: 如基础知识检索、常见问题解答,通过优化提示词或接入RAG即可解决,无需动用模型优化资源。
  • 提升通用能力: 模型优化旨在强化特定场景下的“单点能力”,并非用于扩充模型的通用知识或整体智能水平。
  • 训练数据极度匮乏: 如果缺乏足够数量、覆盖真实业务场景的高质量标注数据,模型优化不仅效果有限,还可能导致模型在特定样本上过拟合,泛化能力下降。
  • 问题边界模糊、输出标准难以量化的场景:如开放式创作、风格生成、情感陪伴类对话等,这类任务没有明确的“标准答案”,无法设计有效的奖励函数,模型优化无从发力,强行使用反而可能压缩模型的表达多样性。
  • 样本分布极度不均衡的场景:如果训练数据中某类意图或任务的样本占比严重失衡,模型优化可能导致模型对高频样本过度拟合,对低频但同样重要的边缘场景表现反而下降。

相关文档