更新时间:2026-09-20 GMT+08:00
分享

示例:一键快速体验模型优化

模型优化通过强化学习对Agent中的模型进行定向优化,让小尺寸模型在特定业务场景下表现可媲美大模型。详见什么是模型优化、模型优化的原理。

为快速体验优化功能,平台提供了“一键体验”入口:平台预置了完整的业务场景(工作流 + 数据集 + 奖惩配置),您只需确认配置并填写评测集参数,即可快速跑通一次完整的优化流程。本示例以银行转账系统意图识别场景为例,带您从优化原理到实操落地,快速理解并掌握模型优化的核心逻辑与使用方法。

场景说明

本示例使用银行转账系统意图识别场景。工作流接收用户的自然语言诉求,通过意图识别节点将问题路由到对应的业务处理分支。

工作流结构

示例中使用工作流Agent构建银行转账系统意图识别场景,工作流由开始节点、意图识别节点、结束节点构成。优化任务对意图识别节点中的模型进行优化,通过优化,训练并替换为小尺寸规格的模型。

其中,意图识别节点中预设的分类标签有:

1. "pending_transfer": "转账状态处理中"
2. "transfer_not_received_by_recipient": "对方反馈没收到"
……

意图识别节点根据用户输入输出对应的分类标签文字(如“转账状态处理中”),下游路由根据标签文字分发到对应的业务处理分支。

场景痛点:

银行转账场景中,意图识别节点需要精准输出数字标签(如“1”),供下游路由使用。当前使用通用的大模型承担此分类任务,但会面临两个问题:

  • 成本与时延:意图识别是每次请求必经的环节,调用频次极高。通用大模型推理成本昂贵、首字延迟高。小尺寸模型成本低、响应快,但在意图分类的准确率和输出规范性上可能会存在不足,因此需要专门进行优化训练,提升效果。
  • 输出规范可能不足:即使使用大模型,也可能会出现“输出多余解释性内容(如“根据您的描述,分类为7”,导致下游JSON解析失败)、多意图混合时无法正确识别主意图、对模糊表述误判意图”问题。通过模型优化,可以让小尺寸模型在意图分类专属场景中精准输出纯净的分类标签,效果可媲美大模型。
图1 工作流示例

步骤一:一键体验模型优化任务

  1. 进入一键体验。

    1. 登录AgentArts智能体平台。
    2. 在左侧导航栏选择“观测与优化 > 优化”,在“模型优化”页面,单击“一键体验”进入一键创建优化任务中。

  2. 确认优化对象配置。

    优化对象和模型均为预置配置,无需修改。

    表1 预置优化对象说明

    配置项

    预置值

    说明

    优化对象

    银行转账助手

    预置的银行转账意图识别工作流

    模型

    Qwen3-NLP-8B-4K

    80亿参数的小尺寸模型,推理速度快

  3. 确认优化方法与奖罚机制。

    页面已预置优化方法为强化学习(GRPO算法),奖惩机制采用规则奖励:

    • 正确性奖励:通过正则表达式从模型输出中提取result字段的数字值,与数据集中reference_output进行字面比对。匹配成功获得正向奖励,匹配失败获得负向惩罚。该规则确保模型输出的数字标签与标准答案完全一致,同时容许模型偶尔输出“分类xxx”这种带中文前缀的格式。

  4. 配置产物路径与委托。

    训练数据集由平台预置,无需修改。

    用户需要配置优化产物路径以及委托:

    • 优化产物路径: 模型优化任务执行过程中会持续产生中间成果,系统需要存储空间存放这些资产。请选择一个OBS路径作为产物存储位置。
    • 委托:授权训练服务访问您云资源的权限凭证,需要选择一个已创建的IAM信任委托。单击“前往创建”进行创建,配置如下:
      • 委托名称:由用户自定义
      • 信任主体类型:选择“云服务”
      • 云服务:填写“智果Agent优化”
      • 其他参数:使用默认配置

      委托创建完成后,按照页面提示进行授权,授权项选择“AgentArtsRLModelTuningTaskAgencyPolicy”。

    委托创建完成后,返回创建优化任务页面,选择已经创建好的委托。

  5. 单击“立即体验”创建模型优化任务。

    单击“立即体验”后,页面将跳转至“模型优化”页面,列表中新增一条优化任务,状态变为“训练中”时可单击任务名称进入详情页查看训练曲线。
    图2 体验优化任务

步骤二:监控训练与挑选模型

训练启动后,在“模型优化”页面单击优化任务名称,进入详情页可参考以下方法监控训练过程并挑选最优模型:

观察训练曲线

单击任务名称进入详情页,关注三条核心曲线:

曲线

含义

理想趋势

异常趋势

奖励值曲线

模型输出符合奖罚机制的平均得分。

平滑上升并趋于稳定。

长期停滞在低位( 排查奖罚规则有效性)、剧烈震荡不收敛( 调整学习率)。

响应长度曲线

模型生成回答的平均字符长度。

波动平稳,不出现异常飙升。

指数级飙升:模型发生“奖励作弊”,输出大量冗余文本骗取高分( 排查奖罚规则有效性)。

消耗时间曲线

训练每个Step的总耗时,用于辅助观察推理开销变化。

整体平稳,或随训练小幅波动。

持续明显升高,且常伴随响应长度增长,需警惕输出冗长或推理异常复杂。

挑选最优模型

模型训练过程中,会留存多个训练阶段模型版本,可以按照以下法则挑选:

  • 优先关注Top 3奖励值的快照:系统自动标记奖励得分最高的3个版本。
  • 剔除响应长度异常飙升的快照:如果某个快照奖励值极高但响应长度显著增长,说明模型发生了“奖励作弊”。
  • 在收敛平台区间内挑选:优先在奖励值持续多个Step保持稳定的模型版本。
  • 通过实际验证排除过拟合模型:训练得分高不代表真实业务表现好,最终需部署到实际Agent中验证,详见后续步骤三:部署模型与验证优化效果操作。

训练完成后,任务状态将从“训练中”变为“成功”,在模型快照列表中可以查看所有保存的模型版本。

步骤三:部署模型与验证优化效果

部署模型并发布Agent:

  1. 在“模型优化”页面单击优化任务名称,在模型快照列表中,选择您看中的快照。
  2. 单击操作列的“部署并接入”,将该模型替换到Agent中。

    图3 查看模型产物

  3. 在“模型部署与接入”页面分别配置模型部署资源、配置接入信息。

    • 部署资源配置:
      注意:模型部署按资源规格和运行时长计费。建议首次验证时选择最小规格的公共资源池和1个实例,确认效果后再按需扩容。
      表2 部署资源配置参数说明

      参数

      说明

      资源池类型

      • 公共资源池:由AgentArts平台提供的公共部署资源,开箱即用,适合首次验证
      • 专属资源池:由用户自己在ModelArts平台创建的专属资源池,独享部署资源,适合生产环境长期使用。

      在ModelArts平台创建专属资源池时,需要选择“模型部署”场景的资源池,并选择“NPU+ARM”架构的节点规格。详细指导请参考创建专属资源池。

      图4 在ModelArts中购买专属资源池
      图5 在ModelArts中购买专属资源池

      实例规格

      部署模型时从资源池中申请的计算资源,决定了模型能否正常加载、推理速度、单实例承载的并发量。首次验证建议选择最小规格,确认模型可正常加载后,再根据业务并发和响应速度需求按需提升规格。

      实例数

      同时启动的推理服务副本数量,实例数越多服务能承载的总并发越高。选择专属资源池方式部署时,实例数不可超过专属池的实例数。首次验证建议设置为1。

      认证凭据

      认证凭据用于获取挂载存储时所需的访问密钥(AK/SK)信息,确保模型部署实例能够正常访问和读取对象存储中的模型文件等资源。单击“前往创建”进行配置:

      • 凭据类型:通用凭据
      • 凭据名称:可自定义
      • 企业项目:默认default
      • 设置凭据值:选择“凭据键/值”方式,新增两个键值对,“键”分别填写“accessKeyId”,“secretAccessKey”,值请登录“我的凭证 > 访问密钥”页面获取,获取到的AK和SK就是accessKeyId和secretAccessKey。
        图6 获取AK、SK
        图7 AK、SK示例
      • KMS加密:使用默认配置
      • 高级配置:使用默认配置

      配置完成后,单击“下一步”保持默认配置,直至凭据创建完成。

      图8 创建凭据
    • 接入配置:
      表3 接入配置参数说明

      参数

      说明

      模型服务名称

      为本次部署的推理服务实例起的名字。

      模型名称

      要部署的具体基础模型名称(如qianwen3),指定推理服务加载哪个模型进行推理。可在模型快照列表中查看对应的基础模型名称。

      委托

      授权模型部署服务访问您云资源的权限凭证,需要选择一个已创建的IAM信任委托,单击“创建委托”进行创建,配置如下:

      • 委托名称:由用户自定义
      • 信任主体类型:选择“云服务”
      • 云服务:填写“智果Agent自优化模型部署”
      • 其他参数:使用默认配置

      委托创建完成后,按照页面提示进行授权,授权项选择“AgentArtsRLModelDeploymentAgencyPolicy”。

    图9 模型部署与接入

  4. 模型部署任务启动后,可以在模型产物列表中查看部署进展。

    部署成功显示“运行中”后,单击操作列“应用至智能体”可在对应的智能体中看到,模型已经被替换。智能体只有经过更新版本重新部署,模型才会被正式应用。

    应用模型并更新版本后,智能体中的原模型将被替换。如果智能体已在线上运行,替换可能影响正在进行的业务。建议先在测试环境中验证模型效果,确认无误后再应用到生产环境。如需回滚,可在智能体编辑页面将模型切换回原版本。

    图10 应用至智能体

评估优化效果:

新的模型替换到工作流中后,可以在工作流编辑页面,通过“试运行”进行测试。端到端的测试可以使用AgentArts提供的“评估”功能进行,详细方法可参考快速验证模型效果。

如果模型部署后效果不如预期,请参考如何挑选最优模型和常见问题。

图11 工作流试运行

相关文档