更新时间:2026-09-17 GMT+08:00
分享

快速验证模型效果

您可以使用AgentArts平台提供的“评估”功能发起一次正式的评估任务。

  1. 准备评测集。

    评测数据格式与训练数据集格式一致,需包含input(用户问题)和reference_output(参考答案)字段。
    1. 在AgentArts平台单击左侧导航栏“观测与优化 > 评估”,进入“评测集”页签。
    2. 单击“创建评测集”,评测集的名称和描述可以自定义,配置列使用默认值。单击“确定”创建评测集。
      图1 创建评测集
    3. 评测集创建后,会自动跳转至添加数据页面。选择“添加数据 > 手动添加”。
      图2 添加数据
    4. 按照页面指引添加评测数据,完成后单击“提交版本”发布评测集版本。仅已发布版本的评测集可用于评估任务。
      提交版本后,评测集状态应变为“已提交”,此时才可用于创建评估任务。
      图3 提交版本

      建议准备一份从未参与过训练的数据,以此检验模型是否真正学会了业务逻辑,而不是在死记硬背训练数据。

  2. 选择评估器。

    根据模型优化的目标,在创建评估任务时,推荐使用正确性评估器进行打分。

    正确性评估器可以评估模型的输出是否正确、准确、真实,并完整覆盖核心要点。通过将智能体的实际输出与预设的参考答案进行对比,评判回答的正确性和完整性。

    平台提供多种预置评估器,涵盖正确性、幻觉现象、任务完成度、指令遵从度等维度。如需了解完整的评估器类型及适用场景,请参考预置评估器概览。对于模型优化场景,正确性评估器是推荐的首选。

  3. 创建评估任务。

    1. 在AgentArts平台单击左侧导航栏“观测与优化 > 评估”,并进入“评估任务”页签。
    2. 单击“创建评估任务”并选择“离线评估”(本示例为手动创建的评测数据集,因此选择“离线评估”)。
      • 离线评估:基于已创建的评测集进行评估,适用于已有预设评测数据的场景。
      • 在线评估:通过调用API产生智能体数据,对实时交互数据进行评测,适用于需要检验智能体在线服务质量的场景。
      图4 离线评估
    3. 选择待评测的智能体、评测集、评估器(选择正确性评估器)后,单击“发起任务”执行评估。

      评估任务发起后,可在评估任务列表中查看进度。评估完成后,单击任务名称可进入评估结果页面,查看每条评测数据的原始输入、智能体实际输出、预期输出、评估器得分及评分理由。在“评估报告”页签中,可查看整体评估指标,包括平均分、最高分、最低分和总分,以及评估器指标。

相关文档