更新时间:2026-09-17 GMT+08:00
快速验证模型效果
您可以使用AgentArts平台提供的“评估”功能发起一次正式的评估任务。
- 准备评测集。 评测数据格式与训练数据集格式一致,需包含input(用户问题)和reference_output(参考答案)字段。
- 在AgentArts平台单击左侧导航栏“观测与优化 > 评估”,进入“评测集”页签。
- 单击“创建评测集”,评测集的名称和描述可以自定义,配置列使用默认值。单击“确定”创建评测集。 图1 创建评测集
- 评测集创建后,会自动跳转至添加数据页面。选择“添加数据 > 手动添加”。 图2 添加数据
- 按照页面指引添加评测数据,完成后单击“提交版本”发布评测集版本。仅已发布版本的评测集可用于评估任务。
建议准备一份从未参与过训练的数据,以此检验模型是否真正学会了业务逻辑,而不是在死记硬背训练数据。
- 选择评估器。
根据模型优化的目标,在创建评估任务时,推荐使用正确性评估器进行打分。
正确性评估器可以评估模型的输出是否正确、准确、真实,并完整覆盖核心要点。通过将智能体的实际输出与预设的参考答案进行对比,评判回答的正确性和完整性。
平台提供多种预置评估器,涵盖正确性、幻觉现象、任务完成度、指令遵从度等维度。如需了解完整的评估器类型及适用场景,请参考预置评估器概览。对于模型优化场景,正确性评估器是推荐的首选。
- 创建评估任务。
- 在AgentArts平台单击左侧导航栏“观测与优化 > 评估”,并进入“评估任务”页签。
- 单击“创建评估任务”并选择“离线评估”(本示例为手动创建的评测数据集,因此选择“离线评估”)。
- 离线评估:基于已创建的评测集进行评估,适用于已有预设评测数据的场景。
- 在线评估:通过调用API产生智能体数据,对实时交互数据进行评测,适用于需要检验智能体在线服务质量的场景。
图4 离线评估
- 选择待评测的智能体、评测集、评估器(选择正确性评估器)后,单击“发起任务”执行评估。
评估任务发起后,可在评估任务列表中查看进度。评估完成后,单击任务名称可进入评估结果页面,查看每条评测数据的原始输入、智能体实际输出、预期输出、评估器得分及评分理由。在“评估报告”页签中,可查看整体评估指标,包括平均分、最高分、最低分和总分,以及评估器指标。
