# 快速验证模型效果
您可以使用AgentArts平台提供的"评估"功能发起一次正式的评估任务。
1. 准备评测集。 
   评测数据格式与训练数据集格式一致，需包含input（用户问题）和reference_output（参考答案）字段。
   1. 在AgentArts平台单击左侧导航栏"观测与优化 \> 评估"，进入"评测集"页签。
   
   2. 单击"创建评测集"，评测集的名称和描述可以自定义，配置列使用默认值。单击"确定"创建评测集。
      图1创建评测集   
      ![](https://support.huaweicloud.com/ops-agentarts/zh-cn_image_0000002733341270.png "点击放大") 
   
   3. 评测集创建后，会自动跳转至添加数据页面。选择"添加数据 \> 手动添加"。
      图2添加数据   
      ![](https://support.huaweicloud.com/ops-agentarts/zh-cn_image_0000002762901807.png "点击放大") 
   
   4. 按照页面指引添加评测数据，完成后单击"提交版本"发布评测集版本。仅已发布版本的评测集可用于评估任务。
      提交版本后，评测集状态应变为"已提交"，此时才可用于创建评估任务。
      图3提交版本   
      ![](https://support.huaweicloud.com/ops-agentarts/zh-cn_image_0000002733344170.png "点击放大")
      ![](https://support.huaweicloud.com/ops-agentarts/public_sys-resources/note_3.0-zh-cn.png)
      建议准备一份从未参与过训练的数据，以此检验模型是否真正学会了业务逻辑，而不是在死记硬背训练数据。
      
    
   
   
2. 选择评估器。 
   根据模型优化的目标，在创建评估任务时，推荐使用**正确性评估器**进行打分。
   正确性评估器可以评估模型的输出是否正确、准确、真实，并完整覆盖核心要点。通过将智能体的实际输出与预设的参考答案进行对比，评判回答的正确性和完整性。
   平台提供多种预置评估器，涵盖正确性、幻觉现象、任务完成度、指令遵从度等维度。如需了解完整的评估器类型及适用场景，请参考[预置评估器概览](https://support.huaweicloud.com/ops-agentarts/agentarts_14_0040.html)。对于模型优化场景，正确性评估器是推荐的首选。
   
   
3. 创建评估任务。 
   1. 在AgentArts平台单击左侧导航栏"观测与优化 \> 评估"，并进入"评估任务"页签。
   
   2. 单击"创建评估任务"并选择"离线评估"（**本示例为手动创建的评测数据集，因此选择"离线评估"** ）。
      - 离线评估：基于已创建的评测集进行评估，适用于已有预设评测数据的场景。
      
      - 在线评估：通过调用API产生智能体数据，对实时交互数据进行评测，适用于需要检验智能体在线服务质量的场景。
      
      
      图4离线评估   
      ![](https://support.huaweicloud.com/ops-agentarts/zh-cn_image_0000002733345290.png "点击放大") 
   
   3. 选择待评测的智能体、评测集、评估器（选择正确性评估器）后，单击"发起任务"执行评估。 评估任务发起后，可在评估任务列表中查看进度。评估完成后，单击任务名称可进入评估结果页面，查看每条评测数据的原始输入、智能体实际输出、预期输出、评估器得分及评分理由。在"评估报告"页签中，可查看整体评估指标，包括平均分、最高分、最低分和总分，以及评估器指标。
      
   
   
   
   
 
