创建离线评估任务
评估任务旨在对智能体或工作流的回复质量进行多维度综合评估。该过程通过评测集、评估对象与评估器的协同工作来实现:
- 评测集:提供输入对话数据,驱动智能体或工作流生成实际回复。
- 评估器:依据设定的评估规则,将实际回复与评测集中的预期输出进行比对。
- 评估对象:被评估的目标,可以是一个智能体,也可以是评测集中的数据本身。
最终生成的评分结果将量化反映智能体在准确性、安全性、流畅性等方面的综合表现。
如果需评估特定智能体版本的质量,请选择创建评估任务(智能体评估);如果需基于线上真实回流数据进行复盘,请选择创建评估任务(评测集评估)。
支持评估的智能体
AgentArts离线评估支持以下智能体来源:
| 智能体来源 | 说明 |
|---|---|
| AgentArts平台内创建 | 在AgentArts平台中直接创建的智能体。 |
| 本地代码开发并托管 | 本地代码开发的智能体,在AgentArts运行时托管的智能体。 |
| 第三方智能体 | 非AgentArts平台开发的第三方智能体,通过API或SDK接入到AgentArts中。 |
费用说明
- 智能体交互费用:选择智能体评估时,产生与智能体交互的费用。
- 评估器调用费用:使用评估器进行判定时产生的费用。
- 智能分析费用:开启智能分析功能生成评估报告时产生的费用。
具体计费请参考计费说明。
前提条件
约束与限制
| 限制 | 说明 |
|---|---|
| 评估任务创建上限 | 默认最多支持创建1000个评估任务(包含10次免费任务额度),分为离线任务和在线任务两种类型。当任务数量达到上限时,可删除不再使用的任务释放配额,或提交工单申请提升配额。删除任务后,已消耗的免费额度不可恢复。 |
| 评估器添加上限 | 单个评估任务中最多支持添加5个评估器。 |
| 评估器使用限制 | 评估器的可用性与评估任务类型相关,需遵循特定的适配规则。关于评估器的详细支持情况,请参见评估器支持任务详情。 当离线评估的对象为智能体运行时或第三方托管智能体时,支持选择轨迹质量、轨迹-工具参数填充正确性两类评估器。 |
开通授权
评估任务需读取存储在APM中的调用链数据,并将执行结果上报至AOM。请确保已开通APM和AOM权限,否则评估功能将不可用。
APM和AOM权限仅需开通一次,后续无需重复操作。
- 登录AgentArts智能体平台。
- 在左侧导航栏中选择“观测与优化 > 评估”,在“评估任务”页签中,单击右上角的“创建评估任务”。
- 在弹出的对话框中,单击“开通授权”。
开通授权后,才可以创建评估任务。如果遇到“权限不足”等错误,请参见常见问题。
图1 开通授权
创建评估任务(智能体评估)
- 登录AgentArts智能体平台。
- 在左侧导航栏中选择“观测与优化 > 评估”,在“评估任务”页签中,单击右上角的“创建评估任务”。
- 选择“任务类型”为“离线评估”,并参照表3完成参数配置。
表3 评估任务参数说明 参数
说明
名称
评估任务的名称。
- 命名要求:支持中文、英文、数字、下划线(_)、中划线(-)和空格的组合,不允许以空格开头或结尾,且不允许使用其他特殊字符。
- 长度限制:2~50个字符。
描述(可选)
评估任务的描述。
长度限制:0~200个字符。
执行类型
设置评估任务的执行时间。
- 立即执行:发起任务后,任务将立即开始执行。
- 稍后执行:可以自定义评估任务的具体执行时间。
智能分析
是否生成智能分析报告。
最大并发数
支持并发执行数据的条目,默认为5条,最大可设置为20条。
标签
由“标签键”和“标签值”组成,用于标识和分类云资源。
您可以在TMS中创建预定义标签,用于使用同一标签标识多种云资源,创建后可在标签输入框下拉选择同一标签,具体操作请参考创建预定义标签,创建后单击
刷新。单击“添加标签”,选择在TMS中创建的预定义标签,或自定义输入标签键和标签值。
可添加一个或多个标签,最多添加20个标签。
- 将评估对象设置为“智能体”。
- 单击“选择评估对象”,选择需评估的智能体及其版本(必须为已发布版本)。选择智能体运行时或第三方托管的智能体进行评估时,需在目标智能体卡片上单击“去配置”,完成智能体运行信息配置,确保智能体在评估期间可正常运行并返回结果。
- 智能体运行时调用配置:
- 在“智能体运行时”页签中,在目标智能体卡片上单击“去配置”并参考表4完成调用配置。
表4 调用配置 参数
说明
API导入
如已有OpenAPI定义,可单击“API 导入”快速导入请求参数(当前仅支持导入请求体参数),免去手动逐条填写。
智能体访问地址
是智能体对外提供调用的入口地址,该地址由系统在运行时智能体部署后自动获取,无需手动填写。
请求参数
请求头(Header)
HTTP请求消息的组成部分之一,请求头负责向服务器传递认证鉴权、内容类型等请求元信息,随请求自动发送。配置时,请参照智能体接口的实际参数要求填写,单击“添加参数”可新增请求头参数,上限10个。
进行轨迹评估时,需在请求参数中添加{{SessionID}}(会话ID)变量,用于关联智能体调用的请求与响应轨迹,确保轨迹评估时可完整还原会话上下文。
图2 配置示例
请求体(Body)
承载请求的核心业务数据,如用户输入、会话上下文等。
如果请求体(Body)中已添加参数,选择评测集后需将评测集输入数据与请求体(Body)中的参数进行映射,确保智能体能够正确读取评测集中的输入数据。
图3 配置示例
查询参数(Query)
用于向服务器传递额外的参数信息。这些参数通常以键值对的形式出现,并且附在URL的路径后面,通过?分隔。配置时,请参照智能体接口的实际参数要求填写,单击“添加参数”可新增查询参数,上限10个。
响应参数
流式输出
是指智能体在生成内容时,将内容分块逐步返回,而不是等待全部完成后一次性返回。
选择流式输出后,智能体会分多次逐步返回内容,每次返回的数据称为一个“事件”。不同事件可能承载不同类型的信息(如文本内容、工具调用结果、状态更新等),因此需配置“事件类型”,用于告诉系统如何识别每条事件的类型,以便正确提取需要评估的内容。
示例: 假设智能体流式返回的每条事件结构为{"type": "message", "content": "你好"},其中type字段表示事件类型,message表示这是一条文本消息。则在第一个输入框填写type,第二个输入框填写message,即$.type = message。
图4 配置示例
非流式输出
是指智能体在完成全部计算和处理后,将完整结果一次性返回给调用方。
智能体输出
用于定义从智能体返回结果中提取哪个字段作为评估内容。
示例:假设智能体返回的完整响应为{"result": {"answer": "北京是中国的首都"}},需要评估的内容是answer字段的值。则在输出字段路径中填写result.answer。系统会自动从响应中提取“北京是中国的首都”作为智能体输出,用于后续评测打分。
图5 配置示例
响应超时时间
设置等待智能体返回的最大时间,默认60秒,最大支持600秒。对于执行耗时较长的复杂推理任务,建议适当增大该值以避免因超时导致评测失败。
- 配置完成后,单击“下一步”,进入调测页面,对已配置的智能体进行连通性验证。
- 调测成功后,单击“确定”,该智能体即可作为评估对象选择使用。
- 在“智能体运行时”页签中,在目标智能体卡片上单击“去配置”并参考表4完成调用配置。
- 第三方托管智能体调用配置:
- 在智能体运行时页签中,单击目标智能体卡片上单击“去配置”并参考表5完成调用配置。
表5 调用配置 参数
说明
API导入
如已有OpenAPI定义,可单击“API导入”快速导入请求参数(请求头、请求体、查询参数),免去手动逐条填写。
智能体访问地址
是智能体对外提供调用的入口地址。
鉴权方式
用于验证智能体接口的调用身份,确保请求合法性。支持以下两种方式:
- 无需鉴权:适用于公开访问的智能体接口,无需配置密钥,系统直接发起请求调用。
- API Key:适用于需身份核验的智能体接口。选择后需配置密钥位置及API Key,将其附加到请求中发送。密钥位置选择Header时,API Key将添加至请求头(Header)中;选择Query时,API Key将添加至查询参数(Query)中。
请求参数
请求头(Header)
HTTP请求消息的组成部分之一,请求头负责向服务器传递认证鉴权、内容类型等请求元信息,随请求自动发送。配置时,请参照智能体接口的实际参数要求填写,单击“添加参数”可新增请求头参数,上限10个。
图6 配置示例
请求体(Body)
承载请求的核心业务数据,如用户输入、会话上下文等。
图7 配置示例
查询参数(Query)
用于向服务器传递额外的参数信息。这些参数通常以键值对的形式出现,并且附在URL的路径后面,通过?分隔。配置时,请参照智能体接口的实际参数要求填写,单击“添加参数”可新增查询参数,上限10个。
响应参数
流式输出
是指智能体在生成内容时,将内容分块逐步返回,而不是等待全部完成后一次性返回。
选择流式输出后,智能体会分多次逐步返回内容,每次返回的数据称为一个“事件”。不同事件可能承载不同类型的信息(如文本内容、工具调用结果、状态更新等),因此需配置“事件类型”,用于告诉系统如何识别每条事件的类型,以便正确提取需要评估的内容。
示例: 假设智能体流式返回的每条事件结构为{"type": "message", "content": "你好"},其中type字段表示事件类型,message表示这是一条文本消息。则在第一个输入框填写type,第二个输入框填写message,即$.type = message。
图8 配置示例
非流式输出
是指智能体在完成全部计算和处理后,将完整结果一次性返回给调用方。
智能体输出
用于定义从智能体返回结果中提取哪个字段作为评估内容。
示例:假设智能体返回的完整响应为{"result": {"answer": "北京是中国的首都"}},需要评估的内容是answer字段的值。则在输出字段路径中填写result.answer。系统会自动从响应中提取“北京是中国的首都”作为智能体输出,用于后续评测打分。
图9 配置示例
响应超时时间
设置等待智能体返回的最大时间,默认60秒,最大支持600秒。对于执行耗时较长的复杂推理任务,建议适当增大该值以避免因超时导致评测失败。
- 配置完成后,单击"下一步",进入调测页面,对已配置的智能体进行连通性验证。 图10 调测数据
图11 调测结果
- 调测成功后,单击“确定”,该智能体即可作为评估对象选择使用。
- 在智能体运行时页签中,单击目标智能体卡片上单击“去配置”并参考表5完成调用配置。
- 智能体运行时调用配置:
- 选择一个已发布的评测集。评测集选择完成后,单击其下方“字段映射”区域的下拉箭头,将评测集输入数据字段与评估对象的输入(input)字段进行映射,确保智能体能够正确读取评测集中的输入数据。
- 选择评估器。
- 单击“选择评估器”,在弹出的页面中选择使用自定义或平台精选评估器。
- 评估器选择完成后,单击评估器左侧的下拉箭头,将评测集中的字段以及评估对象的实际输出(agent_output)与评估器的字段进行映射,确保评估器能够准确获取数据并执行评估任务。
字段映射错误将导致评估失败或结果异常,请仔细检查映射关系。
例如:确保评测集的input映射至评估器的input,智能体实际输出映射至评估器的actual_output。
图12 评估器字段映射
- 检查评估任务的配置信息,确认无误后,单击“发起任务”。任务创建后,系统将自动跳转至“评估任务详情”页面。在该页面中:
- 查看状态:任务创建完成后状态显示为“运行中”,待评估完成后变更为“成功”。
- 查看结果:任务执行成功后,您可以查看评估结果,具体操作请参见查看评估结果。
评估任务创建完成后,在“评估任务”列表页面查看创建的评估任务。支持通过属性筛选或关键字搜索来查找评估任务。
创建评估任务(评测集评估)
当以评测集作为评估对象时,评估器的字段必须与评测集中对应的字段相匹配,否则可能导致评估任务执行失败或结果异常。
- 登录AgentArts智能体平台。
- 在左侧导航栏中选择“观测与优化 > 评估”,在“评估任务”页签中,单击右上角的“创建评估任务”。
- 选择“任务类型”为“离线评估”,并参照表3完成参数配置。
- 将评估对象设置为“评测集”。
当您希望基于已上线运行的Agent产生的真实调用链数据评估时,可以将“评测集”作为评估对象。该方式支持将线上实际输入与输出回流至评测集,实现对智能体表现的复盘与量化分析。
获取调用链数据:
- 进入“调用链分析”页面,在列表中勾选需要添加的调用链数据。
- 单击右侧的“添加至评测集”,即可一键将数据添加进评测集中。具体方法请参考回流Trace数据至评测集。
- 选择需要评估的评测集。
- 选择评估器。
- 单击“选择评估器”,选择使用自定义或平台精选评估器。
如果您是初次使用或无特殊业务逻辑需求,推荐优先使用“平台精选”评估器。
- 选择完成后,单击评估器左侧的下拉箭头,进行字段映射,确保评估器准确获取数据并执行评估。 图13 评估器字段映射
示例场景说明
- 场景一:评估输出结果的正确性
- 目标:判断智能体的输出是否与标准答案一致。
- 推荐评估器:平台精选评估器——“正确性”
- 评测集字段要求:必须包含以下三列:
- input:原始输入数据
- output:实际输出数据
- reference_output:标准参考答案
图14 评测集数据示例
图15 评估器字段映射示例
- 场景二:评估输出是否具有明显的“AI味”(AI感过重)
- 目标:检测数据内容是否过于机械、模板化,缺乏自然表达。
- 推荐评估器:平台精选评估器——“AI味检查”
- 评测集字段要求:
- input:原始输入数据
- output:实际输出数据
图16 评测集数据示例
图17 评估器字段映射示例
- 场景一:评估输出结果的正确性
- 单击“选择评估器”,选择使用自定义或平台精选评估器。
- 检查评估任务的配置信息,确认无误后,单击“发起任务”。任务创建后,系统将自动跳转至“评估任务详情”页面。在该页面中:
- 查看状态:任务创建完成后状态显示为“运行中”,待评估完成后变更为“成功”。
- 查看结果:任务执行成功后,您可以查看评估结果,具体操作请参见查看评估结果。
评估任务创建完成后,在“评估任务”列表页面查看创建的评估任务。支持通过属性筛选或关键字搜索来查找评估任务。

