更新时间:2026-09-16 GMT+08:00
分享

创建离线评估任务

评估任务旨在对智能体或工作流的回复质量进行多维度综合评估。该过程通过评测集、评估对象与评估器的协同工作来实现:

  • 评测集:提供输入对话数据,驱动智能体或工作流生成实际回复。
  • 评估器:依据设定的评估规则,将实际回复与评测集中的预期输出进行比对。
  • 评估对象:被评估的目标,可以是一个智能体,也可以是评测集中的数据本身。

最终生成的评分结果将量化反映智能体在准确性、安全性、流畅性等方面的综合表现。

如果需评估特定智能体版本的质量,请选择创建评估任务(智能体评估);如果需基于线上真实回流数据进行复盘,请选择创建评估任务(评测集评估)。

支持评估的智能体

AgentArts离线评估支持以下智能体来源:

表1 支持智能体来源

智能体来源

说明

AgentArts平台内创建

在AgentArts平台中直接创建的智能体。

本地代码开发并托管

本地代码开发的智能体,在AgentArts运行时托管的智能体。

第三方智能体

非AgentArts平台开发的第三方智能体,通过API或SDK接入到AgentArts中。

费用说明

平台提供10次免费评估任务额度,额度用尽后仍可继续创建评估任务,超出部分按需计费。评估过程中还可能产生以下费用:
  • 智能体交互费用:选择智能体评估时,产生与智能体交互的费用。
  • 评估器调用费用:使用评估器进行判定时产生的费用。
  • 智能分析费用:开启智能分析功能生成评估报告时产生的费用。

具体计费请参考计费说明。

前提条件

约束与限制

表2 使用限制

限制

说明

评估任务创建上限

默认最多支持创建1000个评估任务(包含10次免费任务额度),分为离线任务和在线任务两种类型。当任务数量达到上限时,可删除不再使用的任务释放配额,或提交工单申请提升配额。删除任务后,已消耗的免费额度不可恢复。

评估器添加上限

单个评估任务中最多支持添加5个评估器。

评估器使用限制

评估器的可用性与评估任务类型相关,需遵循特定的适配规则。关于评估器的详细支持情况,请参见评估器支持任务详情。

当离线评估的对象为智能体运行时或第三方托管智能体时,支持选择轨迹质量、轨迹-工具参数填充正确性两类评估器。

开通授权

评估任务需读取存储在APM中的调用链数据,并将执行结果上报至AOM。请确保已开通APM和AOM权限,否则评估功能将不可用。

APM和AOM权限仅需开通一次,后续无需重复操作。

  1. 登录AgentArts智能体平台。
  2. 在左侧导航栏中选择“观测与优化 > 评估”,在“评估任务”页签中,单击右上角的“创建评估任务”。
  3. 在弹出的对话框中,单击“开通授权”。

    开通授权后,才可以创建评估任务。如果遇到“权限不足”等错误,请参见常见问题。

    图1 开通授权

创建评估任务(智能体评估)

  1. 登录AgentArts智能体平台。
  2. 在左侧导航栏中选择“观测与优化 > 评估”,在“评估任务”页签中,单击右上角的“创建评估任务”。
  3. 选择“任务类型”为“离线评估”,并参照表3完成参数配置。

    表3 评估任务参数说明

    参数

    说明

    名称

    评估任务的名称。

    • 命名要求:支持中文、英文、数字、下划线(_)、中划线(-)和空格的组合,不允许以空格开头或结尾,且不允许使用其他特殊字符。
    • 长度限制:2~50个字符。

    描述(可选)

    评估任务的描述。

    长度限制:0~200个字符。

    执行类型

    设置评估任务的执行时间。

    • 立即执行:发起任务后,任务将立即开始执行。
    • 稍后执行:可以自定义评估任务的具体执行时间。

    智能分析

    是否生成智能分析报告。

    最大并发数

    支持并发执行数据的条目,默认为5条,最大可设置为20条。

    标签

    由“标签键”和“标签值”组成,用于标识和分类云资源。

    您可以在TMS中创建预定义标签,用于使用同一标签标识多种云资源,创建后可在标签输入框下拉选择同一标签,具体操作请参考创建预定义标签,创建后单击刷新。

    单击“添加标签”,选择在TMS中创建的预定义标签,或自定义输入标签键和标签值。

    可添加一个或多个标签,最多添加20个标签。

  4. 将评估对象设置为“智能体”。
  5. 单击“选择评估对象”,选择需评估的智能体及其版本(必须为已发布版本)。选择智能体运行时或第三方托管的智能体进行评估时,需在目标智能体卡片上单击“去配置”,完成智能体运行信息配置,确保智能体在评估期间可正常运行并返回结果。

    • 智能体运行时调用配置:
      1. 在“智能体运行时”页签中,在目标智能体卡片上单击“去配置”并参考表4完成调用配置。
        表4 调用配置

        参数

        说明

        API导入

        如已有OpenAPI定义,可单击“API 导入”快速导入请求参数(当前仅支持导入请求体参数),免去手动逐条填写。

        智能体访问地址

        是智能体对外提供调用的入口地址,该地址由系统在运行时智能体部署后自动获取,无需手动填写。

        请求参数

        请求头(Header)

        HTTP请求消息的组成部分之一,请求头负责向服务器传递认证鉴权、内容类型等请求元信息,随请求自动发送。配置时,请参照智能体接口的实际参数要求填写,单击“添加参数”可新增请求头参数,上限10个。

        进行轨迹评估时,需在请求参数中添加{{SessionID}}(会话ID)变量,用于关联智能体调用的请求与响应轨迹,确保轨迹评估时可完整还原会话上下文。

        图2 配置示例

        请求体(Body)

        承载请求的核心业务数据,如用户输入、会话上下文等。

        如果请求体(Body)中已添加参数,选择评测集后需将评测集输入数据与请求体(Body)中的参数进行映射,确保智能体能够正确读取评测集中的输入数据。

        图3 配置示例

        查询参数(Query)

        用于向服务器传递额外的参数信息。这些参数通常以键值对的形式出现,并且附在URL的路径后面,通过?分隔。配置时,请参照智能体接口的实际参数要求填写,单击“添加参数”可新增查询参数,上限10个。

        响应参数

        流式输出

        是指智能体在生成内容时,将内容分块逐步返回,而不是等待全部完成后一次性返回。

        选择流式输出后,智能体会分多次逐步返回内容,每次返回的数据称为一个“事件”。不同事件可能承载不同类型的信息(如文本内容、工具调用结果、状态更新等),因此需配置“事件类型”,用于告诉系统如何识别每条事件的类型,以便正确提取需要评估的内容。

        示例: 假设智能体流式返回的每条事件结构为{"type": "message", "content": "你好"},其中type字段表示事件类型,message表示这是一条文本消息。则在第一个输入框填写type,第二个输入框填写message,即$.type = message。

        图4 配置示例

        非流式输出

        是指智能体在完成全部计算和处理后,将完整结果一次性返回给调用方。

        智能体输出

        用于定义从智能体返回结果中提取哪个字段作为评估内容。

        示例:假设智能体返回的完整响应为{"result": {"answer": "北京是中国的首都"}},需要评估的内容是answer字段的值。则在输出字段路径中填写result.answer。系统会自动从响应中提取“北京是中国的首都”作为智能体输出,用于后续评测打分。

        图5 配置示例

        响应超时时间

        设置等待智能体返回的最大时间,默认60秒,最大支持600秒。对于执行耗时较长的复杂推理任务,建议适当增大该值以避免因超时导致评测失败。

      2. 配置完成后,单击“下一步”,进入调测页面,对已配置的智能体进行连通性验证。
      3. 调测成功后,单击“确定”,该智能体即可作为评估对象选择使用。
    • 第三方托管智能体调用配置:
      1. 在智能体运行时页签中,单击目标智能体卡片上单击“去配置”并参考表5完成调用配置。
        表5 调用配置

        参数

        说明

        API导入

        如已有OpenAPI定义,可单击“API导入”快速导入请求参数(请求头、请求体、查询参数),免去手动逐条填写。

        智能体访问地址

        是智能体对外提供调用的入口地址。

        鉴权方式

        用于验证智能体接口的调用身份,确保请求合法性。支持以下两种方式:

        • 无需鉴权:适用于公开访问的智能体接口,无需配置密钥,系统直接发起请求调用。
        • API Key:适用于需身份核验的智能体接口。选择后需配置密钥位置及API Key,将其附加到请求中发送。密钥位置选择Header时,API Key将添加至请求头(Header)中;选择Query时,API Key将添加至查询参数(Query)中。

        请求参数

        请求头(Header)

        HTTP请求消息的组成部分之一,请求头负责向服务器传递认证鉴权、内容类型等请求元信息,随请求自动发送。配置时,请参照智能体接口的实际参数要求填写,单击“添加参数”可新增请求头参数,上限10个。

        图6 配置示例

        请求体(Body)

        承载请求的核心业务数据,如用户输入、会话上下文等。

        图7 配置示例

        查询参数(Query)

        用于向服务器传递额外的参数信息。这些参数通常以键值对的形式出现,并且附在URL的路径后面,通过?分隔。配置时,请参照智能体接口的实际参数要求填写,单击“添加参数”可新增查询参数,上限10个。

        响应参数

        流式输出

        是指智能体在生成内容时,将内容分块逐步返回,而不是等待全部完成后一次性返回。

        选择流式输出后,智能体会分多次逐步返回内容,每次返回的数据称为一个“事件”。不同事件可能承载不同类型的信息(如文本内容、工具调用结果、状态更新等),因此需配置“事件类型”,用于告诉系统如何识别每条事件的类型,以便正确提取需要评估的内容。

        示例: 假设智能体流式返回的每条事件结构为{"type": "message", "content": "你好"},其中type字段表示事件类型,message表示这是一条文本消息。则在第一个输入框填写type,第二个输入框填写message,即$.type = message。

        图8 配置示例

        非流式输出

        是指智能体在完成全部计算和处理后,将完整结果一次性返回给调用方。

        智能体输出

        用于定义从智能体返回结果中提取哪个字段作为评估内容。

        示例:假设智能体返回的完整响应为{"result": {"answer": "北京是中国的首都"}},需要评估的内容是answer字段的值。则在输出字段路径中填写result.answer。系统会自动从响应中提取“北京是中国的首都”作为智能体输出,用于后续评测打分。

        图9 配置示例

        响应超时时间

        设置等待智能体返回的最大时间,默认60秒,最大支持600秒。对于执行耗时较长的复杂推理任务,建议适当增大该值以避免因超时导致评测失败。

      2. 配置完成后,单击"下一步",进入调测页面,对已配置的智能体进行连通性验证。
        图10 调测数据
        图11 调测结果
      3. 调测成功后,单击“确定”,该智能体即可作为评估对象选择使用。

  6. 选择一个已发布的评测集。评测集选择完成后,单击其下方“字段映射”区域的下拉箭头,将评测集输入数据字段与评估对象的输入(input)字段进行映射,确保智能体能够正确读取评测集中的输入数据。

    • 仅支持选择最新版本的评测集。
    • 如果无可用评测集,可进行以下操作:
      • 单击“创建评测集”,跳转到评测集页面创建新的评测集。具体操作步骤请参考人工创建单轮评测集。
      • 单击“去发布”,将未发布的评测集进行发布。发布后可以在评估任务中使用。具体操作步骤请参考发布评测集版本。

  7. 选择评估器。

    1. 单击“选择评估器”,在弹出的页面中选择使用自定义或平台精选评估器。
      如果您是初次使用或无特殊业务逻辑需求,推荐优先使用“平台精选”评估器。
      • 平台精选:适用于未创建评估器的场景。平台提供了一系列预置评估器可直接使用。详细信息请参考预置评估器。
      • 自定义:选择自定义的评估器以及版本。
        • 单击“创建评估器”,跳转到创建评估器的界面进行创建。具体操作步骤请参考创建模型判定评估器。
        • 单击评估器右侧的,移除该评估器。
    2. 评估器选择完成后,单击评估器左侧的下拉箭头,将评测集中的字段以及评估对象的实际输出(agent_output)与评估器的字段进行映射,确保评估器能够准确获取数据并执行评估任务。

      字段映射错误将导致评估失败或结果异常,请仔细检查映射关系。

      例如:确保评测集的input映射至评估器的input,智能体实际输出映射至评估器的actual_output。

      图12 评估器字段映射

  8. 检查评估任务的配置信息,确认无误后,单击“发起任务”。任务创建后,系统将自动跳转至“评估任务详情”页面。在该页面中:

    • 查看状态:任务创建完成后状态显示为“运行中”,待评估完成后变更为“成功”。
    • 查看结果:任务执行成功后,您可以查看评估结果,具体操作请参见查看评估结果。

    评估任务创建完成后,在“评估任务”列表页面查看创建的评估任务。支持通过属性筛选或关键字搜索来查找评估任务。

创建评估任务(评测集评估)

当以评测集作为评估对象时,评估器的字段必须与评测集中对应的字段相匹配,否则可能导致评估任务执行失败或结果异常。

  1. 登录AgentArts智能体平台。
  2. 在左侧导航栏中选择“观测与优化 > 评估”,在“评估任务”页签中,单击右上角的“创建评估任务”。
  3. 选择“任务类型”为“离线评估”,并参照表3完成参数配置。
  4. 将评估对象设置为“评测集”。

    当您希望基于已上线运行的Agent产生的真实调用链数据评估时,可以将“评测集”作为评估对象。该方式支持将线上实际输入与输出回流至评测集,实现对智能体表现的复盘与量化分析。

    获取调用链数据:

    1. 进入“调用链分析”页面,在列表中勾选需要添加的调用链数据。
    2. 单击右侧的“添加至评测集”,即可一键将数据添加进评测集中。具体方法请参考回流Trace数据至评测集。

  5. 选择需要评估的评测集。
  6. 选择评估器。

    1. 单击“选择评估器”,选择使用自定义或平台精选评估器。

      如果您是初次使用或无特殊业务逻辑需求,推荐优先使用“平台精选”评估器。

      • 平台精选:适用于未创建评估器的场景。平台提供了多种预置评估器可直接使用。详细信息请参考预置评估器。
      • 自定义:如果已有自定义评估器,可选择对应的评估器及其版本,支持灵活配置业务逻辑。自定义评估器请参考创建模型判定评估器。
    2. 选择完成后,单击评估器左侧的下拉箭头,进行字段映射,确保评估器准确获取数据并执行评估。
      图13 评估器字段映射

      示例场景说明

      • 场景一:评估输出结果的正确性
        • 目标:判断智能体的输出是否与标准答案一致。
        • 推荐评估器:平台精选评估器——“正确性”
        • 评测集字段要求:必须包含以下三列:
          • input:原始输入数据
          • output:实际输出数据
          • reference_output:标准参考答案
          图14 评测集数据示例
          图15 评估器字段映射示例
      • 场景二:评估输出是否具有明显的“AI味”(AI感过重)
        • 目标:检测数据内容是否过于机械、模板化,缺乏自然表达。
        • 推荐评估器:平台精选评估器——“AI味检查”
        • 评测集字段要求:
          • input:原始输入数据
          • output:实际输出数据
        图16 评测集数据示例
        图17 评估器字段映射示例

  7. 检查评估任务的配置信息,确认无误后,单击“发起任务”。任务创建后,系统将自动跳转至“评估任务详情”页面。在该页面中:

    • 查看状态:任务创建完成后状态显示为“运行中”,待评估完成后变更为“成功”。
    • 查看结果:任务执行成功后,您可以查看评估结果,具体操作请参见查看评估结果。

    评估任务创建完成后,在“评估任务”列表页面查看创建的评估任务。支持通过属性筛选或关键字搜索来查找评估任务。

常见问题

创建评估任务时,系统提示“权限不足”怎么办?

当前登录的用户未具备创建委托的权限,请联系主账号管理员完成委托创建。具体操作请参见开通授权。

图18 报错信息

创建委托时,系统提示“委托创建失败”怎么办?

当前登录的用户未具备创建委托的权限或账号下的委托数量已达到上限。

  • 权限不足:请联系主账号管理员完成委托创建。具体操作请参见开通授权。
  • 委托数量已达到上限:请联系主账号管理员尝试删除不再使用的委托以释放配额。删除委托请参考删除或修改委托。

相关文档