文档首页/ 智果(AgentArts)智能体平台/ API参考/ API/ 评估/ 评估任务管理/ 查看任务评估结果 - ListOpsEvaluationTaskResults
更新时间:2026-09-24 GMT+08:00
分享

查看任务评估结果 - ListOpsEvaluationTaskResults

功能介绍

该接口用于获取评估任务的详细评估结果,包括各项评估指标的分数、用时和详细信息,适用于任务结果分析和质量评估的场景。

调用方法

请参见如何调用API。

授权信息

账号根用户具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备如下身份策略权限,更多的权限说明请参见权限和授权项。

授权项

访问级别

资源类型(*为必须)

条件键

别名

依赖的授权项

agentarts:evaluationTask:listOpsEvaluationTaskResults

List

evaluationTask *

g:ResourceTag/<tag-key>

-

-

URI

POST /v1/ops/evaluation-tasks/{task_id}/results

表1 路径参数

参数

是否必选

参数类型

描述

task_id

是

String

参数解释:

需要查询结果的评估任务唯一标识符(ID)。可通过调用创建评估任务接口获取,或通过查询评估任务列表接口获取。

约束限制:

不涉及。

取值范围:

只能由英文字母、数字组成,长度为1~100个字符的字符串。

默认取值:

不涉及。

请求参数

表2 请求Body参数

参数

是否必选

参数类型

描述

offset

是

Integer

参数解释:

指定分页查询的起始偏移量。

约束限制:

0到10000之间的整数。

取值范围:

0到10000。

默认取值:

0。

limit

是

Integer

参数解释:

指定单页返回的结果数量。

约束限制:

1到100之间的整数。

取值范围:

1到100。

默认取值:

10。

filters

否

Object

参数解释:

任务过滤条件对象,支持模糊查询,用于精准筛选评估结果。可筛选字段包括min_score(最小得分)、max_score(最大得分)等。默认为空对象,表示不进行过滤。

约束限制:

符合JSON格式规范,仅支持预定义的可筛选字段。

取值范围:

不涉及。

响应参数

状态码:200

表3 响应Body参数

参数

参数类型

描述

data

data object

参数解释:

响应数据主体。

表4 data

参数

参数类型

描述

total

Integer

参数解释:

满足查询条件的评估结果总数。

取值范围:

非负整数。

items

Array of OpsEvaluationTaskResultItem objects

参数解释:

评估结果条目列表。

表5 OpsEvaluationTaskResultItem

参数

参数类型

描述

item_id

String

数据条目ID。

session_id

String

会话ID。

dataset_id

String

数据集ID。

dataset_version

String

数据集版本。

dataset_name

String

数据集名称。

task_id

String

任务ID。

task_name

String

任务名称。

item_data

Array of objects

数据条目原始数据。

agent_output

Array of strings

智能体输出列表。

trace_ids

Array of strings

轨迹ID列表。

evaluations

Array of OpsEvaluationItemEvaluation objects

各评估器的评估结果列表。

annotations

Array of objects

人工标注列表。

表6 OpsEvaluationItemEvaluation

参数

参数类型

描述

evaluator_id

String

评估器ID。

evaluator_version

String

评估器版本。

evaluator_name

String

评估器名称。

score

Double

评估得分。

reason

String

评估理由。

latency_s

Integer

评估耗时(秒)。

status_code

String

评估状态码。

error

String

错误信息。

retry_count

Integer

重试次数。

created_at

String

评估时间。

correction

Object

人工校正信息。

请求示例

获取指定评估任务的详细结果,包含每条测试数据的评分、原因及处理耗时。

POST https://api.example.com/v1/ops/evaluation-tasks/task_7590068991923321000/results

{
  "offset" : 1,
  "limit" : 10,
  "filters" : {
    "min_score" : 0,
    "max_score" : 10
  }
}

响应示例

状态码:200

{
  "data" : {
    "items" : [ {
      "item_id" : "item-f80ce759-490a-4472-b779-80dc5e564f5b",
      "dataset_name" : "dataset_name",
      "evaluations" : [ {
        "score" : 0.8,
        "reason" : "回答完全正确",
        "latency_s" : 20
      } ]
    } ],
    "total" : 1
  }
}

状态码

状态码

描述

200

当前任务的评估详情

错误码

请参见错误码。

相关文档