更新时间:2026-09-02 GMT+08:00
分享

评估器调试 - DebugOpsEvaluator

功能介绍

该接口用于对评估器的判分逻辑进行实时调试,通过输入样例数据验证评估器的解析能力、Prompt 效果及评分准确性。

调用方法

请参见如何调用API

授权信息

账号根用户具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备如下身份策略权限,更多的权限说明请参见权限和授权项

授权项

访问级别

资源类型(*为必须)

条件键

别名

依赖的授权项

agentarts:evaluator:debugOpsEvaluator

Write

evaluator *

g:ResourceTag/<tag-key>

-

-

URI

POST /v1/ops/evaluators/debug

请求参数

表1 请求Body参数

参数

是否必选

参数类型

描述

type

String

参数解释:

评估器的轮次类型。

约束限制:

不涉及。

取值范围:

由英文字母组成的字符串,长度为0~100个字符。

  • single: 单轮评估器

  • multi: 多轮评估器

默认取值:

不涉及。

turn_type

String

参数解释:

评估器的轮次类型。

约束限制:

不涉及。

取值范围:

长度为0~100个字符,枚举值:

  • single:单轮评估器

  • multi:多轮评估器

默认取值:

不涉及。

llm_config

OpsEvaluationLLMConfig object

参数解释:

大语言模型(LLM)的评估配置对象。

约束限制:

不涉及。

取值范围:

不涉及。

默认取值:

不涉及。

表2 OpsEvaluationLLMConfig

参数

是否必选

参数类型

描述

system_prompt

String

参数解释:

系统提示词(System Prompt),定义模型的角色与规则。

约束限制:

不涉及。

取值范围:

可由任意字符组成,长度为0~10000个字符。

默认取值:

不涉及。

model_config

OpsEvaluationModelConfig object

参数解释:

具体的模型参数配置对象,参考OpsEvaluationModelConfig定义。

约束限制:

不涉及。

取值范围:

不涉及。

默认取值:

不涉及。

表3 OpsEvaluationModelConfig

参数

是否必选

参数类型

描述

model_id

String

参数解释:

模型的唯一标识符。可通过调用获取模型列表接口获取。

约束限制:

不涉及。

取值范围:

不涉及。

默认取值:

不涉及。

model_name

String

参数解释:

模型的显示名称。

约束限制:

不涉及。

取值范围:

不涉及。

默认取值:

不涉及。

temperature

Float

参数解释:

采样温度参数,用于控制输出的随机性。数值低更聚焦,数值高更具创造性。

约束限制:

不涉及。

取值范围:

0.0~2.0。

默认取值:

0.7。

max_tokens

Integer

参数解释:

单次推理生成的最大Token数量限制,单位:个。

约束限制:

不涉及。

取值范围:

1~32000。

默认取值:

不涉及。

top_p

Float

参数解释:

核采样参数,用于控制生成时考虑的概率分布范围,值越小生成内容越确定,值越大生成内容越多样。

约束限制:

不涉及。

取值范围:

0.0~1.0。

默认取值:

1.0。

frequency_penalty

Float

参数解释:

频率惩罚系数,降低内容重复倾向。

约束限制:

不涉及。

取值范围:

-2.0~2.0。

默认取值:

0.0。

响应参数

状态码:200

表4 响应Body参数

参数

参数类型

描述

status_code

Integer

参数解释:

调试执行的状态码。

取值范围:

不涉及。

error

String

参数解释:

调试过程中产生的错误详细信息。

取值范围:

不涉及。

score

Integer

参数解释:

评估器根据当前输入调试出的评分结果。

取值范围:

不涉及。

reason

String

参数解释:

评估结果的详细理由或推导过程。

取值范围:

不涉及。

input_token_usage

Integer

参数解释:

调试请求中输入内容消耗的Token数量。

取值范围:

0~2147483647。

output_token_usage

Integer

参数解释:

调试请求中输出内容消耗的Token数量。

取值范围:

0~2147483647。

latency

Integer

参数解释:

本次调试操作的耗时,单位:毫秒(ms)。

取值范围:

0~2147483647。

请求示例

通过输入样例数据实时调试评估器的判分逻辑和 Prompt 效果。

POST https://api.example.com/v1/ops/evaluators/debug

{
  "type" : "llm",
  "llm_config" : {
    "system_prompt" : "system_prompt",
    "model_config" : {
      "model_id" : "1749615103",
      "model_name" : "豆包·1.6·自动深度思考",
      "temperature" : 0.1,
      "max_tokens" : 4096,
      "top_p" : 0.7,
      "frequency_penalty" : 0
    }
  }
}

响应示例

状态码:200

成功响应

{
  "status_code" : 200,
  "error" : "Invalid Prompt Template",
  "score" : 85,
  "reason" : "回复内容过于笼统。",
  "input_token_usage" : 386,
  "output_token_usage" : 703,
  "latency" : 2200
}

状态码

状态码

描述

200

成功响应

错误码

请参见错误码

相关文档