评估器调试 - DebugOpsEvaluator
功能介绍
该接口用于对评估器的判分逻辑进行实时调试,通过输入样例数据验证评估器的解析能力、Prompt 效果及评分准确性。
调用方法
请参见如何调用API。
授权信息
账号根用户具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备如下身份策略权限,更多的权限说明请参见权限和授权项。
| 授权项 | 访问级别 | 资源类型(*为必须) | 条件键 | 别名 | 依赖的授权项 |
|---|---|---|---|---|---|
| agentarts:evaluator:debugOpsEvaluator | Write | evaluator * | g:ResourceTag/<tag-key> | - | - |
URI
POST /v1/ops/evaluators/debug
请求参数
| 参数 | 是否必选 | 参数类型 | 描述 |
|---|---|---|---|
| type | 否 | String | 参数解释: 评估器的轮次类型。 约束限制: 不涉及。 取值范围: 由英文字母组成的字符串,长度为0~100个字符。 默认取值: 不涉及。 |
| turn_type | 否 | String | 参数解释: 评估器的轮次类型。 约束限制: 不涉及。 取值范围: 长度为0~100个字符,枚举值: 默认取值: 不涉及。 |
| llm_config | 否 | OpsEvaluationLLMConfig object | 参数解释: 大语言模型(LLM)的评估配置对象。 约束限制: 不涉及。 取值范围: 不涉及。 默认取值: 不涉及。 |
| 参数 | 是否必选 | 参数类型 | 描述 |
|---|---|---|---|
| system_prompt | 否 | String | 参数解释: 系统提示词(System Prompt),定义模型的角色与规则。 约束限制: 不涉及。 取值范围: 可由任意字符组成,长度为0~10000个字符。 默认取值: 不涉及。 |
| model_config | 否 | OpsEvaluationModelConfig object | 参数解释: 具体的模型参数配置对象,参考OpsEvaluationModelConfig定义。 约束限制: 不涉及。 取值范围: 不涉及。 默认取值: 不涉及。 |
| 参数 | 是否必选 | 参数类型 | 描述 |
|---|---|---|---|
| model_id | 否 | String | 参数解释: 模型的唯一标识符。可通过调用获取模型列表接口获取。 约束限制: 不涉及。 取值范围: 不涉及。 默认取值: 不涉及。 |
| model_name | 否 | String | 参数解释: 模型的显示名称。 约束限制: 不涉及。 取值范围: 不涉及。 默认取值: 不涉及。 |
| temperature | 否 | Float | 参数解释: 采样温度参数,用于控制输出的随机性。数值低更聚焦,数值高更具创造性。 约束限制: 不涉及。 取值范围: 0.0~2.0。 默认取值: 0.7。 |
| max_tokens | 否 | Integer | 参数解释: 单次推理生成的最大Token数量限制,单位:个。 约束限制: 不涉及。 取值范围: 1~32000。 默认取值: 不涉及。 |
| top_p | 否 | Float | 参数解释: 核采样参数,用于控制生成时考虑的概率分布范围,值越小生成内容越确定,值越大生成内容越多样。 约束限制: 不涉及。 取值范围: 0.0~1.0。 默认取值: 1.0。 |
| frequency_penalty | 否 | Float | 参数解释: 频率惩罚系数,降低内容重复倾向。 约束限制: 不涉及。 取值范围: -2.0~2.0。 默认取值: 0.0。 |
响应参数
状态码:200
| 参数 | 参数类型 | 描述 |
|---|---|---|
| status_code | Integer | 参数解释: 调试执行的状态码。 取值范围: 不涉及。 |
| error | String | 参数解释: 调试过程中产生的错误详细信息。 取值范围: 不涉及。 |
| score | Integer | 参数解释: 评估器根据当前输入调试出的评分结果。 取值范围: 不涉及。 |
| reason | String | 参数解释: 评估结果的详细理由或推导过程。 取值范围: 不涉及。 |
| input_token_usage | Integer | 参数解释: 调试请求中输入内容消耗的Token数量。 取值范围: 0~2147483647。 |
| output_token_usage | Integer | 参数解释: 调试请求中输出内容消耗的Token数量。 取值范围: 0~2147483647。 |
| latency | Integer | 参数解释: 本次调试操作的耗时,单位:毫秒(ms)。 取值范围: 0~2147483647。 |
请求示例
通过输入样例数据实时调试评估器的判分逻辑和 Prompt 效果。
POST https://api.example.com/v1/ops/evaluators/debug
{
"type" : "llm",
"llm_config" : {
"system_prompt" : "system_prompt",
"model_config" : {
"model_id" : "1749615103",
"model_name" : "豆包·1.6·自动深度思考",
"temperature" : 0.1,
"max_tokens" : 4096,
"top_p" : 0.7,
"frequency_penalty" : 0
}
}
} 响应示例
状态码:200
成功响应
{
"status_code" : 200,
"error" : "Invalid Prompt Template",
"score" : 85,
"reason" : "回复内容过于笼统。",
"input_token_usage" : 386,
"output_token_usage" : 703,
"latency" : 2200
} 状态码
| 状态码 | 描述 |
|---|---|
| 200 | 成功响应 |
错误码
请参见错误码。