更新时间:2026-09-14 GMT+08:00
分享

Token效率

Token效率评估器

表1 评估器信息

分类

详情

基础信息

评估器名称

Token效率。

效果说明

功能概述

评估Agent完成任务时的Token消耗合理性,结合任务复杂度、Token利用率和步骤效率进行综合判定。

评估方式

LLM评估。

评估目标

成本效率。

适用场景

在线评估。

应用场景

评估Agent在完成任务时的Token消耗合理性。

评分标准

1.0分

Token消耗与任务复杂度完美匹配,几乎无浪费。

0.75分

Token消耗基本合理,存在轻微浪费但不影响整体效率。

0.5分

Token消耗偏高,存在可优化的空间,但不至于严重浪费。

0.25分

Token消耗明显高于任务所需,存在大量无效或冗余的 Token 使用。

0.0分

Token消耗严重浪费,与任务复杂度严重不匹配。

评估器参数说明:

表2 评估器参数说明

参数类型

参数名称

是否必填

参数说明

输入参数

input

是

用户输入,提供评估的上下文背景。

actual_output

是

智能体针对该输入的实际输出结果。

case_token_cost

否

本次任务的总Token消耗。

trajectory

否

agent运行轨迹

输出参数

score

是

评估得分(0.0/0.25/0.5/0.75/1.0)。

reason

是

评分理由说明,需列出各维度的评分及简要依据,以及综合评分的计算方式。

使用该评估器前,需要在评测集中为每条测试数据准备好input(用户输入)和actual_output(智能体实际输出)。case_token_cost(本次任务的总Token消耗)与trajectory(agent运行轨迹)为可选参数,如果不传则平台会根据输入输出进行评估。评估时平台会自动将数据传入评估Prompt,严格按照评分准则中定义的维度、等级和描述进行逐维度评分,最终给出综合评分。各字段的推荐映射方式如下:

输入格式示例:

{
  "input": "请帮我写一封商务邮件",
  "actual_output": "尊敬的王总:关于合作事宜,现回复如下...",
  "case_token_cost": 2000,
  "trajectory": "{"trajectory_id":"greeting-001","root_step":{"step_id":"root-001","session_id":"sess-greeting","name":"GreetingTask","input":"你好","output":"你好!很高兴见到你,有什么可以帮你的吗?","timestamp":1700000000000,"duration":1500,"child_steps_id":["step-001"],"llm_params":{"model":"gpt-4o-mini","input_tokens":12,"output_tokens":15,"total_tokens":27,"duration":1.5,"finish_reason":"stop"}},"steps":[{"step_id":"step-001","parent_id":"root-001","name":"LLMGenerate","input":"你好","output":"你好!很高兴见到你,有什么可以帮你的吗?","type":"llm","timestamp":1700000000100,"duration":1500,"child_steps_id":[],"llm_params":{"model":"gpt-4o-mini","input_tokens":12,"output_tokens":15,"total_tokens":27,"duration":1.5,"finish_reason":"stop"}}]}"
 
}

输出格式示例:

{
  "score": 0.75,
  "reason": "这是一个简单的问候,token消耗合理"
}

相关文档