Token效率
Token效率评估器
| 分类 | 详情 | |
|---|---|---|
| 基础信息 | 评估器名称 | Token效率。 |
| 效果说明 | 功能概述 | 评估Agent完成任务时的Token消耗合理性,结合任务复杂度、Token利用率和步骤效率进行综合判定。 |
| 评估方式 | LLM评估。 | |
| 评估目标 | 成本效率。 | |
| 适用场景 | 在线评估。 | |
| 应用场景 | 评估Agent在完成任务时的Token消耗合理性。 | |
| 评分标准 | 1.0分 | Token消耗与任务复杂度完美匹配,几乎无浪费。 |
| 0.75分 | Token消耗基本合理,存在轻微浪费但不影响整体效率。 | |
| 0.5分 | Token消耗偏高,存在可优化的空间,但不至于严重浪费。 | |
| 0.25分 | Token消耗明显高于任务所需,存在大量无效或冗余的 Token 使用。 | |
| 0.0分 | Token消耗严重浪费,与任务复杂度严重不匹配。 | |
评估器参数说明:
| 参数类型 | 参数名称 | 是否必填 | 参数说明 |
|---|---|---|---|
| 输入参数 | input | 是 | 用户输入,提供评估的上下文背景。 |
| actual_output | 是 | 智能体针对该输入的实际输出结果。 | |
| case_token_cost | 否 | 本次任务的总Token消耗。 | |
| trajectory | 否 | agent运行轨迹 | |
| 输出参数 | score | 是 | 评估得分(0.0/0.25/0.5/0.75/1.0)。 |
| reason | 是 | 评分理由说明,需列出各维度的评分及简要依据,以及综合评分的计算方式。 |
使用该评估器前,需要在评测集中为每条测试数据准备好input(用户输入)和actual_output(智能体实际输出)。case_token_cost(本次任务的总Token消耗)与trajectory(agent运行轨迹)为可选参数,如果不传则平台会根据输入输出进行评估。评估时平台会自动将数据传入评估Prompt,严格按照评分准则中定义的维度、等级和描述进行逐维度评分,最终给出综合评分。各字段的推荐映射方式如下:
输入格式示例:
{
"input": "请帮我写一封商务邮件",
"actual_output": "尊敬的王总:关于合作事宜,现回复如下...",
"case_token_cost": 2000,
"trajectory": "{"trajectory_id":"greeting-001","root_step":{"step_id":"root-001","session_id":"sess-greeting","name":"GreetingTask","input":"你好","output":"你好!很高兴见到你,有什么可以帮你的吗?","timestamp":1700000000000,"duration":1500,"child_steps_id":["step-001"],"llm_params":{"model":"gpt-4o-mini","input_tokens":12,"output_tokens":15,"total_tokens":27,"duration":1.5,"finish_reason":"stop"}},"steps":[{"step_id":"step-001","parent_id":"root-001","name":"LLMGenerate","input":"你好","output":"你好!很高兴见到你,有什么可以帮你的吗?","type":"llm","timestamp":1700000000100,"duration":1500,"child_steps_id":[],"llm_params":{"model":"gpt-4o-mini","input_tokens":12,"output_tokens":15,"total_tokens":27,"duration":1.5,"finish_reason":"stop"}}]}"
} 输出格式示例:
{
"score": 0.75,
"reason": "这是一个简单的问候,token消耗合理"
}