更新时间:2026-08-03 GMT+08:00
分享

Rubric评估

Rubric评估评估器

表1 评估器信息

分类

详情

基础信息

评估器名称

Rubric评估

效果说明

功能概述

基于用户自定义的评分准则(Rubric)对LLM输出进行多维度结构化评估,支持通用质量评估、格式规范检查、内容合规评估等场景,评估结果具备可解释性和可追溯性。

评估方式

LLM评估

评估目标

输出质量

适用场景

离线评估、在线评估

应用场景

需要自定义评分标准的评测场景,如业务特定的质量评估、多维度综合评分、合规性检查等,用户可灵活定义评估维度、等级和权重。

评分标准

1.0分

所有维度均达到最高等级,综合评分映射为1.0分。

0.75分

大部分维度表现良好,综合评分映射为0.75分。

0.5分

部分维度存在不足,综合评分映射为0.5分。

0.25分

多个维度不合格或关键维度不达标,综合评分映射为0.25分。

0.0分

严重不达标或关键维度完全不合格,综合评分映射为0.0分。

评估器参数说明:

表2 评估器参数说明

参数类型

参数名称

是否必填

参数说明

输入参数

input

用户输入,提供评估的上下文背景。

actual_output

智能体针对该输入的实际输出结果。

rubric_set

用户自定义的评分准则(JSON字符串),包含rubrics数组,每项含type(维度类型)、rubric(维度描述)、importance(重要程度:CRITICAL/HIGH/MEDIUM/LOW)。如果不传平台将自动生成评分准则。

输出参数

score

评估得分(0.0/0.25/0.5/0.75/1.0)。

reason

评分理由说明,需列出各维度的评分及简要依据,以及综合评分的计算方式。

使用该评估器前,需要在评测集中为每条测试数据准备好input(用户输入)和actual_output(智能体实际输出)。rubric_set(用户自定义的评分准则)为可选参数,如果不传则平台会根据输入内容自动生成评分准则。评估时平台会自动将数据传入评估Prompt,严格按照评分准则中定义的维度、等级和描述进行逐维度评分,最终给出综合评分。各字段的推荐映射方式如下:

输入格式示例:

{
  "input": "请帮我写一封商务邮件",
  "actual_output": "尊敬的王总:关于合作事宜,现回复如下...",
  "rubric_set": "{\"rubrics\":[{\"type\":\"LANGUAGE:PRIMARY_RESPONSE_LANGUAGE\",\"rubric\":\"回复的主体语言是否为中文\",\"importance\":\"CRITICAL\"},{\"type\":\"CONTENT:RELEVANCE\",\"rubric\":\"回复是否与用户问题直接相关\",\"importance\":\"HIGH\"}]}"
}

输出格式示例:

{
  "score": 0.75,
  "reason": "维度LANGUAGE:PRIMARY_RESPONSE_LANGUAGE(CRITICAL):1.0分,回复主体语言为中文;维度CONTENT:RELEVANCE(HIGH):0.5分,回复与问题相关但包含部分无关内容。综合评分=1.0×0.5+0.5×0.5=0.75。"
}

相关文档