Rubric评估
Rubric评估评估器
| 分类 | 详情 | |
|---|---|---|
| 基础信息 | 评估器名称 | Rubric评估。 |
| 效果说明 | 功能概述 | 基于用户自定义的评分准则(Rubric)对LLM输出进行多维度结构化评估,支持通用质量评估、格式规范检查、内容合规评估等场景,评估结果具备可解释性和可追溯性。 |
| 评估方式 | LLM评估。 | |
| 评估目标 | 输出质量。 | |
| 适用场景 | 离线评估、在线评估。 | |
| 应用场景 | 需要自定义评分标准的评测场景,如业务特定的质量评估、多维度综合评分、合规性检查等,用户可灵活定义评估维度、等级和权重。 | |
| 评分标准 | 1.0分 | 所有维度均达到最高等级,综合评分映射为1.0分。 |
| 0.75分 | 大部分维度表现良好,综合评分映射为0.75分。 | |
| 0.5分 | 部分维度存在不足,综合评分映射为0.5分。 | |
| 0.25分 | 多个维度不合格或关键维度不达标,综合评分映射为0.25分。 | |
| 0.0分 | 严重不达标或关键维度完全不合格,综合评分映射为0.0分。 | |
评估器参数说明:
| 参数类型 | 参数名称 | 是否必填 | 参数说明 |
|---|---|---|---|
| 输入参数 | input | 是 | 用户输入,提供评估的上下文背景。 |
| actual_output | 是 | 智能体针对该输入的实际输出结果。 | |
| rubric_set | 否 | 用户自定义的评分准则(JSON字符串),包含rubrics数组,每项含type(维度类型)、rubric(维度描述)、importance(重要程度:CRITICAL/HIGH/MEDIUM/LOW)。如果不传平台将自动生成评分准则。 | |
| 输出参数 | score | 是 | 评估得分(0.0/0.25/0.5/0.75/1.0)。 |
| reason | 是 | 评分理由说明,需列出各维度的评分及简要依据,以及综合评分的计算方式。 |
使用该评估器前,需要在评测集中为每条测试数据准备好input(用户输入)和actual_output(智能体实际输出)。rubric_set(用户自定义的评分准则)为可选参数,如果不传则平台会根据输入内容自动生成评分准则。评估时平台会自动将数据传入评估Prompt,严格按照评分准则中定义的维度、等级和描述进行逐维度评分,最终给出综合评分。各字段的推荐映射方式如下:
输入格式示例:
{
"input": "请帮我写一封商务邮件",
"actual_output": "尊敬的王总:关于合作事宜,现回复如下...",
"rubric_set": "{\"rubrics\":[{\"type\":\"LANGUAGE:PRIMARY_RESPONSE_LANGUAGE\",\"rubric\":\"回复的主体语言是否为中文\",\"importance\":\"CRITICAL\"},{\"type\":\"CONTENT:RELEVANCE\",\"rubric\":\"回复是否与用户问题直接相关\",\"importance\":\"HIGH\"}]}"
} 输出格式示例:
{
"score": 0.75,
"reason": "维度LANGUAGE:PRIMARY_RESPONSE_LANGUAGE(CRITICAL):1.0分,回复主体语言为中文;维度CONTENT:RELEVANCE(HIGH):0.5分,回复与问题相关但包含部分无关内容。综合评分=1.0×0.5+0.5×0.5=0.75。"
}