
# Rubric评估
**Rubric评估** **评估器**
表1评估器信息 
| 分类          || 详情                                                                              |
|:---|---|:---|
| 基础信息 | 评估器名称 | Rubric评估。                                                                       |
| 效果说明 | 功能概述  | 基于用户自定义的评分准则（Rubric）对LLM输出进行多维度结构化评估，支持通用质量评估、格式规范检查、内容合规评估等场景，评估结果具备可解释性和可追溯性。 |
| 效果说明 | 评估方式  | LLM评估。                                                                          |
| 效果说明 | 评估目标  | 输出质量。                                                                           |
| 效果说明 | 适用场景  | 离线评估、在线评估。                                                                      |
| 效果说明 | 应用场景  | 需要自定义评分标准的评测场景，如业务特定的质量评估、多维度综合评分、合规性检查等，用户可灵活定义评估维度、等级和权重。                     |
| 评分标准 | 1.0分  | 所有维度均达到最高等级，综合评分映射为1.0分。                                                        |
| 评分标准 | 0.75分 | 大部分维度表现良好，综合评分映射为0.75分。                                                         |
| 评分标准 | 0.5分  | 部分维度存在不足，综合评分映射为0.5分。                                                           |
| 评分标准 | 0.25分 | 多个维度不合格或关键维度不达标，综合评分映射为0.25分。                                                   |
| 评分标准 | 0.0分  | 严重不达标或关键维度完全不合格，综合评分映射为0.0分。                                                    |
   
**评估器参数说明：**
表2评估器参数说明 
| 参数类型 | 参数名称          | 是否必填 | 参数说明                                                                                                                   |
|:---|:---|:---|:---|
| 输入参数 | input         | 是    | 用户输入，提供评估的上下文背景。                                                                                                       |
| 输入参数 | actual_output | 是    | 智能体针对该输入的实际输出结果。                                                                                                       |
| 输入参数 | rubric_set    | 否    | 用户自定义的评分准则（JSON字符串），包含rubrics数组，每项含type（维度类型）、rubric（维度描述）、importance（重要程度：CRITICAL/HIGH/MEDIUM/LOW）。如果不传，平台将自动生成评分准则。 |
| 输出参数 | score         | 是    | 评估得分（0.0/0.25/0.5/0.75/1.0）。                                                                                           |
| 输出参数 | reason        | 是    | 评分理由说明，需列出各维度的评分及简要依据，以及综合评分的计算方式。                                                                                     |
   
使用该评估器前，需要在评测集中为每条测试数据准备好input（用户输入）和actual_output（智能体实际输出）。rubric_set（用户自定义的评分准则）为可选参数，如果不传则平台会根据输入内容自动生成评分准则。评估时平台会自动将数据传入评估Prompt，严格按照评分准则中定义的维度、等级和描述进行逐维度评分，最终给出综合评分。各字段的推荐映射方式如下：
**输入格式示例：**
```
{
  "input": "请帮我写一封商务邮件",
  "actual_output": "尊敬的王总：关于合作事宜，现回复如下...",
  "rubric_set": "{\"rubrics\":[{\"type\":\"LANGUAGE:PRIMARY_RESPONSE_LANGUAGE\",\"rubric\":\"回复的主体语言是否为中文\",\"importance\":\"CRITICAL\"},{\"type\":\"CONTENT:RELEVANCE\",\"rubric\":\"回复是否与用户问题直接相关\",\"importance\":\"HIGH\"}]}"
}
```
**输出格式示例：**
```
{
  "score": 0.75,
  "reason": "维度LANGUAGE:PRIMARY_RESPONSE_LANGUAGE（CRITICAL）：1.0分，回复主体语言为中文；维度CONTENT:RELEVANCE（HIGH）：0.5分，回复与问题相关但包含部分无关内容。综合评分=1.0×0.5+0.5×0.5=0.75。"
}
```
