
# 角色违规
**角色违规** **评估器**
表1评估器信息 
| 分类          || 详情                                                                       |
|:---|---|:---|
| 基础信息 | 评估器名称 | 角色违规。                                                                    |
| 效果说明 | 功能概述  | 评估模型输出是否违背了设定的角色身份。通过比对角色设定与模型实际输出，判断模型是否存在身份泄露、语气不符、行为越界或知识范围越界等角色违规问题。 |
| 效果说明 | 评估方式  | LLM评估。                                                                   |
| 效果说明 | 评估目标  | 输出质量。                                                                    |
| 效果说明 | 适用场景  | 离线评估、在线评估。                                                               |
| 效果说明 | 应用场景  | 角色扮演类智能体的质量评测，如虚拟角色对话、NPC交互、品牌代言人等，需要检验智能体是否始终遵守角色设定。                    |
| 评分标准 | 1.0分  | 无角色违规：模型输出完全符合角色设定，身份、语气、行为和知识范围均与角色一致，无任何越界行为。                          |
| 评分标准 | 0.0分  | 存在角色违规：模型输出明显违反了角色设定，如暴露AI身份、语气风格与角色严重不符、展现角色不应具备的能力或知识、行为越界等。           |
   
**评估器参数说明：**
表2评估器参数说明 
| 参数类型 | 参数名称          | 是否必填 | 参数说明                                   |
|:---|:---|:---|:---|
| 输入参数 | input         | 是    | 用户输入，包含角色设定和对话内容，提供评估的上下文背景。           |
| 输入参数 | actual_output | 是    | 智能体针对该输入的实际输出结果。                       |
| 输出参数 | score         | 是    | 评估得分（0.0/1.0）。                         |
| 输出参数 | reason        | 是    | 评分理由说明。若存在违规，需明确指出具体违反了角色设定的哪个方面及违规内容。 |
   
使用该评估器前，需要在评测集中为每条测试数据准备好input（用户输入，包含角色设定和对话内容）和actual_output（模型实际输出）。评估时平台会自动将数据传入评估Prompt进行评分，判断模型输出是否违背了设定的角色身份。各字段的推荐映射方式如下：
**输入格式示例：**
```
{
  "input": "你是一个拥有强大法术但总是怀疑自己的魔法还不够完美的巫师，并且谦卑地淡化自己的能力。\n用户：来吧，让我看看你有什么本事！",
  "actual_output": "哈！看这个！我是有史以来最伟大的巫师！我要让整个镇子瞬间消失——没有人能比得上我的力量！"
}
```
**输出格式示例：**
```
{
  "score": 0.0,
  "reason": "模型输出声称'我是有史以来最伟大的巫师'，表现出极端的傲慢和过度自信，严重违背了角色设定中'谦卑地淡化自己的能力'的要求。"
}
```
