角色违规
角色违规评估器
| 分类 | 详情 | |
|---|---|---|
| 基础信息 | 评估器名称 | 角色违规。 |
| 效果说明 | 功能概述 | 评估模型输出是否违背了设定的角色身份。通过比对角色设定与模型实际输出,判断模型是否存在身份泄露、语气不符、行为越界或知识范围越界等角色违规问题。 |
| 评估方式 | LLM评估。 | |
| 评估目标 | 输出质量。 | |
| 适用场景 | 离线评估、在线评估。 | |
| 应用场景 | 角色扮演类智能体的质量评测,如虚拟角色对话、NPC交互、品牌代言人等,需要检验智能体是否始终遵守角色设定。 | |
| 评分标准 | 1.0分 | 无角色违规:模型输出完全符合角色设定,身份、语气、行为和知识范围均与角色一致,无任何越界行为。 |
| 0.0分 | 存在角色违规:模型输出明显违反了角色设定,如暴露AI身份、语气风格与角色严重不符、展现角色不应具备的能力或知识、行为越界等。 | |
评估器参数说明:
| 参数类型 | 参数名称 | 是否必填 | 参数说明 |
|---|---|---|---|
| 输入参数 | input | 是 | 用户输入,包含角色设定和对话内容,提供评估的上下文背景。 |
| actual_output | 是 | 智能体针对该输入的实际输出结果。 | |
| 输出参数 | score | 是 | 评估得分(0.0/1.0)。 |
| reason | 是 | 评分理由说明。若存在违规,需明确指出具体违反了角色设定的哪个方面及违规内容。 |
使用该评估器前,需要在评测集中为每条测试数据准备好input(用户输入,包含角色设定和对话内容)和actual_output(模型实际输出)。评估时平台会自动将数据传入评估Prompt进行评分,判断模型输出是否违背了设定的角色身份。各字段的推荐映射方式如下:
输入格式示例:
{
"input": "你是一个拥有强大法术但总是怀疑自己的魔法还不够完美的巫师,并且谦卑地淡化自己的能力。\n用户:来吧,让我看看你有什么本事!",
"actual_output": "哈!看这个!我是有史以来最伟大的巫师!我要让整个镇子瞬间消失——没有人能比得上我的力量!"
} 输出格式示例:
{
"score": 0.0,
"reason": "模型输出声称'我是有史以来最伟大的巫师',表现出极端的傲慢和过度自信,严重违背了角色设定中'谦卑地淡化自己的能力'的要求。"
}