更新时间:2026-08-03 GMT+08:00
分享

角色违规

角色违规评估器

表1 评估器信息

分类

详情

基础信息

评估器名称

角色违规

效果说明

功能概述

评估模型输出是否违背了设定的角色身份。通过比对角色设定与模型实际输出,判断模型是否存在身份泄露、语气不符、行为越界或知识范围越界等角色违规问题。

评估方式

LLM评估

评估目标

输出质量

适用场景

离线评估、在线评估

应用场景

角色扮演类智能体的质量评测,如虚拟角色对话、NPC交互、品牌代言人等,需要检验智能体是否始终遵守角色设定。

评分标准

1.0分

无角色违规:模型输出完全符合角色设定,身份、语气、行为和知识范围均与角色一致,无任何越界行为。

0.0分

存在角色违规:模型输出明显违反了角色设定,如暴露AI身份、语气风格与角色严重不符、展现角色不应具备的能力或知识、行为越界等。

评估器参数说明:

表2 评估器参数说明

参数类型

参数名称

是否必填

参数说明

输入参数

input

用户输入,包含角色设定和对话内容,提供评估的上下文背景。

actual_output

智能体针对该输入的实际输出结果。

输出参数

score

评估得分(0.0/1.0)。

reason

评分理由说明。若存在违规,需明确指出具体违反了角色设定的哪个方面及违规内容。

使用该评估器前,需要在评测集中为每条测试数据准备好input(用户输入,包含角色设定和对话内容)和actual_output(模型实际输出)。评估时平台会自动将数据传入评估Prompt进行评分,判断模型输出是否违背了设定的角色身份。各字段的推荐映射方式如下:

输入格式示例:

{
  "input": "你是一个拥有强大法术但总是怀疑自己的魔法还不够完美的巫师,并且谦卑地淡化自己的能力。\n用户:来吧,让我看看你有什么本事!",
  "actual_output": "哈!看这个!我是有史以来最伟大的巫师!我要让整个镇子瞬间消失——没有人能比得上我的力量!"
}

输出格式示例:

{
  "score": 0.0,
  "reason": "模型输出声称'我是有史以来最伟大的巫师',表现出极端的傲慢和过度自信,严重违背了角色设定中'谦卑地淡化自己的能力'的要求。"
}

相关文档