更新时间:2026-09-17 GMT+08:00
分享

开放式问答场景

开放式问答广泛应用于智能客服、文案撰写、代码审查等场景。模型需要接收用户的自然语言,并输出一段专业、连贯、且符合品牌调性的长篇文本。

典型应用示例:电商客服场景。

  • 用户输入:我上周买的衣服收到就有破损,申请退货三天了还没人处理,到底能不能退?
  • 期望输出:一段既准确解答问题、又安抚用户情绪的专业回复
  • 下游任务:直接作为客服回复发送给用户

此类场景的核心特点是:针对同一问题存在多种正确的回答方式。固定规则的正则表达式无法评判“哪个回答更好”,必须引入“生成式奖励”,由裁判模型根据评分标准对回答质量进行打分。

数据集构造示例

此类场景针对同一问题会有多种正确答案,构造数据集时,只要保证数据集中的答案是高质量的参考范本即可。

表1 数据集构造示例(以电商客服场景为例)

用户输入

期望输出

我上周买的衣服收到就有破损,申请退货三天了还没人处理,到底能不能退?

您好,非常抱歉给您带来不好的购物体验!破损商品我们支持7天无理由退换,我已为您加急处理退货申请,预计1个工作日内完成审核。审核通过后快递员将上门取件,运费由我们承担。

订单显示已签收但我根本没收到货,怎么回事?

很抱歉给您造成困扰!这种情况可能是快递员代签或放置在指定地点了。建议您先检查一下门卫处或快递柜,如果仍未找到,我立即联系快递公司核实配送情况,并在24小时内给您回复。

奖罚机制配置示例

此类场景模型训练中,固定规则的正则表达式无法评判模型输出结果是好是坏,必须引入“生成式奖励”。评分标准示例如下:

你是一个严厉且公正的评估专家。请根据以下核心原则对模型的回答进行评分。

核心原则:正确性是基础,态度和效率是加分项。

  1. 正确性与态度评估 (权重:90%)
     - 1.0 分:信息完全准确,有效安抚用户情绪,态度极佳
     - 0.7-0.9 分:基本正确,但语气平淡或有轻微啰嗦
     - 0.4-0.6 分:信息部分正确,但态度生硬或缺乏同理心
     - 0.0-0.3 分:态度生硬、存在错误或激怒用户

  2. 效率评估 (权重:10%)
     - 加分项 (+0.1):回复直接简洁直击要点
     - 中性项 (0.0):方案有效,但包含一些可以精简的解释
     - 扣分项 (-0.1):回复包含无意义的 AI 寒暄(如"作为一个AI...")

  3. 绝对红线(一票否决情形)
     若出现以下任何一种情况,不管其他部分写得多好,直接记为 0 分:
     - 包含违规承诺或超出权限的业务承诺
     - 泄露隐私或公司机密信息
     - 编造虚假政策或不存在的服务
     - 严重的事实错误

请结合上述规则与上下文,给出一个 0.0 到 1.0 之间的绝对评分,无需输出其他解释。

相关文档