# 开放式问答场景
开放式问答广泛应用于智能客服、文案撰写、代码审查等场景。模型需要接收用户的自然语言，并输出一段专业、连贯、且符合品牌调性的长篇文本。
典型应用示例：电商客服场景。
- 用户输入：我上周买的衣服收到就有破损，申请退货三天了还没人处理，到底能不能退？
- 期望输出：一段既准确解答问题、又安抚用户情绪的专业回复
- 下游任务：直接作为客服回复发送给用户
此类场景的核心特点是：针对同一问题存在多种正确的回答方式。固定规则的正则表达式无法评判"哪个回答更好"，必须引入"生成式奖励"，由裁判模型根据评分标准对回答质量进行打分。
#### 数据集构造示例
此类场景针对同一问题会有多种正确答案，构造数据集时，只要保证数据集中的答案是高质量的参考范本即可。
表1数据集构造示例（以电商客服场景为例） 
| 用户输入                               | 期望输出                                                                                 |
|:---|:---|
| 我上周买的衣服收到就有破损，申请退货三天了还没人处理，到底能不能退？ | 您好，非常抱歉给您带来不好的购物体验！破损商品我们支持7天无理由退换，我已为您加急处理退货申请，预计1个工作日内完成审核。审核通过后快递员将上门取件，运费由我们承担。 |
| 订单显示已签收但我根本没收到货，怎么回事？            | 很抱歉给您造成困扰！这种情况可能是快递员代签或放置在指定地点了。建议您先检查一下门卫处或快递柜，如果仍未找到，我立即联系快递公司核实配送情况，并在24小时内给您回复。 |
   
#### 奖罚机制配置示例
此类场景模型训练中，固定规则的正则表达式无法评判模型输出结果是好是坏，必须引入"生成式奖励"。评分标准示例如下：
```
你是一个严厉且公正的评估专家。请根据以下核心原则对模型的回答进行评分。
核心原则：正确性是基础，态度和效率是加分项。
  1. 正确性与态度评估 (权重：90%)
     - 1.0 分：信息完全准确，有效安抚用户情绪，态度极佳
     - 0.7-0.9 分：基本正确，但语气平淡或有轻微啰嗦
     - 0.4-0.6 分：信息部分正确，但态度生硬或缺乏同理心
     - 0.0-0.3 分：态度生硬、存在错误或激怒用户
  2. 效率评估 (权重：10%)
     - 加分项 (+0.1)：回复直接简洁直击要点
     - 中性项 (0.0)：方案有效，但包含一些可以精简的解释
     - 扣分项 (-0.1)：回复包含无意义的 AI 寒暄（如"作为一个AI..."）
  3. 绝对红线（一票否决情形）
     若出现以下任何一种情况，不管其他部分写得多好，直接记为 0 分：
     - 包含违规承诺或超出权限的业务承诺
     - 泄露隐私或公司机密信息
     - 编造虚假政策或不存在的服务
     - 严重的事实错误
请结合上述规则与上下文，给出一个 0.0 到 1.0 之间的绝对评分，无需输出其他解释。
```
