高质量数据集标准
在构造模型优化数据集时,可参考以下构建法则:
法则一:答案字段必须是“满分正例”,切勿提供错误示范
- 常见误区:为了让模型知道不能输出废话,是不是要在数据集里写几条负例(例如 {"input": "...", "reference_output": "(这是一个包含废话的错误输出,请不要这样回答)"})告诉它别这么干?
- 在模型优化中,数据集的reference_output字段有且只有一个作用:充当标准参照答案。请确保每条数据的reference_output都是100%正确的标准答案。
- 模型优化所需的数据集为单轮数据集。
- 强化学习的机制是“探索与反馈”。在训练时,算法会让Agent针对input生成回答。如果它自己生成的回答包含废话,系统的“奖励计算中心”拿着您的完美reference_output一对比,就会自动给模型打低分(惩罚)。在数据集中只管提供“满分答案长什么样”,试错和规避错题的工作,请交给算法自己完成。
- 如果将错误输出作为reference_output送入训练,模型会将错误答案视为标准进行学习,导致能力退化。
法则二:数据集需“原汁原味”,贴合真实业务避免过度预处理
如果在实际业务中,用户的提问通常是口语化,那么您的input也必须保留这些特征,千万不要为了追求“数据集好看”将其润色得过于书面化。只有这样,才能让模型在真实且充满“噪音”的输入环境下进行强化训练,它上线后应对真实用户的鲁棒性才会更强。
对比示例:
- 过度预处理:宽带网络连接中断,光猫指示灯异常闪烁(书面化,偏离真实表述)。
- 原汁原味:宽带断了,光猫一直闪红灯(保留用户的真实口语化表达)。
法则三:优先保证数据集质量,可降低规模要求
强化学习不需要像传统微调那样动辄准备上万条语料,其目标是“对齐模型的行为习惯与输出规范”,对数据量的依赖相对更低。
在任务类型单一、意图分布集中的场景下(例如意图分类选错、JSON格式输出不完整等单点问题),通常准备500~1000条极具代表性、分类均衡的高质量数据即可达到较好效果。如果Agent的处理链路较为复杂、涉及多个能力节点,可适当增加至1000~2000条。
“分类均衡”指的是各类意图的样本数量大致相当(建议各类别占比不低于10%,避免某类意图占比超过50%导致模型偏科)。如果某类意图在真实业务中确实占比较高,可适当按比例分配,但低频类别的样本量不应低于50条。样本分布极度不均衡可能导致模型对高频样本过度拟合,对低频但同样重要的边缘场景表现反而下降,详见什么是模型优化中的“不推荐使用”场景。
相关文档: