# 高质量数据集标准
在构造模型优化数据集时，可参考以下构建法则：
**法则一：答案字段必须是"满分正例"，切勿提供错误示范**
- 常见误区：为了让模型知道不能输出废话，是不是要在数据集里写几条负例（例如 {"input": "...", "reference_output": "（这是一个包含废话的错误输出，请不要这样回答）"}）告诉它别这么干？
- 在模型优化中，数据集的reference_output字段有且只有一个作用：充当标准参照答案。请确保每条数据的reference_output都是100%正确的标准答案。
- **模型优化所需的数据集为单轮数据集。**
  ![](https://support.huaweicloud.com/ops-agentarts/public_sys-resources/note_3.0-zh-cn.png)
  - 强化学习的机制是"探索与反馈"。在训练时，算法会让Agent针对input生成回答。如果它自己生成的回答包含废话，系统的"奖励计算中心"拿着您的完美reference_output一对比，就会自动给模型打低分（惩罚）。在数据集中只管提供"满分答案长什么样"，试错和规避错题的工作，请交给算法自己完成。
  
  - 如果将错误输出作为reference_output送入训练，模型会将错误答案视为标准进行学习，导致能力退化。
    
**法则二：数据集需"原汁原味"，贴合真实业务避免过度预处理**
如果在实际业务中，用户的提问通常是口语化，那么您的input也必须保留这些特征，千万不要为了追求"数据集好看"将其润色得过于书面化。只有这样，才能让模型在真实且充满"噪音"的输入环境下进行强化训练，它上线后应对真实用户的鲁棒性才会更强。
对比示例：
- 过度预处理：宽带网络连接中断，光猫指示灯异常闪烁（书面化，偏离真实表述）。
- 原汁原味：宽带断了，光猫一直闪红灯（保留用户的真实口语化表达）。
**法则三：优先保证数据集质量，可降低规模要求**
强化学习不需要像传统微调那样动辄准备上万条语料，其目标是"对齐模型的行为习惯与输出规范"，对数据量的依赖相对更低。
在任务类型单一、意图分布集中的场景下（例如意图分类选错、JSON格式输出不完整等单点问题），通常准备500～1000条极具代表性、分类均衡的高质量数据即可达到较好效果。如果Agent的处理链路较为复杂、涉及多个能力节点，可适当增加至1000～2000条。
![](https://support.huaweicloud.com/ops-agentarts/public_sys-resources/note_3.0-zh-cn.png)
"分类均衡"指的是各类意图的样本数量大致相当（建议各类别占比不低于10%，避免某类意图占比超过50%导致模型偏科）。如果某类意图在真实业务中确实占比较高，可适当按比例分配，但低频类别的样本量不应低于50条。样本分布极度不均衡可能导致模型对高频样本过度拟合，对低频但同样重要的边缘场景表现反而下降，详见[什么是模型优化](https://support.huaweicloud.com/ops-agentarts/agentarts_14_0094.html)中的"不推荐使用"场景。
相关文档：
- [数据集格式](https://support.huaweicloud.com/ops-agentarts/agentarts_14_0100.html)
- [从智能体Trace中回流数据集](https://support.huaweicloud.com/ops-agentarts/agentarts_14_0102.html)
- [手动创建数据集](https://support.huaweicloud.com/ops-agentarts/agentarts_14_0103.html)
 
