文档首页/ 智果(AgentArts)智能体平台/ 常见问题/ 观测与优化/ 评测集样本数量少、质量不足,如何扩充高质量测试样本
更新时间:2026-09-14 GMT+08:00
分享

评测集样本数量少、质量不足,如何扩充高质量测试样本

问题现象

人工编写评测样本工作量大,样本数量少,业务场景覆盖不足。

问题原因

纯人工构造评测数据集成本高。

解决方案

方案一:AI合成评测集

使用AI合成评测集能力,基于少量种子样本做语义泛化、场景扩展,快速生成业务适配的评测样本。具体操作请参见AI合成评测集。

方案二:Trace数据回流

将线上Trace真实交互数据回流沉淀到评测集,补充真实业务样本,适用于持续优化模型效果。具体操作请参见回流Trace数据至评测集。

相关文档