
# 创建评测集合成任务 - CreateOpsSynthesisTask
#### 功能介绍
该接口用于利用大模型能力发起异步的数据合成任务，通过种子数据泛化（Seed-based Generalization）等手段自动生成高质量、多样化的训练或评测样本。
适用场景：
- 数据样本扩充：在现有数据量不足时，基于少量种子数据生成大规模同分布的模拟数据，提升模型训练效果。
  
- 边界场景覆盖：通过 AI 模拟生成罕见或特定领域的对话记录，增强评测集对极端情况（Edge Cases）的覆盖度。
  
 
#### 调用方法
请参见[如何调用API](https://support.huaweicloud.com/api-agentarts/agentarts_07_0003.html)。
#### 授权信息
账号根用户具备所有API的调用权限，如果使用账号下的IAM用户调用当前API，该IAM用户需具备如下身份策略权限，更多的权限说明请参见[权限和授权项](https://support.huaweicloud.com/api-agentarts/Permission.html)。
| 授权项                                      | 访问级别  | 资源类型（\*为必须） | 条件键                       | 别名 | 依赖的授权项 |
|:---|:---|:---|:---|:---|:---|
| agentarts:dataset:createOpsSynthesisTask | Write | dataset \*  | g:ResourceTag/\<tag-key\> | -  | -      |
   
#### URI
POST /v1/ops/datasets-synthesis
#### 请求参数
表1请求Body参数 
| 参数                   | 是否必选 | 参数类型                                                                                                           | 描述                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                          |
|:---|:---|:---|:---|
| name                 | 是    | String                                                                                                         | **参数解释：** 数据合成任务的显示名称，用于在任务列表中进行识别与检索。 **约束限制：** 不涉及。 **取值范围：** 可由中文、英文字母、数字、下划线及连字符组成，长度为2\~100个字符。 **默认取值：** 不涉及。                                                                                                                                                                                                                                                                                                                                                   |
| scenario_type        | 是    | String                                                                                                         | **参数解释：** 指定数据合成的具体逻辑场景。 **约束限制：** 不涉及。 **取值范围：** 长度为1\~100个字符，枚举值： - seed_data：基于种子数据生成    **默认取值：** 不涉及。                                                                                                                                                                  |
| scenario_description | 否    | String                                                                                                         | **参数解释：** 对合成任务背景的详细描述，辅助模型更好地理解合成目标。 **约束限制：** 不涉及。 **取值范围：** 可由任意字符组成，长度为1\~4000个字符。 **默认取值：** 不涉及。                                                                                                                                                                                                                                                                                                                                                                 |
| status               | 否    | String                                                                                                         | **参数解释：** 任务创建后的初始执行状态。 **约束限制：** 不涉及。 **取值范围：** 长度为1\~100个字符，枚举值： - pending：仅保存草稿   - running：立即启动运行    **默认取值：** pending。 |
| model_config         | 否    | [OpsEvaluationModelConfig] object                   | **参数解释：** 执行合成任务所调用的底层大模型配置信息，参考OpsEvaluationModelConfig定义。 **约束限制：** 不涉及。 **取值范围：** 不涉及。 **默认取值：** 不涉及。                                                                                                                                                                                                                                                                                                                                                              |
| seed_data            | 否    | [OpsEvaluationSeedDataCreateConfig] object | **参数解释：** 作为合成基础的源数据配置，参考OpsEvaluationSeedDataCreateConfig定义。 **约束限制：** 当 scenario_type 为 seed_data 时必填。 **取值范围：** 不涉及。 **默认取值：** 不涉及。                                                                                                                                                                                                                                                                                                                                |
| schemas              | 是    | Array of [OpsEvaluationSynthesisSchema] objects | **参数解释：** 定义合成数据输出的字段结构与约束。数组元素为OpsEvaluationSynthesisSchema对象，用于指定每个输出字段的名称、描述及合成要求。 **约束限制：** 不涉及。 **取值范围：** 不涉及。 **默认取值：** 不涉及。                                                                                                                                                                                                                                                                                                                                    |
| sample_count         | 是    | Integer                                                                                                        | **参数解释：** 期望通过本次合成任务产出的目标样本总数，单位：个。 **约束限制：** 不涉及。 **取值范围：** 1\~500。 **默认取值：** 不涉及。                                                                                                                                                                                                                                                                                                                                                                                   |
   
 表2OpsEvaluationModelConfig 
| 参数                | 是否必选 | 参数类型    | 描述                                                                                                                                                                                                                                                                                                                                                                                                              |
|:---|:---|:---|:---|
| model_id          | 否    | String  | **参数解释：** 模型的唯一标识符。可通过调用获取模型列表接口获取。 **约束限制：** 不涉及。 **取值范围：** 不涉及。 **默认取值：** 不涉及。                          |
| model_name        | 否    | String  | **参数解释：** 模型的显示名称。 **约束限制：** 不涉及。 **取值范围：** 不涉及。 **默认取值：** 不涉及。                                           |
| temperature       | 否    | Float   | **参数解释：** 采样温度参数，用于控制输出的随机性。数值低更聚焦，数值高更具创造性。 **约束限制：** 不涉及。 **取值范围：** 0.0\~2.0。 **默认取值：** 0.7。            |
| max_tokens        | 否    | Integer | **参数解释：** 单次推理生成的最大Token数量限制，单位：个。 **约束限制：** 不涉及。 **取值范围：** 1\~32000。 **默认取值：** 不涉及。                      |
| top_p             | 否    | Float   | **参数解释：** 核采样参数，用于控制生成时考虑的概率分布范围，值越小生成内容越确定，值越大生成内容越多样。 **约束限制：** 不涉及。 **取值范围：** 0.0\~1.0。 **默认取值：** 1.0。 |
| frequency_penalty | 否    | Float   | **参数解释：** 频率惩罚系数，降低内容重复倾向。 **约束限制：** 不涉及。 **取值范围：** -2.0\~2.0。 **默认取值：** 0.0。                             |
   
 表3OpsEvaluationSeedDataCreateConfig 
| 参数                 | 是否必选 | 参数类型   | 描述                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                  |
|:---|:---|:---|:---|
| type               | 否    | String | **参数解释：** 指定种子数据的来源类型。 **约束限制：** 不涉及。 **取值范围：** 长度为1\~100个字符，枚举值： - dataset：平台评测集   - file：本地上传文件    **默认取值：** 不涉及。 |
| dataset_id         | 否    | String | **参数解释：** 种子评测集的唯一标识符，通过数据集列表接口获取。 **约束限制：** 当type为dataset时必填。 **取值范围：** 可由英文字母、数字及连字符组成，长度为0\~64个字符，需为已存在的评测集ID。 **默认取值：** 不涉及。                                                                                                                                                                                                                                                                                                                              |
| dataset_version_id | 否    | String | **参数解释：** 指定种子评测集的具体版本标识。 **约束限制：** 不涉及。 **取值范围：** 可由英文字母、数字及连字符组成，长度为0\~64个字符，需为已发布或草稿版本的ID。 **默认取值：** 指向草稿版本。                                                                                                                                                                                                                                                                                                                                               |
   
 表4OpsEvaluationSynthesisSchema 
| 参数                    | 是否必选 | 参数类型   | 描述                                                                                                                                                                                                                                                                                                                                                                                                              |
|:---|:---|:---|:---|
| name                  | 是    | String | **参数解释：** 合成字段的名称。 **约束限制：** 不涉及。 **取值范围：** 长度1-100字符，由字母、数字、下划线组成。 **默认取值：** 不涉及。                        |
| description           | 否    | String | **参数解释：** 合成字段的业务含义描述。 **约束限制：** 不涉及。 **取值范围：** 可由任意字符组成，长度为0\~400个字符。 **默认取值：** 不涉及。                     |
| synthesis_requirement | 否    | String | **参数解释：** 合成要求，详细的指令说明，用于指导LLM生成该字段的思考路径。 **约束限制：** 不涉及。 **取值范围：** 可由任意字符组成，长度为0\~4000个字符。 **默认取值：** 不涉及。 |
   
#### 响应参数
**状态码：200**
表5响应Body参数 
| 参数 | 参数类型   | 描述                                                                                                                                                                     |
|:---|:---|:---|
| id | String | **参数解释：** 系统生成的合成任务唯一标识符。 **取值范围：** 不涉及。 |
   
#### 请求示例
任务创建
```
POST https://api.example.com/v1/ops/datasets-synthesis
{
  "name" : "从现有数据演化生成技术面试题",
  "scenario_type" : "seed_data",
  "scenario_description" : "基于现有100条React问答，生成50条更复杂的面试题",
  "status" : "pending",
  "model_config" : {
    "model_id" : "1749615103",
    "model_name" : "豆包·1.6·自动深度思考",
    "temperature" : 0.1,
    "max_tokens" : 4096,
    "top_p" : 0.7,
    "frequency_penalty" : 0
  },
  "seed_data" : {
    "type" : "dataset",
    "dataset_id" : "c3c2571d-a8b0-4447-8b79-a67cac076768",
    "dataset_version_id" : "c3c2571d-a8b0-4447-8b79-a67cac076768"
  },
  "schemas" : [ {
    "name" : "input",
    "description" : "作为输入投递给评测对象",
    "synthesis_requirement" : "生成技术深度适中、具有实践意义的React问题，考虑候选人2-3年经验水平"
  } ],
  "sample_count" : 50
}
```
#### 响应示例
**状态码：200**
任务创建成功
```
{
  "id" : "task_uuid"
}
```
#### 状态码
| 状态码 | 描述     |
|:---|:---|
| 200 | 任务创建成功 |
   
#### 错误码
请参见[错误码](https://support.huaweicloud.com/api-agentarts/ErrorCode.html)。
