创建任务
Octopus平台提供对评测任务的管理,包括创建、删除、停止评测任务的操作。在评测任务页面, 实时显示多条评测任务的状态、任务创建时间等信息。评测任务创建完毕后,触发任务。评测任务结束后会生成评测任务结果文件,详细展示模型的各项评测指标得分。
创建评测任务
评测任务与评测参数和数据集有关。具体步骤如下:
- 在左侧菜单栏中单击“训练服务 > 模型评测”。
- 选择“评测任务”页签,单击“新建评测任务”,填写基本信息。 图1 新建评测任务

- 名称:任务组名称,包含中英文、数字、“_”“-”,不得超过64个字符。
- 描述:简要描述任务,不包含“@^\#$%&*<>'|"/”,不得超过256个字符。
- 选择模型与数据集。 图2 选择模型与数据集

- 选择模型:指定模型仓库和模型版本作为评测的目标。如需要将模型版本关联的算法对象的文件也挂载到容器中,可在算法的下拉列表中指定算法。系统默认选中模型版本关联的训练算法(源训练任务使用的算法或手动创建模型版本时关联的训练算法),用户也可手动更改选择其他算法。选择该项后,会补充注入值为算法挂载路径的环境变量${ALGORITHM}至容器中,并在“推理/评测启动指令”文本框占位符提示相关信息。
- 选择数据集:用户选择评测数据集。支持普通数据集和数据缓存。
- 选择自定义评测或内置指标评测。 图3 选择内置评测(上)或自定义评测(下)


- 类别:可选择“内置”或“自定义”,选择相对应的类别。
- 选择“内置”,支持“分类”、“2D目标检测”、“3D目标检测”、“2D目标追踪”、“3D目标追踪”“2D语义分割”、“3D语义分割”、“车道线检测”八个类别。
- 选择“自定义”,则不允许选择内置评测项,仅可使用用户自定义评测。
- 自定义评测:
评测脚本:可选,如果用户有其他自定义评测脚本,可勾选该项将选择的脚本路径挂载至容器内部,用户可使用${SCRIPT}进行引用。
评测启动指令:用户指定自定义评测的启动命令,根据用户选择注入以下环境变量:
表1 环境变量 类型
启动命令
默认值
模型
${MODEL}
/tmp/data/model
算法
${ALGORITHM}
/tmp/data/algorithm
数据集
${DATASET}
/tmp/data/dataset/dataset-0
自定义评测脚本
${SCRIPT}
/tmp/data/script
评测结果路径
${EVAL_RESULT}
/tmp/result/eval
示例评测启动指令:
python ${SCRIPT}/eval.py --image ${DATASET} --output ${EVAL_RESULT} --model ${MODEL}/best.pt - 内置指标评测:
内置评测任务分为两个主要阶段:
第一阶段:使用用户指定的模型、评测数据集和推理启动指令,使用模型关联的镜像在集群中以指定的资源规格启动推理作业,生成推理结果,供平台内置的评测算子使用。
第二阶段:使用第一阶段生成的推理结果和评测数据集,使用平台内置的模型评测算子进行评测,输出评测结果、报告和坏例数据集(按需)。
评测指标项:根据用户选择的模型类别,平台动态生成支持的内置指标项。用户单击选中对应的指标项,将其加入到待评测指标中。最终的评测结果将在报告中体现。
推理启动命令:用户可以指定模型版本或模型仓库关联的自定义镜像中的脚本,以启动推理作业。
示例推理启动指令:
python ${MODEL}/detect.py --image ${DATASET} --output ${INFER_RESULT} --model ${MODEL}/best.pt支持的环境变量如下:
表2 环境变量 类型
启动命令
默认值
模型
${MODEL}
/tmp/data/model
算法
${ALGORITHM}
/tmp/data/algorithm
数据集
${DATASET}
/tmp/data/dataset/dataset-0
推理结果路径
${INFER_RESULT}
/tmp/result/infer
评测参数项:
根据用户选择的模型类别,动态生成评测所需的参数项,用户可参考前端提示填写。
- 所有的模型类别都需要指定正确的标注文件格式和推理文件格式,分别对应输入评测数据集的格式和用户生成的推理结果的格式。
- 部分模型类别支持“类别”参数,指的是标注物对象的类别,若有多个需要以“,”分隔,最多支持15个对象类别,每个对象类别的名称不能超过32个字符。e.g.: car,truck,cycle,motorbike
- 若指定“类别”与评测数据集中的实际对象类别没有重合,评测任务将会失败。
坏例判别:
若在创建评测任务时勾选了“创建内置BadCase判别”,则会在评测任务结束后,生成坏例数据结果的可视化。
只需要将推理结果按照模型数据集支持中说明的各类型数据集对应的推理结果的目录结构和文件格式输出即可。
目前仅内置评测任务的“2D目标检测”和“3D目标检测”支持坏例判别。
- 类别:可选择“内置”或“自定义”,选择相对应的类别。
- 选择资源规格和任务优先级。

- 资源规格:当前项目中可用的资源规格,资源规格需要平台管理员在纳管模型评测用途的任务作业集群后创建。
- 优先级:设定任务的优先级,数值取[-50,50]的整数,数字越大,优先级越高。
- 单击“创建”,在评测任务页面显示新创建的任务信息。