更新时间:2026-09-18 GMT+08:00

智能精炼功能说明

功能介绍

智能精炼是ModelArts数据工程的核心功能模块,旨在解决大模型训练数据准备过程中的“质量”与“数量”双重挑战。它打破了传统数据处理工具的界限,将基于规则的数据加工(清洗、过滤、去重等)与基于大模型的数据合成(改写、扩充、润色等)深度融合。

通过可视化的编数据算子编排,您可以像搭积木一样,将多个加工算子与合成算子串联成一条自动化流水线。系统将按照预设逻辑,对海量原始数据进行层层筛选与优化,最终输出符合训练要求的高质量数据集。

功能架构

智能精炼以文本、图片、视频类数据集作为输入源,构建由多种数据加工算子及合成算子串联编排的智能精炼任务,输出精炼后数据集。具体功能架构参见图1

图1 智能精炼功能架构

核心价值

  • 流程统一:加工与合成一体化编排,无需在多个功能模块间切换,减少中间数据流转,一个任务即可完成从原始脏数据到高质量训练集的全过程。
  • 质量提升:通过多级加工算子层层过滤,确保进入合成环节的数据质量可靠。
  • 灵活编排:支持几十种算子自由组合,满足从简单清洗到复杂增强的各类业务场景。
  • 规模扩充:在清洗后的高质量数据基础上进行合成改写,高效扩充训练数据。
  • 效率提升:可视化算子编排,所见即所得,无需编写处理脚本。
  • 可复现性:使用精炼模板精炼数据,精炼模板可保存、可复用,保证数据处理流程的一致性。

使用场景

根据业务需求不同,智能精炼主要应用于以下几种典型场景,每种场景都配备了推荐的算子组合。您可以根据自己的需求选择不同场景。

场景一:数据集格式转换

场景描述

ModelArts平台支持多种数据集格式,需要将数据从一种格式转成另外格式的数据集,不做额外的数据处理。

推荐算子编排顺序

开始节点 → 结束节点

预期效果

实现输入数据转为不同格式(标准格式/Alpaca格式/ShareGPT格式)的输出数据。

场景二:原始语料清洗与质量提升

场景描述

企业从互联网爬取、内部系统导出或第三方采购的原始数据,通常存在大量噪声,需要系统性清洗以满足模型训练要求。常见语料问题参见下表。

表1 典型数据问题

数据问题

表现形式

对模型的影响

数据中存在重复信息。

数据中存在大量相同或相似内容。

导致训练的模型过拟合。

数据中存在乱码噪声。

数据中存在编码错误、异常字符。

污染模型语义理解。

数据中有敏感违规信息。

数据中存在涉政/涉黄/暴力内容。

模型输出合规风险。

数据质量低下。

语句不通、逻辑混乱,句子不完整。

降低模型生成质量。

数据长度不满足要求。

数据过短无意义或过长冗余。

训练效率低下。

数据大杂烩,未分类

各领域的数据杂糅,没有按领域分类。

需要专门对领域数据分类,影响训练效率。

推荐算子编排顺序

原始语料 → [符号标准化] → [去重算子] → [敏感词过滤] → [文本长度过滤] → [段落结尾不完整句子移除] → [色情文本检测] → [涉政文本检测]→ [辱骂文本检测算子] → [预训练文本分类] → 清洗后数据 

预期效果

  • 数据重复率降低90%以上。
  • 低质量样本有效去除。
  • 敏感违规内容100%过滤。
  • 输出数据可直接用于训练或进入下一步合成环节。
  • 输出数据能够按照不同领域分类。

场景三:训练数据扩充与增强

高质量标注数据获取成本高,现有数据量不足以训练出效果良好的模型。

适用情况

  • 垂直领域数据稀缺。
  • 标注成本过高。
  • 需要快速扩充数据规模。
  • 数据多样性不足。

推荐算子编排顺序

原始数据 → 数据清洗 → 数据生成 → 扩充后数据 
表2 使用算子

算子

作用

配置建议

数据清洗

确保种子数据质量

严格筛选标准

数据生成

生成多样化表达

选择合适的改写策略,生成多样化数据。

预期效果

  • 保持语义一致性。
  • 提升表达多样性。

场景四:指令微调数据准备

准备用于大模型指令微调(SFT)的高质量数据集。

适用情况

  • 通用助手模型微调。
  • 垂直领域模型定制。
  • 对话能力优化。
  • 任务型模型训练。

推荐算子编排流程

原始指令数据 → 数据清洗 → 文本生成(可选) → 生成数据集 
表3 数据格式处理

输入格式

处理方式

输出格式

非结构化文本

格式转换算子

Alpaca/ShareGPT

已有Alpaca

质量筛选+改写

优化后Alpaca

已有ShareGPT

质量筛选+改写

优化后ShareGPT

质量控制要点

  • 指令明确性检查
  • 回答准确性验证
  • 格式一致性确保

场景五:多模态数据统一处理

处理包含图像、视频等多种模态的数据集。

适用情况

视频理解数据整理

推荐算子编排流程(以图像为例)

图像数据集 → 图片去重 → 图片提取 → 图片元数据过滤 → 图像检测 → 处理后数据 
表4 各模态处理要点

模态

关键处理

注意事项

图像

尺寸、格式、质量

分辨率统一

视频

帧率、分辨率、片段

视频编码统一

重要约束

每种模态需单独创建处理任务。

场景六:数据合规与安全处理

确保训练数据符合法规要求和企业安全策略。

适用情况

  • 个人信息保护(GDPR/个保法)。
  • 敏感内容过滤。

推荐算子编排流程

原始数据 → 敏感词过滤 → 合规数据 

使用算子

算子

作用

合规要求

敏感词过滤

过滤个人信息敏感内容。

符合个人隐私要求。