
# 智能精炼功能说明
#### 功能介绍
智能精炼是ModelArts数据工程的核心功能模块，旨在解决大模型训练数据准备过程中的"质量"与"数量"双重挑战。它打破了传统数据处理工具的界限，将基于规则的数据加工（清洗、过滤、去重等）与基于大模型的数据合成（改写、扩充、润色等）深度融合。
通过可视化的编数据算子编排，您可以像搭积木一样，将多个加工算子与合成算子串联成一条自动化流水线。系统将按照预设逻辑，对海量原始数据进行层层筛选与优化，最终输出符合训练要求的高质量数据集。
#### 功能架构
智能精炼以文本、图片、视频类数据集作为输入源，构建由多种数据加工算子及合成算子串联编排的智能精炼任务，输出精炼后数据集。具体功能架构参见[图1]。
图1智能精炼功能架构   
![](https://support.huaweicloud.com/dataprepare-modelarts/figure/zh-cn_image_0000002586422683.png "点击放大")
#### 核心价值
- **流程统一**：加工与合成一体化编排，无需在多个功能模块间切换，减少中间数据流转，一个任务即可完成从原始脏数据到高质量训练集的全过程。
- **质量提升**：通过多级加工算子层层过滤，确保进入合成环节的数据质量可靠。
- **灵活编排**：支持几十种算子自由组合，满足从简单清洗到复杂增强的各类业务场景。
- **规模扩充**：在清洗后的高质量数据基础上进行合成改写，高效扩充训练数据。
- **效率提升**：可视化算子编排，所见即所得，无需编写处理脚本。
- **可复现性**：使用精炼模板精炼数据，精炼模板可保存、可复用，保证数据处理流程的一致性。
 
 #### 使用场景
根据业务需求不同，智能精炼主要应用于以下几种典型场景，每种场景都配备了推荐的算子组合。您可以根据自己的需求选择不同场景。
- 仅对文本类数据集格式做转换，请选择[场景一：数据集格式转换]。
- 数据质量差，需要清洗，请选择[场景二：原始语料清洗与质量提升]。
- 数据量不足，需要扩充，请选择[场景三：训练数据扩充与增强]。
- 准备SFT微调数据，请选择[场景四：指令微调数据准备]。
- 处理图像/视频数据，请选择[场景五：多模态数据统一处理]。
- 数据合规性要求，请选择[场景六：数据合规与安全处理]。
 
 #### 场景一：数据集格式转换
**场景描述**
ModelArts平台支持多种数据集格式，需要将数据从一种格式转成另外格式的数据集，不做额外的数据处理。
**推荐算子编排顺序**
```
开始节点 → 结束节点
```
**预期效果**
实现输入数据转为不同格式（标准格式/Alpaca格式/ShareGPT格式）的输出数据。
 #### 场景二：原始语料清洗与质量提升
**场景描述**
企业从互联网爬取、内部系统导出或第三方采购的原始数据，通常存在大量噪声，需要系统性清洗以满足模型训练要求。常见语料问题参见下表。
表1典型数据问题 
| 数据问题        | 表现形式              | 对模型的影响              |
|:---|:---|:---|
| 数据中存在重复信息。  | 数据中存在大量相同或相似内容。   | 导致训练的模型过拟合。         |
| 数据中存在乱码噪声。  | 数据中存在编码错误、异常字符。   | 污染模型语义理解。           |
| 数据中有敏感违规信息。 | 数据中存在涉政/涉黄/暴力内容。  | 模型输出合规风险。           |
| 数据质量低下。     | 语句不通、逻辑混乱，句子不完整。  | 降低模型生成质量。           |
| 数据长度不满足要求。  | 数据过短无意义或过长冗余。     | 训练效率低下。             |
| 数据大杂烩，未分类   | 各领域的数据杂糅，没有按领域分类。 | 需要专门对领域数据分类，影响训练效率。 |
   
**推荐算子编排顺序**
```
原始语料 → [符号标准化] → [去重算子] → [敏感词过滤] → [文本长度过滤] → [段落结尾不完整句子移除] → [色情文本检测] → [涉政文本检测]→ [辱骂文本检测算子] → [预训练文本分类] → 清洗后数据
```
**预期效果**
- 数据重复率降低90%以上。
- 低质量样本有效去除。
- 敏感违规内容100%过滤。
- 输出数据可直接用于训练或进入下一步合成环节。
- 输出数据能够按照不同领域分类。
 
 #### 场景三：训练数据扩充与增强
高质量标注数据获取成本高，现有数据量不足以训练出效果良好的模型。
**适用情况**
- 垂直领域数据稀缺。
- 标注成本过高。
- 需要快速扩充数据规模。
- 数据多样性不足。
**推荐算子编排顺序**
```
原始数据 → 数据清洗 → 数据生成 → 扩充后数据
```
表2使用算子 
| 算子   | 作用       | 配置建议               |
|:---|:---|:---|
| 数据清洗 | 确保种子数据质量 | 严格筛选标准             |
| 数据生成 | 生成多样化表达  | 选择合适的改写策略，生成多样化数据。 |
   
**预期效果**
- 保持语义一致性。
- 提升表达多样性。
 
 #### 场景四：指令微调数据准备
准备用于大模型指令微调（SFT）的高质量数据集。
**适用情况**
- 通用助手模型微调。
- 垂直领域模型定制。
- 对话能力优化。
- 任务型模型训练。
**推荐算子编排流程**
```
原始指令数据 → 数据清洗 → 文本生成（可选） → 生成数据集
```
表3数据格式处理 
| 输入格式       | 处理方式    | 输出格式            |
|:---|:---|:---|
| 非结构化文本     | 格式转换算子  | Alpaca/ShareGPT |
| 已有Alpaca   | 质量筛选+改写 | 优化后Alpaca       |
| 已有ShareGPT | 质量筛选+改写 | 优化后ShareGPT     |
   
**质量控制要点**
- 指令明确性检查
- 回答准确性验证
- 格式一致性确保
 
 #### 场景五：多模态数据统一处理
处理包含图像、视频等多种模态的数据集。
**适用情况**
视频理解数据整理
**推荐算子编排流程（以图像为例）**
```
图像数据集 → 图片去重 → 图片提取 → 图片元数据过滤 → 图像检测 → 处理后数据
```
表4各模态处理要点 
| 模态     | 关键处理      | 注意事项   |
|:---|:---|:---|
| **图像** | 尺寸、格式、质量  | 分辨率统一  |
| **视频** | 帧率、分辨率、片段 | 视频编码统一 |
   
**重要约束**
每种模态需单独创建处理任务。
 #### 场景六：数据合规与安全处理
确保训练数据符合法规要求和企业安全策略。
**适用情况**：
- 个人信息保护（GDPR/个保法）。
- 敏感内容过滤。
**推荐算子编排流程**
```
原始数据 → 敏感词过滤 → 合规数据
```
**使用算子**：
| 算子    | 作用          | 合规要求      |
|:---|:---|:---|
| 敏感词过滤 | 过滤个人信息敏感内容。 | 符合个人隐私要求。 |
   
