
# 基础文本
以多格式原始文档为核心，支持文档内容的深度提取与解析。上传后的基础文本数据可通过平台内置的**数据精炼**功能，转化为预训练数据集或评测集。
#### 约束限制
- 从OBS导入：单个文件/压缩包大小不超过20GB；多个文件场景，文件数量不限制，总文件大小不超过20GB。
- 本地导入：单个文件大小不超过1GB，文件数量最多20个。
 
#### 格式说明
**文件格式**：docx、pdf
**格式说明** ：此类型直接面向原始文档数据，该类型通常无法直接被模型读取训练，在连接后必须经过**数据精炼** 任务将其转化为**预训练文本**格式的数据集才能被下游任务使用。
**文档规范**：为确保下游数据精炼的提取精度与转化质量，上传的原始文档应具备清晰的段落结构与可识别的文本层级，尽量避免使用全图片型或未经过OCR的扫描版PDF文件；文档内部的表格、公式等复杂排版，在精炼阶段会转换为扁平化的文本描述，需注意高密度图表可能带来的语义断层。
图1基础文本示例   
![](https://support.huaweicloud.com/dataprepare-modelarts/figure/zh-cn_image_0000002659777853.png "点击放大")
