更新时间:2026-08-13 GMT+08:00
基础文本
以多格式原始文档为核心,支持文档内容的深度提取与解析。上传后的基础文本数据可通过平台内置的数据精炼功能,转化为预训练数据集或评测集。
约束限制
- 从OBS导入:单个文件/压缩包大小不超过20GB;多个文件场景,文件数量不限制,总文件大小不超过20GB。
- 本地导入:单个文件大小不超过1GB,文件数量最多20个。
格式说明
文件格式:docx、pdf
格式说明:此类型直接面向原始文档数据,该类型通常无法直接被模型读取训练,在连接后必须经过数据精炼任务将其转化为预训练文本格式的数据集才能被下游任务使用。
文档规范:为确保下游数据精炼的提取精度与转化质量,上传的原始文档应具备清晰的段落结构与可识别的文本层级,尽量避免使用全图片型或未经过OCR的扫描版PDF文件;文档内部的表格、公式等复杂排版,在精炼阶段会转换为扁平化的文本描述,需注意高密度图表可能带来的语义断层。
图1 基础文本示例
父主题: 文本类数据集格式要求