
# 创建语文知识库
#### 场景介绍
知识库是一个组织、存储及管理知识的系统，包括文档、图表、表格等多种形式信息的分类、整理和归纳，可以帮助用户高效管理大量信息。平台为用户提供了创建并管理知识库的能力，且创建的知识库可在工作流和Agent中调用。
对于需要处理大量问答知识、对检索效率有较高要求的场景，通过创建知识库组织和管理信息，可以提升信息获取效率。本实践以创建语文知识库为例进行介绍，主要完成以下设置：
- 上传[语文知识库.docx](https://res-static.hc-cdn.cn/cloudbu-site/china/zh-cn/agentarts/语文知识库.docx)文档，对文档进行层级分段切分。切分出来的切片效果如[图1]所示。
  图1切片效果   
  ![](https://support.huaweicloud.com/bestpractice-agentarts/zh-cn_image_0000002687949822.png "点击放大") 
- 对切片内容进行提取，用于向量化检索。
- 对问题做向量化检索，附加返回答案内容。
- 使用语义检索、关键词检索、混合检索等方式检索内容。
 
#### 前提条件
- 已[实名认证](https://support.huaweicloud.com/usermanual-account/account_auth_00001.html)的华为账号或IAM用户。
- 已[开通AgentArts服务](https://support.huaweicloud.com/qs-agentarts/agentarts_04_0000.html)。
 
#### 准备工作
准备需要上传的知识素材，并进行预处理，以便达到更好的拆分效果。
- 本实践使用的语文知识库请参见[语文知识库.docx](https://res-static.hc-cdn.cn/cloudbu-site/china/zh-cn/agentarts/语文知识库.docx)，仅供参考。
- 您也可自行准备知识素材，并参考[表1]的拆分配置规则对素材进行预处理。确保素材样式结构逻辑清晰，以便提升拆分效果。
 
#### 创建知识库
1. 登录[AgentArts智能体平台](https://console.huaweicloud.com/agentarts/#/home/overview)。
2. 在左侧导航栏中选择"开发中心 \> 组件库"，选择"知识库"页签。
3. 在"知识库"页面，单击"创建知识库 \> 创建平台知识库"。
4. 在"创建知识库"弹框中，填写参数配置信息，填写完成后单击"确定"。 
   图2创建语文知识库（以**体验版** 为例）   
   ![](https://support.huaweicloud.com/bestpractice-agentarts/zh-cn_image_0000002687789972.png "点击放大")
    表1创建语文知识库 
   | 参数                     ||| 示例                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                     | 说明                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                           |
   |:---|---|---|:---|:---|
   | 基本信息 | 名称               || 语文知识库                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                  | 用于标识知识库。 由1\~50个字符组成，包含中文、字母、数字、中划线、下划线，且必须以中文、字母、数字开头。                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                 |
   | 基本信息 | 描述（可选）           || 语文知识库                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                  | 用于对知识库内容和用途的简要说明。它提供了关于知识库的详细信息，帮助用户了解知识库的内容和使用场景。 由0\~100个字符组成。                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                           |
   | 基本信息 | 知识库图标            || 默认                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                     | 系统默认知识库图标，可单击![](https://support.huaweicloud.com/bestpractice-agentarts/zh-cn_image_0000002717389585.png)自动生成图标，也可以自定义图标。 1. 鼠标移动至图标上，单击鼠标左键。  2. 上传已准备好的知识库图标。 支持jpg、jpeg、png、gif格式图片，且不大于200KB。                                                                                                                                                                                                                                                             |
   | 解析配置 | 向量模型             || pangu_embedding                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                        | 新建后，不支持修改。 向量模型是一种将文本、图像等非结构化数据转换为数值向量的模型。例如，在文本处理阶段，用于对文本文档切片后的片段进行向量化表示；在知识检索阶段，根据用户输入的信息对切片进行召回。 向量模型用于在海量的知识库中，快速识别和用户输入信息语义相近的词或句子，进行信息的初步筛选，解决"大海捞针"的效率问题。                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                       |
   | 解析配置 | 精排模型             || pangu_rerank                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                           | 精排模型是一种用于对检索结果进行精细排序的模型。针对用户输入的信息，对向量模型召回的切片进行从高到低的相关度排序，把相关度最高的前几个信息（例如Top 10）呈现给用户。 精排模型用于进一步提升系统搜索的相关性准确度。                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                               |
   | 解析配置 | 文档解析（可选） | OCR增强  | 不勾选                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                    | 开启后，即可调用OCR服务进行智能文档识别，如表格解析或扫描文件等。                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                           |
   | 解析配置 | 文档解析（可选） | 页眉页脚解析 | 不勾选                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                    | - 未开启，解析结果中不包含页眉页脚。  - 开启后，解析结果中包含页眉页脚。                                                                                                                                                                                                                                                                                                                                                                |
   | 解析配置 | 文档解析（可选） | 目录页解析  | 勾选                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                     | 未开启，解析结果中不包含目录页。 开启后，解析结果中包含目录页。                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                             |
   | 解析配置 | 文档解析（可选） | 图片解析   | 勾选，选择"仅保留原图"                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                           | 未开启，则在文档中遇到图片默认跳过，不处理图片。 开启后，根据需要选择"提取图片文本"或者"仅保留原图"。                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                       |
   | 解析配置 | 分段策略（可选）         || 层级分段 根据文档结构和内容进行如下设置： - 层级解析模型：自动解析。  - 标题层级深度：2（文档标题层级深度）。  - 标题保存方式：保存多标题组合。  - 跨标题合并：关闭。  - 分段标识符：默认。  - 分段预计长度：500（分段内容包含题目+答案）。   | 系统默认自动分段。支持如下分段策略，分段介绍及分段策略配置请参考[知识库分段](https://support.huaweicloud.com/lowcode-agentarts/agentarts_05_0158.html)。 - 自动分段：按照系统默认预设的规则和分隔符切分。  - 长度分段：基于内容的长度来决定如何进行分段。  - 层级分段：根据内容的结构层次来进行分段。   |
      
   
   
5. 配置完成后，单击"创建并上传"。 
   - 创建并上传：进入"创建知识库"的"上传文档"页面，为知识库添加文档信息，具体操作请参考[上传文档]。
   
   - 立即创建：页面返回知识库列表。
   
   
   
   
 
 #### 上传文档
1. 进入上传文档页面，"上传方式"选择"知识文档上传"。
2. 单击"点此上传"，在弹出的对话框中，选择要上传的文档。 
   当上传的文档由"上传中"变为"上传成功"，表示文档已成功上传。
   ![](https://support.huaweicloud.com/bestpractice-agentarts/public_sys-resources/note_3.0-zh-cn.png)
   - 支持上传常见的文档格式：
     - 文档/文本类：doc、docx、pdf、ofd、txt、md、wps。
     
     - 表格/数据类：xls、xlsx、csv、et。
     
     - 演示/幻灯片类：ppt、pptx、dps。
     
     - 图片/设计类：jpg、jpeg、png、gif、bmp、webp、tiff、tif、psd、ico、pcx。 AgentArts支持用户根据需求，将图片类的文件直接存储，或是提取图片中的文字信息进行存储。
       
      
   
   - 不同套餐包对文件大小限制不同，具体请参考[知识库使用限制](https://support.huaweicloud.com/lowcode-agentarts/agentarts_05_0149.html)。
    
   
   
3. 单击"完成"。 
   进入知识库详情页面，待文件状态为"成功"，即完成文件解析。
   图3文档解析成功   
   ![](https://support.huaweicloud.com/bestpractice-agentarts/zh-cn_image_0000002717549467.png "点击放大")
   
   
 
#### 查看文档切片
进入知识库详情页面，查看文档切片，如[图4]所示。
"文件内容"区域说明：
- 左侧：知识库文档的类别及上传的文档列表。
- 中间：知识文档的切片信息。
- 右侧：文档详情。
 
图4切片信息   
![](https://support.huaweicloud.com/bestpractice-agentarts/zh-cn_image_0000002687949824.png "点击放大")
#### 命中测试
1. 返回知识库列表，单击语文知识库操作列的"命中测试"。
2. 在页面左侧文本框中输入问题，并单击"命中测试"。 
   命中结果可根据右上方的分值查看结果，分值越高，命中结果越精确。
   图5命中测试   
   ![](https://support.huaweicloud.com/bestpractice-agentarts/zh-cn_image_0000002687949828.png "点击放大")
   
   
3. 在页面右侧将根据不同的检索方式（语义检索、关键词检索、混合检索、FAQ检索），展示多条匹配的内容，并按照匹配分值降序排列。
4. 用户可以根据分值与匹配到的信息数量来评估当前知识库是否满足需求。 
   如果满足需求，则知识库接入完成，您可以在智能体或工作流中使用该知识库。
   
   
 
#### 相关文档
配置本地知识库的详细信息，请参考[创建本地知识库](https://support.huaweicloud.com/lowcode-agentarts/agentarts_05_0150.html)。
