创建语文知识库
场景介绍
知识库是一个组织、存储及管理知识的系统,包括文档、图表、表格等多种形式的信息的分类、整理和归纳,可以帮助用户组织和管理大量的信息,平台为用户提供了创建并管理知识库的能力,且创建的知识库可在工作流和Agent中调用。
对于需要处理大量问答知识、对检索效率有较高要求的场景,通过创建知识库组织和管理信息,可以提升信息获取效率。本实践以创建语文知识库为例进行介绍,主要完成以下设置:
前提条件
- 已实名认证的华为账号或IAM用户。
- 已开通AgentArts服务。
准备工作
准备需要上传的知识素材,并进行预处理,以便达到更好的拆分效果。
创建知识库
- 登录AgentArts智能体平台。
- 在左侧导航栏中选择“开发中心 > 组件库”,选择“知识库”页签。
- 在“知识库”页面,单击“创建知识库 > 创建平台知识库”。
- 在“创建知识库”弹框中,填写参数配置信息,填写完成后单击“确定”。 图2 创建语文知识库(以AgentArts基础版为例)
表1 创建语文知识库 参数
示例
说明
基本信息
名称
语文知识库
用于标识知识库。
由1~50个字符组成,包含中文、字母、数字、中划线、下划线,且必须以中文、字母、数字开头。
描述(可选)
语文知识库
用于对知识库内容和用途的简要说明。它提供了关于知识库的详细信息,帮助用户了解知识库的内容和使用场景。
由0~100个字符组成。
知识库图标
默认
系统默认知识库图标,可单击
自动生成图标,也可以自定义图标。解析配置
向量模型
pangu_embedding
新建后,不支持修改。
向量模型是一种将文本、图像等非结构化数据转换为数值向量的模型。例如,在文本处理阶段,用于对文本文档切片后的片段进行向量化表示;在知识检索阶段,根据用户输入的信息对切片进行召回。
向量模型用于在海量的知识库中,快速识别和用户输入信息语义相近的词或句子,进行信息的初步筛选,解决“大海捞针”的效率问题。
AgentArts基础版预置向量模型:pangu_embedding。
精排模型
pangu_rerank
精排模型是一种用于对检索结果进行精细排序的模型。针对用户输入的信息,对向量模型召回的切片进行从高到低的相关度排序,把相关度最高的前几个信息(例如Top 10)呈现给用户。
精排模型用于进一步提升系统搜索的相关性准确度。
AgentArts基础版预置精排模型:pangu_rerank。
说明:AgentArts基础版用户在创建知识库后,无法修改精排模型的配置。
文档解析(可选)
OCR增强
不勾选
开启后,即可调用OCR服务进行智能文档识别,如表格解析或扫描文件等。
页眉页脚解析
不勾选
- 未开启,解析结果中不包含页眉页脚。
- 开启后,解析结果中包含页眉页脚。
目录页解析
勾选
未开启,解析结果中不包含目录页。
开启后,解析结果中包含目录页。
图片解析
勾选,选择“仅保留原图”
不开启,则在文档中遇到图片默认跳过,不处理图片。
开启后,根据需要选择“提取图片文本”或者“仅保留原图”。
分段策略(可选)
层级分段
根据文档结构和内容进行如下设置:
- 层级解析模型:自动解析。
- 标题层级深度:2(文档标题层级深度)。
- 标题保存方式:保存多标题组合。
- 跨标题合并:关闭。
- 分段标识符:默认。
- 分段预计长度:500(分段内容包含题目+答案)。
系统默认自动分段。支持如下分段策略,分段介绍及分段策略配置请参考知识库分段。
- 自动分段:按照系统默认预设的规则和分隔符切分。
- 长度分段:基于内容的长度来决定如何进行分段。
- 层级分段:根据内容的结构层次来进行分段。
- 配置完成后,单击“创建并上传”。
- 创建并上传:进入“创建知识库”的“上传文档”页面,为知识库添加文档信息,具体操作请参考上传文档。
- 立即创建:页面返回知识库列表。
上传文档
- 进入上传文档页面,“上传方式”选择“知识文档上传”。
- 单击“点此上传”,在弹出的对话框中,选择要上传的文档。
当上传的文档由“上传中”变为“上传成功”,表示文档已成功上传。
- 单击“完成”。
进入知识库详情页面,待文件状态为“成功”,即完成文件解析。
图3 文档解析成功
命中测试
- 返回知识库列表,单击语文知识库操作列的“命中测试”。
- 在页面左侧文本框中输入问题,并单击“命中测试”。
命中结果可根据右上方的分值查看结果,分值越高,命中结果越精确。
图5 命中测试
- 在页面右侧将根据不同的检索方式(语义检索、关键词检索、混合检索、FAQ检索),展示多条匹配的内容,并按照匹配分值降序排列。
- 用户可以根据分值与匹配到的信息数量来评估当前知识库是否满足需求。
如果满足需求,则知识库接入完成,您可以在智能体或工作流中使用该知识库。
相关文档
配置本地知识库的详细信息,请参考创建本地知识库。


