
# 影响RAG效果的因素
知识库是组织、存储及管理知识的系统，涵盖文档、图片、表格等信息的分类整理，可以帮助用户高效管理大量的信息。然而在实际的企业RAG落地场景中，接入知识库的源文档往往来自已有的业务资料，这些文档最初是为人而编写的，并没有考虑AI检索系统的处理方式。以下六类常见问题会系统性地影响AgentArts知识库的检索效果与大模型的最终回答质量。
#### 因素一：文档缺乏清晰的结构与标题层次
企业内部文档有时以大段连续文字呈现，没有合理的章节标题与段落划分；或者虽有标题，但层级混乱，一级标题与二级标题的地位相互混淆，导致内容逻辑难以识别。
AgentArts知识库在进行自动分段时，依赖文档的结构信号（如标题层级、段落边界、自定义分隔符）来确定切片的边界。如果文档结构缺失或混乱，系统将退而依据字符数强制切分，切片结果往往在语义上是不完整的。一个切片可能前半段讲操作步骤，后半段变成了另一个主题的说明，两者本无关联却被强制归并。这类切片在检索时难以被用户问题精准命中，即便被召回，送入大模型的上下文也是语义混杂的，严重影响回答质量。
示例场景：一份产品操作手册将"安装说明"、"参数配置项说明"与"常见错误代码"全部写在同一个无标题的大段落中。系统按默认字符数分段后，每个切片都包含三个主题的部分内容，用户无论查询安装问题还是错误代码，召回的切片都会存在问题。
#### 因素二：语言不规范或者术语前后使用不一致
同一个概念在文档的不同位置使用了不同的表达方式，或者大量使用企业内部缩写而不加任何说明。
Embedding向量化模型在将文本转化为向量时，语义不同的词汇会被映射到向量空间的不同位置。"部署"、"变更"、"上线"虽然都是运维相关的概念，但在向量空间中并不完全重合，尤其当模型对某一语言形式的训练语料较少时，语义漂移会更加明显。这导致用户以某种说法提问时，知识库无法稳定地召回以另一种说法书写的相关切片，形成检索盲区。
示例场景：文档中将同一字段分别写作"user_id"、"用户ID"和"UID"三种形式。用户提问"UID是什么"时，系统召回的切片中都写着"用户ID"，语义匹配得分偏低，最终未能命中最相关的内容。
#### 因素三：内容冗余或存在相互矛盾的表述
多个文档对同一业务问题给出了不同版本的描述（例如新旧两版操作流程同时存在于知识库中，但均未标注版本状态），或者同一文档内部多次重复相同的说明文字。
冗余内容会在向量空间中形成多个语义高度相近的切片，稀释了核心信息的语义权重，使得精排模型难以区分最正确的内容；矛盾内容则会在同一次检索中同时召回两段说法相反的切片，大模型在面对矛盾上下文时可能输出前后不一致甚至自相矛盾的回答，或通过折中措辞给出模糊结论。
示例场景：知识库中同时存在"v1 系统配置手册"与"v2 系统配置手册"的内容，两者描述的参数名不同、操作路径不同。用户提问"如何配置超时参数"时，两份文档的相关切片同时被召回，大模型无从判断哪个版本当前有效，只能将两种说法同时呈现，令用户困惑。
#### 因素四：表述模糊，存在指代不明的多义词
文档中频繁使用指代不清的代词（如"它"、"该功能"、"此项配置"），在文档完整阅读时语义明确，但在切片被独立检索后，失去了前文指代的上下文，代词所指向的对象就彻底消失了。此外，一个术语在不同语境下有不同含义（多义词），也会导致检索歧义。
由于AgentArts以切片为单位进行向量检索和上下文传递，每个切片在送入大模型时都是独立的文本片段。脱离上下文的代词指代，会让大模型在推理时只能猜测指代关系，这是RAG场景中产生幻觉的重要原因之一。
示例场景：一个切片中写道："配置完成后，它需要重新启动才能生效"，但"它"指的是服务、虚拟机还是整个系统，在切片范围内完全无法判断。大模型只能依据上下文猜测，极易给出错误指引。
#### 因素五：文档包含大量图片但没有配置合理的解析策略
企业文档中常见大量操作截图（如系统界面截图）、流程示意图，这些元素对人类读者非常直观，但若未针对文档特点合理配置解析选项，就会对RAG系统的文本检索造成明显影响。
AgentArts知识库提供了可选的文档解析配置，支持通过开启OCR增强、图片解析进行智能识别，并支持对文档中的图片选择"提取图片文本"或"仅保留原图"两种处理方式。若保持默认配置不开启图片解析，文档中的所有图片将被直接跳过，图片中承载的操作说明、流程步骤等关键信息将完全从知识库中消失，无法被检索到。反之，若不加区分地对所有文档开启图片文本提取，装饰性图片（如横幅、Logo）经OCR识别后产生的乱码字符和无意义内容会作为噪音混入切片，稀释有效语义信息。
示例场景：一份以界面截图为主的产品操作手册，因未开启图片解析，入库后图片内容全部被跳过，切片中仅剩零散的章节标题和少量说明文字。用户提问具体操作步骤时，召回的切片语义贡献极低，大模型只能生成泛泛而谈的回答，无法给出准确的操作指引。
#### 因素六：缺少业务背景说明或领域专有术语说明
知识库适用于智能问答助手场景，企业可以将产品文档、产品使用手册、用户高频咨询的问题合集、产品参数规格表、常见故障排查指南等信息上传至知识库。然而，这些文档中往往充斥着大量企业内部专有名词、产品代号、流程缩写，而文档作者默认读者已经了解这些概念，因此从不作解释。
大模型虽然拥有广泛的通用知识，但对企业私有知识体系中的专有术语并不了解。若知识库中缺乏术语定义，模型只能用训练数据中的"通用含义"去解释企业特定术语。这不仅可能导致语义理解偏差，还会让检索时的语义匹配产生偏移。
示例场景：知识库中大量出现"T+1交割"、"AON标志"、"AML审查"等金融业务专有术语，但知识库中没有任何文档对这些词汇进行解释。普通用户提问时，大模型只能依赖通用训练数据中的隐含含义作答，一旦与企业特定定义存在差异，即产生误导性回答。
