W
AI-Wiki
CONCEPT

RAG文档切分策略

定义

RAG文档切分策略,是指在检索增强生成系统中,把原始文档拆成适合建立向量索引、执行检索并回填给生成模型的片段的方法集合。

在本文语境里,它不是泛指任何文本预处理,也不只是“把长文分短”这么简单;它关注的是:切分后的片段能否被稳定嵌入、准确召回,并在生成阶段提供足够完整的上下文。

原文明确把文档切分策略定义为“决定信息检索质量的核心环节”。这意味着切分不是边缘优化项,而是构建高效RAG系统时直接影响召回质量、答案完整性和生成连贯性的基础步骤。

在本文档中的语境

本文讨论的是五类主流策略的选型与组合:固定大小切分、语义切分、结构感知切分、LLM智能切分、混合策略。

其关注点不是算法名词本身,而是不同文档类型、不同实时性要求、不同成本预算下,如何在“实现复杂度、检索准确率、语义完整性、处理速度”之间做权衡。

如果切分过粗,检索时会带回大量无关内容,降低上下文密度;如果切分过细,又可能把本应连续的信息链拆散,导致模型虽然“召回到了”,却无法据此生成完整答案。这也是RAG切分策略选型原则要解决的核心问题。

固定大小切分

机制

固定大小切分,是最直接的入门方案:按预设字符数或 Token 数量,把文本均匀切成多个片段,例如每 500 个字符一段。

为防止相邻片段之间出现信息断层,通常会保留 10%—20% 的重叠区。也就是说,后一段会重复包含前一段尾部的一部分内容,使跨段信息仍有机会被一起召回。

这种做法的核心优点是实现简单、规则稳定、易于批处理,工程上很容易快速落地。

适用场景

它尤其适合新闻、论坛帖子等格式松散文本。这类内容通常没有稳定标题层级,也缺少严格章节结构,因此先用长度规则均匀切开,往往比复杂解析更省成本。

对于实时性要求较高的系统,固定切分也常作为基础方案,因为它几乎不需要额外语义分析计算,处理速度稳定。

边界与问题

固定大小切分的主要边界,在于它不理解语义边界,只按长度截断。

因此,它可能把专业术语、短语搭配或连续语义链直接切开。原文给出的典型风险是类似“神经...网络”这样的术语被拆散。扩展理解上,这种问题也会出现在定义句、因果链、步骤说明和条件约束中。

一旦关键术语被拆入不同片段,向量检索可能只召回其中一半,最终让生成模型拿到的是不完整上下文。

因此,固定大小切分虽然简单高效,但更适合作为起步方案,或与后处理修复、滑动窗口、多路召回等机制搭配,而不宜被误认为对所有文本都足够好。

语义切分

机制

语义切分的目标,是尽量保持“思想完整性”,避免把本应属于同一语义单元的内容机械拆开。

其具体做法是:先利用 NLP 技术识别句子边界或段落边界,再根据相邻内容的语义相似度决定是否继续合并。

原文特别强调,语义切分会通过余弦相似度动态合并相邻内容;只有当相邻单元之间的语义联系明显减弱时,才开启新的分块。

判定条件

本文给出的经验阈值是:当相似度下降超过 0.2—0.3 时,开始新的分块。

这里的意思不是固定地按字数停止,而是观察语义连续性。一组句子如果围绕同一主题展开,即便长度稍长,也可以继续保留在同一块中;反之,只要主题切换明显,即使文本不长,也应该切成新块。

收益场景

语义切分在医疗问诊场景中表现突出。原因在于医疗文本常常存在清晰但紧密相连的逻辑链,例如“症状—诊断—治疗”。

如果使用机械长度切分,这条链可能被拆成多个片段,导致检索只能命中“症状”或“治疗建议”的局部信息;而语义切分更有机会把完整链路保留下来,使生成出的医嘱更连贯。

原文给出的结果是:在该场景下,语义切分使医嘱连贯性提升 40% 以上。

边界

语义切分的代价,是实现复杂度和计算成本都高于固定切分。

它依赖句段识别与相似度计算,参数设置也会影响分块结果。例如阈值过低,容易把主题相关但角度稍有变化的内容过早拆开;阈值过高,则可能把两个实际上已转向不同话题的段落错误合并。

因此,语义切分虽然更能保留逻辑完整性,但并不是“无条件更优”,而是更适合对答案连贯性要求较高、文本内部逻辑关系较强的场景。

结构感知切分

结构感知切分,是利用标题、章节等文档固有结构进行切分的方法,尤其适合法律、制度、手册、技术规范等专业文档。

这类文本的边界本来就由作者显式写出,因此按结构切分往往比单纯按长度或局部语义切分更符合文档原意。

原文给出的案例是法律合同解析:某律所采用结构感知切分后,条款检索准确率从 67% 提升到 92%。

实施时,原文建议结合递归切分:先按章节划分;如果某一章节过长,再对该章节做二次切分。这样既保留了章节级结构完整性,又不会因为单块太长而超出嵌入模型限制。

这说明结构感知切分并不排斥其他方法,它经常是一个上层框架,下面再叠加长度控制或语义细分。

LLM智能切分

LLM智能切分,是通过提示词引导大模型自主判断文档应如何划分语义块的方法。

例如,可以要求模型把科研论文按“研究方法、实验结果、结论”三部分切分,而不是仅按表面长度或标题层级处理。

原文给出的测试结果是:某学术平台使用该方法后,跨文献综述生成质量提升 35%。

但它的边界同样明确:计算成本会显著上升,因此更推荐用于高价值场景,而不是所有文档的默认批处理方案。

混合策略

混合策略,是把多种切分思路组合成分层流程,而不是强行押注单一方法。

原文给出的企业级例子是“多粒度组合切分”:先用固定长度进行粗切,再基于Qwen提取关键事实,最后通过知识图谱链接相关片段。

这种分层方案在电商场景中,使商品参数检索响应速度提升 3 倍,同时又保留了功能描述的完整性。

这类做法说明,实际系统往往不是在“效率”和“质量”之间二选一,而是先用低成本方案铺底,再用更智能的方式修正关键部分。

原文还提到另一项实践:通过“多路召回”融合固定切分的效率优势与语义切分的质量优势,使知识问答准确率从 40% 提升到 83%。

选型思路与实践顺序