W
AI-Wiki
CONCEPT

向量-图谱融合检索

定义

向量-图谱融合检索,是指把向量相似性搜索与图遍历算法组合在同一套检索流程中的机制。

在本文语境中,它不是泛指所有混合检索,而是专门面向 RAG-Anything 这类多模态复杂文档 RAG 系统的检索设计:一部分依靠语义嵌入做相近内容召回,另一部分依靠多模态[[知识图谱]]中的关系边与层次链路补全上下文,最终返回不仅“像”,而且“彼此有关系”的结果。

在本文档中的语境

本文讨论的对象不是纯文本知识库,而是同时包含文本、图像、表格、公式等异构元素的复杂文档。

在这种场景下,单纯向量检索虽然能找到语义相近的片段,但很难充分表达以下信息:

  • 某个图像说明文字与正文实体之间的依赖关系
  • 某个表格与前后章节结论之间的结构从属关系
  • 某个数学公式与领域概念之间的映射关系
  • 同一文档中不同模态元素之间的空间、层次和语义连接

因此,本文把向量-图谱融合检索视为 多模态知识图谱RAG 的关键检索层:它既保留向量召回的语义覆盖能力,又利用图谱把碎片化命中的内容重新接回原始关系网络中。

两部分的职责分工

向量检索负责语义召回

向量部分的核心职责,是根据查询语义找到“内容上相近”的候选结果。

它擅长处理用户问题与文档元素之间不完全词面匹配、但语义相近的情况。例如用户未必直接提到文档中的原词,却仍然可以通过嵌入相似度召回相关文本块、图像描述、表格解释或公式说明。

在多模态场景里,这一步解决的是“先把可能相关的内容找出来”的问题。

图遍历负责关系补全与上下文扩展

图谱部分的核心职责,不是替代语义召回,而是在初始召回后沿关系边继续扩展与补全上下文。

本文明确强调,图遍历会利用至少三类连接:

  • 实体关系:把文本实体与相关多模态组件连接起来
  • 结构关系:沿文档原有层次结构、章节依赖和“归属于”关系链补足上下文
  • 跨模态连接:把文字、图像、表格、公式等不同模态之间的语义连接和依赖关系串起来

因此,向量部分回答“哪些内容可能相关”,图谱部分回答“这些内容在原文中如何关联、还应该补哪些上下文”。

关键机制

1. 先语义命中,再按图扩展

融合检索通常以向量相似性搜索作为入口,先召回与查询语义接近的元素;随后以这些元素为节点,在多模态知识图谱中继续遍历,扩展出与之相关的实体、说明、上下位结构或跨模态依赖。

这样做的意义是,系统不会只停留在若干离散片段,而能把相关片段重新组织成有关系的证据集合。

2. 模态感知排序

本文明确提到系统具有“模态感知排序”能力,即不是对所有候选结果采用统一分数,而是根据查询涉及的内容类型动态调整不同模态结果的评分与排序。

也就是说,查询更偏向表格、图像还是公式,会影响各模态候选结果的权重分配。

这种自适应排序机制的意义在于:

  • 避免文本结果因为数量多而系统性压制其他模态
  • 避免图像、表格、公式等结果虽然相关,却在统一排序中被淹没
  • 让最终返回结果更贴合问题真正依赖的证据类型

对多模态文档来说,这一步非常关键,因为用户的问题往往并不只依赖文字答案。

3. 关系一致性维护

本文还强调“关系一致性维护”,即检索结果不仅要相关,还要保留元素之间原有的语义关系和结构关系。

这意味着系统不能只是召回一堆彼此独立的高相似度碎片,而要尽量保证:

  • 文本与其引用的图、表、公式仍然成对出现
  • 元素之间的上下文顺序、章节归属或依赖关系不被打断
  • 检索结果在传递给生成模型时,仍然具备连贯、可解释的关系结构

它要解决的正是多模态 RAG 中常见的“碎片化召回”问题:单个片段看似相关,但脱离了原始关系网络后,模型容易误解其含义、边界和适用条件。

为什么在多模态复杂文档中有价值

面对图、文、表、公式混合文档时,单纯向量检索的主要限制在于,它更擅长表达“语义相似”,却不擅长表达“结构依赖”。

例如:

  • 一个结论可能写在正文里,但证据在表格中
  • 一个概念解释可能在文本里,但关键定义依赖公式
  • 一个图像本身需要依靠标题、周边段落和层次位置才能被正确理解

如果只做向量检索,系统可能分别召回这些元素,却无法稳定说明它们为什么应该一起出现,也无法保证返回顺序和依赖关系仍然正确。

图谱融合的价值就在于补足这些结构信息,使检索结果更加完整,并且能解释“为什么检到了这些内容、这些内容之间是什么关系”。

因此,在本文语境里,向量-图谱融合检索提升的不只是召回率,还包括:

  • 上下文完整性
  • 关系连贯性
  • 多模态证据拼接能力
  • 最终答案的可解释性

它依赖什么前提

向量-图谱融合检索并不是脱离前处理阶段独立成立的能力,它强依赖前置数据准备质量。

本文给出的前提包括:

  • 文档解析阶段能正确识别文本块、图像、表格、公式等异构元素
  • 在解析过程中尽量保持元素之间的语义关联关系
  • 多模态实体提取足够准确,能把重要元素转成结构化图谱实体
  • 跨模态关系映射足够可靠,能在文本实体与多模态组件之间建立语义连接和依赖关系
  • 层次结构保持做得足够好,能通过“归属于”关系链维护原始组织结构
  • 关系评分机制合理,能根据语义邻近性和结构上下文重要性给关系分配权重

换句话说,融合检索效果并不只由检索算法决定,更直接受文档解析、实体抽取和关系构建质量影响。

如果前面的抽取和建图存在缺漏,后续检索即使能命中语义近邻,也可能:

  • 沿错误关系扩展
  • 漏掉关键上下文
  • 破坏原始结构依赖
  • 让多模态排序失真

因此,它的边界之一就是:图谱质量不足时,图遍历不仅不能增强结果,反而可能放大噪声。

细节与边界

它不是简单的“向量检索 + 重排”

向量-图谱融合检索的重点不只是多加一个排序器,而是在检索阶段就显式利用知识图谱中的关系边和层级链路。