多模态知识图谱RAG
定义
多模态[[知识图谱]]RAG,是指面向复杂文档的一种 RAG 范式:处理对象不是纯文本,而是同时包含文本、图像、表格、公式等异构内容的混合材料;系统先把这些内容解析成可结构化表示的元素,再抽取多模态实体、建立跨模态关系与层级归属,最后在检索阶段同时利用向量相似性与图关系来完成召回、扩展和排序。
它的关键不只是“把不同模态做 embedding”,而是把文档中本来就存在的语义连接、结构依赖和章节上下文显式建模出来。例如,一段正文可能解释一张图,一个表格可能支撑某个结论,一个公式可能属于某节中的特定推导步骤;这些关系如果只做普通文本切块与向量检索,往往会被打散,而多模态知识图谱RAG正是为保留这些依赖而设计。
在本文档中的语境
本文语境中的多模态知识图谱RAG,来自对 RAG-Anything 架构的概括。这里强调的是:复杂文档在进入检索系统之前,要先经过统一解析与标准化处理,再把文本块、图像、表格、公式等元素组织成一个可检索的多模态知识图谱;随后通过“向量-图谱融合”的方式检索,而不是退化成单一文本库或单一OCR结果库。
原文明确指出,该范式面向的是“包含文本、图像、表格、公式等多模态内容的复杂文档”,并支持 PDF、Office 文档系列以及图像等主流格式的统一处理。这里的重要点不在格式数量本身,而在于这些格式中的内容会被拆解为异构元素,并保持元素之间的语义关联关系。
核心链路
多模态知识图谱RAG的核心链路可以概括为四步:
- 先解析复杂文档中的异构元素。
- 再把重要元素抽取为多模态实体。
- 建立跨模态关系与层级归属关系。
- 在检索阶段同时使用向量相似性与图关系进行召回和排序。
这四步不是彼此独立的组件,而是一条连续的数据流。若缺少前面的结构化建模,后面的图谱检索就只剩名字;若缺少后面的融合检索,前面的多模态图谱又难以真正改善RAG效果。
关键机制与组成
1. 异构内容解析
第一层机制是把复杂文档解析成可计算的基础元素。原文列出的典型元素包括:文本块、图像、表格、公式等。这一步的目标不是简单抽字,而是识别文档中不同内容类型,并尽量保留它们之间原有的关联。
在本文引用的架构中,解析阶段强调两点:
- 自动识别并提取文本、图像、表格、公式等异构元素。
- 在抽取时保持元素间的语义关联关系。
这意味着系统处理的不是“一个文件对应一段文本”,而是“一个复杂文档被还原为多个有类型、有边界、有关系的内容单元”。这也是它区别于普通OCR流水线的第一道分界线。
2. 多模态实体抽取
在完成基础解析后,系统会把重要的多模态元素转换为知识图谱中的实体。这里的实体不局限于文本中的名词短语,也包括图像、表格、公式等可被独立引用和关联的内容单元。
原文对这一步的描述包括两项具体工作:
- 语义标注。
- 元数据保存。
语义标注用于说明该元素“表示什么”;元数据保存则用于保留该元素的来源位置、类型、上下文归属等信息。没有这两层信息,后续即便能检索到元素,也难以判断它在原文中的角色与重要性。
3. 跨模态关系映射
多模态知识图谱RAG的核心增益,主要来自跨模态关系映射。原文明确要求在“文本实体和多模态组件之间建立语义连接和依赖关系”,也就是把文本、图像、表格、公式之间本来隐含在文档里的联系显式表示出来。
这类关系至少包括:
- 文本与图像之间的语义连接,例如正文对插图的解释、图像对段落论点的支撑。
- 文本与表格之间的语义连接,例如文字结论来自某个表格中的数据。
- 文本与公式之间的语义连接,例如一段推导说明对应某个数学表达式。
- 表格与表格之间、图像与图像之间、或公式与领域知识之间的依赖或映射关系。
原文还提到,系统可识别多个表格数据集间的语义关系和依赖性,也可建立数学方程与领域特定知识库之间的概念映射。这说明这里的“关系”不只是邻近共现,而是有语义含义的连接。
4. 层次结构保持
除了横向的跨模态关系,系统还要保留纵向的文档层级。原文使用“归属于”关系链来维护原始文档组织结构,并明确指出这些关系链用于保持逻辑内容层次和章节依赖关系。
这意味着一个公式不只是“被检索到的公式”,它还归属于某一节、某一小节、某一主题;一张图表也不只是独立对象,而是属于某个章节中的某个论证单元。通过这类“归属于”关系,检索系统才能在结果扩展时把局部证据与上层语境重新接回去。
对复杂文档来说,这一点非常关键。因为很多内容只有放在所属章节中才有意义:同一个符号在不同章节可能含义不同;同一张表在摘要、实验、附录中的作用也不一样。层次结构保持就是为了避免检索结果失去原始语境。
5. 关系评分机制
本文语境中的多模态知识图谱并不是“有边即可”,而是要求对关系赋分。原文明确提到“加权关系评分”,即为关系类型分配定量相关性分数,评分依据包括:
- 语义邻近性。
- 文档结构内的上下文重要性。
这一机制的作用,是让图中的边不再只是布尔连接,而是能在后续检索、图遍历和排序中体现轻重。比如,同样是与某段文字相关,一张直接解释该段结论的图,通常应比仅处于同一页但关联较弱的图获得更高权重;同理,属于当前小节核心推导链条中的公式,应比章节末尾旁注中的公式更重要。
关系赋分后,系统可以在检索阶段更稳定地做两件事:
- 控制图扩展范围,优先沿高价值关系传播。
- 在融合排序时,把“结构上更关键、语义上更近”的跨模态证据排到前面。
6. 向量-图谱融合检索
在检索阶段,多模态知识图谱RAG不是只走向量相似度,也不是只走图遍历,而是把两者结合。原文将其概括为“向量-图谱融合”:集成向量相似性搜索与图遍历算法,同时利用语义嵌入和结构关系实现全面内容检索。
这一步的含义是:
- 向量检索负责找到语义上相近的候选内容。
- 图关系负责把这些候选内容与相关图像、表格、公式、章节语境连接起来。
- 最终排序不只看相似度,还会考虑模态类型、关系权重与结构一致性。
原文还提到两项配套能力: