W
AI-Wiki
CONCEPT

多模态知识图谱

定义

多模态知识图谱 是一种面向复杂文档理解的知识表示方法:它不是只把文本中的人名、地名、术语做实体抽取,而是把文档里的文本段落、图像、图表、表格、数学公式等多种模态内容,一并抽象为可关联的知识实体,并进一步构造成带关系的网络结构。

它的重点不只是“图谱化”,更是“统一建模”。也就是说,系统不把非文本内容简单降级成一段 OCR 文本,而是尽量保留其原有的信息形态、结构特征、来源位置和与其他内容的语义联系,使异构内容可以在同一知识层中被组织、检索和推理。

在本文语境中的含义

RAG-Anything 的语境里,多模态知识图谱 是其核心技术创新之一,也是其区别于传统 RAG 的关键点。

原文强调,现代文档早已不是纯文本载体,而是常常同时包含文字描述、图表分析、数据统计、公式推导等内容。科研论文中的实验图表和数学公式承载核心发现,教育材料依靠图解增强理解,金融报告依赖统计图表展示趋势,医疗文档包含影像资料和检验数据。这些内容彼此补充,共同构成完整知识。

因此,RAG-Anything 不是把多模态当作附属功能处理,而是把跨模态关联视为文档理解的基础能力:只有把文本、图像、表格、公式放进统一知识图谱中,系统才能回答复杂文档里的真实问题,而不是只做文本片段匹配。

为什么需要统一建模

传统 OCR 转文本的问题

传统 RAG 往往主要面向纯文本设计,常见流程是文本分块、向量化编码、相似性检索,再交给大模型生成回答。面对图像、表格、公式等非文本内容时,常见补救方式是先做 OCR,再把结果当普通文本处理。

这种方式有明显失真:

  • 会丢失视觉布局信息,例如图表元素的位置关系、坐标轴对应、图例配置等。
  • 会丢失颜色编码等视觉语义,例如不同颜色线条或区域代表的不同类别。
  • 会丢失空间关系,例如图片标注与主体对象的相对位置、表格跨行跨列形成的结构意义。
  • 会丢失结构化语义,例如表头层级、数据分组、公式结构、变量依赖关系。

结果是,非文本内容虽然被“转成了字”,但知识本身已经被压扁,进入检索系统后只剩残缺表示。

传统 RAG 的后果

原文指出,这种处理方式会带来至少三类直接问题:

  • 内容理解局限:系统无法充分理解图表、表格和公式真正表达的内容。
  • 检索精度不足:纯文本向量无法有效表示图表视觉语义、表格结构关系和公式数学含义。
  • 上下文缺失:系统无法建立图文互相解释、表格与分析结论互相支撑、公式与理论阐述互相定义的跨模态联系。

因此,当用户提出“图中的趋势如何”“表格里哪个指标最高”“这个公式是什么意思”这类问题时,传统文本化方案很容易答偏、答漏,或者只能给出脱离原文结构的泛泛描述。

关键机制

实体化建模

RAG-Anything 对多模态内容采用统一的实体化建模方式。原文明确提到,文本段落、图表数据、数学公式等异构内容都会被统一抽象为知识实体。

这些实体至少保留以下几类信息:

  • 内容信息:实体本身对应的文字、图像描述、表格数据、公式表达等实际内容。
  • 来源标识:该实体来自原始文档的哪个位置、哪个内容片段,用于后续溯源和定位。
  • 类型属性:标明它是段落、图像、表格、公式,或更细粒度的内容类型,以便后续使用不同理解与检索策略。

这种做法的意义在于,系统不再只围绕“文本 chunk”组织知识,而是把不同模态内容都提升为一等知识对象。这样一来,图像不只是插图,表格不只是 OCR 字符串,公式也不只是 LaTeX 文本,而是可以被引用、关联和检索的实体节点。

关系构建

统一实体之后,还需要构建关系网络。原文特别强调,多模态知识图谱不是把不同类型内容并排存放,而是要识别并建立它们之间的语义关联。

文中明确提到的关系包括:

  • 段落间逻辑关系:例如定义、展开、论证、结论、因果、递进等文本结构联系。
  • 图文说明关系:图片、图表与其标题、说明文字、正文引用段之间的对应关系。
  • 表格数据与分析结论的联系:例如某个表格中的关键指标如何支撑后文的比较、判断和总结。
  • 公式与理论阐述之间的关联:例如某个数学公式由哪段理论说明引入、某些变量含义由哪段文字定义、某条推导服务于哪个结论。

原文还指出,系统能够理解图片与说明文字的对应关系、表格数据与分析结论的逻辑联系,以及公式与理论阐述的内在关联。这意味着图谱中的边不仅是浅层的“相邻”或“同页”,而是带有解释性和推理价值的跨模态语义边。

与存储和检索的结合

多模态知识图谱 在这里并不是独立存在的知识工程产物,而是与检索系统直接耦合的基础结构。

原文明确写到,系统会建立“图谱数据库和向量数据库的双重存储机制”,形成统一图谱表示与向量数据库并存的方案。这一点很重要,因为它表明 RAG-Anything 走的不是“只靠图谱”或“只靠向量”的单一路线,而是混合检索路线。

具体来说:

  • 图谱部分负责保存结构化实体及其关系,适合做实体定位、关系扩展、来源追踪和结构化查询。
  • 向量部分负责承载语义相似性检索,适合捕捉表达不同但语义接近的内容。
  • 两者结合后,系统既能沿着关系网络找到明确相关节点,也能通过向量召回发现潜在语义相关内容。

原文在检索阶段进一步把这种思路落成“双层次检索问答”:一方面通过图谱结构做精准实体匹配和语义关系扩展,另一方面通过向量相似性检索补足语义层面的相关内容,最后再做上下文融合生成。

因此,多模态知识图谱 在本项目里不是静态展示层,而是检索、推理、生成三者之间的中间枢纽。

在问答中的价值

这种统一建模的直接价值,是提高复杂文档问答时的跨模态上下文完整性。

传统系统面对多模态问题时,常常只能检索到某个孤立文本片段,缺乏图、表、公式等证据的联动信息;而 多模态知识图谱 可以把相关实体和关系一起带入上下文,让系统获得更完整的证据链。

在原文语境中,这种能力尤其体现在以下问题类型上:

  • 图中趋势类问题:例如询问某张统计图呈现出怎样的变化趋势。系统不仅需要图像或图表本身,还要结合说明文字、坐标信息、图例含义和正文分析。
  • 表格指标比较类问题:例如询问表格中哪个指标最高、哪组数据差异最大。系统需要保留表格结构、表头层级和数据对应关系,而不是只看 OCR 后的一串数字。