W
AI-Wiki
CONCEPT

跨模态检索

定义

跨模态检索 是指在文字、图像、表格、数学公式等不同模态之间建立可计算的语义对应关系,使系统能够用一种模态提出的问题,检索到另一种模态中的相关证据。

这里的“跨模态”重点不是把文本检索、图片检索、表格检索简单并排放在一起分别跑一遍,而是要让“文字问题”能够落到“图中的趋势”“表格里的最高指标”“公式表达的数学关系”等非文本证据上,并且保留这些证据与正文说明之间的语义联系。

因此,跨模态检索的核心不是单一向量召回,也不是后置 rerank,而是依赖前置的多模态理解与统一知识建模,让不同模态的内容能进入同一检索与推理框架。

在本文中的语境

在本文语境中,跨模态检索 主要对应 RAG-Anything 的检索问答能力。该系统面向复杂多模态文档,而不是只处理纯文本语料。

文中给出的场景包括:科研论文中的实验图表和数学公式、教育材料中的图解和示意图、金融报告中的统计图表、医疗文档中的影像资料和检验数据。这些内容不是附属材料,而是专业知识本体的一部分。

因此,本文中的跨模态检索不是“把文档转成文本后继续做传统 RAG”,而是要同时处理并关联文档中的文字内容、图表信息、表格数据、数学公式等异构内容,在问答时联合召回这些证据。

传统 RAG 的问题

文中明确指出,传统 RAG 系统主要围绕纯文本设计,其典型技术栈是文本分块、向量化编码和相似性检索。这套方法在多模态文档中存在明显瓶颈。

1. 非文本内容被强行文本化

传统做法常把图像、图表、表格先经 OCR 或抽取后强制转成文本。但这样会丢失大量关键信息,包括:

  • 视觉布局
  • 颜色编码
  • 空间关系
  • 表格层次结构
  • 公式原本的数学表达形式

这意味着即便“识别出了字”,也未必保留了原始证据真正可用于理解和推理的语义。

2. 纯文本向量表达能力不足

文中强调,纯文本向量难以有效表示:

  • 图表的视觉语义
  • 表格的结构化关系
  • 公式的数学含义

因此,在回答“图中的趋势如何”“表格中哪个指标最高”这类问题时,系统即便检索到了相关段落,也可能无法精准命中真正的证据对象,导致召回和回答准确性不足。

3. 缺少跨模态上下文关系

复杂文档里,正文、图片、表格、公式通常存在互相引用、解释、证明或补充关系。传统系统无法稳定建立这种跨模态关联,结果就是回答容易只抓住局部文本,而忽略真正支撑结论的图表、数据或公式。

4. 对复杂文档处理链路割裂

面对包含大量非文本元素的文档,传统方案往往依赖多个专用工具拼接,处理链条复杂,信息在转换过程中容易损失,也难以形成统一检索入口。

实现跨模态检索的前置条件

本文特别适合强调一个边界:跨模态检索 不能被理解成独立的 rerank 技术,也不是在现有文本检索后面额外加一个排序器就能完成。

它依赖至少三个前置条件:

  1. 多模态解析完成:先把文本、图像、表格、公式等内容从复杂文档中识别出来。
  2. 统一知识表示建立:把异构内容纳入统一的结构化表示体系,而不是各自孤立存储。
  3. 跨模态关系构建完成:建立图文说明关系、表格与结论关系、公式与理论阐述关系等语义连接。

只有在这些前提之上,后续的检索阶段才真正具备“跨模态”能力。

这也是 RAG-Anything 将整体流程设计为“三阶段架构”的原因:先做多模态文档解析,再做跨模态知识构建,最后才进入检索生成。

在本文中的关键机制:双层次检索问答

文中对 跨模态检索 的直接实现,集中体现在 RAG-Anything 的“双层次检索问答”机制。

它不是只做一层语义检索,而是同时兼顾细粒度信息定位与高层语义理解,以提升复杂多模态问答的召回广度和回答深度。

1. 细粒度关键词提取

第一层是细粒度关键词提取,用来精确定位具体对象,包括:

  • 实体
  • 专业术语
  • 数据点
  • 明确指标
  • 具体内容对象

这一层更适合把问题中的明确查询锚点映射到知识图谱中的实体节点或具体内容单元,例如某个指标、某张图、某个变量、某个表项。

2. 概念级关键词提取

第二层是概念级关键词提取,用来把握更高层的语义目标,包括:

  • 主题脉络
  • 分析趋势
  • 抽象概念
  • 宏观关系

这一层不是寻找单个精确词项,而是帮助系统理解“用户到底在分析什么”,例如趋势判断、概念解释、关系归纳、原因分析等。

3. 两层结合的意义

如果只有细粒度提取,系统容易命中局部词项,却抓不住问题真正的分析意图;如果只有概念级提取,系统又可能语义上相关但缺少精确证据。

双层次机制把这两者结合起来,使系统既能找到具体证据点,又能维持问题在复杂文档中的整体语义方向。

混合检索策略的具体组成

文中给出了跨模态检索的混合检索策略,至少包括以下四个环节。

1. 精准实体匹配

系统首先通过图谱结构进行精准实体匹配,快速定位与查询最直接相关的实体节点。

这一步适合命中明确可识别的对象,例如特定术语、变量、指标、图表对象或结构化内容单元,是跨模态检索中的“精确入口”。

2. 图谱关系扩展

在实体匹配之后,系统利用知识图谱中的关联关系进行扩展,发现潜在相关信息。

这种扩展尤其适合多模态场景,因为用户问题命中的未必是最终证据本身,也可能只是某个入口概念。系统需要沿着关系找到:

  • 图片与说明文字的对应关系
  • 表格数据与分析结论的逻辑联系
  • 公式与理论阐述的内在关联
  • 段落之间的逻辑关系

这一步使检索不再停留在“字符串命中”,而转向“关系网络中的证据发现”。

3. 向量相似性检索

在图谱检索之外,系统还进行向量相似性检索,用于捕获语义层面的相关内容。

它弥补了仅靠实体和显式关系可能遗漏的部分,特别是在问题表达较抽象、同义表述较多、用户没有直接说出目标实体名称时,向量检索可以补足召回。