SOURCE
RAG终极框架,港大开源RAG-Anything:统一多模态知识图谱 - 今日头条 摘要
文档概览
- 文章将 RAG-Anything 定位为“专为多模态文档设计的检索增强生成系统”,目标不是只补强文本问答,而是把复杂文档中的文字、图表、表格、数学公式等异构内容统一纳入一个可检索、可关联、可问答的系统。
- 文中强调,它是一套端到端方案,覆盖从文档解析、内容理解、知识图谱构建到智能问答的全流程自动化。
- 项目渊源上,文章明确指出其多模态处理能力最初是在 LightRAG 基础上“深度扩展与优化”,后续已经独立演进为 RAG-Anything,并将继续在这一平台上迭代。
- 从文章叙述方式看,它把项目的核心创新归结为“统一的多模态知识图谱架构”:不是把各种模态先粗暴转成文本再统一处理,而是保留它们各自的结构和关系,并在知识层上建立统一表示。
关键事实
1. 文章的核心判断:传统 RAG 主要擅长文本,不擅长复杂多模态文档
- 文章认为,现有 RAG 在文本问答上已经较成熟,但其主流技术栈——文本分块、向量化编码、相似性检索——本质上是围绕纯文本设计。
- 一旦文档中出现图像、图表、表格、数学公式,传统方案就会暴露明显缺陷。文中总结的瓶颈包括:
- OCR 转文本会丢失布局语义:图像和表格如果仅通过 OCR 强制转成文本,会损失视觉布局、颜色编码、空间关系等关键信息。
- 检索精度不足:纯文本向量不能充分表达图表视觉语义、表格结构关系和公式数学含义,因此像“图中的趋势如何”“表格中哪个指标最高”这类问题会明显失准。
- 跨模态上下文缺失:文档内部常常存在图文互相说明、表格支撑文字结论、公式对应理论段落等关系,传统 RAG 难以建立这种跨模态链接。
- 工具链复杂且效率低:面对复杂文档,传统流程往往要拼接 OCR、图像理解、表格解析、公式处理等多个工具,带来流程复杂、工程成本高和信息损失。
2. 项目总体定位:面向复杂文档的一体化多模态 RAG 系统
- 文章把 RAG-Anything 定位为“多模态 AI 应用的基础组件”,可以直接作为复杂文档问答与检索能力底座集成进系统。
- 它不是单点的解析器,也不是只做向量检索的库,而是覆盖:
- 文档解析
- 内容理解
- 知识构建
- 智能问答
- 这种定位意味着它试图把多模态文档处理从概念验证推进到可部署的工程化方案。
3. 支持的内容边界与格式范围
- 文中列出的文档格式覆盖 PDF、Office 文档、图像、Markdown、纯文本等。
- 更细地说,Office 被明确展开为 Word、Excel、PowerPoint。
- 图像格式被明确举例为 JPG、PNG、TIFF。
- 文章称其原生支持“10 余种主流文档格式”,并提供智能格式检测与标准化转换机制。
- 内容类型方面,文章明确提到系统可以统一处理:
- 文本
- 图像
- 表格
- 数学公式
- 另外还提到扩展模态支持,包括流程图、代码片段、地理信息等专业内容。
- 需要注意的是,这些扩展能力在文章中属于能力宣称,并未给出逐项性能指标、测试集结果或限制条件。
4. 三阶段系统架构
- 文章给出一个三阶段架构,这是全文最核心的技术摘要之一:
- 第一阶段:多模态文档解析
- 第二阶段:跨模态知识构建
- 第三阶段:检索生成
第一阶段:多模态文档解析
- 该阶段面向 PDF、Office、图像等格式文档。
- 文中列出四个核心模块:
- 文本提取
- 图像分析
- 公式识别
- 表格解析
- 这里的目标不是简单抽出字符,而是尽可能保留文档层次结构、区域位置和内容类型。
第二阶段:跨模态知识构建
- 该阶段以跨模态知识图谱为核心。
- 文章强调通过实体关系抽取和多模态融合技术,建立统一图谱表示。
- 存储上不是单一索引,而是采用:
- 图谱数据库
- 向量数据库
- 这种双重存储对应两类需求:结构化关系查询与语义相似检索。
第三阶段:检索生成
- 最终问答阶段结合图谱检索与向量检索。
- 然后把检索结果交给大语言模型生成答案。
- 文中反复强调系统具备模块化设计,因此在这一阶段也保留了扩展不同检索策略、嵌入算法和模型组件的空间。
重要细节
高精度文档解析:基于 MinerU 2.0 的结构化提取
- 文章明确点名:系统采用基于 MinerU 2.0 的结构化提取引擎。
- 其作用被描述为对复杂文档进行高精度智能解析,重点包括:
- 识别文档层次结构
- 自动分割文本块
- 定位图像区域
- 解析表格布局
- 识别数学公式
- 文中还强调通过“标准化的中间格式转换”统一不同文档类型的处理流程,以最大化保留原始信息的语义完整性。
- 这说明它并非只把各类文档最终压平为纯文本,而是在进入知识层之前尽量保留结构信息,这与传统 RAG文档摄取 的纯文本化路径不同。
深度多模态内容理解:视觉、表格、公式分别处理
- 在内容理解层,文章把不同模态拆开叙述,说明其不是单一 embedding 管线,而是面向模态差异做定制处理。
视觉内容分析
- 集成视觉大模型。
- 自动生成高质量图像描述。
- 能提取图表中的数据关系和视觉要素。
- 文章特别强调图表理解,而不是仅做一般图像 caption。
表格智能解析
- 重点能力是理解表格的层次结构。
- 能自动识别表头关系、数据类型和逻辑联系。
- 可进一步提炼数据趋势和统计规律。
- 这一点对应文章前文对传统 RAG 的批评:单纯 OCR 虽然能拿到单元格文字,但不能恢复表格结构和统计语义。
数学公式理解
- 文中明确提到对 LaTeX 公式 的精确识别与解析。
- 理解内容包括:
- 变量含义
- 公式结构
- 适用场景
- 这意味着其处理目标不是仅把公式转成字符串,而是尝试让问答系统能利用公式所在语境与结构信息。
统一知识表示框架
- 文章强调所有模态内容最终都进入一个统一的知识表示框架。
- 这个框架的意义在于:文本、图像、表格、公式不再是彼此隔离的索引对象,而是可以放进同一语义网络里做关联分析。
统一多模态知识图谱:怎么建、存什么、为什么有用
实体化建模
- 文中指出,系统把文本段落、图表数据、数学公式等异构内容统一抽象为“知识实体”。
- 每个实体保留:
- 内容信息
- 来源标识
- 类型属性
- 这让后续检索不只是“搜到某段文本”,而可以定位到某个图、某个表、某个公式或某个段落实体。
智能关系构建
- 关系构建依赖语义分析技术。
- 文中给出的典型关系包括:
- 段落之间的逻辑关系
- 图与文字说明之间的说明关系
- 结构化内容之间的语义联系
- 这也是文章所谓“统一多模态知识图谱”的核心:不仅识别内容,还要识别内容之间怎么互相解释、支撑或引用。
双重存储
- 文章明确写到“图谱数据库和向量数据库的双重存储机制”。
- 图谱数据库负责结构化查询与关系扩展。
- 向量数据库负责语义相似性检索。
- 这与只依赖向量库的典型 RAG 方案形成对照。
双层次检索问答机制
- 文章把检索问答设计为“双层次”机制,其重点不是单一召回,而是先对问题做分层理解,再执行混合检索。
第一步:分层关键词提取
- 细粒度关键词:用于定位具体实体、专业术语、数据点等详细信息。
- 概念级关键词:用于把握主题脉络、分析趋势和抽象概念。
- 也就是说,系统既试图抓“是什么、哪个数、哪一项”,也试图抓“讨论的是哪个主题、哪种趋势、哪类关系”。
第二步:混合检索与生成
- 精准实体匹配:先通过图谱结构定位相关实体节点。
- 语义关系扩展:沿着图谱关系找到潜在相关信息。
- 向量相似性检索:补充语义上相近但不一定显式连接的内容。
- 上下文融合生成:把多源结果整合后交给模型生成最终回答。
- 文章认为,这种机制能同时支持简单事实查询与复杂分析推理。