CONCEPT
知识图谱
基本定义
知识图谱是AI领域的结构化知识表示方法,核心逻辑为利用图结构建模、识别和推断实体与实体之间的复杂关联关系,是语义理解、智能问答、大数据决策分析、智能物联等场景的核心支撑技术。本词条内容参考AI领域原始文档:知识图谱基础介绍 摘要编写。
起源与发展
知识图谱技术起源于互联网领域,最早落地应用于搜索引擎、智能问答、推荐系统三类场景,核心技术特点为通过规范化语义规则融合多来源异构数据,支持复杂关联数据的挖掘与隐含关系推导。
常见表示方法
知识图谱的标准化表示方法包含以下6类:
- 有向标记图:最简单、最接近自然语言和人脑认知的数据模型,典型代表为RDF三元组模型,以「主语-谓语-宾语」的三元组结构描述资源关联,是W3C推动的语义数据交换标准,支持推理和复杂本体表示语言OWL,具备语义明确、灵活性高、数据整合能力强的特点,广泛应用于语义网、生物医学、文化遗产等领域。
- 知识表示(KR):以易于计算机处理的形式描述人脑知识,核心特征为支持逻辑推理,区别于通用数据格式与数据结构。
- 描述逻辑:一阶谓词逻辑的可判定子集,专门用于描述本体概念和属性,是本体知识库构建的核心理论基础。
- 产生式系统与框架理论:产生式系统为广义规则系统,绝大多数早期专家系统基于该模式构建;框架理论认为人类对事物的认知以框架形式存储,目前广泛应用于对话系统等自然语言处理任务。
- 语义网络:以节点代表概念、边代表语义关联的知识表示模型,是知识图谱的早期理论原型。
- 属性图:工业界广泛应用的图结构表示模型,主流图数据库Neo4j即基于属性图模型实现。
核心构建流程
高质量知识图谱构建的前置核心工作为Schema设计,属于基础性强制步骤,用于明确定义知识图谱的数据结构、字段约束与实体关系规则,后续的知识抽取、融合、入库环节均需遵循Schema要求执行。
存储方案
知识图谱的存储体系分为两类:
- 基于关系数据库的存储:将图结构数据映射为关系表存储,适合结构化程度高、关联复杂度较低的知识图谱场景。
- 基于原生图的存储:针对图结构的遍历、关联查询特性优化的存储引擎,典型代表为Neo4j、Apache TinkerPop,适合高复杂度关联查询、大规模知识推理场景。
核心技术难点
知识图谱的核心技术难点为图嵌入(Graph Embedding)编码,需要将图结构中的实体、关系转化为低维稠密向量支持后续机器学习任务,不同领域的知识图谱编码规则存在显著差异,需结合领域语义特征定制适配方案。