W
AI-Wiki
CONCEPT

文档知识抽取

定义

文档知识抽取是把文档中的信息转化为知识抽象的过程。抽取结果可包含实体、实体间关系等结构化知识,使原本难以直接复用的文档内容能够保存、后续处理和检索。

在本文档中的语境

Hyper-Extract 中,he parse 是执行文档知识抽取的命令。它将输入文档解析后写入指定输出目录,核心知识数据保存在 data.json,并同时记录模板、语言、创建时间和更新时间等提取元数据。

典型输出还可包含向量检索索引:index/index.faissindex/docstore.json。索引是否生成取决于抽取时是否跳过索引构建。

输入方式与处理范围

单个文档

单个文档可以直接作为输入路径。例如可使用知识抽取模板处理 Markdown 文档:he parse document.md -t general/biography_graph -o ./output/ -l en

目录批量处理

输入路径也可以是目录。命令会处理该目录中的 .md.txt 文件,并在抽取前按文件名字母顺序合并内容。因此,批量抽取的上下文顺序受文件名影响;需要控制合并顺序时,应相应规划文件命名。

标准输入

输入路径使用 - 时,命令从标准输入读取文档内容,适合与管道组合,例如:cat document.md | he parse - -t general/biography_graph -o ./output/ -l en

两种抽取入口

基于模板的抽取

模板入口通过 -t 指定,例如 general/concept_graphgeneral/biography_graphlegal/contract_obligationfinance/earnings_summary。未提供 -t 时,命令会进入交互式模板选择,可按编号或关键词选择可用模板。

模板抽取必须提供语言参数 -l,如 enzh;应选择与文档内容匹配的语言,以提高抽取质量。模板类型也应与文档类型相匹配,例如研究论文可使用概念图模板,传记可使用人物关系图模板。

基于底层方法的抽取

方法入口通过 -m 指定底层提取方法,例如:he parse document.md -m light_rag -o ./output/。这与模板抽取是不同入口:方法不需要 -l 参数,且方法始终使用英文提示词。因而不能将模板的语言配置规则直接套用到方法抽取。

索引构建与批处理边界

若抽取后不需要立即进行搜索或聊天,可使用 --no-index 跳过索引构建,例如:he parse document.md -t general/biography_graph -o ./output/ -l en --no-index。这能提升抽取阶段的速度,尤其适合批量处理多个文档。

跳过索引不意味着放弃知识数据:实体、关系等抽取结果仍会写入知识抽象。索引可在之后统一通过 知识库索引构建 中的 he build-index 补建。

输出覆盖与常见限制

默认情况下,已有且非空的输出目录会导致命令报错。可改用其他输出路径、先清理旧目录,或显式加入 -f 强制覆盖。强制覆盖示例:he parse document.md -t general/biography_graph -o ./output/ -l en -f

指定的模板不存在时,应检查模板路径拼写、使用 he list template 查看可用模板,或省略 -t 改用交互选择。若模板抽取提示缺少语言参数,应补充 -l;但使用 -m 的方法抽取无需补充该参数。

相关条目