文档知识抽取
定义
文档知识抽取是把文档中的信息转化为知识抽象的过程。抽取结果可包含实体、实体间关系等结构化知识,使原本难以直接复用的文档内容能够保存、后续处理和检索。
在本文档中的语境
在 Hyper-Extract 中,he parse 是执行文档知识抽取的命令。它将输入文档解析后写入指定输出目录,核心知识数据保存在 data.json,并同时记录模板、语言、创建时间和更新时间等提取元数据。
典型输出还可包含向量检索索引:index/index.faiss 与 index/docstore.json。索引是否生成取决于抽取时是否跳过索引构建。
输入方式与处理范围
单个文档
单个文档可以直接作为输入路径。例如可使用知识抽取模板处理 Markdown 文档:he parse document.md -t general/biography_graph -o ./output/ -l en。
目录批量处理
输入路径也可以是目录。命令会处理该目录中的 .md 和 .txt 文件,并在抽取前按文件名字母顺序合并内容。因此,批量抽取的上下文顺序受文件名影响;需要控制合并顺序时,应相应规划文件命名。
标准输入
输入路径使用 - 时,命令从标准输入读取文档内容,适合与管道组合,例如:cat document.md | he parse - -t general/biography_graph -o ./output/ -l en。
两种抽取入口
基于模板的抽取
模板入口通过 -t 指定,例如 general/concept_graph、general/biography_graph、legal/contract_obligation 或 finance/earnings_summary。未提供 -t 时,命令会进入交互式模板选择,可按编号或关键词选择可用模板。
模板抽取必须提供语言参数 -l,如 en 或 zh;应选择与文档内容匹配的语言,以提高抽取质量。模板类型也应与文档类型相匹配,例如研究论文可使用概念图模板,传记可使用人物关系图模板。
基于底层方法的抽取
方法入口通过 -m 指定底层提取方法,例如:he parse document.md -m light_rag -o ./output/。这与模板抽取是不同入口:方法不需要 -l 参数,且方法始终使用英文提示词。因而不能将模板的语言配置规则直接套用到方法抽取。
索引构建与批处理边界
若抽取后不需要立即进行搜索或聊天,可使用 --no-index 跳过索引构建,例如:he parse document.md -t general/biography_graph -o ./output/ -l en --no-index。这能提升抽取阶段的速度,尤其适合批量处理多个文档。
跳过索引不意味着放弃知识数据:实体、关系等抽取结果仍会写入知识抽象。索引可在之后统一通过 知识库索引构建 中的 he build-index 补建。
输出覆盖与常见限制
默认情况下,已有且非空的输出目录会导致命令报错。可改用其他输出路径、先清理旧目录,或显式加入 -f 强制覆盖。强制覆盖示例:he parse document.md -t general/biography_graph -o ./output/ -l en -f。
指定的模板不存在时,应检查模板路径拼写、使用 he list template 查看可用模板,或省略 -t 改用交互选择。若模板抽取提示缺少语言参数,应补充 -l;但使用 -m 的方法抽取无需补充该参数。
相关条目
- he parse - Hyper-Extract 摘要:命令的输入、参数、输出与示例。
- 知识抽取模板:按文档类型定义抽取目标和结构的入口。
- 知识库索引构建:为已抽取知识补建向量检索索引。
- Hyper-Extract:提供文档知识抽取能力的工具。