W
AI-Wiki
CONCEPT

知识抽取模板

定义

知识抽取模板是 Hyper-Extract 中用于规定“从何种文档抽取什么知识、按何种形式组织结果”的预设配置。模板将特定领域或文档类型的抽取目标与提示词结合起来,使同一条 he parse 命令能够针对传记、论文、合同和财报等材料采用不同的知识抽取方式。

模板不是任意的输出格式名称;应根据输入文档的内容类型选择。选择不匹配的模板可能降低抽取结果的相关性和可用性。

在本文档中的语境

本文档将模板作为 he parse 的知识抽取入口:命令读取单个文件、目录中的文档或标准输入,并将抽取出的实体、关系等知识保存为知识摘要。输出目录中的 metadata.json 会记录实际使用的 templatelang、创建时间和更新时间;若未跳过索引构建,还会生成向量检索索引。

模板抽取与使用底层方法的方式不同。使用 -m light_rag 等方法时,系统使用英文提示词,且不要求语言参数;使用模板时则必须显式给出语言代码。

选择与调用机制

使用 -t 指定模板路径。例如:

he parse document.md -t general/biography_graph -o ./output/ -l en

省略 -t 时,he parse 会进入交互式模板选择,列出可用模板并接受编号或搜索关键词。这适合不确定模板路径,或希望先浏览可选模板的情况。

对目录执行解析时,例如 he parse ./documents/ -t general/concept_graph -o ./output/ -l en,系统会处理其中的 .md.txt 文件,并在抽取前按字母顺序合并文件内容。因此,目录中的命名顺序会影响合并后的文档顺序。

常用模板与适用文档

  • general/biography_graph:用于传记材料,抽取人物相关知识图谱。

  • general/concept_graph:用于研究论文等以概念、术语和关联为核心的材料。

  • legal/contract_obligation:用于法律合同,关注合同中的义务信息。

  • finance/earnings_summary:用于财报或业绩材料,生成财务业绩摘要。

对应示例包括:论文使用 general/concept_graph,传记使用 general/biography_graph,合同使用 legal/contract_obligation,财务报告使用 finance/earnings_summary。这体现了模板选择应与文档类型匹配的原则。

语言要求与质量

知识抽取模板必须通过 -l 提供语言代码。例如英文文档可使用 -l en,中文文档可使用 -l zh。即使模板路径相同,也应让语言代码与输入文档的主要语言一致;本文档明确指出,这会提升抽取质量。

缺少 -l 时,模板模式会报出“Language is required”一类错误。该限制不适用于 -m 指定的底层方法,因此不能将方法模式的免语言参数行为套用于模板模式。

细节与边界

模板决定抽取侧重点,但不替代输出路径和索引策略的管理。输出目录已存在且非空时,可使用 -f 强制覆盖、改用新的输出路径,或先移除原有目录。

若批量抽取时暂时不需要搜索或聊天能力,可加 --no-index 跳过索引构建以加快处理;之后可通过 he build-index 单独构建索引。这不会改变模板的抽取选择,只改变是否在该次解析中生成检索索引。

当出现“Template not found”时,不应假设任意模板路径都可用。可先运行 he list template 查看可用模板,省略 -t 改用交互式选择,或检查模板路径的拼写。

相关条目