W
AI-Wiki
CONCEPT

Hyper-Extract 抽取入口选择

定义

Hyper-Extract 抽取入口选择 是指在 Hyper-Extract 的命令行入口 he parse 中,决定使用模板(template)还是方法(method)来执行知识抽取的规则。

这不是两个等价别名,而是两个层级不同的入口:

  • 模板通过 -t 指定。
  • 方法通过 -m 指定。

两者的差异不只体现在参数名上,还体现在抽取配置封装程度、目标用户、语言支持边界,以及最终抽取质量与使用门槛上。

在本文档中的语境

CLI Guide - Hyper-Extract 摘要 的语境里,he parse 是创建 Knowledge Abstract 的核心入口,也是整个 Hyper-Extract CLI 工作流 的第一步:

  • Create:he parse 从文档中抽取知识,生成 Knowledge Abstract。
  • Enhance:之后可继续 he feed 增量添加文档,或 he build-index 构建索引。
  • Explore:再通过 he showhe searchhe talk 进行可视化、搜索与问答。
  • Save:最后可将结果持久化到磁盘。

因此,抽取入口的选择发生在工作流最前端,会直接影响后续知识图谱、搜索和对话的基础质量。

模板与方法的明确区分

模板:-t 指定的领域化现成配置

模板是面向大多数用户的推荐入口,文档明确将其描述为:

  • domain-specific
  • ready-to-use configurations

也就是说,模板不是裸算法,而是已经针对特定任务形态预先组织好的抽取配置。典型调用形式如下:

he parse doc.md -t general/biography_graph -l en

其核心特点是:

  • 面向具体领域或任务。
  • 开箱即用,用户通常不需要先理解底层抽取机制。
  • 更适合直接把“某类文档要抽什么”映射成命令。
  • 文档明确推荐大多数用户优先使用模板。

方法:-m 指定的底层抽取算法

方法是更底层的 extraction algorithms,文档将其归类为 advanced 用法。典型调用形式如下:

he parse doc.md -m light_rag

其核心特点是:

  • 直接暴露较底层的抽取算法入口。
  • 更适合高级用户进行精细控制。
  • 不像模板那样预先针对具体领域任务做好现成封装。
  • 使用门槛更高,通常需要使用者自己更清楚算法层面的取舍。

因此,模板与方法的本质区别可以概括为:

  • 模板回答的是“我要做什么领域任务”。
  • 方法回答的是“我要直接用哪种底层抽取算法”。

为什么文档推荐大多数用户优先用模板

文档在“Template vs Method”部分直接把模板标为“Recommended for Most Users”,而把方法标为“Advanced”。这意味着默认决策原则非常明确:

  • 如果你的目标是完成某类常见知识抽取任务,应先找合适模板。
  • 只有当现成模板不能满足需求,且你确实需要底层算法控制时,才切换到方法。

这样设计的原因主要有三点:

  1. 模板已经把领域任务所需的抽取配置封装好了,减少试错。
  2. 模板通常更接近用户的业务语义,例如“人物传记”“概念论文”“合同义务”。
  3. 模板对语言选择有直接支持,尤其适合非英文材料。

相对地,方法虽然更灵活,但也意味着:

  • 你需要承担更多配置理解成本。
  • 你不能自动获得模板层面对领域任务的优化。
  • 在多语言场景下,能力边界更严格。

典型模板及其适用场景

文档给出了多个模板示例,它们不是随意举例,而是对应不同的任务对象。

general/biography_graph:人物传记抽取

示例命令:

he parse biography.md -t general/biography_graph -o ./bio_kb/ -l en

适用对象:

  • 传记材料
  • 人物生平叙述
  • 需要观察人生事件、经历、关系脉络的文本

在示例工作流中,抽取完成后还可以:

he show ./bio_kb/

这说明该模板尤其适合把人物经历组织成可视化的 life events 或人物相关图谱结构。

general/concept_graph:研究与概念型材料抽取

示例命令:

he parse paper.md -t general/concept_graph -o ./paper_kb/ -l en

适用对象:

  • 研究论文
  • 概念说明文档
  • 需要提炼主题、概念、关系与贡献点的材料

文档给出的后续示例是:

he talk ./paper_kb/ -q "What are the main contributions?"

这说明 general/concept_graph 适合为研究型文本建立可问答的概念知识基础,便于后续通过 Knowledge Abstract 进行检索与问答。

legal/contract_obligation:合同义务抽取

示例命令:

he parse contract.md -t legal/contract_obligation -o ./contract_kb/ -l en

适用对象:

  • 合同文本
  • 法律义务分析
  • 需要抽取当事人责任、条款义务、终止条件等信息的文档

文档后续示例是:

he search ./contract_kb/ "termination conditions"

这表明该模板面向法律文档中的特定义务与条款信息抽取,后续可结合搜索定位具体 clause。

语言支持差异是入口选择中的关键边界

模板支持多语言,并可显式指定语言

文档明确说明 templates support multiple languages,并给出以下形式:

# English
he parse doc.md -t general/biography_graph -l en

# Chinese
he parse doc.md -t general/biography_graph -l zh

这说明模板入口具备明确的语言参数控制能力:

  • -l en 用于英文。
  • -l zh 用于中文。

这不是可有可无的装饰参数。文档在 best practices 中明确强调:

  • Choose the right language
  • Improves extraction quality for non-English documents

换句话说,处理非英文文档时,语言选择会直接影响抽取效果,而模板入口正是承载这一能力的主要方式。

方法模板始终使用英文 prompts

文档同时给出一个非常重要的边界:

  • Method templates always use English prompts.

这意味着如果选择方法入口,就不能像模板那样通过 -l zh 等方式自然切换到对应语言提示;方法侧的提示语始终是英文。

这一点会带来两个实际影响:

  1. 对英文材料更自然。
  2. 对非英文材料,尤其中文材料,可能不如模板 + 正确语言参数的组合稳定。

因此,在非英文文档场景中,入口选择不是纯粹的个人偏好问题,而是与抽取质量直接相关的技术决策。

抽取入口选择会影响什么

1. 影响命令参数形式

最直接的差异是命令写法不同:

  • 模板:he parse <doc> -t <template> [-l <lang>]
  • 方法:he parse <doc> -m <method>

例如:

he parse document.md -t general/biography_graph -o ./output/ -l en

与:

he parse doc.md -m light_rag

这不仅是参数缩写不同,而是两套抽象层级不同的调用路径。

2. 影响抽取质量

文档中的最佳实践已经隐含这一结论:

  • 领域任务优先用模板,因为模板针对具体 use case 做了优化。
  • 非英文文档要选对语言,否则质量会下降。

因此,如果任务本身就是传记、概念研究、合同义务这类明确领域问题,用对应模板通常比直接上方法更容易得到稳定结果。

3. 影响使用门槛

模板是 ready-to-use,方法是 advanced。 这意味着:

  • 模板降低上手门槛。