Hyper-Extract 抽取入口选择
定义
Hyper-Extract 抽取入口选择 是指在 Hyper-Extract 的命令行入口 he parse 中,决定使用模板(template)还是方法(method)来执行知识抽取的规则。
这不是两个等价别名,而是两个层级不同的入口:
- 模板通过
-t指定。 - 方法通过
-m指定。
两者的差异不只体现在参数名上,还体现在抽取配置封装程度、目标用户、语言支持边界,以及最终抽取质量与使用门槛上。
在本文档中的语境
在 CLI Guide - Hyper-Extract 摘要 的语境里,he parse 是创建 Knowledge Abstract 的核心入口,也是整个 Hyper-Extract CLI 工作流 的第一步:
- Create:
he parse从文档中抽取知识,生成 Knowledge Abstract。 - Enhance:之后可继续
he feed增量添加文档,或he build-index构建索引。 - Explore:再通过
he show、he search、he talk进行可视化、搜索与问答。 - Save:最后可将结果持久化到磁盘。
因此,抽取入口的选择发生在工作流最前端,会直接影响后续知识图谱、搜索和对话的基础质量。
模板与方法的明确区分
模板:-t 指定的领域化现成配置
模板是面向大多数用户的推荐入口,文档明确将其描述为:
- domain-specific
- ready-to-use configurations
也就是说,模板不是裸算法,而是已经针对特定任务形态预先组织好的抽取配置。典型调用形式如下:
he parse doc.md -t general/biography_graph -l en
其核心特点是:
- 面向具体领域或任务。
- 开箱即用,用户通常不需要先理解底层抽取机制。
- 更适合直接把“某类文档要抽什么”映射成命令。
- 文档明确推荐大多数用户优先使用模板。
方法:-m 指定的底层抽取算法
方法是更底层的 extraction algorithms,文档将其归类为 advanced 用法。典型调用形式如下:
he parse doc.md -m light_rag
其核心特点是:
- 直接暴露较底层的抽取算法入口。
- 更适合高级用户进行精细控制。
- 不像模板那样预先针对具体领域任务做好现成封装。
- 使用门槛更高,通常需要使用者自己更清楚算法层面的取舍。
因此,模板与方法的本质区别可以概括为:
- 模板回答的是“我要做什么领域任务”。
- 方法回答的是“我要直接用哪种底层抽取算法”。
为什么文档推荐大多数用户优先用模板
文档在“Template vs Method”部分直接把模板标为“Recommended for Most Users”,而把方法标为“Advanced”。这意味着默认决策原则非常明确:
- 如果你的目标是完成某类常见知识抽取任务,应先找合适模板。
- 只有当现成模板不能满足需求,且你确实需要底层算法控制时,才切换到方法。
这样设计的原因主要有三点:
- 模板已经把领域任务所需的抽取配置封装好了,减少试错。
- 模板通常更接近用户的业务语义,例如“人物传记”“概念论文”“合同义务”。
- 模板对语言选择有直接支持,尤其适合非英文材料。
相对地,方法虽然更灵活,但也意味着:
- 你需要承担更多配置理解成本。
- 你不能自动获得模板层面对领域任务的优化。
- 在多语言场景下,能力边界更严格。
典型模板及其适用场景
文档给出了多个模板示例,它们不是随意举例,而是对应不同的任务对象。
general/biography_graph:人物传记抽取
示例命令:
he parse biography.md -t general/biography_graph -o ./bio_kb/ -l en
适用对象:
- 传记材料
- 人物生平叙述
- 需要观察人生事件、经历、关系脉络的文本
在示例工作流中,抽取完成后还可以:
he show ./bio_kb/
这说明该模板尤其适合把人物经历组织成可视化的 life events 或人物相关图谱结构。
general/concept_graph:研究与概念型材料抽取
示例命令:
he parse paper.md -t general/concept_graph -o ./paper_kb/ -l en
适用对象:
- 研究论文
- 概念说明文档
- 需要提炼主题、概念、关系与贡献点的材料
文档给出的后续示例是:
he talk ./paper_kb/ -q "What are the main contributions?"
这说明 general/concept_graph 适合为研究型文本建立可问答的概念知识基础,便于后续通过 Knowledge Abstract 进行检索与问答。
legal/contract_obligation:合同义务抽取
示例命令:
he parse contract.md -t legal/contract_obligation -o ./contract_kb/ -l en
适用对象:
- 合同文本
- 法律义务分析
- 需要抽取当事人责任、条款义务、终止条件等信息的文档
文档后续示例是:
he search ./contract_kb/ "termination conditions"
这表明该模板面向法律文档中的特定义务与条款信息抽取,后续可结合搜索定位具体 clause。
语言支持差异是入口选择中的关键边界
模板支持多语言,并可显式指定语言
文档明确说明 templates support multiple languages,并给出以下形式:
# English
he parse doc.md -t general/biography_graph -l en
# Chinese
he parse doc.md -t general/biography_graph -l zh
这说明模板入口具备明确的语言参数控制能力:
-l en用于英文。-l zh用于中文。
这不是可有可无的装饰参数。文档在 best practices 中明确强调:
- Choose the right language
- Improves extraction quality for non-English documents
换句话说,处理非英文文档时,语言选择会直接影响抽取效果,而模板入口正是承载这一能力的主要方式。
方法模板始终使用英文 prompts
文档同时给出一个非常重要的边界:
- Method templates always use English prompts.
这意味着如果选择方法入口,就不能像模板那样通过 -l zh 等方式自然切换到对应语言提示;方法侧的提示语始终是英文。
这一点会带来两个实际影响:
- 对英文材料更自然。
- 对非英文材料,尤其中文材料,可能不如模板 + 正确语言参数的组合稳定。
因此,在非英文文档场景中,入口选择不是纯粹的个人偏好问题,而是与抽取质量直接相关的技术决策。
抽取入口选择会影响什么
1. 影响命令参数形式
最直接的差异是命令写法不同:
- 模板:
he parse <doc> -t <template> [-l <lang>] - 方法:
he parse <doc> -m <method>
例如:
he parse document.md -t general/biography_graph -o ./output/ -l en
与:
he parse doc.md -m light_rag
这不仅是参数缩写不同,而是两套抽象层级不同的调用路径。
2. 影响抽取质量
文档中的最佳实践已经隐含这一结论:
- 领域任务优先用模板,因为模板针对具体 use case 做了优化。
- 非英文文档要选对语言,否则质量会下降。
因此,如果任务本身就是传记、概念研究、合同义务这类明确领域问题,用对应模板通常比直接上方法更容易得到稳定结果。
3. 影响使用门槛
模板是 ready-to-use,方法是 advanced。 这意味着:
- 模板降低上手门槛。