Knowledge Abstract
定义
Knowledge Abstract 是 Hyper-Extract CLI 在完成知识抽取后生成的主要容器,也是后续大多数命令直接操作的目标对象。
在典型链路中,输入文档不会被各个命令分别重复处理,而是先被抽取成一个 Knowledge Abstract,之后的可视化、检索、问答、统计、导出、清理与持久化都围绕这个对象展开。因此,它不是附属产物,而是整个 CLI 使用流程中的中心实体。
在 CLI 工作流中的身份
从完整工作流看,Knowledge Abstract 位于“创建 → 增强 → 探索 → 保存”四阶段的中心:
- 创建阶段:文档经
he parse生成 Knowledge Abstract。 - 增强阶段:已有 Knowledge Abstract 可通过
he feed继续追加文档,也可通过he build-index生成或重建索引。 - 探索阶段:Knowledge Abstract 本体可用于
he show可视化;其索引可供he search语义检索与he talk对话问答使用。 - 保存阶段:Knowledge Abstract 可通过
he dump持久化到磁盘。
这意味着 Knowledge Abstract 连接了抽取、扩充、索引、探索、保存和维护各环节,是 Hyper-Extract CLI 工作流 的主线承载物。
创建方式
Knowledge Abstract 的创建入口是 he parse。CLI 文档将该命令定义为“从文档提取知识”。典型形式包括:
he parse document.md -t general/biography_graph -o ./output/ -l enhe parse paper.md -t general/concept_graph -o ./paper_kb/ -l enhe parse biography.md -t general/biography_graph -o ./bio_kb/ -l enhe parse contract.md -t legal/contract_obligation -o ./contract_kb/ -l en
he parse 常见参数包括:
-t:指定模板。-o:指定输出位置,也就是生成后的 Knowledge Abstract 所在位置。-l:指定语言,例如en或zh。
文档还说明,抽取可以基于两类入口:
- 模板:面向多数用户,适合特定领域场景。
- 方法:更底层的抽取算法,可通过
-m指定,例如he parse doc.md -m light_rag。
无论选择模板还是方法,产出的核心操作对象仍是 Knowledge Abstract。
增量增强:he feed
he feed 的职责不是重新从零创建新的知识容器,而是“向现有 Knowledge Abstract 添加文档”。这是 CLI 工作流中特别强调的增量能力。
文档中的最佳实践明确指出:
- 可以随着时间推移不断加入新文档。
- 这样做“不必重新处理全部内容”。
因此,Knowledge Abstract 不是一次性结果,而是可持续演化的知识集合。对于持续整理资料、追加论文、补充人物传记材料或不断纳入合同文本的场景,这一点尤其关键。
索引关系:he build-index、he search、he talk
Knowledge Abstract 本身与搜索索引不是同一个对象。CLI 工作流中明确区分了二者:
- Knowledge Abstract 是知识抽取后的主要容器。
- 索引由
he build-index基于该容器生成或重建。
he build-index 的作用是“构建/重建搜索索引”,常见参数是:
-f:强制重建。
索引建立后,主要服务于两个命令:
he search:在 knowledge abstract 中进行语义搜索,常见参数-n用于指定 top-k 结果数。he talk:围绕 knowledge abstract 进行问答,可用-i进入交互模式,或用-q直接提问。
CLI 文档中的最佳实践还明确给出一条边界:
- 搜索与聊天功能需要先构建索引。
也就是说,Knowledge Abstract 可以先被创建和查看,但若没有通过 he build-index 建立索引,he search 与 he talk 这类依赖检索的能力并不完整可用。
可视化与管理能力
多个命令都直接围绕 Knowledge Abstract 展开,说明它不仅是抽取结果,也是管理单元。
he show:可视化
he show 用于可视化 Knowledge Abstract。CLI 在工作流图中把它放在探索阶段,对应“Visualize”。
示例:
he show ./bio_kb/
在人物传记示例中,该命令被用于可视化人生事件,说明 Knowledge Abstract 可以作为图谱或结构化知识的浏览入口。
he info:统计信息
he info 用于显示 Knowledge Abstract 的统计信息。虽然摘要页未展开具体字段,但其职责已经很明确:它面向的是当前 Knowledge Abstract 的规模、状态或概况,而不是原始文档本身。
he clean:清理索引或整体对象
he clean 的定义是“移除某个 KA 的索引(或整个 KA)”。常见参数包括:
-a:清理全部。-y:确认执行。
这里的边界非常重要:
he clean不仅能清索引。- 在某些用法下,它也可以直接清理整个 Knowledge Abstract。
这表明索引与 Knowledge Abstract 是可分别维护的,但也都属于同一套生命周期管理对象。
he export obsidian:导出
he export obsidian 用于把 Knowledge Abstract 导出到 Obsidian 仓库。常见参数包括:
-o:输出位置。--name:名称。-f:强制覆盖。
这说明 Knowledge Abstract 不只用于 CLI 内部消费,还可以被整理为外部知识管理系统可用的形式。
he dump:持久化保存
在完整工作流图中,保存阶段明确写为:
KA -->|he dump| DISK
这表示 he dump 面向的是将 Knowledge Abstract 持久化到磁盘,而不是再次执行抽取或索引。
角色职责
综合 CLI 文档,Knowledge Abstract 主要承担以下职责:
- 作为知识抽取结果的统一承载容器。
- 作为增量补充文档的目标对象。
- 作为建立搜索索引的来源对象。
- 作为可视化、统计、导出和清理操作的管理单元。
- 作为搜索与问答能力背后的知识基础。
如果没有 Knowledge Abstract,CLI 的各个命令就只能各自直接处理原始文档;而文档给出的设计显然不是这样。它强调先形成一个中间而稳定的知识对象,再围绕该对象反复探索与维护。
关键细节与边界
1. 它是中心对象,但不是所有功能都只靠它本体完成
Knowledge Abstract 是中心实体,但 he search 和 he talk 依赖的是由它构建出来的索引,而不是裸 Knowledge Abstract 直接提供全部检索能力。
2. 它支持增量更新,而非只支持一次性构建
he feed 说明已有 Knowledge Abstract 可以持续扩充;这和每次都重新 he parse 全量资料是不同的工作方式。
3. 它既能被查看,也能被维护
he show、he info 偏探索与理解,he build-index、he clean 偏维护,he export obsidian、he dump 偏保存与迁移。这些命令共同说明 Knowledge Abstract 具有完整生命周期。
4. 语言与抽取入口影响创建质量,但不改变其身份
he parse 可通过 -l en、-l zh 指定语言;模板支持多语言,而方法模板总是使用英文提示词。这些设置会影响抽取过程与质量,但最终产物仍然是同一种中心对象:Knowledge Abstract。
典型使用链路
一个最小但完整的链路可以概括为:
- 用
he parse把文档创建为 Knowledge Abstract。 - 如有新增材料,用
he feed增量补入现有 Knowledge Abstract。 - 用
he build-index为该 Knowledge Abstract 建立检索索引。 - 用
he show查看结构,用he search搜索内容,用he talk基于其知识对话。 - 用
he info查看统计,用he export obsidian导出,用he dump保存,用he clean清理索引或整体对象。
这条链路正是 Hyper-Extract CLI 工作流 的核心运行方式,而 Knowledge Abstract 就是这条链路中的主对象。