W
AI-Wiki
ENTITY

Knowledge Abstract

定义

Knowledge AbstractHyper-Extract CLI 在完成知识抽取后生成的主要容器,也是后续大多数命令直接操作的目标对象。

在典型链路中,输入文档不会被各个命令分别重复处理,而是先被抽取成一个 Knowledge Abstract,之后的可视化、检索、问答、统计、导出、清理与持久化都围绕这个对象展开。因此,它不是附属产物,而是整个 CLI 使用流程中的中心实体。

在 CLI 工作流中的身份

从完整工作流看,Knowledge Abstract 位于“创建 → 增强 → 探索 → 保存”四阶段的中心:

  • 创建阶段:文档经 he parse 生成 Knowledge Abstract。
  • 增强阶段:已有 Knowledge Abstract 可通过 he feed 继续追加文档,也可通过 he build-index 生成或重建索引。
  • 探索阶段:Knowledge Abstract 本体可用于 he show 可视化;其索引可供 he search 语义检索与 he talk 对话问答使用。
  • 保存阶段:Knowledge Abstract 可通过 he dump 持久化到磁盘。

这意味着 Knowledge Abstract 连接了抽取、扩充、索引、探索、保存和维护各环节,是 Hyper-Extract CLI 工作流 的主线承载物。

创建方式

Knowledge Abstract 的创建入口是 he parse。CLI 文档将该命令定义为“从文档提取知识”。典型形式包括:

  • he parse document.md -t general/biography_graph -o ./output/ -l en
  • he parse paper.md -t general/concept_graph -o ./paper_kb/ -l en
  • he parse biography.md -t general/biography_graph -o ./bio_kb/ -l en
  • he parse contract.md -t legal/contract_obligation -o ./contract_kb/ -l en

he parse 常见参数包括:

  • -t:指定模板。
  • -o:指定输出位置,也就是生成后的 Knowledge Abstract 所在位置。
  • -l:指定语言,例如 enzh

文档还说明,抽取可以基于两类入口:

  • 模板:面向多数用户,适合特定领域场景。
  • 方法:更底层的抽取算法,可通过 -m 指定,例如 he parse doc.md -m light_rag

无论选择模板还是方法,产出的核心操作对象仍是 Knowledge Abstract

增量增强:he feed

he feed 的职责不是重新从零创建新的知识容器,而是“向现有 Knowledge Abstract 添加文档”。这是 CLI 工作流中特别强调的增量能力。

文档中的最佳实践明确指出:

  • 可以随着时间推移不断加入新文档。
  • 这样做“不必重新处理全部内容”。

因此,Knowledge Abstract 不是一次性结果,而是可持续演化的知识集合。对于持续整理资料、追加论文、补充人物传记材料或不断纳入合同文本的场景,这一点尤其关键。

索引关系:he build-indexhe searchhe talk

Knowledge Abstract 本身与搜索索引不是同一个对象。CLI 工作流中明确区分了二者:

  • Knowledge Abstract 是知识抽取后的主要容器。
  • 索引由 he build-index 基于该容器生成或重建。

he build-index 的作用是“构建/重建搜索索引”,常见参数是:

  • -f:强制重建。

索引建立后,主要服务于两个命令:

  • he search:在 knowledge abstract 中进行语义搜索,常见参数 -n 用于指定 top-k 结果数。
  • he talk:围绕 knowledge abstract 进行问答,可用 -i 进入交互模式,或用 -q 直接提问。

CLI 文档中的最佳实践还明确给出一条边界:

  • 搜索与聊天功能需要先构建索引。

也就是说,Knowledge Abstract 可以先被创建和查看,但若没有通过 he build-index 建立索引,he searchhe talk 这类依赖检索的能力并不完整可用。

可视化与管理能力

多个命令都直接围绕 Knowledge Abstract 展开,说明它不仅是抽取结果,也是管理单元。

he show:可视化

he show 用于可视化 Knowledge Abstract。CLI 在工作流图中把它放在探索阶段,对应“Visualize”。

示例:

  • he show ./bio_kb/

在人物传记示例中,该命令被用于可视化人生事件,说明 Knowledge Abstract 可以作为图谱或结构化知识的浏览入口。

he info:统计信息

he info 用于显示 Knowledge Abstract 的统计信息。虽然摘要页未展开具体字段,但其职责已经很明确:它面向的是当前 Knowledge Abstract 的规模、状态或概况,而不是原始文档本身。

he clean:清理索引或整体对象

he clean 的定义是“移除某个 KA 的索引(或整个 KA)”。常见参数包括:

  • -a:清理全部。
  • -y:确认执行。

这里的边界非常重要:

  • he clean 不仅能清索引。
  • 在某些用法下,它也可以直接清理整个 Knowledge Abstract。

这表明索引与 Knowledge Abstract 是可分别维护的,但也都属于同一套生命周期管理对象。

he export obsidian:导出

he export obsidian 用于把 Knowledge Abstract 导出到 Obsidian 仓库。常见参数包括:

  • -o:输出位置。
  • --name:名称。
  • -f:强制覆盖。

这说明 Knowledge Abstract 不只用于 CLI 内部消费,还可以被整理为外部知识管理系统可用的形式。

he dump:持久化保存

在完整工作流图中,保存阶段明确写为:

  • KA -->|he dump| DISK

这表示 he dump 面向的是将 Knowledge Abstract 持久化到磁盘,而不是再次执行抽取或索引。

角色职责

综合 CLI 文档,Knowledge Abstract 主要承担以下职责:

  • 作为知识抽取结果的统一承载容器。
  • 作为增量补充文档的目标对象。
  • 作为建立搜索索引的来源对象。
  • 作为可视化、统计、导出和清理操作的管理单元。
  • 作为搜索与问答能力背后的知识基础。

如果没有 Knowledge Abstract,CLI 的各个命令就只能各自直接处理原始文档;而文档给出的设计显然不是这样。它强调先形成一个中间而稳定的知识对象,再围绕该对象反复探索与维护。

关键细节与边界

1. 它是中心对象,但不是所有功能都只靠它本体完成

Knowledge Abstract 是中心实体,但 he searchhe talk 依赖的是由它构建出来的索引,而不是裸 Knowledge Abstract 直接提供全部检索能力。

2. 它支持增量更新,而非只支持一次性构建

he feed 说明已有 Knowledge Abstract 可以持续扩充;这和每次都重新 he parse 全量资料是不同的工作方式。

3. 它既能被查看,也能被维护

he showhe info 偏探索与理解,he build-indexhe clean 偏维护,he export obsidianhe dump 偏保存与迁移。这些命令共同说明 Knowledge Abstract 具有完整生命周期。

4. 语言与抽取入口影响创建质量,但不改变其身份

he parse 可通过 -l en-l zh 指定语言;模板支持多语言,而方法模板总是使用英文提示词。这些设置会影响抽取过程与质量,但最终产物仍然是同一种中心对象:Knowledge Abstract

典型使用链路

一个最小但完整的链路可以概括为:

  1. he parse 把文档创建为 Knowledge Abstract。
  2. 如有新增材料,用 he feed 增量补入现有 Knowledge Abstract。
  3. he build-index 为该 Knowledge Abstract 建立检索索引。
  4. he show 查看结构,用 he search 搜索内容,用 he talk 基于其知识对话。
  5. he info 查看统计,用 he export obsidian 导出,用 he dump 保存,用 he clean 清理索引或整体对象。

这条链路正是 Hyper-Extract CLI 工作流 的核心运行方式,而 Knowledge Abstract 就是这条链路中的主对象。

相关条目