W
AI-Wiki
CONCEPT

Hyper-Extract CLI Retrieval and QA

定义

Hyper-Extract CLI Retrieval and QA 指的是在 Hyper-Extract CLI Workflow 中,用户针对已经抽取完成的知识库进行访问、检索、浏览和问答的命令集合。它不是知识抽取本身,而是抽取完成后的交互入口,主要由 he showhe searchhe talk 三种方式组成。

这三种交互方式的输出形态明确不同:

  • he show:在浏览器中打开交互式知识图谱,用可视化方式查看节点和边。
  • he search:在命令行返回检索结果列表,适合快速查找实体、概念或描述。
  • he talk:根据知识库内容生成自然语言回答,适合直接提问。

它们共同构成用户与抽取结果交互的主要入口。

在本文档中的语境

CLI Workflow Guide 摘要 展示的研究论文分析场景中,用户先把论文解析为知识库,然后进入“Explore the Knowledge”“Search for Information”“Chat with Your Knowledge”等阶段。这里的 Retrieval and QA 就是这些后续操作的总称。

示例流程中,知识库先由 he parse transformer_paper.md -t general/concept_graph -o ./transformer_kb/ -l en 生成,随后再通过以下命令访问其中内容:

  • he show ./transformer_kb/
  • he search ./transformer_kb/ "neural network architecture"
  • he search ./transformer_kb/ "performance metrics" -n 5
  • he talk ./transformer_kb/ -q "What is the main contribution of this paper?"
  • he talk ./transformer_kb/ -i

这说明 Retrieval and QA 的前提是已有可用知识库;如果语义搜索需要向量索引,则还依赖索引已构建,文档中的故障排查明确提到:若搜索无结果,应确认先执行 he build-index ./ka/

关键组成

he show:图谱可视化

he show ./transformer_kb/ 会在浏览器中打开交互式图谱,而不是在终端输出自然语言答案或结果列表。

在示例论文场景中,这个图谱展示的内容包括:

  • 节点:作者、概念、模型、指标
  • 边:它们之间的关系

因此,he show 的作用更偏向结构浏览。它适合用户从整体上观察知识图中的组成与连接关系,但不直接替代搜索或问答。

he search:语义检索

he search 的关键特征是语义检索,而不是仅按字面关键词做精确匹配。文档明确说明:即使查询词与原文中的关键词不完全一致,也可以找到相关实体或概念。

典型示例是:

he search ./transformer_kb/ "neural network architecture"

虽然查询词是较泛化的描述,结果仍可命中与 Transformer 论文高度相关的条目。示例返回中写明“Found 3 result(s):”,并展示了如下典型结果结构字段:

  • name
  • type
  • description

示例结果包括:

{
 "name": "Transformer",
 "type": "model",
 "description": "A neural network architecture based solely on attention mechanisms"
}

以及:

{
 "name": "Attention Mechanism",
 "type": "concept",
 "description": "Mechanism to draw global dependencies between sequences"
}

这说明 he search 返回的是结构化命中列表,而不是整段自由回答。

文档还给出更具体的查询示例:

he search ./transformer_kb/ "performance metrics" -n 5

其中 -n 用于限制返回数量,示例值为 5。在完整脚本示例中,搜索命令还使用了:

he search "$OUTPUT_DIR" "main contributions" -n 2

因此,-n 至少在文档中被用作结果截断参数,常见示例包括 -n 5-n 2

he talk:自然语言问答

he talkhe search 的差异在于:它不是返回若干匹配条目,而是综合知识库内容,生成自然语言答案。

单问题模式:he talk -q

文档中的单次提问示例为:

he talk ./transformer_kb/ -q "What is the main contribution of this paper?"

对应回答总结为:论文的主要贡献是提出 Transformer 架构;该架构在机器翻译任务上取得了当时最先进结果,同时比循环架构或卷积架构更容易并行化,并且显著减少训练时间。

这里体现出 he talk -q 的机制不是摘录单个字段,而是对知识库中的多条信息做综合归纳后输出总结性回答。

交互模式:he talk -i

he talk ./transformer_kb/ -i 会进入持续会话模式。文档中的提示语明确为:

Entering interactive mode. Type 'exit' or 'quit' to stop.

在该模式下,用户可以连续追问。例如示例会话依次询问:

  • 谁是论文作者
  • 他们取得了多少 BLEU 分数

示例中的作者回答列出了完整作者名单:Ashish Vaswani、Noam Shazeer、Niki Parmar、Jakob Uszkoreit、Llion Jones、Aidan N. Gomez、Lukasz Kaiser、Illia Polosukhin。

接着,系统回答模型在 WMT 2014 English-to-German translation task 上达到了 28.4 的 BLEU 分数。

会话可通过输入 exitquit 结束,示例中输入 exit 后返回 Goodbye!

关键机制

从文档给出的行为看,这一组命令分别依赖同一个知识库,但面向不同交互层次:

  • he show 面向图结构浏览,强调节点与关系的可视化。
  • he search 面向检索,强调语义相近内容的命中与结构化列表输出。
  • he talk 面向问答,强调把知识库中的内容组织成自然语言总结。

he search 的“即使关键词不完全匹配也能找到相关内容”说明其核心能力建立在语义匹配之上,而不是普通字符串包含搜索。与此相对,he talk 进一步在检索或知识整合基础上生成答案,因此更接近问答层。

细节与边界

前提条件

这些命令都以已存在的知识库目录为输入,例如 ./transformer_kb/ 或脚本中的 $OUTPUT_DIR。如果前面的抽取没有完成,就不存在可供可视化、搜索或问答的对象。

搜索依赖索引

文档在故障排查中指出:如果搜索没有结果,应确认索引已经构建,可使用 he build-index ./ka/。这意味着 he search 的有效性依赖索引状态,而知识库在解析时只是“如果构建则会有 index”。

三者不可混同

虽然三者都属于访问知识库的入口,但输出和用途不同,不能混为一个命令的不同展示形式:

  • he show 不是搜索结果列表。
  • he search 不是自然语言回答。
  • he talk 不是图谱浏览器。

示例中的能力边界

当前来源只明确展示了:

  • he show 能打开浏览器中的交互式图谱。
  • he search 能按语义返回若干结构化结果,并可用 -n 限制数量。
  • he talk 支持 -q 单问和 -i 交互式会话。

但来源没有进一步说明 he talk 是否支持多轮记忆控制参数、he search 的排序算法细节、或 he show 的可视化过滤选项,因此这些内容不应在本词条中额外推断。

与脚本化工作流的关系

在完整脚本示例里,Retrieval and QA 也被纳入自动化流程:

  • 第 2 步先用 he info 查看知识库信息;
  • 第 3 步用 he search "$OUTPUT_DIR" "main contributions" -n 2 做样例搜索;
  • 第 4 步用 he show "$OUTPUT_DIR" 打开可视化。

这说明在实际 CLI 工作流里,检索与浏览不仅用于人工探索,也常被放进脚本当作验证和演示步骤。

相关条目