Hyper-Extract CLI Retrieval and QA
定义
Hyper-Extract CLI Retrieval and QA 指的是在 Hyper-Extract CLI Workflow 中,用户针对已经抽取完成的知识库进行访问、检索、浏览和问答的命令集合。它不是知识抽取本身,而是抽取完成后的交互入口,主要由 he show、he search 和 he talk 三种方式组成。
这三种交互方式的输出形态明确不同:
he show:在浏览器中打开交互式知识图谱,用可视化方式查看节点和边。he search:在命令行返回检索结果列表,适合快速查找实体、概念或描述。he talk:根据知识库内容生成自然语言回答,适合直接提问。
它们共同构成用户与抽取结果交互的主要入口。
在本文档中的语境
在 CLI Workflow Guide 摘要 展示的研究论文分析场景中,用户先把论文解析为知识库,然后进入“Explore the Knowledge”“Search for Information”“Chat with Your Knowledge”等阶段。这里的 Retrieval and QA 就是这些后续操作的总称。
示例流程中,知识库先由 he parse transformer_paper.md -t general/concept_graph -o ./transformer_kb/ -l en 生成,随后再通过以下命令访问其中内容:
he show ./transformer_kb/he search ./transformer_kb/ "neural network architecture"he search ./transformer_kb/ "performance metrics" -n 5he talk ./transformer_kb/ -q "What is the main contribution of this paper?"he talk ./transformer_kb/ -i
这说明 Retrieval and QA 的前提是已有可用知识库;如果语义搜索需要向量索引,则还依赖索引已构建,文档中的故障排查明确提到:若搜索无结果,应确认先执行 he build-index ./ka/。
关键组成
he show:图谱可视化
he show ./transformer_kb/ 会在浏览器中打开交互式图谱,而不是在终端输出自然语言答案或结果列表。
在示例论文场景中,这个图谱展示的内容包括:
- 节点:作者、概念、模型、指标
- 边:它们之间的关系
因此,he show 的作用更偏向结构浏览。它适合用户从整体上观察知识图中的组成与连接关系,但不直接替代搜索或问答。
he search:语义检索
he search 的关键特征是语义检索,而不是仅按字面关键词做精确匹配。文档明确说明:即使查询词与原文中的关键词不完全一致,也可以找到相关实体或概念。
典型示例是:
he search ./transformer_kb/ "neural network architecture"
虽然查询词是较泛化的描述,结果仍可命中与 Transformer 论文高度相关的条目。示例返回中写明“Found 3 result(s):”,并展示了如下典型结果结构字段:
nametypedescription
示例结果包括:
{
"name": "Transformer",
"type": "model",
"description": "A neural network architecture based solely on attention mechanisms"
}
以及:
{
"name": "Attention Mechanism",
"type": "concept",
"description": "Mechanism to draw global dependencies between sequences"
}
这说明 he search 返回的是结构化命中列表,而不是整段自由回答。
文档还给出更具体的查询示例:
he search ./transformer_kb/ "performance metrics" -n 5
其中 -n 用于限制返回数量,示例值为 5。在完整脚本示例中,搜索命令还使用了:
he search "$OUTPUT_DIR" "main contributions" -n 2
因此,-n 至少在文档中被用作结果截断参数,常见示例包括 -n 5 和 -n 2。
he talk:自然语言问答
he talk 与 he search 的差异在于:它不是返回若干匹配条目,而是综合知识库内容,生成自然语言答案。
单问题模式:he talk -q
文档中的单次提问示例为:
he talk ./transformer_kb/ -q "What is the main contribution of this paper?"
对应回答总结为:论文的主要贡献是提出 Transformer 架构;该架构在机器翻译任务上取得了当时最先进结果,同时比循环架构或卷积架构更容易并行化,并且显著减少训练时间。
这里体现出 he talk -q 的机制不是摘录单个字段,而是对知识库中的多条信息做综合归纳后输出总结性回答。
交互模式:he talk -i
he talk ./transformer_kb/ -i 会进入持续会话模式。文档中的提示语明确为:
Entering interactive mode. Type 'exit' or 'quit' to stop.
在该模式下,用户可以连续追问。例如示例会话依次询问:
- 谁是论文作者
- 他们取得了多少 BLEU 分数
示例中的作者回答列出了完整作者名单:Ashish Vaswani、Noam Shazeer、Niki Parmar、Jakob Uszkoreit、Llion Jones、Aidan N. Gomez、Lukasz Kaiser、Illia Polosukhin。
接着,系统回答模型在 WMT 2014 English-to-German translation task 上达到了 28.4 的 BLEU 分数。
会话可通过输入 exit 或 quit 结束,示例中输入 exit 后返回 Goodbye!。
关键机制
从文档给出的行为看,这一组命令分别依赖同一个知识库,但面向不同交互层次:
he show面向图结构浏览,强调节点与关系的可视化。he search面向检索,强调语义相近内容的命中与结构化列表输出。he talk面向问答,强调把知识库中的内容组织成自然语言总结。
he search 的“即使关键词不完全匹配也能找到相关内容”说明其核心能力建立在语义匹配之上,而不是普通字符串包含搜索。与此相对,he talk 进一步在检索或知识整合基础上生成答案,因此更接近问答层。
细节与边界
前提条件
这些命令都以已存在的知识库目录为输入,例如 ./transformer_kb/ 或脚本中的 $OUTPUT_DIR。如果前面的抽取没有完成,就不存在可供可视化、搜索或问答的对象。
搜索依赖索引
文档在故障排查中指出:如果搜索没有结果,应确认索引已经构建,可使用 he build-index ./ka/。这意味着 he search 的有效性依赖索引状态,而知识库在解析时只是“如果构建则会有 index”。
三者不可混同
虽然三者都属于访问知识库的入口,但输出和用途不同,不能混为一个命令的不同展示形式:
he show不是搜索结果列表。he search不是自然语言回答。he talk不是图谱浏览器。
示例中的能力边界
当前来源只明确展示了:
he show能打开浏览器中的交互式图谱。he search能按语义返回若干结构化结果,并可用-n限制数量。he talk支持-q单问和-i交互式会话。
但来源没有进一步说明 he talk 是否支持多轮记忆控制参数、he search 的排序算法细节、或 he show 的可视化过滤选项,因此这些内容不应在本词条中额外推断。
与脚本化工作流的关系
在完整脚本示例里,Retrieval and QA 也被纳入自动化流程:
- 第 2 步先用
he info查看知识库信息; - 第 3 步用
he search "$OUTPUT_DIR" "main contributions" -n 2做样例搜索; - 第 4 步用
he show "$OUTPUT_DIR"打开可视化。
这说明在实际 CLI 工作流里,检索与浏览不仅用于人工探索,也常被放进脚本当作验证和演示步骤。