本体引导与去重感知:从异构文档构建知识图谱的提取层
大型语言模型(LLM)在从非结构化文档中提取实体和关系时表现出色,但一致性欠佳:类型词汇在不同文档间断裂,同一人物以多种名称变体出现,关系重复,同名不同人的个体可能被错误合并。本文介绍了一个生产级提取层的设计、实现与实证优化,该层将实时文档流转换为与正式本体对齐的、经过验证的知识图谱。
系统从 Kafka 中消费文档元数据,通过针对 PDF、电子表格、Office 和图像内容定制的处理器进行路由,并使用本地托管的、基于本体微调的 Qwen3.5-9B 模型,分两轮提取实体和关系。其核心特色是本体引导提取:通过嵌入相似度从图数据库实时检索本体相关切片,并注入提取提示中,相比静态领域切片,目录开销减少约 94%。
提取结果随后经过五阶段精炼管道:确定性清洗、跨块合并、第二轮关系提取、六种无需模型推理的去重算法,以及一个嵌入解析子系统,其冲突守卫可阻止任何相似度分数覆盖。在情报语料上的评估显示,搜索召回率从约 70% 提升至 95%,且无错误合并;同时修正了七类静默质量缺陷,从截断源文本单字符的 bug 到携带标题前缀实体的系统性重复。
这项工作的意义在于,它展示了一种将 LLM 的灵活性与本体约束和确定性算法相结合的方法,在不牺牲准确性的前提下,显著提高了知识图谱构建的效率和可靠性。
核心技术与流程
系统架构的核心是一个两轮提取流程:第一轮识别实体,第二轮关注关系。每一轮都利用注入提示中的本体切片,确保提取结果与预定义类型和关系一致。对于处理后的文档,系统会进行跨块合并,以消除因文档分割导致的重复实体。
去重环节采用了六种去重算法,全部基于确定性规则,不依赖模型推理,从而保证了可解释性和效率。此外,嵌入解析子系统作为最后一道防线,其冲突守卫机制确保即使相似度分数很高,也不会轻易合并可能不同的人物。
实证效果与行业意义
在情报领域的语料测试中,该系统的搜索召回率从约 70% 提升至 95%,且未发生错误合并。更重要的是,它识别并修复了七类静默质量缺陷,这些缺陷通常难以通过人工审查发现,例如因字符截断导致的文本损坏,以及因标题前缀导致的实体重复。
这项研究为知识图谱构建提供了一种可复用的生产级方案,尤其适用于需要处理海量异构文档且对数据质量要求极高的场景,如情报分析、企业知识管理等。其本体引导与确定性去重相结合的设计思路,也为其他 LLM 驱动的信息提取系统提供了有益参考。
