尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

OntoRAG: Enhancing Question-Answering through Automated Ontology Derivation from Unstructured Knowle

发布时间:2026/9/8 18:04:13

资讯中心
01
ARTICLE

OntoRAG: Enhancing Question-Answering through Automated Ontology Derivation from Unstructured Knowle

OntoRAG: Enhancing Question-Answering through Automated Ontology Derivation from Unstructured Knowle
研究目标本文提出并验证了一个名为OntoRAG的自动化流水线旨在从非结构化文档以电气继电器技术资料为例中自动推导出本体并利用该本体增强大型语言模型LLM的问答QA系统特别是在需要全局理解的复杂查询场景中。主要研究内容与创新点解决的核心问题痛点1传统RAG依赖向量检索擅长局部匹配但缺乏全局理解和多跳推理能力难以处理分散在多个文档中的复杂问题。痛点2GraphRAG虽引入知识图谱但其社区划分破坏源文档的本体结构如层级关系、分类且依赖人工构建初始本体耗时费力。痛点3手动创建本体在动态、海量知识库面前不可持续。OntoRAG的完整技术流水线① 数据获取网络爬取电气继电器PDF文档。② PDF解析采用Unstructured库识别布局并用PyMuPDFLLM增强表格提取。③ 混合语义分块结合元素边界与语义相似度余弦距离生成连贯块。④ 信息抽取利用Gemini 2.5 Flash进行文本清洗、消歧、命名实体识别、原子事实抽取并映射为图结构JSON。⑤ 知识图谱构建基于名称与定义嵌入相似性聚类关键元素形成候选类节点及关系边。⑥ 本体创建对候选类图应用Leiden社区检测划分出本体类再提取类属性LLM合成与类间关系并进一步递归挖掘子社区形成层级本体O0~O3。检索机制用户查询先提取关键元素然后与指定层级如O2的本体类进行嵌入相似度匹配检索对应源文档块并扩展上下文最终由LLM生成答案。此过程保持了全局关系与层级结构的利用。实验评估数据集约100万token的ABB继电器产品技术文档。对比对象向量RAGSS、GraphRAG四个社区层级C0~C3。问题集生成125个需综合理解的“全局理解型”问题。评价方式以GPT类裁判进行两两对比全面性、多样性、赋能性、直接性并基于提取的声明数量与簇数进行量化分析。主要结果全面性O2级OntoRAG胜率比SS高88%比GraphRAG最佳配置C2高65%。多样性O2胜率比SS高86%比C2高62%。声明指标O2平均每答案产出35.2条独特声明与14.1个主题簇均优于GraphRAG和SS。直接性SS仍占优92%说明OntoRAG可进一步融合局部检索策略。局限性与未来工作计算开销大索引100万token需300分钟难以大规模/实时部署。领域依赖提示词针对继电器领域定制迁移新领域需重调。未来方向优化聚类算法、自适应提示、混合索引以提升效率与泛化能力。OntoRAG通过“自动构建层级本体图谱社区检测”的创新方法显著提升了面向复杂技术文档的问答全面性与多样性虽然当前计算成本较高但为自动化本体构建和语义网愿景提供了重要实践路径。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示摘要——本体对于构建知识库以增强由大型语言模型LLM驱动的问答QA系统至关重要。然而传统的本体创建依赖于领域专家的手动工作这一过程耗时、易出错并且对于大型、动态的知识领域不切实际。本文介绍了 OntoRAG一个旨在从非结构化知识库中推导本体的自动化流水线重点针对电气继电器文档。OntoRAG 集成了先进技术包括网络爬取、PDF解析、混合分块、信息抽取、知识图谱构建和本体创建将非结构化数据转换为可查询的本体。通过利用LLM和基于图的方法OntoRAG增强了全局理解能力在全面性和多样性方面优于传统的检索增强生成RAG和GraphRAG方法。实验结果表明了 OntoRAG 的有效性其全面性胜率相较于向量RAG达到85%相较于GraphRAG的最佳配置达到75%。这项工作解决了自动化本体创建的关键挑战推进了语义网的愿景。关键词——本体学习检索增强生成知识图谱大型语言模型I. 引言大型语言模型LLM在自然语言处理领域取得了空前的成功在广泛的任务中展示了卓越的能力[1]-[3]。尽管取得了这些进展LLM在特定领域的、知识密集型的应用中仍面临重大挑战尤其是当查询超出其训练数据或需要最新信息时。一个主要的限制是幻觉——即生成事实性错误的回答——这源于模型无法动态地访问外部知识[4], [5]。检索增强生成RAG通过将外部知识库集成到生成过程中来解决此问题通过语义相似性检索相关文档以提高事实准确性[6]。这种方法已成为改进基于LLM的问答QA系统的基石使得需要当前和精确信息的现实应用成为可能。传统的RAG依赖于向量搜索它将文本块编码为向量表示并检索那些在语义上与查询最相似的块。虽然这种方法对局部检索有效但它在全局理解任务如查询聚焦摘要中表现不佳因为相关信息分散在语料库中的多个文档或区域中[7]。向量搜索孤立地关注单个文本块无法捕捉到全面理解所必需的相互关联的关系和更广泛的上下文。例如在电气继电器等技术领域关于故障模式的查询可能需要综合来自规格书、手册和数据表的信息——这些信息通常是碎片化的且关系复杂的。此外向量搜索缺乏执行多跳推理的能力而这对于回答依赖于遍历知识库中实体间关系的复杂查询至关重要[18]-[20]。为了解决这些缺点微软研究院引入了GraphRAG它利用知识图谱实现更全面的信息检索[8]。在知识图谱中实体被表示为节点它们的关系被表示为带类型的边便于对相互连接的数据进行多跳推理。GraphRAG通过使用社区检测将知识图谱聚类成多个社区来增强全局理解然后将其用于摘要和检索。然而GraphRAG的一个显著局限性在于其聚类方法它直接创建多个聚类而没有保留源文档的本体完整性。此过程通常会忽略原始数据中存在的固有层次关系、实体分类和语义依赖关系导致所得知识表示中结构和语义连贯性的丧失。例如在电气继电器领域关键关系——例如继电器组件与其故障模式之间的关系——可能会被分散到不同的聚类中从而扭曲知识库的完整性并降低问答任务的准确性。此外GraphRAG通常假定存在预定义的本体来指导知识图谱的构建这需要人工策展——这是一个劳动密集、成本高昂且易出错的过程限制了其对新领域的可扩展性和适应性[15], [16], [21]。本体是语义网的基石这是Tim Berners-Lee提出的愿景旨在实现机器可处理的数据语义以支持自动化服务[22]。它们通过定义可重用的类、属性和关系来促进数据集成、共享和发现正如手动策划的本体如统一医学语言系统UMLS、WordNet、GeoNames和都柏林核心元数据倡议所例证的那样[10]-[13]。然而面对大规模、动态的知识库手动创建此类本体所需的工作变得越来越难以维持在这些知识库中信息标准化是一个快速演变的挑战[14]。因此自动化本体创建是一个关键的研究前沿近期的努力探索了基于LLM的本体学习OL方法[17]。这些方法旨在通过利用LLM的语义理解能力来扩展本体构建的规模但它们通常缺乏充分捕捉知识库的层次性和关系性本质同时保持其本体完整性所需的结构推理能力。本文介绍了 OntoRAG一个旨在从非结构化知识库中推导本体的自动化流水线解决了传统向量搜索和GraphRAG的局限性。OntoRAG专注于电气继电器文档——一个信息分散在技术手册、数据表和应用笔记中的领域——通过一系列阶段将非结构化PDF转换为可查询的本体网络爬取、PDF解析、混合分块、信息抽取、知识图谱构建和本体创建。与向量RAG不同OntoRAG通过推导本体类和关系来捕获全局关系和层次结构从而支持多跳推理和全面的理解。与GraphRAG相比OntoRAG通过显式地推导一个反映数据固有层次和关系结构的本体来保留源文档的本体完整性。它采用社区检测算法以及基于LLM的属性合成通过Gemini 2.5 Flash确保本体类、关系和属性与原始文档的语义和结构连贯性对齐从而产生更忠实、更有意义的知识表示。这种自动化的本体创建过程消除了手动策展的需要增强了跨不同领域的可扩展性和适应性。通过将LLM与基于图的技术相结合OntoRAG平衡了语义理解和结构推理在全面性和多样性等关键指标上实现了优越的性能。这项工作的主要贡献有三方面1) 一个从非结构化数据自动创建本体的端到端流水线消除了传统方法和GraphRAG所需的手动工作同时保持了本体的完整性。2) 用于PDF解析、混合和语义分块以及使用社区检测和基于LLM的属性合成的本体推导的新技术专门针对处理复杂的技术文档进行了定制。3) 在电气继电器领域的严格评估证明了 OntoRAG 相对于传统RAG和GraphRAG的优越性。通过解决传统向量搜索和GraphRAG的差距OntoRAG推进了语义网的愿景为知识密集型领域的自动化本体创建和增强的问答提供了可扩展的解决方案。II. 方法论OntoRAG 是一个系统性的流水线旨在将非结构化PDF文档转换为结构化的、可查询的本体。该流水线包括六个关键阶段网络爬取、PDF解析、分块、信息抽取、知识图谱构建和本体创建。每个阶段都经过精心设计以在确保高效处理的同时保持语义完整性。整体工作流程如图2所示。A. 网络爬取OntoRAG流水线从网络爬取开始以获取多样化的电气继电器PDF文档集。使用BeautifulSoup [23]和Scrapy [24]等工具我们系统地制造商网站和技术仓库中提取PDF。该过程克服了动态网页和网络爬取等挑战以确保数据收集的稳健性。爬取的文档被组织到一个中央仓库中便于后续处理阶段的高效访问。B. PDF解析解析器要求有效的PDF解析对于使LLM能够处理非结构化文档至关重要。一个健壮的解析器必须能够识别文档结构如段落、表格、图表并处理复杂的布局例如多列页面和无边框表格。电气继电器文档通常包含复杂的布局包括混合的单列和双列格式、带有数学公式的表格以及嵌入的图像这对传统的基于规则的解析器构成了挑战。采用Unstructured库为应对这些挑战我们采用了Unstructured库[25]它擅长将PDF解析为不同的元素如标题、页眉、文本、表格和图像。Unstructured结合了光学字符识别OCR、目标检测和数字解析以准确识别文档布局和元素位置。然而尽管Unstructured使用PDFMiner [26]提取文本但它在识别出表格存在后仍难以提取表格结构。C. 分块混合分块分块阶段将解析后的内容划分为易于管理的单元以供LLM处理同时保持上下文的完整性。我们开发了一种混合分块技术使用由Unstructured库识别的元素。分块在标题元素处创建前提是当前块超过最小长度阈值一个超参数。一个长度上限确保与LLM上下文窗口的兼容性尽管对于超过此限制的单个元素添加会有例外。此方法确保分块在上下文上连贯且大小最优。语义分块为了进一步提高分块质量我们作为混合分块的一部分实施了语义分块组合相邻的文本块与其前后块组合形成组合句子。句子嵌入使用文本嵌入模型将组合句子嵌入为向量表示。语义距离计算相邻句子嵌入之间的余弦距离以衡量语义相似性。相似性高于阈值的块被合并。阈值选择通过分析所得块的大小和数量来确定相似性阈值在人工监督下平衡粒度与连贯性。此过程产生“首次检索粒度单元”确保块在保持语义连贯性的同时适合LLM上下文窗口。D. 信息抽取与映射此阶段将分块数据转换为结构化的原子事实、实体和关系用于知识图谱构建。该过程涉及几个步骤均利用Gemini 2.5 Flash进行上下文学习。提示语在附录中提供文本清洗纠正错误如拼写、语法、标点以确保数据质量。消歧通过将代词等替换为具体名词来解决歧义增强清晰度。命名实体识别NER在块内识别实体如名称和技术规格。原子事实抽取将文本转换为命题主语-谓语-宾语陈述提取每个命题旁边的关键实体。见附录。块图JSON将结构化的命题表示为JSON对象代表图元素节点和关系节点由属性定义如“词性”、“名称”关系由属性定义如“关系类型”、“源节点”、“目标节点”。见附录。关键元素映射使用严格的置信度阈值将相似实体映射到全局规范实体以确保一致性并减少冗余。关键术语定义与嵌入为关键术语生成定义将其嵌入为向量并添加到块图JSON中以供语义检索。E. 知识图谱构建在此阶段我们通过将文本块中提取的关键元素聚类成本体类来构建知识图谱这些类构成图的节点。然后将关键元素之间的关系投影到这些类上以形成边从而实现用于本体创建的多跳推理。F. 本体创建本体创建阶段从知识图谱 G 中推导出最终的本体类、关系和属性为非结构化电气继电器文档提供结构化表示。我们应用Leiden社区检测算法将图划分为社区本体类提取社区间关系并使用Gemini 2.5 Flash合成类属性。该过程使用数学符号来描述图结构、划分和关系投影。III. 检索方法论OntoRAG 采用结构化的检索过程来利用其本体回答关于电气继电器语料库的理解性问题。检索过程首先使用 Gemini 2.5 Flash 从用户查询中提取关键元素。这些关键元素通常是实体或概念例如故障模式或继电器组件被视为名称而查询本身被视为定义。对于每个关键元素根据一个可配置的参数在指定级别例如O1O2的本体类上执行相似性搜索。相似性搜索分别将关键元素的名称通过其嵌入和查询的定义通过其嵌入与本体的类名称嵌入和类定义嵌入使用余弦相似度进行比较。本体级别决定了用于检索的类的粒度较高的级别例如O3提供更细的粒度较低的级别例如O0提供更多的抽象。基于相似性搜索结果识别出最匹配的本体类并从语料库中检索它们对应的源块。为了确保足够的上下文围绕每个检索到的块应用一个可配置的扩展上下文窗口例如向两侧各扩展200个标记。然后将这些检索到的块组合起来形成最终的上下文由 Gemini 2.5 Flash 用来生成答案。这种本体驱动的检索过程使 OntoRAG 能够捕获全局关系和层次结构增强其处理复杂理解性问题的能力。IV. 实验设置我们评估了 OntoRAG 在全局理解任务中的有效性采用了受 GraphRAG [8] 启发的方法论。将 OntoRAG 与 GraphRAG 和一个向量RAG基线SS进行了比较重点关注在电气继电器文档语料库上的高层级理解性问题。A. 数据集评估使用了一个单一数据集电气继电器文档一个专有的 PDF 文档语料库技术手册、数据表、应用笔记涉及 ABB 继电器产品总计约 100 万个标记分为 1600 个块每块 600 个标记重叠 100 个标记。该数据集通过 OntoRAG 处理以生成知识图谱和本体而 GraphRAG 和 SS 则使用它们各自的索引方法。B. 条件评估了九种条件O0-O3OntoRAG 在四个本体级别上从根候选类级别O0到低级别O3提供不同的粒度。C0-C3GraphRAG 在四个社区级别上从根级别C0到低级别C3[8]。SS使用语义搜索的向量 RAG 基线 [8]。C. 问题生成遵循 [8] 的方法我们使用 Gemini 2.5 Flash 生成了 125 个理解性问题描述数据集和用例例如技术支持、设计优化。为五个用户创建角色例如继电器技术员每个角色有五个任务例如故障排除。为每个用户-任务对生成五个问题例如“不同制造商的电气继电器常见故障模式有哪些”。问题由领域专家验证其相关性。D. 评估指标我们使用 Gemini 2.5 Flash 作为评判者进行成对比较评估四个指标 [8]全面性 (Comprehensiveness)回答问题各方面的覆盖程度无冗余。多样性 (Diversity)答案中观点的多样性。赋能性 (Empowerment)使能做出明智判断的能力。直接性 (Directness)回答问题的具体程度。对答案进行成对比较每个问题重复五次以考虑LLM的随机性。此外计算了基于声明的指标全面性使用 Claimify [8] 提取的平均唯一声明数量。多样性使用 Scikit-learn 的凝聚聚类和 ROUGE-L 距离 [32] 计算的平均声明簇数量。E. 配置OntoRAG 利用 Unstructured 库进行 PDF 解析PyMuPDF 和 Gemini 2.5 Flash 进行表格/图像提取、实体/关系提取、本体创建、问题生成和评估。社区检测使用 graspologic [31] 中的 Leiden 算法。在一台虚拟机16GB RAMIntel Xeon Platinum 8171M CPU 2.60GHz上索引大约需要 300 分钟。V. 结果与讨论OntoRAG 在不同本体级别O0-O3上与 GraphRAGC0-C3和 SS 进行了比较评估重点关注定性指标和基于声明的指标。A. 定性结果表 I 显示了 OntoRAGO2与其他条件的胜率。O2 的全面性胜率相较于 SS 达到 88%p 0.001相较于 GraphRAG 的最佳配置C2, p 0.05达到 65%多样性胜率分别为 86% 和 62%展示了其优越的全局理解能力。赋能性相较于 SS 略高55%p 0.05与 C2 相当52%p 0.05。SS 在直接性上表现出色92%p 0.001而 O2 在直接性上优于 C258%p 0.05。图 4 显示了 OntoRAG 和 GraphRAG 在不同本体和社区级别上的性能趋势。OntoRAG 在全面性和多样性上始终优于 GraphRAG其中 O2 得分最高。B. 基于声明的结果表 II 展示了基于声明的指标。O2 每个答案平均获得 35.2 个声明和 14.1 个簇略微超过 C234.8 个声明13.8 个簇。OntoRAG 的其他级别范围从 34.9 到 35.3 个声明和 13.9 到 14.2 个簇而 GraphRAG 的级别范围从 34.5 到 34.8 个声明和 13.6 到 13.8 个簇。SS 落后为 26.5 个声明和 8.0 个簇。C. 讨论OntoRAG 的本体驱动方法增强了在电气继电器领域的全局理解能力在该领域中结构化关系至关重要。层次化的本体级别实现了粒度和抽象之间的平衡O2 优于 SS全面性 88%多样性 86%和 C2全面性 65%多样性 62%。折线图图 4显示 OntoRAG 在所有级别上都持续优于 GraphRAG在全面性和多样性上都有轻微但显著的改进。O2 和 C2 之间的赋能性结果相当52%p 0.05表明两种方法在使能明智判断方面相似。然而SS 在直接性上的优势92%p 0.001表明 OntoRAG 可能受益于为特定查询整合局部检索策略。本体创建的计算成本300 分钟超过了 GraphRAG 的索引时间281 分钟突显了优化以提高可扩展性的必要性。VI. 局限性尽管 OntoRAG 在全局理解方面展示了显著改进但其当前的实现面临可扩展性挑战这阻碍了其在生产场景中的就绪性。本体创建过程涉及将局部名词聚类为全局名词并应用社区检测计算量很大在一台普通的虚拟机16GB RAMIntel Xeon Platinum 8171M CPU 2.60GHz上索引一个 100 万标记的语料库需要 300 分钟。这种高计算成本使得 OntoRAG 对于更大的语料库或实时应用不切实际限制了其在生产环境中的可扩展性。此外OntoRAG 对用于实体提取、本体创建和问题生成的特定领域提示语的依赖降低了其跨不同领域的泛化能力需要手动调整提示语以适应新的用例。检索过程虽然有效但涉及跨本体级别的多次相似性搜索进一步增加了计算开销。这些局限性突显了将优化作为下一步的必要性包括更高效的聚类算法、自适应提示策略和混合索引技术以减少运行时间和资源需求。VII. 结论OntoRAG 代表了自动化本体创建的重大进步将非结构化的电气继电器文档转换为可查询的本体以增强问答能力。通过将LLM与基于图的方法相结合OntoRAG 在全面性和多样性上优于向量RAG和GraphRAG相较于 SS 和 C2 分别实现了 88% 和 65% 的胜率。然而可扩展性挑战例如本体创建的高计算成本和对特定领域提示语的依赖限制了其在生产场景中的就绪性。未来的工作将侧重于通过先进的索引技术优化计算效率扩展到更大的语料库并通过自适应提示策略将该方法推广到不同领域。表 I ONTORAG (O2) 在电气继电器数据集上针对 GRAPHAG (C0-C3) 和 SS 的定性评估结果。胜率 (%) 是 125 个问题五次重复的平均值p 值来自 Wilcoxon 符号秩检验经 Holm-Bonferroni 校正。表 II 电气继电器数据集上所有条件的基于声明的评估结果。粗体值表示最高分。
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。