论文《Ontology-Guided Evidence Path Inference for Multi-hop Knowledge Graph Question Answering》本体引导的证据路径推理用于多跳知识图谱问答的核心是解决现有方法在以主题实体为中心进行扩展时遇到的两个根本性问题路径爆炸和语义错位。以下是这篇论文主要研究内容的全面总结1. 核心问题与动机问题1路径爆炸。现有方法从问题的“主题实体”开始在知识图谱中逐跳向外扩展。这种无约束的扩展会导致候选路径数量呈指数级增长路径爆炸并且这些路径的终点实体类型混杂如人物、国家、奖项等其中绝大多数与预期的答案类型无关。问题2语义错位。即使检索到的路径终点实体类型是正确的例如都是“语言”但这些路径所经过的关系可能并不满足问题的隐含约束例如问题问的是“官方语言”而路径却指向了“常用语言”导致推理证据与问题语义不符。2. 提出的方法OPI 框架针对上述问题作者提出了OPI (Ontology-guided evidence Path Inference)框架。其核心思想是利用知识图谱自带的本体类型信息来约束和引导检索与推理过程。该框架主要由三个模块构成模块一本体图构建。将庞大的实体级知识图谱抽象为紧凑的类型级本体图。本体图记录了“关系”如何连接“头实体类型”和“尾实体类型”即关系签名如(人物, 出生于, 国家)。这个抽象的图作为后续所有操作的“路线图”极大地缩小了搜索范围。模块二本体引导的双向检索。传统的检索是单向的从主题实体出发。OPI 引入了双向机制预测答案类型先让LLM预测问题期望的答案属于什么类型如“国家”。反向约束利用本体图找出所有能以“国家”作为尾实体的“最后一跳关系”如(人物, 出生于, 国家)。双向匹配检索时不是盲目扩展所有路径而是让“从主题实体出发的前缀路径”与“由答案类型确定的最后一跳关系”进行匹配只补全那些能到达正确答案类型的路径。这种方法从数学上证明可以将搜索空间从O(b^x)降低到O(b^(x-1) * β)显著抑制了路径爆炸。模块三迭代答案细化。即使经过双向检索仍可能存在类型正确但语义不相关的路径。设计了一个生成器-细化器Generator-Refiner循环生成器基于当前路径和答案上下文生成一个初步答案假设。细化器评估该假设与检索到的证据返回结构化反馈如保留/禁止哪些答案、优先/丢弃哪些路径。迭代更新根据反馈更新路径和答案上下文进入下一轮生成。循环直到答案稳定或细化器达到高置信度为止。这个机制有效过滤了类型兼容但问题无关的干扰证据。3. 实验结果与贡献性能提升显著在 WebQSP、CWQ 和 MetaQA 三个权威基准上OPI 均大幅超越了之前的最优结果在复杂的 CWQ 数据集上Hit1 提升了 8.9 个百分点。验证了各组件的有效性通过消融实验证明类型级搜索空间和检索中的答案侧约束是性能提升的关键一旦移除性能会大幅下降。纯检索模式下不经过LLM生成OPI 的 Hit1 也达到了极高的水平WebQSP 95.39%CWQ 88.95%证明其检索模块本身质量很高。高效率与鲁棒性相比前向扩展OPI 将候选路径数量减少了 98% 以上检索时间减少了 95% 以上。在不同的 LLM 主干网络如 LLaMA、Qwen和不同的提示模型GPT-4o、DeepSeek-v3组合下OPI 均能保持稳定的性能优势。论文的核心贡献在于它并非单纯地堆叠LLM的能力而是巧妙地利用知识图谱自身的“本体类型”结构作为先验知识从根本上改变了检索的范式——从“盲目的向外扩张”转变为“有目标的双向汇合”。这种方法论上的创新既解决了计算层面的效率问题路径爆炸又解决了语义层面的准确性问题语义错位为多跳KGQA提供了一个兼具高效性、可解释性和高准确率的解决方案。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示项目地址在这里。摘要知识图谱问答KGQA旨在通过对结构化事实进行推理来回答自然语言问题。现有的多跳KGQA方法主要依赖于以主题实体为中心的扩展这面临两个关键挑战搜索空间随着有噪声的混合类型路径而迅速增长并且检索到的路径可能无法满足复杂问题的语义约束。为了解决这些挑战我们提出了OPI一个用于多跳KGQA的本体引导的证据路径推理框架。OPI引入了一个以关系为中心的本体图来捕获关系的头尾类型约束为答案侧约束提供了一个紧凑的接口。基于此本体图OPI首先引入了一种双向检索机制通过将预测的答案类型映射到兼容的最后一跳关系并结合主题侧前缀扩展与答案侧最后一跳匹配从而抑制了有噪声的混合类型扩展。OPI进一步采用了一种迭代细化策略在问题上下文下重新评估检索到的路径和候选答案过滤掉类型兼容但与问题无关的证据以实现更可靠的答案预测。在WebQSP、CWQ和MetaQA上的实验表明OPI显著缩小了搜索空间在WebQSP上相较于之前的最优结果Hit1/F1分别提高了4.6/5.0个百分点在CWQ上分别提高了8.9/3.3个百分点并且在MetaQA上仅使用检索模块就达到了接近饱和的Hit1。1 引言知识图谱问答KGQA旨在通过对知识图谱中的实体和关系进行推理来回答自然语言问题并已应用于医疗保健[8]、农业[46]和多媒体[20]等领域。受大型语言模型LLM快速发展的推动近年来的研究越来越多地将LLM与KG结合以支持问题理解、推理规划和基于图谱的答案生成[33]。这些方法探索了多种策略包括迭代图探索、关系路径规划和图约束解码并推动了知识图谱上的多跳推理[22, 24-26, 40, 42, 45]。然而在大规模知识图谱上复杂的多跳KGQA仍然具有挑战性因为规模的增大、异构性和结构复杂性带来了巨大的搜索空间和模糊的推理证据[7, 10, 34]。多跳KGQA的一个常见范式是检索以主题实体为根的证据路径或子图并使用它们来推导答案。为了提高检索效率许多方法通过局部子图构建、迭代图探索和路径剪枝来控制扩展空间[40, 42, 45]。为了提高推理质量近期方法进一步引入了诸如关系路径规划、图结构化提示和基于LLM的证据推理等语义信号[22, 24-26]。尽管取得了这些进展大多数检索过程仍然主要由以主题为中心的扩展驱动它们从主题实体开始逐步探索相邻的实体和关系。因此检索常常产生大量结构上可达但与预期答案类型不一致的路径同时也引入了无法满足问题复杂语义约束的虚假候选路径。这种以主题为中心的检索范式在多跳KGQA中面临两个挑战如图1所示。第一个是路径爆炸从主题实体进行无约束的前向扩展会产生大量以异构类型结尾的候选路径其中绝大多数与预期的答案类型完全无关。如图1上半部分所示从同一主题实体开始的路径可能分支到国家、人物、奖项、俱乐部、语言和其他混合类型的终点。第二个是语义错位即使候选路径到达与答案类型兼容的实体它们仍可能违反问题的隐含约束从而偏离预期的推理语义。如图1下半部分所示几条路径可能导致看似合理的语言实体但只有同时捕获了出生国家约束和官方语言约束的路径才能提供正确的推理证据。因此一个有效的多跳KGQA框架需要具备既缓解候选路径爆炸又能识别满足问题复杂语义约束的推理链的能力。图1多跳KGQA中两个主要挑战的图示。上半部分显示以主题为中心的扩展产生许多混合类型的候选路径而下半部分显示即使与答案类型兼容的路径也可能违反问题隐含的语义约束。为了应对这些挑战我们提出了OPI一个用于多跳KGQA的本体引导的证据路径推理Ontology-guided evidence Path Inference框架。OPI没有依赖于会产生噪声混合类型路径的无约束主题中心扩展而是引入了一个以关系为中心的本体图作为证据路径推理的结构基础。该图将知识图谱抽象为类型级别的表示捕获了关系如何连接头实体类型和尾实体类型为答案侧约束提供了一个紧凑的接口。在这个紧凑接口的驱动下OPI用一个两阶段的推理范式取代了无约束的主题中心检索以应对这两个挑战。它首先利用一种双向检索机制来施加答案侧约束并在早期剪除爆炸性的搜索空间。然后应用一种迭代细化策略来过滤虚假证据并改善与问题的语义对齐。具体来说OPI利用双向检索机制来获取一组与答案类型兼容的证据路径。给定一个问题OPI预测隐含的答案类型并将其映射到一小部分与答案类型兼容的最后一跳关系。然后它将主题侧的前缀扩展与答案侧的最后一跳匹配相结合使得检索不再仅由无约束的主题中心扩展驱动。这种双向检索机制有效地抑制了混合类型路径的增长并缓解了结构性的路径爆炸。检索之后OPI应用迭代答案细化策略在问题上下文中重新评估检索到的路径和候选答案。生成器根据当前的路径和答案上下文生成一个答案假设而细化器则将该假设与检索到的证据一起评估并返回结构化的反馈。该反馈更新聚焦的路径上下文和候选答案上下文使OPI能够过滤掉类型兼容但与问题无关的证据并生成更可靠的最终答案。我们的主要贡献总结如下我们引入了一个以关系为中心的本体图它捕获了关系如何连接头尾实体类型并为答案侧约束的路径检索提供了结构基础。我们提出了一种本体引导的双向检索机制它结合了主题侧前缀扩展与答案侧最后一跳匹配以减少有噪声的混合类型扩展并缓解路径爆炸。我们设计了一种迭代答案细化策略它在问题上下文中联合重新评估检索到的路径和候选答案以过滤类型兼容但与问题无关的证据。我们在WebQSP、CWQ和MetaQA上进行了广泛的实验证明了OPI及其关键组件在不同KGQA基准上的有效性。2 预备知识在本节中我们通过定义知识图谱、其类型级抽象以及答案预测目标来形式化本文所考虑的KGQA任务。2.1 知识图谱与本体图图2一个知识图谱及其本体图的示例。本体图将实体级三元组抽象为类型级关系签名。每个关系签名 (ch,r,ct)∈S 指明在本体层面关系 r 可以将头类型为 ch​ 的实体连接到尾类型为 ct​ 的实体。知识图谱存储具体的实体级事实而本体图则通过这些关系签名捕获类型级的兼容性。图2说明了知识图谱中的实体级三元组是如何被抽象为本体图中的类型级关系签名的。2.2 知识图谱问答3 方法3.1 整体架构OPI由三个紧密相连的模块组成本体图构建、本体引导的双向检索和迭代答案细化。它首先将原始知识图谱抽象为一个以关系为中心的本体图其中每个关系由一个类型级关系签名表示。基于此本体图OPI预测问题隐含的答案类型并将其映射到一组与答案类型兼容的最后一跳关系从而实现结合主题侧前缀扩展与答案侧最后一跳匹配的双向检索。然后OPI通过生成器-细化器循环来细化检索到的证据和候选答案其中结构化反馈迭代地更新路径上下文和答案上下文。图3总结了OPI的主要推理流程。3.2 本体图构建在大型知识图谱中实体级图通常是密集且高度异构的。随着跳数的增加无约束的主题中心扩展容易产生大量有噪声的证据路径导致搜索空间快速增长。这促使我们构建一个紧凑的知识图谱类型级抽象以便将重复的实体级事实概括为更稳定的关系-类型模式。3.2.1 对于Freebase风格的知识库。当存在显式模式谓词时可以直接从模式中提取关系签名。具体来说我们从Freebase RDF转储[28]在规范命名空间 http://rdf.freebase.com/ns/ 下构建本体图。对于每个关系我们将type.properties.schema与type.properties.expected_type配对以获取其关系签名中的头类型和尾类型。前者指定关系的域类型而后者指定其预期的范围类型。这样每个模式定义的关系都可以转换为一个类型级三元组 (ch,r,ct)(ch​,r,ct​)。为了提高所得本体图的可靠性我们过滤掉非语义或管理性类型如common、topic并且只保留具有完整头-尾签名的关系。对于少数缺失或指定不足的关系我们仅使用训练集进行保守补全以避免信息泄露。具体来说我们从训练数据中聚合每个此类关系观察到的头实体集和尾实体集推断它们的主导类型并且仅当两侧都能一致地分配类型时才接受补全。该策略利用了Freebase的显式模式结构同时提高了对稀有或不完整关系的覆盖率。图3OPI的整体推理流程。左侧显示本体引导的双向检索它检索与尾类型兼容的证据路径。右侧显示迭代答案细化其中生成器-细化器循环细化这些路径和候选答案以产生最终答案。对于其他具有显式模式谓词的KG如DBpedia其中rdfs:domain和rdfs:range提供了类似的类型约束相同的构建原则自然可以扩展应用。3.2.2 对于Wiki-Movie风格的知识库。当没有显式模式谓词时关系签名直接从数据中归纳。在Wiki-Movie风格的KG中原始图不提供显式定义每个关系域类型和范围类型的模式谓词。因此我们首先从训练QA对及其关联的类型路径注释中推断实体类型。每个实体根据其最频繁出现的观测值被分配一个主要类型这减少了类型稀疏性并避免了因过于细粒度或不一致的类型分配而导致的不稳定关系签名。获得实体级类型分配后我们为每个关系聚合观察到的头-尾类型对。对于关系 r所有包含 r 的训练三元组从实体级三元组 (eh,r,et) 映射到类型级观测 (ch,r,ct)。然后我们保留主导的头-尾类型对作为 r 的关系签名。这种数据驱动的策略使得即使在没有显式模式可用的情况下也能构建本体图。更一般地对于诸如Wikidata之类的KG也可以通过P31实例 of将实体映射到类型集合并可选地使用P279子类 of对其进行泛化然后进行关系级别的头尾类型统计聚合来归纳关系签名。在两种设置下最终的本体图采用相同的形式每个关系都与一个关系签名 (ch,r,ct) 相关联。这种统一的关系签名接口使OPI适用于异构的知识图谱。更重要的是它提供了从本体构建到检索的结构性链接在下一阶段预测的答案类型正是通过这个接口被映射到与答案类型兼容的最后一跳关系。3.3 本体引导的双向检索基于上述定义的关系签名接口OPI引入了一种本体引导的双向检索机制来缓解路径爆炸。这里的双向并非指传统的从主题实体和具体答案实体进行的两侧实体级BFS。相反它意味着检索受到主题侧前缀扩展和答案侧类型约束的联合约束。具体来说OPI首先预测问题隐含的答案类型通过本体图将其映射到与答案类型兼容的最后一跳关系然后结合主题侧前缀扩展与答案侧最后一跳匹配以检索证据路径和候选答案。3.3.1 答案类型预测。关系签名接口使答案类型预测成为检索指导的自然目标。与直接预测答案实体相比答案类型预测更为紧凑和稳定具有不同表面形式和不同黄金答案的问题通常共享相同的答案侧语义类别例如人、电影或地点。在图谱检索之前预测答案类型因此提供了一个粗略但可靠的目标该目标随后可以转化为对最后一跳的结构性约束。该公式表明OPI将最后一跳的扩展从无约束的实体级分支缩减为受答案类型约束的补全。缩减程度取决于答案侧约束的选择性而非假设所有与本体兼容的关系集合都均匀地小。3.3.3 回退检索与证据重排序。如果没有预测出答案类型或者预测的答案类型无法通过关系签名接口映射到任何与答案类型兼容的最后一跳关系我们不执行答案侧约束匹配。相反我们退回到从主题实体进行以主题为中心的前向检索并枚举到有界跳数的候选路径。这种回退机制即使在答案类型指导不可用时也能保留基于图谱的证据来源。获得候选路径后我们在固定的路径预算下保留前 kk 条证据路径。在当前实现中候选路径和问题由预训练语言模型如 SentenceBERT [35]编码并在嵌入空间中衡量其语义相关性。然后保留前 kk 条路径并将其转换为可读的路径字符串。最后从保留路径的尾实体中提取候选答案确保最终答案空间始终基于明确的图证据。3.4 迭代答案细化在本体引导的双向检索之后OPI获得了一组有界的候选证据路径和从它们尾实体提取的候选答案。尽管检索阶段大幅缩小了搜索空间但剩余的路径可能仍包含竞争分支、部分相关证据或对最终答案的语义支持不完整。因此OPI不会直接返回排名最高的候选项。相反它通过生成器-细化器循环执行迭代答案细化。其中 P(0) 表示初始的重排序路径池。在当前实现中A(t) 对应于暴露给下一生成器轮的保留答案而禁止答案则通过细化反馈和显式的类型级答案约束分别注入。因此下一轮的路径上下文是在细化指导下从初始路径池重构的而下一轮的答案上下文则由细化器保留的支持答案形成。如果满足停止标准则跳过此上下文更新。3.4.3 迭代修正与停止。OPI基于两个信号采用自适应停止策略细化器置信度和答案稳定性。细化器输出一个离散的置信度等级以及结构化的修订动作。当细化器分配最高置信度等级表明当前答案得到检索证据的充分支持时细化循环终止。我们使用这个最高置信度等级作为一个保守的停止阈值以避免在证据仍然模糊时过早终止。当连续迭代后细化后的答案保持不变时OPI也会停止。这个稳定性标准捕捉了进一步细化不再改变最终预测的情况。如果任一停止条件满足OPI返回当前细化轮的答案。否则更新后的路径上下文、答案上下文、答案类型约束和细化反馈将传递给下一生成器轮。如果没有触发早期停止条件OPI将返回最后一轮细化后的答案。总体而言OPI闭环了检索到的证据与最终答案预测之间的关系。生成器在图接地检索上下文中提出答案假设而细化器将当前答案状态转换为明确的修订动作。然后相应地更新路径和答案上下文以进行下一轮。这种自适应过程有助于抑制噪声分支并提高超越单次检索和读取的答案可靠性。4 实验我们进行了广泛的实验来回答以下研究问题RQ1:OPI在WebQSP和CWQ上是否优于现有的KGQA方法RQ2:本体引导的双向检索作为一个独立的检索模块是否有效RQ3:OPI的每个组件对整体性能的贡献有多大RQ4:为什么基于本体的约束能提高检索有效性RQ5:OPI在不同的LLM主干网络下是否鲁棒RQ6:OPI能否降低检索成本和证据噪声4.1 实验设置数据集。我们在三个广泛使用的KGQA基准上评估我们的方法WebQuestionsSP (WebQSP) [47]、ComplexWebQuestions (CWQ) [41] 和 MetaQA [51]。这些基准构建在两个知识图谱上涵盖了开放领域和特定领域的QA场景。具体来说WebQSP和CWQ基于Freebase [3]而MetaQA构建在Wiki-Movie [29]上。如表1所示它们在数据集大小、推理深度和问题复杂性方面各不相同为多跳KGQA提供了一个全面的评估环境。对于Freebase设置我们在WebQSP和CWQ上评估OPI这是两个基于预处理Freebase子图的标准基准广泛用于先前工作[11, 24]。OPI从完整的Freebase转储中构建以关系为中心的本体图以获得更完整的类型级约束同时将检索和评估限制在基准子图内以进行公平比较。WebQSP包含4,737个问题主要涉及相对简单的推理答案通常位于主题实体的两跳之内。CWQ则更具挑战性包含34,699个具有组合结构和额外约束的问题通常需要最多四跳的推理。我们遵循两个数据集的标准数据划分[39]。对于Wiki-Movie设置我们采用MetaQA这是一个基于Wiki-Movie知识图谱构建的电影领域KGQA基准包含43,234个实体、9个关系和133,582个三元组。MetaQA包含超过40万个问题并根据推理深度分为三个子集MetaQA-1hop、MetaQA-2hop和MetaQA-3hop。遵循先前工作[11]我们在所有三个子集上进行评估并通过为每个问题模板随机采样一个训练实例来构建单样本one-shot设置分别为三个子集产生161、210和150个训练样本。表1实验数据集的统计信息。数据集KG#训练#开发#测试最大跳数WebQSPFreebase2,8262461,6282CWQFreebase27,6393,5193,5314MetaQA-1hopWiki-Movie96,1069,9929,9471MetaQA-2hopWiki-Movie118,98014,87214,8722MetaQA-3hopWiki-Movie114,19614,27414,2743评估指标。遵循先前工作[24, 39, 40]我们使用Hit1和F1作为主要评估指标。Hit1衡量排名第一的预测是否匹配任何黄金答案反映了top-1答案准确率。F1通过同时考虑精确率和召回率来评估预测答案集这对于具有多个正确答案的问题很重要。在消融研究中我们额外报告精确率和召回率以对预测质量进行更细粒度的分析。对比基线。我们将OPI与来自四个类别的代表性KGQA方法进行比较基于嵌入的方法、基于检索的方法、独立LLM以及KG增强的LLM方法。前两个类别涵盖了传统的KG推理模型这些模型学习KG表示或检索与问题相关的子图而独立LLM则仅使用参数化知识评估推理能力。我们进一步纳入了最近的KG增强LLM方法如ToG、RoG、ORT和GCR它们是OPI最直接的竞争者。对于MetaQA我们还与先前工作中报告的代表性方法进行比较以评估仅检索的多跳结构推理能力。实现细节。OPI使用LLaMA2-Chat-7B作为微调的主干LLM进行答案类型预测。该模型在四块A100-40G GPU上进行指令微调共三个周期批量大小为4学习率为2e-5使用余弦学习率调度热身比率为0.03。WebQSP和CWQ的联合训练时间约为4.7小时MetaQA 1-3跳数据的训练时间约为44.0小时MetaQA单样本one-shot设置为0.42小时。对于本体引导的双向检索我们根据数据集跳数统计设置最大推理深度WebQSP使用两跳CWQ使用四跳。检索到的证据路径通过问题与路径文本之间的Sentence-BERT相似度进行排序使用all-mpnet-base-v2作为排序模型每个问题最多保留256条证据路径。对于答案细化我们使用基于提示的LLM温度为0.2最大输出长度为128每个问题采样一个响应。由于不同的基于提示的模型可能表现出不同的细化行为细化轮数在验证集上选择DeepSeek-v3为三轮GPT-4o为一轮。在所有情况下OPI最多允许三轮细化并在细化器达到高置信度或连续两轮产生稳定答案时提前停止。4.2 整体评估 (RQ1)表2报告了WebQSP和CWQ上的主要结果。我们将OPI与四组代表性方法进行比较包括基于嵌入的方法、基于检索的方法、独立LLM以及最近的KG增强LLM方法。总体而言OPI在两个数据集上均取得了最佳的指标性能。取两个OPI变体在每个指标上的最佳分数OPI在WebQSP上达到了92.3的Hit1和76.8的F1。与先前最强结果相比它在Hit1上提高了4.6个百分点在F1上提高了5.0个百分点相对于ORT。在更复杂的CWQ数据集上OPI达到了76.5的Hit1和62.7的F1在Hit1上比先前指标最强结果高出8.9个百分点在F1上高出3.3个百分点。这些增益表明OPI不仅在通常组合性较少的WebQSP问题上有效而且在需要更仔细的多跳证据检索的CWQ复杂问题上也同样有效。除了整体性能我们进一步分析了不同方法类别的行为。传统的基于嵌入和基于检索的方法可以利用KG结构通过学习的表示或检索的子图但它们在组合复杂的问题上仍然表现不佳这从它们在CWQ上持续较低的分数可以看出。独立的LLM在没有显式图谱检索的情况下取得了合理的结果但它们通常落后于KG增强的LLM方法表明仅凭参数化知识不足以进行可靠的多跳KGQA。最近的KGsLLMs方法通过将LLM推理与图证据相结合进一步提高了性能但其中许多方法仍然主要从主题实体侧检索证据。随着跳数的增加这种以主题为中心的扩展可能会引入许多类型混合的路径和语义模糊的候选项。相比之下OPI将类型级的答案侧约束纳入双向检索并通过生成器-细化器循环进一步细化候选答案从而提高了证据质量和答案选择。我们还观察到两个OPI变体之间的不同优势。使用DeepSeek-v3的OPI在WebQSP和CWQ上都取得了最高的Hit1表明其具有更强的top-1答案选择能力。使用GPT-4o的OPI在两个数据集上都取得了最好的F1表明在涉及多个候选答案时具有更好的覆盖率和校准能力。尽管存在这种差异两个变体都持续优于先前的KG增强LLM方法这表明改进不依赖于特定的主干模型而主要归功于OPI的本体引导双向检索和迭代细化框架。表2WebQSP和CWQ上方法的比较。每个方法使用的主干模型显示在括号中。类型方法WebQSPCWQHit1F1Hit1F1基于嵌入KV-Mem [29]46.734.518.415.7NSM [11]68.762.847.642.4TransferNet [37]71.4—48.6—KGT5 [36]56.1—36.5—基于检索GraftNet [39]66.762.436.832.7PullNet [38]68.1—45.9—SRNSM [50]68.964.150.247.1UniKGQA [16]77.272.251.249.1独立LLMLlama-2-7B [44]56.436.528.421.4Llama-3.1-8B [27]55.534.828.122.4ChatGPT [30]59.343.534.730.2GPT-4o [31]61.843.638.232.9KG增强LLMDeepSeek-v3 [5]64.043.941.133.8ToG (GPT-4) [40]82.6—67.6—RoG (Llama-2-7B) [24]85.770.862.656.2SymAgent (Llama-2-7B) [21]55.541.335.131.2GNN-RAG (Llama-2-7B) [26]85.771.366.859.4R² (Llama-2-7B) [48]87.272.464.058.0ORT (GPT-4o) [22]87.771.865.458.7GCR (Llama-2-7B GPT-4o) [25]87.571.566.058.5OPI(Llama-2-7B GPT-4o)91.376.872.362.7OPI(Llama-2-7B DeepSeek-v3)92.374.976.559.64.3 本体引导的双向检索的有效性 (RQ2)为了进一步检验本体引导的双向检索本身是否能提供有效的图证据我们在纯检索retrieval-only设置下评估OPI。在此设置中候选答案直接从检索到的证据路径的端点提取不进行后续的基于LLM的答案生成或迭代细化。表3在WebQSP和CWQ上与复现的RoG和GCR在纯检索retrieval-only设置下的比较。方法WebQSPCWQHit1F1Hit1F1RoG-BR [24]76.9753.8452.5621.50GCR-BR [25]92.1958.0369.1239.44OPI-BR95.3939.0988.9529.78WebQSP和CWQ上的结果。表3在同一纯检索设置下比较了OPI与复现的RoG和GCR变体。OPI-BR在两个数据集上都取得了最高的Hit1在WebQSP上达到95.39在CWQ上达到88.95。改进在CWQ上尤为明显组合性问题使得以主题为中心的扩展更容易引入噪声和类型混合的路径。这些结果表明答案侧的本体约束可以有效地将检索限制在结构上更合理的端点上特别是在复杂的多跳推理下从而为后续的答案生成和细化提供有用的图接地证据。然而F1结果显示出不同的趋势。在WebQSP上OPI-BR的F1为39.09低于RoG-BR和GCR-BR。在CWQ上OPI-BR在F1上相比RoG-BR有所提高但仍落后于GCR-BR。这是因为RoG和GCR在路径构建过程中已经融入了问题级别的语义RoG提示LLM生成关系路径而GCR则进一步用图结构约束此过程。相比之下此实验中的OPI-BR主要应用答案侧本体约束来检索与答案类型兼容的端点但尚未执行完整的问题感知路径验证或答案集细化。因此其原始检索到的端点可能仍包含类型兼容但与问题无关的实体从而限制了F1。总体而言此比较表明本体引导的双向检索对于top-1答案可达性和搜索空间缩减尤为有效但答案集的完整性仍受益于后续的细化阶段。MetaQA上的结果。我们进一步在MetaQA上评估OPI的双向检索模块MetaQA中的问题更具模板化关系路径也更为规则。与WebQSP和CWQ相比MetaQA更多地依赖于结构路径匹配而非复杂的语义消歧因此适合评估纯检索推理。因此我们报告了没有额外基于LLM答案生成的纯双向检索结果因为检索到的端点已经可以直接检验结构关系路径是否能到达正确答案。此处BR表示双向检索不包括任何后续的基于LLM的答案生成。表4报告了在完整MetaQA基准上的结果。OPI-BR在所有三个子集上均取得了接近饱和的Hit1在1-hop上为100.00在2-hop上为99.99在3-hop上为99.96。OPI-BR-oneshot单样本设置也取得了非常接近的性能特别是在2-hop和3-hop问题上。这些结果表明当证据路径规则且答案侧约束可靠时本体引导的双向检索本身已能为准确的答案预测提供充分的证据。4.4 消融研究 (RQ3)我们进行消融研究以评估OPI中的三个关键设计类型级搜索空间、检索中的早期答案侧约束和迭代答案细化。所有变体使用相同的Llama-2-7B DeepSeek-v3设置。表5报告了在WebQSP和CWQ上的Hit1、F1、精确率和召回率结果。类型级搜索空间的影响。此变体移除了类型级路径空间直接从主题实体遍历原始KG。当出边数量较大时它根据每条路径与问题之间的SentenceBERT相似度保留前 kk 条路径。这一变化导致了最大的性能下降在WebQSP上Hit1/F1下降了10.19/13.95个百分点在CWQ上下降了22.37/18.54个百分点。这种性能下降表明直接进行以主题为中心的扩展容易受到大分支因子的影响。尽管基于相似度的剪枝降低了搜索成本但它可能在路径到达答案侧之前就丢弃了正确的路径。相比之下OPI使用类型级关系签名形成了一个更紧凑的搜索空间有助于在多跳扩展下保留与答案相关的路径。检索中答案侧约束的影响。此变体从检索过程中移除了答案侧约束。相反它首先执行主题侧前向扩展然后应用与答案类型兼容的最后一跳关系作为检索后过滤器。F1在WebQSP上从74.91下降到66.75在CWQ上从59.59下降到45.61表明当答案侧约束参与检索过程而非仅仅过滤已完成的路径时它们更为有效。由于相关的路径可能已经在以主题为中心的前向扩展过程中被剪枝检索后过滤无法恢复它们。尽管如此此变体仍然优于“w/o type-level search space”无类型级搜索空间的变体因为延迟的最后一跳过滤仍然可以移除一些与答案类型不兼容的端点。迭代答案细化的影响。此变体直接使用同一基于提示的LLM的单次输出作为最终答案而不应用生成器-细化器迭代。它在两个数据集上都取得了更高的Hit1和召回率但精确率和F1较低。例如与完整的OPI在CWQ上相比召回率从71.23增加到78.06而精确率从58.96下降到52.32F1从59.59下降到56.42。这表明单次生成倾向于保留更广泛的答案集但也引入了更多的假阳性。因此迭代细化并非简单地最大化覆盖率相反它用一部分激进的候选保留换取了一个更干净的答案集这表明细化更多地起到了一种面向精确率的过滤机制的作用而非最大化召回率的步骤。4.5 本体图分析 (RQ4)表6报告了Freebase和Wiki-Movie本体图的构建统计数据。结果表明所提出的构建过程在不同的模式设置下是可行的。对于提供显式模式谓词的Freebase该流程处理了来自RDF转储的71,210个模式条目并在单台机器上大约6,958秒≈1.93小时内完成。对于没有显式模式谓词的Wiki-Movie本体图直接从134,741个三元组中归纳得出构建时间约为1.17秒。这种对比主要反映了Freebase更大的规模和更丰富的模式结构同时也表明相同的本体抽象可以有效地为紧凑的领域特定KG实例化。构建的本体图覆盖了下游KGQA基准中使用的大多数关系。对于WebQSP5,726个关系中只有19个签名缺失或不完整占比0.33%。对于CWQ6,576个关系中有21个占比0.32%。此外WebQSP和CWQ共同缺失或不完整的签名有19个仅占两个数据集中6,837个唯一关系的0.28%。这些结果表明从Freebase派生的本体图几乎覆盖了所有基准关系。对于MetaQA在归纳的Wiki-Movie本体下所有9个关系都具有有效的头尾类型签名。产生的本体图相对于其底层的知识库来说也是紧凑的。Freebase本体图包含32,195个关系签名和12,369个实体类型提供了广泛的模式覆盖而无需在密集的实体级事实之上进行直接扩展。表4MetaQA上方法的比较。先前方法的结果按原始论文报告。我们的结果保留两位小数以便在接近饱和时更好地区分。方法MetaQA-1hopMetaQA-2hopMetaQA-3hopHit1F1Hit1F1Hit1F1KV-Mem [29]96.2—82.7—48.9—NSM [11]97.1—99.9—98.9—GraftNet [39]97.0—94.8—77.7—UniKGQA [16]97.5—99.0—99.1—StructGPT [13]97.1—97.3—87.0—ReasoningLM [14]96.5—98.3—92.7—KG-GPT [18]96.3—94.4—94.0—Retrieval Reasoning [12]————76.033.8RoG [24]————84.841.3BYOKG [1]95.3—81.9—75.7—ARG [49]————87.7—SymAgent [21]————57.025.8KG-Agent [15]97.1—98.0—92.1—RDPG [6]99.7—98.6—87.7—R² [48]————85.242.5OPI-BR100.0096.9499.9983.5199.9659.19OPI-BR-oneshot99.6895.6899.9483.5099.8658.60表5WebQSP和CWQ上的消融研究结果。所有变体使用相同的 Llama-2-7B DeepSeek-v3 设置。方法WebQSPCWQHit1F1精确率召回率Hit1F1精确率召回率OPI92.3274.9180.1678.9576.5259.5958.9671.23w/o type-level search space82.1360.9665.3566.4754.1541.0541.2448.13w/o in-retrieval answer-side constraint86.4366.7573.4669.9659.0845.6146.8851.90w/o iterative answer refinement93.4370.9570.0484.9681.2856.4252.3278.06表6Freebase和Wiki-Movie本体图构建的统计数据。项目FreebaseWiki-Movie模式设置有显式模式谓词无显式模式谓词输入条目71,210 个模式条目134,741 个三元组总流程时间 (单台机器)≈ 1.93 小时≈ 1.17 秒WebQSP中不完整的签名19/5,726 (0.33%)-CWQ中不完整的签名21/6,576 (0.32%)-WebQSP和CWQ共享的不完整签名19/6,837 (0.28%)-MetaQA中不完整的签名-0/9 (0.00%)本体图中的关系数32,1959本体图中的实体类型数12,36911Wiki-Movie本体图要小得多只有9个关系签名和11个实体类型但仍然保留了MetaQA所需的类型级约束。这些统计数据表明本体图作为一个轻量级的抽象它保留了检索所需的类型语义同时显著简化了多跳推理过程中使用的结构。总体而言这些结果表明本体图构建在不同异构KG设置下是可扩展且有效的。显式的模式谓词为有模式的KG提供了可靠的关系签名而模式轻量的KG则可以通过数据驱动的归纳来处理。因此本体图为多跳KGQA中的检索提供了一个轻量级且实用的类型级接口。4.6 不同LLM主干网络的影响 (RQ5)表7不同LLM主干变体在WebQSP和CWQ上的性能。微调模型基于提示的模型WebQSPCWQHit1F1Hit1F1Qwen2-1.5BDeepSeek-v391.2873.4775.7058.71GPT-4o90.6676.2871.4061.85Qwen2-7BDeepSeek-v391.0373.5175.6459.03GPT-4o90.3675.6470.5761.19Llama-2-7BDeepSeek-v392.3274.9176.5259.59GPT-4o91.3476.8372.3362.73为了检验OPI是否依赖于特定的LLM主干我们评估了微调模型和基于提示的模型的不同组合。微调模型是用于答案类型预测的任务适应型LLM包括Qwen2-1.5B、Qwen2-7B和Llama-2-7B。基于提示的模型是用于答案细化阶段的指令跟随型LLM包括DeepSeek-v3和GPT-4o。表7报告了在WebQSP和CWQ上的结果。总体而言OPI在不同的模型组合下表现出一致的良好性能。在WebQSP上所有变体都达到了超过90的Hit1和超过73的F1。在CWQ上它们也保持了强劲的性能Hit1范围从70.57到76.52F1范围从58.71到62.73。这些结果表明OPI并不局限于单一的LLM选择。相反其有效性主要源于本体引导的双向检索和迭代答案细化框架该框架可以适应不同的微调和基于提示的模型。我们进一步观察到基于提示的模型之间的互补行为。使用DeepSeek-v3的变体通常取得更高的Hit1尤其是在CWQ上表明其具有更强的top-1答案选择能力。相比之下使用GPT-4o的变体在两个数据集上都获得了更高的F1表明在涉及多个候选答案时具有更好的答案集校准能力。在微调模型中Llama-2-7B在两个基于提示的模型下都取得了最好的总体结果。尽管如此Qwen2-1.5B和Qwen2-7B仍然具有竞争力表明OPI也可以有效地与更小的答案类型预测模型协同工作。4.7 效率与鲁棒性分析 (RQ6)搜索空间与检索成本缩减。我们通过测量平均候选路径数、候选答案数和检索时间将OPI的本体引导双向检索与纯前向基线进行比较。如图4(a)和4(b)所示OPI在WebQSP上将候选路径减少了98.7%在CWQ上减少了超过99%候选答案分别减少了98.9%和99.97%检索时间分别减少了95.1%和95.3%。这些缩减表明答案侧类型约束有效地防止了不受控制的主题中心扩展。通过将最后一跳保留给本体引导的匹配OPI避免探索许多类型不兼容的证据路径从而降低了检索成本。证据清洁度与答案覆盖率。我们在答案生成之前评估检索到的证据使用精确率、召回率、黄金命中率和top-1命中率。图4(c)和4(d)显示OPI在WebQSP上将精确率提高了30.85%在CWQ上提高了23.88%并分别将top-1命中率提高了54.24%和31.12%。尽管召回率和黄金命中率略有下降但在WebQSP上仍保持在88.73%/93.98%在CWQ上为87.19%/88.98%。这表明OPI在过滤噪声证据的同时保留了大多数与答案相关的候选。自适应细化的质量-效率权衡。我们比较了固定轮次细化与自适应细化后者根据答案稳定性和细化器置信度来停止细化过程。如图4(e)和4(f)所示自适应细化在WebQSP上仅用1.31轮就达到了74.91的F1略优于固定的三轮细化。在CWQ上它以1.61轮达到59.59的F1与固定的三轮结果非常接近。这分别将平均细化轮数减少了56.4%和46.5%表明自适应细避免了不必要的迭代同时保持了答案质量。对语义挑战性问题的益处。我们比较了时间、属性/数值、约束和简单问题的初始答案和最终细化答案。图4(g)和4(h)显示了所有类别一致的F1增益。在WebQSP上最大的增益出现在简单问题上提高了5.01个百分点其次是约束问题提高了3.91个百分点。在CWQ上时间问题受益最多提高了8.23个百分点而约束和简单问题分别提高了3.37和3.13个百分点。这些结果表明迭代答案细化帮助OPI缓解了语义模糊性补充了主要解决结构路径爆炸问题的双向检索。5 相关工作5.1 多跳知识图谱问答现有的多跳KGQA方法可以大致分为基于嵌入的方法、基于检索的方法、独立LLM方法和KG增强的LLM方法。早期的基于嵌入方法如KV-Mem [29]、NSM [11]、TransferNet [37]和KGT5 [36]通过在连续空间中编码问题和实体或通过图结构传播问题感知信号来学习图感知表示。尽管有效但其推理过程通常是隐式的可能无法保留显式的多跳路径语义。基于检索的方法则在答案预测之前构建与问题相关的子图或证据路径如GraftNet [39]、SRNSM [50]和UniKGQA [16]。虽然这些方法通过暴露支持证据提高了可解释性但它们通常依赖于以主题为中心的扩展并且随着推理深度的增加可能检索到许多结构上可达但语义无关的路径。随着大型语言模型的出现独立的LLM通过提示、上下文学习或思维链推理被应用于KGQA。诸如Llama-2、Llama-3.1、ChatGPT、GPT-4o和DeepSeek-v3等模型展示了强大的语言理解和推理能力[5, 27, 30, 31, 44]但它们可能幻觉出不支持的事实并且缺乏显式的图接地证据。最近的KG增强LLM方法通过将检索到的三元组、证据路径、图结构或符号工具纳入基于LLM的推理来解决这一局限性。例如ToG在LLM指导下探索KG上的推理链[40]RoG生成关系路径以进行图接地推理[24]SymAgent将符号推理与智能体LLM行为相结合[21]GNN-RAG将图神经检索与LLM生成相结合[26]GCR则通过图上下文推理进一步改进了KG增强推理[25]。最近的工作如 R2 也强调了在KG上使用LLM进行可靠推理[48]。这些方法显著改善了基于图的答案生成但其检索阶段仍然主要受主题侧探索或检索后证据选择的驱动。相比之下OPI将答案侧类型约束引入了检索过程本身使用以关系为中心的本体图来指导最后一跳匹配并在基于LLM的答案细化之前减少噪声路径爆炸。5.2 本体与类型级指导本体和模式信息为知识图谱中的实体、关系、类型和约束提供了高层语义结构。与实体级三元组相比类型级抽象捕获了更稳定的语义规律例如关系的预期头尾类型。近年来的研究探索了使用LLM进行本体构建、增强和学习[2, 9, 43]以及从大型RDF资源或能力-问题驱动的工作流中构建本体[4, 19]。这些研究表明本体构建和丰富可以为知识密集型任务提供有用的基础。在KGQA中本体信息已被用于改善自然语言问题与图结构之间的语义对齐。例如本体引导的提示和逆向思维策略已被引入以加强多跳推理和泛化能力[17, 22]而OntoTune则通过本体驱动的自训练将LLM与领域本体对齐[23]。然而大多数现有方法仅将本体信息用作辅助信号在大型异构检索空间中提供的图接地约束有限。诸如Palantir等工业系统进一步表明本体可以作为连接数据、推理和下游操作的结构化接口[32]。OPI遵循这一动机但将其专门用于多跳KGQA它从KG本身构建一个以关系为中心的本体图并使用类型级签名将预测的答案类型映射到兼容的最后一跳关系从而整合了类型级和实体级的路径搜索。6 结论在本文中我们提出了OPI一个用于多跳KGQA的本体引导的证据路径推理框架。OPI引入了一个以关系为中心的本体图使答案侧类型约束变得明确并结合了主题侧前缀扩展与答案侧最后一跳匹配以减少噪声路径爆炸。它进一步采用生成器-细化器循环来联合重新评估检索到的证据和答案假设过滤掉类型兼容但与问题无关的候选。在WebQSP、CWQ和MetaQA上的实验表明OPI持续优于代表性的多跳KGQA方法。这些结果表明OPI为检索提供了一个紧凑且可重用的以关系为中心的本体图同时有效地缓解了多跳KGQA中的路径爆炸和语义错位问题。在未来的工作中我们计划将OPI扩展到类型信息较弱或不太可靠的知识图谱上。一个关键方向是在实体类型缺失、有噪声或仅部分可用时构建和更新关系签名以便本体引导的检索在具有良好定义模式的KG之外仍然有效。这样的扩展将拓宽OPI在开放领域和动态演化知识图谱上的适用性。