尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

DocNavRAG: Document-Structured Graph RAG with Stateful Evidence Construction for Complex Document Qu

DocNavRAG: Document-Structured Graph RAG with Stateful Evidence Construction for Complex Document Qu 一、研究问题与动机核心问题在复杂文档问答CDQA场景中问题通常需要跨段落、跨章节甚至跨文档整合证据。现有RAG方法要么依赖固定的图遍历策略要么使用平面化的段落检索缺乏对文档结构的有效利用导致检索到的证据“各自相关但整体不足”。关键挑战证据分散在长文档或多个文档中现有方法难以根据信息需求动态调整检索路径基于知识图谱的方法脆弱且丢失文档层级结构。核心思想将文档本身的结构组织如章节、标题、段落显式地构建为可导航的图并让一个智能体agent在该图上进行有状态的、迭代式的证据收集而不是每次都从零开始搜索。二、提出的方法DocNavRAGDocNavRAG 是一个无需训练training-free的框架包含两个主要阶段1. 离线文档图构建Indexing Stage层级恢复利用文档的布局、标题和阅读顺序恢复出每个文档的层级树文档→章节→子章节→段落。节点画像Node Profiling段落节点保留原始文本和嵌入结构节点如章节采用自下而上聚合的方式构建画像对于高层路由节点如大章节或整篇文档额外使用LLM生成摘要用于粗粒度导航。图关系构建结构边父子关系层级导航 局部邻接边同一父节点下的连续区域横向边基于引文、实体、语义相似度、社区检测四种信号构建支持跨区域/跨文档的关联扩展。最终形成一个多粒度、带结构和横向关系的文档图。2. 查询时智能体检索Query-Time Agentic Retrieval动作空间定义四种图操作LOCATE在选定粒度上搜索相关节点NAVIGATE沿层级边向上或向下移动扩大或缩小范围EXPAND沿横向边扩展到相关区域FETCH获取节点对应的源段落文本作为最终答案的依据。有状态检索智能体维护一个检索状态包括已收集的证据E待探索的候选节点C未满足的信息需求M当前焦点节点F。迭代流程每轮根据当前状态选择一个动作更新状态直到证据充分或步骤预算耗尽最后用收集到的证据生成答案。三、实验设置基准数据集ScholarQA、MDAQA大规模科学论文集合上的开放域多文档问答LongBench-v2-UserGuide、LongBench-v2-Gov长技术手册和政府文档上的单文档/跨文档问答。对比基线标准段落检索BM25、TF-IDF、稠密检索基于图的RAGLinearRAG、HippoRAG、LightRAG智能体RAGIRCoT、A-RAG。评估指标答案质量RAGAS Answer Correctness、Semantic Similarity、准确率等检索充分性Sufficient Context评估检索到的证据是否足够回答问题。四、主要结果性能提升在所有基准上DocNavRAG的答案质量均优于最强基线A-RAG平均提升7.8%检索上下文充分性平均提升17.7%。消融分析在大型文档集合如ScholarQA中层级搜索贡献最大帮助语料库级定位在长文档中状态控制和证据获取贡献最大帮助深层区域的证据补全横向导航在跨异构文档如Gov中更为重要。骨干网络泛化性在6种不同LLM骨干DeepSeek、Qwen、GPT等下DocNavRAG均一致优于A-RAG尤其在轻量级骨干上增益更明显说明其对弱能力控制器也具有鲁棒性。成本分析DocNavRAG的LLM使用成本处于中等水平高于基础检索但低于语义图构建体现了良好的质量-成本权衡。五、贡献总结首次提出一个无需训练的智能体式图RAG系统专门针对复杂文档问答场景构建了轻量级文档图既保留文档原生层级结构又通过横向边增强跨区域关联支持多粒度导航设计有状态的智能体检索流程能够根据当前证据需求动态调整检索策略直到证据充分实验验证了该方法在多个基准和骨干网络上的有效性、泛化性和合理的成本。六、局限性依赖文档具有可恢复的结构如标题、章节不适用于动态或无结构的多模态文档图是检索基底而非完整语义图导航信号与最终证据有明确界限查询时计算开销有所增加但可通过缓存和自适应预算优化。DocNavRAG 通过将文档结构化为可导航图并让智能体在该图上进行有状态的迭代检索有效解决了复杂文档问答中证据分散、检索不充分的问题在多个公开基准上取得了显著且一致的性能提升。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示摘要在大型文档集合上回答复杂问题需要跨章节和文档整合互补证据。现有的检索增强生成RAG方法结合了结构化检索与自适应推理但通常要么依赖固定的图遍历要么依赖弱结构化的接口。在此基础上我们提出了一个智能体框架该框架学习在文档内部及文档之间导航文档结构而不是重复地从零开始搜索。我们介绍了DocNavRAG它将文档层级结构和跨区域关系组织成一个可导航的图并在智能体框架内暴露图操作用于定位、导航、扩展和获取。在整个检索过程中DocNavRAG维护一个不断演变的证据状态该状态指导探索直到收集到足够的证据。我们展示了在四个长文档和多文档QA基准测试中DocNavRAG在答案质量和上下文充分性方面平均比最强的基线分别提高了7.8%和17.7%。1 引言复杂文档问答CDQA需要回答关于长文档集合的问题例如科学论文、技术手册和政府报告Li等人2024Huang等人2025bBai等人2025。所需的证据通常分散在多个章节和文档中使得现代大型语言模型LLM处理整个语料库变得不切实际尤其是当现实世界的集合超过百万令牌的上下文窗口时。图1CDQA中传统智能体检索与DocNavRAG基于图的检索的比较。检索增强生成RAG通过将语料库划分为可检索单元并选择一小部分作为答案生成的证据提供了一种可扩展的替代方案Lewis等人2020Gao等人2024。它们依赖于平面的、一次性的检索忽略了语料库结构和迭代精炼Xiang等人2025Jiang等人2023。结果检索到的段落通常单独相关但对于复杂问题来说整体不足Joren等人2025。现有方法从两个方向应对这一挑战改进语料库组织Edge等人2024Tao等人2025和增强检索控制Jiang等人2023Asai等人2024bDu等人2026。前者将文档块及其语义关系组织成图等结构化表示允许检索到达与查询直接匹配的段落之外的证据。然而这些方法通常依赖预定义的检索或遍历策略限制了它们使证据选择适应问题不断变化的信息需求的能力。后者利用智能体RAG工作流制定检索动作并迭代精炼收集到的证据。然而底层的语料库接口在结构上仍然受限平面段落集合提供的导航线索很少而LLM提取的知识图谱可能脆弱并且常常丢失文档级层级结构而这对高层路由是必需的。因此智能体反复发出全局查询而不是从广泛的文档区域移动到精确的证据。受此启发如图1所示我们提出将源文档结构暴露为一个可导航的搜索空间允许智能体从部分证据移动到仍然缺失的部分。我们介绍了DocNavRAG一个无需训练training-free的框架包含一个轻量级的基于图的语料库组织层和一个在该图上导航以自适应构建证据的智能体检索控制器。在索引时DocNavRAG将源文档的原生结构重建为多粒度层级同时保留原始段落作为可靠的证据单元。然后它在文档内部和文档之间的相关或相邻主题之间添加轻量级的水平链接。生成的图支持层级导航和关联扩展而无需昂贵语义图提取。在查询时一个检索智能体通过一组图操作与图交互基于查询和累积的证据动态调整搜索方向和粒度。每个检索到的段落都会更新证据状态并指导后续动作直到组合出足够的证据集。我们在四个CDQA基准测试上评估DocNavRAG这些基准包含多文档和长格式的科学、技术和政府文本。在答案质量方面DocNavRAG在所有基准上都优于基于段落、基于图和基于智能体的RAG基线平均比最强基线提高了个百分点。进一步的分析表明DocNavRAG在各种语料库设置和LLM骨干网络下都保持稳健同时兼具最高的答案质量和中等的LLM推理成本。我们的贡献如下我们为CDQA引入了第一个无需训练的智能体基于图的RAG系统。该模型自适应地协调图操作以检索聚焦且充分的证据用于答案生成。为了促进智能体规划我们构建了一个轻量级文档图该图捕获了文档原生结构、多粒度和跨区域关系支持文档内部和文档之间的结构化导航。在四个基准测试和六个LLM骨干网络上的实验表明与基线方法相比DocNavRAG在答案质量和检索上下文充分性方面取得了持续提升平均分别提高了7.8%和17.7%。文档原生结构、多粒度和跨区域关系支持文档内部和文档之间的结构化导航。在四个基准测试和六个LLM骨干网络上的实验表明与基线方法相比DocNavRAG在答案质量和检索上下文充分性方面取得了持续提升平均分别提高了7.8%和17.7%。2 相关工作基于图的RAG。与标准RAGLewis等人2020Gao等人2023相比基于图的RAG进一步将源语料库索引为互连图并进行图遍历以利用结构化推理Peng等人2024。近期工作的一支通过多粒度结构Edge等人2024Huang等人2025aXu等人2025和高阶关系Luo等人2025Wang等人2025Feng等人2025增强图表示。另一支则通过基于传播的方法Gutierrez等人2024Zhuang等人2025、面向路径的策略Mavromatis和Karypis2025Chen等人2026或子图精炼Hu等人2025Wu和Luo2026改进图遍历。智能体RAG。与通常遵循预定义检索工作流的标准RAG系统Lewis等人2020Gao等人2023不同智能体RAG将检索控制纳入模型的推理过程Liang等人2025允许检索工作流随执行过程中收集的信息而演变。现代智能体系统通常结合规划和迭代反思规划将问题的信息需求组织成检索和推理子目标Lee等人2024Verma等人2024而中间结果则用于评估当前证据、修改计划并确定下一个搜索方向Trivedi等人2023Jiang等人2023Asai等人2024b。近期系统进一步扩展了模型可用的检索工具范围使其不仅能决定检索什么还能选择或组合操作Du等人2026Shen等人2025。我们提出将层级文档图集成到智能体检索框架中。3 问题定义4 方法4.1 框架概述如图2所示DocNavRAG包含两个阶段离线文档图构建和查询时的智能体检索以生成答案。具体来说在索引期间源语料库被转换为一个多粒度文档图该图在保留文档原生组织的同时暴露了内容区域之间的附加关系。在查询期间一个检索智能体通过一个受限的动作接口与图交互在多个轮次中更新其检索状态并累积获取的源内容作为答案生成的证据。4.2 文档图构建我们分三个阶段构建文档图恢复每个源文档的层级结构构建层级条件化的节点画像以及添加结构和横向关系。4.2.1 文档层级恢复每个段落节点对应一个源段落并形成一个叶子节点而结构节点表示嵌套的文档范围如章节、章和整个文档。这些节点按范围包含关系组织段落节点附加到它们最窄的包围范围兄弟节点保留原始阅读顺序为下文介绍的节点画像和图关系提供了结构基础。4.2.2 层级条件化的节点画像不同层级的结构节点覆盖不同范围和粒度的源内容。在窄范围内定位内容通常需要细粒度的局部信号而在更广泛的搜索区域之间进行选择则更多地依赖于概括其整体内容的表示。因此我们区分用于高层路由的结构范围和更局部的范围并相应地构建其检索画像。4.2.3 图关系构建恢复的文档树保留了语料库的原生结构。我们包含两种互补的图关系结构边保留此层级结构和横向边连接跨区域的相关内容。4.3 基于图基底的智能体检索给定一个问题 q 和一个文档图 G检索智能体通过一个受限的图动作接口逐步收集证据该接口根据当前检索状态访问局部图区域。我们首先定义可用的操作和检索状态然后介绍多轮检索过程。4.3.1 检索智能体设置图访问操作。我们定义了一个动作空间 A包含四个互补的图访问操作。表2总结了每个操作访问的图组件和返回的节点。实现细节见附录B.2。检索状态。为了保留先前轮次中获得的信息智能体在第 t 轮维护一个紧凑的检索状态 st​。4.3.2 自适应图交互智能体从问题中推断初始证据需求 M0​并将检索状态初始化为5 实验5.1 实验设置数据集。我们在四个CDQA基准测试上进行评估。(1) 大型文档集合。ScholarQA (Asai等人2024a) 和 MDAQA (Huang等人2025b) 评估在包含137篇和792篇全文科学论文的集合上进行开放域多文档问答需要在整个集合范围内检索。(2) 长文档。LongBench-v2 (Bai等人2025) 聚焦于长文档问答。LongBenchV2-UserGuide 评估在22本技术手册上进行选项级二元验证每个问题基于单个文档LongBenchV2-Gov 评估在44份异构政府文件上进行多项选择问答这两个子集包含的文档数量较少但文档长度显著更长。完整的基准统计数据见附录表6。基线。我们比较了三种RAG范式的基线(1) 基础RAG。BM25 (Robertson和Zaragoza, 2009)、TF-IDF (Salton和Buckley, 1988) 和稠密向量检索 (Reimers和Gurevych, 2019)使用 sentence-transformers/all-mpnet-base-v2 实例化涵盖了稀疏词汇匹配和稠密语义匹配。(2) 基于图的RAG。LinearRAG (Zhuang等人2025)、HippoRAG (Gutierrez等人2024) 和 LightRAG (Guo等人2024) 分别代表了无关系图检索、知识图谱传播和混合图-向量检索。(3) 智能体RAG。IRCoT (Trivedi等人2023) 将检索与推理交错进行而 A-RAG (Du等人2026) 为LLM控制器提供了层级搜索和阅读接口。评估指标。我们使用以下指标评估检索上下文充分性和答案质量。(1) 检索上下文充分性。在所有基准上充分上下文 (Sufficient Context) 评估检索到的证据是否包含足够信息来回答问题 (Joren等人2025)在没有一致的金标准证据标注可用时提供了一个通用的检索侧度量。(2) 答案质量。对于包含开放式长格式回答的基准即 ScholarQA 和 MDAQA我们报告答案正确性 (Answer Correctness) (Es等人2023)该指标评估生成答案的语义正确性。我们还报告 RAGAS 语义相似度 (Semantic Similarity) (Es等人2023) 作为补充的基于参考的度量衡量生成答案与参考答案之间的语义重叠。对于 LongBenchV2-UserGuide我们报告选项级二元准确率而对于 LongBenchV2-Gov我们报告多项选择准确率。我们还为开放式基准报告 RAGAS 忠实度 (Faithfulness) (Es等人2023)、Token-F1 和 BERTScore-F1 (Zhang等人2020)并将结果列于附录表7。5.2 主要结果表3展示了端到端的结果。总体而言DocNavRAG在所有报告的答案质量和检索上下文充分性比较中都取得了最佳性能A-RAG 紧随其后成为最强的基线。表3主要答案质量和证据结果。Corr. 表示 ScholarQA 和 MDAQA 的 RAGAS 答案正确性而 Acc. 表示两个 LongBench-v2 子集的问题级准确率。Sim. 表示 RAGAS 语义相似度Suff. 表示充分上下文。加粗值表示每列中最佳总体结果绿色阴影和下划线值表示最强的基线。如图3所示移除任何能力都会导致性能下降而跨基准测试的共享和特定模式显示了DocNavRAG如何利用互补能力来满足不同语料库设置的检索需求。在大型文档集合如ScholarQA和MDAQA中检索跨越包含中等长度、相对独立论文的大型集合因此语料库级定位是主要挑战。相应地层级搜索贡献最大因为它扩展了搜索覆盖范围而结构导航和横向导航的影响较小因为这些设置较少强调深入的文档内遍历或已在定位区域之间的基于链接的导航。在长文档设置中LongBench-v2中显著更长的单个文档将主要挑战从语料库级定位转变为跨深层文档区域的证据补全。相应地状态控制和证据获取贡献最大因为它们分别在主题相似的局部区域中维持证据引导的搜索以及恢复未在通用高层表示中保留的源细节。LongBenchV2-Gov进一步结合了这种深度和分布在异构来源中的证据使得横向导航对于到达其他文档中的互补证据更为重要。5.3 消融分析我们使用每个基准的主要答案质量指标评估图访问和检索工作流的消融。对于图访问w/o 层级搜索 (HS) 将检索限制在局部文本单元w/o 结构导航 (SN) 移除通过层级和局部结构关系的导航w/o 横向导航 (LN) 移除通过横向链接的导航。对于检索工作流w/o 状态控制 (SC) 将证据条件化控制替换为固定的检索序列而 w/o 证据获取 (EF) 直接将中间图视图传递给生成器而不获取源文本。表4与A-RAG的骨干网络比较。每个单元格报告胜场数和括号内的平均 Δ百分点† 标记主要实验骨干网络。完整结果见附录表8。图3各基准消融效果以相对于完整系统在每项基准主要答案质量指标上的绝对下降值百分点衡量。圆形和菱形分别表示图访问和检索工作流消融加粗标识最大下降值。完整结果和细节见附录C。5.4 模型骨干网络泛化性我们进一步在不同LLM骨干网络下将DocNavRAG与A-RAG进行比较以检验其对骨干网络选择的鲁棒性。表4总结了此骨干网络敏感性分析。在24个骨干网络-基准比较中DocNavRAG在19个设置中的正确性指标上优于A-RAG平均增益为2.42个百分点。在ScholarQA和MDAQA上报告的12个语义相似度比较中它在8个设置中取得更高分数平均增益为1.20个百分点。这些跨骨干网络的一致性增益表明改进并非特定于主要的DeepSeek-v4-Flash配置。值得注意的是在较轻量级配置如DeepSeek、Qwen3.5-Flash和gpt 5.4-mini下增益通常更大突显了即使使用能力较弱的智能体骨干网络文档侧图和受限的检索过程仍然有用。5.5 不同检索范式的成本概况图4揭示了一个由语料库构建和查询时检索中LLM参与程度决定的成本谱LLM无关的索引位于低端LLM密集型的语义图构建位于高端而DocNavRAG通过选择性图画像和智能体导航位于两者之间。结合主要结果来看这种中间概况将DocNavRAG定性为一种质量导向的设计其额外的推理支持了清晰的质量提升而不会进入最高成本区间。6 结论我们提出了DocNavRAG一个无需训练的智能体GraphRAG框架用于在复杂文档问答中构建聚焦且充分的证据。它将源文档组织暴露为一个可导航的搜索空间并使用不断演变的证据状态来指导检索从广泛范围深入到互补的源段落。在四个多文档和长文档QA基准测试中DocNavRAG在答案质量和检索上下文充分性方面持续优于基于段落、基于图和基于智能体的检索基线。消融、骨干网络和成本分析进一步揭示了图访问和检索控制在各种语料库设置中的互补作用、跨不同LLM配置的有效性以及中等的推理成本概况。局限性本工作聚焦于具有可恢复组织结构的源文档集合例如科学论文、技术手册和政府文件。DocNavRAG基于文档原生信号构建包括布局、标题、阅读顺序、引文和主题关系将更具动态性或强多模态特性的来源留待未来研究。该图旨在作为一个轻量级检索基底而非完全诱导的语义知识图谱保留了源结构和导航信号与获取证据之间的清晰界限。智能体图检索也增加了查询时计算量尽管我们的成本分析将DocNavRAG置于轻量级检索基线和更昂贵的语义图流程之间未来的工作可以通过缓存、自适应预算和更小的控制器模型来减少此开销。A 实验细节A.1 数据集与评估单元表5和表6提供了补充实验设置的数据集级细节。表5指定了每个基准的评估单元、源类型、任务设置、答案格式和主要指标。表6报告了相应的语料库规模。A.2 共享文档预处理所有系统在共同的分段步骤后接收相同的源文档。文档在方法特定索引之前进行分段。短于200个标记的段落与同一章节内的相邻段落合并而长于400个标记的段落则拆分为更小的单元。我们不会跨章节边界合并因此每个结果单元仍与源文档结构对齐。A.3 评估细节指标范围。主要答案质量指标遵循每个基准的答案格式ScholarQA和MDAQA使用RAGAS答案正确性UserGuide使用选项级二元准确率Gov使用多项选择准确率。RAGAS语义相似度和忠实度仅针对开放式科学问答报告而充分上下文则作为检索侧证据完整性信号在所有四个基准上报告。聚合。分数在每个基准的评估单元上进行宏平均ScholarQA、MDAQA和Gov的原始问题以及UserGuide的88个选项级验证实例。评估器。LLM评判的指标使用Claude-Sonnet-4-6作为评估器。语义相似度基于嵌入使用 all-mnet-basev2不作为LLM评判指标处理。依据上下文。对于忠实度和充分上下文依据上下文仅包括通过 fetch_content 检索到的源文本。仅用于导航的产物包括大纲、父级范围、邻近节点、路由摘要、图画像和候选节点元数据除非通过 fetch_content 被物化为源文本否则予以排除。A.4 实现细节LLM设置。我们对所有基于LLM的组件使用 DeepSeek-v4-Flash评估除外使用 Claude-Sonnet-4-6。所有LLM调用使用温度0。嵌入与硬件。检索嵌入和RAGAS语义相似度使用 sentence-transformers/all-mnet-base-v2 (Reimers和Gurevych, 2019) 计算。嵌入计算和非LLM预处理在一台配备单张 NVIDIA GeForce RTX 3060 GPU 的机器上运行。比较协议。为公平比较所有系统在相同的预处理源块上运行并使用各自的索引和检索流程。A.5 附加结果表次要诊断指标。表7报告了开放式科学基准的忠实度、Token-F1和BERTScore-F1。这些诊断指标补充了主要的答案质量和证据完整性度量主要解释使用正确性以及如果可用答案质量的语义相似度和检索侧证据完整性的充分上下文。模型骨干网络泛化性。表8报告了在四个基准行上的补充骨干网络评估ScholarQA、MDAQA、LongBench-v2 UserGuide和LongBench-v2 Gov。DeepSeek-v4-Flash是主要实验骨干网络其余五个骨干网络是补充运行。该表报告所有四个基准行的正确性以及仅ScholarQA和MDAQA的语义相似度与主要实验中使用的指标范围一致。表7开放式科学问答的次要诊断指标。忠实度评估生成答案是否得到检索源文本的支持而Token-F1和BERTScore-F1衡量答案与参考答案的重叠度。加粗表示每个数据集和指标内的最优值下划线表示次优值。
返回列表