
解决长跨度多跳搜索痛点大模型深度搜索迎来结构化方案现在大模型解决开放域复杂问题时越来越依赖深度搜索能力——通过多轮调用搜索引擎等外部工具逐步获取信息、验证证据、完成推理。但传统的深度搜索方案大多依赖线性顺序推理所有推理状态都存在不断变长的文本交互历史里处理长跨度多跳搜索时很容易出现上下文遗忘、搜索偏离目标、重复检索的问题这也是当前开源深度搜索模型需要大量训练数据才能达到不错效果的核心原因之一。本文来自国内研究团队提出的G-ReAct框架从推理状态组织的底层逻辑入手仅用不到2K训练样本就让30B规模模型在多个主流深度搜索 benchmarks上超过了远超其参数规模的大模型性能提升非常显著。论文技术速览▌核心贡献提出图结构约束下的状态演化深度搜索推理框架G-ReAct▌性能指标BrowseComp-ZH准确率52.6% | XBench-DS准确率79.0% | 数据量降低84%仍提升5个点准确率▌代码状态即将开源▌技术谱系线性ReAct推理 → 知识图辅助数据构建 → 图引导结构化深度搜索从线性文本到结构化图深度搜索推理 representation 的进化深度搜索的发展过程里其实一直存在一个有意思的不对称性大家构造深度搜索训练数据的时候会用知识图来生成带多跳依赖的问题给每个问题提供清晰的潜在推理路径相当于有一个结构化的逻辑骨架。但是到了推理轨迹构造和实际问题求解阶段这个结构化信息就被弱化甚至丢弃了又回到了ReAct的「思考-行动-观察」线性文本序列模式模型只能靠自己试错重新发现潜在的推理结构。随着搜索步数增加线性文本的问题就越来越明显多跳约束会在长上下文里慢慢消散之前已经验证过的结论会被重复搜索模型还很容易被历史里的噪声带偏慢慢偏离原始搜索目标。之前的工作大多想着通过更大规模数据、更强的教师模型、强化学习来缓解这些问题但都没有从根本上改变推理状态的表示方式。这个矛盾就是G-ReAct诞生的契机既然问题生成的时候可以用图做结构化骨架为什么问题求解的时候不能也用图来组织推理状态呢结构不变状态演化拆解G-ReAct的核心设计G-ReAct的核心设计非常巧妙把深度搜索建模成「拓扑结构固定、节点状态不断演化」的查询图推理相当于给搜索过程搭了一个固定的逻辑骨架再在骨架上不断更新搜索得到的信息形成「检索-验证-更新-引导」的闭环。整体框架流程如下图图1G-ReAct框架总览固定拓扑的查询图作为全局约束骨架和不断演化的结构化状态共同引导多轮推理实现「结构不变、状态演化」的设计。第一步查询图初始化拿到用户问题后G-ReAct首先会用大模型把问题解析成一个固定拓扑的查询图第二步图引导推理行动传统ReAct把所有推理历史都堆成扁平的文本序列没有建模多跳推理的结构依赖G-ReAct则改成了图约束的状态空间决策过程由固定查询图和不断演化的结构化状态共同引导推理。结构化状态包含三部分累计验证过的事实集合、每个抽象节点的带置信度候选实体列表、记录推理进度和约束满足情况的全局一致性状态。每一轮决策只需要当前轮次的局部交互历史跨轮的一致性完全由结构化状态保证避免了扁平历史的噪声累积和信息稀释还会根据候选实体的置信度自适应调整搜索策略高置信度就验证剩余约束中置信度先验证失败再拓展低置信度就放弃旧候选换方向搜索。第三步证据驱动状态更新一轮搜索结束后如果没有得到最终答案就会进入状态更新阶段一共分四步先从工具返回结果里提取满足原子性、可追溯性的原子事实再把原子事实映射到查询图的对应节点聚合得到新的候选实体根据约束满足比例给候选打置信度然后做全局一致性检查得到是否满足所有约束的信号最后生成下一轮搜索的探索指引告诉模型哪些约束还没验证、哪些候选需要消歧义。为了避免状态退化G-ReAct还设计了三个简单有效的机制仅追加的事实累积验证过的事实永不删除、分层候选合并重复候选保留最大置信度合并证据、高置信度候选保护高置信度候选不会丢失这保证了G-ReAct的推理状态是单调非递减的一定会收敛到不动点不会出现之前的结论被意外覆盖的问题。第四步迭代优化终止G-ReAct采用嵌套迭代架构外层最多运行K轮优化每一轮只保留结构化状态丢弃上一轮的原始交互历史既传递了推理进度又避免了长上下文退化内层每一轮做有限次数的工具调用满足终止条件就进入下一轮状态更新如果所有迭代跑完都没有收敛就从当前状态里选满足约束最多的候选生成答案。小样本超SOTAG-ReAct的实验结论我们来看G-ReAct在四个主流深度搜索 benchmarks上的实验结果核心结论都非常清晰表1四个深度搜索基准上的主实验结果pass1%首先30B规模模型就达到了新SOTA参数减少20倍性能反超。G-ReAct基于Qwen3-30B得到的结果在XBench-DS上达到79.0%准确率比671B的DeepSeek-V3.1还高7.8个点在BrowseComp-ZH上超过了357B的GLM-4.6在BrowseComp上是30B左右开源深度搜索模型的最好结果证明参数规模不是深度搜索性能的唯一决定因素推理过程的组织同样重要。其次图结构轨迹带来极高的数据效率。同样的训练数据来源G-ReAct只用16%的训练轨迹1.9K vs 11.7K就比OpenSeeker-v1-SFT在三个基准上分别提升6.1、4.2、5.0个百分点还超过了用147K训练样本的MiroThinker证明图结构轨迹携带的监督信号丰富得多大幅降低了对大规模训练数据和强化学习的依赖。表2G-ReAct不做微调直接作为推理框架在BrowseComp-ZH上的性能平均工具调用越少搜索效率越高第三作为推理时框架同时提升性能和效率。不做任何微调G-ReAct就能稳定提升现有大模型的性能给doubao-seed-2.0-pro提了6.57个点给Claude-Sonnet-4.5提了4.84个点同时还减少了平均工具调用次数说明G-ReAct抑制了冗余的试错探索把搜索引导向未解决的状态确实提升了搜索效率而不是靠更多探索换性能。最后我们来看消融实验验证两个核心组件的作用表3XBench和BrowseComp-ZH上的组件消融实验结果去掉查询图后XBench上性能下降更明显说明查询图对复杂信息聚合任务更重要去掉状态演化后两个基准上性能都出现明显下降证明状态演化对维持长跨度搜索的中间状态、减少推理漂移非常关键两个组件对G-ReAct来说缺一不可。表4XBench上不同状态更新粒度的性能对比对状态更新粒度的实验显示64K窗口的更新粒度效果最好更新太频繁会碎片化推理链太久不更新会在状态刷新前就出现上下文退化符合我们之前的设计预期。资源汇总论文来源https://arxiv.org/abs/2608.01324总结G-ReAct从推理状态表示的底层入手把深度搜索重新建模为固定拓扑查询图上的状态演化过程通过结构不变状态演化的双层设计从根本上缓解了传统线性ReAct推理的冗余检索、约束丢失、推理漂移问题。仅用1.9K训练样本就让30B规模模型在多个主流深度搜索基准上达到了媲美甚至超过千亿参数模型的性能数据效率和推理效率都得到了显著提升证明推理 substrate 的设计是深度搜索领域除了模型能力提升之外的另一个核心进步方向后续即将开源所有代码和模型权重对深度搜索推理领域的研究有很高的参考价值。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】