
RAPTORRecursive Abstractive Processing for Tree-Organized Retrieval是一种创新的文档检索增强技术。它的核心思想是通过递归地聚类和摘要文本块构建一个多层次的树状结构从而解决传统方法只能检索短小、连续文本块无法理解长文档全局上下文的局限性。 树是如何构建的RAPTOR采用自底向上的方式构建这棵“语义树”其过程可以概括为三个主要步骤文本块向量化首先将长文档切分成若干语义连贯的短文本块chunks作为树的叶节点。然后使用一个嵌入模型如SBERT将这些文本块转换为稠密向量以捕获其语义信息。聚类与摘要生成基于文本块的向量表示使用聚类算法如高斯混合模型GMM将语义相似的块归为一组。接着利用一个大型语言模型如GPT-3.5为每个聚类生成一个简明的文本摘要。这个摘要节点就成为了树中更高一层的父节点。递归迭代构建多层结构完成一层摘要后系统会将刚刚生成的摘要作为新的“文本块”再次执行“聚类-摘要”的步骤。这个过程会一直递归迭代直到整个文档最终被提炼成一个最顶层的根摘要节点。最终我们得到了一棵层次分明的树越靠近根节点语义越抽象和宏观越靠近叶节点信息越具体和详细。 如何利用这棵树进行检索RAPTOR树构建完成后在面对用户问题时主要有两种检索策略树遍历 (Tree Traversal)从根节点开始逐层向下检索。在每一层系统会选择与问题最相似的Top-K个节点然后进入下一层只在这些节点的子节点中继续搜索直到到达叶节点层。这种方法能够按照“由粗到细”的路径定位信息。折叠树 (Collapsed Tree)这是更常用且效果更好的方法。它把树中所有层级的节点包括原始的叶节点和各层摘要节点“拉平”放入一个统一的向量数据库中。检索时系统会直接从这个“扁平”的集合中找出与问题最相关的Top-K个节点这些节点可能来自不同的抽象层次。实验证明这种方法提供了更大的灵活性能根据问题需要检索到合适颗粒度的信息。 RAPTOR的优势提升复杂问答准确率通过整合从细节到整体的多层次信息RAPTOR能更好地处理需要多步推理或综合全篇知识才能回答的复杂问题。实验表明结合RAPTOR的检索方法在QuALITY基准测试上性能提升了20%的绝对准确率。获得全局文档理解它弥补了传统RAG方法“只见树木不见森林”的短板。多粒度信息整合根据问题的不同既可以依赖叶节点找到具体的证据也可以依赖高层摘要获得主题性的宏观理解。RAPTOR的核心贡献是在文档的“细节”与“宏观主题”之间架起了一座桥梁让信息检索系统拥有了更全面的视野。在实现中聚类方法GMM、摘要模型、以及折叠树检索策略是几个需要根据具体场景仔细设计和调优的关键点。