技术方案-文档向量化及构建RAPTOR树)
文档向量化文档向量化将文档块进行向量化编码用于后续的向量检索步骤如下图所示。文档向量化示意图具体而言将切分后文档块作为输入对其中的每个文档块应用向量化模型生成相应的向量并汇总这些向量以形成集合作为输出。本方案采用通用向量化模型BGE对文档分块进行向量化处理将每段文档映射为高维的密集向量以便于后续的检索操作。BGE模型对于短查询到长文档的检索任务每个短查询需要查询指令前缀开头以提高检索效果如下式所示。〖emb〗_query〖LM〗encode (concat(〖query〗(〖instruction〗_prefix ),query))其中〖LM〗_encode指和本文块嵌入使用同一模型concat·表示将查询指令前缀和原始的查询拼接。构建RAPTOR树构建RAPTORRAPTOR:RECURSIVE ABSTRACTIVE PROCESSING FOR TREE-ORGANIZED RETRIEVAL递归抽象处理树状检索树按照语义对文档块做聚类形成多个cluster。按照语义对chunk文档块做聚类形成多个cluster簇利用LLM给每个cluster内的文档生成摘要总结并为对总结也生成embedding作为树的非Leaf叶节点越接近Root根节点语义越精简。RAPTOR树构建流程示意图