
一句话讲清楚中国科学技术大学联合团队在同一套企业语料上把四类 RAG 方法连续放大约 450 倍发现文件搜索智能体只在小语料上占优语料超过约千万词元后 BM25 持续领先而把智能体接在 BM25 之后效果又明显好于两者单独使用。论文标题BM25 Wins at Scale: A Scaling Study of Retrieval-Augmented Generation Paradigms论文链接https://arxiv.org/abs/2607.26497BM25 是一项已有数十年历史的关键词检索算法。它不理解句子的深层语义也不会自己规划搜索步骤只会根据词语是否出现、出现频率以及词语的区分度对文档做全局排序。面对向量检索、图 RAG 和能够反复调用工具的智能体 BM25 看起来并不新。可这项 RAG Scaling 研究把企业知识库从 1144 篇文档扩大到 511959 篇后表现最稳定的方案恰恰是 BM25 。小语料上直接翻查文件目录的智能体得分为 77.4 BM25 为 74.7 。语料达到约千万词元后两条曲线发生交叉。到 6.008 亿词元的完整语料 BM25 得分仍有 50.5 文件搜索智能体降至 30.7 差距扩大到 19.8 分。论文对 Scaling 交叉现象的示意小语料中文件搜索智能体的点估计更高语料继续增长后 BM25 开始领先。这项实验回答了一个在单一规模评测中看不到的问题知识库持续增长时不同 RAG 方案的准确率和成本会怎样变化单一规模评测看不到方法何时反转RAG 的基本任务是先从外部知识库找出相关证据再交给大模型回答。常见方案大致分为四类。BM25 依靠词语匹配做排序。稠密检索把问题和文档编码成向量再按语义相似度找文档。图 RAG 会提前抽取实体、关系或社区把语料组织成图。文件搜索智能体则不预建检索索引让模型像操作文件夹一样反复列目录、搜索关键词和读取文档。这些方法把成本放在了不同位置。图 RAG 在上线前付出大量构建成本文件搜索智能体把成本留到每次查询 BM25 和稠密检索的准备工作相对轻。若只在一个固定规模上比较准确率成本如何随语料增长、方法会不会在某个规模后反转都看不出来。论文控制了阅读模型、问题和评分方式只改变语料规模。一套从 1144 篇扩到 51 万篇的嵌套语料实验使用 EnterpriseRAG-Bench 。它模拟一家提供大模型推理服务的企业包含维基页面、聊天记录、工单、邮件、会议转录、客户关系记录和代码审查等九类来源。完整语料有 511959 篇文档、约 6.008 亿词元。这里的词元是模型切分文本后的计数单位一段中文或英文会被拆成若干个可处理的小片段。研究团队构造了 28 层严格嵌套的语料。最小层 有 1144 篇文档之后每层约扩大 1.25 倍直到 “严格嵌套”意味着小层中的文档会原封不动保留在所有更大层里。每次扩容只加入背景文档不更换问题也不挪动正确证据和干扰项。这样准确率下降才可以归因于搜索空间变大而不是题目突然变难。最小层专门保留了三类材料■722 篇包含正确答案的文档■326 篇讨论同一主题、但日期或事实错误的陷阱文档■99 篇与问题相似、却无法回答问题的诱饵文档。再加上两篇企业概览并去除五篇跨类别重复文档最终得到 1144 篇。若正确证据只在大语料中出现小语料天然更难若干扰文档随规模增加测到的又会是干扰强度变化。论文把两者都固定下来只让无关背景逐层增多。完整评测流程四类 RAG 访问同一组嵌套语料 500 个问题及其正确证据、事实陷阱和不可回答诱饵保持不变同时记录准确率、构建成本、查询成本和延迟。500 个问题中 470 个可由来源文档回答 10 个需要企业概览等高层材料 20 个本就没有答案。所有方案使用同一个 Qwen3.6-27B 阅读模型温度设为零需要向量的方案统一使用 Qwen3-Embedding-0.6B 。BM25 、向量检索和部分图方法每次最多返回前 5 个文本片段再由阅读模型作答。文件搜索智能体不走这条固定的前 5 条流程它最多调用大模型 80 次可以反复列目录、按固定字符串搜索和读取文档最后直接根据读到的材料回答。主实验的评分模型、提示、问题集和计费方式保持一致。官方综合分先判断答案是否与标准答案一致再计算答案覆盖了多少个必要事实。若答案出现核心错误该题综合分直接归零其中 表示答案是否与标准答案一致 表示标准答案中必要事实的覆盖率论文将后者称为“完整度”。换一个独立评分模型后两套模型对答案是否正确的判断有 96.2% 一致改用只判对错的二元协议后九个共同规模上的方法排序也全部保持不变。结果不是“BM25 从头赢到尾”最小语料层上文件搜索智能体得到 77.4 BM25 得到 74.7 。两者的 95% 置信区间分别为 73.9–80.8 和 71.4–77.9 存在重叠因此这里不能断言文件搜索智能体稳定胜出只能说这次实验得到的分数更高。随着语料扩大文件搜索智能体的得分下降得更快。约在 1000 万词元附近 BM25 完成反超再往后的每一个共同测试规模 BM25 都保持领先。主结果曲线。横轴是语料词元规模纵轴是官方综合分文件搜索智能体在大规模端快速下滑图 RAG 曲线则在各自无法继续完成构建的位置提前结束。主结果表还揭示了另外两点。稠密检索成本低但准确率始终低于 BM25 多种图 RAG 在达到完整语料前就停止了因为索引构建无法在资源范围内完成。在 511959 篇文档的完整语料上 BM25 、文件搜索智能体和 DenseRAG 分别得到 50.5 、 30.7 和 29.9 图方法行中的破折号表示该规模未完成索引构建。最右两列是最小语料层的必要事实覆盖率和标准证据文档召回率。到完整语料时 BM25 、文件搜索智能体和稠密检索分别得到 50.5 、 30.7 和 29.9 。 HippoRAG 2 与 LinearRAG 最多建到 131876 篇文档 MS-GraphRAG 到 8750 篇 LightRAG 到 2254 篇。主结果没有把未完成实验记为零曲线只展示真正完成的实验只有在专门衡量“能否部署到各个规模”的覆盖率汇总中无法构建的层才按零处理。这套文件搜索智能体的主要瓶颈是找文档文件搜索智能体在小语料上有优势并不难理解。它可以先查看目录根据中间结果修改搜索词再打开更多文档。碰到跨文档汇总、项目关系或事实冲突问题时这种多步探索确实比一次检索更灵活。问题是它面对的是一棵不断长大的文件树。每一步只能看到局部结果之前走错的分支还会影响之后的搜索。语料越大相关分支越难在有限调用次数内被发现。BM25 先在整个语料中统一排序再把前 5 个文本片段交给阅读模型。 BM25 本身不做推理但每次都会搜索整个知识库不受智能体当前浏览到哪个目录的限制。论文用一个匹配对照把这两个因素拆开保留同一个智能体模型、工具调用流程、问题、评分模型和 80 次调用预算仅把原始文件搜索替换成 BM25 排序工具。这个组合被称为 AgentBM25 。方法150 题得分文档召回每问词元BM2554.865.65.8K文件搜索智能体36.936.8895KAgentBM2569.472.4101K这组对照只在完整语料层上使用固定的 150 个问题重新评分因此 54.8 和 36.9 不能与前文 500 题主表中的 50.5 和 30.7 直接混用同表三种方法使用的是同一批题可以公平比较。这里的文档召回表示检索结果覆盖标准证据文档的比例。换掉检索入口后智能体的全量得分从 36.9 升到 69.4 文档召回从 36.8 升到 72.4 平均调用次数从 36.12 次降到 5.79 次每问词元也从 895K 降至 101K 。在两种方法都至少找到一篇正确文档的样本中文件搜索智能体得分为 85.9 BM25 为 73.8 。这表明文件搜索智能体读到证据后综合和推理并不弱。它真正的问题是完整语料上的正确文档命中率只有 39.0% BM25 则有 71.6%。因此论文支持的结论比“智能体不适合检索”更具体智能体适合在全局排序给出的候选集合上继续推理不适合用有限次数的局部目录探索替代全局候选发现。图方法先付构建成本文件搜索智能体逐次付查询成本图 RAG 会先用模型从语料中抽取实体与关系。这个索引可以支持关系扩展和图上搜索但语料增长时每个文本块都要经历抽取、合并或嵌入。HippoRAG 2 的构建成本近似线性增长外推到完整语料约需 29 亿生成词元和 3 个单实例日。 MS-GraphRAG 约需 79 亿词元、 50 个单实例日。这里的“单实例日”是按论文实测吞吐量让一份构建程序连续运行一天所完成的工作量并不等于所有硬件都要花同样时间。LightRAG 的成本拟合指数为 1.36 意味着语料扩大 10 倍时构建词元约增加 23 倍。完整构建外推约需 1020 亿词元和 4 个单实例年。这些是根据已经完成的构建层拟合出的成本估计不是隐藏的准确率结果。并行运行可以缩短日历时间却不会减少总计算量也不会改变已经测得的准确率。索引构建成本随语料规模增长。 LightRAG 的斜率最陡 DenseRAG 和 LinearRAG 的空心标记表示嵌入词元而非生成模型调用。文件搜索智能体不需要预建索引但每次回答都要承担多轮模型调用。在最小层 BM25 每问约用 5.8K 词元文件搜索智能体约用 226K 相差 39 倍。语料增至 21614 篇文档时文件搜索智能体升到 343K 约为 BM25 的 60 倍。多轮调用还会增加等待时间。 BM25 、稠密检索和 HippoRAG 2 的查询开销基本稳定文件搜索智能体必须等上一轮工具结果才能决定下一步延迟随着探索深度快速上升。单个问题从开始到完成的时间。文件搜索智能体的中位延迟在大语料端升至千秒量级浅色区域覆盖中间 80% 的查询耗时。到完整语料文件搜索智能体有 31% 的问题耗尽 80 次调用预算。不过尚未耗尽预算的问题准确率也在下降所以性能损失不能只归咎于被强制截断。不同方法调用的模型大小不同直接比较词元数并不公平。论文按模型参数量换算向量模型的调用再将构建成本与 500 次查询的在线成本相加对六个固定语料层取平均。按这个统一口径 BM25 位于低成本、高准确率的一端。文件搜索智能体即使在小语料上保持较高准确率单次查询成本也已经更高图 RAG 的主要成本则发生在查询前。六个固定规模上的准确率—成本汇总。越靠左成本越低越靠上准确率越高 BM25 位于帕累托前沿的低成本端。BM25 领先也有明确的任务边界这套企业基准包含大量准确的产品名、项目名、日期和版本号。事实陷阱往往在语义上很接近正确文档只改错了时间或结论。 BM25 的精确词语匹配在这种环境中天然有利。研究团队专门改写了一部分问题降低原始措辞与文档之间的直接重合也把检索深度从前 5 个文本块增加到前 10 个。 BM25 在这些对照中仍然高于稠密检索和可比较的图方法说明优势并非只来自照抄问题词语或较小的候选数量。但按题型拆开后文件搜索智能体在 42587 篇文档规模上仍有自己的强项。它在需要从一篇长文中定位多处信息、串联多个项目、列全所有事项、辨别冲突记录的四类问题上领先 BM25 其中“列全所有事项”一类是 56 对 27 。 BM25 则在其余五类问题上最好或并列最好。不同题型的综合分。文件搜索智能体在需要汇总和处理冲突的问题上更有优势 BM25 在多数精确查找类问题上更稳定。图 RAG 的短板也与这套数据有关。最小层中抽取出约 3.2 万个实体其中包含格式错误的碎片语义相似但事实错误的文档又容易在图中被连到同一组相关节点。HippoRAG 2 会丢弃“属于”“发布于”这类描述实体关系的文字使部分关系含义进一步损失。 LinearRAG 建图时不调用生成模型在最小层与 MS-GraphRAG 、 LightRAG 只差 1.8 分左右。花更多计算抽取实体和关系并没有带来相应的准确率提升。所以这项研究不能证明 BM25 在所有知识库、所有语言和所有关系推理任务上都最好。它证明的是在包含精确词汇锚点、过期事实陷阱和数十万篇文档的企业式语料中先做便宜的全局词语排序再让智能体处理少量候选比让智能体从原始目录开始探索更准确也更省查询成本。单一规模的排行榜容易把局部领先误写成普遍结论。对包含大量产品名、日期、版本号和过期记录的企业知识库更稳妥的默认架构是让 BM25 负责全库检索再把少量候选交给智能体。论文没有给出查询量变化时的成本分界点实际部署仍需用本地语料和调用频率重新测算若任务主要依赖关系推理或问题与文档措辞差异较大方法排序也要重新测试。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】