面试官问:RAG 为什么需要混合检索和 Rerank?
很多人的第一个 RAG 系统是这样做的文档切块转成向量扔进向量数据库然后祈祷它能搜对。搜不对怎么办换一个更贵的 Embedding 模型再祈祷一次。但生产里的 RAG 往往不是“向量检索 大模型”这么简单。真正高频的面试追问是为什么还需要 BM25、混合检索、融合和 Rerank今日面试题RAG 中为什么要做 BM25 与向量混合检索为什么召回以后还需要 Rerank如果回答“因为这样更准”方向没错但面试官大概率会继续问准在哪里两路分数怎么合Rerank 和召回有什么区别这时只会说“调个权重”就容易当场进入调参玄学频道。先给出 30 秒标准答案BM25 擅长精确词项匹配适合错误码、型号、专有名词和版本号向量检索擅长语义匹配适合同义表达和自然语言改写。混合检索通过多路召回提高候选证据的覆盖率。召回阶段的目标是尽量别漏Rerank 阶段的目标是把最能回答问题的证据排在前面。两路结果可以用 RRF 等排名融合方法合并再用 Cross-Encoder、规则特征或 LLM 对较小候选集重排。最终要分别评估召回、排序和生成不能只看答案感觉不错。一句话记忆BM25 认字向量懂意思Rerank 负责从候选人里挑最能答题的。一、为什么只用向量检索不够向量检索会把 Query 和文档映射到向量空间根据语义距离寻找相近内容。它很擅长处理这种情况用户问怎么取消已经提交的订单文档写已创建订单的撤销流程两句话用词不同但意思接近向量检索通常能把它们联系起来。可遇到下面这些内容向量检索可能不如关键词可靠错误码E_CONN_1042产品型号XPS-9315API 名称responses.create合同条款编号7.3.2人名、地名、版本号和缩写用户要找的是E_CONN_1042向量检索却热情推荐了“其他网络连接错误”。语义确实很像但报错的人只想知道眼前这个祖宗怎么修。二、BM25 和向量检索分别擅长什么# BM25字面侦探BM25 基于倒排索引和词项统计重视词在文档中的出现情况及区分度。它擅长精确关键词稀有实体编号与术语法律条款代码符号与产品名称它的弱点是对同义表达不够敏感。用户说“退货”文档只写“逆向物流”单靠字面匹配可能擦肩而过。# 向量检索语义翻译官向量检索擅长同义词改写问题自然语言描述模糊意图跨表达方式的语义匹配它的弱点是可能把“主题相近”误当成“能回答当前问题”。所以两者不是新旧技术之间的淘汰赛而是两个特长不同的队友。三、混合检索的标准执行链一个常见流程是用户问题 ↓Query 改写与过滤条件提取 ↓BM25 召回 ─────┐ ├→ 去重与融合 → Rerank → 上下文构造 → 生成答案向量召回 ──────┘# 第一步多路召回BM25 与向量检索并行各自返回 Top-K 候选。业务复杂时还可以加入标题检索、标签检索、知识图谱和结构化过滤。召回阶段宁可适当多带候选也不要过早把关键证据丢掉。# 第二步去重与归并多路结果里可能出现相同文档、重复 Chunk 或相邻片段。需要按文档 ID、Chunk ID 和内容相似度去重必要时合并连续片段。否则上下文里会出现三段几乎一样的话大模型还以为这是三位专家达成了共识。# 第三步结果融合直接把 BM25 分数和余弦相似度相加通常不稳因为两种分数的量纲与分布不同。常见方法有分数归一化后加权Reciprocal Rank Fusion简称 RRFLearning to RankRRF 不直接比较原始分数而是根据每个结果在各路中的排名累计贡献score(d) Σ 1 / (k rank(d))它的优点是简单、对分数量纲不敏感适合先建立一个稳健基线。参数仍应通过评测集选择不要把某个常见默认值当成宇宙常数。四、召回了为什么还要 Rerank因为“相关”不等于“最适合回答”。向量检索和 BM25 的主要任务是快速从海量文档中找出候选。它们需要速度和覆盖率很难对每个 Query 与文档做细粒度联合理解。Rerank 则在较小候选集上使用更强、更慢的方法判断这段证据是否真的能回答当前问题可以把它们类比成招聘召回负责从十万份简历中筛出一百份Rerank 负责认真面试这一百个人上下文窗口只录取最合适的几位如果没有 Rerank可能只是把“名字看起来像程序员”的人直接安排去修生产数据库。五、常见 Rerank 方法# 1. Cross-Encoder把 Query 和候选文档一起输入模型直接输出相关性分数。它能同时观察问题和文档的细粒度关系精度通常优于只比较两个独立向量但计算更慢所以适合对较小候选集精排。# 2. LLM Rerank让大模型根据问题比较候选证据输出排序或相关性判断。优点是能理解复杂标准缺点是成本高、延迟大还要防止位置偏差和输出不稳定。# 3. 规则与业务特征可以加入来源权威性文档新鲜度标题命中用户权限产品版本一致性文档状态是否有效这部分非常重要。技术相关性再高过期政策也不应该排在最新制度前面。# 4. Learning to Rank利用人工标注或点击反馈训练排序模型适合数据积累成熟的系统。但没有高质量监督数据时不要为了显得高级而强行上。算法名字很长不代表线上收益自动很大。六、RAG 优化要分层诊断一个成熟回答不能只说“加 Rerank”。应该先问问题坏在哪一层。# 如果相关证据根本没被找回来重点检查文档解析是否正确Chunk 是否切坏Metadata Filter 是否误过滤Query 是否需要改写BM25 和向量召回是否互补# 如果证据被找回但排得太后重点检查融合与 Rerank观察 MRR、NDCG 或关键证据排名。# 如果正确证据已经在前面答案仍然错误重点检查上下文是否有冲突或噪声Prompt 是否要求基于证据回答模型是否忠实引用证据输出后处理和事实校验是否有效不要召回坏了就换生成模型也不要生成坏了就怪向量数据库。RAG 是一条流水线锅应该精准地分给对应工位。七、面试官连续追问# 追问一混合检索一定比单路好吗不一定。如果语料极小、查询高度固定单路可能已经足够。是否增加链路要看离线评测和线上收益而不是看到“混合”两个字就自动加分。# 追问二Rerank 候选越多越好吗不是。候选过少可能漏掉证据过多会增加延迟和费用。应根据召回曲线、延迟预算和最终答案指标选择。# 追问三可以直接让大模型把所有文档排序吗小规模可以海量文档不现实。通常仍需快速召回缩小范围再把少量候选交给更强模型。# 追问四为什么不能只看最终答案正确率因为最终错误可能来自解析、召回、排序、上下文或生成。只看最终答案无法定位瓶颈也无法知道一次优化到底改善了哪一层。八、两分钟面试回答“BM25 和向量检索解决的是两类不同问题。BM25 擅长错误码、型号、条款号和专有名词等精确匹配向量检索擅长同义表达和语义改写。真实查询通常同时包含这两类需求所以会采用多路并行召回提高覆盖率。两路结果不能简单把原始分数相加因为量纲和分布不同。可以先去重再使用归一化加权或 RRF 做融合。RRF 只依赖各路排名对分数量纲不敏感适合建立稳健基线。召回阶段关注尽量别漏Rerank 阶段关注把最能回答问题的证据排在前面。常见重排方法包括 Cross-Encoder、LLM Rerank、业务规则和 Learning to Rank。由于这些方法较慢一般只对较小候选集使用。优化时我会分别评估文档质量、RecallK、排序指标、上下文质量和最终答案忠实度。只有逐层诊断才能知道问题到底在召回、排序还是生成而不是一出问题就换大模型。”记忆口诀BM25 负责认准名字向量负责听懂意思Rerank 负责决定谁坐前排。再缩短一点先多路捞再认真挑最后少而精地喂给模型。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】