尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

读懂 RAG:从文档分片到答案生成的完整流程

读懂 RAG:从文档分片到答案生成的完整流程 RAGRetrieval-Augmented Generation检索增强生成是目前最常用的 AI 问答方案之一。它的核心思路是先从资料库里检索相关的内容再基于这些内容来生成答案——先检索再生成。RAG 会把文档切分成多个片段。当用户提出问题后系统就用这个问题在所有片段中寻找相关内容。比如在一份上百页的产品手册中可能只有三个片段真正和用户的问题相关系统就把这三个片段拿出来和用户的问题一起发给大模型。这样模型就只会感知三个相关片段而不是整个文档。通常来说RAG 分为两大部分数据的准备部分发生在用户提问前把相关文档准备好并完成预处理包含分片和索引两个环节。回答部分发生在用户提问后会触发回答问题的各个环节分别是查询处理、召回、重排和生成。一、分片Chunking分片就是把文档切分成多个片段。分片可以按照字数来分比如 1000 个字一个片段可以按照段落来分一个段落一个片段或者是按照章节分、按照页码分有很多种切分方式。但无论怎么切最终都需要把一篇文档切成多份。在实际操作中相邻片段之间通常会设置一定的重叠区域比如前后各重叠 50~200 字。这是因为如果恰好在一个关键句子的中间切断会导致上下文断裂模型无法理解。重叠可以显著降低这种边界损失。二、索引Indexing索引是将处理好的片段构建成可高效检索的数据结构的过程。最常见的是用 Embedding 模型生成向量并构建向量索引如 HNSW 等 ANN 索引结构但同时也可能构建关键词索引如 BM25、元数据索引如文档来源、时间、类别、权限标签等便于后续过滤和溯源。1.向量索引如HNSW)——按意思找书假设走进一个图书馆想找一本讲人工智能怎么帮助医生看病的书向量索引就像是图书馆把每本书的内容提炼成一个“味道”当你说“AI 辅助医疗”系统也能把你的话变成一个“味道”然后在书库里找“味道”最接近的书。HNSW/ANN可以理解成图书馆提前把书按“味道相似度”分好了区一说需求就能把你带到最可能相关的那个区域找的是“意思相近”即是关键词不一样也能找到。2.关键词索引如BM25——按“字眼”找书就像传统的书名或者目录卡片索引想找“人工智能”它就去找书名、目录、正文中明确出现了“人工智能”四个字的书出现次数越多、位置越重要。特点是找“字眼匹配”非常精准。3.元数据索引——按“标签”过滤每本书进图书馆时都会贴一些标签这本书是哪个出版社的哪一年出版的属于医学类还是计算机类这本书的阅读权限是什么公开/内部/机密元数据索引就是把这些标签整理好方便你快速过滤。特点是不判断内容相不相关而是帮你快速排除不需要的还能溯源。实际 RAG 系统里这三个往往是配合着用的先用元数据索引过滤掉你没权限看的、时间不对的文档同时用向量索引找语义相关的用关键词索引找精确匹配的最后把两边的结果合并一起进入重排和生成。这样既能理解你的意思又不会漏掉关键的专业名词还能保证数据来源可靠。三、向量与 Embedding向量从概念上来讲是有大小和方向的量通常用数组来表示。每个向量都有维度维度的大小等于数组中数字的个数。低维度的向量可以直接在坐标轴里画出来而 RAG 里面用到的向量维度通常比较大常见 768、1024、1536 维等。高维空间能容纳更丰富的语义信息但向量所包含的信息丰富程度主要取决于 Embedding 模型的质量和训练方式而非单纯由维度大小决定。Embedding 就是把文本转换为向量的过程由预训练好的 Embedding 模型完成。以爱丽丝喜欢吃水果为例假设对应的向量是 [1, 2]爱丽丝爱吃水果是 [1, 1]天气真好是 [-3, -1]实际维度远高于 2这里仅为示意。前两个句子的向量很接近说明它们语义上是相近的而后者完全不相关。含义相近的文本在经历 Embedding 之后对应的向量在空间中也是相近的。当用户询问爱丽丝爱吃什么的时候系统会先把问题做个 Embedding转化为向量然后根据向量相似度把与这个问题相关的文本找出来。常见的相似度计算方式包括余弦相似度最常用、欧氏距离和点积。余弦相似度计算两个向量夹角的余弦值值越接近 1夹角越小语义相似度越高欧氏距离则计算两个向量之间的直线距离。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
返回列表