尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

RAG逻辑思路与实战痛点

RAG逻辑思路与实战痛点 一、什么是 RAGRAG 全称Retrieval‑Augmented Generation 检索增强生成。核心思想不把全部私有知识塞进大模型参数外部知识库检索出相关片段把检索到的上下文和用户的问题一起交给大模型让大模型基础资料去回答RAG解决什么问题1. 大模型幻觉模型编造不存在的事实有参考文档约束减少胡说八道。2.知识截止时间大模型训练数据有时间上限新业务数据不需要重新微调模型。3.私有知识库企业内部文档、PDF、业务资料不需要训练/微调直接拿来做问答。4.成本微调大模型成本高RAG是检索提示词工程改知识库不需要重新训练模型。可能的面试考点RAG 和微调的区别RAG检索阶段外部拿资料不改动模型权重适合知识经常变更的场景微调修改模型权重适合学习风格、输出格式、复杂指令知识频繁更新场景不适合微调二、RAG 整体架构两大模块离线知识库构建 在线问答推理1.离线构建入库流程业务文档——信息提取——文档切分Chunk——Embedding向量化——存入向量数据库2.在线推理用户提问流程用户提问——问题向量化——向量库相似度检索——获取上下问Context——拼接Prompt问题检索片段——大模型生成回答 ——返回给用户流程图通俗解读用户输入问题对用户问题做 Embedding转为向量在向量数据库做相似度检索召回和问题最匹配的文档片段 Context将用户问题 检索出来的参考上下文组装成 Prompt 喂给大模型大模型参考提供的资料生成答案返回用户补充RAG 可以和 Function‑Calling 工具调用并存应用程序可以同时调用 Tools 工具和 RAG 检索知识库。三、商业化 RAG 完整落地步骤A信息提取原始业务数据PDF、Word、Excel、TXT解析提取文本内容坑PDF 扫描件、图片表格普通文本提取拿不到内容需要 OCR。B文档切分Chunk把文档切割成多个小块Chunk。可能的面试考点Chunk 大小怎么选Chunk太大单块包含很多无关信息检索噪声大。Chunk太小语义被切割破坏上下文不完整丢失完整语义。常用策略固定长度切分、递归字符切分、基于语义切分 、标题感知切分。C Embedding向量化把文本Chunk转化成向量向量可以表征文本语义含义语义相近向量距离越近相似度越高选型开源 Embedding 模型 / 厂商 API Embedding维度、召回效果、速度、成本需要权衡。用户查询链路1.用户提出问题2.用户问题同样做Embedding转为向量3.在向量数据库做相似度检索返回Top-N相关的文档片段Context4.把 用户问题检索到的Context 组长成prompt提交给大模型5.大语言模型LLM基于参考资料Response返回用户四、RAG 实战中各个环节的痛点每一步出错都会导致 RAG 问答效果差不是拿到文档丢进向量库就完事。环节遇到的工程问题业务数据 信息提取PDF/Word/Excel 多格式文档怎么解析扫描 PDF 图片需要 OCR表格解析困难乱码、多余换行噪声Chunk 切分如何合理切分块块太大噪声高块太小语义断裂如何保留标题、文档层级关系Embedding 向量库选哪个 Embedding 模型向量数据库如何选型向量维度、召回速度、持久化、扩容用户问题处理用户提问是否需要预处理问题改写、查询扩展、多轮会话上下文融合检索阶段检索策略如何做相似度阈值设置召回多少条重排序 Rerank检索准确率直接决定最终回答质量Prompt 设计如何设计 Prompt约束大模型只能参考检索出来的上下文回答不知道就说不知道禁止编造输出后处理大模型输出是否要二次校验增加检查机制校验回答是否和参考文档一致五、RAG 基础优缺点总结优点解决大模型幻觉提供参考来源新增业务知识不需要重新训练大模型成本低快速落地私有知识库问答知识库可更新更新知识库文件即可不需要改动模型。缺点检索为王检索不准回答一定差检索环节是 RAG 最大瓶颈上下文窗口限制检索出来的上下文太多会超出 LLM 上下文窗口复杂多跳问答简单 RAG 效果差需要改进Self‑RAG、Agent、查询改写文档质量差、噪声多会直接污染输出。RAG效果差排查顺序文档解析——Chunk切分——Embedding模型——检索召回——Prompt约束——输出校验
返回列表