尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

87.RAG-RAG评估说明

87.RAG-RAG评估说明 内容参考于图灵AI大模型全栈我们累死累活写出来的RAG好不好这要有一个评估标准不能我们决定好它就好我们做的RAG肯定是要跟其它服务对接的比如小程序、WEB各种各样的对接我们写完一个RAG要进行一个评估测试如果评估的能不能达到预期当没有问题了才可以正常的对接我们写RAG时会用很多东西比如父子索引、检索的方式、后处理器这些东西写完之后要测试是不是跟我们预期的一样RAG评估基本逻辑评估就是看当前的RAG在性能方面和检索和回复的效果好不好文档生成是不是正确的准确的回答问题的连贯性好不好评估主要的两个点一个是检索一个是生成就是说检索的文档正不正常、正不正确生成的文本正不正常、正不正确评估指标检索评估检索到的内容就是通过问题检索到的文档响应评估模型响应的内容就是大模型回的答案系统性能评估执行效率鲁棒性评估纠错机制就是说如果出现了错误它的改正性如何主要是检索和响应检索评估检索评估中主要看 精确度和召回率精确度精准度决定了检索到的文档与问题是不是相关的它的公式精准度 检索到的相关文档数量 除以 检索到的文档总数如果检索到了10个文档与文档相关的文档只有6个那就 6 除以 10 0.6精确度也就是百分之60召回率召回率 检索到的相关文档数量 除以 数据库中相关文档的总数相关的文档在数据库中有10个但是只检索到了6个这个的做法从知识库中手动拿出10个文档然后使用大模型针对这10个文档生成问题然后我们再拿着生成的问题用我们的RAG检索看看检索出来的文档是不是10个如果不是我们的RAG肯定有问题因为我们提出的问题都是通过文档生成的它必然跟文档是相关的精准度和召回率以谁为准这里有一个F1分数的算法可以平衡它们两个F1分数它的公式现在知识库有20个与问题相关的文档检索到了10个文档然后其中6个是相关的精准度是 6 除以10 0.6召回率是 6 除以 20 0.3F1分数是 ( (0.6 乘以 0.3) 除以 (0.6 加 0.3)) 乘以 2 0.4如下通过下方的范围可以评估出是否有问题上方F1分数是0.4它的问题就很大需要重大优化我们的RAG就是不合理F1 范围性能评价适用阶段典型场景0.5需重大优化模型原型/POC 阶段初步实验、基线测试0.5-0.7基本可用内部测试/非关键场景内部工具、非核心功能0.7-0.85良好性能准生产环境电商推荐、客服问答0.85-0.93优秀性能生产环境关键系统金融风控、医疗辅助诊断0.93接近理论上限高精度要求场景工业质检、法律条款匹配响应评估响应评估主要看 忠诚度和答案相关性忠诚度它是指生成的内容是不是和检索到的文档是一致的比如我们的文档是计算机王真好啊大模型回答的是计算机王很一般这个忠诚度就不行这个好不好是取决于我们使用的模型用的大模型不参考我给的文档答案相关性它是指的生成的答案和我们输入的问题之间语义关联程度通过这个可以评估大模型回答的问题是不是把问题核心内容回答正确有没有答非所问评估方式人工评估和自动评估人工评估如下图红框我们跟大模型对话的时候可以点赞点踩这是通过我们用户来进行人工评估这种人工评估如果评估的人价值观、世界观、人生观就有问题那么它评估出来的模型也是有问题所以一般评估的人会用专家级别的用的比较多的就是下图通过用户评估自动评估比较主流的就是通过模型或算法来评估RAG
返回列表