尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

企业级AI智能体评估全攻略:从多轮对话到RAG与AI Agent!零基础小白收藏这一篇就够了!!

企业级AI智能体评估全攻略:从多轮对话到RAG与AI Agent!零基础小白收藏这一篇就够了!! 一、引言Agentic AI 的评估核心是测试你的大语言模型LLM应用确保其性能稳定。这个话题或许不算最吸引人但越来越多企业开始关注它。所以搞清楚该跟踪哪些指标来实际衡量性能很有必要。另外每次推送代码更新时做好评估也能防止系统出问题。因此本文研究了多轮对话机器人、检索增强生成RAG和智能体Agentic应用的常见评估指标还简要介绍了 DeepEval、RAGAS 和 OpenAI 的 Evals 库等框架帮你明确不同场景下该选哪个工具。二、传统评估方式基础入门如果你熟悉自然语言处理NLP任务的评估方法也了解公开基准测试的原理可直接跳过这部分。要是不熟悉建议先了解准确率Accuracy、BLEU 等早期指标的用途和原理以及 MMLU 这类公开基准测试的流程。2.1 自然语言处理任务的评估评估文本分类、翻译、摘要等传统 NLP 任务时我们会用到准确率、精确率Precision、F1 分数、BLEU 和 ROUGE 等传统指标。这些指标至今仍在使用但主要适用于模型输出单一、易对比的 “正确答案” 的场景。以文本分类为例任务是给每个文本分配一个标签。此时可通过准确率评估 —— 将模型分配的标签与评估数据集中的参考标签对比判断是否正确。评判标准很明确标签错误得 0 分正确得 1 分。比如用 1000 封邮件的垃圾邮件数据集训练分类器若模型正确标记了 910 封准确率就是 0.91。文本分类中我们还常使用 F1 分数、精确率和召回率Recall。对于文本摘要、机器翻译这类 NLP 任务人们常用 ROUGE 和 BLEU 指标判断模型生成的译文或摘要与参考文本的吻合度。这两个指标都会统计重叠的 n 元语法n-grams虽对比方向不同但核心逻辑一致共享的词语片段越多分数越高。不过这种评估方式比较简单 —— 若模型输出用了不同措辞分数就会偏低。总体而言这些传统指标在 “答案唯一” 的场景下效果最好但对于如今我们搭建的 LLM 应用大多不太适用。2.2 大语言模型基准测试关注行业动态的话你可能会发现每次有新的大语言模型发布都会进行 MMLU Pro、GPQA 或 Big-Bench 等基准测试。这些属于通用评估正确叫法是 “基准测试Benchmark”而非我们后续会讲的 “评估Evals”。尽管每个模型还会接受毒性、幻觉、偏见等方面的评估但最受关注的还是类似 “考试” 或 “排行榜” 的基准测试。MMLU 等数据集以选择题为主出现已有一段时间。我曾浏览过该数据集发现其中存在不少混乱之处。有些问题和答案模糊不清这让我猜测LLM 提供商可能会针对这些数据集训练模型确保模型能答对题目。这也引发了公众的担忧大多数 LLM 在基准测试中表现优异可能只是过拟合导致因此我们需要更新的数据集和独立的评估方式。2.3 大语言模型评分器LLM-as-a-judge评估这些数据集时通常可以用准确率和单元测试。但现在有个新变化 —— 出现了 “大语言模型评分器LLM-as-a-judge”。基准测试模型时团队大多仍用传统方法。只要是选择题或答案唯一的场景无需其他操作只需将模型答案与参考答案对比判断是否完全匹配即可。MMLU、GPQA 等含选择题答案的数据集就属于这种情况。对于代码测试如 HumanEval、SWE-Bench评分器只需运行模型生成的补丁或函数所有测试通过即视为问题解决反之则未解决。但可想而知若问题模糊或属于开放式问题答案就可能不稳定。这种漏洞催生了 “LLM-as-a-judge”—— 用 GPT-4 这类大语言模型对答案打分。MT-Bench 是采用 LLM 作为评分器的基准测试之一它将两个竞争的多轮对话答案输入 GPT-4让其判断哪个更好。原本依赖人工评分的 “聊天机器人竞技场Chatbot Arena”如今似乎也通过引入 LLM-as-a-judge 来扩大规模。为保证透明度也可使用 BERTScore 等语义评估工具对比语义相似度。为简洁起见这里就不详细展开现有工具了。综上团队可能仍会用 BLEU、ROUGE 等重叠指标进行快速合理性检查或在可能的情况下依赖完全匹配解析但如今的新趋势是用另一个大语言模型来评判输出结果。三、大语言模型应用的评估方法现在的核心变化是我们不再只测试 LLM 本身而是测试整个系统。只要条件允许我们仍会像以前一样用程序化方法评估。对于更细微的输出我们可以先通过 BLEU、ROUGE 这类低成本、确定性的指标查看 n 元语法重叠情况但如今大多数现代框架都会用 LLM 评分器进行评估。有三个领域值得探讨多轮对话、RAG 和智能体Agent的评估方法及相关指标。你可以看到这三个领域已定义的指标数量非常多。接下来我们先简要介绍这些指标再讲解能提供帮助的各类框架。3.1 多轮对话评估首先要讲的是多轮对话常见于聊天机器人的评估搭建方法。我们与聊天机器人互动时希望对话自然、专业机器人能记住关键信息全程不偏离主题且能准确回答问题。目前有不少常用指标可跟踪首先来看 “相关性 / 连贯性Relevancy/Coherence” 和 “完整性Completeness”。相关性用于跟踪 LLM 是否恰当回应用户查询、不偏离主题完整性若最终结果能满足用户需求则该指标得分高。也就是说只要能跟踪整个对话过程中的用户满意度我们就能进一步跟踪对话是否真的 “降低了支持成本”、“提升了信任度”以及是否 “提高了自助服务率”。其次是 “知识留存Knowledge Retention” 和 “可靠性Reliability”。知识留存机器人是否记住对话中的关键细节可靠性能否确保机器人不 “混乱”—— 不仅要记住细节还要能自我修正。在 “氛围编码工具vibe coding tools” 中我们常会遇到机器人忘记之前犯的错误、反复出错的情况这种情况就可判定为 “可靠性或稳定性低”。第三是 “角色一致性Role Adherence” 和 “提示对齐Prompt Alignment”。这两个指标用于跟踪 LLM 是否坚守给定角色以及是否遵循系统提示中的指令。接下来是与安全性相关的指标如 “幻觉Hallucination” 和 “偏见 / 毒性Bias/Toxicity”。幻觉该指标很重要但评估难度较大。有人会尝试通过网页搜索验证输出也有人会将输出拆分为不同断言用更大规模的模型LLM-as-a-judge 模式评估。还有其他方法比如 SelfCheckGPT—— 对同一提示多次调用模型查看模型是否坚持最初答案、偏离次数多少以此判断一致性。偏见 / 毒性可通过其他 NLP 方法评估例如用微调后的分类器。此外你可能还需要跟踪一些应用定制化指标比如代码正确性、安全漏洞、JSON 格式正确性等。至于评估方式并非一定要用 LLM但多数情况下标准解决方案都会采用 LLM。如果能提取出正确答案如解析 JSON自然无需使用 LLM。正如之前所说许多 LLM 提供商在评估代码相关指标时也会用单元测试。需要说明的是用于评判的 LLM 并非总是绝对可靠就像它们所评估的应用一样。但目前我没有相关数据支持这一点你需要自行调研。3.2 检索增强生成RAG评估在多轮对话评估的基础上我们再来看看 RAG 系统需要衡量哪些指标。评估 RAG 系统时需将流程拆分为两部分分别衡量检索Retrieval和生成Generation的指标。3.2.1 检索环节评估首先要评估检索环节获取的文档是否与查询匹配。如果检索环节得分低可通过以下方式优化系统制定更优的分块策略更换嵌入模型Embedding Model加入混合搜索、重排序等技术用元数据过滤等。评估检索效果既可以用依赖精选数据集的传统指标也可以用基于 LLM-as-a-judge 的无参考方法。先说说经典的信息检索IR指标它们是最早出现的检索评估指标。使用这些指标需要 “黄金答案Gold Answers”—— 即针对某个查询对每个文档进行排序。虽然可以用 LLM 构建这类数据集但评估时无需 LLM因为数据集中已有可对比的分数。最知名的 IR 指标包括 Precisionk前 k 个结果的精确率、Recallk前 k 个结果的召回率和 Hitk前 k 个结果中是否有相关文档。这些指标分别衡量获取的相关文档数量、基于黄金参考答案检索到的相关文档数量以及结果中是否至少包含一个相关文档。而 RAGAS、DeepEval 等较新的框架则引入了无参考、LLM 评分式的指标如 Context Recall上下文召回率和 Context Precision上下文精确率。这些指标通过 LLM 判断基于查询前 K 个结果中是否包含真正相关的文本块。简单来说就是判断系统是否返回了与查询相关的文档或者是否包含过多无关文档导致无法正确回答问题。构建检索评估数据集的方法有两种从真实日志中挖掘问题再由人工整理借助 LLM 使用数据集生成器 —— 多数框架中都有这类工具也有 YourBench 这样的独立工具。若你想基于 LLM 搭建自己的数据集生成器可参考以下示例# 生成问题的提示语 qa_generate_prompt_tmpl 以下是上下文信息。 --------------------- {context_str} --------------------- 根据上述上下文信息且不依赖任何先验知识 基于上述上下文生成{num}个问题和{num}个答案。... 3.2.2 生成环节评估再来看 RAG 系统的生成环节评估模型能否利用提供的文档准确回答问题。如果该环节表现不佳可通过以下方式调整优化提示词Prompt调整模型参数如温度系数 temperature更换模型针对特定领域知识微调模型强制模型通过思维链CoT模式推理检查模型的自我一致性等。评估生成环节时RAGAS 框架的指标很实用包括 Answer Relevancy答案相关性、Faithfulness忠诚度和 Noise Sensitivity噪声敏感度。答案相关性判断答案是否真正回应了用户问题忠诚度判断答案中的每个断言是否都有检索到的文档支持噪声敏感度判断少量无关上下文是否会导致模型输出偏离正确方向。以 RAGAS 为例其评估第一个指标答案相关性的方式可能是将问题、答案和检索到的上下文输入 LLM让 LLM 按 0-1 分打分“1 分” 表示答案完全贴合问题最终可根据原始分数计算平均值。综上评估 RAG 系统需将其拆分为检索和生成两个环节。既可以用基于 IR 指标的方法也可以用基于 LLM 评分的无参考方法。3.3 智能体Agent评估最后要讲的是智能体评估 —— 除了上述提到的输出、对话和上下文评估智能体还扩展了新的评估指标。评估智能体时我们不仅关注输出、对话和上下文还要评估它的 “行动能力”能否完成任务或流程完成效率如何是否能在合适的时机调用正确的工具。不同框架对这些指标的命名可能不同但核心要跟踪的两个指标是 Task Completion任务完成度和 Tool Correctness工具正确性。工具正确性评估智能体是否为用户查询调用了正确的工具。测试时需要内置包含真值的 “黄金脚本Gold Script”但只需编写一次后续每次修改系统后都可复用。任务完成度评估时需查看完整的操作轨迹和目标按 0-1 分打分并给出理由以此衡量智能体完成任务的效果。此外根据智能体的具体应用场景可能还需要测试前面提到的其他指标。需要注意的是尽管已有不少定义好的指标但不同应用场景需求不同。了解常见指标很有必要但不要默认它们就是最适合你应用的评估指标。四、实用评估框架推荐目前有很多框架可辅助评估工作本文重点介绍几个常用框架RAGAS、DeepEval、OpenAI 的 Evals 库和 MLFlow 的 Evals 库分析它们的优势和适用场景。你可以在这个代码仓库中找到我整理的所有评估框架列表。此外也可以使用一些框架专属的评估系统如 LlamaIndex尤其适合快速原型开发。OpenAI 和 MLFlow 的 Evals 更偏向 “附加工具”而非独立框架RAGAS 主要定位为 RAG 应用的指标库不过也提供其他指标DeepEval 可能是所有框架中功能最全面的评估库。但需要说明的是这些框架都具备以下功能支持在自定义数据集上运行评估可用于多轮对话、RAG 和智能体评估支持 LLM-as-a-judge允许设置自定义指标兼容持续集成CI流程。正如前面提到的它们的区别主要在功能全面性上MLFlow 最初是为评估传统机器学习管道设计的因此针对 LLM 应用的指标数量较少OpenAI 的 Evals 框架非常轻量化需要用户自行设置指标不过它提供了示例库帮助入门RAGAS 提供了不少指标且可与 LangChain 集成方便运行DeepEval 内置功能丰富甚至包含了 RAGAS 的指标。你可以在这个 GitHub 仓库中查看上述框架的指标对比表。观察这些框架提供的指标能大致了解它们的功能覆盖范围。需要注意的是提供指标的框架在命名上往往没有统一标准 —— 不同框架中名称不同的指标实际含义可能一致。例如一个框架中的 “忠诚度Faithfulness”可能和另一个框架中的 “ groundedness扎根性” 含义相同“答案相关性Answer Relevancy” 可能等同于 “响应相关性Response Relevance”。这种命名混乱给系统评估带来了不必要的麻烦和复杂性。不过DeepEval 的优势很突出它提供了 40 多种指标还推出了 G-Eval 框架可帮助快速搭建自定义指标是从 “想法” 到 “可运行指标” 最快的工具。OpenAI 的 Evals 框架则更适合需要定制逻辑的场景而非快速评估需求。据 DeepEval 团队介绍自定义指标是开发者最常搭建的功能。因此不必纠结于 “哪个框架提供了什么指标”—— 你的应用场景是独特的评估方式也应如此。那么不同场景该如何选择框架呢若需要针对 RAG 管道的专用指标且希望最小化配置工作选 RAGAS若需要功能全面、开箱即用的评估套件选 DeepEval若已在使用 MLFlow或偏好内置跟踪和 UI 功能MLFlow 是不错的选择若依赖 OpenAI 基础设施且需要灵活性OpenAI 的 Evals 框架尽管最精简更合适。此外DeepEval 还通过其 DeepTeam 框架提供 “红队测试Red Teaming” 功能可自动对 LLM 系统进行对抗性测试。其他框架也有类似功能但可能不如 DeepEval 全面。未来我计划专门探讨 LLM 系统的对抗性测试和提示词注入问题 —— 这是个很有意思的话题。五、注意事项数据集相关业务利润丰厚因此现在我们能够用其他 LLM 标注数据或为测试打分这是一个很好的发展阶段。但 LLM 评分器并非 “万能工具”你搭建的评估体系可能会像其他 LLM 应用一样存在不稳定问题。据网络信息显示大多数团队和企业会每几周进行一次人工抽样审核以确保评估的真实性。你为应用搭建的指标很可能是定制化的尽管本文介绍了不少通用指标但最终你或许还是需要自行开发适合自己的评估指标。不过了解这些标准指标仍非常有必要。希望本文能为你提供有价值的参考实现。最后为什么要学AI大模型当下⼈⼯智能市场迎来了爆发期并逐渐进⼊以⼈⼯通⽤智能AGI为主导的新时代。企业纷纷官宣“ AI ”战略为新兴技术⼈才创造丰富的就业机会⼈才缺⼝将达 400 万DeepSeek问世以来生成式AI和大模型技术爆发式增长让很多岗位重新成了炙手可热的新星岗位薪资远超很多后端岗位在程序员中稳居前列。与此同时AI与各行各业深度融合飞速发展成为炙手可热的新风口企业非常需要了解AI、懂AI、会用AI的员工纷纷开出高薪招聘AI大模型相关岗位。最近很多程序员朋友都已经学习或者准备学习 AI 大模型后台也经常会有小伙伴咨询学习路线和学习资料我特别拜托北京清华大学学士和美国加州理工学院博士学位的鲁为民老师给大家这里给大家准备了一份涵盖了AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频全系列的学习资料这些学习资料不仅深入浅出而且非常实用让大家系统而高效地掌握AI大模型的各个知识点。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】AI大模型系统学习路线在面对AI大模型开发领域的复杂与深入精准学习显得尤为重要。一份系统的技术路线图不仅能够帮助开发者清晰地了解从入门到精通所需掌握的知识点还能提供一条高效、有序的学习路径。但知道是一回事做又是另一回事初学者最常遇到的问题主要是理论知识缺乏、资源和工具的限制、模型理解和调试的复杂性在这基础上找到高质量的学习资源不浪费时间、不走弯路又是重中之重。AI大模型入门到实战的视频教程项目包看视频学习是一种高效、直观、灵活且富有吸引力的学习方式可以更直观地展示过程能有效提升学习兴趣和理解力是现在获取知识的重要途径光学理论是没用的要学会跟着一起敲要动手实操才能将自己的所学运用到实际当中去这时候可以搞点实战案例来学习。海量AI大模型必读的经典书籍PDF阅读AI大模型经典书籍可以帮助读者提高技术水平开拓视野掌握核心技术提高解决问题的能力同时也可以借鉴他人的经验。对于想要深入学习AI大模型开发的读者来说阅读经典书籍是非常有必要的。600AI大模型报告实时更新这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。AI大模型面试真题答案解析我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
返回列表