尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

美团开源LoHoSearch:用知识图谱校准搜索智能体,评测长链条复杂任务

美团开源LoHoSearch:用知识图谱校准搜索智能体,评测长链条复杂任务 1. 从“幻觉”到“校准”为什么我们需要新的搜索智能体评测基准最近在跟几个做搜索和RAG检索增强生成的朋友聊天大家普遍有个头疼的问题现在的AI模型尤其是大语言模型驱动的搜索智能体回答起问题来“幻觉”频发一本正经地胡说八道。你问它“美团外卖的配送费政策”它可能给你编一个“满20元免配送费”的规则听起来挺像那么回事但跟实际情况差了十万八千里。这种“幻觉”在通用闲聊里或许还能容忍但在搜索这种强事实性、强时效性的场景里就是致命的缺陷。我们需要的不是一个能说会道的“故事大王”而是一个能精准找到事实、给出可靠答案的“信息侦探”。这就是美团开源LoHoSearch这个评测基准的核心背景。它瞄准的不是模型“会不会说话”而是模型“知不知道自己在说什么”。LoHoSearch这个名字很有意思LoHo是“Long-Horizon”的缩写直译是“长视野”但我觉得更贴切的理解是“长链条、多步骤”的复杂搜索任务。它试图回答一个关键问题当用户提出一个复杂、需要多步推理和事实核查的问题时当前的搜索智能体到底表现如何更重要的是我们如何科学、量化地评估这种表现这背后是业界对AI能力认知的一次重要“校准”——从关注华丽的语言生成转向关注扎实的知识获取与推理能力。2. LoHoSearch基准拆解它到底在测什么要理解LoHoSearch的价值我们得先把它拆开来看。它不是一个简单的问答数据集而是一个结构化的、基于知识图谱的评测体系。我们可以把它看作一个给搜索智能体准备的“高考”试卷设计得非常精巧。2.1 核心评测维度从“找得到”到“用得好”LoHoSearch的评测主要围绕两个核心能力展开这也是一个合格搜索智能体的基本功第一层检索能力Retrieval。这考的是“找得到”信息。给定一个用户问题智能体需要从庞大的知识库在LoHoSearch里是一个精心构建的知识图谱中精准地找到与问题相关的所有事实片段facts。这听起来简单实则挑战巨大。比如用户问“北京有哪些提供川菜和烤鸭的餐厅”智能体需要能同时理解“川菜”、“烤鸭”、“北京”、“餐厅”这几个概念并在知识图谱中准确找到同时满足这些条件的实体餐厅及其属性。这里涉及到对用户意图的深度理解、对查询语句的精准解析以及在图谱中的高效遍历。第二层推理与生成能力Reasoning Generation。这考的是“用得好”信息。仅仅找到一堆事实碎片还不够智能体需要将这些碎片组织起来通过逻辑推理生成一个连贯、准确、完整的自然语言答案。继续上面的例子智能体找到了三家符合条件的餐厅它需要判断这些信息的完整性比如是否有地址、评分、人均消费然后组织成“根据您的需求为您推荐以下三家同时提供川菜和烤鸭的北京餐厅1. XX餐厅地址…评分……”这样的回答。这一步模型要避免引入无关信息更要杜绝基于不完整信息进行“脑补”式生成。2.2 知识图谱作为“标尺”校准事实的锚点LoHoSearch最关键的创新在于它引入了大规模、高质量的知识图谱作为评测的“事实标尺”。这个知识图谱不是网上随便爬取的数据而是经过清洗、对齐和结构化处理的高质量知识集合包含了实体、属性、关系等。它的作用至关重要提供标准答案对于评测集中的每一个问题都可以从知识图谱中推导出唯一或一组确定的正确答案ground truth。这解决了传统评测中“答案模糊”或“主观评判”的问题。量化检索效果我们可以精确计算智能体检索到的实体/关系集合与标准答案集合之间的重合度如精确率、召回率从而客观评价其检索的准确性。检测生成幻觉将智能体生成的最终答案与知识图谱中推导出的标准答案进行比对可以清晰地识别出哪些部分是事实来源于图谱哪些部分是模型自行添加的“幻觉”。这为评估生成质量提供了可量化的指标。可以这么说没有这个高质量的知识图谱作为基准所有的评测都像是在黑暗中射击无法判断命中的是靶心还是空气。LoHoSearch通过引入这个“标尺”第一次让搜索智能体在事实性任务上的能力变得可测量、可比较。3. 实战视角如何利用LoHoSearch评估你自己的智能体开源一个基准的意义在于让大家能用。那么作为一个开发者或研究者我们该如何将LoHoSearch应用到自己的搜索智能体项目中呢这个过程可以分解为环境准备、数据对接、评测运行和结果分析四步。3.1 环境与数据准备首先你需要从GitHub上克隆LoHoSearch的官方仓库。通常这类项目会提供详细的安装说明。你需要准备一个Python环境建议3.8以上然后通过pip install -r requirements.txt安装所有依赖。依赖项可能包括深度学习框架如PyTorch、图谱处理库、评测指标计算库等。接下来是最关键的一步理解数据格式并接入你的智能体。LoHoSearch的评测数据通常以JSON或JSONL格式提供。每个样本可能包含以下字段{ qid: 问题唯一ID, question: 用户提出的自然语言问题, golden_entities: [标准答案涉及的知识图谱实体ID列表], golden_relations: [标准答案涉及的关系列表], golden_answer: 从知识图谱推导出的标准文本答案 }你的任务是编写一个“适配器”将你的搜索智能体封装成一个符合LoHoSearch调用规范的函数或类。这个适配器需要接收一个question字符串然后调用你的智能体内部流程检索生成最终返回两个结果retrieved_entities: 你的智能体检索到的实体ID列表。generated_answer: 你的智能体最终生成的文本答案。注意这里有个容易踩坑的地方。你的智能体内部使用的知识库与LoHoSearch评测依赖的知识图谱很可能是两个不同的数据源。LoHoSearch评测时会基于它自己的图谱来计算指标。因此你的retrieved_entities列表中的ID必须与LoHoSearch知识图谱中的ID体系保持一致。如果ID不匹配所有检索指标都会失效。通常你需要将你的内部检索结果通过实体链接Entity Linking技术对齐到LoHoSearch的实体ID上。这是评测准备中最繁琐但也最重要的一环。3.2 运行评测与核心指标解读当你准备好适配器后就可以在评测集上批量运行你的智能体了。运行结束后LoHoSearch的评测脚本会自动计算一系列指标。理解这些指标的含义比单纯看分数更重要。检索阶段指标精确率 (PrecisionK)在你返回的前K个检索结果中有多少比例是标准答案中要求的正确实体。这衡量了“准不准”。召回率 (RecallK)标准答案中的所有正确实体有多少比例出现在了你返回的前K个结果中。这衡量了“全不全”。F1值精确率和召回率的调和平均数是综合衡量检索性能的常用指标。生成阶段指标BLEU, ROUGE这些是传统的文本生成评价指标通过比较生成答案与标准答案在n-gram重叠度上的相似性来打分。但它们对事实准确性不敏感。基于知识图谱的事实性指标LoHoSearch的重点事实精确率/召回率将生成答案进行信息抽取得到一组实体关系属性三元组然后与从标准答案中抽取的三元组进行比对计算。这直接衡量了生成内容在事实层面的准确性。幻觉率生成答案中包含的、无法从支持性知识图谱片段中推导出的信息比例。这个指标越低越好。在实际分析报告时不要只看总分。一个典型的分析流程是先看检索的F1值如果很低说明问题出在“源头”——智能体根本没找到关键信息后续生成再好也是空中楼阁。如果检索F1值高但生成事实性指标低那问题就出在“加工”环节——模型没能正确利用检索到的信息或者引入了幻觉。通过这种分层诊断你能快速定位智能体系统的瓶颈所在。4. LoHoSearch的启示搜索智能体研发的范式转变LoHoSearch的推出不仅仅是一个新工具更代表了一种研发范式的转变。从我过去参与搜索相关项目的经验来看它给我们带来了几个关键的启示。启示一评测驱动开发成为可能。以前我们评估搜索效果严重依赖人工评测或简单的线上A/B测试周期长、成本高、难以归因。现在有了LoHoSearch这样具备高质量“事实标尺”的基准我们可以在开发阶段就快速、自动化地评估模型迭代的效果。比如今天调整了检索器的排序算法跑一遍LoHoSearch立刻就能看到检索精确率是升了还是降了而不用等到上线后看模糊的业务指标。启示二知识图谱的价值被重新审视。在大模型时代很多人觉得有了“世界知识”压缩的LLM传统的知识图谱似乎过时了。但LoHoSearch清晰地表明在需要精确、结构化、可验证事实的场景下知识图谱作为“单一事实来源”的权威性和可靠性仍然是LLM无法替代的。未来的趋势不是二选一而是LLM负责理解与生成与知识图谱负责存储与验证的深度融合。LLM作为灵活的“接口”去理解用户问题、操作图谱图谱作为坚实的“底座”确保输出事实的准确。启示三对“智能”的定义更加务实。业界开始摒弃那些华而不实的演示转而关注智能体在解决真实、复杂问题时的核心能力知识获取的准确性、多步推理的可靠性、以及结果的可解释性。LoHoSearch benchmark里的“长视野”任务正是对这种复杂能力的考验。这提醒我们在设计自己的智能体时不能只追求回答的流畅和“像人”更要为每一步推理和每一个事实陈述设计可追溯、可验证的机制。5. 超越基准将LoHoSearch思想融入你的项目我们当然不能指望一个开源基准解决所有问题。LoHoSearch的知识图谱领域和任务类型是固定的而你的业务场景是独特的。因此更重要的不是照搬LoHoSearch而是学习其方法论并应用到自己的项目中。第一步构建你自己的“领域知识标尺”。这是最耗时但也是价值最高的一步。在你的业务领域内比如电商、医疗、法律能否梳理出核心的实体、属性和关系构建一个哪怕是小规模的、高质量的知识图谱这个图谱将成为你评测和迭代智能体的黄金标准。例如做电商客服机器人你的图谱里就要有清晰的商品、属性、促销规则、售后政策等实体及关系。第二步设计针对性的“长视野”评测任务。参考LoHoSearch的思路不要只测试单轮简单问答。收集或构造一批用户在实际使用中遇到的、需要串联多个信息点的复杂问题。例如“我想买一款预算3000元左右、适合玩《原神》的手机并且希望它的电池续航要好最近有优惠吗”“根据我过去的购买记录和浏览历史推荐几款我可能感兴趣的、本周有折扣的夏装。” 这些问题需要智能体理解多个约束条件价格、用途、续航、时间并在知识库中执行联合查询与推理。第三步实施分层评测与归因分析。像LoHoSearch一样将智能体的表现拆解为检索和生成两个阶段分别评估。当整体效果不佳时能快速定位是“没找到”还是“没用好”。在你的系统中可以为这两个阶段分别设立质量监控点。例如记录每次查询的检索结果列表及其相关性得分以及生成答案所引用的来源。当答案出错时可以回溯检查是检索源头就错了还是生成过程曲解了正确信息。我在实际项目中采用这种方法后调试效率提升非常明显。以前一个bad case出来我们要像侦探一样从头排查日志现在直接看检索和生成阶段的中间结果问题一目了然。有一次我们发现智能体在回答“某型号手机是否支持5G”时频繁出错通过分层检查立刻发现是检索环节的查询理解模块错误地将“5G”识别成了“第五代游戏”导致检索方向完全错误而非生成模型的幻觉。没有这种分层评测体系我们可能要在生成模型上白费好几周的调优功夫。最后我想说的是LoHoSearch这类基准的出现标志着AI应用正在从“炫技”走向“务实”。它为我们提供了一把尺子让我们能更清醒地认识手中模型的能力边界也指明了提升方向——让AI变得更可靠、更可信。这把尺子本身可能不完美也可能不完全适合你的场景但它所代表的“用事实校准AI”的思想无疑是当前构建实用化、高价值搜索智能体的必经之路。
返回列表