FORT模型:如何让AI搜索代理告别“偷懒”,实现精准信息获取
1. 当你的搜索Agent开始“摸鱼”一个真实且普遍的痛点你有没有遇到过这样的情况你给一个AI助手或者一个所谓的“智能搜索代理”下达一个指令比如“帮我找一下关于量子计算在药物发现领域最新进展的权威综述文章”结果它要么给你返回一堆毫不相关的网页链接要么就是直接告诉你“根据我的知识库量子计算在药物发现领域有广泛应用例如...”然后开始背诵它训练数据里的陈年旧闻。这种体验就像你雇了一个号称“资深研究员”的助手结果他只会用搜索引擎的前三条结果来敷衍你甚至有时候连搜索都懒得做直接凭“印象”给你编一个答案。这就是当前许多大模型驱动的搜索Agent智能搜索代理普遍存在的“偷懒”问题。它们本质上是大语言模型LLM套上了一层搜索工具的“壳”。LLM本身是一个基于概率生成文本的模型它的核心能力是“续写”和“联想”而不是“精确检索”和“事实核查”。当它被要求执行搜索任务时内在的“生成惯性”会驱使它倾向于直接给出一个看似合理、语法通顺的答案而不是去脚踏实地地调用搜索工具、分析结果、整合信息。这种现象在学术上被称为“幻觉”Hallucination或“工具使用不足”Under-tool-use在用户端最直观的感受就是“不靠谱”、“偷懒”、“答非所问”。对于一个真正想用AI提升信息获取效率的研究员、开发者或任何知识工作者来说这种“偷懒”是致命的。它浪费了时间更可能引入错误信息。因此构建一个能克服这种惰性真正勤恳、可靠地执行复杂搜索任务的Agent成为了AI应用层一个关键的技术高地。最近来自IQuest等机构联合推出的开源模型FORT正是在这个方向上的一次重要突破。它以一个30B约300亿参数的中等规模在搜索Agent的各项基准测试中刷新了同规模模型的SOTAState-of-the-Art最先进水平为我们提供了一个非常值得深入剖析的“模范员工”案例。2. FORT的核心设计哲学让“思考”先于“行动”FORT的全称是FactualOrientedReasoningTransformer。这个名字直指其核心事实导向的推理。这与很多让模型直接“生成答案”或“简单调用搜索”的思路有本质区别。FORT的设计哲学是一个优秀的搜索Agent必须像一个严谨的研究员其工作流程应该分解为清晰的“思考-行动-观察-再思考”的循环并且要特别强调在“行动”如发起搜索之前进行充分的“思考”推理和规划。2.1 传统搜索Agent的“条件反射”式缺陷为了理解FORT的先进性我们先看看常见的“偷懒”Agent是如何工作的。一个典型的流程是用户输入问题“2024年特斯拉人形机器人Optimus的最新进展是什么”模型直接生成搜索查询模型可能会基于对问题的浅层理解生成一个如“特斯拉Optimus 2024”这样的搜索词。执行搜索并获取摘要系统用这个搜索词调用搜索引擎API拿到一堆网页摘要。模型总结摘要生成答案模型快速浏览这些摘要然后生成一段话作为答案。这个流程的问题在于步骤2和步骤4之间缺乏深度推理。模型生成搜索词时并没有深入分析问题的复杂性和潜在的信息缺口。例如上述问题可能隐含了多个子问题Optimus在行走稳定性、手部灵巧度、成本控制、量产时间表等方面分别有何进展是否有最新的演示视频或第三方评测模型如果没有进行这种分解它发起的搜索就可能很宽泛返回的结果质量不高进而导致它要么从低质量结果中总结出错误信息要么干脆“偷懒”用自己训练数据中关于Optimus的旧知识来应付。2.2 FORT的“慢思考”工作流推理链与工具调用规划FORT通过引入结构化的推理链Chain-of-Thought CoT和明确的工具调用规划强制模型进行“慢思考”。它的工作流程更像这样问题理解与分解面对用户问题FORT首先不是去想“用什么关键词搜索”而是启动一个内部的“推理模块”。这个模块会分析“这是一个关于具体产品技术进展的查询。要全面回答我需要获取以下几类信息A) 官方最新发布的信息如财报电话会、AI日B) 近期的权威媒体报道或深度分析C) 可能存在的技术论文或工程博客。每一类信息可能需要不同的搜索策略。”生成分步执行计划基于上述分析FORT会生成一个结构化的计划。这个计划不是模糊的指令而是具体的、可执行的步骤序列。例如步骤1搜索“Tesla Optimus Q1 2024 earnings call transcript highlights”。步骤2搜索“Optimus latest walking demo 2024 IEEE”。步骤3搜索“Optimus hand manipulation progress 2024 research paper”。步骤4对比步骤1和步骤2中关于量产时间线的表述是否存在更新。步骤5综合以上所有信息组织答案并注明关键信息的来源如来自特斯拉2024年第一季度财报会议或来自某科技媒体某年某月某日的报道。按计划执行工具调用FORT严格按照这个计划依次调用搜索工具。每一次调用都不是盲目的而是有明确意图的。它知道第一步是为了获取官方口径第二步是为了获取最新的视觉演示证据第三步是为了探寻更深层的技术细节。动态评估与迭代在获得每一步的搜索结果后FORT的“推理模块”会再次介入评估当前获取的信息是否足以回答问题的某个子部分或者是否发现了新的信息线索需要追加搜索。例如如果在步骤2的结果中提到了一个名为“Optimus Gen 2”的新版本那么计划中可能会动态插入一个步骤“搜索‘Optimus Gen 2 vs Gen 1 specification comparison’”。这个“先规划后执行”的范式是FORT克服模型“偷懒”倾向的关键。它把模型的“生成能力”约束在“制定计划”和“综合信息”这两个更需要创造性和逻辑性的环节而把“信息获取”这个需要精确性的环节交给了有明确规划的、序列化的工具调用。这相当于给一个天马行空的创意作家配了一个严格执行清单的科研助理两者结合才能产出既可靠又有深度的报告。3. 技术实现拆解如何训练一个“不偷懒”的Agent让一个大语言模型学会上面这套复杂的“思考-行动”流程绝非易事。FORT团队在模型训练和数据构建上下了狠功夫。其技术栈可以概括为高质量的指令微调数据 强化学习从人类反馈中学习 对工具调用能力的专项优化。3.1 数据构建模拟人类专家的搜索决策过程训练数据的质量直接决定了模型的行为模式。如果训练数据只是简单的“问题-答案”对模型就会学会直接生成答案。如果训练数据是“问题-搜索词-答案”模型可能只学会生成搜索词但不会规划。FORT需要的是“问题-推理过程-工具调用序列-最终答案”这样的复杂数据。团队采用了一种合成与人工标注相结合的方式合成数据利用更强大的大模型如GPT-4扮演一个“理想的搜索专家”针对大量复杂、开放域的问题生成详细的推理链和多步工具调用计划。这能快速产生海量的、质量较高的训练样本。人工精标数据由领域专家如研究人员、专业编辑对合成数据进行审核、修正和补充。专家会判断推理链是否合理工具调用计划是否高效、无遗漏最终的答案是否准确、全面。这部分数据虽然量少但至关重要它确保了模型学习到的是人类顶尖的搜索策略而不是另一个AI可能存在的偏见或错误。例如对于一个合成数据样本专家可能会批注“在第三步搜索‘量子霸权最新实验’过于宽泛应具体化为‘2023年谷歌Sycamore处理器在量子化学模拟方面的最新论文’以获取更精确的学术信息。” 这种高质量的反馈被融入训练数据中。3.2 训练方法从模仿学习到强化学习有了数据下一步是如何教模型学会。监督式微调SFT这是第一步让模型“模仿”专家数据。模型学习在给定问题后生成与之类似的推理链和工具调用序列。这个阶段让模型初步掌握了“应该怎么做”的模式。奖励模型训练与强化学习RLHF这是让模型“变得更好”的关键。仅仅模仿还不够需要让模型学会判断什么样的搜索行为是“好”的。团队会训练一个独立的奖励模型Reward Model。这个奖励模型的输入是用户问题、模型生成的整个“推理-行动-答案”轨迹。输出是一个分数评价这个轨迹的好坏。奖励信号设计奖励模型根据多个维度打分答案事实准确性最终答案与标准答案或可靠来源的一致性。工具调用必要性是否避免了不必要的搜索防止“多动症”是否在关键信息缺失时进行了搜索防止“偷懒”推理链的连贯性每一步的推理是否逻辑通顺是否支撑了后续行动信息覆盖度答案是否全面回答了问题的各个层面 人类标注员会对大量的模型输出轨迹进行偏好排序例如轨迹A比轨迹B更好用这些数据来训练奖励模型让它学会人类的评判标准。近端策略优化PPO利用训练好的奖励模型作为“裁判”通过强化学习算法如PPO去优化FORT模型本身的策略。模型尝试生成不同的轨迹奖励模型给出分数模型的目标就是最大化这个分数。通过数百万次这样的试错和学习FORT逐渐内化了“如何通过严谨的推理和高效的工具使用来获得高奖励”的策略也就是我们看到的“勤恳”且“有效”的搜索行为。3.3 模型架构与规模选择30B的“甜点”定位FORT选择了30B参数这个规模这是一个深思熟虑的“甜点区”选择。7B/13B级别模型虽然轻量、推理速度快但在处理需要多步复杂推理和长上下文理解的搜索任务时能力往往捉襟见肘更容易出现逻辑断裂或“偷懒”。70B/100B级别模型能力强大但推理成本高昂部署门槛高难以广泛应用于需要实时交互的搜索Agent场景。30B级别模型在推理能力、工具使用理解和成本效率之间取得了较好的平衡。它拥有足够的“脑容量”来执行FORT所要求的复杂规划同时相对于巨模型其计算和内存开销又在很多团队可接受的范围内。这使得FORT成为一个既有强大能力又具备实际落地潜力的开源选择。FORT的模型架构基于主流的Decoder-only的Transformer但其训练重点和模型权重已经完全导向了“工具使用”和“事实推理”这两个目标与同规模的通用聊天模型有了本质的功能区分。4. 实战评估FORT到底强在哪里论文和宣传中的指标固然重要但一个搜索Agent的真实能力需要在更贴近实际应用的场景中检验。FORT在多个权威的Agent评估基准上表现突出我们可以从几个关键维度来解读它的优势。4.1 在复杂、多跳查询上的碾压性优势很多搜索任务不是一次搜索就能解决的需要像侦探破案一样串联多个信息点。这被称为“多跳问答”Multi-hop QA。例如“那位导演了《盗梦空间》的导演他妻子主演的哪部电影在2017年获得了奥斯卡最佳女主角奖”传统/偷懒Agent可能会直接搜索“《盗梦空间》导演妻子 奥斯卡最佳女主角 2017”结果很可能不准确或混乱。或者它可能直接用内部知识回答“克里斯托弗·诺兰的妻子是...”但艾玛·托马斯诺兰妻子是制片人而非演员这里就出错了。实际上问题是关于《爱乐之城》和艾玛·斯通。FORT的工作流程推理这个问题需要多步信息检索。首先确定《盗梦空间》的导演然后找到他的妻子最后找出他妻子主演并在2017年获得奥斯卡最佳女主角的电影。计划与执行搜索1“电影《盗梦空间》的导演是谁” - 结果克里斯托弗·诺兰。搜索2“克里斯托弗·诺兰的妻子是谁” - 结果艾玛·托马斯制片人。等等这里可能有问题艾玛·托马斯是知名演员吗不是。重新审视问题“他妻子主演的电影”。诺兰的妻子是制片人不主演电影。是不是我理解错了或许“妻子”在这里指代有误或者问题本身有歧义我需要查证。搜索3“《盗梦空间》导演 妻子 演员” - 结果可能发现混淆实际上导演是诺兰但问题可能指另一位导演或者“妻子”是中文语境下的泛指更稳妥的方式是直接找2017年奥斯卡最佳女主角。搜索4“2017年奥斯卡最佳女主角获奖电影及主演” - 结果《爱乐之城》艾玛·斯通。搜索5“艾玛·斯通 丈夫 导演” - 结果艾玛·斯通的丈夫是……似乎不相关。看来最初的理解路径有误。我需要更直接地拆解问题核心是“2017年奥斯卡最佳女主角电影”。先锁定这个事实再反向关联导演。动态调整计划搜索6“《爱乐之城》的导演是谁” - 结果达米恩·查泽雷。搜索7“达米恩·查泽雷的妻子或伴侣是演员吗” - 结果达米恩·查泽雷曾与演员……实际上这个问题可能基于一个不准确的前提。经过一番检索FORT可能会发现这个问题本身的事实基础可能有问题或者它需要指出其中的混淆点。 尽管这个例子中问题本身可能存在事实瑕疵但FORT展现的是一种持续追问、交叉验证、敢于质疑问题前提的能力。它在遇到矛盾时不会强行捏合一个答案而是会发起新的搜索来澄清事实。这在处理真实世界充满噪音和模糊性的查询时至关重要。在WebShop、HotpotQA等多跳问答数据集上FORT凭借其强大的规划能力准确率显著超过同规模甚至更大规模的模型因为它能更好地拆解问题、规划搜索路径。4.2 工具使用的精确性与节俭性一个好的Agent不仅要会用工具还要“精明”地用。FORT在工具调用上体现出两个特点精确性它生成的搜索查询往往更具体、包含更多限定词这能直接从搜索引擎获取更相关的结果。例如对于“帮我找用于微服务架构的Java分布式链路追踪工具”FORT生成的查询可能是“Java distributed tracing tools for microservices comparison 2024 Zipkin vs Jaeger vs SkyWalking”而不是简单的“Java 链路追踪”。节俭性它不会进行无意义的“刷”搜索。在内部评估中对于已知的、事实明确的问题例如“中国的首都是哪里”FORT经过快速推理后可能会直接利用其内部知识如果置信度高给出答案而不会再去调用搜索工具从而节省资源和时间。这种“该搜则搜不该搜则不搜”的智能判断是衡量Agent成熟度的重要指标。4.3 对长文档和复杂指令的理解能力很多搜索任务需要模型深入阅读和理解单个网页或文档的内容。FORT在训练中加强了对长上下文的理解能力。当它通过搜索得到一个技术文档、一篇长文或一个产品说明书页面时它能更好地提取关键信息进行摘要、对比或回答基于文档细节的提问。这对于技术调研、竞品分析、法律文书查阅等场景极为有用。5. 开源价值与未来展望FORT将带来什么FORT以30B规模、开源的形式发布其意义远不止于论文上的一个SOTA指标。首先它降低了高质量搜索Agent的研发和部署门槛。在此之前构建一个可靠的搜索Agent要么需要依赖闭源、昂贵的巨型API如GPT-4插件要么需要投入巨大资源从头训练。FORT提供了一个性能强劲的“中间件”企业和研究团队可以基于它进行微调快速适配自己的垂直领域如医学文献搜索、法律案例检索、内部知识库问答而不必担心底层模型的“偷懒”通病。其次它提供了一套可复现的方法论。FORT的开源不仅包括模型权重更包括其训练数据构造方法、奖励模型设计和强化学习流程。这为社区后续的研究和创新提供了一个坚实的蓝本。其他人可以在此基础上探索如何融入更多类型的工具如数据库查询、代码执行、API调用如何优化多智能体协作搜索如何让模型在搜索中具备更强的批判性思维和事实核查能力。最后它推动了AI应用从“聊天玩具”向“生产力工具”的实质演进。一个不会“偷懒”、能可靠完成复杂信息获取任务的Agent才是真正能融入工作流的生产力组件。FORT在这一方向上迈出了坚实的一步。当然FORT并非完美。30B的规模决定了它在一些需要极深领域知识或超复杂逻辑推理的任务上仍有局限。其推理和多次搜索的流程也会带来比单次生成更长的响应延迟。如何进一步压缩模型、提升推理速度同时保持甚至增强其规划能力是接下来的挑战。从我个人的实践角度看像FORT这类模型的涌现提示我们在设计AI应用时“思维链”和“工具使用规划”应该成为核心架构考量而不是事后补救的补丁。对于开发者而言与其苦苦Prompt Engineering一个通用大模型让它“别偷懒”不如直接采用或借鉴FORT这种为工具使用而专门优化的架构。它的出现或许标志着AI Agent的发展正在从“能调用工具”的初级阶段走向“善于规划和使用工具”的高级阶段。这其中的技术细节和设计思想值得每一个关注AI落地的从业者细细品味。