尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

大模型如何重构推荐系统:从精排模型到全局决策大脑的演进

大模型如何重构推荐系统:从精排模型到全局决策大脑的演进 1. 从“推什么”到“怎么选”一场推荐系统的范式革命如果你在2015年问我一个推荐系统的核心任务是什么我会毫不犹豫地回答“推什么”。那时候我们所有工程师的精力都花在如何从海量商品、视频或新闻中精准地找到用户可能感兴趣的那一个。我们构建复杂的协同过滤矩阵设计精巧的特征工程训练庞大的深度神经网络目标只有一个——让模型输出的那个“Top 1”或“Top N”列表点击率更高转化率更好。这就像一位技艺高超的厨师不断优化菜单只为端出最符合客人口味的那道菜。但今天当AI特别是大模型真正开始融入推荐系统的血液后我发现事情的本质正在发生改变。我们面临的挑战早已不再是“找菜”那么简单。用户打开一个App他面对的往往不是一个单一的推荐位而是一个由信息流、直播入口、购物橱窗、广告位、活动弹窗等数十个模块组成的复杂界面。每个模块背后可能都对应着一个独立的推荐模型。更关键的是用户的时间、注意力、手机的电量和流量都是有限的。“怎么选”即如何从这几十个、上百个候选推荐结果中动态地、智能地、全局最优地决定最终呈现给用户的“一屏”内容成为了比“推什么”更复杂、也更具决定性的问题。这不再是单个模型的精进而是一个系统工程。它要求我们从“模型优化”的单一视角切换到“系统决策”的全局视角。大模型的引入尤其是其强大的语义理解、推理和生成能力为这场变革提供了前所未有的可能性。它不再仅仅是一个更强大的“排序器”而是正在演变为整个推荐系统的“决策大脑”。接下来我将结合我最近在项目中的实践拆解这场变革背后的核心逻辑、技术挑战以及我们是如何一步步将AI从“推荐引擎”升级为“决策中枢”的。2. 传统推荐系统的“天花板”当精排模型不再是终点要理解为什么需要转向“怎么选”我们必须先看清传统推荐架构的瓶颈。经典的推荐系统流水线通常分为召回、粗排、精排、重排或混排四个阶段。长期以来技术演进的焦点几乎都集中在“精排”环节。2.1 精排模型的“孤岛困境”精排模型比如DeepFM、DIN、MMoE等其目标是给每一个“用户-物品”对打出一个精准的预估分数如点击率、转化率。这个分数代表了该物品对当前用户的“绝对吸引力”。我们投入了巨大的资源构建上千维的特征使用TB级的数据进行训练部署庞大的GPU集群进行实时推理只为将这个分数的AUC提升哪怕0.1%。然而这个分数存在一个根本性的假设物品之间是相互独立的。模型在计算视频A的点击率时不会考虑同时被推荐的视频B是什么。但在真实的用户体验中推荐列表是一个整体。连续推荐三个同类型的搞笑短视频用户可能会感到厌倦在一条严肃新闻后紧跟一条低质广告会严重损害用户体验。精排模型无法建模这种列表级的协同效应和跨物品的相互影响。实操心得我们曾遇到一个典型问题精排模型给出的Top 10商品单个看点击率都很高但上线后整体“加入购物车”的转化率却下降了。复盘发现这10个商品里有6个是同一品牌、不同颜色的手机壳用户滑动两屏看到的都是类似商品很快就失去了继续浏览的兴趣。精排模型每个都判为高分但它不具备“去重”和“多样性”的全局视野。2.2 多目标与业务约束的“缝合怪”业务需求从来不是单一的。老板既要点击率也要时长还要关注点赞、评论、分享、关注等一系列互动指标同时必须保证内容安全、符合监管、扶持新品、平衡生态。传统的做法是在精排阶段做多目标建模例如使用多塔模型如MMoE预估多个目标然后通过一个人工设定的公式进行加权融合最终分数 w1 * CTR w2 * 播放时长 w3 * 点赞率 ...这个公式成了整个系统的“魔法参数”。策略产品经理和算法工程师需要花费大量时间进行AB实验来调参。更棘手的是不同场景、不同人群的最优权重可能是不同的。午间休息和深夜睡前用户对视频时长的偏好显然不同。这种“一刀切”的静态加权方式无法实现动态的、个性化的多目标平衡。2.3 混排阶段的“规则化”与“低效”精排之后的重排/混排阶段本应是解决上述问题的地方。但长期以来由于缺乏强大的决策智能这个阶段严重依赖规则引擎。例如强插规则每隔3条内容插入1条关注主播的直播。去重规则同一作者的内容在连续10条内不能出现超过2次。打散规则同类目商品必须间隔至少2个位置。这些规则是必要的但它们本质上是启发式的、局部的。规则之间经常冲突比如强插和打散冲突了怎么办且无法量化其对最终业务目标的综合影响。调整规则更像一门“艺术”依赖于工程师的经验和大量的A/B测试迭代周期长效率低下。3. 大模型作为“决策大脑”重构系统决策链路大模型特别是具备强大推理和规划能力的Agent型大模型为解决“怎么选”提供了新的范式。它不再仅仅替代精排模型而是站在精排模型的上层扮演一个全局调度者和决策者的角色。我们的实践架构可以概括为下图所示的逻辑核心思想是将“生成最终列表”视为一个序列决策问题而大模型是做出每一步决策的智能体。3.1 输入从“特征向量”到“富语义状态描述”传统模型输入的是数值化、稠密的特征向量。而大模型的输入可以是更丰富的“状态描述”。我们将当前决策所需的信息构造成一段自然语言或结构化的提示Prompt用户状态用户ID: 12345 近期兴趣标签[科技 数码 骑行] 当前时段工作日晚8点 情绪状态预测放松。 候选池状态精排模型已为200个候选内容打分其中包括 - 内容A科技评测视频CTR0.15 预估时长5分钟 作者知名科技UP主。 - 内容B骑行VlogCTR0.12 预估时长8分钟 作者用户已关注。 - 内容C手机广告CTR0.08 预估时长0.5分钟 类型商业广告。 - 内容D新品资讯CTR0.05 预估时长2分钟 标签新品扶持。 ... 当前已生成列表[]刚开始或 [内容A 内容B]生成到一半。 业务目标与约束最大化用户总停留时长同时需满足广告占比10% 关注作者内容占比20% 内容多样性标签不重复需保持。这个描述包含了用户画像、候选物品的多维度信息不仅是分数还有语义属性、当前列表状态以及复杂的业务目标与约束。这是传统模型难以处理和理解的。3.2 推理从“数值计算”到“规划与推理”大模型接收到这个状态描述后其推理过程不再是简单的矩阵乘法而是基于对目标、约束和上下文的理解进行“思考”理解目标“最大化停留时长”意味着要优先选择预估时长高的内容但也要考虑用户连续观看的疲劳度。权衡约束“广告占比10%”是一个硬约束如果当前列表还没广告可以适当考虑插入一个高价值的广告如内容C。评估协同效应“当前列表已有科技内容用户兴趣也有骑行下一个插入骑行Vlog内容B可以平衡多样性且用户关注了作者互动概率高。”做出决策基于以上推理模型可能会输出“选择内容B骑行Vlog作为下一个推荐项。理由符合用户兴趣提升关注作者占比与已有内容形成良好互补有利于长期停留。”这个过程模拟了人类运营编辑的决策思路但能以毫秒级速度处理海量候选。3.3 输出与验证从“排序分”到“决策动作与解释”大模型的输出也更多样化直接决策输出下一个应该推荐的具体内容ID。调整权重输出针对当前用户和上下文精排分数各目标的动态融合权重例如“当前建议权重CTR: 0.3 时长: 0.5 互动: 0.2”指导下游打分。生成解释附带做出该选择的理由这可以用于生成更个性化的推荐理由文案如“换换口味看看你关注的骑手又去了哪里”。踩坑实录我们最初让大模型直接输出内容ID但遇到了严重的“幻觉”问题——模型有时会输出一个不在候选池中的ID。解决方案是采用“规划-验证”模式让大模型输出决策的“理由”或“选择标准”例如“选择一个预估时长5分钟且标签为‘骑行’或‘户外’的内容”然后由一个确定的、快速的规则系统或检索系统根据这个标准从候选池中找出最匹配的那个真实物品。这样既利用了模型的推理能力又保证了结果的确定性。4. 工程化落地平衡理想与现实的架构设计将大模型作为决策大脑引入线上推荐系统是工程上的一大挑战。核心矛盾在于大模型强大的能力与高昂的推理成本、延迟和不确定性。4.1 分层决策架构不把所有鸡蛋放在一个篮子里我们采用了分层混合的决策架构而非完全依赖大模型决策层级负责模块技术实现决策频率特点战略层大模型Agent云端大模型API如GPT-4, Claude或高性能微调模型低频如每10分钟/每次会话开始制定全局策略。例如分析用户当前会话意图决定本次Feed是以“探索发现”为主还是“深度满足”为主并输出一组动态权重和约束规则给战术层。战术层轻量级模型/规则引擎小型化微调模型如6B/7B参数、强化学习模型、动态规则引擎中频每次请求执行战略。接收战略层的指导处理精排结果进行快速的列表级优化和重排满足实时性要求P99延迟50ms。执行层传统精排/召回模型深度排序模型、向量检索高频每次请求提供高质量的候选。专注于“推什么”为上层决策提供优质的原料。这个架构的关键在于“分工”大模型做它擅长的、对延迟不敏感的宏观策略制定轻量级模型和规则引擎负责高并发的、实时的微观决策执行。例如大模型在会话开始时判断用户处于“购物决策”心态便将“转化率”权重调高并将“广告”视为高价值信息而非干扰指导战术层在混排时更积极地插入商品广告。4.2 关键组件提示工程与模型微调要让大模型理解推荐系统的“语言”需要精心设计。提示工程Prompt Engineering 我们构建了结构化的提示模板将系统角色、决策任务、状态信息、输出格式清晰地定义出来。一个简化的例子你是一个资深的视频推荐策略专家。你的任务是从候选视频中为当前用户选择下一个最合适的视频。 ## 用户上下文 {用户画像、时间、地点等} ## 当前已推荐列表 {已选出的视频序列及其关键属性} ## 候选视频池前5个按精排分排序 1. 视频A[标题] [作者] [标签] [预估CTR] [预估播放时长]... 2. 视频B: ... ... ## 业务目标与规则 - 核心目标最大化用户本次会话的总观看时长。 - 必须遵守的规则广告视频占比不得超过10%连续3条视频不能来自同一作者。 - 鼓励的方向适当提升用户已关注作者的视频曝光。 请逐步推理并最终输出你选择的视频编号如“视频2”以及简要理由。模型微调Fine-Tuning 完全依赖提示工程对复杂决策的稳定性和准确性仍有不足。我们采用了离线强化学习Offline RL收集数据 大模型微调的路径数据收集在线上运行一个基础的混排策略可以是规则或简单模型记录下所有的“状态用户、列表、候选-动作实际选择的物品-奖励最终产生的时长、互动等”序列形成一个高质量的决策日志数据集。偏好学习利用大模型如GPT-4对日志中的决策进行“好坏”评判或者通过人工标注构建一个偏好对好的决策 vs 坏的决策数据集。微调模型使用类似Direct Preference Optimization (DPO)的方法对我们部署的轻量级开源大模型如Llama 3 8B进行微调使其决策偏好与我们的业务目标对齐。微调后的模型在理解推荐业务、遵守规则方面表现远优于零样本提示的通用大模型。4.3 评估体系超越A/B测试的仿真平台传统的A/B测试对比的是“策略A”和“策略B”的线上核心指标。但当决策逻辑变得复杂且由AI驱动时我们需要更细粒度的评估和更快速的迭代。我们建立了推荐决策仿真平台环境模拟利用历史用户行为日志构建一个模拟的用户交互环境。策略加载将待评估的新决策模型如一个新微调的LLM加载到平台中。离线仿真让模型在模拟环境中对成千上万个历史会话进行“重放”决策并计算出它可能带来的各项指标时长、互动、收入等。多维度评估有效性模拟的核心指标提升。安全性/合规性自动检查决策结果是否违反预设规则如广告超量、内容重复。多样性/新颖性计算生成列表的标签分布、作者分布等。推理质量分析模型输出的决策理由是否合理、一致。这个平台让我们能在上线前以极低的成本对新的AI决策策略进行快速验证和调优大大降低了试错风险。5. 实战中的挑战与应对策略理想很丰满现实很骨感。在实际落地中我们遇到了诸多挑战。5.1 延迟与成本性能与效果的永恒博弈即便使用分层架构在战术层引入一个几B参数的模型进行实时推理其延迟从几十毫秒到上百毫秒和计算成本也远高于传统的逻辑回归或浅层神经网络。我们的应对策略模型蒸馏用微调好的大模型教师模型去指导训练一个极小的学生模型如几百万参数的神经网络。这个学生模型学习模仿大模型的决策但推理速度快了上百倍。线上部署学生模型定期用教师模型更新。结果缓存对于大量共性的决策场景例如对新用户的首屏推荐其最优策略相对稳定。可以将大模型输出的策略如权重组合进行缓存在一定时间内复用避免重复计算。异步决策与预热对于“战略层”的决策可以完全异步进行。例如在用户登录时或闲时就提前用大模型分析其可能的行为模式生成几套备选策略缓存起来在用户真正请求时直接匹配使用。5.2 稳定性与可解释性黑盒模型的信任危机大模型的输出具有一定随机性即使温度参数设为0且决策过程是黑盒。这在追求高稳定、高可解释的工业系统中是难以接受的。我们的应对策略确定性兜底任何由大模型参与的决策链路都必须有一个完全确定性的、基于规则的兜底策略。当系统检测到大模型输出异常如格式错误、选择无效ID、严重违反规则时立即切换至兜底策略并发出告警。可解释性增强强制要求模型输出决策理由。这不仅用于生成文案更重要的是为算法工程师和产品经理提供了调试窗口。通过分析大量决策日志中的“理由”我们可以发现模型的决策模式是否存在偏差或者业务规则是否存在矛盾。基于规则的验证层在大模型做出决策后增加一个轻量级的规则验证层。例如模型决定插入一个广告验证层会检查当前广告占比是否已超阈值、广告内容是否符合当前用户画像等。只有通过验证的决策才会被执行。5.3 数据闭环与快速迭代让AI决策越用越聪明一个静态的AI决策模型很快就会过时。用户偏好、内容生态、业务目标都在变化。必须建立数据闭环。我们的闭环设计线上决策 - 用户交互 - 数据收集 - 离线评估与标注 - 模型微调/优化 - 线上部署数据收集不仅收集用户点击、时长等最终指标更要完整记录下决策时的完整状态当时的候选池、已生成列表、模型输出的理由等和最终的用户行为序列。这是后续分析和迭代的黄金数据。离线评估利用仿真平台和人工评估定期对线上模型的决策质量进行复盘。找出“坏案例”如导致用户快速滑走的决策。持续学习将“坏案例”和新的业务规则通过增量数据或提示词更新的方式持续注入到模型的学习过程中。例如发现模型近期过于推崇某类内容导致多样性下降可以在下一轮微调时加入更多样化的正面决策样本。6. 未来展望AI驱动的“系统级”智能当AI开始解决“怎么选”的问题推荐系统的想象力被极大地拓宽了。这不仅仅是排序算法的升级而是整个系统设计哲学的演进。从“推荐系统”到“个性化体验引擎”未来的系统大模型作为核心决策者将能够统筹考虑更多维度当前用户的实时情绪通过传感器或交互模式推断、设备状态电量、网络、甚至外部环境地理位置、天气来综合决策此刻应该提供一段长视频、一段播客、一个互动小游戏还是一篇短文。它管理的不是一个内容列表而是一个跨模态、跨场景的体验序列。从“满足需求”到“创造需求”传统的推荐是响应用户已有的、明确或隐性的兴趣。而具备强大生成和规划能力的AI可以主动为用户“创造”新的、有价值的兴趣点。例如它发现用户喜欢骑行和科技可能会规划一个“从骑行装备选购到运动相机使用技巧再到户外电源评测”的系列内容推荐路径并生成相应的引导文案像一位贴心的私人导购引领用户探索一个完整的兴趣领域。工程与算法的深度融合“怎么选”的问题将算法目标和工程约束如QPS、延迟、缓存命中率更紧密地绑定在一起。未来的AI决策模型或许在训练时就会将“推理延迟”作为一个优化目标自动学习在效果和性能之间做出平衡的决策策略。这条路才刚刚开始挑战巨大但方向已经清晰。我们不再满足于只做一个更准的“猜你喜欢”模型而是在尝试构建一个真正理解用户、理解场景、并能做出全局最优决策的智能系统。从“推什么”到“怎么选”这是一次从“工具”到“伙伴”的升级也是推荐技术下一个十年的核心战场。
返回列表