一、业务背景发现性指标的量化困局与效率瓶颈在推荐系统中CTR 和 CVR 等硬性指标易通过实时数据观测而新颖性、相关性等评价维度因主观性强、反馈周期长长期处于量化黑盒状态。本文将介绍得物自动化评测平台的建设方案该平台引入大模型评测能力将评测反馈周期从周级缩短至小时级在支撑单周百万级审计需求下实现了 91% 的资源成本优化。在得物推荐评测平台建设前推荐产研团队在优化用户体验和长尾策略时面临以下核心痛点主观指标难以定量判断商品是否为算法针对用户潜在兴趣的合理推荐过去高度依赖人工审计缺乏统一且可连续对比的数据标准。反馈周期严重滞后策略上线后通常需等一周的大盘例行数据才能得出综合评估无法满足策略高频迭代的需求。审计成本居高不下面对百万级别的全量对比和竞品评测需求依靠传统人工评估模式需投入巨大人力资源难以形成常态化的日常诊断。为打破这一基建瓶颈得物推荐评测平台应运而生旨在通过自动化流水线将主观的发现性指标转化为可实时监控、可精确对比的结构化数据。二、核心架构与功能模块解析得物推荐评测平台通过任务流自动化和指标多维可视化构建了完整的全自动评测空间。评测任务的高并发调度在评测任务管理中心产研同学可以一键拉起不同类型的评测任务。任务承载上线初期平台已稳定支撑大量实验任务、1 组例行大盘以及多场友商对比评测。吞吐能力依托异步底座单周评测数据处理量已达到百万级别。评测空间与大模型辅助审计评测空间是针对具体 case 进行深度拆解的场所。平台支持结合用户的多维画像特征进行全自动化洞察智能辅助评估平台引入了 AI 辅助模式从相关性、新颖性等维度对推荐结果进行 1 到 5 分的动态打分并输出具体的判定依据。多维特征关联评测员或算法同学可以通过双列视图直观看到商品详情快速定位异常推荐结果。评测工作界面评测数据分析看板在数据报表模块得物推荐评测平台实现了全层级指标的实时监控与下钻分析核心 KPI 提炼报表实时输出有效发现率、精准推荐率以及无效推荐率。分级下钻评测记录被精细化划分为 L0 到 L4 等不同层级产研可在小时级内清晰掌握实验组与基线的水位差彻底告别直觉判断。三、核心技术架构拆解可视化提示词工程与人机协同校验基建模型层在得物推荐评测平台中评测提示词的设计与评估一致性的对齐并非通过硬编码锁死而是交由产品与业务专家基于实际场景进行敏捷迭代。为支撑业务同学能独立、高效地完成提示词的调试与人工校验平台在底层构建了一套完善的工程化配置与校验基建动态提示词Prompt版本管理平台将评测提示词抽象为独立的配置资产。产品同学可针对相关性、新颖性等不同评测维度在后台可视化界面中独立调优 Prompt。平台支持 Prompt 的版本控制与热更新确保策略调整后评测标准能够秒级同步无需经历繁琐的代码发布流程。低门槛的评测员配置矩阵平台底层解耦了具体的模型供应商提供了统一的接入协议。业务同学可以自由选择 Qwen3 - Max 等不同量级的模型作为评测员并在系统配置中实时观测其并发能力、当前版本的准确率以及与人工结论的一致性水位。人机协作的在线校验流为解决大模型在复杂电商场景下的理解偏差平台构建了高效的样本校验工作流。产品同学在调整 Prompt 后可一键抓取历史真实 case 进行小规模盲测。通过平台提供的双列视图人工专家可以对 AI 的打分和文本解释进行实时审计与修正。这种“产品专家定义标准、AI 高频执行放大、人工漏斗式校验”的闭环机制不仅极大地降低了算法策略的对齐成本更让平台评测的一致性在业务的动态微调下稳定保持在 92% 以上。百万级吞吐的算力调度与微观控本工程层在支撑同等百万级审计需求下Axis 将单周算力成本控制在万元级左右大幅提升了投入产出比。分布式任务调度CAS 无锁抢占杜绝重复执行得物推荐评测平台的调度核心采用 CASCompare - And - Swap抢占机制而非传统的分布式锁方案。调度器每分钟扫描一次待执行实例用一条原子 SQL 完成“抢锁”操作。依赖 MySQL 行级锁保证多节点竞争时只有一个节点的 rowcount 1其余节点本轮直接跳过无需引入 Redis/ZooKeeper 等外部依赖。宿主机宕机后超过 30 分钟心跳超时的实例可被任意存活节点自动接管做到故障自愈。断点续传三阶段 offset 机制中断后零数据丢失百万级评测任务往往需要数小时执行。得物推荐评测平台通过进度技术字段记录三个阶段各自的执行进度任务在任意阶段中断后重启均能从断点精确续跑不会产生重复评测或数据空洞。LLM 并发控制ThreadPoolExecutor 动态限流成本与速度的精确平衡对于文本 LLM 评测文本评测策略得物推荐评测平台采用分批并发并发度支持通过配置中心热更新无需重启服务即可动态调整至最优水位。对于多模态视觉评测多模态视觉评测策略以单次多模态请求替代多次图片请求在减少 API 调用次数的同时显著降低单次 Token 消耗。微观控本按需触发 模型分级把每分钱花在刀刃上按需执行三种触发模式定时调度 / 文件上传 / 按需 Ad hoc均严格按需消费算力无闲置轮询开销。模型分级平台支持同时配置多个不同量级的评测员如 Qwen3 用于高精度场景、轻量模型用于快速验证策略团队可自由组合高精度任务走重模型批量验证走轻模型。采样精控评测样本流式分页采样精确匹配评测所需规模不做无效全量拉取。三重机制叠加使平台在每周支撑百万级 LLM 调用请求算力利用率极高。四、业务成效与降本增效实绩得物推荐评测平台上线后的实际业务表现可以概括为以下两点策略迭代效率呈倍数提升通过将评测反馈周期从传统的按周计算缩短至小时级算法同学在当天即可看到实验策略与大盘的真实差距有力支撑了上线初期推荐策略的高频迭代。运营资源投入大幅节省在处理同等百万级审计需求时自动化流水线完全替代了过去的人工评估。单周算力成本极低相比传统的人工模式节省了 91% 的资源投入年化潜在节省巨幅人力评测成本。五、演进路线从单一评测到全维度的 Agent 自动巡检虽然得物推荐评测平台在上线初期首先聚焦于解决发现性指标的量化难题但从架构设计的本质来看这套 AI 自动化评测基建具备更广泛的泛化能力。平台未来的演进将突破单一指标的限制向两个深度方向纵向延伸体验评测的多维度泛化发现性评测只是得物推荐评测平台的起点。推荐系统的体验是一个由多维要素交织的复合物后续平台将逐步解耦并接入更多维度的体验审计能力相关性与类目多样性评测评估推荐流在保持兴趣相关性的同时在类目散散度上的表现防止用户陷入信息茧房。时效性与疲劳度审计实时监控用户高频行为信号的下发反馈速度并对重复推荐、类目过度疲劳等负反馈体验进行量化评测。低质与敏感内容拦截把控引入图文多模态大模型评测员对推荐流中的低质封面、标题党以及合规风险进行前置审计。走向全天候的 Agent 自动巡检当前平台的运行模式主要依赖产研手动触发或例行大盘调度。而得物推荐评测平台的终极形态是一个具备自主思考和主动防御能力的自动化巡检智能体Agent全时段监控平台将与在线业务日志及 Trace 链路深度联动无需人工干预7*24 小时在线上推荐流中进行高频采样。主动根因诊断当巡检 Agent 发现某个 UID 的推荐流中有效发现率突降或者无效噪音飙升时将自动激活深度诊断工作流联动召回、粗排、精排及策略过滤等全链路日志进行溯源。闭环预警与干预在问题引发大盘指标异常之前智能体将自动梳理出异常 case 的根因报告并通过内部通道精准推送给策略负责人甚至在未来实现低风险策略的自动化降级与熔断。六、结语在过去由于主观体验无法量化很多能够带来业务长远增量的策略例如破圈推荐、泛兴趣引入、长尾类目扶持因为缺乏即时的指标反馈往往在实验初期就被墨守成规地放弃了。而得物推荐评测平台的出现恰恰是把这些看不见的体验变成了可追踪、可量化的数据水位差。通过小时级的反馈闭环算法同学得以在一片迷雾中看清每一组增量实验的真实方向从而支撑起整个季度策略的高频迭代。它真正的价值在于解放了生产力让团队敢于去探索那些能带来业务突破的无人区。在信息茧房和推荐黑盒越来越被广泛讨论的今天做一个推荐算法工程师很多时候不仅在和冷冰冰的点击率、转化率数字赛跑更是在和真实用户的疲劳感、厌倦感博弈。得物推荐评测平台的诞生让我们第一次有了一块清晰的后视镜能够随时看到算法在线上对用户体验带来的微观改变。当 AI 评测员开始全天候辅助我们去审视每一个商品流去理解每一个用户的潜在兴趣时我们离那个更健康、更有温度、也更具业务生命力的推荐系统又近了一步。得物推荐评测平台还在持续成长期待与更多探索在推荐一线的技术同行一起用技术要效率用评测促增量。得物推荐评测平台能带来更多惊喜吗