PM视角下的AB 实验方法论
AB 方法论 把我觉得新版更好变成95% 置信度下提升 3%的科学决策法,让数据替拍脑袋埋单。定位:产品经理视角的系统拆解核心主张:AB 实验的本质,是用「随机对照 统计推断」给产品决策提供因果证据。它不是两个版本比一下谁数据高,而是一套从假设到决策的科学方法。一、AB 方法论是什么1.1 命名来源AB来自最朴素的实验形态:把用户随机分成两堆,一堆看A 版本(对照,原方案),一堆看B 版本(实验,新方案),对比指标差异。A baseline(基线),B treatment(处理)。这是入门级形态。1.2 真正含义AB 方法论远不止于此,它的真正含义是:以随机对照实验为核心,贯穿假设 → 设计 → 执行 → 分析 → 决策全链路的一套科学决策体系。包含四层:层内容负责方统计学层假设检验、置信区间、功效、效应量数据 / 算法工程层分流系统、埋点、监控、实验平台研发流程层实验评审、决策门、复盘、知识库PM 数据文化层证据优先于职级(反 HIPPO)、容错、可证伪全员面试加分点:能区分AB 实验和AB 方法论——实验只是动作,方法论是组织级决策机制。这一层区分就把你和只背P0.05 显著的候选人拉开差距。二、本质:三个不可拆分的要素2.1 对照(Control)没有对照组,就无法证明是改动 X 带来了提升——可能是季节、活动、自然波动。对照是因果推断的前提。2.2 随机化(Randomization)保证两组在实验前等价——可观测变量(性别、年龄、设备)和不可观测变量(动机、习惯)都均匀分布。没有随机化,因果推断不成立。2.3 统计推断(Statistical Inference)单看数字差 0.9pp 不够,要判断这个差异是真效应还是抽样噪声。统计推断提供以多大概率相信差异为真的量化语言。三要素口诀:对照证因果,随机化等价,统计量化不确定性。三、生命周期五阶段核心论断:70% 的功夫在前两阶段。假设不清,后续全错。阶段关键产出PM 必答的关键问题1. 假设可证伪的因果命题为什么相信改动 X 能提升 Y?机制是什么?可证伪吗?2. 设计指标分层、样本量、分流策略核心指标是哪个?护栏指标有哪些?要多少样本、跑多久?3. 执行AA 检验通过、监控告警AA 检验通过吗?有没有分流不均、SRM、数据丢失?4. 分析显著性、效应量、CI、功效统计显著 ≠ 业务显著,效应量多大?CI 区间多宽?5. 决策上线 / 不上线 / 迭代业务收益是否覆盖开发成本?长期效应如何?3.1 假设阶段 —— 写得像命题错误写法:测一下新版好不好正确写法:把购买按钮文案从『立即购买』改成『免费试用』,因为降低决策门槛,转化率将提升 ≥ 3%要素:机制 → 预期 → 阈值,缺一不可。3.2 设计阶段 —— 三件事必做指标分层:核心指标(OEC) 驱动指标 护栏指标样本量计算:基于 MDE(最小可检测效应)和功效反推 N分流策略:用户级 vs 设备级 vs 会话级,取决于业务归因单位四、统计推断核心:两类错误 四概念4.1 两类错误矩阵H0 为真(改动其实无效)H1 为真(改动真的有效)不拒绝 H0✅ 正确决策(概率 1-α)❌ 第二类错误 β(存伪 / 漏检)拒绝 H0❌ 第一类错误 α(弃真 / 误判)✅ 正确决策 功效(概率 1-β)α(显著性水平):改动其实无效,却被误判为有效。行业默认 0.05。β:改动真的有效,却没被检测出来。行业默认 ≤ 0.2。功效(Power) 1 - β:改动真的有效时能检测出来的概率。行业默认 ≥ 0.8。4.2 四个必须真正理解的概念概念定义常见误读P 值在 H0 为真前提下,观察到当前(或更极端)结果的概率❌ H0 为真的概率置信区间 CI真实效应量以一定概率(如 95%)落入的区间❌ 95% 的样本落在此区间统计功效1-β,改动真的有效时能检测出来的概率❌ 结果的可信度效应量改动带来的实际提升幅度,如 0.9pp❌ P 值越小效应越大关键论断:统计显著 ≠ 业务显著。0.05pp 也可能显著,但收益覆盖不了开发成本就不该上。五、八大陷阱(按前-中-后分类)5.1 实验前 - 设计陷阱编号陷阱表现后果①假设模糊测一下新版好不好没有机制、没有阈值②指标单一只看核心指标忽略护栏指标(崩溃率/留存)③样本量拍脑袋跑一周看看没算 MDE / 功效,样本不足④流量互斥冲突多实验并行抢流量没做正交分层,相互污染5.2 实验中 - 执行陷阱编号陷阱表现后果⑤SRM 样本比失衡分流 50/50 实际 47/53随机化已被破坏⑥新奇效应用户图新鲜点新的两周后效果消失⑦提前终止第 3 天看 P0.05 就停连续检验会膨胀 α⑧数据丢失 / 偏差埋点缺失、延迟、回传不全显著性结果不可信5.3 实验后 - 分析陷阱编号陷阱表现后果⑨P-hacking反复切维度直到显著多重比较未校正⑩把统计显著当业务0.05pp 也显著收益覆盖不了开发成本⑪忽略异质性整体持平但某子群大涨大涨大跌相互抵消,误判⑫短长期混淆短期涨转化长期伤留存 / 品牌六、能力边界:何时该用、何时换方案核心论断:知道什么时候不该用 AB,比会跑 AB 更重要。6.1 AB 适用 - 4 个前提(全满足才跑)前提说明① 单一变量可控一次只改一个因子,否则无法归因② 用户独立可分流无网络效应 / 社交溢出,SUTVA 假设成立③ 短期可观测指标指标在实验周期能测到,留存类长周期慎用④ 样本量充足能算出 MDE 对应的 N,罕见事件不适用6.2 AB 不适用 - 6 场景 替代方案场景典型例子替代方案⑤ 网络效应 / 社交推荐、好友互动、竞价DID / 准实验⑥ 全量合规 / 政策隐私政策、法规变更灰度 中断时间序列(ITS)⑦ 罕见事件大额付费、诈骗检测CUPED / 方差缩减⑧ 长期效应留存、品牌、LTV长留置组 后测⑨ 冷启动新功能无历史数据估方差用研 MVP 灰度⑩ 多变量交互同时改 UI 文案 算法MVT 析因设计重要提醒:替代方案不是 AB 的次品,而是对的方法用在对的场景。七、实验平台化:大厂的隐藏门槛简单跑 AB 只需一个分流 SDK,但实验规模一上来就出现新问题——多实验抢流量、配置混乱、结果不可复现。所以大厂都做了实验平台:7.1 分层正交分流(Layered Orthogonal Bucketing)把用户 hash 成 1000 个桶,每个实验层独立取桶组合,不同层的实验互不干扰、可并行运行。Google、Meta、字节都在用的标准方案。7.2 实验元数据管理每个实验有唯一 ID、假设、指标、样本量、决策记录,沉淀到知识库,支持复盘与复用。7.3 统一指标口径避免不同 PM 用不同公式算转化率,平台层统一定义。7.4 实验评审门新实验需过数据 BP 评审,防止低质量实验浪费流量。八、组织文化:从 HIPPO 到证据驱动技术再完善,组织文化不到位,AB 就只是工具。关键转变:决策权从职级(HIPPO, Highest Paid Persons Opinion)转向证据:实习生跑出的负向结果也能否决总监的直觉。容错机制:失败实验也有价值——否决了错误假设。把失败实验率作为健康度指标(健康范围 30-50%,过低说明太保守)。可证伪文化:每个产品决策都应能写成如果 X 成立,那么 Y 会提升 Z,而不是我觉得这样更好。反直觉结果接受:最大胆的改动往往反而无效甚至负向,这是 AB 最重要的副产品——暴露直觉的盲点。九、高阶话题(后续可深入)话题一句话定义应用价值CUPED(方差缩减)用预实验期协变量降低指标方差等同放大小样本量,大厂标配Uplift Modeling给会被改动正向影响的子群上线不只判断全量上/不上,精细化Bandit 算法多臂老虎机替代固定 AB减少实验期损失,适合推荐位后期分析(Post-launch)实验上线后追踪长期效应防止短涨长跌准实验方法DID、合成对照、PSM不能随机分流时的因果推断十、PM 面试视角10.1 高频考点清单统计显著性 vs 业务显著性两类错误(α 与 β)护栏指标 vs 核心指标(OEC)AA 检验的作用SRM(样本比失衡)新奇效应 vs 学习效应CUPED / 方差缩减分层正交分流10.2 区分度关键大部分候选人能说AB 就是两版本对比,但能讲清以下四块的少:两类错误:α、β、功效的精确含义样本量计算:MDE 反推 N 的逻辑能力边界:何时该用、何时换方案组织文化:从 HIPPO 到证据驱动的转型10.3 体现 PM 价值能讲 AB 方法论,意味着你不只是画原型,而是用证据驱动决策的 PM——这是中高级 PM 的标志。10.4 方法论回扣AB 体现 PM 三件事:假设构建能力:找到值得验证的命题度量设计能力:选对指标,既看核心也看护栏决策落地能力:把结果转化为行动这三件事本身就是 PM 的核心能力。十一、速查表:常见问题对照问题简明答案P 0.04 算显著吗?在 α0.05 下显著,但要结合效应量和 CI 判断业务价值实验显著但护栏指标崩了,上线吗?不上。护栏指标是硬约束,一票否决跑了一周还没显著,继续吗?看样本量是否到设计值;未到则继续,已到则接受无效结论SRM 报警怎么办?停实验排查分流逻辑 / 埋点 / 数据回传,修复后重跑新奇效应怎么处理?延长实验周期 2-4 周观察趋势是否回落多重比较怎么办?Bonferroni / FDR 校正,或事先声明主指标统计显著但效应量小怎么办?评估收益是否覆盖开发成本,否则不上线附录:本方法论涉及的关键英文术语缩写 / 术语全称 / 含义OECOverall Evaluation Criterion,综合评估指标MDEMinimum Detectable Effect,最小可检测效应SRMSample Ratio Mismatch,样本比失衡SUTVAStable Unit Treatment Value Assumption,用户独立性假设CUPEDControlled-Experiment Using Pre-Experiment Data,方差缩减DIDDifference-in-Differences,双重差分(准实验)PSMPropensity Score Matching,倾向得分匹配ITSInterrupted Time Series,中断时间序列MVTMultivariate Test,多变量测试(析因设计)HIPPOHighest Paid Persons Opinion,最高薪者意见LTVLife Time Value,生命周期价值