← 返回 QuantGrowth 首页

AB实验:最小样本量的科学估算

增长
增长A/B 测试
一个实验场景的实际渗透率,能将所需样本量放大数倍,这正是许多A/B测试结论波动巨大的隐藏原因。
最小样本量的科学估计,能让你在面对质疑时,自信地给出基于统计原理的精确数字,而非模糊的经验判断。

流量样本量的确定

实验结论被挑战的经典场景:老板问:“你的实验样本量置信吗?”你只能凭历史经验说:“我觉得 1000 个样本应该够了”——其实老板也没学过,他也不敢质疑你,因为到底 1000 够不够他也不知道,不了了之。

学完这部分知识后,你就能非常自信地回答:我是通过科学的验证方法得到的——最小样本量需要 3692,但我们实验组有 6000,满足科学实验方法的要求!

最小样本量的估计涉及两个统计概念:

一类错误 α(弃真):实验的真实数据是好的,但本次表现让我们觉得它不好。一般 α 取 0.05。

二类错误 β(取伪):本身实验是坏的,但本次刚好觉得它是好的。一般 β 取 0.2。

功能组好功能组不好拒绝一类错误α(弃真)正确选择接收正确选择二类错误β(取伪)

通常设定α为 0.05,β为 0.2 ;

Z 为正态分布的分位数函数

P1 是基础值,P2 是希望通过功能优化到的值


需要最小样本量计算

用库里投三分球来类比就很好理解:库里的三分命中率 43% 左右。如果只赌一个球,以球定胜负——我也是有一定概率赢的(因为样本量太小导致结论不可信)。但如果赌一万次三分球,那我一定输得很惨。

MDE(Minimum detectable effect):最小预期提升幅度

实际工作中不需要手算公式,推荐使用 Evan Miller 的在线工具。

例如:对照组 CTR=30%,预期提升 10%(绝对值提升 3 个百分点),工具直接输出最小样本量 3692。

预计实验需要多少流量可以访问 HTTPS://www.evanmiller.org/ab-testing/

考虑实验场景的渗透率

系统算出来的 3692 是默认渗透率 100%——所有分流用户都能进入你的实验场景。实际操作中不可能。渗透率 = 场景曝光 UV ÷ 产品 DAU。实际需要的样本 = 最小样本量 ÷ 渗透率。

用两个真实案例来说明:同一个产品,两个场景做 A/B。首页场景渗透率 80%,需要样本量 3692 ÷ 80% = 4615。支付页场景渗透率只有 30%,需要样本量 3692 ÷ 30% = 12307。

差异非常大!如果你看到其他同学的实验结论波动很大,除了看最小样本量,还要看他有没有考虑渗透率。