做时间的朋友:AB实验长期对照组
当老板质疑你的大改版搞砸了长期数据时,你该如何自证清白?Facebook和国内一家公司的对比,揭示了一个关键答案。 如何确定实验时长? 实验时长建议满足三个条件: 大于理论实验时间(可用 Evan Miller 工具计算) 跨客户端发版周期(因为先升级的用户往往是积极用户,结果可能偏乐观) 跨完整一周(绝大多数产品都有
9 篇已发布内容
当老板质疑你的大改版搞砸了长期数据时,你该如何自证清白?Facebook和国内一家公司的对比,揭示了一个关键答案。 如何确定实验时长? 实验时长建议满足三个条件: 大于理论实验时间(可用 Evan Miller 工具计算) 跨客户端发版周期(因为先升级的用户往往是积极用户,结果可能偏乐观) 跨完整一周(绝大多数产品都有
一个实验场景的实际渗透率,能将所需样本量放大数倍,这正是许多A/B测试结论波动巨大的隐藏原因。 最小样本量的科学估计,能让你在面对质疑时,自信地给出基于统计原理的精确数字,而非模糊的经验判断。 流量样本量的确定 实验结论被挑战的经典场景:老板问:“你的实验样本量置信吗?”你只能凭历史经验说:“我觉得 1000 个样本应
早期的互斥分流方法正面临流量瓶颈,而一种能让一个用户样本在不同实验中反复使用的‘正交分流’设计应运而生。 随着并行A/B测试实验越来越多,流量不够用的‘饥渴’问题该如何解决? 互斥实验 vs 正交实验 早期的 A/B 系统往往采用互斥的方法分流——把流量样本分成 100 组或其他固定数量,产品经理各自申请若干组流量,组
你是否也曾像二战时的军方一样,只盯着返航飞机上的弹孔,而忽略了那些坠毁的、更关键的线索?这正揭示了我们分析数据时一个致命的盲点。 幸存者偏差的故事 第二次世界大战期间,哥伦比亚大学的统计学家亚伯拉罕·瓦尔德提出了一个极具反直觉的解决方案。军方委托他确定应在飞机的哪些部位加装装甲,以提高飞机完成任务并幸存的概率。军方研究
为了保证分流的公平,A/B测试必须遵守两个铁律:功能组与对照组的用户特征要同质,实验的开启与结束要同时。 A/B实验就像从两个桶里舀水,如果舀出来的水各项特征必须一致,这个特质就叫‘同质性’,而验证它的秘密武器,竟然是另一场看似无用的AA实验。 AB 实验的分流方式 A/B 实验又常被叫做「桶实验」,分流又常被叫做「分
在设计产品方案时,必须遵循一个关键原则:具备强目的性,并形成一个明确可量化、可归因的具体方案。 A/B 实验的分成了三个步骤 1、提出假设&方案设计 包括数据分析、竞品反推、决策&洞察、用户反馈 需求方案设计:强目的性、可量化、可归因 2、实验设计 分流方式:互斥/正交实验 流量样本量:满足置信度,结合
如果没有A/B实验,一个能带来30%收入增长的功能和一个导致10%下滑的功能混在一起发布,你只能看到一个‘整体不错’的假象。 一个版本发布后数据持续下跌,团队花数周查Bug、开会,最终被迫回滚——这种开发噩梦,本可以通过A/B实验在发布前就彻底避免。 第一、加速迭代 让多组实验互不干扰地同时进行。早期没有 A/B 系统
A/B测试,就是在争议和直觉之外,用数据和单一变量原则来接管你的主观判断。 A/B 测试的定义 翻看了很多国内外文献,想找一个比较精确的定义。但大家的定义基本就是举例子——“A/B 实验就是功能组的按钮是红的,对照组是绿的,比较两组数据表现”。既然找不到现成的,我就自己归纳一下: A/B Test是指:为了达成一个明确
你知道互联网上无处不在的A/B测试,其源头竟始于一艘远洋船上对12名船员的食物实验吗? 1747 年左右,大航海时代,船员们经常在大海上航行好几个月,非常容易得一种叫“坏血病”的疾病。坏血病非常恐怖,病人从一开始牙龈出血,逐渐发展到全身溃烂而死,死状惨不忍睹。 有一位名叫 詹姆斯·林德 的英国军医,想要解决这个问题。他