当老板质疑你的大改版搞砸了长期数据时,你该如何自证清白?Facebook和国内一家公司的对比,揭示了一个关键答案。
如何确定实验时长?
实验时长建议满足三个条件:
大于理论实验时间(可用 Evan Miller 工具计算)
跨客户端发版周期(因为先升级的用户往往是积极用户,结果可能偏乐观)
跨完整一周(绝大多数产品都有周末效应,周末和工作日的差异往往很大)
如果发版节奏特别快,一周一版不能满足完整一周,也尽量跨一个周末。
警惕新奇效应(Novelty Effect)
实际操作中经常遇到:前几天的数据特别令人兴奋,功能组数据大幅好于对照组,但过了几天提升效果越来越弱。往往是因为用户对新 Feature 刚开始感到好奇想尝试,但如果没有持续感受到价值,后续就不来了。这种现象叫做「新奇效应」,特别常出现在 UI 策略变化的时候。当发生新奇效应时,要延长实验周期,等数据稳定后再输出结论。

桌面角标数值变大带来的新奇效应
设置长期对照组
实验都稳定了、放量了,基本结束了——可是过了半年,老板发现大盘数据跌了。这个数据阴跌的开始节点跟你的大改版时间是吻合的。老板一定会怀疑:是不是你的改版把数据搞坏了?这时候怎么向老板证明不是你的问题?

长期效果怎么看
先看一个经典案例。2012 年,Facebook 一位叫 Sam 的 VP 亲自带团队做了大改版。做过 AB 实验之后,新版本相对于老版本,用户活跃、广告收入都有下降。新版本前前后后折腾了一年多,最后还是回滚到了老版本。而差不多同时期,国内一家公司参考了 Facebook 的新版设计做了类似改版,但没有保留长期对照组——最后在失败的改版上越走越远,等到发现问题的时候新版本上已经合入太多功能和代码,为时已晚。

Facebook大改版与回滚案例
这个对比说明什么?很大程度上跟有没有长期对照组有关。Facebook 有完备的长期对照组方案,能及时发现问题;而没有这套系统的公司,过了一两年才发现问题,已经改不掉了。
什么场景适用长期对照组?
第一,有争议的关键需求。比如上了一个端外变现功能,收入提升 200%,但长期留存是负向的。一咬牙推了全量,但一定要保留长期对照组来评估累积的留存下跌影响。
第二,大改版。大改版很难把各方面利益都平衡好——收入涨、时长涨、各功能模块留存都涨,基本不现实。如果没有长期对照组,受影响的功能模块负责人就会来质疑你,可能本来只影响 2%,他说影响 20%——「我今年的 KPI 完不成全赖你的改版」。有了长期对照组,一切就迎刃而解——直接看数据,客观评估影响。

具体做法:在非重叠域保留一个长期对照组(比如 2% 的流量),始终跑去年版本,今年所有实验的新功能都不对这 2% 流量生效。如果系统维护成本可接受,建议一直保留下去。