当实验结果看似正向时,应该优先检查负向指标——用户退订率是否升高、卸载率有无异动,这些常被遗漏的数据才是真正的‘警报器’。
实验结论的四类指标
输出实验结论时,需从四个维度进行综合分析:
**基础指标:**活跃用户数、留存率、使用时长等大盘层面通用的核心指标,用于判断实验是否对产品基本面产生负面影响。
**过程指标:**达成结果指标的各转化环节数据。例如 Push 推送的完整漏斗:服务端下发 → 客户端收到 → 通知权限开启 → 成功展示 → 用户点击 → 成功跳转。任一环节出现异常都需要定位排查。

**结果指标:**实验预期提升的目标指标,如点击率、转化率、收入等。
**负向指标:**常被遗漏但至关重要。包括退订率(用户关闭通知/弹窗)、卸载率等。卸载率在移动端难以精确统计,可通过后台联网率近似估算(如次日无联网上报则大概率已卸载)。

脏数据的产生与处理
实验组中出现对照组行为的数据,除数据采集清洗和技术原因外,还有两种常见来源:
其一,A/B 配置已下发但生效时机延后。为避免页面闪动等体验问题,样式类实验通常在下一次进入场景时才生效——导致部分时间内用户在对照组,部分时间在功能组。

其二,当日获取配置的时机较晚。例如用户上午 8 点产生的行为仍为对照组,下午 2 点获取功能组配置后才切换——该用户全天被标记为功能组,但上午的数据仍为对照组。
处理方案:优先将实验生效时间设定为零点;对已污染的样本进行剔除(如 10000 个样本中剔除 1000 个污染样本,在 9000 个纯净样本上分析)。脏数据通常只影响效果幅度,不影响方向,但剔除后结论更严谨。
a 对照组功能组功能组校正后曝光
有 1000 个样本被污染 9000 点击
| 对照组 | 功能组 | 功能组校正后 | |
|---|---|---|---|
| 曝光 | 10000 | 10000 有1000个样本被污染 |
9000 |
| 点击 | 2000 | 2100 | 1950 |
| CTR | 20% | 21% | 21.6% |
放量决策流程
实验放量的前置条件:分流策略正确、样本量满足要求、时长覆盖完整周期、数据经过清洗处理。满足以上条件后,依据四类指标综合判断:
结果指标显著正向,基础指标和负向指标无明显异常 → 全量发布。结果指标未达预期,或基础指标出现下滑,或负反馈指标异常升高 → 终止实验,分析原因,重新设计方案。有时可通过人群拆分发现差异化效果——某些策略仅对特定用户群体有效。

实战案例:引导登录按钮优化
实验背景
某应用的合规要求是提升用户登录率。当前产品现状:首页存在引导登录弹窗,渗透率约 50%,弹窗内“立即登录”按钮的点击率为 40%,点击后拉起系统登录页面。该应用已接入 A/B 系统,DAU 约为 100 万,每两周发版一次。
提升登录率有多种路径——增加引导登录入口、优化按钮点击率、改进登录 SDK 取号逻辑、接入第三方登录方式等。本次实验以“提升立即登录按钮点击率”为切入点。
实验方案:将立即登录按钮和“下次再说”取消按钮的位置从左右结构改为上下结构,并将取消按钮透明度降低 30%,使“立即登录”更为醒目。基于历史上类似样式优化的经验,预期点击率绝对值提升 5 个百分点。

实验设计
分流方式:样式优化属于 UI 层改动,选择在 UI 实验层上进行分流(与其他 UI 层实验互斥)。UI 层剩余可用流量为 50%,对应约 50 万 DAU。

样本量:基准值(当前点击率)为 40%,预期绝对值提升 5 个百分点。通过在线工具计算最小样本量为 1514,除以场景渗透率 50%,实际需要 3028 个样本。

实验时长:选择 10 天,在发版周期内跨完整一周。第一天数据通常不稳定,从第二天即开始观测。由于改动幅度不大、争议性较低,不设置长期对照组。
数据分析与结论
实验完成后,四类指标表现如下:
**基础指标:**大盘活跃度、留存率无显著变化。
**过程指标:**弹窗展示 → 点击 → 拉起登录页面 → 成功登录,各环节转化率均正常提升,因果链条完整。
**结果指标:**整体登录率显著提升,符合实验预期。
**负向指标:**卸载率无异常波动。
综合以上数据,实验全量发布。