加载中...

| 类型 | 产品实验方法 / 统计方法 |
| 关键统计概念 | p 值、统计功效、置信区间 |
| 主流工具 | Optimizely、Statsig、Eppo |
A/B 测试起源于 20 世纪初的农业实验和医学临床试验,被引入互联网产品是在 2000 年代。谷歌有一个广为流传的案例:2000 年 Marissa Mayer 主导的一次测试,把搜索结果页每行显示的广告数从 10 条测试到 12 条,结果 12 条版本的收入显著更高。
A/B 测试可以应用的对象极广:按钮颜色、文案措辞、落地页布局、价格策略、推荐算法、邮件标题。Netflix 每年运行数千个 A/B 测试,包括测试海报图片(同一部影片用不同封面图哪个点击率更高),测试结果直接影响内容推荐算法。[1]
A/B 测试的结论要有统计学基础,核心概念是 p 值和置信区间。通常要求 p < 0.05(置信度 95%)才认为差异显著。
实际工程中有几个常见问题:过早停止测试(看到 A 领先就停,但差异可能是随机波动);多重检验问题(同时测 20 个指标,纯靠运气也可能让一个指标达到显著);网络效应干扰(社交产品中 A 组和 B 组用户相互影响,随机分组假设不成立)。Booking.com 的数据科学团队曾公开讨论这些问题,并介绍了他们如何用序贯检验处理早停偏差。

| 类型 | 产品实验方法 / 统计方法 |
| 关键统计概念 | p 值、统计功效、置信区间 |
| 主流工具 | Optimizely、Statsig、Eppo |
登录 后参与讨论
暂无讨论,来发表第一条评论吧