背景:为什么需要「实验样本量测算」

A/B 测试最常见的失败原因不是「改动不好」,而是「没跑够样本就下结论」。要检测多大的提升、需要多少人——这个数在实验开始前就必须算清楚,而不是跑了一周看心情停。
⚠ 常见痛点:实验时长随意:流量小的产品跑三天就下结论,结果「测出」的提升全量后消失。

方法:怎么算

  1. 输入:基线转化率、想检测的最小提升(相对值)、置信度(默认 95%)、功效(默认 80%)
  2. 标准两比例检验公式计算每组所需样本量
  3. 填日流量可自动换算「需要跑几天」
  4. 输出:每组样本量、总样本、预计天数
每组 n = ( zα·√(2p̄(1−p̄)) + zβ·√(p₁(1−p₁)+p₂(1−p₂)) )² ÷ (p₂−p₁)²:每组 n = ( zα·√(2p̄(1−p̄)) + zβ·√(p₁(1−p₁)+p₂(1−p₂)) )² ÷ (p₂−p₁)²

案例:真实数字走一遍

CASE
某产品准备测试新推荐算法
输入:基线转化率 5%、想检测 10% 相对提升(→5.5%)、95% 置信、80% 功效
  1. p₁ = 0.05,p₂ = 0.055,合并 p̄ = 0.0525
  2. 代入标准公式:每组 ≈ 31243 人
  3. 总样本 62486 人;日流量 2000 → 需 32 天
结论:这个实验至少要跑一个月。产品经理原本计划的「跑一周看结果」被否——一周每组只有 1.4 万人,只能检测 15% 以上的大提升。