背景:为什么需要「实验效果评估」

「改版后转化率从 4% 涨到 4.6%,我们成功了!」——先别急。4.6% 和 4% 的差别可能只是随机波动。统计检验(Z 检验)是区分「真效果」和「运气」的唯一方法。
⚠ 常见痛点:看到数据涨就全量上线,不检验显著性——很多「成功」的改版在放大流量后效果消失。

方法:怎么算

  1. 输入:对照组人数与转化数、实验组人数与转化数
  2. 工具计算两组转化率、绝对提升(pp)、相对提升(%)
  3. Z 检验:Z = (p₂−p₁) ÷ 标准误;Z > 1.96 即 95% 置信显著
  4. 输出:是否显著、提升幅度、年化价值估算
Z = (p₂ − p₁) ÷ SE,其中 SE = √(p̄(1−p̄)(1/n₁+1/n₂)):Z = (p₂ − p₁) ÷ SE,其中 SE = √(p̄(1−p̄)(1/n₁+1/n₂))
Z > 1.96 → 95% 置信显著:Z > 1.96 → 95% 置信显著

案例:真实数字走一遍

CASE
某电商新详情页 A/B 测试
输入:对照组 10000 人 400 单;实验组 10000 人 460 单
  1. 转化率:4.0% vs 4.6%,相对提升 15%
  2. 合并比例 p̄ = 4.3%,标准误 SE ≈ 0.00287
  3. Z = 0.006 ÷ 0.00287 ≈ 2.09 > 1.96 → 显著!
结论:15% 的提升是真实的(95% 置信),批准全量。如果 Z 只有 1.5,同样的涨幅结论会是「继续观察,可能是波动」——检验改变了决策。