A/B测试中处理效应大于预设δ时是否仍需进行显著性检验?
A/B测试观测效应大于预设δ是否可以跳过显著性检验
结论
必须执行步骤3的显著性检验,不能直接以观测处理效应大于预设δ作为效果显著的判断依据。
核心原因
- 预设的δ是功效分析环节的「最小感兴趣效应量」,作用是帮你估算达到统计功效所需的最小样本量,本身不属于统计显著性的判断阈值,二者的作用逻辑完全不同。
- 观测到的处理效应只是当前抽样样本的统计结果,天然存在抽样误差:哪怕两组实际没有任何差异,随机抽样也完全有可能出现观测效应大于δ的情况,这种差异本质是随机波动导致的假阳性,不是处理本身带来的真实效应。
- 举个实际场景的例子:你预设δ为2%,按α=0.05、功效=0.8算出每组需要1万样本,跑满样本后观测到处理组比对照组高2.1%,看似超过了δ,但如果你的指标本身方差很大(比如用户付费转化率的标准差达10%),最终计算的p值很可能高于0.05的显著性阈值,此时的效应差异就不具备统计显著性,不能判定处理有效。
- 额外补充:显著性检验和效应量判断是A/B测试结果分析的两个互补维度,缺一不可:就算检验结果显著,如果观测效应远小于δ,也说明该处理的业务价值极低,不值得上线;反过来就算观测效应很高,没有通过显著性检验也不能排除随机波动的可能性。
内容的提问来源于stack exchange,提问作者Yuan Liu
相关产品推荐
相关产品推荐

