免费AB测试计算器

组1

组2

结果

输入分组数据以计算统计显著性

理解A/B测试

A/B测试(也称为拆分测试或双比例Z检验)是一种统计技术,用于比较两组并评估它们在特定结果上的差异是否具有统计意义。营销人员、产品开发人员和研究人员依靠它来决定,例如,新的网站布局是否带来更高的转化率,或者某种治疗是否优于对照组。A/B测试属于Z检验家族,旨在评估观察到的两个比例之间的差距是真实的还是仅仅由随机因素造成。

每个A/B测试都从一个原假设开始,原假设假定两个总体具有相同的真实比例。目标是收集足够的证据来拒绝该原假设——即证明各组确实不同。此处提供的工具自动完成整个计算,仅需要每组的样本量和正结果数(或转化率),以及您选择的置信水平。

“统计显著性”意味着什么?

统计显著性描述的是实验结果的极端程度,以至于仅仅靠随机因素很难发生。假设你掷硬币100次,观察到60次正面。硬币有偏还是纯粹幸运?显著性检验帮你做出判断。如果结果具有统计显著性,你可以合理地将其归因于潜在因素(硬币不公平),而不是抽样误差。

双比例Z检验的机制

进行A/B测试,你需要来自两组的数据:

  • 样本量:n1n_{1} 和 n2n_{2}
  • 正结果数:t1t_{1} 和 t2t_{2}

由此计算每组比例:

p1=t1n1,p2=t2n2p_{1} = \frac{t_{1}}{n_{1}}, \qquad p_{2} = \frac{t_{2}}{n_{2}}

然后计算整体合并比例——两组的总正比率:

p=t1+t2n1+n2p = \frac{t_{1} + t_{2}}{n_{1} + n_{2}}

检验统计量是Z值,它衡量两个比例相对于期望变异的差距大小:

Z=p1−p2p(1−p)(1n1+1n2)Z = \frac{p_{1} - p_{2}}{\sqrt{p(1 - p)\left(\dfrac{1}{n_{1}} + \dfrac{1}{n_{2}}\right)}}

由于这是双尾检验(我们寻找任何差异,不指定方向),我们将显著性水平(alpha)分为两半。决策规则将|Z|的绝对值与临界值Zα/2Z_{\alpha/2}进行比较,Zα/2Z_{\alpha/2}取决于所选置信水平:

置信水平显著性水平 (α\alpha)临界Z值 (Zα/2Z_{\alpha/2})
90%10%1.645
95%5%1.960
98%2%2.326
99%1%2.576

如果∣Z∣>Zα/2|Z| > Z_{\alpha/2},则结果位于拒绝域,拒绝原假设——差异具有统计显著性。如果∣Z∣<Zα/2|Z| < Z_{\alpha/2},则无法拒绝原假设;观察到的差距可能来自随机因素。

逐步过程

  1. 选择置信水平(通常为90%、95%、98%或99%)。
  2. 根据上表确定临界Z值。
  3. 使用公式计算p1p_{1}、p2p_{2}、合并比例pp,最后计算Z值。
  4. 比较∣Z∣|Z|与Zα/2Z_{\alpha/2}。
  5. 得出结论:如果∣Z∣>Zα/2|Z| > Z_{\alpha/2},拒绝原假设;否则,接受原假设。

一个实例

考虑两个网站页面进行转化测试:

  • A组:n1=40n_{1} = 40,t1=2t_{1} = 2 → 转化率 p1=5%p_{1} = 5\%
  • B组:n2=12n_{2} = 12,t2=5t_{2} = 5 → 转化率 p2≈41.7%p_{2} \approx 41.7\%

合并比例:

p=2+540+12=752≈0.1346p = \frac{2 + 5}{40 + 12} = \frac{7}{52} \approx 0.1346

Z值计算:

Z=0.05−0.41670.1346×0.8654×(140+112)≈−0.36670.1123≈−3.27Z = \frac{0.05 - 0.4167}{\sqrt{0.1346 \times 0.8654 \times \left(\frac{1}{40} + \frac{1}{12}\right)}} \approx \frac{-0.3667}{0.1123} \approx -3.27

对于90%置信水平,Zα/2=1.645Z_{\alpha/2} = 1.645。由于∣Z∣=3.27>1.645|Z| = 3.27 > 1.645,差异具有统计显著性。B组较高的转化率不太可能是偶然结果。

您可以使用本页上的A/B测试计算器重现此示例——只需输入样本量、正结果数和置信水平。

可靠拆分测试的条件

双比例Z检验依赖几个假设:

  • 样本量:每组至少应有30个观测值,每组50或以上更理想。样本量较小时会违反Z检验所需的正态性假设。
  • 平衡性:样本量应大致相等。虽然不是严格要求,但严重不平衡会降低检验的功效和有效性。
  • 随机抽样:数据必须从目标总体中随机收集。不具有代表性的样本会导致有偏且不可靠的结果。

使用A/B测试计算器

此工具简化了整个流程:

  1. 输入每组的样本量和正结果数(或百分比)。
  2. 从下拉菜单中选择所需的置信水平(90%、95%、98%或99%)。
  3. 点击“计算”——计算器将运行双比例Z检验,并立即告知您差异是否具有统计显著性。

无需手动公式计算。结果包含Z值和一个关于显著性的清晰说明,使您能够快速做出数据驱动的决策。

常见问题

1. 在A/B测试中,“统计显著性”意味着什么?

这意味着观察到的两组差异足够大,随机因素几乎不可能解释。用统计术语来说,Z值超过所选置信水平的临界值,从而导致我们拒绝两组相同的原假设。

2. 有效的拆分测试需要多大的样本量?

两组均应包含至少30个观测值,每组50个或以上更好。此外,样本量应大致相等,且数据随机收集,才能满足检验的假设。

3. 双比例Z检验的Z值如何计算?

首先计算每组比例和合并比例。Z值公式为:\( Z = \frac{p_1 - p_2}{\sqrt{p(1-p)(1/n_1 + 1/n_2)}} \),其中\( p \)是总体合并比例。然后将此值与置信水平表中的临界Z值进行比较。

4. 我应该选择哪个置信水平?

最常见的是95%,它在严谨性和敏感性之间取得了平衡。您也可以选择90%、98%或99%。置信水平越高,犯假阳性错误的风险越低,但也更难检测到真实差异;置信水平越低则相反。

5. 如果样本量相差很大,我可以使用A/B测试吗?

该检验假设样本量大致相等以获得最佳性能。虽然您仍然可以应用不均匀的样本量,但结果的可信度会降低。最好争取平衡的组,或者如果失衡严重则使用其他方法。

使用方法

  1. 输入组1和组2的样本量和正结果数。
  2. 从下拉菜单中选择所需的置信水平(90%、95%、98%或99%)。
  3. 查看Z值、p值、转化率以及结果是否具有统计显著性。