Digital Marketing Academy · 课时

统计显著性

样本量与置信度

第 3 / 4 课13 个步骤

统计显著性 是 CoddyKit 上的免费 Digital Marketing Academy 课时。 这是第 3 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 Digital Marketing Academy 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 Digital Marketing Academy 课程共包含 4 节课。

为什么显著性很重要

转化率会因偶然因素而上下波动。如果变体 B 在小样本中比 A 高 2%,这个差距可能纯粹是噪声。

统计显著性可以告诉您,观察到的差异有多大可能是真实的,而不是随机运气造成的。没有显著性,您可能会发布实际上毫无作用的更改。

信号与噪声

每次测量都有波动。将一枚公平的硬币抛十次,很少会刚好得到五次正面。

转化也是如此。短期测试可能仅仅因为某个变体连续走运,就显示出一个虚假的胜者。显著性可以将真正的信号与这种噪声区分开来。

Day 1: B looks +14% better
Day 3: gap shrinks to +4%
Day 7: gap settles to +1% (noise)
Early leads often regress to the mean.

P 值

如果变体之间实际上没有差异,P 值会估计出现当前结果或更极端结果的概率。

P 值较小意味着仅凭偶然因素很难出现该结果。营销人员通常将低于 0.05 的 P 值视为判定显著性的阈值。

p < 0.05  -> statistically significant
p = 0.20  -> likely just noise
Lower p = stronger evidence the
difference is real, not random.

置信度

大多数 A/B 工具报告置信度,而不是原始 P 值。95% 的置信度对应 P 值低于 0.05。

它的含义是:如果实际上没有发生变化,您只有大约 5% 的概率看到如此大的差异。更高的置信度需要更多数据。

统计功效

统计功效是指测试在真实效果存在时检测到该效果的概率。统计功效较低意味着真正的胜者可能会被忽略。

标准目标是 80% 的统计功效。统计功效不足的测试会浪费流量,并产生难以定论的结果,诱使您过早结束测试。

Typical targets
Confidence (significance) = 95%
Power                     = 80%
Minimum detectable effect = your call
These three drive sample size.

最小可检测效果

最小可检测效果,即 MDE,是指您希望测试能够可靠检测出的最小提升。

检测 1% 的微小提升,比检测 10% 的提升需要多得多的流量。请在上线前设定现实的 MDE;它会直接决定您所需的样本量。

计算样本量

运行测试前,请将基准转化率、目标 MDE、置信度和统计功效输入样本量计算器。它会告诉您每个变体需要多少访客。

请坚持这个数量。因为 B“看起来正在获胜”就提前结束,是团队最常见的自我误导方式。

Sample-size note
Baseline conversion = 5%
MDE                 = 10% relative (to 5.5%)
Confidence          = 95%
Power               = 80%
Needed ~ 31,000 visitors per variant

反复查看结果的问题

反复检查结果,并在显著性刚出现时停止,会大幅提高假阳性率。

每次查看都是一次让随机噪声越过界线的机会。请提前决定样本量和测试时长,然后耐心等待。不要在第一次出现绿色结果时就停止。

运行完整的业务周期

用户行为会因工作日、周末和发薪日而不同。从周一运行到周三的测试会完全错过周末购物者。

请至少运行一到两个完整星期,让每个变体都接触到具有代表性的流量组合。样本量和时间都会影响结果是否有效。

Bad:  run Tue-Thu only (3 days)
Good: run 2 full weeks
Why: weekday vs weekend buyers
differ; partial cycles bias results.

显著性不等于重要性

结果可能具有统计显著性,但对业务来说小到无关紧要。在流量极大的情况下,即使 0.1% 的提升也可能达到 95% 的置信度。

请始终将显著性与效果大小及其实际价值结合起来。请问自己:这项提升是否足以证明更改是值得的?

关注置信区间

置信区间显示真实效果的合理范围。点估计为 +8%,但区间从 -1% 到 +17%,这种结果并不稳妥。

请优先选择整个区间都保持为正的结果。跨过零点的宽区间意味着您无法确定这项变化是否真的有帮助。

Result A: +8% [+5% to +11%]  -> solid
Result B: +8% [-1% to +17%]  -> shaky
Interval crossing 0 means the
true effect could be negative.

快速检查

测试您对显著性的理解。

回顾:统计显著性

显著性可以将真实效果与随机噪声区分开来。请以 95% 的置信度和 80% 的统计功效为目标,设定 MDE,并在开始前计算样本量。

请避免中途查看结果,运行完整的业务周期,并根据效果大小和置信区间,而不只是显著性来判断结果。

免费开始

用 AI 导师学习 Digital Marketing Academy — 免费

在浏览器中编写并运行真实代码,获得全天候 AI 导师的即时帮助,并在网页或应用中继续学习。

课程
63
课程
239

常见问题解答

「统计显著性」课时是免费的吗?

是的 — 「统计显著性」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 Digital Marketing Academy 课程的其余内容,请升级到 CoddyKit PRO。 Digital Marketing Academy 课程共包含 4 节课。

「统计显著性」这节课中我会学到什么?

样本量与置信度 你通过在浏览器中直接运行的动手代码来练习 Digital Marketing Academy,全天候 AI 导师会在你学习这节课的过程中回答你的问题。

学习 Digital Marketing Academy 需要有经验吗?

无需任何先前经验。CoddyKit 上的 Digital Marketing Academy 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 3 节课,共 4 节。

「统计显著性」课时需要多长时间?

大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。

我能在这节 Digital Marketing Academy 课中编写并运行代码吗?

能。每节 Digital Marketing Academy 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。

此课程中的所有课时

  1. 测试什么
  2. 构建假设
  3. 统计显著性
  4. 解读结果
← 返回 Digital Marketing Academy