Statistische Signifikanz
Stichprobengröße und Konfidenz.
Statistische Signifikanz ist eine kostenlose Digital Marketing Academy-Lektion auf CoddyKit. Dies ist Lektion 3 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des Digital Marketing Academy-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der Digital Marketing Academy-Kurs umfasst insgesamt 4 Lektionen.
Warum Signifikanz wichtig ist
Conversion-Raten schwanken zufallsbedingt. Wenn Variante B Variante A bei einer kleinen Stichprobe um 2 % übertrifft, kann dieser Unterschied reines Rauschen sein.
Die statistische Signifikanz zeigt, wie wahrscheinlich es ist, dass der beobachtete Unterschied tatsächlich besteht und nicht auf Zufall beruht. Ohne sie besteht die Gefahr, Änderungen zu veröffentlichen, die nichts bewirken.
Signal und Rauschen
Jede Messung weist Schwankungen auf. Wenn Sie eine faire Münze zehnmal werfen, erhalten Sie nur selten genau fünfmal Kopf.
Dasselbe gilt für Conversions. Ein kurzer Test kann nur deshalb einen falschen Gewinner zeigen, weil eine Variante eine Glückssträhne hatte. Signifikanz trennt das echte Signal von diesem Rauschen.
Day 1: B looks +14% better
Day 3: gap shrinks to +4%
Day 7: gap settles to +1% (noise)
Early leads often regress to the mean.Der p-Wert
Der p-Wert schätzt die Wahrscheinlichkeit, Ihr Ergebnis oder ein noch extremeres Ergebnis zu beobachten, wenn tatsächlich kein Unterschied zwischen den Varianten bestünde.
Ein kleiner p-Wert bedeutet, dass das Ergebnis allein durch Zufall unwahrscheinlich wäre. Marketingfachleute betrachten einen p-Wert unter 0,05 häufig als Schwellenwert für statistische Signifikanz.
p < 0.05 -> statistically significant
p = 0.20 -> likely just noise
Lower p = stronger evidence the
difference is real, not random.Konfidenzniveau
Die meisten A/B-Tools geben statt eines rohen p-Werts ein Konfidenzniveau aus. Ein Konfidenzniveau von 95 % entspricht einem p-Wert unter 0,05.
Das bedeutet: Wenn sich tatsächlich nichts geändert hätte, würden Sie einen so großen Unterschied nur in ungefähr 5 % der Fälle beobachten. Ein höheres Konfidenzniveau erfordert mehr Daten.
Statistische Teststärke
Die Teststärke ist die Wahrscheinlichkeit, dass Ihr Test einen tatsächlich vorhandenen Effekt erkennt. Bei geringer Teststärke bleiben echte Gewinner unbemerkt.
Das Standardziel liegt bei einer Teststärke von 80 %. Tests mit zu geringer Teststärke verschwenden Traffic und liefern nicht eindeutige Ergebnisse, die dazu verleiten, sie zu früh abzubrechen.
Typical targets
Confidence (significance) = 95%
Power = 80%
Minimum detectable effect = your call
These three drive sample size.Kleinster nachweisbarer Effekt
Der kleinste nachweisbare Effekt, kurz MDE, ist die geringste Verbesserung, die der Test zuverlässig erkennen soll.
Um eine kleine Steigerung von 1 % zu erkennen, benötigen Sie deutlich mehr Traffic als für eine Steigerung von 10 %. Legen Sie vor dem Start einen realistischen MDE fest; er bestimmt direkt den erforderlichen Stichprobenumfang.
Den Stichprobenumfang berechnen
Geben Sie vor dem Start Ihre Ausgangsrate, den angestrebten MDE, das Konfidenzniveau und die Teststärke in einen Stichprobenumfangsrechner ein. Er zeigt Ihnen, wie viele Besucher jede Variante benötigt.
Halten Sie sich an diese Zahl. Ein vorzeitiges Ende, weil Variante B „wie der Gewinner aussieht“, ist die häufigste Art, wie Teams sich selbst täuschen.
Sample-size note
Baseline conversion = 5%
MDE = 10% relative (to 5.5%)
Confidence = 95%
Power = 80%
Needed ~ 31,000 visitors per variantDas Problem des wiederholten Nachsehens
Wenn Sie die Ergebnisse wiederholt prüfen und den Test in dem Moment beenden, in dem Signifikanz erreicht wird, steigt Ihre Fehlalarmrate erheblich.
Jede Prüfung ist eine weitere Gelegenheit für zufälliges Rauschen, die Signifikanzgrenze zu überschreiten. Legen Sie Stichprobengröße und Dauer im Voraus fest und warten Sie dann ab. Beenden Sie den Test nicht beim ersten positiven Ergebnis.
Vollständige Geschäftszyklen testen
Das Verhalten unterscheidet sich an Werktagen, Wochenenden und Zahltagen. Ein Test, der von Montag bis Mittwoch läuft, erfasst Wochenendkäufer überhaupt nicht.
Führen Sie den Test mindestens eine oder zwei vollständige Wochen lang durch, damit jede Variante eine repräsentative Mischung aus Besuchern sieht. Sowohl Stichprobengröße als auch Dauer sind Voraussetzungen für ein gültiges Ergebnis.
Bad: run Tue-Thu only (3 days)
Good: run 2 full weeks
Why: weekday vs weekend buyers
differ; partial cycles bias results.Signifikanz ist nicht gleich Bedeutsamkeit
Ein Ergebnis kann statistisch signifikant und für das Unternehmen trotzdem zu unbedeutend sein. Bei sehr hohem Traffic kann selbst eine Steigerung von 0,1 % ein Konfidenzniveau von 95 % erreichen.
Betrachten Sie die Signifikanz immer zusammen mit der Effektgröße und ihrem praktischen Wert. Fragen Sie sich: Ist diese Steigerung groß genug, um die Änderung zu rechtfertigen?
Achten Sie auf das Konfidenzintervall
Das Konfidenzintervall zeigt den plausiblen Bereich des tatsächlichen Effekts. Eine Punktschätzung von +8 % mit einem Intervall von −1 % bis +17 % ist unsicher.
Bevorzugen Sie Ergebnisse, bei denen das gesamte Intervall positiv bleibt. Ein breites Intervall, das null überschreitet, bedeutet, dass Sie nicht sicher sein können, ob die Änderung überhaupt hilft.
Result A: +8% [+5% to +11%] -> solid
Result B: +8% [-1% to +17%] -> shaky
Interval crossing 0 means the
true effect could be negative.Kurztest
Testen Sie Ihr Verständnis von Signifikanz.
Zusammenfassung: Statistische Signifikanz
Signifikanz trennt echte Effekte von zufälligem Rauschen. Streben Sie eine Konfidenz von 95 % und eine Teststärke von 80 % an, legen Sie eine MDE fest und berechnen Sie die Stichprobengröße, bevor Sie den Test starten.
Vermeiden Sie vorzeitiges Nachsehen, führen Sie den Test über vollständige Geschäftszyklen hinweg durch und bewerten Sie die Ergebnisse anhand von Effektstärke und Konfidenzintervall, nicht anhand der Signifikanz allein.
Häufig gestellte Fragen
Ist die Lektion „Statistische Signifikanz“ kostenlos?
Ja — der vollständige Text von „Statistische Signifikanz“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des Digital Marketing Academy-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der Digital Marketing Academy-Kurs umfasst insgesamt 4 Lektionen.
Was lerne ich in „Statistische Signifikanz“?
Stichprobengröße und Konfidenz. Du übst Digital Marketing Academy mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.
Brauche ich Erfahrung, um Digital Marketing Academy zu starten?
Keine Vorkenntnisse erforderlich. Digital Marketing Academy auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 3 von 4.
Wie lange dauert die Lektion „Statistische Signifikanz“?
Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.
Kann ich in dieser Digital Marketing Academy-Lektion Code schreiben und ausführen?
Ja. Jede Digital Marketing Academy-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.
Alle Lektionen in diesem Kurs
- Was Sie testen sollten
- Eine Hypothese formulieren
- Statistische Signifikanz
- Ergebnisse auswerten