Die wichtigsten Erkenntnisse
- Deine Shopify A/B-Test Sample Size (Stichprobengröße) ist die Anzahl an Besuchern, die jede Variante braucht, bevor das Ergebnis irgendeine Aussagekraft hat. Wenn du den Gewinner zu früh bestimmst, interpretierst du nur Rauschen.
- Vier Faktoren bestimmen sie: deine Baseline Conversion Rate (Ausgangs-Conversion-Rate), der Minimum Detectable Effect (minimaler nachweisbarer Effekt), den du erfassen willst, das Signifikanzniveau (meistens 95 %) und die statistische Power (meistens 80 %).
- Eine niedrigere Baseline Conversion Rate und ein kleinerer nachweisbarer Effekt treiben die benötigte Stichprobe schnell in die Höhe. Kleine Änderungen bei Shops mit wenig Traffic können Zehntausende Besucher pro Variante erfordern.
- Nutze einen kostenlosen Rechner wie den von Evan Miller, um die Zahl zu berechnen, und plane den Test dann in vollen Wochen, damit Wochentagsmuster das Ergebnis nicht verfälschen.
- Fudge veröffentlicht deine Testvariante in wenigen Minuten als nativen Theme-Code. Das Langsame ist also der Traffic, nicht die Entwicklung.
Deine Shopify A/B-Test Sample Size ist die eine Zahl, die darüber entscheidet, ob ein Test dir überhaupt etwas sagen kann. Sie gibt an, wie viele Besucher jede Version der Seite sehen müssen, bevor der Unterschied zwischen ihnen echt und nicht bloß Zufall ist.
Machst du hier einen Fehler, ist die ganze Aktion reines Theater. Dieser Guide zeigt dir, warum die Sample Size wichtig ist, welche vier Faktoren sie bestimmen, die Formel inklusive Rechenbeispiel, ein Spreadsheet-Template zum Kopieren und die Realität für die meisten Shopify-Shops, die mit wenig Traffic zu kämpfen haben.
Warum du uns vertrauen kannst
Wir arbeiten seit über vier Jahren im Shopify-Bereich und haben Hunderten von Marken geholfen, ihre Storefronts zu verbessern. Wir bauen Fudge, einen KI-Storefront-Editor mit einer 4.9-Bewertung im Shopify App Store. Wir sitzen also direkt auf der Theme-Ebene, wo diese Tests tatsächlich ablaufen, und sehen, wie oft sie beendet werden, bevor die Daten das hergeben.
Warum die Sample Size wichtig ist
Ein A/B-Test vergleicht zwei Versionen einer Seite und misst, welche besser konvertiert. Der Haken daran ist, dass Conversions natürlichen Schwankungen unterliegen (Noise). Wenn du eine faire Münze 20 Mal wirfst, bekommst du selten genau zehnmal Kopf. Kleine Stichproben schwanken stark um die tatsächliche Rate.
Die Sample Size ist dein Schutz gegen dieses Rauschen. Unterhalb des Schwellenwerts kann eine Variante reiner Zufall sein, aber fälschlicherweise wie ein 15%iger Gewinner aussehen.
Zwei Fehlerquellen entstehen, wenn man sie ignoriert.
Underpowered Tests (zu wenig Power). Wenn du den Test mit zu wenigen Besuchern beendest, kann sich eine echte Verbesserung im Rauschen verstecken und als “kein Unterschied” gelesen werden. Du schlussfolgerst, dass die Änderung nicht funktioniert hat, setzt nichts live und lässt den Uplift auf der Strecke.
Peeking und zu frühes Stoppen. Der verlockendere Fehler ist, täglich aufs Dashboard zu schauen und den Test zu stoppen, sobald die Signifikanz grün aufleuchtet. Jeder zusätzliche Blick (Peeking) ist eine weitere Chance für eine zufällige Schwankung, die Ziellinie zu überqueren. Wiederholtes Überprüfen treibt die echte Falsch-Positiv-Rate weit über die 5 %, von denen du denkst, dass du sie hast.1 Die Lösung: Leg die Sample Size im Voraus fest und warte ab.
Das ist der Unterschied zwischen dem bloßen Ausführen von Tests und dem Führen eines echten Testing-Programms. Das große Ganze findest du in unserem Guide zu Shopify Conversion Testing.
Die vier Faktoren der Sample-Size-Berechnung
Jeder Rechner fragt nach denselben vier Dingen. Wenn du sie verstehst, ist die Zahl keine Blackbox mehr.
| Eingabe | Was das bedeutet | Typischer Wert |
|---|---|---|
| Basis-Conversion-Rate | Die aktuelle Conversion-Rate der Seite, die du testest | Was auch immer dein Shop aktuell erreicht |
| Minimum Detectable Effect (MDE) | Der kleinste Uplift, den der Test erkennen können soll | 10 % bis 30 % relativ |
| Statistische Signifikanz | Die Sicherheit, dass das Ergebnis kein Zufall ist (bestimmt durch Alpha) | 95 % (Alpha 0,05) |
| Statistische Power | Die Chance, einen echten Effekt zu erkennen, wenn es einen gibt (bestimmt durch Beta) | 80 % |
Baseline Conversion Rate
Das ist dein Startpunkt, gezogen aus deinen eigenen Analytics für genau die Seite und Zielgruppe, die du testen willst. Eine Produktseite, die mit Mobile-Traffic getestet wird, hat eine andere Baseline als dieselbe Seite auf dem Desktop. Grenze den Wert also exakt auf deinen Test ein.
Minimum Detectable Effect
Der Minimum Detectable Effect ist der kleinste Uplift, bei dem sich die Erkennung lohnt, meist als relativer Prozentsatz angegeben. Ein MDE von 20 % bei einer Baseline von 3 % bedeutet, dass du einen Sprung auf 3,6 % zuverlässig erkennen möchtest.
Diesen Faktor schätzen die Leute am häufigsten falsch ein. Ein kleinerer MDE bedeutet einen empfindlicheren Test, und Empfindlichkeit ist teuer. Wenn du den Effekt, den du erfassen willst, halbierst, vervierfacht sich die Anzahl der benötigten Besucher ungefähr.
Signifikanz und Power
Die Signifikanz (95 %) legt fest, wie sicher du sein möchtest, dass ein erkannter Gewinner kein Zufall ist. Die Power (80 %) bestimmt, wie wahrscheinlich es ist, dass du einen Gewinner entdeckst, der tatsächlich existiert. Beides sind Konventionen, keine Gesetze, aber sie sind bewährte Standards und ein vernünftiger Startpunkt für die meisten Stores.
Die Sample-Size-Formel und ein Rechenbeispiel
Für einen Test, der zwei Conversion Rates vergleicht, lautet die Standardnäherung für die benötigten Besucher pro Variante:
n = (z_alpha + z_beta)^2 x [ p1(1-p1) + p2(1-p2) ] / (p2 - p1)^2
wobei:
p1 = Baseline Conversion Rate
p2 = Baseline x (1 + MDE)
z_alpha = 1,96 (zweiseitig, 95 % Signifikanz)
z_beta = 0,84 (80 % Power)
Gehen wir einen konkreten Fall durch. Bei einer Baseline Conversion Rate von 3 % möchtest du einen relativen Uplift von 20 % erfassen, bei 95 % Signifikanz und 80 % Power.
- p1 = 0,03, also p2 = 0,03 x 1,20 = 0,036
- (1,96 + 0,84)^2 = 2,8^2 = 7,84
- p1(1-p1) = 0,0291, und p2(1-p2) = 0,0347, ergibt in Summe etwa 0,0638
- (p2 - p1)^2 = 0,006^2 = 0,000036
Setzt man das zusammen, ergibt das 7,84 x 0,0638 / 0,000036. Das entspricht etwa 13.900 Besuchern pro Variante oder rund 27.800 insgesamt.
Das ist die Zahl, die der Rechner ausspuckt. Der große Vorteil, das einmal per Hand durchzurechnen, liegt darin, dass du genau siehst, wie die einzelnen Faktoren das Ergebnis beeinflussen.
Wie Baseline und MDE die Zahl verändern
Die zwei Haupttreiber sind deine Basis-Conversion-Rate und der Effekt, den du erzielen willst. Beide können die Stichprobengröße schnell in die Höhe treiben. Die folgende Tabelle wendet dieselbe Formel bei 95 % Signifikanz und 80 % Power auf einige Szenarien an.
| Basis-CVR | Relativer MDE | Besucher pro Variante | Wochen bei 4.000 Test-Besuchern/Woche |
|---|---|---|---|
| 3 % | 30 % | ~6.400 | ~4 Wochen |
| 3 % | 20 % | ~13.900 | ~7 Wochen |
| 3 % | 10 % | ~53.100 | ~27 Wochen |
| 1 % | 20 % | ~42.600 | ~21 Wochen |
| 5 % | 20 % | ~8.100 | ~4 Wochen |
Aus der Mathematik ergeben sich zwei Muster.
Kleinere Effekte kosten viel mehr. Senkt man den MDE bei einer Basis von 3 % von 20 % auf 10 %, steigt der Bedarf von etwa 13.900 auf 53.100 pro Variante. Die Jagd nach einem winzigen Uplift ist der schnellste Weg, einen Test zu entwerfen, den du nie abschließen kannst.
Eine niedrigere Basis ist gnadenlos. Bei einer Basis von 1 % benötigt selbst ein 20%iger Uplift etwa 42.600 Besucher pro Variante – dreimal so viel wie beim 3%-Fall, weil seltene Ereignisse verhältnismäßig mehr Rauschen mit sich bringen.
Die letzte Spalte übersetzt die Anzahl in Kalenderzeit. Sie geht von 4.000 testfähigen Besuchern pro Woche aus, aufgeteilt auf beide Varianten, aufgerundet auf volle Wochen. Diese Spalte ist der Punkt, an dem die meisten Shopify-Testpläne auf die Realität treffen.
Baue dein eigenes Sample-Size-Template
Du brauchst kein ausgefallenes Tool, um das zu planen. Ein Spreadsheet mit der obigen Formel reicht vollkommen aus und lässt dich die Ergebnisse jedes Rechners auf Plausibilität prüfen.
Lege folgende Zellen an:
- Baseline CVR (Input): deine aktuelle Rate, zum Beispiel 0,03
- MDE (Input): relativer Uplift, zum Beispiel 0,20
- p2 (Berechnet):
Baseline * (1 + MDE) - z_alpha (Konstante): 1,96 für 95 % zweiseitig
- z_beta (Konstante): 0,84 für 80 % Power
- n pro Variante (Berechnet):
(z_alpha + z_beta)^2 * (p1*(1-p1) + p2*(1-p2)) / (p2 - p1)^2
Füge dann noch ein Feld für den wöchentlichen Traffic und eine Zelle für die Dauer hinzu, die 2 * n durch deine wöchentlichen testberechtigten Besucher teilt. Jetzt kannst du den MDE verändern und sofort sehen, wie sich die Laufzeit anpasst, bevor du dich auf einen Test festlegst.
Führe ein zweites Sheet, in dem jeder Test protokolliert wird: Hypothese, betroffene Seite, Start- und Enddatum, geplante Sample Size und das Ergebnis. Dieses Log verhindert, dass du geklärte Fragen erneut testest, und macht dein CRO-Programm überprüfbar. Es passt perfekt zu einem umfassenderen Shopify CRO-Plan.
Kostenlose A/B-Test-Rechner, die sich lohnen
Wenn du lieber kein Spreadsheet pflegen möchtest, erledigen zwei bekannte, kostenlose Tools exakt denselben Job.
Der Sample Size Calculator von Evan Miller nimmt deine Baseline Rate und den MDE entgegen und gibt die benötigte Stichprobe pro Variante aus, basierend auf denselben Eingaben für Signifikanz und Power.2 Er ist eine langjährige Referenz in der Testing-Community und ein hervorragender Gegencheck für dein eigenes Sheet.
Der Sample Size Calculator von Optimizely ist eine weitere kostenlose browserbasierte Option, die nach denselben Inputs fragt und einen Wert pro Variante ausgibt. Beide Tools landen in etwa bei den Zahlen aus der Tabelle oben, wenn sie mit denselben Annahmen gefüttert werden.
Welches Tool du auch nutzt, füttere es mit deiner echten Baseline und einem realistischen MDE. Ein Rechner, der mit optimistischen Eingaben gespeist wird, liefert eine optimistische – und meist unerreichbare – Zahl.
Die Low-Traffic-Realität bei Shopify
Hier ist die harte Wahrheit für kleinere Stores: Die Szenarien-Tabelle zeigt, dass die Erfassung eines bescheidenen Uplifts bei einer typischen Conversion Rate schnell Zehntausende von Besuchern pro Variante erfordern kann. Viele Shopify-Shops erreichen das in einem vernünftigen Zeitfenster einfach nicht.
Das heißt aber nicht, dass Testing völlig sinnlos ist. Es bedeutet nur, dass du intelligenter testen musst.
- Teste größere Veränderungen. Ein komplettes Page-Redesign oder ein völlig neues Angebot bewegt die Nadel deutlich mehr als eine angepasste Button-Farbe. Daher ist eine kleinere Sample Size nötig, um den Effekt nachzuweisen. Hebe dir feinkörnige Detail-Tests für Stores mit viel Traffic auf.
- Teste Seiten mit mehr Traffic. Führe Experimente auf den Seiten durch, die die meisten Sessions abbekommen, wie der Startseite, der Haupt-Collection und der Top-Produktseite, anstatt in einer wenig besuchten Ecke deines Shops.
- Lass Tests volle Wochen laufen. Teste immer in Blöcken von ganzen Wochen. Wochenend- und Werktagsshopper verhalten sich unterschiedlich. Ein Test, der an einem Montag startet und an einem Donnerstag endet, ist von vornherein durch diesen Bias verfälscht.
- Akzeptiere weniger, dafür längere Tests. Ein Low-Traffic-Store, der einen sauberen, vierwöchigen Test durchzieht, ist besser dran als einer, der fünf Underpowered Tests startet und wieder abbrechen muss.
- Verlass dich auch auf qualitative Signale. Heatmaps, Session-Recordings und Umfragen brauchen keine statistische Power. Sie können dir den Weg zu den großen Stellschrauben weisen, die einen echten A/B-Test wert sind.
Tools, die das auch mit einem kleineren Shopify-Budget unterstützen, findest du in unserer Übersicht der besten Shopify-Apps für CRO.
Wo Fudge ins Spiel kommt
Die Sample Size bestimmt, wie lange ein Test laufen muss. Die andere Hälfte der Gleichung ist, wie lange es dauert, die Variante überhaupt erst einmal zu bauen – und genau da bleiben die meisten Tests stecken, bevor sie überhaupt anfangen.
Fudge ist ein KI-Storefront-Editor, der nativen Theme-Code schreibt. Du beschreibst einfach die Variante, die du testen möchtest – ein neues Produktseiten-Layout, einen anderen Hero-Bereich, ein umstrukturiertes Angebot – und die App schreibt das Liquid, CSS und JavaScript direkt in dein Theme. Keine Entwickler-Warteschlange, keine blockierenden Widgets.
Da der Output echter Theme-Code ist, verhält sich die Variante während des Tests exakt wie der Rest deines Stores, ohne dass ein Drittanbieter-Skript die Seite verlangsamt und das Ergebnis verfälscht. Du kannst den Challenger an den Start bringen, dein Testing-Tool darauf richten und deine wertvolle Energie in den Teil stecken, der tatsächlich Zeit kostet: darauf zu warten, dass sich die Sample Size füllt. Dasselbe gilt für alles andere, was du mit dem Shopify Store Editor baust.
FAQ
Nimm deine Baseline Conversion Rate, den Minimum Detectable Effect (MDE), den du erfassen willst, sowie die üblichen 95 % Signifikanz und 80 % Power. Gib das in einen Rechner wie den von Evan Miller ein oder nutze die Formel n = (1.96 + 0.84)^2 x [p1(1-p1) + p2(1-p2)] / (p2-p1)^2. Das Ergebnis ist die benötigte Besucherzahl pro Variante.
Der MDE ist der kleinste Uplift, den dein Test erfassen soll, meist als relativer Prozentsatz angegeben. Ein 20 % MDE bei einer Baseline von 3 % bedeutet, dass eine Steigerung auf 3,6 % erkannt wird. Ein kleinerer MDE macht den Test empfindlicher, erfordert aber deutlich mehr Besucher, da eine Halbierung des Effekts die Sample Size in etwa vervierfacht.
Lass ihn laufen, bis du die vorher berechnete Sample Size erreichst, und immer in vollen Wochenblöcken, damit sich das Verhalten an Wochenenden und Wochentagen ausgleicht. Teile die benötigte Gesamtbesucherzahl durch deinen wöchentlichen, für den Test qualifizierten Traffic, um die Dauer zu schätzen. Zwei bis vier Wochen sind üblich; brich nicht vorzeitig ab, nur weil die Signifikanz grün aufleuchtet.
Seltene Ereignisse haben relativ gesehen mehr Rauschen, daher braucht es mehr Beobachtungen, um einen echten Effekt vom Zufall zu unterscheiden. Bei einer Baseline von 1 % kann selbst ein 20%iger Lift etwa 42.600 Besucher pro Variante erfordern – grob dreimal so viel wie bei einer Baseline von 3 % für denselben relativen Effekt.
Ja, aber du musst größere Änderungen testen, dich auf deine Seiten mit dem meisten Traffic konzentrieren und längere Testfenster akzeptieren. Einen kleinen Lift zu erkennen, kann Zehntausende Besucher pro Variante erfordern, was für viele Shops außer Reichweite ist. Reserviere also detaillierte Tests für Seiten mit viel Traffic und nutze für den Rest qualitative Recherche.
Die gängigen Standardwerte sind 95 % statistische Signifikanz (Alpha von 0,05) und 80 % statistische Power. Die Signifikanz steuert, wie sicher du bist, dass ein erkannter Gewinn kein Zufall ist, und die Power steuert, wie wahrscheinlich es ist, dass du einen Gewinn erkennst, der auch wirklich existiert. Beides sind Startpunkte und keine festen Regeln.
Footnotes
-
Evan Miller, “How Not To Run An A/B Test” - wiederholtes Überprüfen eines Tests und ein Abbruch, sobald er Signifikanz erreicht, treibt die Falsch-Positiv-Rate weit über das nominale Niveau. Deshalb sollte die Sample Size im Voraus festgelegt werden. https://www.evanmiller.org/how-not-to-run-an-ab-test.html ↩
-
Evan Miller, “Sample Size Calculator” - ein kostenloses Tool, das die benötigte Stichprobe pro Variante basierend auf einer Baseline Conversion Rate und einem Minimum Detectable Effect bei ausgewählten Signifikanz- und Power-Leveln zurückgibt. https://www.evanmiller.org/ab-testing/sample-size.html ↩