Shopify A/B-Test Sample Size (mit kostenlosem Template)

Zuletzt aktualisiert
Von Experten geprüft
5 Min. Lesezeit
Simeon Mantel
Simeon Mantel
CEO bei Fudge.

Das Wichtigste in Kürze

  • Deine Shopify A/B-Test-Stichprobengröße (Sample Size) ist die Anzahl der Besucher, die jede Variante braucht, bevor das Ergebnis aussagekräftig ist. Wenn du den Gewinner zu früh ausrufst, liest du nur Rauschen.
  • Vier Faktoren bestimmen sie: deine Basis-Conversion-Rate, der Minimum Detectable Effect (MDE), den du erfassen willst, das Signifikanzniveau (meist 95 %) und die statistische Power (meist 80 %).
  • Eine niedrigere Basis-Conversion-Rate und ein kleinerer MDE treiben die benötigte Stichprobe schnell in die Höhe. Kleine Änderungen bei Shops mit wenig Traffic können Zehntausende von Besuchern pro Variante erfordern.
  • Nutze einen kostenlosen Rechner wie den von Evan Miller, um die Zahl zu ermitteln, und plane den Test dann in vollen Traffic-Wochen, damit Wochentagsmuster das Ergebnis nicht verfälschen.
  • Fudge liefert deine Testvariante in wenigen Minuten als nativen Theme-Code aus. Der langsame Teil ist also der Traffic, nicht die Entwicklung.

Deine Shopify A/B-Test-Stichprobengröße ist die entscheidende Zahl, die bestimmt, ob dir ein Test überhaupt etwas sagt. Sie besagt, wie viele Besucher jede Version der Seite sehen muss, bevor der Unterschied zwischen ihnen echt und nicht bloß Zufall ist.

Machst du das falsch, ist die ganze Übung reine Zeitverschwendung. Dieser Guide behandelt, warum die Stichprobengröße wichtig ist, die vier Faktoren, die sie bestimmen, die Formel samt Rechenbeispiel, eine Tabellenvorlage zum Kopieren und die Realität von wenig Traffic, auf die die meisten Shopify-Shops stoßen.

Warum du uns vertrauen kannst

Wir arbeiten seit über vier Jahren im Shopify-Umfeld und haben Hunderten von Brands geholfen, ihre Storefronts zu verbessern. Wir entwickeln Fudge, einen KI-Storefront-Editor mit einer 5.0-Bewertung im Shopify App Store. Wir sitzen also genau auf der Theme-Ebene, wo diese Tests tatsächlich laufen, und sehen tagtäglich, wie oft sie abgebrochen werden, bevor die Daten wirklich aussagekräftig sind.


Warum die Sample Size wichtig ist

Ein A/B-Test vergleicht zwei Versionen einer Seite und misst, welche besser konvertiert. Der Haken daran ist, dass Conversions natürlichen Schwankungen unterliegen (Noise). Wenn du eine faire Münze 20 Mal wirfst, bekommst du selten genau zehnmal Kopf. Kleine Stichproben schwanken stark um die tatsächliche Rate.

Die Sample Size ist dein Schutz gegen dieses Rauschen. Unterhalb des Schwellenwerts kann eine Variante reiner Zufall sein, aber fälschlicherweise wie ein 15%iger Gewinner aussehen.

Zwei Fehlerquellen entstehen, wenn man sie ignoriert.

Underpowered Tests (zu wenig Power). Wenn du den Test mit zu wenigen Besuchern beendest, kann sich eine echte Verbesserung im Rauschen verstecken und als “kein Unterschied” gelesen werden. Du schlussfolgerst, dass die Änderung nicht funktioniert hat, setzt nichts live und lässt den Uplift auf der Strecke.

Peeking und zu frühes Stoppen. Der verlockendere Fehler ist, täglich aufs Dashboard zu schauen und den Test zu stoppen, sobald die Signifikanz grün aufleuchtet. Jeder zusätzliche Blick (Peeking) ist eine weitere Chance für eine zufällige Schwankung, die Ziellinie zu überqueren. Wiederholtes Überprüfen treibt die echte Falsch-Positiv-Rate weit über die 5 %, von denen du denkst, dass du sie hast.1 Die Lösung: Leg die Sample Size im Voraus fest und warte ab.

Das ist der Unterschied zwischen dem bloßen Ausführen von Tests und dem Führen eines echten Testing-Programms. Das große Ganze findest du in unserem Guide zu Shopify Conversion Testing.


Die vier Faktoren der Sample-Size-Berechnung

Jeder Rechner fragt nach denselben vier Dingen. Wenn du sie verstehst, ist die Zahl keine Blackbox mehr.

EingabeWas das bedeutetTypischer Wert
Basis-Conversion-RateDie aktuelle Conversion-Rate der Seite, die du testestWas auch immer dein Shop aktuell erreicht
Minimum Detectable Effect (MDE)Der kleinste Uplift, den der Test erkennen können soll10 % bis 30 % relativ
Statistische SignifikanzDie Sicherheit, dass das Ergebnis kein Zufall ist (bestimmt durch Alpha)95 % (Alpha 0,05)
Statistische PowerDie Chance, einen echten Effekt zu erkennen, wenn es einen gibt (bestimmt durch Beta)80 %

Baseline Conversion Rate

Das ist dein Startpunkt, gezogen aus deinen eigenen Analytics für genau die Seite und Zielgruppe, die du testen willst. Eine Produktseite, die mit Mobile-Traffic getestet wird, hat eine andere Baseline als dieselbe Seite auf dem Desktop. Grenze den Wert also exakt auf deinen Test ein.

Minimum Detectable Effect

Der Minimum Detectable Effect ist der kleinste Uplift, bei dem sich die Erkennung lohnt, meist als relativer Prozentsatz angegeben. Ein MDE von 20 % bei einer Baseline von 3 % bedeutet, dass du einen Sprung auf 3,6 % zuverlässig erkennen möchtest.

Diesen Faktor schätzen die Leute am häufigsten falsch ein. Ein kleinerer MDE bedeutet einen empfindlicheren Test, und Empfindlichkeit ist teuer. Wenn du den Effekt, den du erfassen willst, halbierst, vervierfacht sich die Anzahl der benötigten Besucher ungefähr.

Signifikanz und Power

Die Signifikanz (95 %) legt fest, wie sicher du sein möchtest, dass ein erkannter Gewinner kein Zufall ist. Die Power (80 %) bestimmt, wie wahrscheinlich es ist, dass du einen Gewinner entdeckst, der tatsächlich existiert. Beides sind Konventionen, keine Gesetze, aber sie sind bewährte Standards und ein vernünftiger Startpunkt für die meisten Stores.


Die Sample-Size-Formel und ein Rechenbeispiel

Für einen Test, der zwei Conversion Rates vergleicht, lautet die Standardnäherung für die benötigten Besucher pro Variante:

n = (z_alpha + z_beta)^2 x [ p1(1-p1) + p2(1-p2) ] / (p2 - p1)^2

wobei:
  p1        = Baseline Conversion Rate
  p2        = Baseline x (1 + MDE)
  z_alpha   = 1,96   (zweiseitig, 95 % Signifikanz)
  z_beta    = 0,84   (80 % Power)

Gehen wir einen konkreten Fall durch. Bei einer Baseline Conversion Rate von 3 % möchtest du einen relativen Uplift von 20 % erfassen, bei 95 % Signifikanz und 80 % Power.

Setzt man das zusammen, ergibt das 7,84 x 0,0638 / 0,000036. Das entspricht etwa 13.900 Besuchern pro Variante oder rund 27.800 insgesamt.

Das ist die Zahl, die der Rechner ausspuckt. Der große Vorteil, das einmal per Hand durchzurechnen, liegt darin, dass du genau siehst, wie die einzelnen Faktoren das Ergebnis beeinflussen.


Wie Baseline und MDE die Zahl verändern

Die zwei Haupttreiber sind deine Basis-Conversion-Rate und der Effekt, den du erzielen willst. Beide können die Stichprobengröße schnell in die Höhe treiben. Die folgende Tabelle wendet dieselbe Formel bei 95 % Signifikanz und 80 % Power auf einige Szenarien an.

Basis-CVRRelativer MDEBesucher pro VarianteWochen bei 4.000 Test-Besuchern/Woche
3 %30 %~6.400~4 Wochen
3 %20 %~13.900~7 Wochen
3 %10 %~53.100~27 Wochen
1 %20 %~42.600~21 Wochen
5 %20 %~8.100~4 Wochen

Aus der Mathematik ergeben sich zwei Muster.

Kleinere Effekte kosten viel mehr. Senkt man den MDE bei einer Basis von 3 % von 20 % auf 10 %, steigt der Bedarf von etwa 13.900 auf 53.100 pro Variante. Die Jagd nach einem winzigen Uplift ist der schnellste Weg, einen Test zu entwerfen, den du nie abschließen kannst.

Eine niedrigere Basis ist gnadenlos. Bei einer Basis von 1 % benötigt selbst ein 20%iger Uplift etwa 42.600 Besucher pro Variante – dreimal so viel wie beim 3%-Fall, weil seltene Ereignisse verhältnismäßig mehr Rauschen mit sich bringen.

Die letzte Spalte übersetzt die Anzahl in Kalenderzeit. Sie geht von 4.000 testfähigen Besuchern pro Woche aus, aufgeteilt auf beide Varianten, aufgerundet auf volle Wochen. Diese Spalte ist der Punkt, an dem die meisten Shopify-Testpläne auf die Realität treffen.

Liefere die Variante in Minuten aus, sodass du nur noch auf den Traffic warten musst.
Try Fudge for Free

Baue dein eigenes Sample-Size-Template

Du brauchst kein ausgefallenes Tool, um das zu planen. Ein Spreadsheet mit der obigen Formel reicht vollkommen aus und lässt dich die Ergebnisse jedes Rechners auf Plausibilität prüfen.

Lege folgende Zellen an:

Füge dann noch ein Feld für den wöchentlichen Traffic und eine Zelle für die Dauer hinzu, die 2 * n durch deine wöchentlichen testberechtigten Besucher teilt. Jetzt kannst du den MDE verändern und sofort sehen, wie sich die Laufzeit anpasst, bevor du dich auf einen Test festlegst.

Führe ein zweites Sheet, in dem jeder Test protokolliert wird: Hypothese, betroffene Seite, Start- und Enddatum, geplante Sample Size und das Ergebnis. Dieses Log verhindert, dass du geklärte Fragen erneut testest, und macht dein CRO-Programm überprüfbar. Es passt perfekt zu einem umfassenderen Shopify CRO-Plan.


Kostenlose A/B-Test-Rechner, die sich lohnen

Wenn du lieber kein Spreadsheet pflegen möchtest, erledigen zwei bekannte, kostenlose Tools exakt denselben Job.

Der Sample Size Calculator von Evan Miller nimmt deine Baseline Rate und den MDE entgegen und gibt die benötigte Stichprobe pro Variante aus, basierend auf denselben Eingaben für Signifikanz und Power.2 Er ist eine langjährige Referenz in der Testing-Community und ein hervorragender Gegencheck für dein eigenes Sheet.

Der Sample Size Calculator von Optimizely ist eine weitere kostenlose browserbasierte Option, die nach denselben Inputs fragt und einen Wert pro Variante ausgibt. Beide Tools landen in etwa bei den Zahlen aus der Tabelle oben, wenn sie mit denselben Annahmen gefüttert werden.

Welches Tool du auch nutzt, füttere es mit deiner echten Baseline und einem realistischen MDE. Ein Rechner, der mit optimistischen Eingaben gespeist wird, liefert eine optimistische – und meist unerreichbare – Zahl.


Die Low-Traffic-Realität bei Shopify

Hier ist die harte Wahrheit für kleinere Stores: Die Szenarien-Tabelle zeigt, dass die Erfassung eines bescheidenen Uplifts bei einer typischen Conversion Rate schnell Zehntausende von Besuchern pro Variante erfordern kann. Viele Shopify-Shops erreichen das in einem vernünftigen Zeitfenster einfach nicht.

Das heißt aber nicht, dass Testing völlig sinnlos ist. Es bedeutet nur, dass du intelligenter testen musst.

Tools, die das auch mit einem kleineren Shopify-Budget unterstützen, findest du in unserer Übersicht der besten Shopify-Apps für CRO.


Wo Fudge ins Spiel kommt

Die Sample Size bestimmt, wie lange ein Test laufen muss. Die andere Hälfte der Gleichung ist, wie lange es dauert, die Variante überhaupt erst einmal zu bauen – und genau da bleiben die meisten Tests stecken, bevor sie überhaupt anfangen.

Fudge ist ein KI-Storefront-Editor, der nativen Theme-Code schreibt. Du beschreibst einfach die Variante, die du testen möchtest – ein neues Produktseiten-Layout, einen anderen Hero-Bereich, ein umstrukturiertes Angebot – und die App schreibt das Liquid, CSS und JavaScript direkt in dein Theme. Keine Entwickler-Warteschlange, keine blockierenden Widgets.

Da der Output echter Theme-Code ist, verhält sich die Variante während des Tests exakt wie der Rest deines Stores, ohne dass ein Drittanbieter-Skript die Seite verlangsamt und das Ergebnis verfälscht. Du kannst den Challenger an den Start bringen, dein Testing-Tool darauf richten und deine wertvolle Energie in den Teil stecken, der tatsächlich Zeit kostet: darauf zu warten, dass sich die Sample Size füllt. Dasselbe gilt für alles andere, was du mit dem Shopify Store Editor baust.


FAQ

Wie berechne ich die A/B-Test-Stichprobengröße für einen Shopify-Shop?

Nimm deine Basis-Conversion-Rate, den Minimum Detectable Effect (MDE), den du erreichen willst, sowie die standardmäßigen 95 % Signifikanz und 80 % Power. Gib das in einen Rechner wie den von Evan Miller ein oder nutze die Formel n = (1.96 + 0.84)^2 x [p1(1-p1) + p2(1-p2)] / (p2-p1)^2. Das liefert dir die benötigten Besucher pro Variante.

Was ist ein Minimum Detectable Effect (MDE)?

Der MDE ist der kleinste Uplift, den der Test erkennen können soll, meist als relativer Prozentsatz angegeben. Ein 20 % MDE bei einer 3 % Basis bedeutet, dass eine Steigerung auf 3,6 % erkannt wird. Ein kleinerer MDE macht den Test empfindlicher, erfordert aber viel mehr Besucher, da eine Halbierung des Effekts die Stichprobengröße in etwa vervierfacht.

Wie lange sollte ich einen Shopify A/B-Test laufen lassen?

Lass ihn laufen, bis du deine vorberechnete Stichprobengröße erreicht hast, und zwar immer in ganzen Wochenblöcken, damit sich das Verhalten am Wochenende und an Wochentagen ausgleicht. Teile die Gesamtzahl der benötigten Besucher durch deinen wöchentlichen, testfähigen Traffic, um die Dauer zu schätzen. Zwei bis vier Wochen sind üblich; brich nicht zu früh ab, nur weil die Signifikanz grün leuchtet.

Warum erfordert eine niedrige Conversion-Rate eine größere Stichprobe?

Seltene Ereignisse bringen relativ gesehen mehr Rauschen mit sich, sodass mehr Beobachtungen nötig sind, um einen echten Effekt vom Zufall zu trennen. Bei einer Basis von 1 % kann selbst ein 20%iger Uplift rund 42.600 Besucher pro Variante erfordern, also etwa dreimal so viel wie eine 3%-Basis für denselben relativen Effekt.

Kann ein Shopify-Shop mit wenig Traffic gültige A/B-Tests durchführen?

Ja, aber du musst größere Änderungen testen, dich auf deine Seiten mit dem meisten Traffic konzentrieren und längere Testfenster in Kauf nehmen. Das Erkennen eines kleinen Uplifts kann Zehntausende von Besuchern pro Variante erfordern, was für viele Shops unerreichbar ist. Hebe dir feinteilige Tests also für Seiten mit viel Traffic auf und nutze ansonsten qualitative Forschung.

Welche Signifikanz und Power sollte ich verwenden?

Die gängigen Standardwerte sind 95 % statistische Signifikanz (Alpha von 0,05) und 80 % statistische Power. Die Signifikanz steuert, wie sicher du bist, dass ein erkannter Gewinn kein Zufall ist, und die Power steuert, wie wahrscheinlich es ist, dass du einen echten Gewinn überhaupt erkennst. Beides sind eher Ausgangspunkte als starre Regeln.

Simeon's signature
Liefere Testvarianten ohne Dev-Warteschlange aus.

Footnotes

  1. Evan Miller, “How Not To Run An A/B Test” – einen Test wiederholt zu prüfen und ihn abzubrechen, sobald er Signifikanz erreicht, treibt die Falsch-Positiv-Rate weit über das nominale Niveau. Daher sollte die Stichprobengröße im Voraus festgelegt werden. https://www.evanmiller.org/how-not-to-run-an-ab-test.html

  2. Evan Miller, “Sample Size Calculator” – ein kostenloses Tool, das die benötigte Stichprobe pro Variante aus einer Basis-Conversion-Rate und einem Minimum Detectable Effect bei gewählten Signifikanz- und Power-Levels berechnet. https://www.evanmiller.org/ab-testing/sample-size.html

You might also be interested in

Wie man eine Shopify Quiz Landing Page baut (Schritt-für-Schritt)
Eine Shopify Quiz Landing Page hostet das Quiz und sonst nichts. Baue die Seite und das Template, entferne den Header, mach sie schnell und tracke die richtigen Events.
So legst du einen Schwellenwert für kostenlosen Versand auf Shopify fest
Lege deinen Shopify-Schwellenwert für kostenlosen Versand anhand von AOV und Marge fest, nicht durch Raten. Inklusive Break-Even-Beispiel und Anleitung für die Free-Shipping-Bar.
Mobile-First Shopify Landing Page Muster, die konvertieren
Mobile Shopify Landing Page Muster, die konvertieren: Single-Column-Layout, Sticky CTA, daumenfreundliche Targets, schneller Hero und Message Match mit deiner Ad.