Taille d'échantillon pour test A/B Shopify (Avec modèle gratuit)

Dernière mise à jour
Revu par un expert
5 min de lecture
Simeon Mantel
Simeon Mantel
CEO chez Fudge.

Points clés

  • La taille d’échantillon d’un A/B test Shopify est le nombre de visiteurs dont chaque variante a besoin avant que le résultat ne veuille dire quoi que ce soit. Déclarer un gagnant trop tôt revient à lire du bruit.
  • Quatre facteurs la déterminent : votre taux de conversion de base, l’effet minimum détectable (MDE) que vous voulez capter, le seuil de significativité (généralement 95 %) et la puissance statistique (généralement 80 %).
  • Un taux de conversion de base plus faible et un effet détectable plus petit font rapidement grimper l’échantillon requis. De petites modifications sur des boutiques à faible trafic peuvent nécessiter des dizaines de milliers de visiteurs par variante.
  • Utilisez un calculateur gratuit comme celui d’Evan Miller pour obtenir ce nombre, puis planifiez le test sur des semaines complètes de trafic pour que les habitudes selon le jour de la semaine ne faussent pas les résultats.
  • Fudge déploie votre variante de test sous forme de code natif du thème en quelques minutes. La partie lente devient donc l’acquisition de trafic, pas le développement.

La taille d’échantillon de votre A/B test Shopify est le seul chiffre qui décide si un test peut vous apprendre quelque chose. C’est le nombre de visiteurs que chaque version de la page doit accumuler avant que la différence entre elles ne soit réelle plutôt qu’aléatoire.

Si vous vous trompez, tout l’exercice n’est que du théâtre. Ce guide explique pourquoi la taille de l’échantillon est importante, les quatre variables qui la définissent, la formule et un exemple concret, un modèle de feuille de calcul que vous pouvez copier, et la réalité du faible trafic à laquelle se heurtent la plupart des boutiques Shopify.

Pourquoi vous pouvez nous faire confiance

Nous travaillons dans l’écosystème Shopify depuis plus de quatre ans et avons aidé des centaines de marques à améliorer leurs boutiques. Nous avons créé Fudge, un éditeur de boutique IA noté 5,0 sur le Shopify App Store. Nous opérons donc au niveau du code du thème, là où ces tests s’exécutent réellement, et nous voyons bien trop souvent des tests interrompus avant que les données ne le justifient.


Pourquoi la taille de l’échantillon est si importante

Un test A/B compare deux versions d’une page et mesure laquelle convertit le mieux. Le piège, c’est que la conversion fait du « bruit ». Lancez une pièce équilibrée 20 fois et vous obtiendrez rarement exactement dix fois pile. Les petits échantillons fluctuent beaucoup autour du taux réel.

La taille de l’échantillon est votre protection contre ce bruit. En dessous du seuil de significativité, une variante peut sembler gagnante de 15 % par pur hasard.

Il existe deux risques principaux quand on l’ignore.

Les tests sous-dimensionnés (underpowered). Si vous arrêtez avec trop peu de visiteurs, une véritable amélioration peut se cacher dans le bruit et ressembler à une « absence de différence ». Vous concluez que le changement n’a pas fonctionné, vous ne déployez rien, et vous passez à côté de l’augmentation de vos ventes.

Le “peeking” et l’arrêt prématuré. L’erreur la plus tentante est de vérifier le tableau de bord tous les jours et d’arrêter le test dès que la significativité passe au vert. Chaque vérification supplémentaire est une nouvelle occasion pour une variation aléatoire de franchir la ligne. Par conséquent, des vérifications répétées gonflent le taux réel de faux positifs bien au-delà des 5 % que vous croyez cibler.1 La solution ? Fixer la taille de l’échantillon à l’avance et faire preuve de patience.

C’est la différence entre faire des tests au hasard et gérer un vrai programme de testing. Pour une vision plus globale, consultez notre guide sur l’optimisation des conversions Shopify.


Les 4 variables pour calculer la taille de l’échantillon

Tous les calculateurs demandent les quatre mêmes éléments. Comprenez-les et ce chiffre cessera d’être une boîte noire.

DonnéeCe que ça signifieValeur typique
Taux de conversion de baseLe taux de conversion actuel de la page que vous testezCe que votre boutique fait réellement
Effet minimum détectable (MDE)La plus petite amélioration que vous souhaitez que le test puisse détecter10 % à 30 % en relatif
Significativité statistiqueLa certitude que le résultat n’est pas dû au hasard, définie par l’alpha95 % (alpha 0,05)
Puissance statistiqueLa probabilité de capter un effet réel s’il y en a un, définie par le bêta80 %

Le taux de conversion de base

C’est votre point de départ, tiré de vos propres données (analytics) pour la page et l’audience exactes que vous comptez tester. Une page produit testée sur du trafic mobile a une base de référence (baseline) différente de la même page sur ordinateur, vous devez donc l’adapter spécifiquement à votre test.

L’effet minimum détectable (MDE)

L’effet minimum détectable (MDE - Minimum Detectable Effect) est la plus petite amélioration qui vaille la peine d’être détectée, souvent exprimée en pourcentage relatif. Un MDE de 20 % sur une baseline de 3 % signifie que vous voulez repérer de façon fiable un passage à 3,6 %.

C’est la variable que les gens évaluent le plus mal. Un MDE plus faible signifie un test plus sensible, et la sensibilité coûte cher. Réduire de moitié l’effet que vous voulez détecter multiplie par quatre le nombre de visiteurs dont vous avez besoin.

Significativité et puissance

La significativité (95 %) définit à quel point vous voulez être sûr qu’une victoire détectée n’est pas le fruit du hasard. La puissance (80 %) définit la probabilité de détecter une victoire qui existe réellement. Ce sont des conventions, pas des lois, mais ce sont les valeurs par défaut standards et un point de départ raisonnable pour la plupart des boutiques.


La formule de taille d’échantillon et un exemple concret

Pour un test comparant deux taux de conversion, l’approximation standard du nombre de visiteurs nécessaires par variante est :

n = (z_alpha + z_beta)^2 x [ p1(1-p1) + p2(1-p2) ] / (p2 - p1)^2

où :
  p1        = taux de conversion de base
  p2        = baseline x (1 + MDE)
  z_alpha   = 1,96   (bilatéral, significativité de 95 %)
  z_beta    = 0,84   (puissance de 80 %)

Prenons un cas concret. Vous avez un taux de conversion de base de 3 %, et vous voulez détecter une augmentation relative de 20 %, à 95 % de significativité et 80 % de puissance.

En combinant tout cela, on obtient 7,84 x 0,0638 / 0,000036, soit environ 13 900 visiteurs par variante, ou grossièrement 27 800 au total.

C’est le nombre que vous renvoie le calculateur. L’intérêt de le faire à la main au moins une fois, c’est de comprendre exactement ce qui fait varier le résultat.


Comment la baseline et le MDE modifient le calcul

Les deux principaux moteurs sont votre taux de conversion de base et l’effet que vous souhaitez capter. Les deux peuvent rapidement faire exploser la taille de l’échantillon. Le tableau ci-dessous applique la même formule à 95 % de significativité et 80 % de puissance sur plusieurs scénarios.

Taux de conversion de baseMDE relatifVisiteurs par varianteSemaines à 4 000 visiteurs/semaine
3 %30 %~6 400~4 semaines
3 %20 %~13 900~7 semaines
3 %10 %~53 100~27 semaines
1 %20 %~42 600~21 semaines
5 %20 %~8 100~4 semaines

Deux tendances se dégagent de ces calculs.

Les effets plus petits coûtent beaucoup plus cher. Faire passer le MDE de 20 % à 10 % sur une base de 3 % fait passer le besoin d’environ 13 900 à 53 100 visiteurs par variante. Courir après une amélioration infime est le moyen le plus rapide de concevoir un test que vous ne pourrez jamais terminer.

Un taux de base plus faible est punitif. À 1 % de base, même une augmentation de 20 % nécessite environ 42 600 visiteurs par variante, soit trois fois plus que pour une base à 3 %, car les événements rares comportent plus de bruit relatif.

La dernière colonne traduit le nombre en temps calendaire. Elle part du principe de 4 000 visiteurs éligibles au test par semaine, répartis sur les deux variantes, arrondi à la semaine supérieure. C’est dans cette colonne que la plupart des plans de test Shopify se heurtent à la réalité.

Déployez la variante en quelques minutes pour que votre seule attente soit le trafic.
Try Fudge for Free

Créez votre propre modèle de calcul

Vous n’avez pas besoin d’un outil complexe pour planifier tout ça. Un simple tableur avec la formule ci-dessus fait l’affaire et vous permet de vérifier la cohérence de n’importe quel calculateur.

Configurez ces cellules :

Ajoutez ensuite une entrée pour le trafic hebdomadaire et une cellule pour la durée qui divise 2 * n par le nombre de vos visiteurs hebdomadaires éligibles au test. Vous pouvez maintenant modifier le MDE et voir la durée d’exécution évoluer avant de vous lancer dans un test.

Gardez une deuxième feuille listant chaque test : l’hypothèse, la page, les dates de début et de fin, la taille d’échantillon prévue, et le résultat. Ce journal de bord (log) vous évite de retester des choses déjà prouvées et rend votre programme auditable. Cela va naturellement de pair avec un plan CRO Shopify plus large.


Les calculateurs de tests A/B gratuits qui valent le coup

Si vous préférez ne pas maintenir de tableur, deux outils gratuits très connus font exactement le même travail.

Le calculateur d’Evan Miller (Sample Size Calculator) prend votre taux de base et votre MDE et vous donne l’échantillon par variante, en utilisant les mêmes données de significativité et de puissance.2 C’est une référence de longue date dans la communauté du testing et un bon moyen de vérifier votre propre feuille de calcul.

Le calculateur d’Optimizely est une autre excellente option gratuite via navigateur qui demande les mêmes entrées et renvoie un nombre par variante. N’importe lequel de ces outils aboutira à des chiffres proches de ceux du tableau ci-dessus avec les mêmes hypothèses.

Peu importe celui que vous utilisez, donnez-lui votre vraie baseline et un MDE réaliste. Un calculateur alimenté avec des chiffres optimistes renverra un objectif optimiste, et la plupart du temps, inatteignable.


La réalité du manque de trafic sur Shopify

Voici la dure réalité pour les petites boutiques. Le tableau de scénarios montre que détecter une amélioration modeste sur un taux de conversion classique peut nécessiter des dizaines de milliers de visiteurs par variante. Beaucoup de boutiques Shopify n’atteignent pas ce trafic dans un laps de temps raisonnable.

Cela ne veut pas dire que faire des tests ne sert à rien. Cela signifie qu’il faut tester intelligemment.

Pour découvrir des outils adaptés au budget d’une boutique Shopify, consultez notre sélection des meilleures applications Shopify pour le CRO.


La place de Fudge dans tout ça

La taille de l’échantillon détermine la durée d’exécution d’un test. L’autre moitié de l’équation, c’est le temps nécessaire pour créer la variante en elle-même, et c’est là que la plupart des tests calent avant même de commencer.

Fudge est un éditeur de boutique IA qui écrit du code de thème natif. Vous décrivez la variante que vous voulez tester (une nouvelle disposition de page produit, un bandeau d’accueil différent, une offre restructurée…), et il écrit le code Liquid, CSS et JavaScript directement dans votre thème. Pas besoin d’attendre un développeur, et pas de widget lourd.

Comme le résultat est du vrai code de thème, la variante se comporte comme le reste de votre boutique pendant le test, sans script tiers qui ralentit la page et fausse les résultats. Vous pouvez générer rapidement la nouvelle version (le challenger), y brancher votre outil de test, et concentrer vos efforts sur la partie qui prend vraiment du temps : attendre d’avoir un échantillon suffisant. Cela vaut pour tout ce que vous créez avec notre éditeur de boutique Shopify.


FAQ

Comment calculer la taille de l'échantillon d'un A/B test pour une boutique Shopify ?

Prenez votre taux de conversion de base, l'effet minimum détectable que vous souhaitez capter, ainsi que les standards de 95 % de significativité et 80 % de puissance. Entrez ces données dans un calculateur comme celui d'Evan Miller, ou utilisez la formule n = (1,96 + 0,84)^2 x [p1(1-p1) + p2(1-p2)] / (p2-p1)^2. Cela vous donnera le nombre de visiteurs nécessaires par variante.

Qu'est-ce qu'un effet minimum détectable (MDE) ?

Le MDE est la plus petite amélioration que vous souhaitez que le test puisse capter, généralement exprimée en pourcentage relatif. Un MDE de 20 % sur une base de 3 % signifie détecter un passage à 3,6 %. Un MDE plus faible rend le test plus sensible mais nécessite beaucoup plus de visiteurs, car diviser l'effet par deux multiplie environ par quatre la taille de l'échantillon.

Combien de temps dois-je faire tourner un A/B test Shopify ?

Faites-le tourner jusqu'à ce que vous atteigniez la taille d'échantillon calculée au préalable, et toujours par blocs de semaines complètes pour que le comportement du week-end et de la semaine s'équilibrent. Divisez le nombre total de visiteurs nécessaires par votre trafic hebdomadaire éligible au test pour estimer la durée. Deux à quatre semaines est une durée courante ; ne vous arrêtez pas plus tôt simplement parce que la significativité passe au vert.

Pourquoi un faible taux de conversion nécessite-t-il un plus grand échantillon ?

Les événements rares comportent plus de bruit relatif, il faut donc plus d'observations pour séparer un effet réel du hasard. À 1 % de base, même une augmentation de 20 % peut nécessiter environ 42 600 visiteurs par variante, soit à peu près trois fois ce dont une base de 3 % a besoin pour le même effet relatif.

Une boutique Shopify à faible trafic peut-elle réaliser des A/B tests valides ?

Oui, mais vous devez tester des changements plus importants, vous concentrer sur vos pages à plus fort trafic et accepter des fenêtres de test plus longues. Détecter une petite amélioration peut nécessiter des dizaines de milliers de visiteurs par variante, ce qui est hors de portée pour de nombreuses boutiques. Réservez donc les tests de précision aux pages à fort trafic et utilisez la recherche qualitative ailleurs.

Quels niveaux de significativité et de puissance dois-je utiliser ?

Les valeurs par défaut conventionnelles sont de 95 % pour la significativité statistique (alpha de 0,05) et de 80 % pour la puissance statistique. La significativité contrôle à quel point vous êtes sûr qu'une victoire détectée n'est pas due au hasard, et la puissance contrôle votre probabilité de capter une victoire qui existe réellement. Les deux sont des points de départ plutôt que des règles fixes.

Simeon's signature
Déployez des variantes de test sans attendre les devs.

Footnotes

  1. Evan Miller, “How Not To Run An A/B Test” - vérifier à plusieurs reprises un test et l’arrêter dès qu’il atteint la significativité gonfle le taux de faux positifs bien au-dessus du niveau nominal, c’est pourquoi la taille de l’échantillon doit être fixée à l’avance. https://www.evanmiller.org/how-not-to-run-an-ab-test.html

  2. Evan Miller, “Sample Size Calculator” - un outil gratuit qui donne l’échantillon requis par variante à partir d’un taux de conversion de base et d’un effet minimum détectable, à des niveaux de significativité et de puissance choisis. https://www.evanmiller.org/ab-testing/sample-size.html

You might also be interested in

Comment créer une modale de quick view sur Shopify (2026)
Créez une modale de quick view sur Shopify en code natif : API Section Rendering, /cart/add.js, sélection de variante et focus trap accessible.
Images Lifestyle IA pour Shopify : Outils & Exemples
Photos lifestyle par l'IA pour Shopify : les outils qui produisent des images à l'image de votre marque, le workflow, et ce que l'IA ne peut pas encore remplacer.
Flows Klaviyo pour Marques de Skincare sur Shopify
Les flows Klaviyo pour les marques de skincare : bienvenue, éducation post-achat, replenishment, cross-sell et winback, avec déclencheurs, timing et segments.