Taille d'échantillon pour test A/B Shopify (Avec modèle gratuit)

Dernière mise à jour
Revu par un expert
5 min de lecture
Simeon Mantel
Simeon Mantel
CEO chez Fudge.

Points clés

  • La taille de l’échantillon de votre test A/B Shopify est le nombre de visiteurs dont chaque variante a besoin avant que le résultat ne soit significatif. Désigner un gagnant trop tôt revient à interpréter du bruit.
  • Quatre éléments l’influencent : votre taux de conversion de base (baseline), l’effet minimum détectable (MDE) que vous souhaitez repérer, le seuil de signification (généralement 95 %) et la puissance statistique (généralement 80 %).
  • Un taux de conversion de base plus faible et un effet détectable plus petit font tous deux grimper rapidement la taille de l’échantillon requise. De petits changements sur des boutiques à faible trafic peuvent nécessiter des dizaines de milliers de visiteurs par variante.
  • Utilisez un calculateur gratuit comme celui d’Evan Miller pour obtenir ce chiffre, puis planifiez le test sur des semaines complètes de trafic pour que les variations selon les jours de la semaine ne faussent pas la donne.
  • Fudge déploie votre variante de test sous forme de code de thème natif en quelques minutes. Ce qui prend du temps, c’est d’attendre le trafic, pas la création de la variante.

La taille d’échantillon de votre test A/B Shopify est le chiffre unique qui détermine si un test a quelque chose à vous apprendre. C’est le nombre de visiteurs que chaque version de la page doit accumuler avant que la différence entre elles soit réelle plutôt qu’aléatoire.

Si vous vous trompez, tout l’exercice n’est que du théâtre. Ce guide explique pourquoi la taille de l’échantillon est importante, les quatre variables qui la définissent, la formule avec un exemple concret, un modèle de tableur à copier, et la réalité du manque de trafic auquel se heurtent la plupart des boutiques Shopify.

Pourquoi vous pouvez nous faire confiance

Nous travaillons dans l’écosystème Shopify depuis plus de quatre ans et avons aidé des centaines de marques à améliorer leurs boutiques. Nous avons créé Fudge, un éditeur de boutique IA noté 5,0 sur le Shopify App Store. Nous opérons donc au niveau du code du thème, là où ces tests s’exécutent réellement, et nous voyons bien trop souvent des tests interrompus avant que les données ne le justifient.


Pourquoi la taille de l’échantillon est si importante

Un test A/B compare deux versions d’une page et mesure laquelle convertit le mieux. Le piège, c’est que la conversion fait du « bruit ». Lancez une pièce équilibrée 20 fois et vous obtiendrez rarement exactement dix fois pile. Les petits échantillons fluctuent beaucoup autour du taux réel.

La taille de l’échantillon est votre protection contre ce bruit. En dessous du seuil de significativité, une variante peut sembler gagnante de 15 % par pur hasard.

Il existe deux risques principaux quand on l’ignore.

Les tests sous-dimensionnés (underpowered). Si vous arrêtez avec trop peu de visiteurs, une véritable amélioration peut se cacher dans le bruit et ressembler à une « absence de différence ». Vous concluez que le changement n’a pas fonctionné, vous ne déployez rien, et vous passez à côté de l’augmentation de vos ventes.

Le “peeking” et l’arrêt prématuré. L’erreur la plus tentante est de vérifier le tableau de bord tous les jours et d’arrêter le test dès que la significativité passe au vert. Chaque vérification supplémentaire est une nouvelle occasion pour une variation aléatoire de franchir la ligne. Par conséquent, des vérifications répétées gonflent le taux réel de faux positifs bien au-delà des 5 % que vous croyez cibler.1 La solution ? Fixer la taille de l’échantillon à l’avance et faire preuve de patience.

C’est la différence entre faire des tests au hasard et gérer un vrai programme de testing. Pour une vision plus globale, consultez notre guide sur l’optimisation des conversions Shopify.


Les 4 variables pour calculer la taille de l’échantillon

Tous les calculateurs demandent les mêmes quatre éléments. Comprenez-les, et ce calcul ne sera plus une boîte noire.

VariableCe que cela signifieValeur typique
Taux de conversion de base (Baseline)Le taux de conversion actuel de la page testéeCelui que réalise actuellement votre boutique
Effet minimum détectable (MDE)La plus petite augmentation que vous souhaitez que le test puisse détecter10 % à 30 % relatif
Significativité statistiqueLa certitude que le résultat n’est pas dû au hasard, définie par l’alpha95 % (alpha 0,05)
Puissance statistiqueLa probabilité de détecter un effet réel s’il existe, définie par le bêta80 %

Le taux de conversion de base

C’est votre point de départ, tiré de vos propres données (analytics) pour la page et l’audience exactes que vous comptez tester. Une page produit testée sur du trafic mobile a une base de référence (baseline) différente de la même page sur ordinateur, vous devez donc l’adapter spécifiquement à votre test.

L’effet minimum détectable (MDE)

L’effet minimum détectable (MDE - Minimum Detectable Effect) est la plus petite amélioration qui vaille la peine d’être détectée, souvent exprimée en pourcentage relatif. Un MDE de 20 % sur une baseline de 3 % signifie que vous voulez repérer de façon fiable un passage à 3,6 %.

C’est la variable que les gens évaluent le plus mal. Un MDE plus faible signifie un test plus sensible, et la sensibilité coûte cher. Réduire de moitié l’effet que vous voulez détecter multiplie par quatre le nombre de visiteurs dont vous avez besoin.

Significativité et puissance

La significativité (95 %) définit à quel point vous voulez être sûr qu’une victoire détectée n’est pas le fruit du hasard. La puissance (80 %) définit la probabilité de détecter une victoire qui existe réellement. Ce sont des conventions, pas des lois, mais ce sont les valeurs par défaut standards et un point de départ raisonnable pour la plupart des boutiques.


La formule de taille d’échantillon et un exemple concret

Pour un test comparant deux taux de conversion, l’approximation standard du nombre de visiteurs nécessaires par variante est :

n = (z_alpha + z_beta)^2 x [ p1(1-p1) + p2(1-p2) ] / (p2 - p1)^2

où :
  p1        = taux de conversion de base
  p2        = baseline x (1 + MDE)
  z_alpha   = 1,96   (bilatéral, significativité de 95 %)
  z_beta    = 0,84   (puissance de 80 %)

Prenons un cas concret. Vous avez un taux de conversion de base de 3 %, et vous voulez détecter une augmentation relative de 20 %, à 95 % de significativité et 80 % de puissance.

En combinant tout cela, on obtient 7,84 x 0,0638 / 0,000036, soit environ 13 900 visiteurs par variante, ou grossièrement 27 800 au total.

C’est le nombre que vous renvoie le calculateur. L’intérêt de le faire à la main au moins une fois, c’est de comprendre exactement ce qui fait varier le résultat.


Comment la baseline et le MDE modifient le calcul

Les deux principaux moteurs sont votre taux de conversion de base et l’effet que vous voulez détecter. Les deux peuvent faire exploser la taille de l’échantillon très rapidement. Le tableau ci-dessous applique la même formule (95 % de significativité et 80 % de puissance) sur différents scénarios.

CVR de baseMDE relatifVisiteurs par varianteSemaines à 4 000 visiteurs/semaine
3 %30 %~6 400~4 semaines
3 %20 %~13 900~7 semaines
3 %10 %~53 100~27 semaines
1 %20 %~42 600~21 semaines
5 %20 %~8 100~4 semaines

Deux tendances se dégagent de ces mathématiques :

Les petits effets coûtent beaucoup plus cher. Faire passer le MDE de 20 % à 10 % sur une base de 3 % fait grimper le besoin d’environ 13 900 à 53 100 visiteurs par variante. Courir après une micro-amélioration est le moyen le plus rapide de concevoir un test que vous ne finirez jamais.

Une baseline faible ne pardonne pas. Avec une base de 1 %, même une augmentation de 20 % nécessite environ 42 600 visiteurs par variante, soit trois fois plus que dans le cas des 3 %, car les événements rares comportent un “bruit” relatif plus important.

La dernière colonne traduit ces chiffres en temps réel. Elle part du principe qu’il y a 4 000 visiteurs éligibles au test par semaine, répartis sur les deux variantes, le tout arrondi à des semaines complètes. C’est sur cette colonne que la plupart des plans de tests Shopify se heurtent à la réalité.

Déployez la variante en quelques minutes pour que la seule attente soit le trafic.
Try Fudge for Free

Créez votre propre modèle de calcul

Vous n’avez pas besoin d’un outil complexe pour planifier tout ça. Un simple tableur avec la formule ci-dessus fait l’affaire et vous permet de vérifier la cohérence de n’importe quel calculateur.

Configurez ces cellules :

Ajoutez ensuite une entrée pour le trafic hebdomadaire et une cellule pour la durée qui divise 2 * n par le nombre de vos visiteurs hebdomadaires éligibles au test. Vous pouvez maintenant modifier le MDE et voir la durée d’exécution évoluer avant de vous lancer dans un test.

Gardez une deuxième feuille listant chaque test : l’hypothèse, la page, les dates de début et de fin, la taille d’échantillon prévue, et le résultat. Ce journal de bord (log) vous évite de retester des choses déjà prouvées et rend votre programme auditable. Cela va naturellement de pair avec un plan CRO Shopify plus large.


Les calculateurs de tests A/B gratuits qui valent le coup

Si vous préférez ne pas maintenir de tableur, deux outils gratuits très connus font exactement le même travail.

Le calculateur d’Evan Miller (Sample Size Calculator) prend votre taux de base et votre MDE et vous donne l’échantillon par variante, en utilisant les mêmes données de significativité et de puissance.2 C’est une référence de longue date dans la communauté du testing et un bon moyen de vérifier votre propre feuille de calcul.

Le calculateur d’Optimizely est une autre excellente option gratuite via navigateur qui demande les mêmes entrées et renvoie un nombre par variante. N’importe lequel de ces outils aboutira à des chiffres proches de ceux du tableau ci-dessus avec les mêmes hypothèses.

Peu importe celui que vous utilisez, donnez-lui votre vraie baseline et un MDE réaliste. Un calculateur alimenté avec des chiffres optimistes renverra un objectif optimiste, et la plupart du temps, inatteignable.


La réalité du manque de trafic sur Shopify

Voici la dure réalité pour les petites boutiques. Le tableau de scénarios montre que détecter une amélioration modeste sur un taux de conversion classique peut nécessiter des dizaines de milliers de visiteurs par variante. Beaucoup de boutiques Shopify n’atteignent pas ce trafic dans un laps de temps raisonnable.

Cela ne veut pas dire que faire des tests ne sert à rien. Cela signifie qu’il faut tester intelligemment.

Pour découvrir des outils adaptés au budget d’une boutique Shopify, consultez notre sélection des meilleures applications Shopify pour le CRO.


La place de Fudge dans tout ça

La taille de l’échantillon détermine la durée d’exécution d’un test. L’autre moitié de l’équation, c’est le temps nécessaire pour créer la variante en elle-même, et c’est là que la plupart des tests calent avant même de commencer.

Fudge est un éditeur de boutique IA qui écrit du code de thème natif. Vous décrivez la variante que vous voulez tester (une nouvelle disposition de page produit, un bandeau d’accueil différent, une offre restructurée…), et il écrit le code Liquid, CSS et JavaScript directement dans votre thème. Pas besoin d’attendre un développeur, et pas de widget lourd.

Comme le résultat est du vrai code de thème, la variante se comporte comme le reste de votre boutique pendant le test, sans script tiers qui ralentit la page et fausse les résultats. Vous pouvez générer rapidement la nouvelle version (le challenger), y brancher votre outil de test, et concentrer vos efforts sur la partie qui prend vraiment du temps : attendre d’avoir un échantillon suffisant. Cela vaut pour tout ce que vous créez avec notre éditeur de boutique Shopify.


FAQ

Comment calculer la taille d'échantillon d'un test A/B pour une boutique Shopify ?

Prenez votre taux de conversion de base, l'effet minimum détectable que vous voulez déceler, ainsi que les standards de 95 % pour la significativité et de 80 % pour la puissance. Entrez ces données dans un calculateur comme celui d'Evan Miller, ou utilisez la formule n = (1,96 + 0,84)^2 x [p1(1-p1) + p2(1-p2)] / (p2-p1)^2. Vous obtiendrez le nombre de visiteurs nécessaires par variante.

Qu'est-ce qu'un effet minimum détectable (MDE) ?

Le MDE est la plus petite amélioration que vous souhaitez que le test puisse détecter, généralement sous la forme d'un pourcentage relatif. Un MDE de 20 % sur une base de 3 % signifie détecter un passage à 3,6 %. Un MDE plus faible rend le test plus sensible mais nécessite beaucoup plus de visiteurs, car diviser par deux l'effet attendu multiplie par quatre la taille de l'échantillon requise.

Combien de temps dois-je laisser tourner un test A/B Shopify ?

Laissez-le tourner jusqu'à ce que vous atteigniez la taille d'échantillon préalablement calculée, et toujours par blocs de semaines complètes afin d'équilibrer les comportements entre la semaine et le week-end. Divisez le nombre total de visiteurs nécessaires par votre trafic hebdomadaire éligible au test pour estimer la durée. Deux à quatre semaines sont courantes ; n'arrêtez pas prématurément juste parce que la significativité passe au vert dans votre outil.

Pourquoi un faible taux de conversion nécessite-t-il un plus grand échantillon ?

Les événements rares comportent un « bruit » relatif plus important, il faut donc plus d'observations pour distinguer un effet réel du simple hasard. À 1 % de conversion de base, même une augmentation de 20 % peut nécessiter environ 42 600 visiteurs par variante, soit environ trois fois ce dont une base de 3 % a besoin pour le même effet relatif.

Une boutique Shopify avec peu de trafic peut-elle réaliser des tests A/B fiables ?

Oui, mais vous devez tester des changements plus radicaux, vous concentrer sur les pages ayant le plus de trafic, et accepter des fenêtres de test plus longues. Détecter une petite augmentation peut nécessiter des dizaines de milliers de visiteurs par variante, ce qui est hors de portée pour beaucoup de boutiques. Réservez donc les tests de détails aux pages à fort trafic et utilisez la recherche qualitative pour le reste.

Quelles significativité et puissance dois-je utiliser ?

Les valeurs par défaut classiques sont une significativité statistique de 95 % (alpha de 0,05) et une puissance statistique de 80 %. La significativité contrôle à quel point vous êtes sûr qu'une victoire détectée n'est pas due au hasard, et la puissance contrôle la probabilité que vous détectiez une victoire qui existe réellement. Ces deux éléments sont des points de départ, plutôt que des règles immuables.

Simeon's signature
Déployez des variantes de test sans attendre qu'un dev s'en charge.

Footnotes

  1. Evan Miller, “How Not To Run An A/B Test” - vérifier un test à plusieurs reprises et l’arrêter dès qu’il atteint la significativité gonfle le taux de faux positifs bien au-dessus du niveau ciblé. C’est pourquoi la taille de l’échantillon doit être fixée à l’avance. https://www.evanmiller.org/how-not-to-run-an-ab-test.html

  2. Evan Miller, “Sample Size Calculator” - un outil gratuit qui renvoie l’échantillon requis par variante à partir d’un taux de conversion de base et d’un effet minimum détectable avec la significativité et la puissance choisies. https://www.evanmiller.org/ab-testing/sample-size.html

You might also be interested in

Lancer une boutique Shopify en France (Avec Templates)
Lancer une boutique Shopify en France : TVA et mentions légales, REP/Triman, paiements, expédition et les changements de design que les acheteurs français attendent.
Créer des landing pages publirédactionnelles sur Shopify (avec modèle)
Une landing page publirédactionnelle Shopify pré-vend le trafic publicitaire froid grâce à une histoire. Obtenez le modèle en 9 parties, créez-le en natif pour plus de rapidité, et étiquetez-le selon les règles.
Klaviyo + Shopify : Le Guide d'Installation Pratique
Configurer Klaviyo sur Shopify : l'installation, les flows qui comptent, la segmentation, et ce qu'il faut zapper. Guide pratique pour les boutiques de moins de 5 M$ et plus.