Tester deux versions d'une page : le calcul à faire avant tout
Je vais commencer par le contraire de ce qu'on attend d'une agence web.
Sur la plupart des sites de PME, l'A/B testing est une mauvaise idée. La méthode est excellente. Mais elle a besoin de trafic pour dire quelque chose, et ces sites n'en ont pas assez.
La demande revient pourtant souvent. Un dirigeant a lu qu'il fallait tester ses pages, il veut comparer deux versions de sa page d'accueil. Faites le calcul pour une page qui reçoit quelques centaines de visites par mois : départager les deux versions prend souvent plusieurs mois. Pendant tout ce temps, la moitié des visiteurs voit une version qu'on soupçonne d'être moins bonne.
Le but n'est pas de vous dissuader de tester. C'est de vous éviter de passer un semestre à mesurer du bruit.
TL;DR : un test A/B compare deux versions d'une page auprès de deux groupes de visiteurs pour savoir laquelle convertit le mieux. Il lui faut assez de visiteurs pour atteindre la significativité statistique, souvent plusieurs milliers par variante. En dessous de ce seuil, une PME progresse plus vite en observant ses visiteurs et en corrigeant les défauts évidents.
Qu'est-ce qu'un test A/B ?
Un test A/B affiche deux versions d'une même page à deux groupes de visiteurs tirés au hasard, sur la même période. On compare ensuite le taux d'atteinte d'un objectif précis : un formulaire envoyé, un appel déclenché, un devis demandé.
Qu'est-ce qui le distingue d'une simple refonte ? Le groupe témoin. Si vous changez votre page et que les demandes montent le mois suivant, vous ne savez pas pourquoi. Ce peut être la page, la saison, une campagne ou un article qui a bien marché. Le test A/B fait tourner les deux versions en même temps, ce qui neutralise tout le reste.
C'est sa valeur, et c'est aussi sa contrainte. Pour que la comparaison soit honnête, chaque groupe doit être assez grand pour que le hasard se dilue. La Harvard Business Review le rappelle dans son introduction à l'A/B testing : la vraie question n'est pas de savoir quelle version a le meilleur score. C'est de savoir si l'écart observé est réel ou dû au hasard.
Combien de visiteurs faut-il pour un test A/B ?
Tout dépend de votre taux de conversion actuel et de l'écart que vous voulez détecter : plus l'amélioration cherchée est faible, plus il faut de monde.
L'ordre de grandeur surprend. Pour détecter une amélioration modeste sur une page qui convertit peu, il faut souvent plusieurs milliers de visiteurs par variante. Le calculateur de taille d'échantillon d'Evan Miller, utilisé par la plupart des praticiens, fait ce calcul en trente secondes.
Faites-le en premier. Avant de choisir un outil, avant de dessiner la variante.
Voici la lecture que j'en fais pour un site de PME.
| Trafic mensuel de la page | Ce qui est réaliste |
|---|---|
| Moins de 1 000 visiteurs | Aucun test. Observation qualitative et corrections évidentes |
| 1 000 à 5 000 visiteurs | Tests possibles sur des changements radicaux uniquement |
| Plus de 5 000 visiteurs | Tests exploitables sur des changements ciblés |
Un site vitrine de PME reçoit souvent quelques centaines de visites par mois sur sa page de contact. À ce niveau, un test A/B ne produira jamais de conclusion. Il produira une impression de conclusion, ce qui est pire.
Que faire quand on n'a pas le volume ?
Observer, corriger l'évident, puis mesurer avant et après. C'est la partie utile pour la majorité des lecteurs, et elle coûte moins cher.
Regarder des gens utiliser le site. Trois ou quatre personnes qui ne connaissent pas votre activité. Vous leur demandez de trouver un service ou de vous contacter. Le Nielsen Norman Group a montré qu'environ 85 % des problèmes d'utilisabilité apparaissent dès cinq testeurs. Vous apprendrez en une heure ce qu'un test de plusieurs mois ne vous dirait pas.
Lire les enregistrements de session et la profondeur de scroll. Ils montrent où l'attention s'arrête. Ce n'est pas une preuve statistique, c'est une piste. À ce stade, une piste vaut mieux qu'un test non concluant.
Corriger ce qui est évident. Un formulaire à onze champs, un numéro de téléphone introuvable, un titre qui ne dit pas le métier. Ces défauts n'ont pas besoin d'être testés pour être corrigés. Personne ne teste si une porte fermée à clé gêne les clients.
Mesurer avant et après, en assumant l'imprécision. Ce n'est pas de la science, mais sur un changement franc, l'effet se voit. Mesurez ce qui compte pour l'entreprise. Sur la refonte d'Activ'Sport, par exemple, le résultat suivi est un nombre de rendez-vous (cinq séances d'essai réservées via le formulaire), pas un taux de clic.
Pour moi, la bonne séquence est simple. On corrige d'abord ce qui est cassé. On construit le trafic ensuite. On teste seulement quand il y a de quoi tester. Cette progression est détaillée dans notre guide des étapes d'une refonte de site pour PME.
Vous ne savez pas si votre page de contact freine vos demandes ? Nous observons le parcours réel de vos visiteurs lors d'un diagnostic de refonte. Devis gratuit et sans engagement.
Quel outil utiliser depuis la fin de Google Optimize ?
Un outil payant, choisi sur trois critères plutôt que sur sa liste de fonctions.
Beaucoup d'articles francophones recommandent encore Google Optimize. Il n'existe plus : Google a annoncé son arrêt dans sa documentation d'assistance, et le service a fermé fin septembre 2023. Le marché s'est depuis reconfiguré autour d'outils payants.
L'intégration à votre mesure d'audience. Un test dont les résultats vivent dans un tableau de bord séparé finit par ne plus être lu.
L'éditeur visuel. Il doit permettre de créer la variante sans développeur. Sinon chaque test devient un mini projet, et vous en ferez deux par an.
La méthode d'arrêt du test. Elle doit être explicite. C'est le point technique qui compte vraiment, et il fait l'objet de la section suivante.
Comment mener un test A/B correctement ?
En fixant tout avant de lancer : l'hypothèse, le changement testé, la durée et le seuil de décision.
Une hypothèse écrite. Pas « on teste un bouton vert ». Plutôt : « placer les avis clients au-dessus du formulaire augmentera les demandes, parce que les visiteurs hésitent au moment de s'engager ». Une hypothèse fausse est utile. Une absence d'hypothèse ne l'est pas.
Un seul changement à la fois. Sinon vous saurez que quelque chose a marché, sans savoir quoi.
Une durée fixée à l'avance. Elle couvre au minimum un cycle complet d'activité. Le trafic du lundi ne ressemble pas à celui du samedi.
Un seuil de décision défini au lancement. L'usage professionnel retient un seuil de confiance de 95 % comme plancher. Cela revient à accepter une chance sur vingt de se tromper.
Aucune décision avant le terme prévu. C'est la règle la plus violée, et la plus destructrice.
Les quatre erreurs qui invalident un test
Arrêter trop tôt, tester en période atypique, tester un détail quand le problème est de fond, et suivre le mauvais objectif.
Arrêter le test quand la courbe est favorable. Au troisième jour, une variante mène toujours. Si vous arrêtez là, vous ne mesurez pas une amélioration. Vous mesurez votre impatience.
Tester pendant une période atypique. Une campagne, un article qui remonte, un pont de mai. Le trafic n'est plus comparable à votre trafic habituel.
Tester un détail sur un site qui a un problème de fond. Comparer deux nuances de bouton sur une page qui n'explique pas le métier, c'est repeindre une pièce au plancher troué. La hiérarchie du message se corrige avant de se tester. C'est un travail d'arbitrage éditorial autant que de design, comme dans notre guide de la charte graphique pour PME.
Suivre le mauvais objectif. Une variante peut augmenter les clics sur un bouton et faire baisser les demandes qualifiées. L'objectif à suivre est le rendez-vous ou le devis signé, pas le clic.
Questions fréquentes
À partir de combien de visiteurs un test A/B est-il fiable ? Il n'y a pas de chiffre universel : cela se calcule à partir de votre taux de conversion et de l'écart à détecter. En pratique, sous 1 000 visiteurs mensuels sur la page concernée, un test aboutit rarement à une conclusion exploitable.
Combien de temps doit durer un test ? Au minimum un cycle d'activité complet, et jusqu'à atteindre la taille d'échantillon calculée. La plus contraignante des deux conditions l'emporte.
Peut-on tester deux éléments en même temps ? Oui, avec un test multivarié. Mais il exige beaucoup plus de trafic qu'un test A/B classique. Pour une PME, c'est presque toujours hors de portée.
Un test non concluant est-il un échec ? Non. Il signifie que le changement testé n'a pas d'effet mesurable, ce qui est une information. L'échec, c'est de conclure quand même.
Faut-il un développeur pour lancer un test ? Pas forcément. Les éditeurs visuels suffisent pour modifier un texte ou une mise en page. Un changement de structure profond demande en revanche une intervention technique.
Tester, oui, mais au bon moment
L'A/B testing est un excellent outil de décision, à condition d'avoir de quoi l'alimenter. Pour la plupart des PME, la contrainte n'est ni la méthode ni l'outil. C'est le volume de visiteurs.
Ce n'est pas une raison de renoncer à améliorer son site. C'est une raison de commencer par ce qui se voit à l'œil nu, et de garder les tests pour le moment où ils diront quelque chose.
Vous voulez savoir ce que votre trafic actuel permet réellement de tester ? Parlons de votre projet. Devis gratuit et sans engagement.