Deux titres, deux versions de page, et on garde le meilleur : le principe paraît imparable. Le problème est que la plupart des tests menés par de petites structures ne mesurent rien, et donnent malgré tout un gagnant.
Ce faux gagnant est plus coûteux qu'aucun test, parce qu'il fait prendre une décision durable sur du hasard.
Définition
L'A/B testing consiste à présenter simultanément deux versions d'un élément à deux groupes de visiteurs tirés au hasard, puis à comparer leur Taux de conversion.
Le mot « simultanément » est une condition, pas un détail. Comparer une semaine à la suivante mesure aussi le jour, la saison et la source de trafic.
Le volume nécessaire, qui surprend tout le monde
À ce volume, cet écart est indiscernable du hasard. Un gagnant désigné ici serait un faux gagnant.
Le seuil est calculé pour un test bilatéral à 95 % de confiance et 80 % de puissance, la convention courante. Il ne remplace pas un outil statistique, il donne l'ordre de grandeur, qui suffit presque toujours à savoir s'il faut attendre.
Réglez ci-dessus le nombre de visiteurs et l'écart entre les deux versions. Ce qui apparaît est la seule chose importante à retenir : avec quelques centaines de visiteurs, un écart de deux points est indiscernable du hasard. Il faut souvent plusieurs milliers de visiteurs par version pour trancher un écart réaliste.
Conséquence directe pour une petite activité : sur une page qui reçoit trois cents visiteurs par mois, l'A/B testing ne peut rien démontrer. Le temps d'atteindre un volume suffisant, la saison a changé et le test est invalide.
Que faire quand on n'a pas le volume
| Méthode | Ce qu'elle donne |
|---|---|
| Lecture commentée par cinq personnes | Les blocages, en une heure |
| Changement franc, mesuré sur un trimestre | Un écart assez gros pour être visible |
| Question posée aux acheteurs | La raison réelle de l'achat |
| Observation des sorties de page | L'endroit précis où on perd |
La deuxième ligne est la bonne stratégie à petit volume : ne testez pas deux nuances, changez franchement et mesurez sur une longue période. Un écart de dix points se voit même avec peu de trafic ; un écart d'un point ne se verra jamais.
Questions fréquentes
Combien de temps laisser tourner un test ?
Au minimum deux semaines complètes, pour couvrir tous les jours de la semaine, et jusqu'à atteindre le volume nécessaire. Arrêter un test dès qu'une version passe devant est l'erreur la plus fréquente : les écarts s'inversent souvent.
Peut-on tester plusieurs choses à la fois ?
Pas sur de petits volumes. Chaque variante supplémentaire divise le trafic et multiplie le nombre de visiteurs nécessaires. À faible trafic, un seul changement par test, et un test à la fois.
Que tester en priorité ?
Ce qui est vu par tout le monde et proche de la décision : le titre, le prix, la formulation de l'offre. Tester un élément vu par 5 % des visiteurs demande vingt fois plus de trafic pour le même résultat.
Un test perdant est-il une perte de temps ?
Non, c'est une information conservée : vous savez que cette piste ne rapporte rien, et vous ne la reprendrez pas dans six mois. Notez les résultats, y compris négatifs, sinon vous rejouerez les mêmes tests.