Conversion et experience
Signification statistique
La signification statistique évalue la probabilité qu’un écart observé entre deux versions d’une page soit dû au hasard plutôt qu’à une différence réelle.
Un test déclaré significatif à 95 % signifie qu’il y a environ une chance sur vingt que l’écart constaté vienne du hasard seul.
Ce que le seuil ne dit pas
Trois malentendus fréquents, et ils conduisent à des décisions coûteuses.
Il ne dit pas que la version B est meilleure de tant. Il dit qu’un écart existe probablement. L’ampleur de cet écart a sa propre incertitude, souvent large.
Il ne dit pas que le résultat se reproduira. Une chance sur vingt de se tromper reste une chance sur vingt, et sur vingt tests menés, un donnera un faux positif.
Il ne dit pas que la différence a de la valeur. Un écart réel de 0,2 % sur un site à faible volume ne change rien au chiffre d’affaires.
Combien il en faut
C’est la question que la plupart des tests évitent, et elle décide de tout.
L’ordre de grandeur se compte en conversions, pas en visites. Pour détecter un écart relatif de dix pour cent avec une confiance raisonnable, il faut plusieurs centaines de conversions par version.
La conséquence est directe : sur une page qui produit dix conversions par mois, aucun test comparatif ne conclura avant des années. C’est le cas de la majorité des sites de service.
Le calcul du taux de conversion sur les volumes réels de la page dit donc, avant tout test, s’il est possible d’en conclure quoi que ce soit.
Les erreurs qui font conclure trop tôt
Quatre, par fréquence.
Regarder les résultats en continu et s’arrêter au premier moment favorable. Le seuil est atteint par hasard à un instant donné, puis repart. Cette pratique produit énormément de faux positifs.
Ne pas fixer la durée à l’avance. Un test doit couvrir au moins un cycle hebdomadaire complet, les comportements du week-end différant de ceux de la semaine.
Tester plusieurs variantes sans ajuster le seuil. Plus il y a de versions, plus la probabilité qu’une paraisse gagnante par hasard augmente.
Mélanger des populations. Un test qui agrège mobile et ordinateur peut masquer deux effets opposés qui s’annulent.
Que faire quand le volume manque
C’est la situation la plus fréquente, et il existe une réponse.
Corriger ce qui est manifestement cassé sans le tester : un formulaire trop long, une page qui ne tient pas la promesse de l’annonce, un frais découvert au dernier moment. Ces corrections n’ont pas besoin de validation statistique.
Et s’appuyer sur l’observation plutôt que sur la mesure : cinq tests utilisateurs révèlent des problèmes qu’aucun test comparatif ne détecterait sur ces volumes.
FAQ