Conversion et experience
Puissance statistique
La puissance statistique est la probabilité qu’un test détecte un écart qui existe réellement.
Elle répond à la question symétrique de la signification. La signification statistique évite de conclure à un écart qui n’existe pas. La puissance évite de passer à côté d’un écart qui existe.
Les deux erreurs possibles
Un test peut se tromper de deux façons.
Conclure à une différence qui n’existe pas. C’est le faux positif, contrôlé par le seuil de signification, généralement fixé à 5 %.
Ne pas détecter une différence qui existe. C’est le faux négatif, contrôlé par la puissance, généralement visée à 80 %.
Une puissance de 80 % signifie qu’en cas d’écart réel, le test a huit chances sur dix de le voir. Une chance sur cinq de le manquer subsiste, et elle est acceptée.
Ce qui la détermine
Trois paramètres, liés entre eux.
La taille de l’échantillon. Plus il y a d’observations, plus la puissance est élevée. C’est le seul levier réellement actionnable.
L’ampleur de l’écart à détecter. Un écart de vingt pour cent se voit avec peu de données. Un écart de deux pour cent en demande énormément.
Le taux de base. Un taux de conversion de 1 % demande bien plus d’observations qu’un taux de 10 % pour détecter le même écart relatif.
Pourquoi la plupart des tests en manquent
Parce que le calcul n’est pas fait avant.
La démarche correcte consiste à décider d’abord l’écart minimal qui vaudrait la peine d’être détecté, puis à calculer le nombre de conversions nécessaires, puis à vérifier que le trafic permet de l’atteindre dans un délai raisonnable.
Sur une page qui produit dix conversions par mois, ce calcul montre que détecter un écart de dix pour cent demanderait plusieurs années. Le test ne doit pas être lancé.
C’est la situation de la majorité des sites de service, et c’est ce que le calcul du taux de conversion révèle avant tout test.
Ce qu’on fait quand elle manque
Deux choses, et aucune n’est un test comparatif.
Corriger ce qui est manifestement cassé, sans validation statistique : un formulaire trop long, une page qui ne tient pas la promesse de l’annonce.
Et s’appuyer sur l’observation directe, notamment le test utilisateur, qui révèle avec cinq personnes ce qu’aucun test comparatif ne détecterait sur ces volumes.
FAQ