← Toutes les lectures guidées

Lecture guidée · 8 étapes

Quand un résultat devient une preuve

De la valeur p à la méta-analyse : ce qu’il faut établir avant de croire qu’un résultat tient.

Un résultat statistiquement significatif ne devient pas, par lui-même, une preuve solide. Il faut encore savoir ce que mesure exactement le seuil franchi, quelle est l’ampleur de l’effet, si l’étude avait une chance réaliste de le détecter, et si les choix effectués avant ou après les données ont pu favoriser ce résultat. Cette lecture suit la chaîne qui relie un test isolé à une conclusion plus fiable : elle part du chiffre le plus souvent invoqué, examine les fragilités qui peuvent le rendre trompeur, puis suit les moyens de rendre la recherche plus contrôlable et cumulable.

Valeur p (p-value)

La valeur p, ou p-value, est la probabilité d’obtenir, sous un modèle nul spécifié, un résultat au moins aussi extrême que celui observé. L’hypothèse nulle ne correspond pas nécessairement à l’absence de tout effet réel : elle peut, par exemple, poser une valeur précise pour un effet ou une différence. Popularisée par Ronald Fisher dès 1925 comme un repère de compatibilité entre les données et un modèle, elle ne constitue pas à elle seule une règle de décision automatique. L’American Statistical Association a rappelé en 2016 qu’elle ne mesure ni la probabilité que l’hypothèse soit vraie ni l’ampleur ou l’importance pratique d’un effet.

Un article titrant p = ,04 est parfois lu à tort comme la preuve que l’effet observé a 96 % de chances d’être réel.

Deux réplications d’une même étude peuvent obtenir p = ,01 puis p = ,20 sans que l’effet réel n’ait changé, par simple fluctuation d’échantillonnage.

Taille d’effet

La taille d’effet quantifie l’ampleur d’un phénomène, par exemple le d de Cohen pour une différence de moyennes standardisée ou le coefficient r pour une association, indépendamment du nombre de personnes testées. Jacob Cohen en systématise le calcul en 1988 avec des repères conventionnels pour un petit, moyen ou grand effet, en précisant lui-même que ces seuils restent des conventions grossières et non des vérités fixes valables dans tous les domaines.

Un d de Cohen de 0,8 sur une mesure d’anxiété indique un écart large entre deux groupes, quelle que soit la taille de l’échantillon utilisé.

Deux études rapportant toutes deux p < ,05 peuvent correspondre à des tailles d’effet très différentes, l’une négligeable et l’autre substantielle.

Puissance statistique

La puissance statistique d’un test est la probabilité de détecter correctement un effet réel d’une taille donnée, s’il existe. Elle dépend de la taille de l’effet recherché, de la taille de l’échantillon, du seuil de signification choisi et de la variabilité des données ; Jacob Cohen en systématise le calcul dès 1988 avec pour cible conventionnelle une puissance de 0,80, alors qu’une revue de 2013 estime la puissance médiane réelle des études de neurosciences à seulement environ 20 %.

Une étude avec seulement 20 % de puissance n’a qu’une chance sur cinq environ de détecter l’effet réel qu’elle cherche à mettre en évidence.

Calculer la taille d’échantillon nécessaire avant de recueillir les données, plutôt qu’après coup, permet d’éviter une étude structurellement sous-puissante.

P-hacking

Le p-hacking désigne l’ensemble des choix analytiques flexibles pris après avoir vu les données, comme arrêter la collecte au bon moment, choisir la mesure qui fonctionne ou exclure certains participants après coup, qui font grimper le taux réel de faux positifs bien au-delà du seuil affiché de 5 %. Joseph Simmons, Leif Nelson et Uri Simonsohn en font la démonstration en 2011 dans un article devenu une référence de méthodologie, en montrant qu’un nombre modeste de tels choix, chacun défendable isolément, suffit à produire une preuve statistiquement significative d’un effet qu’ils savaient eux-mêmes impossible.

Un chercheur teste cinq mesures différentes d’anxiété et ne rapporte dans l’article que la seule mesure devenue significative.

Une équipe arrête la collecte de données dès qu’un résultat franchit le seuil de significativité, sans avoir fixé cette règle à l’avance.

Biais de publication

Le biais de publication désigne la moindre probabilité qu’une étude sans résultat significatif soit soumise, acceptée par une revue ou même rédigée par ses auteurs, comparée à une étude rapportant un effet positif. Robert Rosenthal formalise ce problème dès 1979 sous le nom de problème du tiroir, et Matthias Egger et ses collègues proposent en 1997 un test graphique, le funnel plot, pour détecter la distorsion qu’il produit dans une méta-analyse.

Dix études testant un même traitement peuvent être menées, mais seules les trois qui trouvent un effet positif sont finalement publiées et citées.

Un funnel plot montrant l’absence de petites études aux résultats négatifs suggère qu’une partie de la littérature sur le sujet reste invisible.

Crise de la réplication

La crise de la réplication désigne le constat, établi notamment par l’Open Science Collaboration en 2015 sur cent études de psychologie, qu’une large proportion des résultats publiés perd sa significativité ou voit son ampleur nettement réduite lorsqu’une équipe indépendante tente de les reproduire avec une méthode rigoureuse et une puissance suffisante. Le dossier consacré aux statistiques sur ce site détaille cette étude et ses causes ; ce concept renvoie plus brièvement à la notion générale pour la relier au reste du glossaire.

Une étude princeps très citée peut voir son effet diminuer de moitié, voire disparaître, lorsqu’elle est reproduite avec un échantillon plus large.

Le préenregistrement des hypothèses avant la collecte des données s’est diffusé après 2015 en réponse directe à ce constat.

Préenregistrement

Le préenregistrement consiste à déposer, sur un dépôt public comme l’Open Science Framework, les hypothèses et le plan d’analyse d’une étude avant de recueillir les données, afin de distinguer clairement ce qui a été prédit à l’avance de ce qui a été décidé après avoir vu les résultats. Un format plus strict, la publication enregistrée, inaugurée par Christopher Chambers en 2013 dans la revue Cortex, fait accepter un article en principe avant même de connaître ses résultats, sur la seule qualité de la question et de la méthode.

Un chercheur dépose sur l’Open Science Framework son hypothèse et son plan d’analyse avant de commencer à recueillir des données.

Une revue accepte un article sous le format de la publication enregistrée avant même de connaître ses résultats, sur la seule qualité de sa méthode.

Méta-analyse

Une méta-analyse combine statistiquement les résultats de plusieurs études indépendantes portant sur une même question, en pondérant généralement chaque étude selon la précision de son estimation, de sorte qu’une grande étude bien menée pèse davantage dans le résultat final qu’une petite étude imprécise. Gene Glass invente le terme en 1976 pour distinguer cette synthèse statistique d’une revue de littérature narrative classique, et l’outil est depuis devenu la base des hiérarchies de preuves en psychologie clinique comme en médecine. Sa limite la plus documentée est qu’elle ne corrige pas les défauts que les études combinées partagent en amont, en particulier le biais de publication qui prive la synthèse des petites études aux résultats nuls ou négatifs restées dans le tiroir.

Une méta-analyse combinant vingt petites études imprécises et deux grandes études précises accorde un poids statistique bien plus élevé à ces deux dernières.

Un funnel plot asymétrique publié en annexe d’une méta-analyse signale que des petites études aux résultats négatifs manquent probablement à l’appel.

En conclusion

Une preuve scientifique n’est donc pas le statut que confère une p-value à une étude. Elle se construit par la transparence des choix, la proportion entre la précision revendiquée et les données disponibles, la publication des résultats qui déçoivent autant que de ceux qui confirment, puis la confrontation de travaux indépendants. La méta-analyse peut rendre cette accumulation plus lisible, mais elle ne transforme pas des études fragiles en certitude : elle doit examiner leur qualité, leur hétérogénéité et ce qui manque au dossier. Le bon réflexe est moins de demander si un résultat est « significatif » que de demander quelle part du chemin vers une conclusion fiable il a réellement parcourue.

Le grand dossier statistiques