Définition
Définition et périmètre
Ce problème se pose dès qu’une étude mesure plusieurs résultats, plusieurs sous-groupes ou plusieurs moments dans le temps et ne rapporte que les comparaisons devenues significatives sans préciser combien en ont réellement été testées, ce qui revient à gonfler silencieusement le taux d’erreur réel derrière un seuil affiché de 5 % qui ne s’applique en toute rigueur qu’à un test unique.Dunn, 1961 · Holm, 1979
Cette notion décrit un fonctionnement possible, dont l’intensité et les effets varient selon la situation. La reconnaître suppose d’examiner ce qui la déclenche, la fonction qu’elle prend et ce qu’elle produit dans le temps, plutôt que de s’arrêter à une conduite isolée.Dunn, 1961 · Holm, 1979
Comprendre
Mécanisme et fonction
Comparaisons multiples dépend de la manière dont l’information est sélectionnée, interprétée et maintenue disponible. Le processus peut être rapide ou réfléchi, volontaire ou partiellement automatique ; ces dimensions doivent être distinguées avant de lui attribuer une cause unique.Holm, 1979 · Benjamini, 1995 · Bender, 2001
Son caractère utile ou coûteux dépend moins de sa simple présence que de sa fréquence, de sa souplesse et de son ajustement au contexte. Un fonctionnement ponctuel peut soutenir l’adaptation ; le même fonctionnement, devenu automatique ou exclusif, peut réduire les possibilités de réponse.Holm, 1979 · Benjamini, 1995 · Bender, 2001
Observer
Formes et variations
Les exemples rendent la notion plus concrète sans en faire une règle générale. Un même comportement peut remplir une autre fonction dans une autre situation.Holm, 1979 · Benjamini, 1995 · Bender, 2001
- Une étude qui teste vingt sous-groupes et ne publie que celui qui a atteint la significativité reproduit silencieusement le problème des comparaisons multiples.
- La correction de Bonferroni divise le seuil de signification par le nombre de tests effectués afin de garder le taux d’erreur global proche de 5 %.
Distinguer
Notions proches et limites
Comparaisons multiples est notamment rapproché de Erreur de type I, P-hacking et Biais de publication. Ces relations signalent des recouvrements possibles, pas des synonymes : deux notions peuvent produire des conduites semblables tout en différant par leur déclencheur, leur fonction ou leur temporalité.Benjamini, 1995 · Bender, 2001
La notion devient peu informative lorsqu’elle est utilisée comme une étiquette globale. Elle gagne au contraire en précision lorsqu’on peut décrire les situations où elle apparaît, les changements qui la modifient et les observations qui contrediraient l’hypothèse.Holm, 1979 · Benjamini, 1995 · Bender, 2001
Références
- Bender, R., & Lange, S. (2001). Adjusting for multiple testing: When and how? Journal of Clinical Epidemiology, 54(4), 343–349.
- Benjamini, Y., & Hochberg, Y. (1995). Controlling the false discovery rate: A practical and powerful approach to multiple testing. Journal of the Royal Statistical Society: Series B, 57(1), 289–300.
- Dunn, O. J. (1961). Multiple comparisons among means. Journal of the American Statistical Association, 56(293), 52–64.
- Holm, S. (1979). A simple sequentially rejective multiple test procedure. Scandinavian Journal of Statistics, 6(2), 65–70.
Dernière révision documentaire : septembre 2026.