Centre de ressources · Comprendre

Tailles d’effet

Un traitement peut être supérieur au placebo et ne rien changer pour votre patient. La taille d’effet est le chiffre qui fait la différence, à condition de savoir ce qu’il mesure.

Mise à jour 13 août 2026
Lecture 14 min
9 références vérifiées

← Comprendre·Centre de ressources

En une phrase. La valeur de p dit qu’une différence existe probablement, la taille d’effet dit si elle vaut la peine d’être prescrite, et aucune des deux ne répond à la question de l’autre.

01 Pourquoi le p ne suffit pas

Prenez une différence d’un point sur une échelle de dépression qui en compte cinquante. Sur quarante patients, elle ne sera pas significative. Sur vingt mille, elle le sera, et largement.

La différence, elle, n’a pas bougé d’un millimètre. C’est le nombre de patients qui a changé.

En clair. Une valeur de p mesure votre capacité à voir un effet, pas la taille de cet effet. Un grand essai voit mieux, il ne soigne pas mieux.

D’où une règle de lecture en trois temps, valable pour n’importe quel résultat chiffré :

  1. Quelle ampleur ? C’est la taille d’effet.
  2. Quelle précision ? C’est l’intervalle de confiance.
  3. Quelle portée ? C’est votre jugement clinique, et rien ne peut le remplacer.

Le p n’intervient dans aucun des trois.

02 Ce que veut dire « standardisé »

C’est le mot qui bloque tout le monde, y compris ceux qui lisent des méta-analyses depuis vingt ans. Il recouvre pourtant une opération simple.

Une différence brute s’exprime dans l’unité de l’échelle : trois points de MADRS, un kilo et demi, deux heures de sommeil. C’est parlant, mais on ne peut pas additionner des points de MADRS et des points de HAMD. Pour les agréger, on divise chaque différence par la dispersion des patients de l’étude, c’est-à-dire par l’écart type. Le résultat n’est plus en points, il est en « écarts types », donc comparable d’une échelle à l’autre.

En clair. Standardiser, c’est mesurer un écart avec une règle graduée non pas en centimètres, mais en « largeur de la population étudiée ». D’où le problème : cette règle change de longueur d’une étude à l’autre.

Ce que ça donne concrètement

Deux essais du même produit, exactement le même bénéfice de 3 points sur la MADRS.

Essai Population Écart type Bénéfice DMS
A Large, patients hétérogènes 10 points 3 points 0,30
B Étroite, critères stricts 6 points 3 points 0,50

L’essai B affiche une taille d’effet presque double. Le patient, lui, gagne exactement la même chose.

Exemple construit pour l’illustration. Ce ne sont pas des données publiées.

À quoi ressemble une DMS de 0,30

Voici, à l’échelle, ce que représente l’ordre de grandeur habituellement observé pour les antidépresseurs contre placebo.

0,30 placebo traitement évolution du score, du pire au meilleur
Deux populations décalées de 0,30 écart type. Le patient moyen du groupe traité se situe au 62e centile du groupe placebo, contre le 50e en l’absence de tout effet. Valeur calculée à partir de la loi normale, ce n’est pas une donnée publiée.

En clair. Un effet réel et un recouvrement massif ne s’opposent pas. C’est même la situation ordinaire en psychiatrie, et c’est ce que veut dire « il faut essayer pour savoir ».

03 Les cinq familles de mesures

Les tailles d’effet ne forment pas une échelle unique. Cinq familles, cinq questions différentes, et elles ne se comparent pas entre elles.

Mesure Ce qu’elle dit Où on la croise Le piège
Différence moyenne L’écart brut, en points d’échelle ou en kilos Essais utilisant une même échelle Ne dit rien de la dispersion des patients
DMS, d de Cohen, g de Hedges Le même écart, mesuré en écarts types Méta-analyses agrégeant plusieurs échelles Dépend de la population étudiée, voir plus haut
Risque relatif Combien de fois le risque est multiplié Réponse, rémission, rechute Un grand rapport sur un petit risque reste un petit gain
Rapport de cotes Un rapport de cotes, pas de risques Régressions logistiques, méta-analyses en réseau Exagère l’effet dès que l’événement est fréquent
NNT Combien de patients traiter pour un bénéfice Décision partagée, recommandations Dépend entièrement du risque de départ

d ou g, faut-il s’en inquiéter

Non. Le d de Cohen gonfle un peu quand l’échantillon est petit. Le g de Hedges est le même indice avec une correction J = 1 − 3 / (4 × ddl − 1) qui rattrape ce biais. Sensible en deçà d’une vingtaine de sujets par bras, négligeable au delà de cinquante. Voir un g plutôt qu’un d ne signale pas un meilleur résultat, seulement des auteurs consciencieux.

04 Les seuils de Cohen

0,2 faible, 0,5 moyen, 0,8 important. Tout le monde les cite. Presque personne ne sait d’où ils viennent.

Ils viennent de Jacob Cohen, en 1988, qui les présente lui-même comme arbitraires aux pages 12 et 13 de son ouvrage. Il les propose faute de mieux, calibrés sur la moyenne des effets rencontrés en sciences du comportement, et il recommande explicitement de leur préférer toute référence propre au domaine étudié dès qu’il en existe une.

En clair. Ce ne sont pas des seuils cliniques et ils n’ont jamais prétendu l’être. Un d de 0,15 sur la prévention du suicide et un d de 0,15 sur un score de qualité de sommeil ne se jugent pas de la même façon, et aucune convention ne le dira à votre place.

Le cas du rapport de cotes

Chen, Cohen et Chen ont calculé les rapports de cotes qui correspondent aux repères de Cohen, selon la fréquence de l’événement chez les non exposés.

Fréquence chez les non exposés Équivaut à d = 0,2 Équivaut à d = 0,5 Équivaut à d = 0,8
1 % OR 1,68 OR 3,47 OR 6,71
5 % OR 1,52 OR 2,74 OR 4,72

Autrement dit, la question « ce rapport de cotes est-il grand » n’a aucune réponse tant qu’on ignore le risque de départ.

05 Traduire en langage de consultation

De la DMS aux points d’échelle

Multipliez la DMS par l’écart type de la population. Vous récupérez des points. Une DMS de 0,30 dans une population dont l’écart type est de 8 points donne 2,4 points d’échelle. Condition : que cet écart type soit celui d’une population qui ressemble à vos patients, ce qui est rarement le cas des essais à inclusion étroite.

Du rapport de cotes au risque relatif

Le rapport de cotes s’écarte du risque relatif à mesure que l’événement devient fréquent, et toujours en exagérant.

Le même bénéfice, deux fréquences

Situation Placebo Traitement Risque relatif Rapport de cotes
Événement rare 5 % 6,5 % 1,30 1,32
Événement fréquent 50 % 65 % 1,30 1,86

Bénéfice relatif identique dans les deux lignes. Lu comme un risque relatif, le rapport de cotes de 1,86 promet 86 % d’amélioration là où il n’y en a que 30.

Exemple construit pour l’illustration, calculé à partir des pourcentages affichés.

Or les taux de réponse en psychiatrie tournent couramment autour de 40 à 50 % dans le bras placebo. Nous sommes donc en permanence dans la seconde ligne du tableau.

Du risque au NNT

Le NNT est l’inverse de la différence absolue de risque : NNT = 1 / (risque contrôle − risque traité). C’est la mesure qui parle le mieux en consultation, et la plus fragile au transport.

Le même traitement, deux populations

Population Rechute sans traitement Rechute sous traitement NNT
À haut risque 40 % 25 % 7
À bas risque 12 % 7,5 % 22

Réduction relative identique, de 37,5 % dans les deux cas. Le nombre de patients à traiter est pourtant multiplié par trois.

Exemple construit pour l’illustration, calculé à partir des pourcentages affichés.

Du rapport de cotes à la DMS

La conversion usuelle en méta-analyse est d ≈ ln(OR) / 1,81, proposée par Chinn. Elle suppose une variabilité comparable d’une étude à l’autre, condition presque jamais vérifiée explicitement.

La règle qui vaut pour les quatre. Une conversion ne crée aucune information. Un intervalle large avant conversion reste large après. Une valeur convertie est une valeur dérivée, jamais une valeur publiée : elle se signale comme telle, avec la formule employée.

06 Un cas travaillé, trois lectures

La méta-analyse en réseau de Cipriani et collaborateurs, publiée dans le Lancet en 2018, rassemble 522 essais et 116 477 participants sur 21 antidépresseurs dans l’épisode dépressif caractérisé de l’adulte. Le même jeu de données a été présenté publiquement de trois façons, toutes exactes, et qui ne laissent pas du tout la même impression.

0 0,2 0,5 0,8 1,0 Différence moyenne standardisée FAIBLE MOYEN IMPORTANT CONVENTIONS DE COHEN, 1988 0,875 seuil proposé, contesté 0,30 IC 95 % 0,26 à 0,34
Le losange porte l’estimation groupée, les moustaches son intervalle. Les repères de Cohen sont des conventions, le repère à 0,875 une proposition discutée : ni l’un ni l’autre n’est une donnée de l’étude.

Première lecture, en rapports de cotes

Tous les antidépresseurs testés ressortent supérieurs au placebo, avec des rapports de cotes allant de 2,13 (intervalle de crédibilité à 95 % : 1,89 à 2,41) pour l’amitriptyline à 1,37 (1,16 à 1,63) pour la réboxétine. Présentée comme ça, la conclusion se lit comme un doublement des chances de réponse.

Deuxième lecture, en différence standardisée

Une correspondance publiée dans le Lancet à propos de cet article situe la différence moyenne standardisée à 0,30 (intervalle de crédibilité à 95 % : 0,26 à 0,34). Sur l’échelle de Cohen, le même résultat devient un effet faible.

Troisième lecture, en points d’échelle

La même correspondance rappelle que le NICE avait antérieurement proposé, comme critère de pertinence clinique, une différence de 3 points sur la HAMD ou une DMS de 0,5. Ramenée en points, la différence observée se situe en deçà de ce repère.

Et le patient, dans tout ça

Leucht et collaborateurs ont relié les scores de HAMD-17 aux cotations d’impression clinique globale, par appariement de percentiles, sur 43 essais et 7 131 patients. Une cotation « nettement amélioré » correspond à une réduction du score comprise entre 50 et 60 %. Une cotation « aucun changement » correspond à une réduction pouvant aller jusqu’à 3 points. Moncrieff et Kirsch ont repris ces courbes et en ont tiré deux seuils : 3 points ne sont pas perçus par le clinicien, et il en faut 7, soit une taille d’effet de 0,875, pour correspondre à une amélioration jugée minimale.

Démontré La supériorité statistique de chacun des 21 antidépresseurs sur le placebo, avec les rapports de cotes et leurs intervalles, sur ce corpus d’essais.

Suggéré La correspondance entre variation de HAMD et perception clinique. La méthode est solide, mais elle repose sur une base d’essais d’une seule molécule et transpose une relation moyenne à des situations individuelles.

Opinion Le seuil de 7 points, ou de 0,875, comme critère de pertinence clinique. Il est contesté : Hieronymus et collaborateurs rappellent que les auteurs de l’analyse d’origine ne l’ont pas proposé, et qu’il transpose à une différence entre deux groupes un critère construit sur l’évolution d’un même patient.

En clair. Trois lectures, un seul jeu de données, aucune erreur de calcul. Ce qui change n’est pas la réalité mesurée, c’est l’unité choisie et le repère auquel on la compare. C’est exactement là qu’un article devient un titre de presse.

07 Six erreurs fréquentes

Prendre un petit p pour un grand effet

Un p très petit signale un effet mesuré avec précision, souvent parce que l’essai est grand. Il ne dit rien de sa taille. Chercher la taille d’effet d’abord.

Lire une DMS comme un pourcentage

Une DMS de 0,30 n’est pas 30 % d’amélioration. Ce n’est pas non plus 30 % de patients améliorés. C’est 0,30 écart type, et ça ne veut rien dire tant qu’on ne l’a pas reconverti en points d’échelle.

Traiter les seuils de Cohen comme des seuils cliniques

Ce sont des conventions statistiques empruntées à un autre champ, et présentées comme arbitraires par leur auteur. Les utiliser comme critère de décision médicale revient à importer une norme qui n’a pas été faite pour ça.

Comparer des DMS entre populations différentes

Le dénominateur change d’une étude à l’autre. Deux DMS ne se comparent que si les populations se ressemblent. Regarder les critères d’inclusion avant de comparer.

Confondre effet moyen et effet attendu chez votre patient

Une taille d’effet décrit un déplacement de population, pas une trajectoire individuelle. Un effet modeste en moyenne peut recouvrir une minorité de très bons répondeurs et une majorité sans bénéfice, ce qui est cliniquement tout autre chose. Les essais ne permettent presque jamais de trancher.

S’arrêter à l’intervalle de confiance dans une méta-analyse

L’intervalle de confiance porte sur la moyenne des études, l’intervalle de prédiction sur ce qu’on peut attendre de la prochaine. Quand les études sont hétérogènes, le second est bien plus large, et c’est lui qui décrit votre situation.

08 Dans les analyses PEB

Deux situations du corpus où la taille d’effet décidait de la lecture.

  • Augmentation par brexpiprazole. Le seuil de 0,20 sert à qualifier l’effet de faible. Il est conservé dans l’analyse, mais présenté explicitement comme une convention de Cohen et non comme un résultat de l’essai. Lire l’analyse
  • Condition cardio-respiratoire et risque psychiatrique. L’intervalle de confiance de l’estimation portant sur la démence paraissait rassurant. L’intervalle de prédiction, lui, s’étend de 0,07 à 9,12, ce qui vide l’estimation de sa portée clinique. Lire l’analyse

Ce que ça change lundi matin

  • Chercher la taille d’effet avant la valeur de p. Si l’article ne la donne pas, c’est déjà une information.
  • Ne jamais la lire sans son intervalle. Un d de 0,45 entre 0,05 et 0,85 et un d de 0,45 entre 0,38 et 0,52 ne racontent pas la même histoire.
  • Devant une DMS, regarder qui a été inclus. Une population étroite gonfle le chiffre sans rien changer pour le patient.
  • Devant un rapport de cotes, chercher le taux d’événements dans le bras contrôle. Sans lui, le rapport n’est pas interprétable.
  • Devant un NNT, vérifier dans quelle population il a été calculé avant de le transposer à votre file active.
  • Se méfier du mot « modéré » dans un résumé. Il désigne rarement une donnée, souvent un jugement, et jamais explicitement lequel des deux.

Références

  1. Cohen J. Statistical Power Analysis for the Behavioral Sciences. 2e éd. Hillsdale : Lawrence Erlbaum, 1988. Conventions et mise en garde de l’auteur, p. 12 et 13.
  2. Hedges LV, Olkin I. Statistical Methods for Meta-Analysis. Orlando : Academic Press, 1985. Correction du biais de petit échantillon.
  3. Chen H, Cohen P, Chen S. How big is a big odds ratio? Interpreting the magnitudes of odds ratios in epidemiological studies. Commun Stat Simul Comput. 2010;39(4):860-864. doi:10.1080/03610911003650383
  4. Chinn S. A simple method for converting an odds ratio to effect size for use in meta-analysis. Stat Med. 2000;19(22):3127-3131. PMID 11113947.
  5. Cipriani A, Furukawa TA, Salanti G, et al. Comparative efficacy and acceptability of 21 antidepressant drugs for the acute treatment of adults with major depressive disorder: a systematic review and network meta-analysis. Lancet. 2018;391(10128):1357-1366. doi:10.1016/S0140-6736(17)32802-7
  6. Correspondance à propos de Cipriani et al. Lancet. 2018. doi:10.1016/S0140-6736(18)31799-9. Source de la DMS de 0,30 et du rappel du critère NICE.
  7. Leucht S, Fennema H, Engel R, Kaspers-Janssen M, Lepping P, Szegedi A. What does the HAMD mean? J Affect Disord. 2013;148(2-3):243-248. doi:10.1016/j.jad.2012.12.001. PMID 23357658.
  8. Moncrieff J, Kirsch I. Empirically derived criteria cast doubt on the clinical significance of antidepressant-placebo differences. Contemp Clin Trials. 2015;43:60-62. doi:10.1016/j.cct.2015.05.005
  9. Hieronymus F, Jauhar S, Østergaard SD, Young AH. One (effect) size does not fit at all: interpreting clinical significance and effect sizes in depression treatment trials. J Psychopharmacol. 2020. doi:10.1177/0269881120922950

Psychiatry Evidence Base, la psychiatrie fondée sur les preuves, expliquée avec rigueur.