Centre de ressources · Comprendre
GRADE
Quatre niveaux, cinq raisons de descendre, trois de remonter, et une confusion qui traverse toute la littérature francophone. Voici ce que GRADE mesure, et surtout ce qu’il ne mesure pas.
← Comprendre·Centre de ressources
En une phrase. GRADE note la confiance qu’on peut avoir dans une estimation d’effet, pour un critère de jugement précis, sur l’ensemble des études disponibles. Pas la qualité d’un article. Pas l’importance du résultat.
01 Ce que GRADE note, et sur quoi
Une revue systématique compare un antipsychotique à un autre. Elle conclut à une meilleure efficacité sur les symptômes positifs, avec une prise de poids plus importante. Deux résultats, un seul article.
GRADE ne donne pas une note à cet article. Il en donne deux : une pour l’efficacité, une pour la prise de poids. Et il arrive souvent que la première soit modérée et la seconde très faible, parce que les essais mesurent bien ce qu’ils cherchent et mal ce qu’ils redoutent.
En clair. Un niveau GRADE se rattache toujours à un couple, une question et un critère de jugement. « Cette étude est GRADE modérée » est une phrase vide. « La certitude est modérée pour la réponse à huit semaines » est une phrase qui veut dire quelque chose.
Deuxième malentendu, plus discret. GRADE porte sur un corps de preuves, c’est-à-dire sur l’ensemble des études qui traitent la question. Devant un article isolé, il n’y a rien à graduer : on regarde son risque de biais avec l’outil adapté, et on situe son design dans la hiérarchie classique. C’est une erreur qu’on voit passer régulièrement, y compris sous la plume de comités qui devraient savoir.
02 Certitude et force, deux choses différentes
C’est la confusion la plus fréquente, et elle est structurante pour la lecture d’une recommandation. GRADE produit deux objets qui ne se déduisent pas l’un de l’autre.
| La certitude de la preuve | La force de la recommandation | |
|---|---|---|
| Répond à | À quel point suis-je sûr de l’ampleur de l’effet ? | Faut-il le faire, et avec quelle netteté ? |
| Échelle | Élevée, modérée, faible, très faible | Forte, ou conditionnelle |
| Se lit | Dans le tableau de synthèse, critère par critère | Dans le texte de la recommandation |
| Le vocabulaire | Aucun, c’est un niveau | « Nous recommandons » pour une forte, « nous suggérons » pour une conditionnelle |
| Dépend de | Uniquement des études | Des études, mais aussi de la balance bénéfices risques, des préférences des patients et des ressources |
Le vocabulaire n’est pas une coquetterie. Une recommandation forte veut dire que presque tous les patients correctement informés choisiraient cette option, et qu’on peut l’appliquer sans discussion approfondie. Une conditionnelle veut dire que le choix dépend de la personne en face, et qu’il faut en parler avec elle.
En clair. « Nous suggérons » n’est pas une formule de politesse. C’est une consigne : discutez-en avec le patient, parce que deux patients raisonnables peuvent choisir différemment. Quand vous lisez une recommandation, ce mot compte autant que la phrase entière.
03 Comment se construit un niveau
On entre dans l’échelle par le design, puis on monte ou on descend selon ce qu’on trouve. Les essais randomisés entrent en haut, les études observationnelles entrent en bas.
Un corps de preuves parti d’essais randomisés peut donc finir en certitude très faible : il suffit de deux domaines sérieusement compromis. Ça arrive plus souvent qu’on ne l’imagine en psychiatrie.
Les mots comptent, là aussi. Certitude élevée veut dire que l’effet réel est très probablement proche de ce qui est estimé. Certitude très faible veut dire qu’on ne sait à peu près rien de son ampleur. Aucun des deux ne dit que le traitement marche ou ne marche pas.
04 Les cinq raisons de descendre
1. Le risque de biais
Les études incluses sont-elles bien faites. C’est le domaine qui reprend le travail fait avec RoB 2 ou ROBINS-I sur chaque étude, puis le résume à l’échelle du corps de preuves. Une revue impeccable sur des essais douteux reste une revue sur des essais douteux.
2. L’incohérence
Les études ne disent pas la même chose. Quand les résultats partent dans des directions différentes sans qu’on sache pourquoi, la moyenne devient un artefact de calcul. C’est là que se lisent l’hétérogénéité et, quand elle est publiée, l’intervalle de prédiction.
3. Le caractère indirect
C’est le domaine le plus important en psychiatrie, et le moins discuté. Quatre décalages possibles : la population n’est pas la vôtre, l’intervention n’est pas celle que vous prescrivez, le comparateur n’est pas celui de votre pratique, ou le critère mesuré n’est pas celui qui compte.
Ce dernier cas mérite un nom : le critère de substitution. Un essai qui montre une amélioration d’un biomarqueur, d’un score d’échelle ou d’un taux plasmatique ne montre pas une amélioration de la vie du patient. Le lien entre les deux est une hypothèse, parfois solide, parfois pas.
Le test du caractère indirect, en trois questions
Devant un tableau de synthèse, demandez-vous : ces patients ressemblent-ils aux miens, ce traitement est-il celui que je prescris à cette dose, et ce qui a été mesuré est-il ce qui compte pour le patient ?
Une réponse négative sur l’une des trois suffit à faire descendre la certitude d’un niveau, et elle devrait faire descendre votre confiance d’autant.
4. L’imprécision
L’intervalle de confiance est-il assez étroit pour décider. Le critère n’est pas statistique, il est clinique : si un bout de l’intervalle conduit à prescrire et l’autre à s’abstenir, la preuve est imprécise, même quand le résultat est significatif.
Le nombre total de patients compte aussi. Un corps de preuves qui repose sur deux cents personnes reste imprécis, quelle que soit la beauté du calcul.
5. Le biais de publication
Manque-t-il des études. Ce domaine ne se juge pas sur les articles retenus mais sur ceux qu’on n’a pas trouvés, en comparant aux registres d’essais. Une revue qui ne s’en préoccupe pas laisse ce domaine dans le vide, et un vide n’est pas une absence de problème.
En clair. Biais, incohérence, indirect, imprécision, publication. Cinq portes de sortie vers le bas. Si vous voulez en retenir une seule pour la psychiatrie, retenez la troisième : c’est celle qui décide si l’étude parle de vos patients.
05 Les trois raisons de remonter
Elles ne valent que pour les études observationnelles, et elles servent rarement. Les conditions sont strictes, quoique parfaitement logiques.
- Un effet de très grande ampleur. Quand le risque est multiplié ou divisé par deux, et davantage encore au delà, aucun biais résiduel plausible n’explique un tel écart à lui seul.
- Un gradient dose réponse. Plus la dose est forte, plus l’effet est marqué. C’est un argument causal ancien, et il tient toujours.
- Des facteurs de confusion qui joueraient contre. Si tout ce qu’on n’a pas mesuré aurait dû réduire l’effet observé, et qu’on l’observe quand même, l’effet réel est probablement au moins aussi grand.
Ce dernier point est le plus élégant des trois. Le biais devient un argument en faveur de la conclusion, ce qui n’arrive à peu près jamais ailleurs en épidémiologie.
06 Un cas travaillé, les recommandations fortes sur preuve faible
GRADE déconseille les recommandations fortes quand la certitude est faible ou très faible. Le groupe a toutefois décrit cinq situations où ce mélange se justifie. Une équipe a regardé ce que ça donne en pratique.
Sur les recommandations nationales irlandaises utilisant GRADE, 202 recommandations ont été analysées. 151 sont fortes, soit près des trois quarts. Parmi ces 151, 55 reposent sur une certitude élevée ou modérée, et 96 sur une certitude faible ou très faible. Ces 96 sont dites discordantes.
Sur ces 96, les auteurs ont pu rattacher 55 à l’une des cinq situations prévues. Aucune n’était présentée comme telle dans le texte de la recommandation.
| Les cinq situations où une recommandation forte se justifie malgré une preuve faible |
|---|
| Situation vitale ou catastrophique |
| Bénéfice incertain, effet indésirable certain |
| Bénéfices possiblement équivalents, une option nettement moins risquée ou moins coûteuse |
| Bénéfices équivalents établis, une option potentiellement plus risquée ou plus coûteuse |
| Risque de dommage catastrophique |
Démontré La fréquence des recommandations fortes fondées sur une preuve faible dans ce corpus, et l’absence de justification explicite par une situation paradigmatique.
Suggéré Que le phénomène dépasse ce corpus. Un travail comparable sur une base de recommandations très utilisée retrouvait 349 recommandations fortes discordantes, dont 58,5 % jugées conformes aux situations prévues et 41,5 % non conformes.
Opinion Le classement rétrospectif de chaque recommandation dans l’une des cinq situations. Ce sont des jugements portés après coup par les auteurs, sur des textes qui ne disaient pas leur raisonnement.
En clair. Quand vous lisez « nous recommandons » suivi de « certitude faible », ce n’est pas forcément une erreur. Mais la recommandation devrait dire pourquoi, et la plupart du temps elle ne le dit pas. À ce moment-là, vous êtes en droit de la lire comme une opinion d’experts habillée en recommandation forte.
07 Ce que GRADE ne fait pas
- Il ne dit pas si le traitement marche. Une certitude très faible n’est pas un résultat négatif. C’est une absence de savoir sur l’ampleur, ce qui est très différent, et beaucoup moins confortable.
- Il ne dit pas si le bénéfice vaut quelque chose. L’ampleur relève des tailles d’effet. La certitude porte sur la fiabilité de l’estimation, pas sur sa valeur clinique.
- Il ne s’applique pas tel quel aux méta-analyses en réseau. Les comparaisons indirectes demandent une adaptation, connue sous le nom de CINeMA, avec des domaines propres.
- Il ne supprime pas le jugement. Décider qu’un problème est sérieux ou très sérieux reste une appréciation humaine. Deux équipes appliquant GRADE au même corpus ne rendent pas toujours le même niveau.
Ce dernier point n’est pas une faiblesse cachée, c’est le principe même de la méthode. GRADE ne prétend pas mesurer, il prétend rendre le raisonnement visible. Les notes de bas de tableau, qui expliquent chaque déclassement, valent souvent mieux que le niveau lui-même : c’est là qu’on voit si le jugement tient.
08 Cinq erreurs fréquentes
Appliquer GRADE à un article isolé
GRADE gradue un corps de preuves pour un critère donné. Devant une publication unique, on utilise l’outil de risque de biais adapté et la hiérarchie de design, pas GRADE.
Lire « certitude très faible » comme « ça ne marche pas »
C’est une absence de connaissance sur l’ampleur de l’effet, dans les deux sens. Le traitement peut très bien être efficace, on n’en sait rien.
Confondre le niveau de certitude et la force de la recommandation
Quatre niveaux d’un côté, deux forces de l’autre, et aucune correspondance automatique. Une recommandation forte peut reposer sur une preuve faible, à condition qu’elle dise pourquoi.
Ne retenir qu’un niveau pour toute la revue
Une revue produit autant de niveaux que de critères de jugement. Celui de l’efficacité et celui de la tolérance sont rarement les mêmes, et le second est souvent le plus bas.
Sauter les notes de bas de tableau
Elles portent la justification de chaque déclassement. Sans elles, le niveau est une lettre sans raisonnement, et rien ne permet de vérifier s’il est défendable.
09 Dans les analyses PEB
Deux situations du corpus où un domaine GRADE décidait de la lecture.
- Condition cardio-respiratoire et risque psychiatrique. Domaine imprécision. L’intervalle de confiance de l’estimation portant sur la démence paraissait rassurant, alors que l’intervalle de prédiction s’étend de 0,07 à 9,12. Un intervalle pareil ne permet aucune décision, et il ne se voit pas si on s’arrête à la première colonne. Lire l’analyse
- Varénicline et bupropion dans le trouble de l’usage d’alcool. Domaine caractère indirect. L’un des deux critères principaux est un biomarqueur sanguin, le phosphatidyléthanol. C’est un marqueur d’exposition à l’alcool, pas une mesure de ce qui change dans la vie du patient. La preuve est solide sur ce qu’elle mesure, et indirecte sur ce qui nous intéresse. Lire l’analyse
Ce que ça change lundi matin
- Devant une recommandation, chercher deux choses et pas une : le niveau de certitude et la force. Elles sont écrites à deux endroits différents.
- Repérer le verbe. « Nous recommandons » se suit, « nous suggérons » se discute avec le patient.
- Devant une recommandation forte appuyée sur une preuve faible, chercher la justification. Son absence est une information.
- Dans un tableau de synthèse, lire la ligne de la tolérance autant que celle de l’efficacité. Les deux niveaux diffèrent presque toujours.
- Se poser les trois questions du caractère indirect avant toutes les autres : mes patients, ma prescription, ce qui compte pour eux.
- Lire les notes de bas de tableau. C’est le seul endroit où le raisonnement est visible.
Références
- Guyatt GH, Oxman AD, Vist GE, et al. GRADE: an emerging consensus on rating quality of evidence and strength of recommendations. BMJ. 2008;336(7650):924-926. doi:10.1136/bmj.39489.470347.AD
- Guyatt G, Oxman AD, Akl EA, et al. GRADE guidelines: 1. Introduction, GRADE evidence profiles and summary of findings tables. J Clin Epidemiol. 2011;64(4):383-394. doi:10.1016/j.jclinepi.2010.04.026
- Andrews JC, Schünemann HJ, Oxman AD, et al. GRADE guidelines: 15. Going from evidence to recommendation, determinants of a recommendation’s direction and strength. J Clin Epidemiol. 2013;66(7):726-735. doi:10.1016/j.jclinepi.2013.02.003
- Chong MC, Sharp MK, Smith SM, et al. Strong recommendations from low certainty evidence: a cross-sectional analysis of a suite of national guidelines. BMC Med Res Methodol. 2023;23(1):68. doi:10.1186/s12874-023-01895-8
- Agoritsas T, Merglen A, Heen AF, et al. UpToDate adherence to GRADE criteria for strong recommendations: an analytical survey. BMJ Open. 2017;7(11):e018593. doi:10.1136/bmjopen-2017-018593
- Schünemann H, Brożek J, Guyatt G, Oxman A, éd. GRADE Handbook. GRADE Working Group, 2013, mis à jour depuis. Disponible en accès libre.
Psychiatry Evidence Base, la psychiatrie fondée sur les preuves, expliquée avec rigueur.
