Publié le 13 août 2026, mis à jour le 16 septembre 2026

Analyse · Toutes pathologies · Méthodologie

Recommandations psychiatriques : 11,6 % de niveau de preuve élevé, faut-il pour autant s’en défier ?

▤ Dossier BMJ Mental Health · 2026 · 29(1):e302194 · Rømer et al. DOI 10.1136/bmjment-2025-302194 PMID 41806975 Scientifique 70 Éditorial 89

L’essentiel

Une revue systématique publiée dans BMJ Mental Health a repris 545 recommandations, extraites de 24 documents publiés entre 2014 et 2024 par quatre organismes émetteurs, l’American Psychiatric Association, l’European Psychiatric Association, la World Federation of Societies for Biological Psychiatry et l’Organisation mondiale de la santé. Pour chaque recommandation, les auteurs ont relevé deux choses distinctes : le niveau de preuve tel que les rédacteurs de la recommandation l’avaient eux mêmes attribué, harmonisé dans le vocabulaire GRADE, et la classe de l’étude du plus haut niveau réellement citée à l’appui. Les deux relevés divergent, et c’est le résultat central : 63 recommandations, soit 11,6 %, sont jugées de niveau élevé par leurs propres rédacteurs, alors que 241, soit 44,2 %, citent au moins deux essais randomisés ou une méta-analyse de ceux ci. Autrement dit, les rédacteurs de recommandations dégradent massivement la preuve issue des essais dont ils disposent. Aucune tendance significative n’est mise en évidence sur la période de dix ans (p = 0,07). Ce travail décrit l’état des preuves citées, il ne juge pas la justesse clinique des recommandations, et les auteurs le disent eux mêmes.

Le contexte

Une recommandation de bonne pratique fonctionne, en consultation, comme un raccourci de confiance. Elle condense un corpus qu’aucun clinicien ne peut lire intégralement, et elle sert d’appui quand la décision est discutée, devant le patient, devant un confrère ou devant un tiers. Sa force tient à cette économie : on suit la ligne sans redémontrer ce qui la fonde.

Le prix de ce raccourci est qu’il rend invisible la solidité de ce qui est condensé. Deux recommandations rédigées dans le même document, avec la même autorité typographique, peuvent reposer l’une sur plusieurs essais randomisés concordants, l’autre sur une série de cas et un consensus d’experts. Le lecteur pressé ne fait pas la différence, d’autant que les organismes n’affichent pas tous leur niveau de preuve avec la même clarté, ni selon la même grille.

La question posée par ce travail n’est donc pas clinique mais épistémique : quand nous appliquons une recommandation, sur quoi marchons nous exactement ? Elle mérite d’être posée parce que la réponse ne change pas la conduite dans la majorité des cas, mais qu’elle change la manière de la défendre et de la discuter dans les cas où l’incertitude compte.

Ce que mesure GRADE

Certitude de la preuve et force de la recommandation sont deux axes distincts

Rappel méthodologique, hors du champ de cette étude. GRADE ne note pas la qualité d’une recommandation. Il note la certitude que l’on peut accorder à l’estimation d’effet qui la soutient, en quatre niveaux, élevé, modéré, faible, très faible. Cette certitude se dégrade avec le risque de biais des études, l’imprécision des estimations, l’hétérogénéité, le caractère indirect des comparaisons et le risque de biais de publication.

La force de la recommandation, elle, relève d’un second jugement, qui intègre la balance bénéfice risque, les valeurs et préférences des patients, la faisabilité et le coût. Une recommandation forte adossée à une certitude faible est parfaitement cohérente dans le cadre GRADE : c’est le cas typique d’une conduite dont personne ne fera jamais l’essai randomisé, soit parce qu’il serait considéré comme non éthique, soit parce que l’événement à prévenir est trop rare pour être étudié avec une puissance suffisante.

Deux précisions s’imposent sur l’usage qui est fait de cette grille ici. D’abord, les auteurs de la revue n’ont pas noté eux mêmes les recommandations : ils ont relevé la note que chaque organisme avait déjà attribuée, puis ont traduit les échelles hétérogènes des différents organismes dans le vocabulaire commun de GRADE. Ensuite, le second axe a bien été mesuré : la force déclarée de chaque recommandation, forte ou faible, a été enregistrée et croisée avec le niveau de preuve. Le croisement est éloquent. Parmi les recommandations fortes, 22,9 % reposent sur un niveau élevé et 45,0 % sur un niveau modéré, contre 0,4 % et 15,5 % parmi les recommandations faibles. Et 44 des 249 recommandations fortes, soit 17,7 %, ne citent à l’appui que des cas ou un avis d’expert.

L’étude en un coup d’œil

Revue systématique avec synthèse quantitative, protocole pré enregistré
Population
CorpusRecommandations publiées de 2014 à 2024 par quatre organismes pré sélectionnés : American Psychiatric Association, European Psychiatric Association, World Federation of Societies for Biological Psychiatry et Organisation mondiale de la santé. Recherche sur les sites des quatre organismes le 15 juillet 2024, actualisée le 22 juin 2025. Aucune pathologie n’est ciblée en particulier : l’objet est la littérature de recommandation elle même, avec stratification secondaire par groupe diagnostique.
Intervention
ProcédurePour chaque recommandation, relevé de la force déclarée, forte ou faible, et du niveau de preuve attribué par les rédacteurs de la recommandation eux mêmes, harmonisé dans le vocabulaire GRADE. Relevé séparé de l’étude du plus haut niveau citée à l’appui, classée selon la nomenclature ACC/AHA, avec son aveugle et son comparateur. Extraction par un relecteur, validation intégrale par un second, arbitrage par un troisième en cas de désaccord. Aucune statistique d’accord inter évaluateurs n’est rapportée dans la publication.
Comparaison
AxesRépartition par organisme émetteur, par type de recommandation, par groupe diagnostique et par année de publication. Comparaison pré spécifiée avec des travaux équivalents conduits dans d’autres spécialités. Deux analyses de sensibilité, l’une restreinte aux documents les plus rigoureux, l’autre aux cinq dernières années.
Critère de jugement
MesureDeux mesures distinctes. Proportion de recommandations classées en niveau élevé, modéré, faible ou très faible selon l’appréciation des rédacteurs. Proportion citant une preuve de classe A, B ou C, la classe A désignant au moins deux essais randomisés ou une méta-analyse de ceux ci, la classe B un essai unique ou des études observationnelles, la classe C des cas ou un avis d’expert.
Effectif analysé
Volume82 documents examinés, 24 inclus, 545 recommandations extraites. Le principal motif d’exclusion est l’absence de mise à jour depuis plus de dix ans, qui écarte 29 documents, soit 35 % des documents examinés.
Design et niveau de preuve
DesignRevue systématique de recommandations avec synthèse quantitative, relevant de la méta épistémologie. Aucun niveau CEBM n’est applicable ni mentionné : l’échelle CEBM porte sur des questions cliniques, non sur un corpus de recommandations. La qualité des 24 documents inclus est appréciée au moyen d’AGREE II, domaine 3, « rigueur d’élaboration », par un seul relecteur ; 6 documents sur 24 atteignent un score d’au moins 70 %.

Le contrôle de qualité

Point de contrôleJugement
Étendue du corpusPré sélectionné, non exhaustif
Constat545 recommandations sur dix ans, pour les quatre organismes émetteurs les plus influents. Le corpus n’est pas pour autant exhaustif, et les auteurs le disent : seuls les documents en anglais, graduant explicitement le niveau de preuve et citant la preuve recommandation par recommandation, ont pu être retenus. Le NICE est exclu pour cette raison. Les recommandations des pays à revenu faible ou intermédiaire n’ont pas été consultées, en raison de la barrière de la langue. Les auteurs écrivent que leurs résultats peuvent ne pas se généraliser à d’autres régions ni à d’autres sous champs.
Enregistrement préalableProtocole déposé avant extraction
ConstatLe protocole a été enregistré sur l’Open Science Framework avant le début de l’extraction, et les données ainsi que le code d’analyse y sont déposés. La comparaison avec les autres spécialités était pré spécifiée. C’est le point fort méthodologique le plus net du travail.
Conduite de la revuePRISMA annoncé
ConstatLe diagramme de flux et la liste de contrôle PRISMA sont annoncés dans le matériel supplémentaire, que nous n’avons pas pu consulter. Nous ne pouvons donc pas vérifier la complétude de cette liste par nous mêmes.
Extraction des donnéesUn seul extracteur
ConstatL’extraction a été faite par un relecteur unique, l’ensemble des données extraites ayant été validé par un second relecteur, un troisième auteur intervenant en cas de désaccord. Aucune statistique d’accord inter évaluateurs n’est rapportée, et l’on ne peut donc pas quantifier la part de jugement dans le classement par type de recommandation et par groupe diagnostique. L’appréciation AGREE II, elle, repose sur un relecteur unique sans validation annoncée.
Origine du niveau de preuveNote des rédacteurs, non des évaluateurs
ConstatPoint à ne pas confondre. Le niveau de preuve analysé n’a pas été attribué après coup par l’équipe danoise : c’est celui que chaque organisme avait lui même publié, condition d’inclusion du document. Le travail des auteurs a consisté à traduire des échelles hétérogènes dans un vocabulaire commun. La marge d’interprétation porte donc sur cette traduction, non sur une notation de substitution. Les auteurs signalent en contrepartie que l’appréciation des rédacteurs peut être influencée par leurs croyances préalables et leurs liens d’intérêts, ce qui est précisément la raison pour laquelle ils y ont adjoint le relevé indépendant des études citées.
Financement et liens d’intérêtsAucun lien avec les organismes évalués
ConstatÉquipe du Copenhagen Research Center for Biological and Precision Psychiatry et de l’université de Copenhague, sans lien avec les quatre organismes analysés. Aucun financement spécifique n’a été déclaré pour ce travail. Hors du travail soumis, l’auteur senior déclare être investigateur principal sur des financements du Conseil européen de la recherche, de la Région Capitale du Danemark, des services de santé mentale de cette même région, de la Fondation Lundbeck et de la Fondation Novo Nordisk ; le premier auteur déclare un financement de la Fondation Novo Nordisk. Ces deux dernières sont des fondations adossées à des groupes pharmaceutiques : le lien est indirect et hors sujet ici, il mérite d’être connu du lecteur.

Les résultats

11,6 %
des 545 recommandations analysées sont jugées de niveau de preuve élevé par leurs propres rédacteurs, soit 63 recommandations. Dans le même temps, 241 recommandations, soit 44,2 %, citent au moins deux essais randomisés ou une méta-analyse de ceux ci. Cet écart est le résultat central du travail.
RésultatValeur rapportée
Répartition par niveau de preuve, ensemble du corpusÉlevé 63 (11,6 %), modéré 165 (30,3 %), faible 128 (23,5 %), très faible 189 (34,7 %)
LectureUn peu plus d’un tiers du corpus relève du niveau le plus bas de l’échelle. Ces quatre valeurs sont celles attribuées par les rédacteurs des recommandations, traduites dans le vocabulaire GRADE.
Classe de la meilleure étude citéeClasse A 241 (44,2 %), classe B 167 (30,6 %), classe C 137 (25,1 %)
LectureLe détail de la classe A est de 155 recommandations (28,4 %) citant une méta-analyse d’essais randomisés et 86 (15,8 %) citant au moins deux essais. C’est ici que se loge l’écart : 44,2 % du corpus s’appuie sur ce que la nomenclature considère comme la preuve la plus forte, mais 11,6 % seulement en tirent un niveau de certitude élevé. Les auteurs y voient une dégradation, par les rédacteurs, de la preuve issue des essais dont ils disposaient.
Part de niveau très faible, par organismeAPA 65 (59,6 %), WFSBP 90 (36,7 %), OMS 12 (19,7 %), EPA 22 (16,9 %)
LectureL’American Psychiatric Association affiche la proportion la plus élevée de niveaux très faibles. Aucun test statistique ne compare les organismes entre eux, et ce classement est donc descriptif. L’indicateur mis en avant par les auteurs est d’ailleurs l’autre extrémité de l’échelle : la part de niveau élevé va de 20,0 % pour l’European Psychiatric Association à 1,6 % pour l’Organisation mondiale de la santé.
Évolution de 2014 à 2024Aucune tendance significative, p = 0,07
LectureLa proportion de recommandations de niveau élevé ou modéré ne montre pas de tendance significative sur la période, une régression logistique sur l’année de publication donnant p = 0,07. Ni amélioration démontrée, ni dégradation démontrée. Une analyse de sensibilité restreinte aux documents publiés de 2019 à 2024 retrouve une proportion voisine, 30 recommandations sur 311, soit 9,6 %.
Écarts par type de recommandationDe 14,6 % pour les traitements pharmacologiques à 0 % pour l’évaluation somatique
Lecture41 recommandations sur 281 concernant la pharmacothérapie sont de niveau élevé, contre 1 sur 46 pour l’organisation des soins et 0 sur 13 pour l’évaluation somatique des patients atteints de troubles mentaux sévères. Certains domaines comptent moins de dix recommandations au total, information du patient, prévention, arrêt du traitement, objectifs thérapeutiques, et ne supportent aucune interprétation fine.
Analyse post hoc des meilleures recommandations8 méta-analyses sur 25, soit 1,5 % du corpus
Lecture25 recommandations cumulent un niveau élevé et la citation d’au moins une méta-analyse. Parmi les méta-analyses citées, 8 seulement fournissent une estimation d’effet reposant exclusivement sur des essais en double aveugle avec comparateur adéquat, soit 1,5 % des 545 recommandations, et toutes portent sur la pharmacothérapie. À l’inverse, 11 sur 25 ne reposent que sur des essais sans double aveugle et sans comparateur comparable. Analyse post hoc, à traiter comme génératrice d’hypothèses.
Précision statistiqueEffectifs et proportions, sans intervalle de confiance
LectureLa publication rapporte des effectifs et des pourcentages. Aucun intervalle de confiance n’est fourni, et le seul test inférentiel est la régression logistique sur l’année de publication. Il n’est donc pas possible de dire si les écarts entre organismes ou entre types de recommandation dépassent la fluctuation d’échantillonnage.

Lecture critique

DomaineRisque
Harmonisation des échellesTraduction non quantifiée
ConstatC’est le point qui pèse le plus lourd. Les quatre organismes n’emploient pas la même grille, et les auteurs ont dû ramener ces grilles à un vocabulaire commun. Cette opération de traduction comporte une part de jugement qui n’est pas chiffrée : aucune statistique d’accord entre relecteurs n’accompagne le travail, et les tableaux de correspondance figurent dans le matériel supplémentaire, que nous n’avons pas pu consulter. Toute comparaison entre organismes dépend directement de la validité de cette traduction.
Ce que mesure vraiment le niveau élevéNote déclarative, non auditée
ConstatLe chiffre de 11,6 % ne dit pas que 11,6 % des recommandations sont bien étayées. Il dit que leurs rédacteurs les ont déclarées telles. Les auteurs signalent que cette appréciation peut être influencée par les croyances préalables et les liens d’intérêts des rédacteurs, ce qui joue dans les deux sens : un organisme scrupuleux dans l’affichage de ses incertitudes se pénalise lui même dans ce type de dénombrement. C’est exactement pourquoi le relevé indépendant des études citées est le contrepoids utile du travail.
Une seule étude retenue par recommandationReconnu par les auteurs
ConstatLe classement ACC/AHA ne retient que l’étude du plus haut niveau citée. Les auteurs reconnaissent que ce choix ignore la masse de preuves réellement mobilisée, qui peut être ailleurs, dans des études observationnelles nombreuses par exemple. Ils n’ont pas non plus évalué si les études citées soutenaient effectivement la recommandation, ni la qualité de chacune d’elles.
Sélection des documentsRestreinte par construction
ConstatIl fallait, pour entrer dans le corpus, que le document gradue son niveau de preuve recommandation par recommandation. Ce critère est indispensable au projet, mais il écarte des textes influents, le NICE au premier chef, et il sélectionne les organismes qui affichent déjà leurs incertitudes. La langue anglaise comme critère écarte l’ensemble des recommandations nationales non anglophones.
Financement et liens d’intérêtsDéclarés, sans lien avec les évalués
ConstatAucun financement spécifique pour ce travail, aucun lien avec les organismes analysés, déclaration ICMJE complète mentionnant des financements de recherche hors sujet, dont deux fondations adossées à l’industrie pharmaceutique. Configuration attendue et correctement documentée.
Adéquation entre revendication et preuveConclusions calibrées
ConstatLes auteurs écrivent explicitement que conclure que 11,6 % des recommandations reposent sur une preuve de haut niveau ne revient pas à dire que 11,6 % des décisions cliniques reposent sur une preuve de haut niveau, puisque les recommandations ne sont ni toujours suivies ni d’impact égal. Ils rappellent aussi que les comparaisons avec les autres spécialités, où les valeurs vont de 5 % à 23 %, reposent sur des méthodologies différentes et ne doivent pas être surinterprétées. Cette retenue mérite d’être soulignée, car c’est exactement là que la reprise médiatique dérape habituellement.
Transposition au corpus françaisNon évaluée
ConstatLes recommandations de la Haute Autorité de santé, que le psychiatre français utilise au quotidien, ne font pas partie du corpus analysé. Ce travail ne dit donc rien de leur niveau de preuve, ni dans un sens ni dans l’autre, et une extrapolation serait ici une opinion, pas un résultat.
Ce que le devis ne permet pasAucune inférence causale
ConstatLe travail est descriptif. Les auteurs écrivent que la raison de la dégradation de la preuve n’est pas directement abordée par leur étude. Ils avancent des explications plausibles, essais indirects, questions cliniquement peu pertinentes, résultats discordants, puissance insuffisante, levée de l’aveugle, données manquantes, critères de substitution, biais de publication, mais ces explications sont des hypothèses, pas des résultats.

Niveau de preuve

Scientifique70 / 100
Éditorial89 / 100

Ce qui est démontré, au sens d’un dénombrement reproductible sur un corpus défini et un protocole déposé avant l’extraction : la part de recommandations déclarées de niveau élevé par leurs rédacteurs est de 11,6 %, la part citant au moins deux essais randomisés est de 44,2 %, et l’écart entre ces deux valeurs est massif. Le dénombrement est indépendant des organismes évalués, publié dans une revue à comité de lecture, données et code déposés publiquement.

Ce qui est suggéré, et non démontré : que cet écart traduise une dégradation de la preuve par les rédacteurs plutôt qu’un artefact de la traduction entre échelles hétérogènes. La distinction n’est pas académique, puisque aucune statistique de reproductibilité n’accompagne cette traduction. Est également suggéré, sans être testé, le classement relatif des organismes : aucun test ne compare les publieurs, aucun intervalle de confiance n’est fourni, et qu’un organisme affiche la part la plus élevée de niveaux très faibles peut refléter sa rigueur d’affichage autant que la faiblesse de ses fondements.

Ce qui n’est pas établi, et qu’il faut se garder de lire dans ce travail : une évolution de la période. Aucune tendance significative n’est mise en évidence, p = 0,07. Ni progrès, ni recul.

Reste ce qui relève de l’opinion d’expert, et qui doit être identifié comme tel. Les auteurs recommandent une approche partagée de l’appréciation de la preuve entre organismes, un engagement à mettre à jour les documents en années plutôt qu’en décennies, et un financement prioritaire des essais dans les domaines sous documentés, organisation des soins et comorbidités somatiques. Ce sont des positions défendables, elles ne sont pas des résultats de l’étude.

Le test du confrère

Ce que dirait un confrère expérimenté à qui l’on présente cette étude en deux minutes, entre deux consultations.

« Lundi matin, je lis les recommandations autrement. Le plus troublant, ce n’est pas que 11,6 % soient de haut niveau, c’est que presque quatre fois plus citent des essais randomisés. Ça veut dire que les rédacteurs eux mêmes ne croient pas beaucoup aux essais qu’ils citent. Ça ne veut pas dire que je vais arrêter de suivre les recommandations, ça veut dire que je sais où je marche sur du ferme et où je marche sur du mou. Et franchement, sur certaines questions, personne ne fera jamais l’essai qui manque. »

Traduction pour la pratique : le niveau de preuve n’est pas une note attribuée à la recommandation, c’est une information sur la solidité de ce qui la soutient. Il sert à calibrer le discours, pas à trier entre bonnes et mauvaises recommandations.

Ce que vous pouvez en faire

  • Prendre l’habitude de lire, à côté de chaque recommandation, le niveau de preuve annoncé et non seulement la force de la formulation. Sur la plupart des textes cette information existe, elle est simplement reléguée en petits caractères ou en annexe.
  • Distinguer systématiquement deux questions : quelle est la certitude de la preuve, et quelle est la force de la recommandation. Le corpus analysé montre que 17,7 % des recommandations fortes ne citent à l’appui que des cas ou un avis d’expert.
  • Regarder aussi ce qui est cité. Une recommandation qui renvoie à une méta-analyse d’essais randomisés n’a pas le même appui qu’une recommandation qui renvoie à une série de cas, même quand les deux portent la même couleur dans le tableau récapitulatif.
  • Devant une recommandation de faible certitude, expliciter cette incertitude dans la décision partagée et la tracer dans le dossier. C’est la situation où l’alternative se discute réellement avec le patient, et où la préférence exprimée pèse le plus.
  • Se méfier des domaines peu documentés plutôt que des organismes. L’évaluation somatique des patients atteints de troubles mentaux sévères ne compte aucune recommandation de niveau élevé sur les treize identifiées, et l’organisation des soins une seule sur quarante six.
  • Ne pas transposer ce résultat aux recommandations de la Haute Autorité de santé, qui ne sont pas dans le corpus analysé. Le réflexe de lecture est transposable, le chiffre ne l’est pas.
  • Résister à la formule qui circulera : un niveau de preuve faible ne rend pas une recommandation mauvaise. Il indique que l’on avance avec moins de marge d’erreur documentée, ce qui n’est pas la même chose.

Questions fréquentes

Un niveau de preuve GRADE faible signifie-t-il que la recommandation est mauvaise ?

Non, et c’est la confusion principale à éviter. GRADE qualifie la certitude de l’estimation d’effet, pas la justesse de la conduite recommandée. Une recommandation peut être forte, juste et unanimement suivie tout en reposant sur une certitude très faible, simplement parce que l’essai randomisé qui la démontrerait ne sera jamais réalisé, pour des raisons éthiques ou de puissance. Les auteurs rappellent d’ailleurs qu’un essai n’est pas toujours nécessaire ni pertinent, notamment quand l’intervention relève d’un droit fondamental comme le logement ou l’accès aux soins. Un niveau bas est une information sur l’état de la littérature citée, pas un verdict sur la recommandation.

Qui a attribué les niveaux de preuve analysés dans ce travail ?

Les rédacteurs des recommandations eux mêmes. C’est un point souvent mal compris. Le fait qu’un document gradue explicitement chacune de ses recommandations était une condition pour entrer dans le corpus. Les auteurs de la revue ont relevé ces notes, puis les ont traduites dans le vocabulaire GRADE parce que les quatre organismes n’utilisent pas la même échelle. Ils y ont ajouté, indépendamment, le relevé de l’étude du plus haut niveau citée à l’appui de chaque recommandation. Ce sont ces deux mesures qui divergent.

Une preuve de classe A équivaut-elle à un niveau de preuve GRADE élevé ?

Non, et c’est précisément le résultat de l’étude. Dans la nomenclature employée ici, empruntée aux sociétés américaines de cardiologie, la classe A désigne un niveau de preuve, celui d’au moins deux essais randomisés ou d’une méta-analyse de ceux ci. Elle ne désigne pas la force de la recommandation, qui relève dans ce système d’une numérotation distincte. Or 44,2 % des recommandations citent une preuve de classe A quand 11,6 % seulement sont déclarées de niveau élevé. Lire une classe A comme la garantie d’une certitude élevée est une erreur de traduction entre deux grilles.

Ce résultat s’applique-t-il aux recommandations françaises ?

Le corpus analysé se limite à quatre organismes, l’American Psychiatric Association, l’European Psychiatric Association, la World Federation of Societies for Biological Psychiatry et l’Organisation mondiale de la santé. Les recommandations de la Haute Autorité de santé n’y figurent pas. Nous ne savons donc pas ce que donnerait la même analyse appliquée au corpus français, et l’affirmer dans un sens comme dans l’autre relèverait de la conjecture.

Faut-il en conclure qu’il ne faut plus suivre les recommandations ?

Non, et les auteurs eux mêmes ne le concluent pas. Une recommandation reste, pour le clinicien isolé, la meilleure synthèse disponible d’une littérature qu’il ne peut pas lire en entier. Ce travail invite à la lire avec son niveau de preuve, pas à s’en passer. L’alternative à une recommandation faiblement étayée n’est pas l’absence de recommandation, c’est le jugement individuel, dont la certitude n’est pas mieux documentée.

Quelle est la limite principale de ce travail ?

Elle tient à l’harmonisation des échelles. Les quatre organismes n’emploient pas la même grille de notation, et les auteurs ont dû les ramener à un vocabulaire commun pour pouvoir les comparer. Cette opération comporte une part de jugement qui n’est chiffrée nulle part, faute de statistique d’accord entre relecteurs, et l’extraction a d’ailleurs reposé sur un seul relecteur, validé par un second. S’y ajoute que le relevé de l’étude citée ne retient que la référence du plus haut niveau, ce qui ignore la masse de preuves réellement mobilisée, limite que les auteurs reconnaissent explicitement.

Bibliographie

Rømer TB, Andersson SN, Benros ME. Levels of evidence supporting American, European and international guidelines in psychiatry, 2014-2024: a systematic review with quantitative synthesis. BMJ Mental Health, 2026, volume 29, numéro 1, article e302194. DOI 10.1136/bmjment-2025-302194. PMID 41806975.
Revue systématique avec synthèse quantitative portant sur 545 recommandations extraites de 24 documents publiés de 2014 à 2024 par quatre organismes internationaux, avec relevé du niveau de preuve déclaré par les rédacteurs, harmonisé dans le vocabulaire GRADE, et relevé indépendant de l’étude du plus haut niveau citée. Protocole pré enregistré, données et code déposés sur l’Open Science Framework. Apport : un dénombrement indépendant sur un objet rarement quantifié, et la mise en évidence d’un écart entre la preuve citée et la certitude déclarée. Limite : l’harmonisation d’échelles hétérogènes n’est accompagnée d’aucune statistique de reproductibilité, et un seul relecteur a réalisé l’extraction.

Ce qui a été consulté. Chiffres, méthode et références vérifiés par double lecture indépendante sur le texte intégral de la version publiée, consulté le 13 août 2026, ainsi que sur la notice bibliographique de PubMed pour les identifiants, les affiliations, la déclaration de financement et la déclaration de liens d’intérêts. Le matériel supplémentaire de la publication, un fichier unique contenant les tableaux S1 à S11 et les figures S1 et S2, n’a pas pu être consulté : il n’était pas fourni et n’a pas pu être récupéré depuis l’éditeur. Les éléments qui n’existent que dans ce matériel, notamment les tableaux de correspondance entre les échelles des quatre organismes, le diagramme de flux PRISMA et le détail des analyses de sensibilité, ne sont donc rapportés ici que d’après ce qu’en dit le texte principal, et cela est signalé à chaque fois. Aucun intervalle de confiance, aucune statistique d’accord inter évaluateurs et aucun niveau CEBM ne figurent dans la publication : ils ne figurent pas non plus dans cette analyse.

Collections éditoriales

Étiquettes

Vérification effectuée le 13 août 2026 sur le texte intégral de la publication et sur son matériel supplémentaire lorsque celui-ci est disponible. Cette analyse a fait l’objet d’une double lecture indépendante. Comment nous vérifions ce que nous publions.
Cette analyse est destinée aux professionnels de santé. Elle ne constitue ni une recommandation de prescription, ni un avis médical individuel, et ne se substitue pas à l’évaluation clinique ni aux recommandations en vigueur.
Psychiatry Evidence Base, la psychiatrie fondée sur les preuves, expliquée avec rigueur.

Signaler une erreur dans cette analyse

Suivre le Dr Stroescu sur LinkedIn, pour la revue chaque samedi

Publications similaires