Publié le 13 août 2026, mis à jour le 14 septembre 2026
Ajouter un outil diagnostique standardisé au parcours pédopsychiatrique fait-il poser davantage de diagnostics ?
L’essentiel
Mille deux cent vingt-cinq enfants et adolescents de 5 à 17 ans, adressés en routine à huit établissements du service public de santé anglais pour des difficultés émotionnelles, ont été randomisés entre les soins usuels et les soins usuels complétés par un questionnaire diagnostique structuré renseigné en ligne par la famille ou par le jeune, dont le rapport de synthèse était versé au dossier du service. À douze mois, la proportion d’enfants ayant reçu un diagnostic de trouble émotionnel inscrit au dossier est de 11 % contre 12 %, rapport de risque ajusté 0,94, intervalle de confiance à 95 % de 0,70 à 1,28. Les auteurs ne mettent en évidence de différence sur aucun critère secondaire, et aucune analyse ne démontre la coût-efficacité de l’intervention. L’évaluation qualitative propose une explication : le rapport n’a pas été utilisé de façon constante par les cliniciens lors des évaluations, contrairement à ce qui était prévu. Il ne s’agit pas d’une absence d’effet démontrée, mais d’une absence de preuve d’effet.
Le contexte
L’idée est intuitive et largement partagée : si des troubles émotionnels de l’enfant restent non repérés, c’est que le clinicien manque d’information au moment de l’évaluation. Un questionnaire structuré rempli par la famille en amont devrait donc augmenter le nombre de diagnostics posés, réduire les délais et améliorer l’orientation. Cette croyance de système est rarement testée, parce qu’elle paraît évidente. Elle vient de l’être, à grande échelle, dans des conditions de soins réels.
L’étude en un coup d’œil
| Population | |
| Enfants et adolescents de 5 à 17 ans présentant des difficultés émotionnelles, adressés en routine à un service de pédopsychiatrie dans huit établissements du service public de santé anglais, urbains et ruraux. Étaient exclus les adressages urgents nécessitant une évaluation accélérée, les déficiences intellectuelles sévères et les enfants déjà randomisés dans l’essai. Randomisation du 27 août 2019 au 17 octobre 2021, période à cheval sur la pandémie. | |
| Intervention | |
| Questionnaire diagnostique structuré renseigné en ligne par la famille ou par le jeune après l’adressage, avec un rapport de synthèse envoyé aux participants et versé au dossier clinique du service, en plus des soins usuels. Le rapport reposait entièrement sur les prédictions issues de l’algorithme, exprimées en quatre niveaux allant de proche de la moyenne à très élevé. | |
| Comparateur | |
| Soins usuels seuls : examen de l’adressage, évaluation clinique si l’adressage est accepté, puis proposition et délivrance d’une intervention. | |
| Critère principal | |
| Décision diagnostique posée par un clinicien quant à la présence d’un trouble émotionnel dans les douze mois suivant la randomisation, relevée dans les dossiers du service, avec une terminologie stricte : le suffixe « disorder » était exigé pour les diagnostics qui le comportent. Les formulations incertaines étaient soumises à adjudication et classées comme ne constituant pas un diagnostic. L’absence documentée de diagnostic comme l’incertitude étaient codées en négatif. | |
| Critères secondaires | |
| Acceptation de l’adressage index puis de tout adressage, sortie du dispositif, réadressage, décision diagnostique confirmée, diagnostic à dix-huit mois, délais jusqu’au diagnostic, jusqu’à la décision d’offre et jusqu’au démarrage du traitement, questionnaires renseignés par les participants à l’inclusion puis à six et douze mois, mesures économiques de recours aux soins et de qualité de vie. | |
| Design et effectifs | |
| Essai randomisé pragmatique multicentrique à deux bras parallèles, avec évaluation économique et évaluation qualitative de processus imbriquées. 1 225 randomisés, 615 et 610 par bras, 610 contre 609 analysés sur le critère principal. Le calcul d’effectif prévoyait 1 210 sujets pour détecter une différence absolue de dix points de pourcentage, avec une puissance de 90 % et un risque bilatéral de 5 %, sous l’hypothèse de 45 % de diagnostics dans le bras contrôle et de 10 % de données de critère principal manquantes. |
Le contrôle de qualité
| Point contrôlé | Jugement |
|---|---|
| Enregistrement prospectif | Vérifié |
| ConstatEssai enregistré sous le numéro ISRCTN15748675, avec un avis favorable du comité d’éthique le 12 juin 2019 et une première randomisation le 27 août 2019. Le protocole final, version 4.1 du 1er août 2022, et le plan d’analyse statistique sont publics sur le registre. Le plan de définition et d’adjudication du critère principal est daté du 25 février 2020, soit pendant les inclusions et bien avant le verrouillage de la base. La comparaison mot pour mot du libellé déposé au registre n’a pas pu être faite : le registre n’a pas été consulté. | |
| Dissimulation de l’allocation | Solide |
| ConstatMinimisation par algorithme équilibrée sur le site, la tranche d’âge (5 à 10 ans, 11 à 15 ans, 16 à 17 ans) et le sexe, avec une probabilité de 80 % de minimiser le déséquilibre. Algorithme créé et dissimulé dans un système web automatisé et sécurisé, opéré par l’unité d’essais cliniques de Nottingham. | |
| Insu impossible sur le terrain | Parade efficace |
| ConstatNi les participants, ni les cliniciens, ni les chercheurs de site recueillant les données sources n’étaient en aveugle, et les auteurs le comptent parmi leurs limites. Les diagnostics repérés dans les dossiers ont été relevés textuellement sur le cahier d’observation, puis soumis à un comité d’adjudication composé des cliniciens du groupe de gestion de l’essai, en aveugle de l’allocation et de l’identifiant du participant ; les analystes des données de l’essai travaillaient également en aveugle. | |
| Rétention | Supérieure à 99 % |
| ConstatSix retraits du consentement d’accès aux dossiers sur 1 225, cinq dans le bras intervention et un dans le bras contrôle, tous survenus avant tout diagnostic de trouble émotionnel. L’analyse principale porte sur l’ensemble des participants disposant d’une donnée observée, selon le groupe de randomisation. C’est l’avantage structurel d’un critère issu des dossiers. | |
| Adhérence à l’intervention | 80 % |
| Constat494 familles sur 615, l’adhérence étant définie de façon large comme une complétion totale ou partielle, un seul module renseigné suffisant. Parmi elles, 332, soit 67 %, atteignaient le niveau très élevé sur au moins un domaine de trouble émotionnel, le plus souvent la dépression et l’anxiété généralisée. Les auteurs citent eux-mêmes les 20 % de non-complétion en tête des explications possibles du résultat. C’est la réserve la plus substantielle. | |
| Hypothèse de taux de base | 45 % attendus, 12 % observés |
| ConstatL’hypothèse de 45 % venait de données de service non publiées, qui ne reflétaient pas nécessairement la terminologie diagnostique précise exigée dans l’essai. Les auteurs notent qu’en regroupant diagnostics fermes et incertains, on obtient 34 à 39 % à douze mois et 39 à 43 % à dix-huit mois, plus proche de l’attendu initial. Sur l’échelle relative, l’intervalle du rapport de risque, borné à 0,70 et 1,28, n’exclut ni une baisse de 30 % ni une hausse de 28 %. La source ne publie pas la différence de risque absolue ni son intervalle. | |
| Nature du critère | Critère de processus |
| ConstatUn diagnostic inscrit au dossier n’est pas un devenir clinique. Le choix est cohérent avec la question posée, et les auteurs formulent eux-mêmes la question suivante parmi leurs axes de recherche future : recevoir un diagnostic clinique change-t-il quelque chose aux résultats de santé. | |
| Indépendance | Financement public |
| ConstatRecherche indépendante financée par le programme Health Technology Assessment du National Institute for Health and Care Research, dossier 16/96/09. Aucun lien avec l’industrie n’est déclaré. Des liens institutionnels avec le financeur existent : l’investigateur principal est chercheur senior du NIHR et siège à son comité de priorisation HTA, un autre auteur a siégé au comité d’évaluation clinique et d’essais du même programme. Le résultat étant négatif, l’hypothèse de complaisance ne tient pas. | |
Les résultats
| Résultat | Valeur rapportée |
|---|---|
| Critère principal à 12 mois | 68/610 contre 72/609, RR ajusté 0,94 [0,70 ; 1,28], p=0,71 |
| LectureLes auteurs concluent à l’absence de preuve d’une différence entre les groupes. Le calcul d’effectif visait une différence absolue de dix points sous l’hypothèse de 45 % de diagnostics dans le bras contrôle, alors que le taux observé est de 12 %. La source ne publie ni la différence de risque absolue ni son intervalle : on ne peut donc pas dire à partir d’elle quelle ampleur de bénéfice absolu est exclue. | |
| Diagnostic à 18 mois, critère secondaire | 14 % contre 15 % |
| LectureLe résultat ne se déplace pas avec le recul supplémentaire. Le document consulté ne fournit pas d’estimation d’effet chiffrée pour ce critère. | |
| Acceptation de l’adressage | 277 (45 %) contre 262 (43 %), RR 1,06 [0,94 ; 1,19] |
| LecturePour tout adressage à dix-huit mois, 374 (61 %) contre 352 (58 %), rapport de risque 1,06, intervalle de 0,97 à 1,16. Les auteurs relèvent eux-mêmes une suggestion d’influence faible, de 3 à 6 %, sur la probabilité d’acceptation de l’adressage index ou de tout adressage à douze ou dix-huit mois. C’est le seul endroit où ils laissent ouverte l’hypothèse d’un effet. | |
| Autres critères secondaires | Aucune différence mise en évidence |
| LectureLes auteurs rapportent l’absence de preuve de différence entre les groupes sur l’ensemble des autres critères secondaires, qu’ils proviennent des dossiers ou des questionnaires renseignés par les participants. Le document consulté ne détaille pas les estimations correspondantes. | |
| Évaluation économique | Aucune analyse ne démontre la coût-efficacité |
| LecturePerspective principale du service de santé et des services sociaux, critère de résultat principal l’année de vie ajustée sur la qualité, analyse secondaire en perspective sociétale incluant pertes de productivité et dépenses des familles, différences estimées par régressions apparemment non reliées sur données multi-imputées. Les auteurs écrivent ne mettre en évidence aucun effet de l’intervention sur le recours aux soins, sur les coûts sociétaux élargis ou sur la qualité de vie des enfants et des parents. Les résultats chiffrés ne figurent pas dans le document consulté : celui-ci renvoie à l’annexe de la publication princeps. | |
Lecture critique
| Domaine | Jugement |
|---|---|
| Randomisation et allocation | Faible risque |
| ConstatMinimisation centralisée, attribution automatisée par système web sécurisé, et caractéristiques initiales décrites comme bien équilibrées entre les groupes, tant pour les enfants que pour les parents. | |
| Déviations par rapport à l’intervention | Préoccupations |
| ConstatInsu du terrain impossible, et adhérence de 80 % au sens large, la complétion d’un seul module suffisant à compter comme adhérente. Dans un essai qui ne met en évidence aucune différence, cette dernière donnée est la principale objection recevable. | |
| Données manquantes | Faible risque |
| ConstatRétention supérieure à 99 % sur le critère principal, six retraits sur 1 225. | |
| Mesure du critère | Préoccupations atténuées |
| ConstatLes chercheurs extrayant les dossiers n’étaient pas en aveugle, mais le relevé textuel suivi d’une adjudication en aveugle de l’allocation et de l’identifiant neutralise l’essentiel du risque. Les auteurs ajoutent que toute inexactitude devrait être substantielle pour annuler un effet réel. | |
| Sélection du résultat rapporté | Faible risque |
| ConstatEnregistrement au registre, protocole et plan d’analyse statistique publics, plan d’adjudication du critère principal daté et antérieur au verrouillage de la base, conclusion négative énoncée sans échappatoire. Le document consulté ne rapporte aucune analyse en sous-groupes : il s’agit d’une absence d’analyse dans cette source, et non d’une absence de signal. | |
Niveau de preuve
Niveau de preuve Oxford 1b : essai randomisé contrôlé unique, multicentrique, de grande taille, à faible risque de biais sur la randomisation, sur les données manquantes et sur la mesure du critère. La confiance est élevée sur le fait que cet outil, utilisé de cette manière, dans ce système de soins, n’a pas fait la preuve d’une augmentation du nombre de diagnostics inscrits au dossier ni d’un bénéfice économique. Elle est plus réservée sur la portée de ce résultat hors du système où il a été produit, et sur ce qu’il faudrait conclure d’un dispositif où l’adhésion des cliniciens serait obtenue. Les auteurs bornent eux-mêmes leur conclusion : ils écrivent n’avoir trouvé aucune preuve que la complétion du questionnaire aide à détecter les troubles émotionnels dans cette étude, et que l’utiliser de cette façon ne peut pas être recommandé pour la pratique clinique. Ces bornes doivent être conservées dans toute reprise du résultat.
Le test du confrère
Ce que dirait un confrère expérimenté à qui l’on présente cette étude en deux minutes, entre deux consultations.
« Un essai britannique sur 1 225 enfants ne trouve aucune preuve qu’envoyer aux familles un questionnaire diagnostique structuré avant l’évaluation fasse poser davantage de diagnostics, raccourcisse les délais ou réduise les coûts. Le volet qualitatif suggère pourquoi : peu de cliniciens interrogés avaient utilisé le rapport en consultation. »
Traduction pour la pratique : avant de financer un outil de recueil supplémentaire, il faut se demander qui lira le document produit, à quel moment de la décision, et ce qui changera dans la consultation. Le facteur limitant ne semblait pas être l’information disponible, mais son entrée dans la décision clinique.
Ce que vous pouvez en faire
- Ne pas attendre d’un questionnaire structuré adressé aux familles qu’il augmente à lui seul le repérage des troubles émotionnels de l’enfant.
- Quand un outil de recueil est déployé dans un service, prévoir dès le départ le circuit de lecture du document, son moment d’utilisation et sa place dans la décision, faute de quoi le résultat de cet essai est le résultat attendu.
- Retenir la formulation juste : il n’y a pas de preuve d’un effet. Écrire qu’il n’y a aucun effet serait plus affirmatif que ce que montre l’essai, et la source ne publie pas la différence absolue qui permettrait de dire quelle ampleur de bénéfice se trouve exclue.
- Utiliser cet essai comme référence méthodologique lorsqu’un dispositif organisationnel est proposé sans évaluation : un grand essai négatif rigoureux vaut mieux qu’une évidence partagée.
Questions fréquentes
L’outil est-il en cause, ou son usage ?
L’essai teste un outil dans un mode d’emploi précis. L’évaluation qualitative identifie plusieurs freins convergents : charge de travail, difficulté à retrouver le rapport dans le dossier électronique, délai entre la génération du rapport et la première évaluation, et réticence des cliniciens envers la terminologie diagnostique. Cela oriente vers l’usage plutôt que vers l’outil, mais aucune des deux hypothèses n’est démontrée séparément.
Ce résultat vaut-il pour la France ?
L’essai a été conduit dans huit établissements du service public anglais, dont l’organisation diffère de celle des centres médico-psychologiques infanto-juvéniles. La transposabilité directe n’a pas été étudiée, et les auteurs bornent explicitement leur conclusion à ce système et à ce format de délivrance. Le message opérationnel, lui, se transpose au moment où les services numérisent leurs procédures d’accueil.
L’essai avait-il la puissance nécessaire ?
Il a dépassé sa cible d’inclusion, 1 225 randomisés pour 1 210 prévus, avec une puissance calculée à 90 % pour une différence absolue de dix points. L’hypothèse de 45 % de diagnostics dans le bras contrôle s’est révélée très supérieure aux 12 % observés, ce qui élargit l’incertitude sur l’échelle relative. La source ne publiant pas la différence de risque absolue, on ne peut pas en déduire quelle ampleur de bénéfice absolu reste compatible avec les données.
Le résultat varie-t-il selon l’âge ou le sexe ?
Le document consulté ne rapporte aucune analyse en sous-groupes. C’est une absence d’analyse dans cette source, et non une absence de différence : rien ne peut en être conclu dans un sens ou dans l’autre.
Pourquoi un essai négatif de cette taille est-il peu relayé ?
Parce qu’il ne propose rien de nouveau à faire. C’est précisément la raison pour laquelle il mérite d’être lu : il évite de déployer un dispositif dont le bénéfice a été recherché et n’a pas été trouvé.
Bibliographie commentée
Rapport source. Sayal K, Wyatt L, Thomson L, Holt G, Ewart C, Bhardwaj A, Dubicka B, Marshall T, Gledhill J, Lang A, Sprange K, Partlett C, Newman K, Moody S, Bould H, Upton C, Keane M, Cox E, James M, Montgomery A. Clinical and cost-effectiveness of a standardised diagnostic assessment for children and adolescents with emotional difficulties: the STADIA multi-centre RCT. Health Technology Assessment 2025;29(61):1-34. DOI 10.3310/GJKS0519. PMID 41239894. Synopsis du programme Health Technology Assessment. C’est le document de référence de cette analyse. Il reprend, avec autorisation, le matériel des deux publications ci-dessous, et renvoie explicitement à la publication princeps pour les tableaux détaillés et les résultats économiques chiffrés, qui n’y figurent pas.
Publication princeps de l’essai. Sayal K, Wyatt L, Partlett C, Ewart C, Bhardwaj A, Dubicka B, et al. The clinical and cost effectiveness of a STAndardised DIagnostic Assessment for children and adolescents with emotional difficulties (STADIA): multi centre randomised controlled trial. Journal of Child Psychology and Psychiatry 2025;66:805-20. DOI 10.1111/jcpp.14090. PMID 39775729. Référence citée dans le rapport source, qui en fournit l’identifiant numérique d’objet et l’identifiant PubMed. Elle n’a pas été consultée pour cette analyse : aucun chiffre repris ici n’en provient.
Évaluation qualitative de processus. Thomson L, Newman K, Ewart C, Bhardwaj A, Dubicka B, Marshall T, et al. Barriers and facilitators to using standardised diagnostic assessments in child and adolescent mental health services: a qualitative process evaluation of the STADIA randomised controlled trial. European Child and Adolescent Psychiatry 2025;34:2763-77. DOI 10.1007/s00787-025-02678-w. PMID 40100401. Source du volet qualitatif, résumé dans le rapport et dans son annexe 3. Non consultée directement.
Protocole publié. Day F, Wyatt L, Bhardwaj A, Dubicka B, Ewart C, Gledhill J, et al. STAndardised DIagnostic Assessment for CYP with emotional difficulties (STADIA): protocol for a multicentre randomised controlled trial. BMJ Open 2022;12:e053043. Essai enregistré sous le numéro ISRCTN15748675. Le rapport source ne donne ni identifiant numérique d’objet ni identifiant PubMed pour ce protocole : ils ne sont pas affichés ici plutôt que devinés.
Ce qui a été consulté. Vérification effectuée le 13 août 2026. Ont été lues intégralement les 58 pages du rapport du programme Health Technology Assessment : résumé structuré, résumé en langage courant, introduction et objectifs, méthodes de recueil et d’analyse, analyse économique, résumé des résultats de l’essai principal et de l’évaluation qualitative, discussion et interprétation, implication des patients et du public, égalité et diversité, implications pour les décideurs, recommandations de pratique et de recherche, conclusions, informations complémentaires (contributions, liens d’intérêts, enregistrement, financement), liste des références, puis les trois annexes : modifications du protocole, calendrier des évaluations, diagnostics éligibles et critères secondaires ; résumé de l’essai principal ; résumé de l’évaluation qualitative de processus. Les quatre documents de matériel supplémentaire ont également été consultés en totalité : formulaire de sélection des adressages, tableau de consentement et de participation, plan de définition du critère et d’adjudication du 25 février 2020, gabarit du rapport remis aux familles. Les métadonnées bibliographiques, volume, numéro, pagination, identifiant numérique d’objet et identifiant PubMed, ont été établies sur les notices de l’éditeur et de PubMed. Point à signaler : les chiffres de l’évaluation économique, la différence de risque absolue et les analyses en sous-groupes ne figurent dans aucun des documents consultés, le rapport renvoyant pour cela à l’annexe de la publication princeps, qui n’a pas été consultée ; ces éléments ont donc été retirés plutôt que reproduits. Article soumis à une double lecture indépendante.
Collections éditoriales
Étiquettes
