Publié le 2 septembre 2026, mis à jour le 18 septembre 2026

Analyse · Intelligence artificielle · Méthodologie

Un modèle génératif intégré au dossier médical réduit-il les échecs thérapeutiques ? Un essai randomisé en grappes au Kenya ne trouve pas de différence

▬ Publication Nature Medicine · 2026 ; volume 32, pages 3032 à 3039 · Agweyu A et al. DOI 10.1038/s41591-026-04503-6 PMID 42362867 Scientifique 69 Éditorial 65

Seize établissements de soins primaires au Kenya, 103 cliniciens randomisés, 9 347 consultations analysées, un système d’aide à la décision fondé sur un grand modèle de langage intégré au dossier médical électronique. Le critère principal n’est pas un score de qualité des soins : c’est un composite d’échec thérapeutique à 14 jours, arbitré par un panel d’experts en aveugle. Il survient chez 102 patients sur 4 693 (2,2 %) dans le bras assisté et 94 sur 4 654 (2,0 %) dans le bras témoin, soit un rapport de cotes ajusté de 0,77 (IC 95 % 0,55 à 1,08 ; p = 0,13). L’essai ne met pas en évidence de réduction des échecs thérapeutiques. Il rapporte en revanche une amélioration nette de la qualité de la documentation clinique, une baisse du coût des antibiotiques, et aucun signal de sécurité identifié. Il porte des liens d’intérêts ciblés, il se déroule dans un réseau privé de cliniques urbaines qui n’est pas notre système de santé, et il ne porte pas sur la psychiatrie. Sa valeur pour un lecteur français est méthodologique, pas clinique.

Le contexte

Les promesses faites aux systèmes d’aide à la décision fondés sur des modèles génératifs ont largement précédé leur évaluation en conditions réelles. Les démonstrations les plus citées reposent sur des vignettes cliniques et sur des méthodes in silico, c’est-à-dire sur des dispositifs où le modèle est jugé hors du flux réel du soin. Les auteurs formulent leur constat de départ de façon restreinte, et cette restriction mérite d’être recopiée telle quelle : les preuves rigoureuses sur la performance des grands modèles de langage « in real-world, low-resource clinical settings remains limited », c’est-à-dire en conditions réelles et en contexte à ressources limitées, restent limitées. Ils ne disent pas qu’elles sont inexistantes, et ils situent explicitement leur travail dans le prolongement d’évaluations randomisées récentes conduites dans d’autres contextes cliniques.

La psychiatrie n’est pas le terrain de cet essai, et c’est précisément pourquoi il mérite d’être lu ici. La question qu’il pose, celle de savoir si un outil d’aide à la décision modifie ce que fait réellement un clinicien pressé, se posera dans les mêmes termes lorsque ces outils arriveront en consultation psychiatrique.

L’étude en un coup d’œil

Élément
Population
9 347 consultations analysées, tous âges confondus, dans seize établissements de soins primaires du réseau privé Penda Health, comtés de Nairobi et Kiambu, Kenya. Contrairement à ce que suggère le mot « adulte », 3 553 patients sur 9 347 ont moins de 18 ans, soit 38 % ; 5 658 (61 %) ont 18 à 55 ans et 136 (1,5 %) plus de 55 ans. Motifs variés, dominés par les affections fébriles ou infectieuses (5 585 ; 60 %). Les diagnostics neurologiques et psychiatriques concernent 1 242 patients (13 %).
Intervention
« AI Consult », version 2.0, développé par Penda Health et intégré au dossier médical électronique. Le modèle sous-jacent est GPT-4o (version de mai 2025) d’OpenAI, température 0,1, top-p 1,0, sortie limitée à 1 024 jetons. Le système analyse les données saisies pendant la consultation et produit des recommandations sans que le clinicien ait à formuler une requête, avec un signal visuel à trois niveaux : vert, jaune, rouge.
Comparateur
Mêmes établissements, même dossier médical électronique, fonctionnalité « AI Consult » désactivée pour les cliniciens du bras témoin. Soins habituels, sans incitation supplémentaire à l’adhésion aux recommandations.
Critère de jugement principal
Échec thérapeutique dans les 14 jours suivant la consultation index, composite arbitré par un panel d’experts : nouvelle consultation pour symptômes non résolus, recours non programmé à un niveau de soins supérieur ou aux urgences, ou événement de sécurité (orientation retardée ou manquée, prescription inappropriée, diagnostic manqué, événement menaçant le pronostic vital, décès).
Critères secondaires
Qualité de la documentation clinique, prise en charge de conditions sentinelles (hypertension, diabète de type 2, malnutrition), pertinence des prescriptions d’antibiotiques et d’antipaludiques, satisfaction des patients. La durée de consultation et les coûts par catégorie de médicament relèvent d’analyses post hoc, pas de critères secondaires préspécifiés.
Schéma
Essai contrôlé randomisé en grappes, pragmatique, multicentrique, en groupes parallèles. L’unité de randomisation est le clinicien (« clinical officer »), pas l’établissement : 103 cliniciens randomisés, 52 dans le bras assisté et 51 dans le bras témoin, patients emboîtés dans les cliniciens et les établissements. Inclusions du 22 avril au 16 juillet 2025. Protocole et plan d’analyse statistique publiés. Niveau de preuve Oxford 1b.

Le contrôle de qualité

Point contrôléJugement
Enregistrement et protocoleConforme et documenté
ConstatEssai enregistré au Pan-African Clinical Trials Registry sous le numéro 202502499779176. Protocole et plan d’analyse statistique déposés publiquement sur Zenodo. Rapport conforme aux extensions CONSORT-AI et CONSORT 2010 pour les essais randomisés en grappes, avec grille CONSORT complétée dans le matériel supplémentaire.
Unité de randomisationAppropriée, 103 grappes
ConstatLa randomisation porte sur le clinicien, choix cohérent pour un outil dont l’usage crée un effet d’apprentissage individuel : un même praticien ne peut pas alterner entre les deux conditions sans contamination. Randomisation par blocs de taille variable, quatre, six ou huit, réalisée par le statisticien de l’étude. Le nombre de grappes, 103, est confortable. La limite tient ailleurs : les deux bras cohabitent dans les mêmes établissements, et les auteurs reconnaissent qu’un échange informel de raisonnement clinique entre confrères n’a pas pu être totalement empêché.
Effectif et puissanceEffectif atteint, puissance insuffisante
ConstatLa cible de 9 000 consultations était calculée pour détecter une réduction relative de 50 % de l’échec thérapeutique, de 2 % à 1 %, avec un effet de grappe de 1,5, une puissance de 80 %, un alpha bilatéral de 0,05 et 10 % de perdus de vue. Elle est atteinte. Mais les auteurs écrivent que le taux d’événements observé a été inférieur à celui attendu et que l’essai était dimensionné pour un effet plus grand que celui observé, d’où une précision limitée. Des simulations post hoc situent au-delà de 100 000 patients l’effectif nécessaire pour détecter des différences modestes sur des événements cliniques rares.
Nature et recueil des donnéesAdjudication indépendante
ConstatLe critère principal n’est pas une donnée administrative. Il repose sur un suivi téléphonique à J3 et J14 conduit par des assistants de recherche en aveugle, puis sur une adjudication par un panel indépendant de six médecins de famille kényans exerçant depuis 10 à 16 ans. Chaque événement est revu indépendamment par deux membres du panel, un troisième tranchant en cas de désaccord persistant. Les adjudicateurs n’avaient accès ni à l’allocation ni aux sorties du modèle.
InsuPartiel, correctement organisé
ConstatL’insu des cliniciens était impossible, contrainte inhérente à ce type d’intervention et non un défaut de conduite. En revanche, les patients, les assistants de recherche chargés du suivi, le panel d’adjudication et, selon le résumé de reporting, les analystes pour les analyses principales, étaient tous en aveugle de l’allocation.
Financement et liens d’intérêtsCiblés, déclarés, à considérer
ConstatÉtude financée par la Gates Foundation, subvention INV-068056, et promue par PATH, Seattle. Les auteurs écrivent que le financeur n’a joué aucun rôle dans la conception, le recueil, l’analyse, la décision de publier ni la préparation de l’article. Deux auteurs, R. Korom et S. Kiptinness, détiennent des options d’achat d’actions de Penda Health, l’organisation de santé au sein de laquelle l’essai a été conduit. OpenAI, propriétaire du modèle, a fourni un soutien en nature à Penda Health, sous forme de crédits de calcul et de conseils techniques sur l’usage de son interface de programmation, pour le développement et l’optimisation d’« AI Consult » ; les auteurs précisent que la décision d’utiliser le produit d’OpenAI avait été prise avant cette offre et qu’OpenAI n’a eu aucun rôle dans l’étude ni dans la décision de publier. Les autres auteurs déclarent n’avoir aucun lien d’intérêts.
Validité externeLimitée, reconnue par les auteurs
ConstatLes auteurs écrivent eux-mêmes que la conduite de l’essai dans un réseau privé unique de cliniques urbaines de Nairobi peut limiter la généralisation aux milieux ruraux, périurbains ou au secteur public. Ils ajoutent que le niveau initial de qualité des soins de ce réseau, encadré par des audits cliniques réguliers et une revue par les pairs, a probablement réduit la marge d’amélioration mesurable. Aucune extrapolation directe à la psychiatrie française.

Les résultats

0,77Rapport de cotes ajusté pour l’échec thérapeutique à 14 jours, IC 95 % 0,55 à 1,08, p = 0,13. La direction du point d’estimation est favorable à l’intervention, mais l’intervalle traverse la valeur nulle : aucune réduction n’est démontrée.
CritèreRésultat
Échec thérapeutique à 14 jours102/4 693 (2,2 %) contre 94/4 654 (2,0 %) ; OR ajusté 0,77 (0,55 à 1,08), p = 0,13
LectureCritère principal, non atteint. Résultat identique en intention de traiter et en per protocole. Avec ajustement supplémentaire sur sexe, âge, moment de la journée et jour de la semaine, l’OR ajusté est de 0,72 (0,50 à 1,03 ; p = 0,07). Attention au sens de lecture : l’événement mesuré est un échec, un rapport de cotes inférieur à 1 va donc dans le sens de l’intervention, pas contre elle. La différence de risque moyenne est de -0,005 (IC de crédibilité 95 % -0,013 à 0,001), soit cinq échecs de moins pour 1 000 patients traités ; les auteurs bornent l’effet plausible entre 13 échecs évités et 1 échec supplémentaire pour 1 000 patients.
Cohérence entre les seize sitesOR poolé 0,76 (ICr 95 % 0,50 à 1,12) ; τ = 0,22 (0,01 à 0,67)
LectureMéta-analyse bayésienne multiniveau sur données individuelles. Les estimations ponctuelles vont dans le même sens, favorable à l’intervention, dans 14 des 16 établissements, avec des intervalles individuels larges. L’hétérogénéité entre sites est faible. C’est une cohérence de direction, pas une démonstration d’efficacité.
Analyses en sous-groupesAucune variation d’effet mise en évidence
LectureSous-groupes exploratoires préspécifiés : classe d’âge (pédiatrique n = 3 553, adulte n = 5 794), type de jour (week-end n = 561, semaine n = 8 786), condition sentinelle (oui n = 1 098, non n = 8 249) et moment de la consultation (nuit n = 356, jour n = 8 991). Les auteurs écrivent qu’il n’y a pas d’indice de variation de l’effet de l’intervention dans ces sous-groupes. Les tests d’interaction ne sont pas corrigés pour la multiplicité et la précision est faible dans plusieurs strates.
Qualité de la documentation cliniqueOR ajustés 1,74 ; 1,68 ; 1,71 ; tous p < 0,001
LectureSur 2 000 consultations revues par le panel, les cliniciens assistés étaient plus susceptibles de consigner un diagnostic approprié (OR ajusté 1,74 ; 1,28 à 2,36), une note clinique complète (1,68 ; 1,24 à 2,27) et un plan de traitement approprié (1,71 ; 1,25 à 2,34). C’est le résultat positif de l’essai, sur un critère de processus et non sur un critère de résultat pour le patient. Les auteurs le qualifient de preuve forte que l’intervention a amélioré la qualité de la documentation et du soin.
Prescriptions et conditions sentinellesAucune différence, sauf le repérage du risque de diabète
LectureAntibiothérapie correcte : OR ajusté 0,86 (0,48 à 1,55 ; p = 0,60). Prescription inappropriée d’antipaludique : 0,76 (0,17 à 3,43 ; p = 0,70). Nouveau diagnostic d’hypertension : 0,85 (0,67 à 1,08 ; p = 0,20), initiation du traitement 0,68 (0,37 à 1,23 ; p = 0,20). Diagnostic de malnutrition aiguë de l’enfant : 0,91 (0,50 à 1,64 ; p = 0,70), orientation vers un nutritionniste 1,14 (0,61 à 2,13 ; p = 0,70). Seule différence significative : moins de patients classés à risque de diabète de type 2 dans le bras assisté, 0,88 (0,78 à 0,98 ; p = 0,023), que les auteurs interprètent, sans le démontrer, comme un reclassement de patients dont le diabète était déjà établi.
Satisfaction et durée de consultationSatisfaction identique ; durée médiane 11 minutes dans les deux bras
LectureSur 826 patients ayant répondu à l’enquête, 411 témoins et 415 assistés, les scores de satisfaction sont identiques au niveau du groupe (médiane 4,0 ; intervalle interquartile 4,0 à 5,0) et la probabilité de déclarer une satisfaction élevée est comparable (OR ajusté 1,02 ; 0,70 à 1,49 ; p > 0,9). 784 répondants (95 %) jugent la durée « juste comme il faut », 20 (2,4 %) trop courte, 22 (2,7 %) trop longue. La durée médiane de consultation, analyse post hoc, est de 11 minutes dans les deux bras (interquartile 7 à 17 minutes chez les témoins, 8 à 17 minutes chez les assistés ; IC 95 % de la différence médiane -1,0 à 0,00 ; p = 0,031).
Sécurité33 événements graves ; aucun lien causal retenu
Lecture33 événements indésirables graves sur les seize sites, soit 27 hospitalisations et 6 décès. La revue indépendante a confirmé une prise en charge appropriée et n’a retenu aucun lien causal avec l’intervention. Le composite post hoc décès ou hospitalisation survient chez 17 témoins (0,4 %) et 14 assistés (0,3 %), sans différence significative (OR ajusté 0,77 ; 0,30 à 1,94 ; p = 0,60). Les auteurs écrivent explicitement que l’essai n’était pas dimensionné pour détecter des événements graves rares et que l’absence de différence observée ne doit pas être interprétée comme une preuve d’équivalence de sécurité.
Qualité et suivi des alertes rouges91,8 % des sorties jugées sûres ; adhésion partielle majoritaire
LectureSur 1 000 sorties du modèle associées à une alerte rouge et revues par le panel, 494 (49,4 %) ont été jugées certainement sûres et appropriées et 424 (42,4 %) plutôt sûres et appropriées, 40 (4,0 %) neutres, 31 (3,1 %) plutôt non sûres ou inappropriées et 11 (1,1 %) non sûres et inappropriées. Les cliniciens ont pleinement suivi l’avis du modèle dans 195 consultations (19,5 %), partiellement dans 573 (57,3 %) et pas du tout dans 232 (23,2 %). Le panel a jugé la décision du clinicien cliniquement justifiée dans 284 cas (28,4 %) et non justifiée dans 716 (71,6 %). Ce dernier chiffre porte sur les seules consultations à alerte rouge et ne se généralise pas à l’ensemble de l’essai.
CoûtsAntibiotiques : différence moyenne ajustée -0,15 US$ (-0,25 à -0,04)
LectureAnalyse post hoc. Les antibiotiques représentent le premier poste de dépense, 3,85 US$ par patient dans le bras témoin contre 3,71 dans le bras assisté (taux retenu : 1 dollar américain pour 130 shillings kényans) ; la différence moyenne ajustée est de -0,147 US$ (IC 95 % -0,252 à -0,042). C’est la seule des douze catégories de médicaments dont l’intervalle de confiance exclut zéro. Le coût moyen du modèle par patient est de 0,04 US$ (IC 95 % 0,04 à 0,04).

Lecture critique

DomaineRisque de biais
Processus de randomisationFaible
ConstatRandomisation par blocs de taille variable au niveau du clinicien, 103 grappes, caractéristiques initiales comparables entre les bras tant pour les patients que pour les cliniciens. Les modèles à effets aléatoires prennent en compte le double emboîtement, clinicien et établissement. La répartition des consultations par établissement est en revanche très déséquilibrée entre les bras, conséquence attendue d’une randomisation portant sur les praticiens et non sur les sites, et traitée par l’ajustement.
Écarts au protocole et contaminationPréoccupations
Constat921 écarts et violations de protocole documentés : 876 déviations (8,3 % des consultations recrutées), principalement des cliniciens non consentis (570 ; 5,4 %) ou plusieurs cliniciens pour une même consultation (306 ; 2,9 %), 13 consultations non rattachables au dossier (0,1 %), et 45 violations (0,4 %) liées à une erreur temporaire de configuration ayant donné accès à l’outil à des cliniciens du bras témoin. Les auteurs notent que toute contamination résiduelle biaiserait le résultat vers l’absence de différence. À cela s’ajoute que l’intensité réelle d’usage n’était pas imposée : l’essai mesure l’efficacité en conditions de routine, pas la performance sous usage contraint. Les auteurs l’écrivent explicitement.
Données manquantesFaible
Constat11 retraits de consentement et 90 perdus de vue sur 9 702 consultations éligibles, soit environ 1 %. Analyse en cas complets, justifiée par cette faible proportion. On note une asymétrie : 61 perdus de vue dans le bras assisté contre 29 dans le bras témoin, qui n’est pas discutée dans la publication.
Mesure du critère de jugementPréoccupations
ConstatL’adjudication en aveugle, en double lecture avec arbitre, est solide. La difficulté tient au composite lui-même, qui agrège des événements de gravité très inégale, d’une nouvelle consultation pour symptômes persistants jusqu’au décès, et qui peut donc diluer un bénéfice sur l’une de ses composantes. Les auteurs posent d’ailleurs eux-mêmes la question ouverte du critère principal le plus approprié pour évaluer une technologie généraliste dans un champ aussi large que les soins primaires. La fenêtre de 14 jours est courte et les auteurs la comptent parmi leurs limites.
IndépendancePréoccupations
ConstatDeux auteurs détiennent des options d’achat d’actions de la structure évaluée et le fournisseur du modèle a apporté un soutien en nature au développement de l’outil. Ces liens joueraient plutôt en faveur d’un résultat positif : l’absence de différence sur le critère principal en devient plus crédible, pas moins. Deux éléments retiennent d’aller plus loin dans la mise en cause : le financeur et le fournisseur du modèle sont déclarés sans rôle dans la conduite et la publication, et l’adjudication des critères cliniques a été confiée à un panel externe en aveugle.
Sélection du résultat rapportéFaible
ConstatProtocole et plan d’analyse statistique publiés avant les résultats, critère principal et critères secondaires clairement identifiés, analyses post hoc explicitement étiquetées comme telles, non confirmatoires et non corrigées pour la multiplicité. Les résultats favorables à l’intervention, documentation et coûts, sont présentés avec cette réserve par les auteurs eux-mêmes.

Niveau de preuve

Scientifique69
Éditorial65

Niveau de preuve Oxford 1b. La confiance est élevée sur un point : dans ce contexte, avec cet outil, cette intensité d’usage et cette fenêtre de 14 jours, aucune réduction des échecs thérapeutiques n’a été mise en évidence, et l’essai n’avait pas la précision nécessaire pour trancher sur des différences modestes. Elle est également élevée sur l’amélioration de la qualité de la documentation clinique, qui est nette et cohérente sur les trois domaines évalués. Elle est faible sur tout le reste : on ne sait pas ce qu’aurait donné une utilisation plus soutenue, un suivi plus long, un outil spécialisé plutôt que généraliste, ni une version plus récente du modèle, les auteurs présentant explicitement leur résultat comme un repère temporel et non comme une estimation figée des capacités. Enfin, un essai conduit dans un réseau privé de cliniques kényanes ne dit rien de ce qui se passerait dans un cabinet de psychiatrie en France, et ce n’est pas son propos.

Le test du confrère

Ce que dirait un confrère à qui l’on présente cet essai en deux minutes.

« Enfin un essai randomisé plutôt qu’une démonstration sur vignettes. Sur le critère principal, l’échec thérapeutique à quatorze jours, il ne trouve rien, et il le dit sans tricher : l’intervalle est large, l’essai était calibré pour un effet bien plus gros. Ce qui bouge, c’est la qualité des notes, et ça, c’est un critère de processus. Le plus intéressant, c’est que ceux qui l’ont fait avaient tout intérêt à ce qu’il soit positif. Cela dit, c’est le Kenya, ce sont des soins primaires, et quatorze jours c’est court. Je ne change rien, je note que la démonstration sur les résultats patients reste à faire. »

Traduction pour la pratique : rien à modifier lundi matin, et un argument solide à opposer aux promesses faites sans essai à l’appui.

Ce que vous pouvez en faire

  • Quand un outil d’aide à la décision vous est présenté, la question à poser est celle du niveau de preuve : une comparaison sur vignettes cliniques et un essai randomisé en conditions réelles ne répondent pas à la même question.
  • Distinguez toujours ce qui est mesuré. Ici, la documentation clinique s’améliore franchement, et l’échec thérapeutique à 14 jours ne bouge pas. Un critère de processus qui progresse n’est pas un bénéfice pour le patient, c’est une hypothèse de bénéfice.
  • Vérifiez le sens de lecture du critère. Quand l’événement mesuré est un échec, un rapport de cotes inférieur à 1 est favorable à l’intervention. Un même 0,77 se lit dans un sens ou dans l’autre selon ce que l’on compte.
  • Un résultat sans différence obtenu par une équipe qui avait intérêt à un résultat positif pèse plus lourd qu’un même résultat obtenu par des sceptiques. La direction des liens d’intérêts s’analyse, elle ne se comptabilise pas.
  • Ce que cet essai ne dit pas : il ne dit pas que ces outils sont inutiles, ni qu’ils sont dangereux. Les auteurs écrivent que l’assistance était sûre et n’a pas réduit l’échec thérapeutique à 14 jours, et qu’un bénéfice, s’il existe, est probablement modeste. Ils écrivent aussi que l’essai n’était pas dimensionné pour détecter des effets indésirables graves rares.
  • Pour une équipe qui envisage d’expérimenter ce type d’outil, le point critique identifié ici est la mesure : décider avant le déploiement de ce qu’on appelle une amélioration, et sur quels indicateurs.
  • À surveiller : l’existence d’essais équivalents en santé mentale n’a pas été recherchée dans le cadre de cette vérification, qui s’est limitée à la publication source et à son matériel supplémentaire. Cette analyse ne permet donc ni d’en affirmer ni d’en nier l’existence.

Questions fréquentes

L’essai montre-t-il que l’intelligence artificielle dégrade les soins ?

Non, et il ne montre pas non plus qu’elle les améliore sur ce critère. Le rapport de cotes ajusté pour l’échec thérapeutique à 14 jours est de 0,77, avec un intervalle de confiance de 0,55 à 1,08 et un p à 0,13. Comme l’événement compté est un échec, le point d’estimation va dans le sens de l’intervention, mais l’intervalle traverse la valeur nulle. Les auteurs concluent que l’assistance était sûre, qu’elle n’a pas réduit l’échec thérapeutique à 14 jours et qu’un bénéfice, s’il existe, est probablement modeste.

Est-ce le premier essai du genre ?

La publication ne le revendique pas, et cette analyse ne le revendique pas non plus. Les auteurs écrivent que les preuves rigoureuses en conditions réelles et en contexte à ressources limitées « remains limited », restent limitées, ce qui n’est pas la même chose qu’inexistantes. Ils situent leur travail dans le prolongement d’évaluations randomisées récentes conduites dans d’autres contextes cliniques, dont un essai randomisé d’agent conversationnel fondé sur un modèle de langage pour la transition entre soins primaires et spécialisés, et un essai randomisé d’agent conversationnel coconçu avec la communauté en soins primaires. Une étude d’amélioration de la qualité portant sur 40 000 consultations, avec un outil presque identique et dans le même réseau de cliniques, avait par ailleurs précédé cet essai. Aucune revendication d’antériorité ne peut donc être formulée ici.

Pourquoi analyser une étude de soins primaires kényans dans une revue de psychiatrie ?

Pour la méthode, pas pour la clinique. C’est un des rares essais randomisés qui évalue une aide à la décision fondée sur un modèle génératif dans le flux réel du soin, avec un critère de jugement centré sur le patient et une adjudication indépendante en aveugle. La façon dont il est construit, et la façon dont son résultat principal se lit, transposent directement au jour où ces outils arriveront en consultation psychiatrique.

Un composite d’échec thérapeutique, est-ce un bon critère ?

Il a l’avantage de capter plusieurs façons dont une consultation peut échouer et l’inconvénient d’agréger des événements de gravité très inégale, d’une nouvelle consultation pour symptômes persistants jusqu’au décès. Les auteurs posent eux-mêmes la question ouverte du critère principal le plus approprié pour évaluer une technologie généraliste dans un champ aussi large que les soins primaires, en notant que les critères propres à une maladie donnée ne capturent pas la valeur du dispositif, et que les critères patients objectifs exigent une échelle souvent hors d’atteinte.

Que faudrait-il pour trancher en psychiatrie ?

Un essai randomisé conduit dans des consultations psychiatriques réelles, avec des critères choisis à l’avance et pertinents pour le patient, une mesure de l’usage effectif de l’outil et un suivi plus long que quatorze jours. La présente vérification n’a pas exploré la littérature en dehors de la publication source : elle ne permet pas de dire si un tel essai existe.

Bibliographie commentée

Étude source. Agweyu A, Mwaniki P, Menon V, Korom R, Isaaka L, Wanyama C, Gill J, Kiptinness S, Adan N, Emmanuel-Fabula M, Riley RD, Archer L, Denniston AK, Liu X, Mateen BA. Generative AI-enabled clinical decision support system in primary care: a pragmatic, cluster-randomized trial. Nature Medicine. 2026 ; volume 32, pages 3032 à 3039. DOI 10.1038/s41591-026-04503-6. Reçu le 16 décembre 2025, accepté le 2 juin 2026, publié en ligne le 26 juin 2026. Article en accès ouvert sous licence Creative Commons Attribution 4.0. Enregistrement de l’essai : Pan-African Clinical Trials Registry, numéro 202502499779176. Financement : Gates Foundation, subvention INV-068056 ; promoteur PATH, Seattle, États-Unis. PMID 42362867. Deux matériels supplémentaires ont été consultés : les tableaux supplémentaires 1 à 4 et la grille CONSORT pour essais en grappes, entièrement exploitables, et le résumé de reporting Nature Portfolio, obtenu par reconnaissance optique de caractères et partiellement dégradé. Dans ce second document, le texte de fond reste lisible et a été utilisé, mais les cases à cocher des listes de contrôle sont illisibles et n’ont pas été exploitées, la mention du modèle y apparaît sous la forme erronée « GPT-40 » au lieu de GPT-4o, et la section détaillant les données d’essai clinique, dont le numéro d’enregistrement, n’y figure pas dans l’extrait fourni.

Références de contexte. Les références qui suivent sont reprises de la liste bibliographique de la publication source ; leurs identifiants ne figurent pas dans les sources consultées. Leur existence, leur revue, leur année, leur volume et leur pagination ont été confirmées auprès des registres bibliographiques le 2 septembre 2026, à l’exception du dépôt Zenodo et de la prépublication arXiv, qui ne relèvent pas de ces registres. Menon V et al. Large language model-assisted clinicians versus unassisted clinicians in clinical decision making: protocol for a multi-facility pragmatic cluster randomized controlled trial in Nairobi, Kenya. Zenodo, 2025, https://zenodo.org/records/15788148 : c’est le protocole et le plan d’analyse statistique de l’essai, déposés publiquement. Agweyu A et al. Safety of a large language model-based clinical decision support system in African primary healthcare. Nature Health. 2026 ; 1 : 607 à 618 : évaluation de sécurité du même dispositif par la même équipe, antérieure à l’essai. Korom R et al. AI-based clinical decision support for primary care: a real-world study. Prépublication, arXiv 2507.16947, 2025 : étude d’amélioration de la qualité portant sur 40 000 consultations avec un outil presque identique dans le même réseau. Tao X et al. An LLM chatbot to facilitate primary-to-specialist care transitions: a randomized controlled trial. Nature Medicine. 2026 ; 32 : 934 à 942, et Li S et al. A community-codesigned LLM-powered chatbot for primary care: a randomized controlled trial. Nature Health. 2026 ; 1 : 238 à 250 : les deux évaluations randomisées récentes dont les auteurs disent prolonger les résultats. Liu X et al. Reporting guidelines for clinical trial reports for interventions involving artificial intelligence: the CONSORT-AI extension. Nature Medicine. 2020 ; 26 : 1364 à 1374, et Campbell MK, Piaggio G, Elbourne DR, Altman DG, CONSORT Group. Consort 2010 statement: extension to cluster randomised trials. British Medical Journal. 2012 ; 345 : e5661 : les deux référentiels de rapport suivis par les auteurs.

Statut réglementaire. La qualification d’un tel système d’aide à la décision au regard du règlement européen relatif aux dispositifs médicaux et du règlement européen sur l’intelligence artificielle n’a pas pu être vérifiée : ces textes ne font pas partie des sources consultées pour cette analyse, et aucune affirmation n’est donc formulée sur ce point, qui reste à établir par une vérification dédiée. Ce que la publication indique, en revanche, est que le régulateur kényan des dispositifs médicaux, le Pharmacy and Poisons Board, a estimé que le produit sortait de son champ de compétence, aucun équivalent local d’une exemption pour dispositif expérimental n’ayant en conséquence été déposé. L’étude déclare par ailleurs se conformer au Kenya Data Protection Act de 2019, les identifiants personnels étant retirés avant tout traitement par le modèle.

Collections éditoriales

Étiquettes

Vérification effectuée le 2 septembre 2026 sur le texte intégral de la publication et sur son matériel supplémentaire lorsque celui-ci est disponible. Cette analyse a fait l’objet d’une double lecture indépendante. Comment nous vérifions ce que nous publions

Cette analyse s’adresse à des professionnels de santé. Elle ne remplace ni l’évaluation clinique individuelle, ni les recommandations en vigueur, et ne constitue pas un conseil thérapeutique.

Psychiatry Evidence Base, la psychiatrie fondée sur les preuves, expliquée avec rigueur.

Signaler une erreur dans cette analyse

Suivre le Dr Stroescu sur LinkedIn, pour la revue chaque samedi

Publications similaires