Publié le 9 août 2026, mis à jour le 17 septembre 2026
Hallucinations auditives : que change vraiment une psychothérapie ciblée ?
L’essentiel
Vingt-trois essais randomisés publiés entre 2004 et 2025, 2 016 participants adultes présentant un trouble du spectre de la schizophrénie, 1 081 dans les bras d’intervention répartis en cinq approches thérapeutiques et 935 dans les bras contrôles ; vingt-deux essais fournissent des données exploitables. En fin de traitement, les interventions psychologiques et psychosociales qui ciblent spécifiquement les hallucinations auditives en réduisent la sévérité par rapport aux contrôles : différence moyenne standardisée, g de Hedges, −0,18 (IC 95 % : −0,31 à −0,05 ; p = 0,007 ; nombre de sujets à traiter 16 ; GRADE, preuves de faible certitude), avec une hétérogénéité faible (I² 31,8 % ; p = 0,06). L’effet se maintient au suivi, en moyenne 27 semaines après l’inclusion : −0,15 (IC 95 % : −0,27 à −0,03 ; p = 0,01). En analyse de sous-groupe, la thérapie par avatar est la seule des cinq approches à franchir le seuil de signification sur la sévérité (−0,37 ; IC 95 % : −0,51 à −0,22 ; p < 0,001). Les critères secondaires vont dans le même sens pour la fréquence et la détresse liées aux voix, les symptômes totaux, les symptômes positifs, les idées délirantes, la dépression et l’anxiété, mais deux critères ne bougent pas : les symptômes négatifs (0,01 ; IC 95 % : −0,13 à 0,14 ; p = 0,90) et les croyances de malveillance attribuées aux voix (−0,09 ; IC 95 % : −0,24 à 0,07 ; p = 0,26). Les abandons ne diffèrent pas entre les bras, ce qui plaide pour une bonne acceptabilité, mais le recueil des effets indésirables est pauvre : six essais seulement les documentent en détail, huit n’en rapportent aucun. Les auteurs concluent à une efficacité avec des tailles d’effet allant de petites à moyennes, et à des différences substantielles entre approches. Trois réserves conditionnent la lecture. La hiérarchie entre approches provient d’analyses en sous-groupes, non de comparaisons directes randomisées, et les auteurs le disent eux mêmes. Onze des vingt-deux essais évalués sont à risque de biais élevé. Enfin, contre l’intuition, ce sont les essais à faible risque de biais et les essais à comparateur actif qui produisent les effets les plus grands, ce qui interdit d’expliquer ce résultat par un simple défaut de rigueur méthodologique.
Le contexte
Les auteurs posent d’emblée le problème clinique : les hallucinations auditives sont une caractéristique cardinale des troubles du spectre de la schizophrénie, avec une prévalence sur la vie entière qu’ils situent entre 64 et 80 %, et elles s’accompagnent souvent d’une détresse sévère. Une partie des personnes concernées continue d’entendre des voix alors que le traitement antipsychotique est conduit dans les règles, ce qui explique qu’une littérature entière se soit constituée autour de la formule « hallucinations résistantes au médicament ». La question posée ici n’est donc pas de remplacer la chimiothérapie, mais de savoir ce qu’apporte une psychothérapie construite pour agir sur la voix elle-même.
Les auteurs revendiquent une antériorité, formulée dans la discussion : à leur connaissance, il s’agit de la première revue systématique avec méta-analyse portant sur l’ensemble des interventions psychologiques et psychosociales spécifiquement conçues pour les hallucinations auditives. La revendication est recevable pour ce périmètre large, elle ne dispense pas de situer le travail. Une revue Cochrane de 2020 avait déjà examiné la thérapie par avatar et n’avait pas retrouvé d’effet cohérent, sur trois études et 195 participants, avec des niveaux de certitude allant de très faible à modéré selon les critères ; elle ne figure pas dans les 72 références de l’article. Une méta-analyse en réseau publiée en 2026 dans Psychological Medicine, qui compte l’un des auteurs seniors du travail analysé ici, a spécifiquement opposé thérapie par avatar et thérapie cognitivo-comportementale ; parue après l’acceptation du manuscrit, datée du 4 avril 2026, elle ne pouvait pas y être discutée. Ces trois travaux ne racontent pas la même histoire, et c’est précisément ce qui rend l’exercice intéressant.
L’étude en un coup d’œil
| Question (PICO) | |
|---|---|
| Population | |
| Adultes présentant un trouble du spectre de la schizophrénie et des hallucinations auditives actuelles, avec au moins 75 % de patients porteurs de ce diagnostic dans chaque bras. 23 essais randomisés publiés entre 2004 et 2025, 2 016 participants, dont 1 081 dans les bras d’intervention et 935 dans les bras contrôles ; 22 essais fournissent des données exploitables. Âge moyen 38,6 ans (moyennes d’essai de 25,9 à 46,0), 53,3 % d’hommes, effectif moyen par essai 87,6 (20 à 345) | |
| Intervention | |
| Toute intervention psychologique ou psychosociale visant principalement à réduire une caractéristique des hallucinations auditives, sans restriction de cadre de soins. Les auteurs les regroupent en cinq catégories : thérapie cognitivo-comportementale (5 essais), thérapie par avatar (6 essais, dont plusieurs en réalité virtuelle), thérapie du dialogue et de la relation à la voix (2 essais), programmes d’auto-assistance, en ligne ou informatisés, dits numériques (5 essais), et approches intégratives combinant plusieurs modèles (5 essais). Durée médiane des essais 12 semaines (6 à 39) | |
| Comparateur | |
| Contrôles actifs, soins habituels, liste d’attente, ou combinaison de ceux-ci. Répartition effective des 23 essais : soins habituels seuls dans 14 essais, counseling de soutien renforcé dans 3, intervention de compagnonnage dans 1, thérapie cognitivo-comportementale dans 2, liste d’attente associée aux soins habituels dans 3 | |
| Critères | |
| Critère principal : variation intergroupe de la sévérité des hallucinations auditives entre l’inclusion et la fin de traitement. Critères secondaires : sévérité au suivi, autres caractéristiques des voix, autres critères cliniques en fin de traitement et au suivi, mesurés par des échelles validées, au premier rang desquelles la PSYRATS-AH. Acceptabilité mesurée par les abandons, effets indésirables tels que rapportés dans chaque essai. Analyses complémentaires de nombre de sujets à traiter et gradation de la certitude des preuves par l’approche GRADE | |
| Design | |
| Revue systématique avec méta-analyse par paires à effets aléatoires, g de Hedges, analyses en sous-groupes et méta-régression à effets mixtes. Recherche dans Embase, MEDLINE, PsycArticles, PsycInfo, PSYNDEX et la Cochrane Library, initiale le 18 novembre 2024, actualisée le 18 août 2025. 7 408 références identifiées, 109 textes intégraux examinés, 23 essais inclus. Conforme à PRISMA. Protocole enregistré sur PROSPERO, CRD42023475704, et publié dans PLOS One en juillet 2024 · CEBM 1a |
Le contrôle de qualité
Un mot de méthode avant de lire ce tableau. Le texte intégral de l’article a été consulté, y compris ses trois tableaux et le descriptif essai par essai. Les éléments ci-dessous en proviennent directement. Une seule réserve d’accès subsiste : les dix-huit figures et les huit tableaux électroniques du matériel supplémentaire, qui portent notamment le détail des grilles GRADE, des tests d’Egger et du calcul du nombre de sujets à traiter, n’ont pas été ouverts. Quand un élément ne figure que dans ce supplément, c’est écrit.
| Critère | Statut |
|---|---|
| Enregistrement du protocole | Solide |
| ConstatPROSPERO CRD42023475704, avec un protocole publié en revue à comité de lecture en juillet 2024, soit plus d’un an avant la clôture de la recherche bibliographique. Les écarts au préenregistrement sont déclarés et renvoyés à une annexe du supplément | |
| Recherche bibliographique | Solide |
| ConstatSix bases interrogées, dont PsycInfo et PSYNDEX, recherche initiale en novembre 2024 puis actualisation le 18 août 2025. 7 408 références identifiées, 109 textes intégraux examinés, 23 essais retenus. Sélection, extraction et cotation du risque de biais menées en double, avec recours à un troisième évaluateur en cas de désaccord persistant. Le champ couvre la littérature germanophone, souvent absente des revues anglo-saxonnes | |
| Aveugle des participants et des thérapeutes | Impossible par construction |
| ConstatAucun essai de psychothérapie ne peut masquer au patient ni au thérapeute ce qui est administré. Ce n’est pas un défaut des auteurs, c’est la contrainte du domaine, et elle vaut pour l’ensemble du corpus | |
| Masque de l’évaluation | Documenté essai par essai |
| ConstatLe tableau descriptif de l’article donne le statut de masquage pour chacun des 23 essais : 14 sont en simple aveugle, c’est-à-dire à évaluation masquée, 1 est partiellement masqué, 5 sont explicitement ouverts, 2 ne renseignent pas ce point, et 1 ne repose que sur des auto-évaluations. Le masquage de l’évaluation est donc la règle plutôt que l’exception, ce qui affaiblit nettement l’hypothèse d’un effet porté par des évaluateurs informés | |
| Homogénéité des comparateurs | Réserve, mais pas celle qu’on attendait |
| ConstatLes soins habituels seuls dominent, 14 essais sur 23, contre 6 essais à comparateur actif et 3 essais à liste d’attente associée aux soins habituels. Une supériorité sur soins habituels et une supériorité sur intervention active ne sont pas la même démonstration. Le type de contrôle modère effectivement le résultat (Q = 10,23 ; p = 0,02), mais dans le sens inverse de l’intuition : seuls les essais à comparateur actif atteignent la signification | |
| Nature des comparaisons | Réserve |
| ConstatIl s’agit d’une méta-analyse par paires à effets aléatoires, chaque approche étant confrontée à ses propres contrôles, puis les approches étant comparées entre elles par méta-régression à effets mixtes. Ce n’est pas une méta-analyse en réseau : aucune comparaison indirecte formelle n’est estimée, et aucun résultat ne relève d’un modèle de réseau | |
| Instruments de mesure | Réserve |
| ConstatL’article nomme les instruments essai par essai. La PSYRATS-AH, entretien coté par un clinicien, sert de mesure de sévérité dans la quasi-totalité des essais, complétée le plus souvent par le BAVQ-R, questionnaire de croyances rempli par le patient. Ces deux formats ne réagissent pas de la même manière à la levée de l’aveugle. Les critères secondaires reposent sur des échelles plus hétérogènes, ce que les auteurs comptent parmi leurs limites | |
| Gradation de la certitude | Réserve |
| ConstatLe corps de l’article donne deux niveaux explicites, faible pour le critère principal et faible également pour le sous-groupe avatar. Les grilles GRADE complètes sont renvoyées à un tableau électronique du supplément, non consulté. Aucun niveau n’est donc lisible, dans le corps de l’article, pour chacun des critères secondaires pris isolément | |
| Risque de biais | Point faible du corpus |
| ConstatSur les 22 essais évalués par l’outil RoB 2, 6 sont à faible risque, 5 soulèvent des réserves et 11 sont à risque élevé. Les auteurs en font l’une de leurs limites principales. Le risque de biais modère significativement le résultat (Q = 9,59 ; p = 0,02) | |
| Hétérogénéité | Faible |
| ConstatI² 31,8 % sur le critère principal (p = 0,06), et une analyse en jackknife ne retrouve aucune étude isolée responsable de l’hétérogénéité. Elle reste plus marquée sur la fréquence des voix (I² 47,4 % ; p = 0,006) et nulle sur plusieurs critères secondaires | |
| Biais de publication | Recherché, non retrouvé |
| ConstatInspection visuelle des graphiques en entonnoir et test d’Egger sur le critère principal : z = −0,94 ; p = 0,35. Aucun signal non plus sur les critères secondaires. Rien ne plaide donc pour un biais de publication. Ce n’est pas un blanc-seing : sur 19 observations, le test d’Egger a une puissance limitée et un résultat non significatif n’exclut pas un effet des petites études | |
| Indépendance | Déclarée, et à connaître |
| ConstatFinancement : bourse doctorale Elsa-Neumann du Land de Berlin, les financeurs déclarant n’avoir joué aucun rôle. Deux déclarations méritent l’attention du lecteur. Stefan Leucht déclare des honoraires personnels de douze laboratoires, hors travail soumis. Kerem Böge, auteur senior, déclare être cofondateur de trois entreprises de santé, Kiso GmbH, Mental Hub et FIL, et avoir reçu des honoraires de conseil ou de conférence de Boehringer Ingelheim, Clicks Therapeutics et Angelini. Dans une synthèse dont le résultat le plus visible favorise une intervention technologique, cette position doit être connue. Par ailleurs l’un des essais inclus a pour première autrice la première autrice de la revue, et les auteurs précisent qu’un autre évaluateur a coté le risque de biais de cet essai à sa place. Les auteurs signalent enfin l’usage d’un modèle de langage entre juillet 2025 et février 2026 pour la vérification linguistique, le contrôle du code R et le raccourcissement de sections | |
| Tolérance et acceptabilité | Acceptabilité oui, tolérance mal documentée |
| ConstatLes proportions d’abandon d’étude sont comparables, 15,0 % en intervention et 16,2 % en contrôle, sans différence de risque (risque relatif 0,91 ; IC 95 % : 0,75 à 1,11 ; p = 0,36). En revanche, six essais seulement évaluent et rapportent les effets indésirables en détail et huit n’en rapportent aucun. Les auteurs le disent : le recueil des effets négatifs est insuffisant et centré sur les événements graves, au détriment des effets plus légers mais cliniquement pertinents | |
Les résultats
| Résultat | Donnée publiée |
|---|---|
| Sévérité des hallucinations auditives, fin de traitement | SMD −0,18 (IC 95 % : −0,31 à −0,05) ; p = 0,007 ; I² 31,8 % ; NST 16 ; GRADE, faible certitude |
| Lecture PEBStatistiquement présent, d’amplitude modeste l’effet est réel au sens statistique, et sa taille se situe sous le seuil habituellement retenu pour parler d’un petit effet | |
| Sévérité des hallucinations auditives, au suivi | SMD −0,15 (IC 95 % : −0,27 à −0,03) ; p = 0,01 ; I² 5,3 %. Suivi moyen 27,2 semaines, de 12 à 78 semaines selon les essais |
| Lecture PEBL’effet ne s’éteint pas l’amplitude diminue à peine et l’intervalle exclut toujours zéro. C’est un point important pour une psychothérapie, même si peu d’essais dépassent douze mois | |
| Sous-groupe thérapie par avatar | 6 essais, 7 observations. Sévérité en fin de traitement −0,37 (IC 95 % : −0,51 à −0,22) ; p < 0,001 ; I² 0,01 %. Au suivi −0,26 (IC 95 % : −0,41 à −0,11) ; p < 0,001. Fréquence −0,34, détresse −0,29, les deux significatives. Croyances de malveillance −0,09 (IC 95 % : −0,32 à 0,14), non significative. GRADE, faible certitude |
| Lecture PEBLe plus grand effet, mais en sous-groupe les six essais sont Craig 2018, Percie du Sert 2018, Dellazizzo 2021, Liang 2022, Garety 2024 qui pèse deux observations, et Smith 2025. Quatre d’entre eux utilisent un comparateur actif et trois sont à évaluation masquée. Les auteurs reconnaissent que ce sous-groupe concentre les comparateurs actifs et les essais à faible risque de biais, ce qui rend sa supériorité apparente indissociable de ses caractéristiques méthodologiques | |
| Les quatre autres approches | Sévérité en fin de traitement : thérapie cognitivo-comportementale 0,05 (IC 95 % : −0,18 à 0,28) ; dialogue et relation à la voix 0,14 (IC 95 % : −0,40 à 0,68) ; approches numériques −0,05 (IC 95 % : −0,37 à 0,26) ; approches intégratives −0,25 (IC 95 % : −0,82 à 0,31). Aucune n’est significative |
| Lecture PEBNon significatif n’est pas nul chaque sous-groupe repose sur 2 à 4 essais, largement sous-dimensionnés, avec des intervalles très larges. Les auteurs l’écrivent : ces résultats peuvent refléter un manque de puissance, pas une absence d’effet. Ils relèvent aussi que la thérapie cognitivo-comportementale a fait ses preuves sur les symptômes positifs en général, ce qui n’est pas la question posée ici | |
| Critères secondaires sur les voix | Fréquence −0,28 (IC 95 % : −0,45 à −0,10) ; p = 0,002. Détresse −0,19 (IC 95 % : −0,34 à −0,04) ; p = 0,01. Croyances de malveillance −0,09 (IC 95 % : −0,24 à 0,07) ; p = 0,26 |
| Lecture PEBDeux acquis, un échec la fréquence bouge davantage que la sévérité globale, la détresse suit, mais ce que le patient croit de la malveillance de sa voix ne change pas. C’est une donnée intéressante en soi : ces thérapies semblent agir sur la présence et le vécu de la voix plus que sur le système de croyances qui l’entoure | |
| Critères secondaires cliniques | Symptômes totaux −0,29 (IC 95 % : −0,48 à −0,11) ; symptômes positifs −0,24 (IC 95 % : −0,38 à −0,11) ; idées délirantes −0,27 (IC 95 % : −0,41 à −0,12) ; dépression −0,19 (IC 95 % : −0,30 à −0,07) ; anxiété −0,28 (IC 95 % : −0,48 à −0,08). Symptômes négatifs 0,01 (IC 95 % : −0,13 à 0,14) ; p = 0,90 |
| Lecture PEBCohérence de direction, avec une exception nette cinq critères sur six vont dans le même sens, avec des amplitudes voisines de celle du critère principal ou légèrement supérieures. Les symptômes négatifs ne bougent pas du tout, ce qui est cohérent avec l’idée d’une intervention ciblée sur un symptôme et non sur le trouble | |
| Modérateurs et analyses de sensibilité | Le résultat est modéré par le type de contrôle (Q = 10,23 ; p = 0,02), le risque de biais (Q = 9,59 ; p = 0,02) et l’approche thérapeutique (Q = 26,07 ; p < 0,001), mais pas par la durée du traitement (Q = 2,55 ; p = 0,11). Restreint aux essais à faible risque de biais, l’effet passe à −0,27 (IC 95 % : −0,44 à −0,09). Restreint aux essais à comparateur actif, il passe à −0,32 (IC 95 % : −0,50 à −0,15). L’exclusion des essais à liste d’attente et de l’essai chinois ne modifie pas les conclusions |
| Lecture PEBLe résultat le plus contre-intuitif de l’étude on attendait que la rigueur méthodologique rabote l’effet ; elle l’augmente. L’explication proposée par les auteurs est structurelle : les comparateurs actifs se trouvent presque exclusivement dans les essais d’avatar, eux mêmes majoritairement à faible risque de biais. Ces trois modérateurs sont donc confondus entre eux et ne peuvent pas être départagés dans ce jeu de données | |
| Biais de publication | Test d’Egger sur le critère principal : z = −0,94 ; p = 0,35. Aucun signal sur les critères secondaires |
| Lecture PEBRecherché, non retrouvé l’argument classique du domaine, de petits essais portés par les équipes qui ont conçu l’intervention, n’est pas objectivé ici. La puissance du test reste faible sur 19 observations | |
| Tolérance et acceptabilité | Abandon d’étude 15,0 % en intervention contre 16,2 % en contrôle (risque relatif 0,91 ; IC 95 % : 0,75 à 1,11 ; p = 0,36). Abandon du traitement 17,3 % contre 12,2 %, sans différence sur la comparaison appariée (risque relatif 0,97 ; IC 95 % : 0,66 à 1,43 ; p = 0,87). Six essais rapportent les effets indésirables en détail, huit n’en rapportent aucun |
| Lecture PEBAcceptabilité solide, tolérance mal renseignée les patients restent, ce qui est en soi un signal favorable et l’argument le plus robuste pour proposer ces approches. Mais un corpus où huit essais sur vingt-trois ne rapportent aucun effet indésirable ne permet pas d’affirmer une bonne tolérance : il permet seulement de dire qu’aucun signal de danger n’a été rapporté | |
Deux notions méritent d’être posées, parce qu’elles décident de la portée du résultat. La différence moyenne standardisée n’est pas un nombre de points sur une échelle : c’est un écart entre deux moyennes rapporté à la dispersion des mesures, ici sous la forme du g de Hedges, ce qui permet d’agréger des instruments différents mais interdit de traduire directement le chiffre en gain clinique. Par les conventions d’interprétation usuelles, 0,2 marque le seuil d’un petit effet ; l’estimation agrégée reste en dessous. Le sous-groupe avatar, à 0,37, se situe entre un petit et un moyen effet, ce qui correspond à la formulation retenue par les auteurs, tailles d’effet allant de petites à moyennes.
Le nombre de sujets à traiter de 16 appelle la même prudence. Un tel indice se calcule à partir d’une proportion de répondeurs. Ici, le critère principal est continu, ce qui suppose de définir un seuil de réponse et d’utiliser une hypothèse sur le taux de réponse dans le groupe contrôle. Le corps de l’article ne détaille ni ce seuil ni cette hypothèse, et renvoie le calcul à un tableau électronique du supplément, non consulté. Le chiffre reste utile pour se représenter l’ordre de grandeur, il ne doit pas être manipulé comme s’il provenait d’un décompte direct de patients améliorés.
Enfin, une comparaison qui n’est pas dans l’article mais qui éclaire son résultat le plus visible. La méta-analyse en réseau publiée en 2026 dans Psychological Medicine, sur 26 essais et 2 273 participants, a confronté directement la thérapie par avatar à la thérapie cognitivo-comportementale chez des patients aux hallucinations résistantes au médicament. En fin de traitement, elle ne retrouve pas de différence sur la sévérité des hallucinations, avec une différence moyenne standardisée de −0,23 dont l’intervalle de confiance à 95 % va de −0,55 à 0,10, c’est-à-dire franchit zéro. L’avantage de l’avatar y apparaît à trois mois, −0,37 (IC 95 % : −0,69 à −0,05), et sur les symptômes psychotiques globaux, −0,41 (IC 95 % : −0,75 à −0,06). Les auteurs de ce second travail signalent eux mêmes un effet des petites études, avec un test d’Egger significatif sous le seuil de 0,01 pour la sévérité des hallucinations, et un risque de biais globalement modéré à élevé. Deux enseignements. D’une part, la supériorité de l’avatar sur la thérapie cognitivo-comportementale n’est pas établie en comparaison directe en fin de traitement. D’autre part, les deux travaux convergent sur la durabilité : l’avantage de l’avatar se lit à distance du traitement, à trois mois dans la méta-analyse en réseau, au suivi moyen de 27 semaines dans la méta-analyse par paires. Convergence n’est pas confirmation, les deux corpus se recouvrent largement.
Lecture critique
| Domaine | Jugement |
|---|---|
| Niveau de preuve de la synthèse | Solide |
| ConstatSommet de la hiérarchie : essais randomisés uniquement, protocole préenregistré puis publié, six bases bibliographiques, double sélection et double extraction, conformité PRISMA, gradation GRADE, test de biais de publication. Le dispositif est celui qu’on attend d’une grande revue | |
| Qui évalue, et sous quel masque | Réserve levée pour l’essentiel |
| ConstatDans un essai de psychothérapie, l’aveugle du patient n’existe pas ; seule l’évaluation peut être masquée, et c’est donc là que se juge la solidité. L’article documente ce point essai par essai : 14 des 23 essais sont à évaluation masquée, 5 sont ouverts, 1 partiellement masqué, 2 non renseignés, 1 en auto-évaluation seule. Surtout, l’analyse restreinte aux essais à faible risque de biais, domaine de la mesure du critère compris, ne réduit pas l’effet mais l’augmente, de −0,18 à −0,27. L’hypothèse d’une estimation gonflée par des évaluateurs informés ne tient donc pas devant ces données | |
| Attente du patient et allégeance du chercheur | Réserve maintenue |
| ConstatUne thérapie qui met en scène la voix du patient produit une attente forte, et l’allégeance des équipes est connue pour majorer les effets dans les essais de psychothérapie. L’article n’analyse pas ce facteur. Le signal existe pourtant dans la littérature : la revue Cochrane de 2020 relevait que, dans l’un des essais d’avatar, des auteurs avaient participé au développement du système évalué, et que dans un autre des brevets étaient en cours de dépôt. L’argument est ici affaibli, sans être annulé, par le fait que les essais à comparateur actif donnent les effets les plus grands | |
| Comparateurs mélangés | Réserve, en sens inverse |
| ConstatAgréger une supériorité contre liste d’attente et une supériorité contre intervention active revient à mélanger deux questions cliniques distinctes : est ce mieux que rien, et est ce mieux qu’autre chose. L’article sépare les deux, et le résultat surprend : seuls les essais à comparateur actif atteignent la signification (−0,32 ; IC 95 % : −0,50 à −0,15), contre rien de significatif pour les soins habituels seuls et la liste d’attente. Ce n’est pas la démonstration d’une spécificité, car les auteurs relèvent eux mêmes que les comparateurs actifs se concentrent dans les essais d’avatar. Type de contrôle, approche et risque de biais sont confondus | |
| Sous-groupe et non comparaison randomisée | Réserve principale |
| ConstatLa hiérarchie entre approches repose sur des analyses en sous-groupes de la même méta-analyse par paires. Ce type d’analyse ne conserve pas la randomisation entre approches : les essais d’avatar diffèrent des essais de thérapie cognitivo-comportementale par leurs populations, leurs contrôles, leurs dates et leur qualité méthodologique. Ce n’est pas non plus une méta-analyse en réseau, donc aucune comparaison indirecte formelle n’est proposée. Les auteurs l’inscrivent explicitement dans leurs limites : la supériorité des sous-groupes doit être interprétée avec prudence en l’absence d’essais de comparaison directe | |
| Sous-groupes sous-dimensionnés | Réserve |
| ConstatLes cinq sous-groupes reposent sur 2 à 6 essais. Que la thérapie cognitivo-comportementale ressorte à 0,05 sur trois essais ne démontre pas son inefficacité sur les voix, cela démontre qu’on ne sait pas. Lire ce tableau comme un classement d’efficacité serait une erreur de raisonnement, celle qui consiste à traiter une absence de signification comme une preuve d’absence | |
| Résultat divergent de l’antériorité | Réserve |
| ConstatLa revue Cochrane de 2020 ne retrouvait pas d’effet cohérent de la thérapie par avatar, sur trois études et 195 participants, toutes à risque de biais élevé sur au moins un domaine, avec des données de court terme uniquement. Six ans plus tard, un sous-groupe de six essais donne le plus grand effet observé. L’accumulation de nouveaux essais, dont l’essai AVATAR2 de 2024 et l’essai danois de 2025, explique probablement cette évolution, mais un renversement de conclusion appelle par principe la vérification, pas l’adhésion | |
| Effet des petites études | Recherché, non retrouvé ici |
| ConstatLe domaine est fait de petits essais portés par les équipes qui ont conçu les interventions, et la méta-analyse en réseau de 2026 y objective un effet des petites études sur ce même critère (test d’Egger, p < 0,01). Le travail analysé ici applique le même test et ne le retrouve pas (z = −0,94 ; p = 0,35). Deux corpus proches, deux résultats opposés sur ce point : la différence de périmètre, corpus élargi ici, restreint à la comparaison avatar contre thérapie cognitivo-comportementale là, explique probablement l’écart, mais le doute n’est pas levé | |
| Validité externe | Réserve |
| ConstatLes essais viennent presque tous du Royaume-Uni, d’Europe du Nord, du Canada et d’Australie, avec un seul essai chinois ; aucun essai français. Les interventions testées supposent un thérapeute formé, un protocole structuré et, pour l’avatar, un dispositif technique et un accompagnement spécifique. Rien de tout cela ne se déduit d’une taille d’effet. Les auteurs signalent en outre que le traitement pharmacologique associé est rarement décrit, ce qui empêche de savoir sur quel fond médicamenteux ces effets s’ajoutent | |
| Tolérance | Acceptabilité oui, tolérance non démontrée |
| ConstatLes abandons sont identiques dans les deux bras, ce qui plaide pour une bonne acceptabilité et autorise, en pratique, à proposer ces approches malgré une amplitude d’effet modeste. Mais les auteurs eux mêmes qualifient le recueil des effets indésirables de limité et insuffisant, centré sur les événements graves. Une bonne acceptabilité mesurée ne vaut pas une bonne tolérance démontrée | |
Séparons ce que ces données autorisent. Ce qui est démontré, avec une certitude que les auteurs eux mêmes qualifient de faible : à l’échelle de 23 essais randomisés, les psychothérapies construites pour cibler la voix font mieux que les conditions contrôles sur la sévérité des hallucinations en fin de traitement, avec une amplitude modeste, l’effet se maintient au suivi, il s’étend à la fréquence des voix, aux symptômes positifs, aux idées délirantes, à la dépression et à l’anxiété, et l’acceptabilité est bonne. Ce qui est suggéré : la thérapie par avatar se détache des autres approches, et la robustesse du résultat aux analyses de sensibilité plaide pour un effet réel plutôt que pour un artefact de mesure. Ce qui n’est pas démontré, et que le lecteur pressé risque de conclure à tort : que les autres approches soient inefficaces, alors que leurs sous-groupes sont simplement trop petits ; que l’avatar soit supérieur à la thérapie cognitivo-comportementale, ce qui exigerait une comparaison directe ; et que ces interventions soient bien tolérées, ce qui exigerait qu’on ait cherché les effets indésirables, ce que huit essais sur vingt-trois n’ont pas fait. Ce qui relève de l’opinion d’expert, y compris de la nôtre : le fait que les essais les plus rigoureux et les comparaisons les plus exigeantes donnent les effets les plus grands est le résultat le plus intrigant de ce travail. Il peut signaler une intervention réellement spécifique, ou seulement le fait que les meilleures études du corpus sont aussi celles qui testent l’approche la plus récente et la mieux financée. Un essai comparant directement l’avatar à une thérapie cognitivo-comportementale ciblée sur la voix, à évaluation masquée, trancherait.
Niveau de preuve
Appréciation PEB : confiance faible, au sens de la gradation retenue par les auteurs, sur l’existence d’un bénéfice de faible amplitude des psychothérapies ciblées sur la sévérité des hallucinations auditives, en fin de traitement et au suivi ; confiance faible également, au même sens, sur l’effet de la thérapie par avatar prise isolément, mais confiance très faible sur sa supériorité relative, qui repose sur une analyse en sous-groupe confondue avec le type de comparateur et le risque de biais, et qui n’est pas retrouvée en comparaison directe en fin de traitement dans un travail indépendant ; confiance raisonnable sur l’acceptabilité, mais preuves insuffisantes sur la tolérance. La méthode de la revue est de bon niveau et la conclusion des auteurs est calibrée, avec une mention explicite de la faible certitude dans le résumé lui même, ce qui n’est pas si fréquent. Ce qui limite la portée tient au matériau : onze essais sur vingt-deux à risque de biais élevé, des sous-groupes de deux à six essais, un recueil des effets indésirables lacunaire, et une architecture où les trois variables qui expliquent le résultat, approche thérapeutique, type de comparateur et qualité méthodologique, varient ensemble. Les auteurs identifient eux mêmes ces limites, ce qui plaide en leur faveur.
Le test du confrère
Ce que dirait un confrère expérimenté à qui l’on résume ce travail entre deux consultations.
« Donc les psychothérapies des voix marchent un peu, l’effet est petit, il tient dans le temps, et la certitude reste faible. L’avatar sort du lot, mais dans un sous-groupe, pas dans un essai qui l’oppose vraiment aux autres. Et quand on regarde de près, les études les plus sérieuses trouvent plus d’effet, pas moins : ça, c’est plutôt rassurant. Ce que je retiens surtout, c’est que les patients ne s’en vont pas. Reste que huit essais sur vingt-trois n’ont même pas cherché les effets indésirables. »
Traduction pour la pratique : devant tout essai de psychothérapie, deux questions valent mieux qu’une. « Contre quoi », d’abord, parce qu’ici le comparateur change tout. Puis « qui a mesuré, et savait il », parce que c’est le seul aveugle disponible dans ce domaine. Et une troisième, qu’on oublie presque toujours : « a-t-on cherché ce qui pouvait mal se passer ». Une psychothérapie qui n’a pas d’effets indésirables rapportés n’est pas une psychothérapie sans effets indésirables.
Ce que vous pouvez en faire dès lundi matin. Ce travail ne crée pas une prescription nouvelle, mais il donne des mots, un ordre de grandeur et une conduite à tenir.
- Traiter la voix comme une cible en soi. La littérature sur laquelle repose cette revue existe parce que des patients continuent d’entendre des voix sous traitement bien conduit. Nommer explicitement ce symptôme résiduel en consultation, plutôt que de le classer d’emblée en échec pharmacologique, ouvre une conversation utile.
- Mesurer avant de conclure. Les essais inclus s’appuient très majoritairement sur deux formats complémentaires : un entretien coté par le clinicien, la PSYRATS dans sa sous-échelle hallucinations, et un questionnaire de croyances rempli par le patient, le BAVQ-R. Documenter la sévérité, la fréquence et la détresse au départ permet de savoir plus tard s’il s’est passé quelque chose, ce qu’aucune impression globale ne permet.
- Annoncer le bon ordre de grandeur, et le bon périmètre. On peut dire honnêtement à un patient qu’une psychothérapie ciblée apporte, en moyenne et sur des données de faible certitude, un bénéfice réel mais modeste, qui semble tenir plusieurs mois, et que les personnes qui commencent ces prises en charge les poursuivent. On peut ajouter ce que ces thérapies ne font pas : elles ne modifient ni les symptômes négatifs, ni les croyances sur la malveillance de la voix. C’est une proposition raisonnable, ce n’est pas une promesse.
- Ne pas survendre l’avatar. C’est l’approche la plus prometteuse de cette synthèse, ce n’est pas une approche validée contre ses concurrentes, et sa supériorité apparente est indissociable du fait que ses essais sont aussi les mieux construits du corpus. Une recherche dans le registre ClinicalTrials.gov le 11 août 2026 ne retrouve aucun essai de thérapie par avatar proprement dite conduit en France. Le seul enregistrement français identifié sur ce registre porte sur autre chose : un essai multicentrique promu par le centre hospitalier universitaire de la Guadeloupe, dont le seul site déclaré est aux Abymes et dont les critères d’inclusion mentionnent également un recrutement au centre hospitalier universitaire de Nîmes, évaluant un programme de groupe intégratif de quinze séances hebdomadaires dont une seule est consacrée à la création d’un avatar de la voix, non encore recruteur à la date de consultation. Un registre d’essais ne décrit pas l’offre de soins courante : cette source ne documente pas d’implantation française de la thérapie par avatar, elle ne prouve pas qu’il n’en existe aucune.
- Continuer d’orienter vers les approches psychosociales disponibles. Le résultat agrégé porte sur l’ensemble des interventions ciblées, pas sur la seule thérapie par avatar, même si les essais d’avatar en portent une part importante. Aucune des quatre autres approches n’est disqualifiée par cette synthèse : elles sont seulement moins étudiées. Un accompagnement psychothérapeutique structuré, en service ou en réseau spécialisé dans les troubles psychotiques, reste une option cohérente avec ces données.
- Emporter la grille de lecture. Différence moyenne standardisée d’un côté, seuil conventionnel de l’autre, nature du comparateur en troisième. Et un quatrième réflexe, que ce travail illustre bien : quand un auteur écrit qu’une approche est supérieure, vérifier si la comparaison est randomisée ou si elle repose sur la mise côte à côte de deux sous-groupes. Ces réflexes servent devant n’importe quel essai de psychothérapie, bien au-delà des hallucinations auditives.
- La conduite à tenir est détaillée dans l’arbre décisionnel de la schizophrénie.
Questions fréquentes
Faut il proposer une psychothérapie ciblée à un patient qui entend encore des voix sous antipsychotique ?
Ces données soutiennent la proposition, sans la rendre obligatoire. Le bénéfice moyen est de faible amplitude et la certitude des preuves est jugée faible par les auteurs, mais il se maintient au suivi et l’acceptabilité est bonne, les abandons étant identiques dans les deux bras. La tolérance, elle, est mal documentée : huit essais sur vingt-trois ne rapportent aucun effet indésirable, ce qui ne veut pas dire qu’il n’y en a pas eu. Dans une situation où l’alternative est souvent l’augmentation posologique ou l’association d’antipsychotiques, le rapport entre le bénéfice attendu et le risque encouru penche néanmoins du côté de la proposition.
La thérapie par avatar est elle supérieure à la thérapie cognitivo-comportementale ?
Ce travail ne le démontre pas. Il montre que le sous-groupe des six essais d’avatar est le seul à atteindre la signification contre ses propres contrôles, tandis que le sous-groupe des trois essais de thérapie cognitivo-comportementale ne l’atteint pas (0,05 ; IC 95 % : −0,18 à 0,28). Comparer ces deux chiffres n’est pas une comparaison randomisée : les essais diffèrent par leurs comparateurs, leur qualité et leur puissance, et trois essais ne suffisent pas à conclure à une absence d’effet. Les auteurs inscrivent d’ailleurs cette réserve dans leurs limites. La méta-analyse en réseau publiée en 2026 dans Psychological Medicine, qui pose directement cette question, ne retrouve pas de différence significative sur la sévérité des hallucinations en fin de traitement, et un avantage à trois mois dont l’intervalle de confiance frôle zéro.
Pourquoi la revue Cochrane de 2020 était elle négative sur l’avatar ?
Elle disposait de trois études et 195 participants, toutes à risque de biais élevé sur au moins un domaine, avec des niveaux de certitude majoritairement très faibles à faibles et des données de court terme uniquement. Le corpus a grossi depuis, notamment avec l’essai britannique AVATAR2 de 2024 et l’essai danois de 2025, qui pèsent lourd dans le sous-groupe. Un changement de conclusion lié à l’accumulation de données est le fonctionnement normal de la médecine fondée sur les preuves, à condition que les nouvelles données soient de meilleure qualité. Sur ce point précis, elles le sont : les essais d’avatar sont majoritairement à faible risque de biais et à comparateur actif, ce qui n’était pas le cas en 2020.
Une différence moyenne standardisée de −0,18, cela représente quoi pour un patient ?
Pas de traduction directe possible. Cet indice rapporte un écart de moyennes à la dispersion des mesures, ce qui permet d’agréger des échelles différentes mais interdit de le convertir en points d’échelle ou en heures de voix en moins. Par les conventions usuelles, la valeur reste sous le seuil d’un effet petit. Le nombre de sujets à traiter de 16 aide à se représenter l’ordre de grandeur, à condition de savoir qu’il dérive d’un critère continu et repose donc sur un seuil de réponse dont le détail est renvoyé au matériel supplémentaire.
Le fait que le patient sache ce qu’il reçoit invalide t il l’étude ?
Non, et l’article apporte de quoi le vérifier. Dans une psychothérapie, l’aveugle du participant est impossible ; ce qui reste possible, et devient décisif, c’est le masque de l’évaluateur. Quatorze des vingt-trois essais inclus sont à évaluation masquée, cinq sont ouverts, un partiellement masqué, deux ne le précisent pas et un ne repose que sur des auto-évaluations. Surtout, l’analyse restreinte aux essais à faible risque de biais, ce qui inclut le domaine de la mesure du critère, donne un effet plus grand, non plus petit. L’idée intuitive selon laquelle l’effet mesuré serait gonflé par des évaluateurs informés n’est donc pas soutenue par ces données.
Ces interventions sont elles accessibles en France ?
Les sources consultées ne permettent pas de décrire l’offre française, et aucun des vingt-trois essais inclus n’a été conduit en France. Le registre ClinicalTrials.gov, interrogé le 11 août 2026, ne recense aucun essai de thérapie par avatar proprement dite conduit en France, et un seul enregistrement français apparenté : un essai promu par le centre hospitalier universitaire de la Guadeloupe, dont le site déclaré est aux Abymes et dont les critères d’inclusion prévoient un recrutement au centre hospitalier universitaire de Nîmes, portant sur un programme de groupe qui comporte une séance de création d’avatar sur quinze, non encore recruteur. Un registre d’essais ne renseigne ni sur les soins courants, ni sur leur prise en charge.
Bibliographie commentée
Fässler L, Koop S, Opper F, Bighelli I, Leucht S, Sabé M, Bajbouj M, Knaevelsrud C, Böge K (2026). Psychological Interventions Targeting Auditory Hallucinations in Persons With Psychotic Disorders: A Systematic Review and Meta-Analysis. JAMA Psychiatry, publication en ligne avancée du 17 juin 2026 ; aucun volume ni pagination attribués à la date de vérification. DOI 10.1001/jamapsychiatry.2026.1443 · PMID 42307965 · PMCID PMC13276665. Étude source analysée ici. Accès libre sous licence CC BY-NC-ND. Texte intégral consulté, y compris les trois tableaux, le descriptif essai par essai et les informations sur les auteurs ; seul le matériel supplémentaire, dix-huit figures et huit tableaux électroniques, n’a pas été ouvert. Manuscrit accepté le 4 avril 2026, mis en ligne le 17 juin 2026, sans volume ni pagination attribués à la date de vérification, sans erratum ni correctif rattaché. Financement : bourse doctorale Elsa-Neumann du Land de Berlin, sans rôle déclaré des financeurs. Liens d’intérêts déclarés : honoraires personnels de douze laboratoires pour Stefan Leucht, hors travail soumis ; pour Kerem Böge, auteur senior, statut de cofondateur de trois entreprises de santé, Kiso GmbH, Mental Hub et FIL, et honoraires de conseil ou de conférence de Boehringer Ingelheim, Clicks Therapeutics et Angelini. Les auteurs déclarent aussi avoir eu recours à un modèle de langage pour la vérification linguistique, le contrôle du code R et le raccourcissement de sections.
Fässler L, Bighelli I, Leucht S, Sabé M, Bajbouj M, Knaevelsrud C, Böge K (2024). Targeted psychological and psychosocial interventions for auditory hallucinations in persons with psychotic disorders: Protocol for a systematic review and meta-analysis. PLOS One, 19(7), e0306324. DOI 10.1371/journal.pone.0306324 · PMID 38959279. Protocole préenregistré de la revue analysée, publié plus d’un an avant la clôture de la recherche. Utile pour mesurer l’écart entre l’intention et la réalisation : l’article final déclare des déviations au préenregistrement et les renvoie à une annexe du matériel supplémentaire. Financement doctoral déclaré dans le protocole : bourse Elsa-Neumann du Land de Berlin et soutien du Medical Scientist Program de la Charité, ce second financeur n’apparaissant plus dans l’article de 2026. Un protocole décrit une intention, il ne garantit pas ce qui a été fait.
Hsu TW, Liang CS, Changchien TC, Tseng PT, Carvalho AF, Stubbs B, Thompson T, Böge K, Hsu CW, Yang FC, Tu YK, Lin YH (2026). AVATAR versus cognitive-behavioral therapy for medication-resistant auditory hallucination: a systematic review and network meta-analysis. Psychological Medicine, 56, e107. DOI 10.1017/S0033291726104127 · PMID 41969063. Contrepoint indispensable, et méta-analyse en réseau cette fois, donc combinant comparaisons directes et indirectes. Sur 26 essais et 2 273 participants, pas de différence significative entre avatar et thérapie cognitivo-comportementale sur la sévérité des hallucinations en fin de traitement, avantage de l’avatar à trois mois et sur les symptômes psychotiques globaux, avec un effet des petites études objectivé et un risque de biais modéré à élevé. Kerem Böge est auteur des deux travaux, ce qui rend la divergence d’autant plus instructive. Publiée après l’acceptation du manuscrit de JAMA Psychiatry, elle n’y est pas discutée.
Aali G, Kariotis T, Shokraneh F (2020). Avatar Therapy for people with schizophrenia or related disorders. Cochrane Database of Systematic Reviews, 2020(5), CD011898. DOI 10.1002/14651858.CD011898.pub2 · PMID 32413166. État antérieur de la question : peu ou pas d’effet cohérent de la thérapie par avatar, sur trois études et 195 participants, toutes à risque de biais élevé sur au moins un domaine, avec des niveaux de certitude allant de très faible à modéré selon les critères et des données de court terme uniquement. Les auteurs y relevaient aussi que, dans l’un des essais, des auteurs avaient participé au développement du système évalué et que, dans un autre, des brevets étaient en cours de dépôt. Cette revue n’est pas citée dans l’article de 2026. À lire avant de considérer le résultat de 2026 comme acquis.
ClinicalTrials.gov, NCT07266376. Validation of a VOICE MAnagement Program in Schizophrenia. clinicaltrials.gov. Essai contrôlé randomisé décrit comme multicentrique, promu par le centre hospitalier universitaire de la Guadeloupe, avec le groupement interrégional de recherche clinique et d’innovation Sud-Ouest Outre-Mer comme partenaire. Un seul site est déclaré dans la fiche du registre, aux Abymes, mais les critères d’inclusion prévoient également un recrutement au centre hospitalier universitaire de Nîmes. Programme de groupe intégratif de quinze séances hebdomadaires de 90 minutes, dont la onzième est consacrée à la création d’un avatar de la voix, comparé à un atelier média ; 116 participants prévus, statut non encore recruteur à la date de consultation. Seule trace française apparentée identifiée sur ce registre. Source d’implantation, non source d’efficacité.
Ce qui a été consulté. Texte intégral de l’étude source consulté le 11 août 2026 dans sa version d’archive en accès libre, tableaux et informations sur les auteurs compris ; tous les chiffres cités en proviennent directement. Le matériel supplémentaire, dix-huit figures et huit tableaux électroniques, n’a pas été ouvert, et les rares éléments qui en dépendent sont signalés comme tels dans le corps de l’analyse. Références vérifiées sur Europe PMC, Crossref et OpenAlex le 11 août 2026, sans erratum ni correctif rattaché. Antériorité de la question vérifiée sur la Cochrane Library et Europe PMC le 11 août 2026. Implantation des interventions vérifiée sur le registre ClinicalTrials.gov le 11 août 2026. Cette analyse a fait l’objet d’une double lecture indépendante.
