Publié le 13 août 2026, mis à jour le 14 septembre 2026
Trouble de stress post-traumatique complexe : l’outil de référence mesure-t-il ce que la CIM-11 décrit ?
L’essentiel
L’International Trauma Questionnaire est l’instrument construit pour opérationnaliser les deux diagnostics de la CIM-11, le trouble de stress post-traumatique et sa forme complexe. Cette méta-analyse d’analyses factorielles confirmatoires réunit 57 études et 43 066 participants dans 31 pays, et compare neuf modèles factoriels. Le modèle qui s’ajuste le mieux aux données n’est pas celui qui reproduit la structure de la CIM-11, mais un modèle à sept facteurs corrélés de premier ordre, dans lequel la dysrégulation affective se scinde en deux dimensions distinctes, une composante d’hyperactivation et une composante d’hypoactivation. Le modèle conforme à la CIM-11 conserve néanmoins un bon ajustement, et les auteurs concluent que l’instrument reste adéquat pour évaluer les deux diagnostics. Second résultat, de portée immédiate en consultation : la fiabilité de plusieurs sous-échelles de la version brève est insuffisante, en particulier celle de la dysrégulation affective, alors que les deux scores globaux restent fiables. Les données et le code sont déposés en accès ouvert, le protocole était enregistré à l’avance, et seuls 38 % des auteurs sollicités ont transmis leurs matrices de données.
Le contexte
Depuis que la CIM-11 a séparé le trouble de stress post-traumatique de sa forme complexe, la distinction repose sur trois groupes de symptômes supplémentaires regroupés sous le nom de perturbations de l’organisation du soi : la dysrégulation affective, le concept de soi négatif, et les difficultés relationnelles. L’instrument censé recueillir ces dimensions s’est imposé très vite, en recherche comme en clinique. Sa version finalisée, publiée en 2018, comporte douze items de symptômes, deux par groupe, auxquels s’ajoutent six items de retentissement fonctionnel, soit dix-huit items cotés de 0 à 4. Elle a été traduite dans vingt-cinq langues. Cette brièveté est un choix assumé de ses concepteurs, qui ont privilégié l’utilité clinique en retenant un nombre minimal d’indicateurs par dimension.
La question posée ici n’est pas de savoir si le trouble complexe existe. Elle est de savoir si l’instrument qui sert à l’identifier se comporte statistiquement comme la classification le suppose. C’est une question de psychométrie, et elle a des conséquences très concrètes sur ce qu’un clinicien a le droit de conclure d’un score. Les auteurs situent leur travail en indiquant qu’à ce jour, aucune synthèse quantitative n’avait examiné la structure latente de cet instrument, revendication restreinte à ce seul objet et qui laisse de côté les revues qualitatives antérieures, dont ils discutent longuement les résultats.
L’étude en un coup d’œil
| Population | |
| Participants ayant rempli l’International Trauma Questionnaire, tous types d’exposition traumatique, 31 pays, 43 066 personnes réparties dans 57 études publiées entre 2016 et 2024, et 58 échantillons distincts. Taille médiane des échantillons 307 (moyenne 743, étendue 44 à 4 944), âge moyen des études de 19,09 à 67,08 ans (médiane 37,4), proportion de femmes de 6,20 % à 100 % (moyenne 62 %). | |
| Intervention, au sens de l’analyse conduite | |
| Méta-analyse d’analyses factorielles confirmatoires par modélisation d’équations structurales en deux étapes, à effets aléatoires pour l’analyse principale, portant sur neuf modèles factoriels concurrents. Les analyses en sous-groupes ont dû recourir à des modèles à effets fixes, faute d’un nombre suffisant d’études. | |
| Comparateur | |
| Le modèle conforme à la CIM-11, soit deux facteurs de second ordre, le trouble de stress post-traumatique et les perturbations de l’organisation du soi, coiffant six groupes de symptômes, opposé notamment à un modèle à sept facteurs corrélés de premier ordre séparant deux composantes de dysrégulation affective, et à un modèle à six facteurs corrélés de premier ordre. | |
| Critère | |
| Qualité d’ajustement comparée des modèles sur six indices et le khi deux, puis fiabilité des scores par le coefficient oméga, et recherche de modérateurs par analyses en sous-groupes et méta-régression des saturations factorielles. | |
| Design | |
| Revue systématique conforme à PRISMA, enregistrée au registre PROSPERO sous le numéro CRD42023434942, huit bases de données interrogées en avril 2023 puis en avril 2024, sans restriction de langue, évaluation de la qualité par une version modifiée de la grille QualSyst, données et code déposés en accès ouvert sur la plateforme OSF. |
Le contrôle de qualité
| Point contrôlé | Jugement |
|---|---|
| Enregistrement préalable | Fait |
| ConstatProtocole déposé au registre PROSPERO sous le numéro CRD42023434942, ce qui limite la sélection a posteriori des modèles rapportés. La liste de contrôle PRISMA figure dans le matériel supplémentaire. | |
| Ampleur de l’échantillon | Solide |
| Constat43 066 participants, 57 études, 31 pays, huit bases de données. Rarement atteint en psychométrie. | |
| Accord entre évaluateurs | Élevé |
| ConstatKappa de Cohen de 0,91 pour la sélection sur titres et résumés, 0,93 sur textes intégraux, 0,89 pour l’évaluation de qualité. Divergences réglées par discussion, extraction discordante sur 8 des 472 données extraites. | |
| Qualité des études incluses | Contrastée |
| ConstatGrille QualSyst modifiée, quatre critères. 79 % des études (45 sur 57) sont classées de qualité élevée, 21 % de qualité modérée, aucune de qualité faible. Mais le critère qualité des données est le point faible du corpus : 27 études (48,2 %) y sont cotées faibles, principalement pour absence de rapport des données manquantes (24 études). | |
| Hétérogénéité | Élevée |
| ConstatAu premier stade de l’analyse, Q = 18 230,74 pour 3 586 degrés de liberté, p < 0,001, et I² compris entre 11,15 % et 97,49 % selon les corrélations. L’homogénéité est donc rejetée, ce qui impose de la prudence dans la généralisation. | |
| Transparence des données | Ouverte |
| ConstatDonnées et scripts déposés en accès ouvert sur OSF, analyses conduites sous R avec les packages metaSEM, OpenMx et lavaan, versions précisées. L’analyse est reproductible par un tiers. | |
| Obtention des données brutes | Partielle |
| ConstatAucune publication incluse ne fournissait de matrice de covariance complète. 126 auteurs ont été sollicités pour 185 études, avec 48 réponses, soit 38 %. Un biais de disponibilité ne peut être exclu, les équipes qui répondent n’étant pas nécessairement représentatives. | |
| Financement et liens d’intérêts | Déclarés |
| ConstatTravail académique, financé en partie par une bourse du Research Training Program du gouvernement australien et par le Conseil néerlandais de la recherche (projet VI.Vidi.201.009). Les auteurs déclarent n’avoir aucun conflit d’intérêts potentiel relatif à cette recherche, à sa rédaction et à sa publication. | |
Les résultats
| Résultat | Valeur |
|---|---|
| Modèle le mieux ajusté | Sept facteurs corrélés |
| LectureKhi deux 215,16 pour 33 degrés de liberté, RMSEA 0,011, SRMR 0,012, TLI 0,993, CFI 0,997, BIC négatif à -136,97, le plus bas des neuf modèles. Toutes les saturations sont substantielles, de 0,75 à 0,92, et les corrélations entre facteurs vont de 0,42 à 0,77. | |
| Modèle conforme à la CIM-11 | Bon ajustement, troisième rang |
| LectureLe modèle à deux facteurs de second ordre atteint RMSEA 0,020, SRMR 0,029, TLI 0,980, CFI 0,986, valeurs qui correspondent à un bon ajustement selon les seuils retenus. Il arrive au troisième rang derrière le modèle à sept facteurs et le modèle à six facteurs corrélés. La corrélation entre le facteur post-traumatique et le facteur des perturbations de l’organisation du soi est de 0,68, ce qui les rend liés mais distinguables. Les auteurs écrivent explicitement qu’il ne doit pas être écarté. | |
| Nature de la septième dimension | Scission de la dysrégulation affective |
| LectureUne composante d’hyperactivation et une composante d’hypoactivation se comportent statistiquement comme deux dimensions distinctes plutôt que comme une seule. La supériorité de ce modèle se reproduit sur la version longue à 22 items et sur trois versions modifiées de l’instrument, ce qui rend peu probable un artefact lié à la redondance des items. | |
| Fiabilité des scores globaux | Bonne à excellente |
| LectureDans le modèle conforme à la CIM-11, oméga hiérarchique atteint 0,84 pour le score post-traumatique et 0,87 pour le score de perturbations de l’organisation du soi sur la version à 12 items, 0,89 et 0,96 sur la version à 22 items. Les seuils retenus par les auteurs sont 0,70 à 0,79 pour acceptable, 0,80 à 0,89 pour bon, 0,90 et plus pour excellent. | |
| Fiabilité des sous-échelles | Insuffisante pour quatre sur six |
| LectureSur la version à 12 items, oméga vaut 0,61 pour la réexpérience, 0,69 pour l’évitement, 0,66 pour le sentiment de menace actuelle et 0,43 pour la dysrégulation affective, toutes en dessous du seuil acceptable. Seuls le concept de soi négatif (0,84) et les difficultés relationnelles (0,71) l’atteignent. C’est le résultat le plus directement utilisable en consultation : un score de sous-échelle pris isolément ne porte pas une information suffisamment stable. | |
| Version longue à 22 items | Meilleure, mais insuffisante aussi |
| LectureLes valeurs d’oméga y sont plus élevées (0,77 pour l’évitement, 0,74 pour le sentiment de menace, 0,78 pour les difficultés relationnelles), mais la dysrégulation affective reste à 0,55, et ses deux composantes, une fois séparées, à 0,49 pour l’hyperactivation et 0,66 pour l’hypoactivation, malgré cinq et quatre items. Le nombre d’items n’explique donc pas tout. | |
| Recherche de modérateurs | Effets significatifs, ampleur négligeable |
| LectureLa méta-régression des saturations met en évidence une modération statistiquement significative par le caractère post-traumatique de l’échantillon (khi deux 61,80 à 12 degrés de liberté, p < 0,001, variation moyenne de -0,10), par le franchissement du seuil de forme complexe probable (khi deux 585,73, p < 0,001, variation moyenne de -0,11), par la sévérité symptomatique et par la langue d’administration (variations moyennes de -0,01). Les auteurs retiennent le seuil de 0,10 en valeur absolue en deçà duquel une différence de saturation est jugée non substantielle, et concluent que ces effets, bien que significatifs, ne modifient pas la structure. Le type de trauma n’a pas été testé comme modérateur. | |
| Fiabilité selon la population | Plus basse en clinique |
| LectureLes échantillons post-traumatiques ont des estimations de fiabilité inférieures, de -0,06 à -0,15 selon les sous-échelles, et les groupes atteignant le seuil de forme complexe probable descendent jusqu’à -0,22 sur la réexpérience. Autrement dit, l’instrument est le moins fiable au niveau des sous-échelles précisément là où il est le plus utilisé. | |
Lecture critique
| Domaine | Jugement |
|---|---|
| Recherche et sélection des études | Faible risque |
| ConstatHuit bases de données, protocole enregistré, critères explicites, aucune restriction de langue, double sélection avec accord élevé. | |
| Disponibilité des données primaires | Risque modéré |
| ConstatLe taux de réponse de 38 % ouvre la possibilité que les échantillons analysés diffèrent systématiquement de ceux qui n’ont pas pu l’être. Les auteurs reconnaissent par ailleurs que la littérature grise n’a pas été exhaustivement couverte. | |
| Comparaison des modèles | Faible risque |
| ConstatNeuf modèles comparés sur six indices d’ajustement, avec trois analyses de sensibilité, l’une excluant les études de qualité faible ou modérée, l’autre les traductions non retraduites, la troisième les études mal cotées sur les données manquantes. La comparaison n’est pas restreinte au modèle favori des auteurs, et la hiérarchie se maintient dans les trois cas. | |
| Portée du résultat factoriel | À ne pas durcir |
| ConstatUn meilleur ajustement statistique ne démontre pas qu’une catégorie diagnostique est fausse. Les auteurs concluent au contraire que l’instrument est adéquat pour évaluer les deux diagnostics de la CIM-11, que le modèle conforme à cette classification garde un bon ajustement, et qu’il peut rester préférable en clinique tant que la conceptualisation de la forme complexe n’est pas affinée. Cette nuance doit être conservée. | |
| Invariance de mesure | Non testée |
| ConstatLes auteurs indiquent explicitement que l’objet du travail n’était ni les variances des facteurs latents ni le test d’invariance, et que le recours à des matrices de corrélations plutôt que de covariances ne le permettait pas. Trente et un pays représentés ne valent donc pas démonstration d’équivalence de mesure entre langues et contextes. La méta-régression par langue d’administration ne remplace pas ce test. | |
| Analyses en sous-groupes | Risque modéré |
| ConstatLe sous-groupe post-traumatique ne compte que 9 études pour 6 151 participants et a dû être analysé à effets fixes, ce qui restreint la généralisation au-delà des études incluses. La méthode employée n’autorise pas non plus les modérateurs continus ni l’inclusion simultanée de plusieurs modérateurs, ce qui expose à la confusion. | |
Niveau de preuve
L’échelle d’Oxford ne comporte pas de rubrique pour la validité structurale d’un instrument : ses niveaux répondent à des questions de traitement, de diagnostic, de pronostic ou de risque. Aucun niveau n’est donc retenu ici, et nous préférons le dire plutôt que de transposer une graduation hors de son domaine. La confiance est élevée sur le constat de fiabilité insuffisante des sous-échelles brèves, qui repose sur un très grand échantillon, une méthode transparente et des données ouvertes. Elle est élevée également sur le meilleur ajustement du modèle à sept facteurs, avec deux réserves : cela concerne la structure de l’instrument et non la validité de la catégorie diagnostique, et l’hétérogénéité entre études est importante. Elle est plus faible sur la transposition à un contexte linguistique particulier, faute d’analyse d’invariance dans ce travail.
Le test du confrère
Ce que dirait un confrère expérimenté à qui l’on présente cette étude en deux minutes, entre deux consultations.
« Je continue à utiliser l’instrument, mais je lis les deux scores globaux et je ne commente plus une sous-échelle isolée. Le reste, c’est l’entretien qui le donne. »
Traduction pour la pratique : un score élevé sur une seule dimension des perturbations de l’organisation du soi ne suffit pas à fonder un raisonnement clinique. Les deux scores globaux, oui.
Ce que vous pouvez en faire
- Utiliser les deux scores globaux de l’instrument, celui du trouble de stress post-traumatique et celui des perturbations de l’organisation du soi, et s’y tenir pour toute décision. Leur fiabilité est bonne, celle des sous-échelles ne l’est pas.
- Ne pas fonder une conclusion sur une sous-échelle prise isolément dans la version brève, en particulier celle de la dysrégulation affective, dont le coefficient oméga tombe à 0,43. La somme de deux items ne mesure pas une dimension de façon stable.
- Se souvenir que la fiabilité des sous-échelles baisse encore dans les populations les plus symptomatiques, celles précisément que l’on reçoit en consultation spécialisée.
- Si l’objectif est un profil détaillé par dimension, envisager la version longue à 22 items plutôt que la version brève, comme le suggèrent les auteurs, sans attendre qu’elle règle tout : la dysrégulation affective y reste sous le seuil acceptable.
- Explorer la dysrégulation affective dans les deux sens en entretien, ce qui déborde et ce qui s’éteint, plutôt que comme une dimension unique.
- Compléter systématiquement l’auto-questionnaire par l’entretien clinique avant de retenir le diagnostic de forme complexe.
- Savoir répondre à un patient qui a rempli le questionnaire : l’outil oriente, il ne pose pas le diagnostic.
Questions fréquentes
Cette étude remet-elle en cause le trouble de stress post-traumatique complexe ?
Non. Elle porte sur la structure factorielle de l’instrument qui sert à le mesurer. Les auteurs concluent que cet instrument est adéquat pour évaluer les deux diagnostics de la CIM-11 et que le modèle conforme à cette classification, qui garde un bon ajustement, ne doit pas être écarté.
Faut-il abandonner l’instrument ?
Rien dans cette analyse ne le suggère. Les auteurs le décrivent comme une mesure brève et solide au niveau des deux facteurs globaux. Ce qui est déconseillé, c’est l’usage isolé des sous-échelles, pas l’usage de l’outil.
Que signifie concrètement une fiabilité insuffisante ?
Que le score d’une sous-échelle varie trop, entre items censés mesurer la même chose, pour porter seul une décision clinique. Avec deux items par dimension dans la version brève, une réponse atypique déplace tout le score.
Le résultat vaut-il pour la version française ?
Une étude française figure parmi les 57 incluses, et le français fait partie des langues de traduction représentées. Mais l’invariance de mesure entre langues n’a pas été testée dans ce travail, les auteurs le disent eux-mêmes. La validation de la version française est donc à vérifier séparément.
Le modèle à sept facteurs va-t-il remplacer la CIM-11 ?
Ce n’est pas ce que dit l’étude. Les auteurs suggèrent que les futures révisions de la classification pourraient spécifier les deux dimensions d’hyperactivation et d’hypoactivation. C’est une proposition argumentée, pas une décision de nomenclature.
Bibliographie commentée
Étude source. Kindred R, Jak S, Hamer R, Nedeljkovic M, Bates GW. Evaluating the ICD-11 PTSD and Complex PTSD Constructs: A Meta-Analytic Confirmatory Factor Analysis of the International Trauma Questionnaire. Assessment, 2026, volume 33, numéro 4, pages 510 à 532. DOI 10.1177/10731911251340837. PMID 40448311. Méta-analyse d’analyses factorielles confirmatoires par équations structurales en deux étapes, 57 études, 43 066 participants, 31 pays, protocole enregistré au registre PROSPERO sous le numéro CRD42023434942, données et scripts déposés sur OSF. Fascicule de juin 2026, publication électronique du 30 mai 2025.
Ce qui a été consulté. Références vérifiées le 13 août 2026 sur la version publiée. Le matériel supplémentaire, un fichier unique regroupant les tableaux supplémentaires 1 à 22 et les figures supplémentaires 1 et 2, n’a pas été consulté : il n’accompagnait pas la version dont nous disposions. Aucun chiffre de cette analyse n’en provient. Article soumis à une double lecture indépendante.
Collections éditoriales
Étiquettes
