Centre de ressources · Comprendre

Biais

La question que tout le monde se pose devant un résultat qui dérange, et à laquelle on répond rarement autrement que par un haussement d’épaules : est-ce que je peux y croire ?

Mise à jour 13 août 2026 Lecture 20 min 7 références vérifiées

← Comprendre·Centre de ressources

En une phrase. Un biais est un écart qui pousse toujours dans le même sens entre ce qu’une étude mesure et ce qu’elle croit mesurer. Aucun calcul ne le rattrape après coup.

01 Une scène ordinaire

Un essai compare une molécule à un placebo. La molécule donne des nausées à un patient sur deux, le placebo presque jamais. L’évaluateur, qui est censé ignorer qui reçoit quoi, coche son échelle de dépression après vingt minutes d’entretien pendant lesquelles le patient a parlé de son estomac.

L’essai est randomisé. Il est en double insu sur le papier. Il compte huit cents patients et il est publié dans une bonne revue.

Et l’insu n’existe plus.

Voilà un biais. Personne n’a triché, aucun calcul n’est faux, le protocole a été respecté à la lettre. Le résultat est quand même décalé, et il l’est toujours dans le même sens, celui qui favorise la molécule active.

En clair. Un biais n’est pas une faute. C’est une propriété de la façon dont l’étude a été montée. Chercher le coupable ne sert à rien, il n’y en a pas : il faut chercher le mécanisme.

Cette page répond à une question que je me pose devant à peu près chaque article, et vous aussi je suppose : jusqu’où puis-je croire ce que je viens de lire ? Elle est un peu longue. Bon, elle couvre ce qui sert vraiment en lecture courante, et vous pouvez piocher dedans par le sommaire.

02 Le hasard et le biais

Deux choses peuvent séparer le résultat d’un essai de la vérité. On les confond en permanence, et elles n’ont rien à voir.

La première est le hasard. Vous avez tiré un échantillon plutôt qu’un autre, et il tombe un peu à côté. L’erreur joue dans les deux sens, elle se mesure par l’intervalle de confiance, et elle rétrécit quand on ajoute des patients.

La seconde est le biais. Là, quelque chose dans le montage de l’étude pousse le résultat dans une direction. Toujours la même. L’erreur n’apparaît dans aucun intervalle de confiance, et elle ne rétrécit pas quand on ajoute des patients. Elle ne bouge pas du tout.

BIAISÉ ET PRÉCIS le grand essai mal conçu IMPRÉCIS ET JUSTE le petit essai bien conçu
Les intervalles de confiance décrivent la dispersion des tirs. Ils ne disent rien du décalage de la cible. La statistique lit la cible de droite et reste aveugle à celle de gauche.

En clair. Ajouter des patients rétrécit l’intervalle de confiance, ça ne déplace jamais un biais. Un grand essai biaisé n’est pas un essai plus fiable, c’est un essai biaisé mesuré avec précision. C’est la situation la plus dangereuse, parce que c’est la plus convaincante.

Retenez le réflexe inverse de celui qu’on a spontanément. Devant un essai de trente mille patients, il faut regarder le dispositif de plus près, pas de moins près. Le hasard ne peut plus expliquer grand-chose, alors tout ce qui reste d’écart vient d’ailleurs.

03 Ce que le tirage au sort protège

La randomisation est une invention remarquable, et elle est très souvent mal comprise.

Ce qu’elle fait : elle rend les deux groupes comparables au départ, sur tout, y compris sur ce qu’on n’a pas mesuré et sur ce à quoi personne n’a pensé. C’est ça qui est fort. Aucun ajustement statistique ne sait corriger un facteur qu’on ignore, le tirage au sort si.

Ce qu’elle ne fait pas : tout le reste.

TIRAGE AU SORT SUIVI MESURE ANALYSE jour 0 sorties d’étude qui cote, en sachant quoi ce qu’on rapporte protégé par le tirage TOUT LE RESTE DE L’ESSAI le tirage au sort n’y peut plus rien
La randomisation vaut au jour 0. Après, chaque étape peut réintroduire un écart systématique, et c’est là que se joue l’essentiel de la lecture critique d’un essai.

Un patient qui sort de l’étude n’a pas été tiré au sort pour en sortir. Un évaluateur qui devine le bras n’a pas été tiré au sort pour deviner. Un critère secondaire qu’on décide de mettre en avant après avoir vu les résultats n’a pas été tiré au sort non plus.

En clair. « Randomisé » veut dire que le départ est propre. Ça ne dit rien de la suite, et la suite fait la plus grande partie de l’essai.

04 Les quatre portes d’entrée

Les mécanismes portent des dizaines de noms dans la littérature. Les portes, elles, sont quatre. Une fois qu’on les a en tête, on les reconnaît vite.

Première porte, la sélection

Les patients comparés ne sont pas comparables, ou ils ne ressemblent pas à ceux que vous voyez.

En psychiatrie, c’est la porte la plus large. Regardez les critères d’exclusion d’un essai antidépresseur : idées suicidaires, trouble de l’usage de substances, comorbidité somatique instable, traitement psychotrope associé. Retirez tout ça de votre file active, il reste quoi ? Une minorité. L’essai reste valide, il répond simplement à une question qui n’est pas tout à fait la vôtre.

Deuxième porte, la mesure

Le critère est coté différemment selon le bras, ou il ne mesure pas ce qu’on croit.

C’est la scène du début. Un effet indésirable reconnaissable suffit à lever l’insu, sans que personne n’ait besoin d’ouvrir une enveloppe. Le problème s’aggrave quand le critère est subjectif, et les échelles psychiatriques le sont toutes, quoi qu’on en dise. Un critère dur, une hospitalisation, un décès, résiste beaucoup mieux.

Troisième porte, la confusion

Un troisième facteur explique le lien qu’on observe.

Le cas typique en psychiatrie tient en une phrase : on donne le traitement aux patients les plus graves, puis on constate que ceux qui l’ont reçu vont moins bien. Le traitement n’y est pour rien. C’est la gravité initiale qui parle, et elle parle fort. On appelle ça la confusion par indication, et elle explique une bonne part des associations trouvées dans les bases de données.

Le réflexe qui règle la question

Devant toute étude qui observe sans tirer au sort, posez cette question avant toutes les autres : pourquoi ces patients-là ont-ils reçu ce traitement-là ?

Si la réponse contient le mot « parce qu’ils allaient mal », vous tenez probablement l’explication du résultat, et le traitement n’a rien à voir avec lui.

Quatrième porte, ce qui sort de l’étude

Les patients qui partent, et les résultats qui ne sortent jamais.

Vingt pour cent de sorties d’étude ne sont pas un problème en soi. Vingt pour cent concentrés dans le bras le moins bien toléré, si : c’est le biais d’attrition. Quant aux critères secondaires, un essai en mesure souvent quinze et en met deux en avant. La question est de savoir si ces deux-là étaient prévus, ou choisis après. Quand ils sont choisis après, on parle de biais de report sélectif.

Porte Son nom dans la littérature Où la chercher dans l’article Le signe qui doit vous arrêter
Sélection Biais de sélection Critères d’inclusion et d’exclusion, flowchart (figure de flux) Une liste d’exclusions qui vide la population réelle
Mesure Biais de mesure, appelé aussi biais d’information ou biais de détection Qui cote le critère principal, et ce qu’il sait Critère subjectif, insu théorique, effets indésirables très typés
Confusion Biais de confusion, ici sous sa forme la plus fréquente, la confusion par indication Nature de l’étude, liste des facteurs ajustés Étude observationnelle, ajustements nombreux, aucune mention de l’indication
Sorties et report Biais d’attrition pour les patients qui partent, biais de report sélectif pour les résultats qui restent au tiroir Flowchart, protocole enregistré, critères annoncés Sorties déséquilibrées, critère principal différent de celui du registre

05 Les cinq questions à poser à un essai

L’outil de référence pour les essais randomisés s’appelle RoB 2. Il a cinq domaines, ni plus ni moins, et on ne peut pas en ajouter. Traduits en langage de consultation, ce sont cinq questions.

Domaine La question, en français Ce qui doit vous alerter
Processus de randomisation Le tirage au sort a-t-il vraiment eu lieu, et personne ne pouvait-il deviner le bras suivant ? Aucune mention de la façon dont la liste a été générée ni de la façon dont elle était tenue secrète
Écarts aux interventions prévues Les patients ont-ils reçu ce qui était prévu, et l’insu a-t-il tenu ? Traitements associés autorisés sans contrôle, insu jamais vérifié auprès des patients
Données manquantes Combien de patients manquent à l’arrivée, et est-ce la même proportion dans les deux bras ? Sorties nombreuses, déséquilibrées, ou remplacées par une méthode d’imputation non expliquée
Mesure du critère Qui a coté, et savait-il quel bras il cotait ? Critère subjectif coté par un évaluateur non indépendant
Sélection du résultat rapporté Ce qui est publié est-il bien ce qui était annoncé au départ ? Pas de protocole enregistré, ou un critère principal qui a changé en cours de route

En clair. Tirage, insu, perdus de vue, qui a coté, ce qui a été promis. Cinq questions, deux minutes, et vous avez fait l’essentiel du travail sur un essai. Le reste de l’outil sert à formaliser un jugement que vous avez déjà porté.

Chaque domaine reçoit l’un de trois verdicts, risque faible, quelques réserves, risque élevé. Et le verdict global prend le pire des cinq, jamais la moyenne. C’est logique : une seule porte ouverte suffit.

06 L’outil suit le document

Il n’existe pas d’instrument universel. Le type de publication commande l’outil, et se tromper d’outil donne un jugement sans valeur.

Publication Outil Structure Verdict rendu
Essai randomisé RoB 2 Cinq domaines, tous obligatoires Risque faible, quelques réserves, risque élevé
Étude non randomisée d’intervention ROBINS-I Sept domaines, ramenés à six dans la version 2 Faible, modéré, sérieux, critique, information absente
Revue systématique, méta-analyse AMSTAR-2 Seize items, dont sept critiques Confiance haute, modérée, basse, critiquement basse
Revue systématique, angle biais ROBIS Quatre domaines, suivant les phases de la revue Risque faible ou élevé, par domaine puis global
Recommandation de pratique AGREE II Six domaines de qualité d’élaboration Score par domaine, sans verdict unique

Deux détails sauvent beaucoup d’erreurs de lecture.

Le premier : dans AMSTAR-2, un seul item critique manqué classe la revue en confiance critiquement basse, même si les quinze autres sont satisfaits. Quinze sur seize peut valoir zéro. Ces outils ne s’additionnent pas, leurs auteurs déconseillent d’ailleurs explicitement d’en tirer un score.

Le second : les guides de rédaction ne sont pas des outils de biais. CONSORT, PRISMA et STROBE disent ce qu’un article doit contenir, pas si l’étude a été bien conduite.

En clair. Un guide de rédaction, c’est la liste de ce qu’il faut écrire. Un outil de biais, c’est l’examen de ce qui a été fait. Une étude ratée mais bien racontée coche toutes les cases du premier et échoue au second. Elle sera ratée de façon lisible, ce qui vaut quand même mieux que l’inverse.

07 Ce que les outils ne mesurent pas

Un risque de biais faible ne veut pas dire que l’étude est bonne, encore moins qu’elle vous concerne. Quatre choses restent hors du champ.

  • Est-ce que ça concerne vos patients. Un essai peut être irréprochable sur ses cinq domaines et porter sur des gens qui ne ressemblent pas aux vôtres. On appelle ça la validité externe. Aucun outil de biais ne l’évalue, et aucun ne prétend le faire.
  • L’ampleur du bénéfice. Elle n’entre dans aucune grille. C’est un autre objet, traité dans la page sur les tailles d’effet.
  • Les liens d’intérêts. RoB 2 n’a pas de domaine consacré au financement. Ils s’examinent à part, et ils s’examinent toujours.
  • La reproductibilité de l’évaluation elle-même. Point inconfortable, et bien documenté.

Sur ce dernier point, une étude a fait appliquer RoB 2 par quatre évaluateurs au critère principal de 70 essais randomisés, soit 280 évaluations, puis a mesuré leur accord.

Cet accord se chiffre par un coefficient dit kappa, qui vaut 0 quand deux lecteurs ne font pas mieux que le hasard et 1 quand ils tombent toujours d’accord. Sur le jugement global, il valait 0,16 (intervalle de confiance à 95 % : 0,08 à 0,24). À peine mieux que le hasard. Il n’atteignait un niveau correct que sur le domaine de la randomisation, à 0,45 (0,37 à 0,53), qui est aussi le plus factuel des cinq.

Le résultat a été discuté. Une correspondance a soutenu que ce coefficient est mal adapté ici, et en a proposé un autre donnant 0,59 (0,51 à 0,68), soit un accord modéré. Le désaccord porte sur l’ampleur du problème, pas sur son existence.

En clair. Deux lecteurs compétents, le même article, le même outil, et pas le même verdict. Ça n’invalide pas les outils. Ça interdit de les prendre pour des mesures. Un risque de biais est un jugement structuré, pas un résultat.

Je trouve cette donnée utile plutôt que gênante. Elle explique pourquoi une évaluation sérieuse se fait par deux lecteurs quand c’est possible, pourquoi on coche les items vérifiables avant de porter un jugement d’ensemble, et pourquoi un verdict de risque de biais devrait toujours s’accompagner de sa justification. Un verdict sans justification ne se discute pas, il se subit.

08 Le biais qu’on ne voit pas

Les biais précédents se cherchent dans le texte de l’article. Celui-ci se situe entre les articles, et il tient à ceux qui n’ont jamais paru. Aucune lecture, même très attentive, ne peut le repérer sur une publication isolée : ce qui manque n’est nulle part.

En 2008, Turner et collaborateurs ont comparé ce que la Food and Drug Administration avait reçu et ce que la littérature avait publié, pour 12 antidépresseurs et 12 564 patients. Sur 74 études enregistrées, 31 % n’ont jamais été publiées, soit 3 449 participants.

SELON LA FDA, SUR LES 74 ÉTUDES ENREGISTRÉES SELON LA LITTÉRATURE PUBLIÉE résultat positif négatif ou douteux jamais publiée
Chaque carré est une étude. En haut, le verdict de l’agence sur les 74 études enregistrées. En bas, ce que la littérature donnait à voir : 51 études publiées, dont 48 rapportées comme positives, et 23 qui n’ont jamais paru.

Le détail vaut le coup d’être lu lentement. 37 études jugées positives par l’agence ont été publiées, contre une seule non publiée. Les études jugées négatives ou douteuses ont, à trois exceptions près, soit disparu (22 études), soit été publiées sous une forme qui, selon les auteurs, donnait l’impression d’un résultat positif (11 études).

Résultat : la littérature laissait croire que 94 % des essais étaient positifs (intervalle de confiance à 95 % : 84 à 99), là où l’agence en comptait 51 % (39 à 63). Les deux intervalles ne se recouvrent pas. Les tailles d’effet calculées sur les seules publications dépassaient de 32 % celles calculées sur l’ensemble des données, avec un écart allant de 11 à 69 % selon la molécule.

Démontré L’écart entre le corpus enregistré et le corpus publié, pour cette classe et cette période, avec ses conséquences chiffrées sur les tailles d’effet.

Suggéré Que le phénomène ait reculé. Une actualisation des mêmes auteurs, sur des molécules plus récentes, retrouve une inflation moindre : 0,24 (0,18 à 0,30) sur les données de l’agence contre 0,29 (0,23 à 0,36) sur les publications, soit un écart de 0,05 au lieu de 0,10 pour les molécules anciennes.

Opinion Le classement des 11 publications jugées trompeuses. Les auteurs écrivent que c’est leur appréciation, et ils précisent ne pas pouvoir dire si le biais vient des auteurs, des industriels ou des revues.

En clair. Une méta-analyse ne peut agréger que ce qui existe. Si les essais négatifs manquent, elle sortira une estimation biaisée avec une méthode irréprochable. C’est la raison d’être des registres d’essais, et la raison pour laquelle une revue systématique qui n’examine pas le biais de publication laisse une question majeure ouverte.

09 Six erreurs fréquentes

Croire qu’un grand effectif protège du biais

Il protège du hasard, et de rien d’autre. Sur une très grande étude, la question du biais devient plus importante, pas moins.

Confondre qualité de rédaction et qualité de méthode

Un article clair, complet, conforme aux guides de rédaction, reste évaluable sur sa méthode. Il arrive qu’il soit mauvais. La transparence rend le défaut visible, elle ne l’efface pas.

Lire un risque de biais faible comme un feu vert

Faible risque de biais veut dire que l’essai mesure correctement ce qu’il mesure. Rien sur l’ampleur du bénéfice, rien sur la ressemblance entre ses patients et les vôtres.

Additionner les items d’une grille

Aucun de ces outils ne produit un score. Un seul item critique manqué fait basculer le verdict d’AMSTAR-2, quel que soit le reste.

Chercher tous les biais dans l’article

Le biais de publication ne se voit dans aucune publication prise isolément. Il se cherche dans les registres d’essais et dans ce qui manque.

Prendre « risque élevé » pour « résultat faux »

L’erreur inverse, moins fréquente et tout aussi coûteuse. Un risque élevé signale que le dispositif autorise un écart, pas qu’il y en a eu un. On perd de la confiance, on ne conclut pas au contraire.

10 Dans les analyses PEB

Deux cas du corpus où le risque de biais changeait la conclusion.

  • Condition cardio-respiratoire et risque psychiatrique. L’estimation portant sur les troubles psychotiques repose sur deux cohortes de conscrits masculins, dont une apporte 1 109 786 des 1 112 007 participants. Ça ressemble à une méta-analyse. En pratique, c’est une seule étude, dans une population très particulière. Lire l’analyse
  • Varénicline et bupropion dans le trouble de l’usage d’alcool. Quand un essai prévoit de tester ses comparaisons l’une après l’autre, la règle veut qu’on s’arrête à la première qui échoue : tout ce qui suit ne prouve plus rien, même avec un petit p. Un bras de cet essai se trouve après ce point d’arrêt, avec des valeurs de p pourtant favorables. Le dire non significatif serait faux. Le dire efficace aussi. Il n’est pas interprétable, et ça s’écrit autrement. Lire l’analyse

Ce que ça change lundi matin

  • Sur un essai, poser les cinq questions dans l’ordre. Tirage, insu, perdus de vue, qui a coté, ce qui était promis.
  • Sur une étude qui observe sans tirer au sort, chercher d’abord pourquoi ces patients-là ont reçu ce traitement-là.
  • Sur une méta-analyse, vérifier que le biais de publication a été recherché, et regarder le poids de la plus grosse étude incluse.
  • Ne jamais déduire d’un risque de biais faible que le résultat s’applique à vos patients. Deux questions distinctes.
  • Quand un essai est très grand, augmenter l’attention portée au dispositif, pas la confiance accordée au résultat.
  • Quand un article annonce un risque de biais sans dire sur quel domaine, considérer que l’information n’a pas été donnée.

Références

  1. Sterne JAC, Savović J, Page MJ, et al. RoB 2: a revised tool for assessing risk of bias in randomised trials. BMJ. 2019;366:l4898. doi:10.1136/bmj.l4898
  2. Sterne JA, Hernán MA, Reeves BC, et al. ROBINS-I: a tool for assessing risk of bias in non-randomised studies of interventions. BMJ. 2016;355:i4919. doi:10.1136/bmj.i4919
  3. Shea BJ, Reeves BC, Wells G, et al. AMSTAR 2: a critical appraisal tool for systematic reviews that include randomised or non-randomised studies of healthcare interventions, or both. BMJ. 2017;358:j4008. doi:10.1136/bmj.j4008
  4. Whiting P, Savović J, Higgins JPT, et al. ROBIS: a new tool to assess risk of bias in systematic reviews was developed. J Clin Epidemiol. 2016;69:225-234. doi:10.1016/j.jclinepi.2015.06.005
  5. Minozzi S, Cinquini M, Gianola S, Gonzalez-Lorenzo M, Banzi R. The revised Cochrane risk of bias tool for randomized trials (RoB 2) showed low interrater reliability and challenges in its application. J Clin Epidemiol. 2020;126:37-44. doi:10.1016/j.jclinepi.2020.06.015
  6. Turner EH, Matthews AM, Linardatos E, Tell RA, Rosenthal R. Selective publication of antidepressant trials and its influence on apparent efficacy. N Engl J Med. 2008;358(3):252-260. doi:10.1056/NEJMsa065779
  7. Turner EH, Cipriani A, Furukawa TA, Salanti G, de Vries YA. Selective publication of antidepressant trials and its influence on apparent efficacy: updated comparisons and meta-analyses of newer versus older trials. PLoS Med. 2022;19(1):e1003886. doi:10.1371/journal.pmed.1003886. PMID 35045113.

Psychiatry Evidence Base, la psychiatrie fondée sur les preuves, expliquée avec rigueur.