Médecine fondée sur les preuves : interprétation des résultats d'études

Résumé

L'interprétation des résultats d'une étude doit suivre un ordre fixe. Commencez par la question, le schéma d'étude et le critère de jugement principal. Évaluez ensuite le risque de biais, lisez la taille de l'effet conjointement avec son intervalle de confiance et traduisez les effets relatifs en conséquences absolues pour un risque de base pertinent. Ce n'est qu'ensuite que la valeur p doit être prise en compte. La significativité statistique ne démontre ni que l'effet est cliniquement important, ni que le résultat est exempt de biais. Un résultat non significatif ne démontre pas que les traitements sont équivalents.

Les essais randomisés fournissent en règle générale le meilleur niveau de preuve pour les effets thérapeutiques, mais la randomisation ne protège pas contre un défaut d'assignation secrète, les perdus de vue, la publication sélective des résultats ou des analyses inappropriées. Les études observationnelles peuvent être indispensables pour le pronostic, les effets indésirables rares et les effets à long terme, mais les associations doivent être évaluées en tenant particulièrement compte des facteurs de confusion, de la sélection et des biais liés au temps. Les revues systématiques ne sont pas automatiquement fiables. Leur valeur dépend de la recherche documentaire, de l'inclusion des études, du risque de biais, de l'hétérogénéité et du biais de publication.

Enfin, l'applicabilité du résultat doit être appréciée au regard du risque du patient concerné, de ses comorbidités, des alternatives thérapeutiques, de ses valeurs et de la durée de suivi. Une conclusion clinique raisonnable précise donc la direction de l'effet, son ampleur, son incertitude, le niveau de confiance dans les preuves ainsi que le bénéfice et le risque absolus attendus.

Un ordre pratique d'interprétation

Les recommandations de rédaction telles que CONSORT, STROBE et PRISMA améliorent la transparence des rapports d'essais randomisés, d'études observationnelles et de revues systématiques, respectivement [1-3]. Elles ne constituent pas pour autant des labels de qualité. Une étude bien rédigée peut être méthodologiquement faible, tandis qu'une étude mal rapportée peut parfois avoir été bien conduite tout en restant impossible à évaluer.

La démarche suivante réduit le risque que la conclusion soit dictée par le titre de l'article, le résumé ou la valeur p :

flowchart TD
A["Formuler la question clinique<br>et identifier le schéma d'étude"] --> B["Vérifier population,<br>intervention, comparateur et critères"]
B --> C["Identifier le critère principal<br>et l'analyse préenregistrée"]
C --> D["Évaluer le risque de biais<br>et les perdus de vue"]
D --> E["Lire la taille de l'effet et<br>l'intervalle de confiance"]
E --> F["Calculer l'effet absolu<br>pour un risque de base pertinent"]
F --> G["Évaluer la pertinence clinique,<br>les risques et la durée de suivi"]
G --> H["Apprécier la cohérence,<br>le caractère indirect et le biais de publication"]
H --> I["Déterminer si le résultat est<br>applicable au patient"]

GRADE distingue la qualité méthodologique des études individuelles du niveau de confiance dans l'ensemble des preuves. Le niveau de confiance dans les preuves est gradé élevé, modéré, faible ou très faible en fonction du risque de biais, de l'incohérence, du caractère indirect, de l'imprécision et du biais de publication. La gradation des preuves doit être distinguée de la force de la recommandation, car le bénéfice, les risques, la consommation de ressources et les préférences des patients influencent également la décision clinique [4].

Commencer par la bonne question et le bon schéma d'étude

Structurer la question

Une question thérapeutique peut généralement être décrite à l'aide des éléments suivants :

  • Population : quels patients ont été étudiés ?
  • Intervention : quel traitement, quelle dose, quelle intensité et quelle durée de traitement ont été utilisés ?
  • Comparateur : placebo, absence de traitement, traitement standard ou contrôle actif ?
  • Critère de jugement : quels critères importants pour le patient ont été mesurés ?
  • Temps : à quel moment le critère a-t-il été mesuré ?

La question doit correspondre à l'estimand de l'étude, c'est-à-dire à l'effet que l'analyse vise réellement à estimer. L'effet de l'assignation à un traitement, l'effet de l'instauration d'un traitement et l'effet de l'observance du traitement selon le protocole sont des questions différentes.

Choisir le schéma d'étude en fonction de la question

Question clinique Schéma généralement le plus informatif Principales limites
Effet d'un traitement ou d'une prévention Essai contrôlé randomisé Perdus de vue, cross-over, insuffisance de l'aveugle, suivi court
Effets indésirables rares ou tardifs Grande cohorte, étude de registre, étude cas-témoins Facteurs de confusion, erreur de classement, sélection
Performance diagnostique Étude transversale ou cohorte prospective avec une référence pertinente Biais de spectre, biais de vérification, seuil inapproprié
Pronostic Cohorte d'inception avec un suivi suffisant Perdus de vue sélectifs, surajustement, événements concurrents
Prévalence Étude transversale représentative Biais d'échantillonnage et de non-réponse
Effet thérapeutique global Revue systématique et méta-analyse Défauts de la recherche, des études primaires, de la synthèse ou du rapport

Le schéma d'étude détermine les conclusions possibles. Un essai randomisé peut étayer un effet thérapeutique causal. Une étude observationnelle montre avant tout une association, même après ajustement statistique. Une étude diagnostique montre comment un test classe les patients, et pas nécessairement si l'introduction de ce test améliore la santé.

Évaluer la validité interne avant l'ampleur des résultats

Essais randomisés

La randomisation crée des groupes comparables en espérance, mais seulement si la séquence d'allocation est aléatoire et tenue secrète jusqu'à l'inclusion. L'assignation secrète ne doit pas être confondue avec l'aveugle :

  • L'assignation secrète empêche la personne qui inclut les patients de prévoir la prochaine allocation.
  • L'aveugle empêche les participants, les soignants ou les évaluateurs des critères d'être influencés par la connaissance de l'allocation.

Les données méta-épidémiologiques montrent qu'une génération de séquence et une assignation secrète inadéquates ou incertaines sont associées en moyenne à des effets thérapeutiques surestimés. Le problème est le plus marqué pour les critères évalués subjectivement et en l'absence d'aveugle des évaluateurs des critères [5].

Examinez au minimum les points suivants :

  1. La méthode de randomisation était-elle crédible ?
  2. L'allocation était-elle tenue secrète jusqu'à l'inclusion ?
  3. L'aveugle était-il possible, mis en œuvre et vraisemblablement efficace ?
  4. Le critère principal avait-il été défini avant tout accès aux données ?
  5. Les groupes ont-ils été analysés selon l'allocation initiale ?
  6. Quelle était l'ampleur des perdus de vue, pourquoi sont-ils survenus et différaient-ils entre les groupes ?
  7. Le suivi était-il suffisamment long pour le bénéfice comme pour les risques ?
  8. La publication est-elle conforme au protocole, au registre et au plan d'analyse statistique ?

Les tests de significativité statistique portant sur les caractéristiques initiales ne doivent pas servir à juger de la réussite de la randomisation. Des différences dues au hasard sont attendues. Il importe davantage de savoir si ces différences ont une portée pronostique, si elles ont pu résulter d'une sélection après randomisation et si l'analyse prévue a pris en compte les facteurs pronostiques forts.

Intention de traiter et per protocole

Une analyse en intention de traiter compare les participants selon leur groupe de randomisation, indépendamment de l'observance et du cross-over. Elle préserve l'équilibre pronostique conféré par la randomisation et estime en règle générale l'effet d'une stratégie thérapeutique ou de l'assignation à un traitement.

Une analyse per protocole restreint ou reclasse les participants selon leur observance. Elle peut mieux approcher l'effet du fait de suivre réellement le traitement, mais la protection conférée par la randomisation peut être perdue, car l'observance est souvent liée au pronostic.

La notion d'intention de traiter modifiée n'a pas de définition uniforme. Vérifiez précisément quels participants ont été exclus. Une exclusion après randomisation, par exemple de patients n'ayant jamais reçu de dose ou chez qui un prélèvement donné manquait, peut induire un biais de sélection.

Perdus de vue et données manquantes

La proportion de perdus de vue ne détermine pas à elle seule le risque de biais. Un taux de perdus de vue de cinq pour cent peut être grave s'il est lié au traitement et au critère de jugement, alors qu'une perte plus importante survenant au hasard a parfois moins de conséquences. Évaluez :

  • le nombre absolu et la proportion dans chaque groupe
  • les motifs et le moment de survenue
  • si l'événement a pu survenir après le dernier contact
  • les hypothèses retenues pour l'imputation
  • les analyses de sensibilité sous des hypothèses alternatives

Une analyse d'essais cardiovasculaires positifs a retrouvé un indice de fragilité médian de 13. Dans environ 30 % des essais, le nombre de perdus de vue dépassait l'indice de fragilité [6]. L'indice de fragilité indique le faible nombre d'événements qu'il suffit de modifier pour qu'un résultat binaire significatif devienne non significatif. Cet indicateur peut illustrer la fragilité statistique, mais ne remplace ni la taille de l'effet, ni l'intervalle de confiance, ni le risque de biais.

Financement et conflits d'intérêts

Le financement ne prouve pas en soi qu'une étude est erronée, mais doit faire partie de l'évaluation globale. Dans une revue méthodologique Cochrane, les études de médicaments et de dispositifs médicaux financées par l'industrie étaient plus souvent favorables au produit du promoteur, tant pour les résultats d'efficacité que pour les conclusions. Cette différence n'était pas entièrement expliquée par les domaines habituels du risque de biais [7].

Vérifiez donc le rôle du promoteur dans la conception, la gestion des données, l'analyse, la rédaction du manuscrit et la décision de publication. Examinez les liens financiers des auteurs et si des chercheurs indépendants avaient accès à l'intégralité des données.

Comprendre les mesures d'effet

Le résultat d'une étude doit être décrit selon trois composantes :

  1. L'estimation ponctuelle, l'estimation la plus compatible avec les données observées.
  2. L'incertitude, généralement un intervalle de confiance à 95 %.
  3. L'échelle clinique, par exemple le risque absolu, un score de symptômes ou la durée de survie.

Critères binaires

Supposons, à titre hypothétique, qu'un événement survienne chez 20 % des patients du groupe contrôle et chez 15 % du groupe traité.

Mesure Calcul Résultat Interprétation
Risque dans le groupe contrôle 20 sur 100 20 % Risque de base
Risque dans le groupe traité 15 sur 100 15 % Risque sous traitement
Risque relatif, RR 0,15 / 0,20 0,75 Le risque relatif est inférieur de 25 %
Réduction du risque relatif 1 moins 0,75 25 % Diminution relative
Réduction du risque absolu 0,20 moins 0,15 5 points de pourcentage 5 événements de moins pour 100
Nombre de sujets à traiter, NNT 1 / 0,05 20 20 patients doivent être traités pendant la durée indiquée pour prévenir un événement

Le NNT doit toujours être rapporté à une population, un traitement, un critère et une durée. Un NNT de 20 à cinq ans n'est pas comparable à un NNT de 20 à 30 jours. Le NNT est généralement arrondi à l'entier supérieur lorsqu'il décrit un bénéfice. Pour les effets délétères, on utilise souvent le nombre de sujets à traiter pour nuire, NNH.

L'effet absolu dépend du risque de base. Si un RR de 0,75 peut être transposé à une population dont le risque est de 4 %, le risque sous traitement devient d'environ 3 %, la réduction du risque absolu de 1 point de pourcentage et le NNT d'environ 100. Un même effet relatif peut donc être cliniquement important chez les patients à haut risque, mais marginal chez les patients à faible risque.

Odds ratio

L'odds ratio, OR, compare des cotes plutôt que des risques. Lorsque l'événement est rare, l'OR est proche du RR. Pour des événements fréquents, l'OR peut donner une impression d'effet plus marquée et ne doit pas être présenté comme un risque relatif.

Dans les études cas-témoins, le risque absolu ne peut normalement pas être calculé directement à partir de l'échantillon, car le nombre de cas et de témoins est fixé par le schéma d'étude. L'OR y est la mesure d'association naturelle.

Critères continus

Une différence de moyennes conserve l'unité d'origine, par exemple une pression artérielle systolique inférieure de 4 mm Hg ou une douleur inférieure de 1,5 point. Demandez-vous si la différence dépasse l'erreur de mesure et si elle est cliniquement importante.

La différence de moyennes standardisée est utilisée lorsque des études mesurent le même phénomène avec des échelles différentes. Le résultat est exprimé en écarts-types et est moins intuitif. Sa portée clinique dépend de la validité des échelles et de la variabilité des populations étudiées.

La différence minimale cliniquement importante n'est pas une constante universelle. Elle peut dépendre de la valeur initiale, de la sévérité de la maladie, du point de vue du patient, de la méthode et du fait que la variation concerne un individu ou un groupe. Comparez donc l'intervalle de confiance à la fois à zéro et à un seuil clinique justifié a priori.

Critères de type délai jusqu'à événement

Un hazard ratio, HR, compare l'intensité instantanée de survenue des événements entre les groupes. Un HR de 0,75 ne signifie pas automatiquement que 25 % des événements sont évités, que la survie est prolongée de 25 % ou que le risque à un instant donné est inférieur de 25 %.

Interprétez le HR conjointement avec :

  • les courbes de Kaplan-Meier ou les courbes d'incidence cumulée
  • le nombre de patients à risque au cours du temps
  • les risques absolus d'événement à des moments cliniquement pertinents
  • la durée médiane de suivi
  • l'évaluation de l'hypothèse des risques proportionnels

Si les courbes se croisent, un HR unique peut être trompeur. Des alternatives telles que la survie moyenne restreinte peuvent alors être plus informatives.

En présence de risques concurrents, par exemple un décès d'une autre cause avant l'insuffisance rénale, la méthode de Kaplan-Meier classique peut surestimer la probabilité de l'événement étudié. Dans une revue d'essais randomisés comportant des critères de type délai jusqu'à événement, 31 sur 40 étaient potentiellement exposés à des risques concurrents, mais seuls cinq rapportaient une fonction d'incidence cumulée [8]. Les événements concurrents ne doivent pas être traités sans esprit critique comme une censure ordinaire.

Intervalles de confiance, valeurs p et pertinence clinique

L'intervalle de confiance

Un intervalle de confiance à 95 % décrit les tailles d'effet compatibles avec les données et les hypothèses du modèle. Si l'on répétait les études avec la même méthode, 95 % des intervalles calculés contiendraient la vraie valeur du paramètre.

La valeur nulle est :

  • RR, OR ou HR = 1
  • différence de risques ou différence de moyennes = 0

Un intervalle étroit traduit une plus grande précision qu'un intervalle large, mais la précision ne garantit pas l'exactitude. Une très grande étude observationnelle peut produire un intervalle extrêmement étroit autour d'une estimation biaisée.

Quatre profils fréquents sont :

Résultat Intervalle de confiance Interprétation raisonnable
Effet cliniquement important Exclut zéro et un effet négligeable Argument en faveur d'un effet pertinent, si le risque de biais est faible
Statistiquement significatif mais effet négligeable Exclut zéro mais reste proche du seuil clinique Bénéfice clinique probablement faible
Non significatif et précis Exclut un effet cliniquement important Argument contre un effet notable
Non significatif et imprécis Englobe à la fois un bénéfice et un effet délétère importants Information insuffisante, pas une preuve d'absence d'effet

La valeur p

La valeur p est la probabilité, sous l'hypothèse nulle et sous les hypothèses du modèle d'analyse, d'observer un résultat au moins aussi extrême que celui obtenu. Ce n'est pas :

  • la probabilité que l'hypothèse nulle soit vraie
  • la probabilité que le résultat soit dû au hasard
  • la taille de l'effet
  • la probabilité que le résultat soit reproduit
  • une mesure de la pertinence clinique

Le seuil de 0,05 est une convention, et non une frontière biologique. Des résultats avec p = 0,049 et p = 0,051 ne doivent pas être traités comme qualitativement opposés. Rapportez et interprétez la valeur p exacte conjointement avec la taille de l'effet et l'intervalle de confiance.

Analyses multiples

Si 20 hypothèses indépendantes sont testées au seuil de 0,05, la probabilité d'au moins un résultat faussement positif est d'environ 64 % lorsque toutes les hypothèses nulles sont vraies. Le risque augmente avec la multiplication :

  • des critères de jugement
  • des moments d'évaluation
  • des doses
  • des sous-groupes
  • des modèles statistiques
  • des définitions alternatives

Déterminez donc si l'analyse était prédéfinie, testée de façon hiérarchique ou corrigée pour la multiplicité. Un critère secondaire significatif a peu de poids si le critère principal était négatif et qu'aucune stratégie de gestion de la multiplicité n'était prévue.

Une présentation trompeuse, souvent appelée spin, consiste pour les auteurs à mettre en avant des critères secondaires, des sous-groupes ou des formulations favorables alors que le critère principal n'étaye pas la conclusion. Dans une revue systématique d'essais de non-infériorité négatifs en oncologie, un spin a été identifié dans 75 % des rapports [9]. Lisez donc la section des résultats avant la conclusion de la discussion.

Pertinence des critères de jugement

Critères principaux, secondaires et exploratoires

Le critère principal détermine généralement le calcul de la taille de l'échantillon et le test d'hypothèse principal. Les critères secondaires peuvent apporter des informations complémentaires importantes, mais leur robustesse statistique est souvent moindre. Les analyses post hoc sont génératrices d'hypothèses.

Vérifiez que :

  • le critère principal est identique dans le registre, le protocole, le plan d'analyse et la publication
  • le moment d'évaluation n'a pas été modifié
  • la définition du critère n'a pas été modifiée après accès aux données
  • tous les critères importants prédéfinis sont rapportés

Critères importants pour le patient et critères de substitution

La mortalité, la capacité fonctionnelle, les symptômes, la qualité de vie, l'hospitalisation et les complications graves sont habituellement plus directement pertinents que des valeurs biologiques ou des mesures d'imagerie. Un critère de substitution peut être utile s'il est bien validé pour la maladie, le mécanisme d'action du traitement et la population de patients concernés. Une association entre le critère de substitution et le critère clinique ne suffit pas. Il faut également des arguments montrant que l'effet du traitement sur le critère de substitution prédit de manière fiable son effet sur le critère important pour le patient.

Critères composites

Les critères composites augmentent le nombre d'événements et la précision statistique, mais peuvent masquer la composante qui détermine le résultat. Évaluez chaque composante séparément en ce qui concerne :

  1. son importance pour le patient
  2. sa fréquence
  3. la direction et l'ampleur de l'effet
  4. sa sensibilité aux décisions de l'évaluateur

Plus les composantes diffèrent en pertinence clinique et en fréquence, moins le critère composite est informatif. Une diminution du critère combinant décès, infarctus ou recours aux soins peut être entièrement portée par un plus grand nombre de recours aux soins, sans effet démontré sur le décès ou l'infarctus [10].

Effets indésirables

L'absence de différence statistiquement significative en matière d'effets indésirables démontre rarement que les traitements sont aussi sûrs l'un que l'autre. Les essais sont habituellement dimensionnés pour l'efficacité, et non pour des effets délétères rares. Examinez le recueil actif ou passif, les définitions, la durée d'exposition, le nombre de patients traités et la prise en compte des arrêts de traitement.

Les articles publiés peuvent contenir nettement moins d'informations sur les effets délétères que les rapports d'étude clinique. Dans une comparaison de cinq essais sur l'orlistat, les méthodes et les données complètes sur les effets indésirables étaient décrites de façon plus détaillée dans les rapports d'étude que dans les publications des revues [11]. L'évaluation de la sécurité nécessite donc souvent des données de registre, des rapports réglementaires et des études observationnelles de plus longue durée, en complément des essais randomisés.

Schémas d'étude particuliers

Non-infériorité et équivalence

Un essai de non-infériorité doit montrer que le nouveau traitement n'est pas inférieur au contrôle au-delà d'une marge prédéfinie. Il ne montre pas que les traitements sont identiques. La marge doit être justifiée sur les plans clinique et méthodologique.

L'interprétation doit reposer sur la position de l'intervalle de confiance par rapport à la fois à la différence nulle et à la marge. Les analyses en intention de traiter et per protocole sont toutes deux importantes, car une mauvaise observance peut faire paraître les traitements plus semblables et favoriser ainsi une conclusion de non-infériorité.

Dans une revue de 209 essais de non-infériorité et d'équivalence, la marge était définie dans 94 % des cas mais justifiée dans environ un quart seulement. Les analyses en intention de traiter et per protocole étaient toutes deux rapportées dans moins de la moitié des essais, et 21 % des conclusions ont été jugées erronées ou incompréhensibles [12].

Un résultat non significatif dans un essai de supériorité classique ne prouve ni la non-infériorité ni l'équivalence. De telles conclusions exigent un essai spécifiquement conçu, avec une marge prédéfinie et une précision suffisante.

Sous-groupes

Un résultat significatif dans un sous-groupe mais pas dans un autre ne démontre pas que l'effet du traitement diffère entre les groupes. Un test d'interaction est nécessaire.

Un effet de sous-groupe crédible doit :

  • être prédéfini
  • reposer sur une hypothèse biologiquement ou cliniquement plausible
  • concerner un petit nombre de sous-groupes testés
  • montrer une interaction étayée statistiquement
  • être cohérent entre des critères apparentés
  • idéalement être confirmé dans d'autres études

Les sous-groupes fondés sur des variables mesurées après la randomisation, par exemple l'observance ou la réponse précoce au traitement, sont particulièrement exposés aux biais.

Études diagnostiques

De la sensibilité à la décision clinique

La sensibilité est la proportion de malades dont le test est positif. La spécificité est la proportion de non-malades dont le test est négatif. Ces mesures sont moins directement influencées par la prévalence que les valeurs prédictives, mais varient selon le spectre de la maladie, le seuil, les tests antérieurs et le contexte clinique [13].

La valeur prédictive positive indique la probabilité de maladie après un test positif dans la population étudiée. La valeur prédictive négative indique la probabilité d'absence de maladie après un test négatif. Toutes deux se modifient lorsque la prévalence ou la sélection des patients change.

Les rapports de vraisemblance sont souvent plus transposables :

  • Rapport de vraisemblance positif : sensibilité / (1 moins spécificité)
  • Rapport de vraisemblance négatif : (1 moins sensibilité) / spécificité

La cote post-test se calcule en multipliant la cote pré-test par le rapport de vraisemblance. Une probabilité se convertit en cote par la formule p/(1−p)p/(1-p).

Un test dont le rapport de vraisemblance positif est de 10 augmente nettement plus la probabilité de maladie qu'un test dont le rapport de vraisemblance positif est de 2. Son utilité clinique dépend néanmoins du franchissement, par la probabilité post-test, d'un seuil de traitement, d'examens complémentaires ou d'abstention-surveillance.

Risque de biais dans les études diagnostiques

STARD recommande un rapport transparent portant notamment sur la sélection des patients, le test index, la référence, les seuils, l'aveugle, les résultats indéterminés et le flux des patients [14]. QUADAS-2 structure l'évaluation en quatre domaines : sélection des patients, test index, référence ainsi que flux et chronologie [15].

Soyez particulièrement attentif :

  • à un schéma cas-témoins comparant des cas sévères à des témoins sains
  • à l'exclusion des patients difficiles à classer
  • au fait que seuls les patients dont le test est positif bénéficient de la référence
  • à l'utilisation de références différentes selon les groupes
  • à la connaissance du test index lors de l'interprétation de la référence
  • au choix guidé par les données d'un seuil optimal
  • à un délai long ou variable entre les tests

L'AUC d'une courbe ROC résume la discrimination sur de nombreux seuils possibles, mais ne détermine pas quel seuil est cliniquement approprié et ne tient pas directement compte des conséquences des résultats faussement positifs et faussement négatifs.

Modèles pronostiques et prédiction du risque

Un modèle pronostique ne doit pas être évalué uniquement à partir de prédicteurs statistiquement significatifs. Les éléments plus importants sont :

  • la discrimination, capacité du modèle à classer les risques
  • la calibration, concordance entre risque prédit et risque observé
  • l'utilité clinique aux seuils de décision pertinents
  • la validation interne et externe
  • la gestion des données manquantes
  • le risque de surajustement

Un C-index élevé peut coexister avec une mauvaise calibration. Un modèle peut donc bien classer les patients tout en surestimant ou en sous-estimant systématiquement leur risque absolu. TRIPOD définit les exigences de rapport pour le développement, la validation et la mise à jour des modèles diagnostiques et pronostiques [16].

Les résultats obtenus uniquement sur l'échantillon de développement sont souvent optimistes. Le partage aléatoire d'un petit jeu de données en une partie d'apprentissage et une partie de test est généralement moins efficient que l'utilisation de l'ensemble des données avec bootstrap ou validation croisée pour la validation interne. L'utilisation clinique exige en outre une validation externe dans une autre période, un autre contexte ou une autre population.

Études observationnelles

Une association n'est pas automatiquement une causalité

Un facteur de confusion existe lorsqu'un facteur influence à la fois l'exposition et le critère de jugement. Dans le biais d'indication, par exemple, les patients les plus malades reçoivent plus souvent un traitement, ce qui peut faire paraître ce traitement délétère. À l'inverse, la sélection de patients traités en meilleure santé peut créer un bénéfice apparent.

L'ajustement statistique n'élimine que la confusion liée à des variables mesurées suffisamment bien et modélisées correctement. Le score de propension, l'appariement et l'analyse de régression ne transforment pas une étude observationnelle en essai randomisé.

Évaluez en particulier :

  • comment les patients traités et non traités ont été sélectionnés
  • si les facteurs pronostiques importants ont été mesurés avant le traitement
  • l'équilibre avant et après ajustement
  • le chevauchement des probabilités de traitement
  • les erreurs de classement de l'exposition et du critère de jugement
  • l'existence d'un contrôle négatif ou d'autres analyses de sensibilité
  • si les résultats sont robustes face à une confusion non mesurée

Biais liés au temps

Le biais de temps immortel survient lorsqu'un patient doit survivre pendant une certaine période pour être classé comme exposé, alors que cette période est attribuée à tort au groupe exposé. Il peut créer un avantage de survie artificiel.

Une manière utile d'examiner une étude observationnelle d'un traitement consiste à formuler l'essai randomisé cible hypothétique que l'analyse cherche à émuler. L'éligibilité, l'assignation du traitement et le début du suivi doivent coïncider. Un défaut de synchronisation peut créer un biais de temps immortel et un biais de sélection, même si la confusion a par ailleurs été bien prise en compte [17].

Revues systématiques et méta-analyses

La revue est-elle réellement systématique ?

PRISMA 2020 exige notamment de rapporter les stratégies de recherche, la sélection, le risque de biais, les méthodes de synthèse, l'hétérogénéité, les analyses de sensibilité et le niveau de confiance dans les preuves [3]. PRISMA évalue la qualité du rapport, et non la qualité méthodologique.

AMSTAR 2 peut être utilisé pour l'évaluation critique des revues systématiques. Les domaines particulièrement importants sont l'enregistrement préalable du protocole, une recherche suffisante, la justification des études exclues, l'évaluation du risque de biais, une méta-analyse appropriée et la prise en compte du biais de publication. AMSTAR 2 ne doit pas être réduit à un simple score total, car une faille critique peut être masquée par de nombreux éléments mineurs bien réalisés [18].

Interpréter un forest plot

L'estimation ponctuelle et l'intervalle de confiance de chaque étude doivent être lus avant le résultat poolé. Demandez-vous :

  • Les effets vont-ils dans le même sens ?
  • Les intervalles se chevauchent-ils ?
  • Une seule grande étude est-elle prépondérante ?
  • Les petites études sont-elles plus favorables ?
  • Les interventions, populations et critères sont-ils suffisamment similaires ?
  • L'effet poolé est-il cliniquement compréhensible ?

Un modèle à effet fixe suppose un effet sous-jacent commun à toutes les études. Un modèle à effets aléatoires admet que l'effet réel varie d'une étude à l'autre. Le modèle à effets aléatoires ne résout pas l'hétérogénéité clinique et peut accorder un poids relativement plus important aux petites études.

Hétérogénéité

Le Q de Cochran teste si la variabilité est supérieure à celle attendue sous l'effet du hasard, mais sa puissance est faible lorsque les études sont peu nombreuses. I2I^2 estime la proportion de la variabilité observée attribuable à des différences entre études plutôt qu'à la fluctuation d'échantillonnage. Sa valeur ne doit pas être interprétée de façon mécanique. Sa portée clinique dépend de la mesure d'effet, de la précision, du nombre d'études et de la direction de la variabilité.

Le tau carré décrit la variance entre les vrais effets des études sur l'échelle de l'analyse. Un intervalle de prédiction estime l'intervalle dans lequel pourrait se situer l'effet d'une nouvelle étude comparable. En cas d'hétérogénéité importante, l'intervalle de prédiction est souvent plus informatif sur le plan clinique que l'intervalle de confiance autour de l'effet moyen.

Effets des petites études et biais de publication

L'asymétrie d'un funnel plot peut résulter d'un biais de publication, de faiblesses méthodologiques, d'une hétérogénéité clinique ou du hasard. L'absence d'asymétrie n'exclut pas un biais de publication, en particulier lorsque peu d'études sont incluses. AMSTAR 2 indique qu'un funnel plot requiert normalement au moins une dizaine d'études pour une évaluation pertinente [18].

Dans une analyse méta-épidémiologique d'études en réanimation, les petites études rapportaient des effets favorables plus importants que les grandes études. Les petites études rapportaient aussi moins bien la génération de la séquence, l'assignation secrète, l'aveugle et l'analyse en intention de traiter [19]. Un résultat poolé positif entièrement porté par de petites études doit donc être considéré comme incertain jusqu'à sa confirmation dans des études plus grandes et de bonne qualité.

De l'étude au patient

La validité interne prime sur la validité externe. Un résultat fortement biaisé ne devient pas cliniquement utilisable du seul fait que les patients ressemblent au patient concerné. Lorsque la validité interne est acceptable, il convient de comparer les éléments suivants :

Caractéristique de l'étude Question clinique
Âge et fragilité Le patient est-il plus âgé, plus fragile ou plus polypathologique ?
Sévérité de la maladie Le risque de base est-il comparable ?
Comorbidités Des maladies associées fréquentes ont-elles été exclues ?
Traitements concomitants Le groupe contrôle correspond-il au traitement standard actuel ?
Intensité du traitement La dose, la surveillance et l'observance sont-elles atteignables ?
Critère de jugement Est-il important pour le patient ?
Suivi Est-il suffisant au regard du bénéfice et des risques attendus ?
Contexte de soins Les résultats sont-ils transposables au système de santé suédois ?

Les restrictions thérapeutiques nationales, les modalités de remboursement et les conditions organisationnelles peuvent différer de celles des études internationales. Ces différences doivent être vérifiées au regard des recommandations suédoises en vigueur et des informations sur le produit avant que le résultat ne soit appliqué en pratique clinique.

Une conclusion cliniquement utile peut être formulée ainsi :

Chez des patients semblables à la population étudiée, le traitement a réduit en relatif le critère principal important pour le patient, mais l'effet absolu dépendait du risque de base. L'intervalle de confiance était compatible avec X à Y événements de moins pour 1 000 patients traités sur Z ans. Le risque de biais était faible ou modéré, mais l'applicabilité était limitée par un suivi court et un faible nombre de patients fragiles.

Une telle formulation est plus informative que d'affirmer que le traitement était efficace, positif ou statistiquement significatif.

Liste de vérification pour un journal club ou une décision clinique

  1. La question est-elle pertinente et clairement définie ?
  2. Le schéma d'étude est-il adapté à la question ?
  3. Quel était le critère principal prédéfini ?
  4. Le critère est-il important pour le patient ?
  5. La randomisation, l'assignation secrète et l'aveugle étaient-ils adéquats ?
  6. Comment les perdus de vue, le cross-over et les données manquantes ont-ils été gérés ?
  7. L'article, le protocole, le registre et le plan d'analyse concordent-ils ?
  8. Quelle est l'ampleur de l'effet en relatif et en absolu ?
  9. Quelle est la largeur de l'intervalle de confiance ?
  10. L'intervalle exclut-il à la fois l'absence d'effet et un effet cliniquement important ?
  11. Des critères, sous-groupes ou moments d'évaluation multiples ont-ils été analysés ?
  12. Un critère composite est-il porté par des composantes moins importantes ?
  13. Les données de sécurité sont-elles suffisantes ?
  14. Le résultat est-il cohérent avec les autres études ?
  15. Existe-t-il une hétérogénéité, des effets des petites études ou un biais de publication ?
  16. Le financement et les intérêts des auteurs sont-ils transparents ?
  17. La population de l'étude ressemble-t-elle au patient concerné ?
  18. Comment le bénéfice absolu évolue-t-il compte tenu du risque de base du patient ?
  19. La contrainte du traitement et le risque d'effets délétères sont-ils acceptables ?
  20. Quel est le niveau de confiance dans l'ensemble des preuves ?

Sources

  1. Moher D et al. CONSORT 2010 explanation and elaboration: updated guidelines for reporting parallel group randomised trials. International Journal of Surgery 2012. PMID: 22036893
  2. Vandenbroucke JP et al. Strengthening the Reporting of Observational Studies in Epidemiology (STROBE): explanation and elaboration. PLoS Medicine 2007. PMID: 17941715
  3. Page MJ et al. The PRISMA 2020 statement: an updated guideline for reporting systematic reviews. BMJ 2021. PMID: 33782057
  4. Balshem H et al. GRADE guidelines: 3. Rating the quality of evidence. Journal of Clinical Epidemiology 2011. PMID: 21208779
  5. Page MJ et al. Empirical Evidence of Study Design Biases in Randomized Trials: Systematic Review of Meta-Epidemiological Studies. PLoS One 2016. PMID: 27398997
  6. Khan MS et al. Fragility Index in Cardiovascular Randomized Controlled Trials. Circulation: Cardiovascular Quality and Outcomes 2019. PMID: 31822121
  7. Lundh A et al. Industry sponsorship and research outcome. Cochrane Database of Systematic Reviews 2017. PMID: 28207928
  8. Austin PC, Fine JP. Accounting for competing risks in randomized controlled trials: a review and recommendations for improvement. Statistics in Medicine 2017. PMID: 28102550
  9. Ito C et al. Misleading Reporting (Spin) in Noninferiority Randomized Clinical Trials in Oncology With Statistically Not Significant Results: A Systematic Review. JAMA Network Open 2021. PMID: 34874407
  10. McCoy CE. Understanding the Use of Composite Endpoints in Clinical Trials. Western Journal of Emergency Medicine 2018. PMID: 30013696
  11. Hodkinson A et al. Reporting of harms outcomes: a comparison of journal publications with unpublished clinical study reports of orlistat trials. Trials 2016. PMID: 27103582
  12. Schiller P et al. Quality of reporting of clinical non-inferiority and equivalence randomised trials: update and extension. Trials 2012. PMID: 23157733
  13. Fischer JE et al. A readers' guide to the interpretation of diagnostic test properties: clinical example of sepsis. Intensive Care Medicine 2003. PMID: 12734652
  14. Cohen JF et al. STARD 2015 guidelines for reporting diagnostic accuracy studies: explanation and elaboration. BMJ Open 2016. PMID: 28137831
  15. Whiting PF et al. QUADAS-2: a revised tool for the quality assessment of diagnostic accuracy studies. Annals of Internal Medicine 2011. PMID: 22007046
  16. Collins GS et al. Transparent reporting of a multivariable prediction model for individual prognosis or diagnosis (TRIPOD): the TRIPOD statement. BMJ 2015. PMID: 25569120
  17. Hernán MA et al. Specifying a target trial prevents immortal time bias and other self-inflicted injuries in observational analyses. Journal of Clinical Epidemiology 2016. PMID: 27237061
  18. Shea BJ et al. AMSTAR 2: a critical appraisal tool for systematic reviews that include randomised or non-randomised studies of healthcare interventions, or both. BMJ 2017. PMID: 28935701
  19. Zhang Z et al. Small studies may overestimate the effect sizes in critical care meta-analyses: a meta-epidemiological study. Critical Care 2013. PMID: 23302257

Mis à jour 15 septembre 2026