Résumé
La lecture critique consiste à déterminer si une étude répond à une question cliniquement pertinente, si son résultat peut être systématiquement biaisé, quelles sont l'ampleur et la précision de l'effet, et si le résultat est applicable au patient concerné. Ne commencez pas par la conclusion ni par la valeur de p. Identifiez d'abord la question de recherche, le schéma d'étude, la population, l'intervention ou l'exposition, le comparateur, les critères de jugement et la durée de suivi. Examinez ensuite la validité interne, les mesures d'effet et la précision, puis la validité externe et l'ensemble des données probantes.
Pour les essais randomisés, les questions essentielles sont de savoir si la séquence de randomisation a été correctement générée, si l'assignation était dissimulée, si des écarts par rapport au traitement assigné sont survenus, comment les perdus de vue ont été gérés, si la mesure du critère de jugement était fiable et si les analyses rapportées étaient prédéfinies. Pour les études observationnelles s'ajoutent principalement le biais de sélection, la confusion, les erreurs de classification et les biais liés au temps. Les études diagnostiques doivent être évaluées en fonction de la sélection des patients, du test index et du test de référence, de l'insu, des seuils et du flux des patients. Les revues systématiques exigent une recherche reproductible, une sélection transparente des études, une évaluation appropriée du risque de biais et une synthèse raisonnable.
La significativité statistique n'est pas synonyme de pertinence clinique. Interprétez toujours l'estimation ponctuelle conjointement avec l'intervalle de confiance et les effets absolus. Un résultat non significatif ne démontre pas automatiquement une équivalence. Un effectif important peut produire un résultat précis mais biaisé, tandis qu'un petit effectif peut produire un résultat incertain malgré un bon schéma d'étude. Enfin, les résultats de l'étude doivent être confrontés aux autres données probantes, au risque de base du patient, à ses valeurs, à la charge thérapeutique, aux effets indésirables, aux ressources et au contexte de soins suédois.
De la question clinique au plan de lecture critique
Formuler la question avant d'évaluer l'article
Une lecture critique utile commence par une question à laquelle il est possible de répondre. Pour les effets thérapeutiques, on utilise habituellement le format PICO :
| Composante | Question |
|---|---|
| Population | Quels patients sont concernés par la question ? |
| Intervention | Quel traitement, quelle stratégie ou quelle mesure est évalué(e) ? |
| Comparator | À quoi l'intervention est-elle comparée ? |
| Outcome | Quels effets et quels préjudices pertinents pour le patient sont importants ? |
| Temps | Quelle durée de traitement et de suivi est nécessaire pour que le critère de jugement ait un sens ? |
Pour le diagnostic, la question doit également préciser le test index, le standard de référence, le rôle clinique prévu et l'étape du parcours de soins à laquelle le test sera utilisé. Pour le pronostic, on précise la population, le facteur ou le modèle pronostique, le critère de jugement et l'horizon temporel. Pour l'étiologie ou les préjudices, on spécifie l'exposition, la comparaison pertinente et les facteurs de confusion possibles.
Un même article peut être pertinent pour une question mais inadapté pour une autre. Une étude d'efficacité contrôlée contre placebo peut montrer qu'un traitement a un effet biologique, sans nécessairement montrer s'il est supérieur au traitement standard suédois. Une étude de performance diagnostique peut montrer avec quelle exactitude un test classe la maladie, mais pas si le test améliore le devenir des patients.
Identifier le schéma d'étude d'après ce qui a réellement été fait
Ne vous fiez pas uniquement à l'étiquette donnée par les auteurs. Évaluez comment les participants ont été sélectionnés, comment les groupes de comparaison ont été constitués, quand l'exposition et le critère de jugement ont été mesurés et comment le suivi a été réalisé.
| Type de question | Schéma souvent approprié | Principales menaces pour la validité |
|---|---|---|
| Effet thérapeutique | Essai contrôlé randomisé | Défauts de randomisation, écarts, perdus de vue, rapport sélectif des résultats |
| Préjudice rare ou à long terme | Cohorte, étude cas-témoins, étude de registre | Confusion, sélection, erreur de classification, biais liés au temps |
| Performance diagnostique | Étude transversale ou cohorte dans laquelle les mêmes patients bénéficient du test index et du test de référence | Biais de spectre, biais de vérification, standard de référence inadapté |
| Pronostic | Cohorte d'inception avec un suivi pertinent | Inclusion sélective, perdus de vue, surajustement |
| Prévalence | Étude transversale représentative | Erreur d'échantillonnage, non-réponse, erreur de mesure |
| Ensemble des preuves thérapeutiques | Revue systématique, avec méta-analyse lorsque c'est approprié | Recherche incomplète, biais dans les études primaires, agrégation inappropriée |
Les recommandations de rédaction aident le lecteur à trouver les informations nécessaires. CONSORT 2025 comprend 30 items pour les essais randomisés et met notamment l'accent sur l'enregistrement, le protocole, le plan d'analyse statistique, la gestion des données, les perdus de vue et les effets indésirables [1]. STROBE couvre les études de cohorte, cas-témoins et transversales et souligne que la population, le recueil des données, les variables, les biais possibles et l'analyse doivent être décrits clairement [2]. STARD remplit une fonction équivalente pour les études diagnostiques [3], tandis que PRISMA 2020 contient 27 items pour les revues systématiques [4].
Ces recommandations ne sont pas des instruments d'évaluation de la qualité. Une rédaction complète permet d'évaluer une étude, mais ne garantit pas que la méthode soit correcte. En revanche, une rédaction insuffisante signifie que le risque de biais ne peut souvent pas être exclu.
flowchart TD
A["Formuler la question clinique<br>et les critères importants"] --> B["Identifier ce que les chercheurs<br>ont réellement comparé"]
B --> C["Évaluer la validité interne<br>et le risque de biais"]
C --> D["Interpréter l'ampleur de l'effet<br>et la précision"]
D --> E["Examiner les analyses alternatives<br>et la sélection des résultats rapportés"]
E --> F["Évaluer l'applicabilité<br>au patient et au contexte de soins"]
F --> G["Confronter aux autres preuves<br>bénéfices, préjudices et ressources"]Lecture critique commune à toutes les études
Question de recherche, protocole et enregistrement préalable
Vérifiez si l'hypothèse, le critère de jugement principal, la durée de suivi et l'analyse ont été définis avant l'analyse des données. Pour les essais randomisés, l'enregistrement aurait dû être effectué avant l'inclusion du premier participant. Comparez la publication au protocole de l'étude, à l'enregistrement dans le registre et au plan d'analyse statistique. Recherchez si :
- le critère de jugement principal a été changé
- le moment de l'analyse principale a été modifié
- des critères de jugement ont été ajoutés ou supprimés
- des sous-groupes ou des variables d'ajustement ont été choisis après que les résultats étaient connus
- l'étude a été arrêtée prématurément sans règles clairement prédéfinies
- l'analyse s'écarte de celle prévue sans explication convaincante
Un écart n'est pas nécessairement inapproprié. Une évolution clinique ou des problèmes de données inattendus peuvent justifier une modification. Le problème est une modification non documentée et guidée par les résultats, qui augmente le risque qu'un résultat fortuit soit présenté comme une preuve confirmatoire.
Population et recrutement
Décrivez la population source avant d'évaluer la population de l'étude. Demandez-vous quels patients auraient pu être inclus, lesquels ont réellement été évalués en vue de leur participation et lesquels ont finalement été analysés. Un recrutement dans des centres hautement spécialisés peut offrir une grande qualité de traitement mais une généralisabilité limitée. Un recrutement par annonces ou sur la base du volontariat peut sélectionner des personnes particulièrement motivées et soucieuses de leur santé.
Vérifiez :
- les critères d'inclusion et d'exclusion
- le pays de recrutement, le niveau de soins et la période
- la proportion de personnes sollicitées qui ont été incluses
- les comorbidités, l'âge, la répartition par sexe et la sévérité de la maladie
- les traitements antérieurs et concomitants
- si les personnes âgées, fragiles, les femmes enceintes ou d'autres groupes importants ont été exclus
- si les critères diagnostiques correspondent à la pratique clinique
Un traitement peut avoir le même effet relatif quel que soit le risque de base, mais un bénéfice absolu très différent. Le risque de base du patient est donc central pour l'application des résultats.
Intervention, comparateur et traitements concomitants
L'intervention doit être suffisamment décrite pour pouvoir être reproduite. Pour les médicaments, il faut connaître la dose, la voie d'administration, la durée du traitement, l'adaptation posologique et l'observance. Pour la chirurgie, la kinésithérapie ou les programmes de soins complexes, il faut des informations sur les intervenants, leur formation, les composantes et la mise en œuvre effective. TIDieR a été développé pour améliorer la description et la reproductibilité de ces interventions [5].
Le traitement de comparaison est aussi important que l'intervention. Un placebo peut être raisonnable en l'absence de traitement standard efficace, mais il est insuffisant si la question porte sur le choix entre des traitements établis. Un contrôle actif sous-dosé ou administré de manière inadéquate peut exagérer le bénéfice relatif du nouveau traitement.
Évaluez également les traitements concomitants. Si les groupes reçoivent des traitements de secours, une rééducation, un suivi ou des examens diagnostiques différents, la différence de résultats ne peut pas être attribuée avec certitude à l'intervention étudiée.
Critères de jugement et durée de suivi
Privilégiez les critères de jugement pertinents pour le patient, tels que la survie, les symptômes, la capacité fonctionnelle, la qualité de vie, l'hospitalisation et les complications graves. Les biomarqueurs et les mesures radiologiques peuvent être utiles, mais un critère de substitution doit être validé pour la maladie, le mécanisme d'action du traitement et la population de patients concernés. Un traitement peut améliorer une valeur biologique sans améliorer la santé des patients.
Examinez comment le critère de jugement a été défini et mesuré :
- La définition avait-elle un sens clinique ?
- La méthode de mesure était-elle validée ?
- Le critère était-il autodéclaré ou dépendant de l'évaluateur ?
- Les évaluateurs étaient-ils en aveugle ?
- Le critère a-t-il été mesuré avec la même fréquence et de la même façon dans les groupes ?
- Le suivi était-il suffisamment long pour les bénéfices et les préjudices ?
- Un critère composite comprenait-il des composantes d'importance clinique très différente ?
Un critère composite peut être dominé par la composante la plus fréquente mais la moins grave. Le rapport doit donc présenter à la fois le critère composite et chacune de ses composantes séparément.
Essais thérapeutiques randomisés
La randomisation réduit, en espérance, la confusion connue comme inconnue, mais seulement si la séquence est véritablement aléatoire et que l'assignation ne peut pas être anticipée. RoB 2 évalue cinq domaines : le processus de randomisation, les écarts par rapport aux interventions prévues, les données manquantes sur les critères de jugement, la mesure des critères de jugement et la sélection du résultat rapporté [6].
Processus de randomisation et dissimulation de l'assignation
Vérifiez comment la séquence a été générée. Les nombres aléatoires générés par ordinateur et la randomisation centralisée sont généralement appropriés. L'alternance, la date de naissance, le numéro de dossier ou le jour de la semaine sont prévisibles et ne constituent pas une randomisation fiable.
La dissimulation de l'assignation signifie que la personne qui inclut le participant ne peut pas connaître la prochaine assignation. Elle est distincte de l'insu après la randomisation. Une assignation centralisée par internet ou par téléphone offre souvent une meilleure protection que des enveloppes conservées localement. Si l'assignation pouvait être anticipée, la personne chargée du recrutement peut influencer la répartition des patients entre les groupes.
Examinez le tableau des caractéristiques initiales, mais n'utilisez pas uniquement des tests de significativité pour évaluer la randomisation. Des déséquilibres fortuits peuvent survenir. En revanche, des différences importantes ou improbables portant sur plusieurs variables pronostiques importantes peuvent justifier un examen plus approfondi du processus.
Insu et écarts par rapport au traitement
L'insu réduit le risque que les attentes influencent le traitement, les traitements concomitants, les perdus de vue ou la mesure du critère de jugement. Son importance dépend du critère de jugement. La mortalité toutes causes est moins sensible à l'influence de l'évaluateur que la douleur, l'évaluation fonctionnelle ou la décision d'hospitalisation.
Si l'insu n'est pas possible, demandez-vous si :
- les groupes ont reçu une prise en charge ou des traitements concomitants différents
- l'observance a été influencée par la connaissance du traitement
- les écarts étaient équilibrés
- le critère de jugement a été évalué par un comité indépendant en aveugle
- l'analyse estimait l'effet de l'assignation ou l'effet du traitement effectivement reçu
Intention de traiter et per protocole
Une analyse en intention de traiter maintient les participants dans le groupe auquel ils ont été randomisés. Elle préserve la comparabilité obtenue par la randomisation et estime généralement l'effet d'une stratégie thérapeutique dans les conditions de l'étude. Une analyse selon le traitement effectivement reçu rompt la randomisation et peut réintroduire de la confusion.
L'analyse per protocole n'inclut que les participants ayant suivi le protocole selon des critères prédéfinis. Elle peut être informative mais est sensible à la sélection, car l'observance est souvent liée au pronostic. Dans les essais de supériorité, l'analyse en intention de traiter est généralement l'analyse principale. Dans les essais de non-infériorité, les analyses en intention de traiter et per protocole sont toutes deux importantes, car les écarts et les changements de bras de traitement peuvent rendre les groupes plus semblables et ainsi favoriser une conclusion de non-infériorité.
Non-infériorité et équivalence
La non-infériorité signifie que le nouveau traitement n'est pas inacceptablement moins bon que le contrôle. Ce n'est pas la même chose que l'absence de différence statistiquement significative. Vérifiez :
- Que la marge de non-infériorité a été définie avant l'étude.
- Que la marge repose sur une justification clinique et empirique.
- Que le contrôle actif a déjà démontré son efficacité dans une population similaire.
- Que le traitement, l'observance et la mesure du critère de jugement étaient suffisamment bons pour que des différences puissent être détectées.
- Que l'intervalle de confiance se situe entièrement du bon côté de la marge.
- Que le bénéfice et les avantages possibles, par exemple moins d'effets indésirables ou une administration plus simple, sont évalués.
L'équivalence exige que la totalité de l'intervalle de confiance se situe entre deux bornes prédéfinies. L'absence de différence significative ne suffit pas.
Perdus de vue et données manquantes
Rapportez les perdus de vue séparément pour chaque groupe et pour chaque critère de jugement essentiel. Évaluez à la fois leur proportion et leurs causes. Cinq pour cent de perdus de vue peuvent être graves si peu d'événements sont survenus et que les perdus de vue sont liés au pronostic. Une proportion plus importante peut être moins source de biais si ses causes sont indépendantes du traitement et du critère de jugement.
L'analyse des cas complets n'est fiable que sous des hypothèses restrictives. Les méthodes modernes comprennent notamment l'imputation multiple, les modèles fondés sur la vraisemblance et la pondération. Aucune méthode ne restitue une information qui n'a jamais été recueillie. Les hypothèses doivent être cliniquement plausibles et des analyses de sensibilité doivent montrer comment la conclusion est affectée si les critères de jugement manquants sont moins favorables dans l'un des groupes. Une revue méthodologique de 2024 a montré que de nombreux essais utilisent encore des méthodes qui exigent en pratique l'hypothèse forte de données manquantes de manière complètement aléatoire [7].
Rapport sélectif des résultats et sous-groupes
Le critère de jugement principal doit être prédéfini. La multiplication des critères secondaires, des temps d'évaluation, des sous-groupes et des variantes de modèles augmente la probabilité de résultats positifs dus au hasard.
Un effet de sous-groupe crédible devrait de préférence :
- être prédéfini et limité à un petit nombre d'hypothèses
- avoir une plausibilité biologique ou clinique
- être démontré par un test d'interaction formel
- être cohérent au sein des études et entre elles
- reposer sur un nombre suffisant de participants et d'événements
- ne pas reposer uniquement sur une significativité dans un groupe et une non-significativité dans un autre
La différence entre un résultat significatif et un résultat non significatif n'est pas nécessairement significative. Dans une analyse de 928 revues Cochrane, des analyses en sous-groupes selon l'âge étaient prévues dans 20,4 %, mais n'ont été réalisées que dans une petite minorité. Plusieurs analyses ne comportaient pas de test d'interaction formel et les interactions observées étaient faiblement étayées [8].
Préjudices et effets indésirables
Les études d'efficacité ont souvent une puissance statistique insuffisante et un suivi trop court pour détecter des préjudices rares ou tardifs. Examinez comment les effets indésirables ont été recherchés, définis, codés et imputés. Une surveillance active et systématique recense davantage d'événements que les déclarations spontanées.
Le rapport doit indiquer, dans chaque groupe, le nombre de participants ayant présenté au moins un événement, le nombre d'événements, leur sévérité, les arrêts de traitement, les événements graves et les décès. CONSORT Harms recommande une présentation intégrée et prédéfinie des bénéfices et des préjudices [9]. Dans une revue systématique de 61 essais vaccinaux randomisés, tous rapportaient les décès et les effets indésirables graves, mais seuls six décrivaient la manière dont les effets indésirables récurrents étaient traités [10].
Études observationnelles
Les études observationnelles sont indispensables pour de nombreuses questions de pronostic, d'étiologie, de préjudices rares et de traitement en pratique clinique courante. Elles peuvent être très grandes et précises, mais la précision n'élimine pas les erreurs systématiques.
Sélection et comparabilité
Dans une étude de cohorte, les sujets exposés et non exposés doivent représenter des personnes comparables à un point de départ clairement défini. Dans une étude cas-témoins, les témoins doivent représenter la population dont sont issus les cas. Dans les études transversales, la chronologie entre exposition et maladie est souvent incertaine.
Vérifiez si l'inclusion, le traitement ou la poursuite du suivi dépendent du pronostic. Il peut s'agir, par exemple, de la sélection de personnes ayant survécu jusqu'à l'inclusion dans l'étude, de l'exclusion de patients gravement malades ou de perdus de vue informatifs.
Confusion
Un facteur de confusion est associé à la fois à l'exposition et au critère de jugement, sans être une conséquence de l'exposition. Le biais d'indication est particulièrement important lorsque les patients les plus malades reçoivent plus souvent un traitement donné. Une étude observationnelle statistiquement ajustée n'est pas automatiquement causale. L'ajustement ne peut prendre en compte que des variables mesurées suffisamment bien et modélisées correctement.
Vérifiez :
- si les facteurs de confusion importants ont été identifiés à partir des connaissances cliniques
- quand et comment ils ont été mesurés
- si des variables postérieures au début du traitement ont été ajustées à tort
- si les groupes présentaient une probabilité chevauchante de recevoir le traitement
- si l'équilibre après appariement ou pondération a été présenté
- si des analyses de sensibilité concernant une confusion inconnue ont été réalisées
Une revue exploratoire (scoping review) portant sur 117 articles méthodologiques consacrés aux bases de données de santé secondaires a identifié la confusion, la sélection et l'erreur de mesure comme les problèmes les plus fréquents. Le biais d'indication, la confusion résiduelle, l'erreur de classification du critère de jugement et le biais de temps immortel étaient particulièrement marquants [11].
Le score de propension peut être utilisé pour l'appariement, la stratification, la pondération ou l'ajustement, mais il ne rend pas comparables les facteurs de confusion inconnus. Dans une revue de 127 comparaisons entre analyses par score de propension et essais randomisés, la différence entre les schémas d'étude était importante dans 54 % des comparaisons [12].
Erreur de mesure et erreur de classification
Les diagnostics, les expositions médicamenteuses et les critères de jugement figurant dans les registres administratifs ont souvent été créés à des fins de soins ou de remboursement, et non de recherche. Vérifiez la valeur prédictive positive et négative des codes dans le contexte concerné. Une prescription ne signifie pas que le médicament a été délivré, et une délivrance ne signifie pas qu'il a été pris.
Une erreur de classification non différentielle n'entraîne pas toujours un biais vers l'hypothèse nulle, en particulier en présence de plusieurs catégories, d'erreurs de mesure dépendantes ou de modèles ajustés. Une erreur de classification différentielle peut biaiser le résultat dans n'importe quelle direction.
Biais liés au temps
Le début de l'exposition, de la comparaison et du suivi doit se situer à un moment commun et cliniquement pertinent. Dans le biais de temps immortel, une période pendant laquelle l'événement ne pouvait pas survenir est classée comme temps exposé, ce qui produit souvent un effet protecteur fictif.
Une étude pharmacoépidémiologique robuste utilise souvent :
- de nouveaux utilisateurs plutôt que des personnes ayant déjà toléré le traitement
- un traitement comparateur actif ayant une indication similaire
- la même définition de la date index dans les groupes
- un modèle d'exposition dépendant du temps lorsque l'exposition varie
- une gestion claire des changements de traitement, des arrêts et des événements concurrents
Études diagnostiques
La performance diagnostique n'est pas une propriété immuable d'un test. Elle varie selon le spectre de la maladie, la prévalence, le niveau de soins, les tests antérieurs et la manière dont le test est réalisé [3]. QUADAS-2 évalue la sélection des patients, le test index, le standard de référence ainsi que le flux des patients et le délai. Les trois premiers domaines sont également évalués en termes d'applicabilité [13].
Sélection des patients et rôle clinique
L'étude devrait de préférence inclure une série consécutive ou aléatoire de patients chez lesquels le test serait réellement utilisé. Une comparaison entre des cas manifestement malades et des témoins sains donne souvent une performance surestimée. Précisez si le test doit servir au dépistage, au triage, à la confirmation diagnostique, au remplacement d'un test existant ou comme test complémentaire.
Test index et standard de référence
Le test index et le standard de référence doivent être décrits de manière à pouvoir être reproduits. Le standard de référence doit classer la condition cible de façon suffisamment exacte. Si les évaluateurs du test de référence connaissent le résultat du test index, la concordance peut être artificiellement élevée.
Les seuils doivent être prédéfinis. Un seuil choisi après l'analyse de l'ensemble des résultats tend à donner des performances trop optimistes et nécessite une validation externe.
Tous les participants devraient en principe bénéficier du même standard de référence dans un délai cliniquement raisonnable. Si seuls les patients positifs au test index font l'objet d'un diagnostic définitif, il en résulte un biais de vérification partielle.
Mesures de performance
| Mesure | Définition | Usage clinique |
|---|---|---|
| Sensibilité | Proportion de malades ayant un test positif | Évalue les faux négatifs |
| Spécificité | Proportion de non-malades ayant un test négatif | Évalue les faux positifs |
| Rapport de vraisemblance positif | Sensibilité divisée par 1 moins la spécificité | Augmente la probabilité de maladie |
| Rapport de vraisemblance négatif | 1 moins la sensibilité divisé par la spécificité | Diminue la probabilité de maladie |
| Valeur prédictive positive | Proportion de sujets positifs au test qui sont malades | Dépend de la prévalence et de la sélection des patients |
| Valeur prédictive négative | Proportion de sujets négatifs au test qui ne sont pas malades | Dépend de la prévalence et de la sélection des patients |
La sensibilité et la spécificité doivent être rapportées avec leur intervalle de confiance. Une valeur unique d'AUC peut masquer des différences cliniquement importantes au seuil qui sera effectivement utilisé. La question décisive est souvent de savoir si le résultat du test modifie suffisamment la probabilité pour changer le traitement, la suite des investigations ou le besoin de suivi.
Revues systématiques et méta-analyses
Une revue systématique est une étude d'études. Elle ne peut pas compenser un biais important dans les études primaires. PRISMA facilite une présentation transparente [4], tandis qu'AMSTAR 2 est un outil d'évaluation des revues d'études interventionnelles randomisées et non randomisées [14].
Recherche et sélection des études
Vérifiez que la question et les critères d'inclusion ont été définis dans un protocole avant la recherche et l'analyse. La recherche doit couvrir plusieurs bases de données pertinentes, des registres d'essais, des listes de références et, si nécessaire, des sources non publiées ou réglementaires. Les stratégies de recherche complètes et la date de la dernière recherche doivent être présentées.
La sélection des études et l'extraction des données doivent être réalisées par au moins deux personnes ou vérifiées de manière indépendante. Une liste des études exclues après lecture du texte intégral, avec les motifs d'exclusion, permet de détecter une exclusion sélective.
Risque de biais et agrégation
Les auteurs doivent utiliser un outil adapté au schéma d'étude et intégrer l'évaluation dans la synthèse. Se contenter de présenter un score total est inapproprié, car un seul défaut critique peut être plus important que plusieurs défauts mineurs. AMSTAR 2 déconseille explicitement d'additionner ses 16 items en un score de qualité unique [14].
Une méta-analyse n'est raisonnable que lorsque les études sont suffisamment comparables en termes de population, d'intervention, de contrôle, de critère de jugement et de durée. Un modèle à effets aléatoires ne résout pas une incompatibilité clinique. Lorsque des résultats randomisés et observationnels sont combinés, de très grandes études observationnelles peuvent dominer et produire une estimation globale précise mais biaisée.
Hétérogénéité
L'hétérogénéité doit être comprise sur le plan clinique et méthodologique, et pas uniquement au travers de l'I². L'I² indique approximativement quelle proportion de la variation observée n'est pas expliquée par l'erreur d'échantillonnage, mais il est influencé par la précision des études. Un I² faible n'exclut pas une variation cliniquement importante, et un I² élevé n'implique pas nécessairement de grandes différences absolues.
Dans une méta-analyse à effets aléatoires, l'intervalle de prédiction est souvent plus informatif sur le plan clinique que l'intervalle de confiance autour de l'effet moyen. Il estime l'intervalle des effets réels attendus dans un futur contexte similaire. Dans une analyse de méta-analyses Cochrane statistiquement significatives présentant une hétérogénéité, 72,4 % des intervalles de prédiction incluaient l'absence d'effet, et 20,3 % incluaient un effet opposé à l'estimation globale [15].
Biais de publication
Les petites études positives sont souvent publiées plus facilement que les petites études négatives. Le graphique en entonnoir (funnel plot) et les tests d'asymétrie peuvent étayer une suspicion d'effet des petites études, mais ils sont difficiles à interpréter en présence d'hétérogénéité et ont une faible puissance lorsque les études sont peu nombreuses. AMSTAR 2 indique qu'au moins une dizaine d'études sont généralement nécessaires pour évaluer de façon pertinente l'asymétrie d'un funnel plot [14]. Un funnel plot symétrique ne prouve pas l'absence de biais de publication.
Interprétation des résultats statistiques
Estimation ponctuelle et intervalle de confiance
L'estimation ponctuelle est la meilleure estimation unique fournie par l'étude. L'intervalle de confiance décrit l'incertitude statistique sous les hypothèses du modèle, mais ne capte pas les biais systématiques. Un intervalle étroit autour d'une estimation biaisée ne donne pas un résultat crédible.
Évaluez si l'intervalle inclut :
- l'absence d'effet
- un bénéfice cliniquement significatif
- un préjudice cliniquement significatif
- à la fois un bénéfice et un préjudice
Un résultat peut être statistiquement significatif mais cliniquement négligeable. Il peut aussi être non significatif tout en restant compatible avec un effet important, parce que l'intervalle est large.
Effets relatifs et absolus
Supposons que le risque d'un événement soit de 20 % dans le groupe contrôle et de 15 % dans le groupe traité.
- Risque relatif : 0,15 / 0,20 = 0,75.
- Réduction relative du risque : 1 moins 0,75 = 25 %.
- Réduction absolue du risque : 20 moins 15 points de pourcentage = 5 points de pourcentage.
- Nombre de sujets à traiter (NNT) : 1 / 0,05 = 20 sur la durée étudiée.
Le NNT doit toujours être rapporté à la population, à la comparaison et à la période considérées. Comme l'effet absolu dépend du risque dans le groupe contrôle, le NNT ne peut pas être comparé sans précaution d'une étude à l'autre. Le NNT doit être calculé à partir d'une différence de risque absolue appropriée et présenté avec son incertitude. Pour les critères de jugement dépendant du temps, le NNT varie selon le moment choisi [16].
Odds ratio et hazard ratio
L'odds ratio est proche du risque relatif lorsque l'événement est rare, mais il peut paraître plus important lorsque l'événement est fréquent. Si le risque dans le groupe contrôle est connu, le résultat doit également être exprimé en risque absolu.
Un hazard ratio compare des intensités instantanées de survenue des événements au cours du suivi et ne correspond pas directement à un risque relatif ni à une différence de durée de survie. Son interprétation suppose souvent des risques proportionnels. En cas de courbes de survie qui se croisent ou se séparent tardivement, une valeur unique de hazard ratio peut être trompeuse. Le temps de survie moyen restreint jusqu'à un moment prédéfini peut alors être plus facile à interpréter [17].
Valeurs de p et analyses multiples
La valeur de p indique dans quelle mesure les données sont incompatibles avec un modèle statistique spécifié, souvent l'hypothèse nulle. Elle n'indique pas la probabilité que l'hypothèse soit vraie, l'ampleur de l'effet, sa pertinence clinique ni le risque de biais.
Le seuil de 0,05 est une convention, et non une ligne de partage biologique. Les résultats p = 0,049 et p = 0,051 ne constituent normalement pas des preuves qualitativement différentes. Interprétez l'ampleur de l'effet, l'intervalle de confiance, la planification préalable, le nombre d'analyses et la validité de l'étude.
Si 20 hypothèses indépendantes sont testées au seuil de significativité de 0,05, on s'attend en moyenne à un résultat positif dû au hasard lorsque toutes les hypothèses nulles sont vraies. Une hiérarchie d'analyse prédéfinie ou un contrôle approprié de la multiplicité des tests est donc nécessaire.
Robustesse et analyses de sensibilité
Les analyses de sensibilité doivent tester des hypothèses alternatives raisonnables, par exemple :
- différentes hypothèses concernant les données manquantes
- analyses ajustées et non ajustées
- exclusion des études à risque de biais élevé
- différents modèles d'hétérogénéité
- définition alternative de l'exposition ou du critère de jugement
- prise en compte des événements concurrents
- analyse per protocole en complément de l'intention de traiter lorsque c'est pertinent
Si la conclusion change à la suite de modifications minimes et raisonnables du modèle, les preuves sont fragiles. L'indice de fragilité, c'est-à-dire le nombre d'événements qu'il faudrait modifier pour qu'un résultat dichotomique significatif devienne non significatif, peut illustrer une certaine instabilité statistique, mais ne remplace ni l'intervalle de confiance ni l'évaluation du risque de biais. Des revues critiques ont montré que l'indice de fragilité de nombreux essais randomisés était très faible, et parfois inférieur au nombre de participants perdus de vue [18].
Applicabilité et pertinence clinique
La validité interne doit être évaluée avant la généralisabilité. Un résultat à risque de biais élevé ne devient pas utilisable simplement parce que la population de l'étude ressemble au patient. Lorsque la validité interne est acceptable, on évalue :
- la similitude en termes d'âge, de comorbidités, de sévérité de la maladie et de traitements antérieurs
- le risque de base et le bénéfice absolu attendu
- le niveau de soins, les compétences et les ressources disponibles
- la faisabilité de l'intervention et la charge thérapeutique
- la durée du suivi
- les valeurs et les objectifs du patient
- les effets indésirables et les interactions pertinents
- si le traitement de contrôle correspond à la pratique suédoise
Les recommandations suédoises, les indications approuvées, les restrictions de remboursement et l'organisation des soins peuvent différer de celles des études internationales. Une étude méthodologiquement solide ne détermine donc pas à elle seule ce qu'il convient de faire dans le système de santé suédois.
De l'étude isolée à l'ensemble des preuves
Une décision clinique devrait rarement reposer sur une seule étude. GRADE évalue la certitude des preuves pour chaque critère de jugement en se fondant notamment sur le schéma d'étude, le risque de biais, l'incohérence, le caractère indirect, l'imprécision et le biais de publication. La force de la recommandation dépend en outre de la balance bénéfices-préjudices, des valeurs des patients et d'autres conséquences [19].
| Domaine | Question lors de l'évaluation finale |
|---|---|
| Risque de biais | Les résultats des études peuvent-ils être systématiquement biaisés ? |
| Incohérence | Les études vont-elles dans le même sens et la variation est-elle compréhensible ? |
| Caractère indirect | La population, l'intervention, le contrôle et le critère de jugement correspondent-ils à la question clinique ? |
| Imprécision | L'intervalle de confiance exclut-il d'autres conclusions importantes ? |
| Biais de publication | Des résultats négatifs ou défavorables pourraient-ils manquer ? |
| Ampleur de l'effet | L'effet est-il important et cliniquement pertinent ? |
| Effet absolu | Combien d'événements sont concernés au niveau de risque de base du patient ? |
| Bénéfices et préjudices | La balance globale est-elle favorable pour ce patient ? |
Conclusion pratique après la lecture critique
Terminez la lecture critique par une conclusion structurée, et non par un jugement global du type « bonne étude » ou « faible niveau de preuve ». Indiquez :
- À quelle question l'étude répond réellement.
- Les principaux points forts.
- Les principaux risques de biais.
- L'estimation ponctuelle, l'intervalle de confiance et l'effet absolu.
- Si les résultats sont robustes et prédéfinis.
- À quels patients et à quels contextes de soins les résultats s'appliquent.
- Comment l'étude se situe par rapport aux autres données probantes.
- Ce que le résultat implique raisonnablement pour la pratique clinique.
- Quelle incertitude persiste.
La lecture critique n'est pas une chasse aux défauts qui disqualifieraient automatiquement une étude. Son objectif est de déterminer quel poids le résultat mérite. Une étude petite mais bien conduite peut apporter des informations précieuses, bien qu'incertaines. Une très grande étude peut offrir une grande précision tout en étant inutilisable si les groupes de comparaison ont été constitués de manière systématiquement biaisée. La conclusion cliniquement pertinente repose sur la combinaison de la validité, de l'ampleur de l'effet, de la précision, de l'applicabilité et de la cohérence avec l'ensemble des données probantes.
Sources
- Hopewell S et al. CONSORT 2025 explanation and elaboration: updated guideline for reporting randomised trials. BMJ 2025. PMID: 40228832
- Vandenbroucke JP et al. Strengthening the Reporting of Observational Studies in Epidemiology (STROBE): explanation and elaboration. PLoS Medicine 2007. PMID: 17941715
- Cohen JF et al. STARD 2015 guidelines for reporting diagnostic accuracy studies: explanation and elaboration. BMJ Open 2016. PMID: 28137831
- Page MJ et al. PRISMA 2020 explanation and elaboration: updated guidance and exemplars for reporting systematic reviews. BMJ 2021. PMID: 33781993
- Hoffmann TC et al. Better reporting of interventions: template for intervention description and replication (TIDieR) checklist and guide. BMJ 2014. PMID: 24609605
- Sterne JAC et al. RoB 2: a revised tool for assessing risk of bias in randomised trials. BMJ 2019. PMID: 31462531
- Medcalf E et al. Addressing missing outcome data in randomised controlled trials: A methodological scoping review. Contemporary Clinical Trials 2024. PMID: 38857674
- Liu P et al. Age-treatment subgroup analyses in Cochrane intervention reviews: a meta-epidemiological study. BMC Medicine 2019. PMID: 31639007
- Junqueira DR et al. CONSORT Harms 2022 statement, explanation, and elaboration: updated guideline for the reporting of harms in randomized trials. Journal of Clinical Epidemiology 2023. PMID: 37100738
- Yuniar CT et al. Adverse Events Reporting Quality of Randomized Controlled Trials of COVID-19 Vaccine Using the CONSORT Criteria for Reporting Harms: A Systematic Review. Vaccines 2022. PMID: 35214773
- Prada-Ramallal G et al. Bias in pharmacoepidemiologic studies using secondary health care databases: a scoping review. BMC Medical Research Methodology 2019. PMID: 30871502
- Forbes SP, Dahabreh IJ. Benchmarking Observational Analyses Against Randomized Trials: a Review of Studies Assessing Propensity Score Methods. Journal of General Internal Medicine 2020. PMID: 32193818
- Whiting PF et al. QUADAS-2: a revised tool for the quality assessment of diagnostic accuracy studies. Annals of Internal Medicine 2011. PMID: 22007046
- Shea BJ et al. AMSTAR 2: a critical appraisal tool for systematic reviews that include randomised or non-randomised studies of healthcare interventions, or both. BMJ 2017. PMID: 28935701
- IntHout J et al. Plea for routinely presenting prediction intervals in meta-analysis. BMJ Open 2016. PMID: 27406637
- Okwuokenye M et al. Number Needed to Treat in Multiple Sclerosis Clinical Trials. Neurology and Therapy 2017. PMID: 28176189
- Jiménez JL. Quantifying treatment differences in confirmatory trials under non-proportional hazards. Journal of Applied Statistics 2022. PMID: 35707213
- Mielke D, Rohde V. Randomized controlled trials, a critical re-appraisal. Neurosurgical Review 2021. PMID: 33025186
- Guyatt G et al. GRADE guidelines: 1. Introduction, GRADE evidence profiles and summary of findings tables. Journal of Clinical Epidemiology 2011. PMID: 21195583