Résumé
Une revue systématique utilise des méthodes prédéfinies, transparentes et reproductibles pour identifier, sélectionner, évaluer et synthétiser la recherche répondant à une question délimitée. Une méta-analyse est la combinaison statistique des résultats d'au moins deux études. Les deux termes ne sont donc pas synonymes. Une revue systématique peut ne pas comporter de méta-analyse, et une combinaison statistique n'est pas automatiquement systématique.
En pratique clinique, la revue doit être évaluée dans l'ordre suivant : la question est-elle pertinente pour le patient concerné ? La recherche bibliographique est-elle suffisamment large et à jour ? Les études ont-elles été sélectionnées et les données extraites de manière fiable ? Le risque de biais des études primaires a-t-il été évalué ? Les études sont-elles suffisamment similaires pour être combinées ? Quelle est l'ampleur des effets relatifs et absolus ? Quelle est la précision de l'estimation ? Existe-t-il une hétérogénéité cliniquement significative, des effets des petites études ou une publication sélective des résultats ? Enfin, le niveau de confiance dans les preuves doit être évalué pour chaque critère de jugement important.
PRISMA 2020 est une norme de rapport comportant 27 items principaux. Elle rend le rapport plus transparent, mais ne constitue pas un instrument d'évaluation de la qualité méthodologique [1,2]. Pour l'évaluation critique des revues d'interventions, AMSTAR 2 peut être utilisé, tandis que ROBIS porte sur le risque de biais de la revue elle-même [3,4]. Le niveau de confiance dans les preuves ne doit pas être assimilé à la significativité statistique. GRADE distingue un niveau de confiance élevé, modéré, faible et très faible, et prend en compte le risque de biais, l'incohérence, le caractère indirect, l'imprécision et le biais de publication [5,6].
Une recommandation clinique ne découle pas directement d'une méta-analyse. La décision doit également prendre en compte le bénéfice absolu, les effets indésirables, les valeurs du patient, la faisabilité, les coûts et la mesure dans laquelle la population étudiée correspond au patient concerné.
Notions fondamentales
Revue systématique
Une revue systématique synthétise la recherche répondant à une question clairement formulée à l'aide de méthodes explicites. Ses composantes essentielles sont :
- Une question et des critères d'inclusion prédéfinis.
- Un protocole établi avant que les résultats ne soient connus.
- Une recherche bibliographique large et reproductible.
- Une sélection systématique des études.
- Une extraction structurée des données.
- Une évaluation du risque de biais des études incluses.
- Une synthèse qualitative ou statistique planifiée.
- Une évaluation du niveau de confiance dans les preuves.
- Un compte rendu transparent des méthodes, des écarts et des résultats.
PRISMA 2020 définit une revue systématique à partir de ses méthodes explicites et systématiques, et non selon qu'une combinaison statistique a été réalisée ou non [1]. Le fait qu'un article soit qualifié de revue systématique ne constitue donc pas en soi une garantie de qualité.
Méta-analyse
Une méta-analyse combine les mesures d'effet et leur incertitude issues d'au moins deux études en une estimation globale. Les études dont la précision statistique est plus élevée reçoivent généralement un poids plus important. La méta-analyse peut accroître la précision, mettre en évidence la variabilité entre études et permettre l'analyse de modificateurs d'effet.
La méta-analyse peut cependant donner une précision trompeuse si elle combine des études qui diffèrent sensiblement en termes de population, d'intervention, de comparateur, de critère de jugement, de suivi ou de risque de biais. Une estimation globale précise peut être systématiquement erronée si les études qui la composent sont systématiquement erronées.
Types de revues apparentés
| Type de revue | Objectif principal | Limite importante |
|---|---|---|
| Revue systématique | Répondre à une question délimitée à l'aide de méthodes systématiques | La qualité dépend de la recherche, de la sélection, des études primaires et de la synthèse |
| Revue systématique avec méta-analyse par paires | Combiner deux options, par exemple un traitement contre placebo | Exige une comparabilité clinique et méthodologique suffisante |
| Méta-analyse en réseau | Comparer plusieurs traitements à l'aide de preuves directes et indirectes | Exige la transitivité et une cohérence raisonnable entre preuves directes et indirectes |
| Méta-analyse sur données individuelles | Analyser les données de chaque participant | Consommatrice de ressources et sensible au choix des groupes d'investigateurs qui partagent leurs données |
| Revue systématique vivante | Mise à jour en continu lorsque de nouvelles preuves sont publiées | Exige une organisation à long terme, des règles de mise à jour et une gestion des versions |
| Revue rapide | Répondre à une question en peu de temps avec des méthodes simplifiées | Les raccourcis peuvent augmenter le risque de manquer des études pertinentes |
| Scoping review | Cartographier l'étendue, les concepts et les lacunes de connaissances | N'est généralement pas conçue pour fournir une estimation fiable de l'effet |
| Revue de revues | Synthétiser plusieurs revues systématiques | Des études primaires communes peuvent être comptées plusieurs fois |
De la question clinique au protocole
Formuler la question avant la recherche
Pour les questions portant sur des interventions, on utilise généralement le format PICO :
- P, population ou situation clinique
- I, intervention
- C, comparateur
- O, critère de jugement (outcome)
La question doit également préciser le schéma d'étude, le contexte de soins et la durée de suivi pertinente. Une question sur l'effet d'un médicament chez l'adulte atteint d'une pathologie donnée est insuffisamment délimitée si la dose, le traitement comparateur, la sévérité de la maladie et le moment d'évaluation du critère de jugement sont déterminants pour l'interprétation.
Les critères de jugement doivent être hiérarchisés selon leur pertinence pour le patient. La mortalité, les symptômes, la capacité fonctionnelle, la qualité de vie et les effets indésirables graves sont souvent plus importants que les paramètres biologiques ou autres critères de substitution. Un critère de substitution statistiquement sensible peut donner un résultat plus impressionnant qu'un critère pertinent pour le patient, sans démontrer que celui-ci vit plus longtemps ou se porte mieux.
Pour les questions diagnostiques, il faut préciser la population cible, le test index, la référence, le seuil et le rôle clinique envisagé, par exemple le triage, le test complémentaire ou le test de remplacement. Les questions pronostiques exigent notamment un point de départ clair, un facteur pronostique, un critère de jugement et un horizon temporel.
Protocole et enregistrement
Le protocole doit préciser :
- la question et les critères d'inclusion
- les sources d'information et la stratégie de recherche générale
- les critères de jugement principaux et secondaires
- la manière de hiérarchiser plusieurs temps de mesure et échelles de mesure
- le processus de sélection des études et d'extraction des données
- les instruments d'évaluation du risque de biais
- les mesures d'effet et les modèles méta-analytiques prévus
- la prise en charge des données manquantes et des études sans événement
- les analyses en sous-groupes, de sensibilité et de méta-régression prévues
- la méthode d'évaluation du niveau de confiance dans les preuves
L'enregistrement prospectif, par exemple dans PROSPERO, crée une trace datée des méthodes prévues et peut mettre en évidence des modifications a posteriori. L'enregistrement peut aussi réduire la duplication non planifiée des revues [7]. En revanche, l'enregistrement ne signifie pas que le protocole a fait l'objet d'un examen méthodologique complet.
Des modifications légitimes du protocole peuvent être nécessaires. Elles doivent être datées, justifiées et rapportées. Les modifications apportées après que les chercheurs ont pris connaissance des résultats sont particulièrement sensibles, par exemple le changement de critère de jugement principal, la modification de la durée de suivi ou l'ajout de nouveaux sous-groupes.
flowchart TD
A["Délimiter la question clinique<br>et les critères pertinents pour le patient"] --> B["Rédiger le protocole<br>et le plan d'analyse"]
B --> C["Enregistrer le protocole<br>avant la sélection des études"]
C --> D["Mener une recherche large<br>et reproductible"]
D --> E["Sélectionner les études et extraire les données<br>avec contrôle indépendant"]
E --> F["Évaluer le risque de biais<br>pour chaque critère important"]
F --> G["Évaluer la comparabilité<br>clinique et méthodologique"]
G -->|"Suffisante"| H["Réaliser la synthèse<br>statistique prévue"]
G -->|"Insuffisante"| I["Synthèse structurée<br>sans méta-analyse"]
H --> J["Évaluer l'hétérogénéité,<br>la précision et le biais de notification"]
I --> J
J --> K["Graduer le niveau<br>de confiance dans les preuves"]
K --> L["Interpréter les effets absolus<br>et l'applicabilité clinique"]Recherche bibliographique et sélection des études
Sources d'information
Aucune base de données ne contient à elle seule toute la recherche médicale pertinente. Une recherche peut donc devoir couvrir :
- MEDLINE ou PubMed
- Embase
- Cochrane Central Register of Controlled Trials
- des bases de données spécialisées
- des bases de données régionales
- ClinicalTrials.gov et le registre des essais de l'OMS
- des documents réglementaires
- des thèses et des résumés de congrès
- des listes de références et une recherche par citations
- des contacts avec des chercheurs ou des fabricants
PRISMA-S comporte 16 items pour un rapport reproductible des recherches bibliographiques. La base de données, la plateforme de recherche, la date, l'équation de recherche complète, les filtres, les limitations et les méthodes de recherche complémentaires doivent être rapportés [8]. Une recherche dans MEDLINE via Ovid n'est pas techniquement identique à une recherche dans MEDLINE via une autre plateforme.
La stratégie de recherche doit combiner termes d'indexation et termes en texte libre. Des restrictions inutiles de langue, de date ou de type de publication peuvent exclure des preuves pertinentes. Si des restrictions sont appliquées, elles doivent être justifiées par la question posée, et non par la seule commodité.
Un documentaliste spécialisé peut contribuer à améliorer à la fois la sensibilité et la reproductibilité. PRESS est une recommandation spécifique pour la relecture par les pairs des stratégies de recherche électronique [9].
Preuves publiées et non publiées
Les seuls articles de revues ne donnent pas toujours une image complète. Les études aux résultats statistiquement significatifs ou commercialement favorables peuvent avoir une probabilité plus élevée d'être publiées. Ces résultats peuvent aussi être rapportés de manière plus complète que les résultats négatifs ou non concluants.
Les registres d'essais, les documents réglementaires et le contact avec les investigateurs peuvent permettre d'identifier :
- des études terminées mais non publiées
- des critères de jugement principaux préenregistrés
- des critères de jugement omis dans l'article publié
- un suivi plus long
- des effets indésirables supplémentaires
- plusieurs publications issues de la même étude
Une erreur fréquente consiste à compter plusieurs publications d'une même étude comme des études distinctes. Le protocole, le rapport principal, l'analyse secondaire et le suivi à long terme doivent être rattachés à un identifiant d'étude commun.
Sélection des études et extraction des données
La sélection se fait généralement en deux étapes :
- Examen du titre et du résumé.
- Examen du texte intégral des rapports potentiellement pertinents.
Au moins deux personnes doivent évaluer les textes intégraux de manière indépendante. Une double procédure similaire, ou une extraction suivie d'un contrôle indépendant rigoureux, doit être utilisée pour les données essentielles. Les motifs d'exclusion après lecture du texte intégral doivent être documentés.
L'extraction des données doit porter sur bien plus que le nombre de participants et les mesures d'effet. Les variables importantes comprennent notamment :
- le contexte et la période de recrutement
- les critères d'inclusion et d'exclusion
- la sévérité de la maladie et les comorbidités
- la dose de l'intervention et la durée du traitement
- le traitement comparateur
- l'observance et les changements de traitement
- la définition et la méthode de mesure de chaque critère de jugement
- la durée de suivi
- les perdus de vue et le principe d'analyse
- le financement et les conflits d'intérêts
- les informations nécessaires à l'évaluation du risque de biais
Évaluation du risque de biais
Le risque de biais n'est pas synonyme de qualité du rapport
Une étude bien rédigée peut présenter un risque de biais élevé, et une étude insuffisamment rapportée peut, à certains égards, avoir été correctement conduite. Toutefois, lorsque des informations nécessaires manquent, il n'est souvent pas possible de porter un jugement sûr.
Pour les essais randomisés, RoB 2 évalue cinq domaines principaux : le processus de randomisation, les écarts par rapport à l'intervention prévue, les données manquantes sur les critères de jugement, la mesure des critères de jugement et la sélection du résultat rapporté [10]. L'évaluation est spécifique à chaque critère de jugement. Une étude en ouvert peut par exemple présenter un risque de biais plus faible pour la mortalité totale que pour une douleur autodéclarée.
Pour les études de performance diagnostique, QUADAS-2 couvre la sélection des patients, le test index, la référence ainsi que le flux et la chronologie. Les trois premiers domaines sont également évalués du point de vue de l'applicabilité [11]. Pour les études d'intervention non randomisées, une attention particulière doit être portée aux facteurs de confusion, à la sélection et à la classification des interventions.
Instruments à différents niveaux
| Objet de l'évaluation | Instrument approprié | Question à laquelle répond l'instrument |
|---|---|---|
| Essai randomisé | RoB 2 | L'estimation de l'étude peut-elle être systématiquement biaisée ? |
| Étude diagnostique | QUADAS-2 | Existe-t-il un risque de biais ou un problème d'applicabilité ? |
| Revue systématique d'interventions | AMSTAR 2 | La revue a-t-elle été conduite avec des méthodes méthodologiquement fiables ? |
| Revue systématique | ROBIS | Existe-t-il un risque de biais dans le processus, les résultats ou les conclusions de la revue ? |
| Ensemble des preuves pour un critère de jugement | GRADE | Quelle confiance pouvons-nous accorder à l'estimation de l'effet ? |
| Rapport d'une revue systématique | PRISMA 2020 | Les méthodes et les résultats ont-ils été rapportés de manière complète et transparente ? |
AMSTAR 2 comporte 16 items et s'adresse aux revues d'interventions incluant des études randomisées ou non randomisées. L'outil met l'accent sur sept domaines critiques : le protocole, la recherche bibliographique, la justification des exclusions, le risque de biais des études primaires, les méthodes statistiques, la prise en compte du biais lors de l'interprétation et le biais de publication. Les items ne doivent pas être additionnés pour obtenir un simple score numérique de qualité [3].
ROBIS évalue quatre domaines du processus de revue : les critères d'inclusion, l'identification et la sélection des études, le recueil des données et l'évaluation des études, ainsi que la synthèse et les résultats. Un jugement global sur le risque de biais des conclusions de la revue est ensuite porté [4].
Synthèse statistique
Choisir la mesure d'effet selon le critère de jugement et la question
Les mesures d'effet courantes sont :
| Type de critère de jugement | Mesure d'effet | Interprétation clinique |
|---|---|---|
| Critère binaire | Risque relatif, RR | Risque dans le groupe intervention divisé par le risque dans le groupe contrôle |
| Critère binaire | Odds ratio, OR | Rapport de cotes, peut être interprété à tort comme un RR lorsque l'événement est fréquent |
| Critère binaire | Différence de risque, DR | Différence absolue de risque |
| Délai de survenue d'un événement | Hazard ratio, HR | Taux instantané relatif d'événements au cours du suivi |
| Critère continu, même échelle | Différence de moyennes, DM | Différence exprimée dans l'unité d'origine de l'échelle |
| Critère continu, échelles différentes | Différence de moyennes standardisée, DMS | Différence exprimée en écarts-types |
| Critère diagnostique | Sensibilité et spécificité | Capacité du test à identifier respectivement les malades et les non-malades |
Les mesures d'effet relatives doivent être complétées par des effets absolus. Si le RR est de 0,75, la réduction absolue du risque est de 2,5 points de pourcentage lorsque le risque de base est de 10 %, mais seulement de 0,25 point de pourcentage lorsque le risque de base est de 1 %. Un même effet relatif peut donc avoir une portée clinique totalement différente.
Le nombre de sujets à traiter (number needed to treat, NNT) peut être calculé comme l'inverse de la réduction absolue du risque lorsque la période, la population et le comparateur sont clairement précisés. Le NNT n'est pas une propriété invariable du traitement. Il varie selon le risque de base, la durée de suivi et la mesure d'effet.
Effet fixe et effets aléatoires
Un modèle à effet fixe suppose que les études estiment le même effet réel commun et que les différences observées sont principalement dues à l'incertitude aléatoire. Un modèle à effets aléatoires suppose que les effets réels varient d'une étude à l'autre et estime la moyenne d'une distribution d'effets.
Le choix ne doit pas se faire uniquement en testant d'abord l'hétérogénéité. Les connaissances cliniques sur les populations, les traitements et les contextes doivent guider le choix du modèle. Le modèle à effets aléatoires ne résout pas le problème d'une combinaison inappropriée. Il peut en outre accorder un poids relativement plus important aux petites études, ce qui pose problème si celles-ci sont publiées de manière plus sélective ou présentent un risque de biais plus élevé.
Lorsque les études sont peu nombreuses, l'estimation de la variabilité entre études devient incertaine. L'intervalle de confiance autour de l'effet global peut alors être trop étroit avec certaines méthodes standard. C'est pourquoi le choix des méthodes et les analyses de sensibilité doivent être clairement rapportés.
Hétérogénéité
L'hétérogénéité peut être :
- clinique, par exemple une sévérité de la maladie, un âge ou une intervention différents
- méthodologique, par exemple un schéma d'étude, un risque de biais ou une méthode de mesure différents
- statistique, c'est-à-dire la variabilité observée des estimations de l'effet
L'I² estime la part de la variabilité observée qui est compatible avec une variabilité entre études plutôt qu'avec la seule incertitude d'échantillonnage [12]. Le cadre d'interprétation approximatif suivant est souvent utilisé :
| I² | Interprétation possible |
|---|---|
| 0 à 40 % | Peut être négligeable |
| 30 à 60 % | Peut être modérée |
| 50 à 90 % | Peut être importante |
| 75 à 100 % | Peut être considérable |
Les intervalles se chevauchent délibérément. L'I² ne doit pas être interprété de manière mécanique. Un I² élevé peut apparaître lorsque de grandes études précises montrent des différences faibles mais constantes. Un I² faible peut s'observer lorsque des petites études peu nombreuses sont trop imprécises pour révéler une variabilité réelle.
Le tau² décrit la variance entre les effets réels des études, mais sur une échelle qui peut être difficile à interpréter cliniquement. Un intervalle de prédiction indique en revanche l'intervalle dans lequel on peut s'attendre à trouver l'effet réel dans une nouvelle étude comparable. Dans une étude méthodologique portant sur des méta-analyses à effets aléatoires significatives avec hétérogénéité, 72,4 % des intervalles de prédiction englobaient l'absence d'effet, alors que l'intervalle de confiance de l'effet moyen ne le faisait pas [13]. Les intervalles de prédiction sont particulièrement précieux lorsque le résultat doit être transposé à un nouveau contexte de soins, mais deviennent incertains lorsque peu d'études sont incluses.
Analyses en sous-groupes et méta-régression
Les analyses en sous-groupes doivent être peu nombreuses, cliniquement justifiées et de préférence prédéfinies. Il est erroné de conclure que l'effet du traitement diffère entre deux groupes uniquement parce que le résultat est statistiquement significatif dans l'un mais pas dans l'autre. La différence entre les groupes doit être analysée au moyen d'un test d'interaction.
La crédibilité augmente si :
- l'hypothèse a été fixée dans le protocole
- elle est biologiquement ou cliniquement plausible
- la différence est importante
- elle est constante d'une étude à l'autre
- le test d'interaction est en faveur d'une modification de l'effet
- l'analyse repose sur des différences entre participants au sein des études, et non uniquement sur des différences de moyennes entre études
La méta-régression est une analyse observationnelle au niveau des études. Elle peut générer des hypothèses, mais elle est sensible au faible nombre d'études, aux tests multiples, aux facteurs de confusion et aux erreurs écologiques.
Analyses de sensibilité
La robustesse doit être testée par des analyses qui, par exemple :
- excluent les études à risque de biais élevé
- utilisent d'autres modèles statistiques
- utilisent d'autres hypothèses concernant les données manquantes
- séparent les données observationnelles ajustées et non ajustées
- excluent les études non publiées ou rapportées uniquement sous forme de résumé
- traitent différemment les essais en grappes, en cross-over et à plusieurs bras
- évaluent l'influence de certaines études individuelles
Si la conclusion principale change nettement, cela doit apparaître clairement et influer sur la gradation des preuves.
Biais de notification et effets des petites études
Un funnel plot représente les estimations de l'effet des études en fonction d'une mesure de précision ou de l'erreur standard. En l'absence de sélection et d'autres effets des petites études, on s'attend à un entonnoir à peu près symétrique. Une asymétrie peut être due à :
- une publication sélective
- un rapport sélectif des critères de jugement
- une moins bonne qualité méthodologique des petites études
- de réelles différences cliniques entre petites et grandes études
- le hasard
- une mesure d'effet ou une méthode statistique inappropriée
Le funnel plot et les tests fondés sur la régression ont une faible puissance lorsque peu d'études sont incluses. Une limite pratique courante veut que ces analyses aient rarement un sens avec moins de dix études [3,14]. Un test non significatif n'exclut pas un biais de publication.
Des méthodes telles que le trim and fill peuvent être utilisées comme analyses de sensibilité exploratoires, mais elles ne permettent ni de prouver combien d'études manquent ni de restituer l'effet réel. L'évaluation doit également prendre en compte les registres d'essais, les protocoles, le financement, la présence de petites études positives et les différences entre critères de jugement enregistrés et publiés.
Synthèse sans méta-analyse
Il convient de renoncer à la méta-analyse lorsque les études sont trop différentes ou lorsque les données ne peuvent pas être exprimées de manière comparable. L'absence de méta-analyse ne justifie toutefois pas un résumé narratif non systématique.
SWiM définit neuf domaines de rapport pour la synthèse sans méta-analyse. Ils comprennent le regroupement des études, les mesures d'effet standardisées, la méthode de synthèse choisie, la hiérarchisation des résultats, la prise en compte de l'hétérogénéité, le niveau de confiance dans les preuves, la présentation sous forme de tableaux et de figures, la synthèse des résultats ainsi que les limites de la synthèse [15].
Une synthèse structurée doit :
- regrouper les études selon des comparaisons cliniquement pertinentes
- indiquer quelles études contribuent à chaque conclusion
- rapporter le sens, l'ampleur et la précision, et pas seulement les valeurs de P
- prendre en compte le risque de biais
- éviter d'accorder la même importance aux petites et aux grandes études
- rapporter les résultats contradictoires
- expliquer pourquoi aucune méta-analyse n'a été réalisée
Le décompte des votes fondé sur le nombre d'études statistiquement significatives doit être évité. Une petite étude et une grande étude peuvent alors être comptées de la même façon, tandis que la significativité statistique est confondue avec l'ampleur de l'effet.
Méta-analyse en réseau
La méta-analyse en réseau permet de comparer plusieurs interventions au sein d'un réseau connecté. Si des études comparent A à B et B à C, une comparaison indirecte entre A et C peut être calculée. La méthode peut également combiner l'estimation indirecte avec des études de comparaison directe.
Outre les exigences méta-analytiques habituelles, il faut :
- la transitivité, les études des différentes comparaisons doivent être suffisamment similaires en ce qui concerne les modificateurs d'effet
- la cohérence, les preuves directes et indirectes doivent être compatibles
- un réseau de preuves connecté
- une prise en charge appropriée des études comportant plusieurs bras de traitement
- un compte rendu clair de l'incertitude de chaque comparaison
L'extension de PRISMA pour les méta-analyses en réseau comporte des exigences spécifiques concernant notamment la géométrie du réseau, les comparaisons indirectes et l'évaluation de l'incohérence [16]. Les classements de traitements doivent être interprétés avec prudence. Un classement élevé peut reposer sur peu d'études, sur des comparaisons indirectes ou sur un faible niveau de confiance dans les preuves.
Une vaste méta-analyse en réseau sur les antidépresseurs illustre à la fois les possibilités et les limites de l'approche. L'analyse portait sur 522 études et 116 477 participants, mais 73 % des études ont été jugées à risque de biais modéré et le niveau de confiance dans les preuves variait de modéré à très faible [17]. Un réseau étendu et des intervalles étroits ne rendent donc pas toutes les comparaisons également fiables.
Effets indésirables
Les revues systématiques sont souvent mieux conçues pour évaluer le bénéfice que les effets indésirables. Les essais randomisés peuvent être trop petits ou trop courts pour détecter des effets indésirables rares, retardés ou cumulatifs. Les études observationnelles et les données de registres peuvent donc être nécessaires en complément, même si elles comportent un risque plus élevé de confusion et d'autres erreurs systématiques.
Pour chaque critère de jugement relatif à la tolérance, la revue doit rapporter :
- la définition de l'effet indésirable
- s'il a été recherché activement ou rapporté spontanément
- la période de surveillance
- le nombre de participants ayant présenté l'événement et le nombre de participants analysés
- la prise en charge des études sans événement
- la gravité et les arrêts de traitement
- l'imputabilité possible
- les perdus de vue et le rapport sélectif
PRISMA Harms a été élaboré parce que les insuffisances du rapport des études primaires sont souvent amplifiées lorsque les effets indésirables sont synthétisés dans des revues [18]. La formule selon laquelle aucun effet indésirable grave n'a été rapporté ne signifie pas nécessairement que ces effets ont été activement recherchés ou qu'ils ne sont pas survenus.
Évaluation du niveau de confiance dans les preuves
GRADE évalue l'ensemble des preuves pour chaque critère de jugement, et non une étude ou un article dans sa globalité. Quatre niveaux sont utilisés [5] :
| Niveau | Signification pratique |
|---|---|
| Élevé | Forte confiance dans le fait que l'effet réel est proche de l'estimation |
| Modéré | L'effet réel est probablement proche de l'estimation mais peut en différer sensiblement |
| Faible | Confiance limitée, l'effet réel peut différer sensiblement |
| Très faible | Très peu de confiance dans l'estimation de l'effet |
Les essais randomisés partent normalement d'un niveau de confiance élevé et peuvent être déclassés pour :
- Risque de biais.
- Incohérence.
- Caractère indirect.
- Imprécision.
- Biais de publication.
Les études observationnelles partent normalement d'un niveau faible, mais peuvent dans certaines situations être surclassées, par exemple en cas d'effet très important, de relation dose-effet ou lorsqu'une confusion résiduelle plausible tendrait vraisemblablement à réduire l'effet observé [5].
GRADE distingue le niveau de confiance dans les preuves de la force de la recommandation. Une recommandation exige en outre d'évaluer la balance bénéfice-risque, les préférences des patients, l'utilisation des ressources, l'équité, l'acceptabilité et la faisabilité [6].
Un tableau de synthèse des résultats (summary of findings) doit indiquer :
- le critère de jugement et la durée de suivi
- le nombre d'études et de participants
- le risque sans intervention
- le risque avec intervention
- l'effet relatif
- l'effet absolu
- le niveau de confiance dans les preuves
- les motifs de déclassement ou de surclassement
Les effets absolus sont essentiels. Dans une méta-analyse sur le dépistage par PSA, une éventuelle réduction relative de la mortalité par cancer de la prostate ne correspondait qu'à environ un décès de moins pour 1 000 hommes dépistés sur dix ans, alors que le dépistage entraînait des examens diagnostiques supplémentaires et des complications liées au traitement [19]. L'effet relatif seul aurait donné une image incomplète.
Lecture critique en pratique clinique
Un ordre d'évaluation pratique
| Question | Éléments qui renforcent la confiance | Signaux d'alerte |
|---|---|---|
| La revue est-elle pertinente ? | Le PICO et le suivi correspondent à la question clinique | Population large ou différente, critères de substitution |
| Est-elle à jour ? | Dernière recherche récente ou mise à jour vivante | Domaine de recherche en évolution rapide et recherche datant de plusieurs années |
| Existait-il un protocole ? | Protocole prospectif et modifications expliquées | Enregistrement après l'extraction des données ou absence de plan d'analyse |
| La recherche était-elle suffisante ? | Plusieurs bases de données pertinentes, registres et équations de recherche complètes | Une seule base de données, restriction linguistique injustifiée, articles publiés uniquement |
| La sélection était-elle robuste ? | Double lecture indépendante et motifs d'exclusion rapportés | Un seul évaluateur ou sélection sur texte intégral peu claire |
| Le risque de biais a-t-il été évalué ? | Instrument adapté au schéma d'étude et évaluation par critère de jugement | Score numérique de qualité sans évaluation par domaine |
| La méta-analyse était-elle raisonnable ? | Études cliniquement comparables et modèle prédéfini | Combinaison malgré des interventions ou des critères de jugement manifestement différents |
| L'effet est-il cliniquement compréhensible ? | Effets relatifs et absolus avec horizon temporel | Uniquement OR, DMS ou valeur de P |
| L'hétérogénéité est-elle prise en compte ? | Explication clinique, tau², I² et si possible intervalle de prédiction | Hétérogénéité ignorée ou expliquée par de nombreuses analyses a posteriori |
| Existe-t-il un biais de notification ? | Vérification des registres et interprétation prudente | Nombreuses petites études positives et aucune donnée non publiée |
| La conclusion est-elle équilibrée ? | Bénéfice, effets indésirables, précision et applicabilité sont mis en balance | Conclusion fondée uniquement sur la significativité statistique |
Lire un forest plot de manière systématique
Lors de l'examen d'un forest plot, le lecteur doit vérifier :
- Quelle mesure d'effet est utilisée et quel sens correspond à un bénéfice.
- Combien d'études et de participants contribuent réellement.
- Si les grandes et les petites études donnent des résultats similaires.
- Si les intervalles de confiance se chevauchent.
- Si une ou deux études dominent la pondération.
- Si l'effet global englobe l'absence d'effet.
- Si l'intervalle exclut à la fois un bénéfice et un préjudice cliniquement importants.
- Si l'I² et le tau² sont rapportés.
- Si l'intervalle de prédiction englobe l'absence d'effet ou un seuil de décision clinique.
- Si les études à risque de biais élevé influencent la conclusion.
Un intervalle de confiance qui englobe l'absence d'effet ne signifie pas que les traitements sont équivalents. L'intervalle peut inclure à la fois un bénéfice important et un préjudice important. La conclusion correcte est alors que l'estimation est imprécise.
Signification statistique et pertinence clinique
La significativité statistique dépend de la taille de l'échantillon. Un effet très faible peut devenir statistiquement significatif dans une grande méta-analyse, tandis qu'un effet cliniquement important peut être non significatif sur un ensemble de données restreint.
Dans une revue Cochrane sur l'exercice aquatique dans l'arthrose du genou ou de la hanche, l'effet standardisé sur la douleur était de moins 0,31. Exprimé sur une échelle de 0 à 100, ce résultat correspondait à une amélioration d'environ cinq points [20]. La conversion vers une échelle cliniquement familière rend le résultat plus utilisable, mais la différence minimale cliniquement importante doit toujours être prise en compte.
Une méta-analyse de grande ampleur peut également masquer une incertitude liée à l'hétérogénéité. Une revue sur la TENS incluait 381 essais randomisés, mais seuls 26 ont été jugés à faible risque de biais global. Pour la comparaison avec le placebo, l'I² était de 88 %, ce qui montre qu'un nombre élevé de participants n'élimine pas le problème de résultats d'études variables [21].
Mise à jour et gestion des revues
Une revue systématique est à jour jusqu'à la date de sa dernière recherche, et non jusqu'à sa date de publication. L'évaluation du manuscrit et la publication peuvent faire que la recherche soit déjà ancienne lorsque l'article devient disponible.
Les revues systématiques vivantes reposent sur des recherches répétées et une mise à jour continue. Elles conviennent le mieux lorsque :
- la question est hautement prioritaire sur le plan clinique
- une incertitude importante persiste
- de nouvelles études sont publiées régulièrement
- de nouvelles preuves peuvent modifier la conclusion ou la recommandation
Les recommandations méthodologiques concernant les revues vivantes sont plus développées pour leur conduite et leur publication que pour leur rapport et leur évaluation critique. Une scoping review a identifié des recommandations sur la conduite dans 17 publications, mais sur l'évaluation critique dans deux seulement [22]. La fréquence de mise à jour, l'intervalle entre les recherches, les critères déclenchant une nouvelle analyse et le moment de la fin du statut vivant doivent donc être rapportés explicitement.
Pour le clinicien, cela signifie qu'une revue plus ancienne mais bien conduite ne doit pas être rejetée d'emblée. Il faut d'abord vérifier si de nouvelles études sont susceptibles de modifier l'estimation de l'effet, le profil des effets indésirables ou le niveau de confiance dans les preuves.
Sources
- Page MJ et al. The PRISMA 2020 statement: an updated guideline for reporting systematic reviews. BMJ 2021. PMID: 33782057
- Page MJ et al. PRISMA 2020 explanation and elaboration: updated guidance and exemplars for reporting systematic reviews. BMJ 2021. PMID: 33781993
- Shea BJ et al. AMSTAR 2: a critical appraisal tool for systematic reviews that include randomised or non-randomised studies of healthcare interventions, or both. BMJ 2017. PMID: 28935701
- Whiting P et al. ROBIS: A new tool to assess risk of bias in systematic reviews was developed. Journal of Clinical Epidemiology 2016. PMID: 26092286
- Balshem H et al. GRADE guidelines: 3. Rating the quality of evidence. Journal of Clinical Epidemiology 2011. PMID: 21208779
- Guyatt G et al. GRADE guidelines: 1. Introduction, GRADE evidence profiles and summary of findings tables. Journal of Clinical Epidemiology 2011. PMID: 21195583
- Booth A et al. The nuts and bolts of PROSPERO: an international prospective register of systematic reviews. Systematic Reviews 2012. PMID: 22587842
- Rethlefsen ML et al. PRISMA-S: an extension to the PRISMA Statement for Reporting Literature Searches in Systematic Reviews. Systematic Reviews 2021. PMID: 33499930
- McGowan J et al. PRESS Peer Review of Electronic Search Strategies: 2015 Guideline Statement. Journal of Clinical Epidemiology 2016. PMID: 27005575
- Sterne JAC et al. RoB 2: a revised tool for assessing risk of bias in randomised trials. BMJ 2019. PMID: 31462531
- Whiting PF et al. QUADAS-2: a revised tool for the quality assessment of diagnostic accuracy studies. Annals of Internal Medicine 2011. PMID: 22007046
- Higgins JPT et al. Measuring inconsistency in meta-analyses. BMJ 2003. PMID: 12958120
- IntHout J et al. Plea for routinely presenting prediction intervals in meta-analysis. BMJ Open 2016. PMID: 27406637
- Sterne JA et al. Recommendations for examining and interpreting funnel plot asymmetry in meta-analyses of randomised controlled trials. BMJ 2011. PMID: 21784880
- Campbell M et al. Synthesis without meta-analysis in systematic reviews: reporting guideline. BMJ 2020. PMID: 31948937
- Hutton B et al. The PRISMA extension statement for reporting of systematic reviews incorporating network meta-analyses of health care interventions: checklist and explanations. Annals of Internal Medicine 2015. PMID: 26030634
- Cipriani A et al. Comparative efficacy and acceptability of 21 antidepressant drugs for the acute treatment of adults with major depressive disorder: a systematic review and network meta-analysis. Lancet 2018. PMID: 29477251
- Zorzela L et al. PRISMA harms checklist: improving harms reporting in systematic reviews. BMJ 2016. PMID: 26830668
- Ilic D et al. Prostate cancer screening with prostate-specific antigen test: a systematic review and meta-analysis. BMJ 2018. PMID: 30185521
- Bartels EM et al. Aquatic exercise for the treatment of knee and hip osteoarthritis. Cochrane Database of Systematic Reviews 2016. PMID: 27007113
- Johnson MI et al. Efficacy and safety of transcutaneous electrical nerve stimulation for acute and chronic pain in adults: a systematic review and meta-analysis of 381 studies. BMJ Open 2022. PMID: 35144946
- Iannizzi C et al. Methods and guidance on conducting, reporting, publishing, and appraising living systematic reviews: a scoping review. Systematic Reviews 2023. PMID: 38098023