Résumé
La médecine fondée sur les preuves consiste à intégrer les meilleures données scientifiques disponibles à l'expertise clinique ainsi qu'aux valeurs, aux objectifs et à la situation du patient. Elle ne se résume pas à l'application mécanique d'un article, d'une méta-analyse ou d'une recommandation. Les résultats scientifiques doivent d'abord être évalués quant à leur validité, à l'ampleur de l'effet, à sa précision, à leur pertinence et à leur applicabilité au patient concerné [1].
La démarche peut se résumer en cinq étapes : formuler une question à laquelle il est possible de répondre, rechercher les meilleures connaissances disponibles, procéder à l'analyse critique des données, appliquer le résultat avec le patient et évaluer les conséquences de la décision [2]. La question doit être structurée selon le type de question clinique, le plus souvent selon le format PICO : population, intervention ou exposition, comparateur et critère de jugement (outcome). Recherchez en priorité des recommandations ou des revues systématiques récentes et méthodologiquement fiables. Passez aux études primaires lorsque les revues font défaut, sont trop anciennes ou ne correspondent pas à la question.
L'analyse critique doit distinguer trois questions :
- Le résultat est-il suffisamment crédible ?
- Quelle est l'ampleur de l'effet et quelle est sa précision ?
- Le résultat est-il pertinent pour ce patient et pour cette décision ?
Les effets relatifs doivent être complétés par des valeurs absolues, par exemple la réduction absolue du risque et le nombre de sujets à traiter, NNT. Une valeur de p faible ne prouve ni que l'effet est de grande ampleur, ni qu'il est cliniquement important, ni qu'il est exempt de biais. Pour les tests diagnostiques, le résultat doit être interprété en fonction de la probabilité pré-test. Pour les recommandations, la force de la recommandation doit être distinguée du niveau de confiance dans les preuves. Enfin, la décision doit faire l'objet d'un suivi à l'aide de critères de jugement pertinents pour le patient et être réévaluée lorsque l'état du patient, ses objectifs ou l'état des connaissances évoluent.
Principes fondamentaux
Ce qu'est la médecine fondée sur les preuves
La médecine fondée sur les preuves s'est développée afin de rendre les décisions cliniques plus explicites, reproductibles et transparentes. La définition classique insiste sur l'utilisation consciencieuse et judicieuse des meilleures preuves actuelles dans les décisions concernant des patients individuels. L'expérience clinique est nécessaire pour identifier le problème, estimer le risque de base, interpréter l'incertitude et déterminer si les résultats sont applicables. Les préférences du patient sont indispensables, car un même bénéfice et un même préjudice potentiels peuvent être appréciés différemment selon les personnes [1].
Le concept englobe à la fois les décisions individuelles et les décisions à l'échelle collective, par exemple les protocoles de soins, les priorisations et le retrait progressif d'interventions à faible bénéfice. La démarche individuelle peut être décrite en cinq étapes :
| Étape | Signification pratique | Erreur fréquente |
|---|---|---|
| Question | Transformer l'incertitude en une question clinique structurée | La question est trop large ou le critère de jugement trop vague |
| Recherche | Identifier la meilleure source de connaissances disponible | On retient le premier résultat ou on n'interroge qu'une seule base de données |
| Analyse critique | Évaluer le risque de biais, l'ampleur de l'effet, la précision et l'applicabilité | On juge la réputation de la revue plutôt que la méthode de l'étude |
| Application | Intégrer les preuves au jugement clinique et aux objectifs du patient | Une recommandation est appliquée comme une règle, sans individualisation |
| Évaluation | Suivre le processus, le bénéfice, les préjudices et la qualité de la décision | L'effet de la décision n'est pas vérifié |
Le modèle en cinq étapes est également utilisé pour l'enseignement et l'évaluation de la médecine fondée sur les preuves. Une revue systématique des instruments d'évaluation validés a montré que l'analyse critique est souvent mesurée, alors que la capacité à appliquer puis à évaluer la décision l'est nettement plus rarement [2]. Ce constat reflète un problème clinique fréquent : beaucoup d'attention est consacrée à la lecture d'articles, mais moins à la manière dont les connaissances modifient réellement les décisions et le devenir des patients.
Ce que la médecine fondée sur les preuves n'est pas
La médecine fondée sur les preuves n'est pas :
- un livre de recettes où la même mesure s'applique à tous
- une méthode visant à remplacer l'expérience clinique par des statistiques
- l'exigence que chaque décision soit étayée par un essai randomisé
- synonyme de minimisation des coûts
- synonyme d'application d'une recommandation de pratique clinique
- le postulat que toutes les études publiées sont fiables
- le postulat qu'une revue systématique est toujours de haute qualité
- une décision prise à la majorité parmi des experts
L'absence de preuves de haut niveau n'est pas la preuve de l'absence d'effet. Pour les maladies rares, les situations aiguës engageant le pronostic vital, les interventions chirurgicales, les effets indésirables à long terme et les questions difficiles à étudier sur le plan éthique, les essais randomisés peuvent être impossibles ou inappropriés. La décision doit alors reposer sur les meilleures données existantes, tout en exposant clairement l'incertitude.
La hiérarchie des preuves dépend de la question
Une pyramide des preuves unique et générale est insuffisante. Le schéma d'étude approprié dépend de la question posée. Un essai randomisé est généralement le meilleur moyen d'estimer l'effet causal d'une intervention, mais pas d'estimer une prévalence, des effets indésirables tardifs rares ou la performance diagnostique d'un test.
| Question clinique | Schéma d'étude généralement le plus informatif | Questions clés de l'analyse critique |
|---|---|---|
| Traitement ou prévention | Revue systématique d'essais randomisés, puis essai randomisé isolé | Randomisation, assignation secrète, perdus de vue, insu, observance |
| Diagnostic | Étude transversale ou cohorte prospective avec méthode de référence pertinente | Sélection des patients, interprétation en aveugle, biais de vérification, seuil |
| Pronostic | Cohorte prospective, idéalement avec validation externe | Point de départ représentatif, perdus de vue, évaluation des critères de jugement, calibration |
| Étiologie ou préjudice | Étude de cohorte ou cas-témoins, parfois essai randomisé | Confusion, relation dose-effet, séquence temporelle, sélection, erreur de classement |
| Prévalence | Étude transversale représentative | Base de sondage, participation, définition et mesure |
| Expérience des patients | Étude qualitative ou synthèse qualitative des preuves | Échantillonnage raisonné, saturation des données, réflexivité et analyse |
| Mise en œuvre | Essai randomisé pragmatique, essai randomisé en grappes ou série chronologique contrôlée | Contexte, degré de mise en œuvre, contamination et pérennité |
Les revues ont, elles aussi, des finalités différentes. Une revue systématique répond à une question délimitée à l'aide de méthodes prédéfinies. Une scoping review cartographie un domaine plus large et n'a pas nécessairement à évaluer des effets. Une revue narrative peut apporter une compréhension clinique, mais dépend davantage de la sélection opérée par l'auteur. Une umbrella review synthétise des revues systématiques existantes. Ces types de publications ne sont donc pas interchangeables [3].
Démarche
flowchart TD
A["Identifier l'incertitude clinique"] --> B["Formuler la question<br>avec PICO ou équivalent"]
B --> C["Déterminer le type de question<br>et le schéma d'étude pertinent"]
C --> D["Rechercher d'abord une recommandation<br>ou une revue systématique récente"]
D --> E["Évaluer actualité,<br>méthode et pertinence"]
E -->|"Données suffisantes"| F["Quantifier bénéfice,<br>préjudice et incertitude"]
E -->|"Données insuffisantes"| G["Rechercher les études<br>primaires pertinentes"]
G --> H["Analyser de façon critique<br>risque de biais et précision"]
H --> F
F --> I["Évaluer applicabilité,<br>risque de base et faisabilité"]
I --> J["Discuter des options<br>avec le patient"]
J --> K["Prendre et documenter<br>une décision partagée"]
K --> L["Suivre critères de jugement,<br>effets indésirables et décision"]
L --> M["Réévaluer en cas de nouvelles preuves<br>ou de changement de situation"]Étape 1 : identifier la décision et formuler la question
Partez d'une décision réelle, et non d'un domaine de connaissances général. La question « Quel est le meilleur traitement de la fibrillation atriale ? » est trop large. Une question plus utile définit la population de patients, les options et les critères de jugement susceptibles de modifier la décision.
Pour les questions thérapeutiques, on utilise généralement le format PICO :
- P, population : diagnostic, sévérité de la maladie, âge, comorbidités et contexte de soins
- I, intervention : traitement, stratégie diagnostique ou autre mesure
- C, comparison : placebo, prise en charge habituelle, autre traitement actif ou abstention
- O, outcome : effets bénéfiques et préjudices pertinents pour le patient
- T, time : un horizon temporel pertinent peut être ajouté lorsque le critère de jugement dépend du temps
Exemple :
Chez les personnes de plus de 75 ans présentant une fibrillation atriale non valvulaire et un risque hémorragique élevé, les anticoagulants oraux directs réduisent-ils, par rapport à la warfarine, le risque d'accident vasculaire cérébral ischémique sans augmentation inacceptable des hémorragies graves sur deux ans ?
Pour les questions diagnostiques, l'intervention est remplacée par le test index et le comparateur par la méthode de référence. Pour les questions pronostiques, on définit le point de départ, le facteur ou le modèle pronostique, le critère de jugement et la période. Pour les questions relatives à un préjudice, on définit l'exposition et un groupe de comparaison non exposé pertinent.
Le critère de jugement doit être important pour le patient. La mortalité, les symptômes, le niveau fonctionnel, la qualité de vie, les hospitalisations et les effets indésirables graves sont généralement plus directement pertinents que des valeurs biologiques ou des critères de substitution radiologiques. Un critère de substitution peut être utile si son lien avec le bénéfice pour le patient est bien validé, mais l'amélioration d'un biomarqueur ne doit pas être interprétée automatiquement comme une amélioration de l'état de santé.
Étape 2 : rechercher de manière efficace et reproductible
La recherche doit être adaptée au délai disponible et à l'enjeu de la décision. Face à une question urgente concernant un patient, une synthèse de connaissances validée peut être raisonnable. Pour l'élaboration d'une recommandation ou d'un protocole de soins, une recherche documentée, reproductible et plus large est indispensable.
Un ordre de recherche pratique est le suivant :
- Recommandation nationale ou internationale récente.
- Revue systématique ou méta-analyse.
- Essais randomisés plus récents ou études observationnelles de bonne qualité publiés après la date de la dernière recherche de la revue.
- Études primaires isolées en l'absence de synthèses.
- Consensus d'experts lorsque les données empiriques sont insuffisantes.
Vérifiez toujours :
- à quelle date la recherche bibliographique a été clôturée
- si la population, l'intervention et les critères de jugement correspondent à la question
- si le document a été remplacé ou mis à jour
- si la recommandation est adaptée à un autre système de santé
- si les médicaments, les examens diagnostiques ou le suivi sont disponibles en Suède
Les recommandations ne doivent pas être acceptées sur la seule base de leur émetteur. Dans une évaluation systématique de 40 recommandations sur la dermatite atopique, la qualité méthodologique variait fortement. L'applicabilité et la rigueur méthodologique étaient les domaines les plus faibles, et la gestion des conflits d'intérêts était souvent insuffisante [4]. Les conditions réglementaires, les restrictions de remboursement et les contraintes organisationnelles propres à la Suède peuvent en outre différer des recommandations internationales.
Recherche pratique dans PubMed
Commencez par les concepts clés issus du PICO. Utilisez à la fois des descripteurs et du texte libre lorsque la recherche doit être exhaustive. Évitez d'introduire d'emblée toutes les caractéristiques possibles des patients, au risque de manquer des études pertinentes.
Une structure simplifiée pour une question thérapeutique est la suivante :
(population OR synonyme) AND (intervention OR synonyme) AND
(randomized controlled trial OR systematic review)Ne recherchez pas systématiquement un critère de jugement attendu tel que « mortality » si cela risque d'exclure des études dans lesquelles ce critère n'apparaît que dans le texte intégral. Documentez la base de données, la date, l'équation de recherche complète et les éventuels filtres lorsque la recherche doit pouvoir être vérifiée ou reproduite.
Étape 3 : choisir la bonne source de connaissances
Une revue systématique bien conduite est souvent la source la plus efficace, car elle synthétise l'ensemble des connaissances. Elle n'est toutefois fiable que dans la mesure où ses méthodes et les études incluses le sont. Une méta-analyse est une méthode statistique, et non un label de qualité.
GRADE est utilisé pour évaluer le niveau de confiance dans l'ensemble des preuves pour chaque critère de jugement important. L'évaluation porte notamment sur le risque de biais, l'incohérence, le caractère indirect, l'imprécision et le biais de publication. Le niveau de confiance dans les preuves est classé comme élevé, modéré, faible ou très faible [5].
Les revues systématiques doivent rendre compte de la question, du protocole, de la recherche, de la sélection, du risque de biais, de la synthèse et de l'évaluation des preuves. PRISMA 2020 comporte 27 items de déclaration et un diagramme de flux à cet effet [6]. PRISMA porte sur le compte rendu, et non sur la qualité méthodologique. Une liste de contrôle complète ne garantit donc pas que la revue a été bien conduite. Pour l'évaluation méthodologique des revues portant sur des interventions, AMSTAR 2 peut être utilisé. Cet outil couvre les revues d'études randomisées comme non randomisées [7].
Analyse critique
Commencer par la méthode, pas par les résultats
La lecture doit suivre l'ordre suivant :
- Question de recherche et schéma d'étude.
- Population, critères d'inclusion et contexte de soins.
- Intervention ou exposition et comparateur.
- Critères de jugement et durée de suivi.
- Méthodes limitant les biais.
- Perdus de vue et données manquantes.
- Ampleur de l'effet et intervalle de confiance.
- Financement, protocole, enregistrement et conflits d'intérêts.
- Seulement ensuite, la conclusion des auteurs.
Le résumé et la discussion sont insuffisants pour une évaluation complète de la qualité. Lorsque la décision est importante, examinez les tableaux, les figures, les annexes, le protocole de l'étude et le plan d'analyse statistique.
Les recommandations relatives au compte rendu des études facilitent la lecture. CONSORT s'applique aux essais randomisés en groupes parallèles [8], STROBE aux études observationnelles [9], STARD aux études de performance diagnostique [10] et TRIPOD aux modèles de prédiction diagnostiques ou pronostiques [11]. Ces recommandations améliorent la transparence, mais ne remplacent pas l'évaluation du risque de biais.
Essais d'intervention randomisés
La randomisation réduit la confusion en répartissant entre les groupes les facteurs pronostiques connus comme inconnus. Cet avantage peut être perdu en cas d'assignation défaillante, de perdus de vue sélectifs, de passage d'un bras à l'autre (crossover) ou d'analyse inappropriée.
Évaluez en particulier :
- La séquence de randomisation était-elle réellement aléatoire ?
- L'assignation était-elle tenue secrète jusqu'à l'inclusion ?
- Les participants, les soignants et les évaluateurs des critères de jugement étaient-ils en aveugle lorsque cela était possible ?
- Les groupes étaient-ils traités de manière identique en dehors de l'intervention ?
- Le critère de jugement était-il prédéfini, pertinent et mesuré de la même façon ?
- Les perdus de vue étaient-ils peu nombreux et répartis de manière équilibrée ?
- Les participants ont-ils été analysés principalement selon le groupe d'assignation initial ?
- Tous les critères de jugement prédéfinis ont-ils été rapportés ?
- L'étude a-t-elle été arrêtée prématurément après un effet d'une ampleur inattendue ?
- L'étude était-elle dimensionnée à la fois pour le bénéfice et pour les préjudices importants ?
L'analyse en intention de traiter estime l'effet du fait d'être assigné à une stratégie et préserve en règle générale la comparabilité conférée par la randomisation. L'analyse per protocole estime l'effet chez les participants ayant suivi le protocole, mais peut réintroduire de la confusion. Les deux peuvent être pertinentes, mais elles répondent à des questions différentes.
Les essais en grappes nécessitent une analyse spécifique, car les patients d'une même unité de soins ne sont pas statistiquement indépendants. Dans les essais en crossover, il faut évaluer un éventuel effet résiduel du traitement et le caractère suffisant de la période de wash-out.
Études observationnelles
Les études observationnelles sont essentielles pour le pronostic, la prévalence, le diagnostic, les préjudices rares et les effets à long terme. Elles peuvent aussi fournir des informations précieuses sur l'effet d'un traitement lorsque la randomisation n'est pas réalisable. Leurs résultats sont toutefois plus vulnérables au biais de sélection, au biais d'information et à la confusion [12].
Les problèmes fréquents sont :
| Problème | Exemple | Conséquence |
|---|---|---|
| Confusion par indication | Les patients les plus graves reçoivent un traitement donné | Le traitement peut à tort paraître délétère |
| Biais de sélection | La participation ou le suivi dépend du pronostic | Les groupes comparés deviennent systématiquement différents |
| Erreur de classement | Le diagnostic ou l'exposition médicamenteuse est mal enregistré | L'association est atténuée ou faussée |
| Biais de temps immortel | Le statut d'exposé suppose la survie jusqu'à une date ultérieure | Le traitement peut à tort paraître protecteur |
| Biais de l'utilisateur en bonne santé | Les personnes traitées ont aussi d'autres comportements favorables à la santé | L'effet est surestimé |
| Censure informative | Les sorties d'étude sont liées au pronostic ou à l'effet du traitement | Les participants restants ne sont pas représentatifs |
| Confusion résiduelle | Une variable importante manque ou est mesurée grossièrement | L'analyse ajustée reste biaisée |
Dans une cartographie des problèmes méthodologiques des études fondées sur des bases de données de santé, la confusion était la principale catégorie la plus fréquente. La confusion par indication, la confusion résiduelle, l'erreur de classement des critères de jugement et le biais de temps immortel étaient particulièrement fréquents [13].
L'ajustement par régression, l'appariement et les méthodes fondées sur le score de propension peuvent équilibrer les facteurs mesurés, mais ne peuvent pas éliminer avec certitude les facteurs de confusion non mesurés. Le score de propension ne doit donc pas être considéré comme un substitut statistique à la randomisation. La méthode peut compléter des données randomisées et améliorer la comparabilité dans des données observationnelles, mais le résultat dépend des variables mesurées, de la spécification du modèle et d'un chevauchement suffisant entre les groupes de traitement [14].
Une base de données volumineuse ou un intervalle de confiance très étroit ne corrige pas les biais. Au contraire, un intervalle de confiance étroit peut donner un faux sentiment de certitude autour d'une estimation biaisée.
Études diagnostiques
Un test diagnostique doit être évalué dans la population et la situation clinique où il sera utilisé. Les études de type cas-témoins comparant des patients manifestement malades à des témoins parfaitement sains tendent à surestimer la performance du test.
Les mesures de base sont :
- Sensibilité : proportion de malades ayant un test positif.
- Spécificité : proportion de non-malades ayant un test négatif.
- Rapport de vraisemblance positif : sensibilité / (1 - spécificité).
- Rapport de vraisemblance négatif : (1 - sensibilité) / spécificité.
- Valeur prédictive positive : probabilité de maladie en cas de test positif.
- Valeur prédictive négative : probabilité d'absence de maladie en cas de test négatif.
Les valeurs prédictives dépendent fortement de la prévalence de la maladie et ne peuvent pas être transposées sans précaution entre soins primaires, service d'urgences et consultation spécialisée. Les rapports de vraisemblance peuvent servir à actualiser les odds (cotes) :
Odds pré-test = probabilité pré-test / (1 - probabilité pré-test)
Odds post-test = odds pré-test × rapport de vraisemblance
Probabilité post-test = odds post-test / (1 + odds post-test)Un test est le plus utile lorsque son résultat peut faire franchir à la probabilité un seuil de décision clinique. Un test est moins utile si le traitement doit être administré quel que soit le résultat, ou si aucun résultat possible ne justifierait un traitement. La sensibilité et la spécificité varient en outre lorsque le seuil est modifié. La courbe ROC montre la capacité discriminante du test sur plusieurs seuils, mais n'indique pas à elle seule quel seuil est cliniquement approprié [15].
Revues systématiques et méta-analyses
Vérifiez si la revue comporte :
- un protocole préenregistré ou daté
- des critères d'inclusion explicites
- une recherche suffisamment large et récente
- un examen indépendant par au moins deux personnes
- la liste des articles exclus après lecture du texte intégral
- une évaluation du risque de biais pour chaque critère de jugement pertinent
- une méthode de synthèse justifiée
- une analyse de l'hétérogénéité clinique et statistique
- une évaluation du biais de publication lorsque cela est possible
- la présentation des effets absolus et du niveau de confiance dans les preuves
L'hétérogénéité statistique ne doit pas être évaluée uniquement à l'aide de l'I². Les différences de population, de dose, d'intervention, de suivi, de définitions et de risque de biais doivent également être analysées. Une estimation poolée peut être trompeuse si les études ne portent pas sur la même question clinique.
La méta-analyse en réseau permet de comparer plusieurs traitements à l'aide de preuves directes et indirectes. Elle requiert une transitivité raisonnable, c'est-à-dire que les modificateurs d'effet des études soient suffisamment comparables pour autoriser des comparaisons indirectes. Le classement des traitements ne doit pas être lu sans les tailles d'effet, les intervalles de confiance, l'analyse d'incohérence et l'évaluation du niveau de confiance dans les preuves [16].
Interprétation des mesures d'effet
Effets relatifs et absolus
Pour un critère de jugement binaire :
Risque dans le groupe témoin = événements dans le groupe témoin / effectif du groupe témoin
Risque dans le groupe intervention = événements dans le groupe intervention / effectif du groupe intervention
Risque relatif, RR = risque intervention / risque témoin
Réduction relative du risque = 1 - RR
Réduction absolue du risque, RAR = risque témoin - risque intervention
NNT = 1 / RARSi le risque diminue de 10 % à 8 %, le RR est de 0,80, la réduction relative du risque de 20 %, la RAR de 2 points de pourcentage et le NNT de 50 sur la période étudiée. Si le même RR s'applique à un risque de base de 1 %, la RAR devient 0,2 point de pourcentage et le NNT 500. L'effet relatif est identique, mais le bénéfice clinique diffère considérablement.
Le NNT doit toujours être indiqué avec :
- le critère de jugement
- la période
- le comparateur
- la population de patients ou le risque de base
- l'intervalle de confiance lorsqu'il est disponible
Pour les préjudices, on utilise de manière analogue l'augmentation absolue du risque et le nombre de sujets nécessaire pour nuire, NNH. Le NNT et le NNH ne doivent pas être comparés mécaniquement si les critères de jugement diffèrent par leur gravité.
L'odds ratio peut approcher le risque relatif lorsque l'événement est rare, mais surestime souvent l'effet relatif lorsque le critère de jugement est fréquent. Le hazard ratio décrit des taux d'événements relatifs au cours du temps et ne peut pas être directement converti en rapport de risques sans informations supplémentaires.
Critères de jugement continus
La différence de moyennes est la plus facile à interpréter lorsque toutes les études utilisent la même échelle. La différence de moyennes standardisée est utilisée lorsque différentes échelles mesurent le même construit, mais elle s'exprime en écarts-types et est moins intuitive sur le plan clinique.
La significativité statistique doit être distinguée de la pertinence clinique. Une très grande étude peut mettre en évidence une petite différence que le patient ne perçoit pas. La différence minimale cliniquement importante peut aider, mais sa valeur dépend de la population, de l'instrument de mesure, de la situation initiale et de la méthode. Un seuil issu d'un autre stade de sévérité ou d'une autre intervention ne doit pas être utilisé sans vérification de sa pertinence [17].
Intervalles de confiance et valeurs de p
La valeur de p indique dans quelle mesure les données observées sont incompatibles avec une hypothèse nulle statistique spécifiée, compte tenu des hypothèses du modèle. Elle n'indique ni la probabilité que l'hypothèse soit vraie, ni la probabilité que le résultat soit dû au hasard, ni la pertinence clinique de l'effet.
L'intervalle de confiance renseigne à la fois sur le sens et sur la précision de l'effet. Demandez-vous :
- L'intervalle inclut-il l'absence d'effet ?
- Inclut-il un bénéfice cliniquement important ?
- Inclut-il un préjudice cliniquement important ?
- L'intervalle est-il si large que plusieurs décisions différentes restent raisonnables ?
Un résultat non significatif peut tenir à une précision insuffisante et n'équivaut pas automatiquement à la démonstration d'une absence d'effet. Les essais d'équivalence et de non-infériorité exigent des marges et des principes d'analyse spécifiques et prédéfinis.
Un exemple clinique d'effet absolu
Dans une méta-analyse du dépistage du cancer de la prostate par dosage du PSA, une éventuelle réduction relative de la mortalité spécifique par cancer de la prostate dans l'étude méthodologiquement la plus solide correspondait à environ un décès de moins pour 1 000 hommes dépistés sur dix ans. Dans le même temps, les diagnostics et les complications liées aux traitements augmentaient. Cet exemple montre pourquoi les mesures d'effet relatives, les valeurs absolues, l'horizon temporel et les préjudices doivent être présentés conjointement [18].
Évaluation du niveau de confiance dans les preuves
GRADE évalue les preuves par critère de jugement, et non par article. Une même étude peut donc fournir des données plus fiables pour la mortalité que pour la qualité de vie ou les effets indésirables.
| Domaine GRADE | Question lors de l'évaluation |
|---|---|
| Risque de biais | La conduite des études a-t-elle pu fausser systématiquement le résultat ? |
| Incohérence | L'ampleur ou le sens de l'effet diffère-t-il entre les études sans explication plausible ? |
| Caractère indirect | La population, l'intervention, le comparateur ou le critère de jugement s'écartent-ils de la décision ? |
| Imprécision | L'intervalle de confiance est-il si large que des décisions cliniques différentes sont possibles ? |
| Biais de publication | Des études négatives ou de petite taille pourraient-elles manquer ? |
Les essais randomisés débutent généralement avec un niveau de confiance élevé et peuvent être déclassés. Les études observationnelles débutent généralement à un niveau plus bas, mais peuvent dans certaines situations être surclassées, par exemple en cas d'effet très important, de relation dose-effet ou lorsqu'une confusion résiduelle tendrait vraisemblablement à réduire l'effet observé [5].
Une recommandation forte peut parfois être émise malgré un faible niveau de confiance dans les preuves, par exemple lorsqu'un préjudice potentiellement mortel est plausible et que l'alternative est simple et sûre. À l'inverse, une recommandation conditionnelle peut être justifiée malgré un niveau de confiance élevé lorsque le bénéfice et le préjudice sont proches ou que les valeurs des patients varient.
Des preuves à la décision pour le patient
Applicabilité
Après l'analyse critique, il convient d'évaluer les points suivants :
- Le patient ressemble-t-il aux participants de l'étude en termes de sévérité de la maladie, d'âge et de comorbidités ?
- Le risque de base du patient est-il plus élevé ou plus faible ?
- La dose, l'intensité et le suivi de l'intervention sont-ils réalisables ?
- Le patient présente-t-il des contre-indications ou une vulnérabilité particulière aux préjudices ?
- Les critères de jugement auxquels le patient accorde de l'importance ont-ils été mesurés ?
- L'horizon temporel est-il pertinent au regard de l'espérance de vie et des objectifs thérapeutiques ?
- Existe-t-il des risques concurrents ?
- Quels coûts pratiques, contrôles et contraintes thérapeutiques s'y ajoutent ?
- Le traitement comparateur correspond-il à la prise en charge actuelle en Suède ?
La multimorbidité peut rendre contradictoires des recommandations distinctes. L'association de plusieurs recommandations fondées sur les preuves n'est pas automatiquement fondée sur les preuves si elle conduit à une polymédication, à une charge thérapeutique déraisonnable ou à des effets indésirables cumulatifs. Il faut alors privilégier les critères de jugement les plus importants pour le patient et tenir compte du délai avant le bénéfice attendu.
Décision médicale partagée
Lorsque plusieurs options raisonnables existent, le clinicien doit exposer :
- qu'une décision doit être prise
- les options disponibles, y compris l'abstention
- le bénéfice et le préjudice absolus attendus
- l'incertitude des estimations
- les conséquences pratiques
- les critères de jugement auxquels le patient accorde le plus d'importance
Les outils d'aide à la décision destinés aux patients peuvent améliorer les connaissances, la perception du risque et la participation. Une revue Cochrane portant sur 209 études et 107 698 participants a montré que les aides à la décision augmentaient probablement la concordance entre des valeurs éclairées et les choix effectués. Elles amélioraient également les connaissances et la justesse de la perception du risque, sans augmentation démontrée du regret décisionnel [19].
Les risques devraient de préférence être exprimés sous forme de fréquences naturelles avec le même dénominateur, par exemple « 8 sur 100 contre 10 sur 100 sur cinq ans ». Évitez de présenter le bénéfice sous forme de réduction relative du risque et le préjudice sous forme d'augmentation absolue du risque. Utilisez le même horizon temporel et le même format visuel pour les deux.
Il est utile de documenter :
- la décision prise
- les options discutées
- le bénéfice et le préjudice estimés
- les objectifs principaux du patient
- l'incertitude persistante
- le suivi prévu et les critères de réévaluation
Suivi, mise en œuvre et réévaluation
La médecine fondée sur les preuves ne s'arrête pas une fois la décision prise. Évaluez si l'intervention a été réalisée, si elle a produit l'effet recherché et si des conséquences indésirables sont survenues.
À l'échelle individuelle, le suivi doit porter sur :
- l'effet pertinent pour le patient
- les effets indésirables et la charge thérapeutique
- l'observance et la faisabilité
- l'évolution des préférences
- de nouvelles contre-indications ou des risques concurrents
- la nécessité d'une adaptation posologique, d'un arrêt ou d'une stratégie alternative
À l'échelle d'un service, on peut mesurer l'adhésion à un processus recommandé, la variabilité injustifiée des pratiques, les résultats cliniques, l'équité, la consommation de ressources et la fréquence du surdiagnostic ou des soins à faible valeur ajoutée.
La formation seule n'entraîne souvent qu'un changement limité. Une revue Cochrane de 215 études a montré que les réunions de formation entraînaient probablement une légère amélioration de la pratique clinique et une amélioration moindre des résultats pour les patients. L'effet était variable et semblait pouvoir être renforcé par plusieurs stratégies combinées [20]. La mise en œuvre peut donc nécessiter de combiner parcours de soins locaux, retour d'information, rappels, répartition des responsabilités et accès à des outils d'aide à la décision.
Les rappels électroniques ne sont pas une solution universelle. Une revue systématique de 54 essais randomisés menés en soins primaires a mis en évidence des améliorations portant principalement sur la documentation et certains indicateurs de processus centrés sur le patient, alors que les effets sur la sécurité, l'efficience et les résultats cliniques étaient moins constants [21]. Les outils d'aide à la décision doivent être conçus pour s'intégrer au flux de travail, pouvoir être ignorés lorsque le patient s'écarte de la situation standard et ne pas contribuer à la lassitude face aux alertes.
L'état des connaissances doit être réévalué lorsque :
- un nouveau traitement ou une nouvelle méthode diagnostique est introduit
- de nouveaux signaux de sécurité apparaissent
- un essai randomisé important est publié
- une revue systématique ou une recommandation est mise à jour
- le risque de base ou les objectifs du patient évoluent
- l'intervention ne produit pas l'effet attendu
- la charge thérapeutique dépasse le bénéfice
Une culture de la médecine fondée sur les preuves efficace exige donc à la fois des compétences individuelles et des systèmes organisationnels pour la recherche documentaire, l'analyse critique, la décision médicale partagée, le suivi et l'abandon des pratiques inefficaces.
Sources
- Sackett DL et al. Evidence based medicine: what it is and what it isn't. BMJ 1996. PMID: 8555924
- Kumaravel B et al. A systematic review and taxonomy of tools for evaluating evidence-based medicine teaching in medical education. Systematic Reviews 2020. PMID: 32331530
- Grant MJ, Booth A. A typology of reviews: an analysis of 14 review types and associated methodologies. Health Information and Libraries Journal 2009. PMID: 19490148
- Arents BWM et al. Global Guidelines in Dermatology Mapping Project, a systematic review of atopic dermatitis clinical practice guidelines: are they clear, unbiased, trustworthy and evidence based? British Journal of Dermatology 2022. PMID: 34984668
- Guyatt G et al. GRADE guidelines: 1. Introduction, GRADE evidence profiles and summary of findings tables. Journal of Clinical Epidemiology 2011. PMID: 21195583
- Page MJ et al. The PRISMA 2020 statement: an updated guideline for reporting systematic reviews. BMJ 2021. PMID: 33782057
- Shea BJ et al. AMSTAR 2: a critical appraisal tool for systematic reviews that include randomised or non-randomised studies of healthcare interventions, or both. BMJ 2017. PMID: 28935701
- Schulz KF et al. CONSORT 2010 statement: updated guidelines for reporting parallel group randomised trials. BMJ 2010. PMID: 20332509
- von Elm E et al. The Strengthening the Reporting of Observational Studies in Epidemiology statement: guidelines for reporting observational studies. Journal of Clinical Epidemiology 2008. PMID: 18313558
- Bossuyt PM et al. STARD 2015: an updated list of essential items for reporting diagnostic accuracy studies. BMJ 2015. PMID: 26511519
- Collins GS et al. Transparent reporting of a multivariable prediction model for individual prognosis or diagnosis: the TRIPOD statement. BMJ 2015. PMID: 25569120
- Hammer GP et al. Avoiding bias in observational studies: part 8 in a series of articles on evaluation of scientific publications. Deutsches Ärzteblatt International 2009. PMID: 19946431
- Prada-Ramallal G et al. Bias in pharmacoepidemiologic studies using secondary health care databases: a scoping review. BMC Medical Research Methodology 2019. PMID: 30871502
- Liau MYQ et al. Can propensity score matching replace randomized controlled trials? World Journal of Methodology 2024. PMID: 38577204
- Kallner A. Bayes' theorem, the ROC diagram and reference values: definition and use in clinical diagnosis. Biochemia Medica 2018. PMID: 29209139
- Christofilos SI et al. Network meta-analyses: methodological prerequisites and clinical usefulness. World Journal of Methodology 2022. PMID: 35721244
- Draak THP et al. The minimum clinically important difference: which direction to take. European Journal of Neurology 2019. PMID: 30793428
- Ilic D et al. Prostate cancer screening with prostate-specific antigen test: a systematic review and meta-analysis. BMJ 2018. PMID: 30185521
- Stacey D et al. Decision aids for people facing health treatment or screening decisions. Cochrane Database of Systematic Reviews 2024. PMID: 38284415
- Forsetlund L et al. Continuing education meetings and workshops: effects on professional practice and healthcare outcomes. Cochrane Database of Systematic Reviews 2021. PMID: 34523128
- Nguyen OT et al. Electronic health record nudges and health care quality and outcomes in primary care: a systematic review. JAMA Network Open 2024. PMID: 39287947