Résumé
Un essai contrôlé randomisé (ECR) compare des interventions en répartissant les participants ou des groupes de participants de manière aléatoire. Une randomisation correcte crée des groupes comparables en espérance et permet d'interpréter une différence de critère de jugement comme un effet causal du traitement. Cela suppose que la séquence d'allocation soit imprévisible, que les écarts au protocole et les perdus de vue soient correctement pris en charge, que les critères de jugement soient mesurés sans différence systématique et que les résultats ne soient pas sélectionnés en fonction de ce que montrent les analyses.
Lors de la lecture critique, le clinicien doit d'abord identifier la question de l'étude et l'estimand, c'est-à-dire l'effet du traitement réellement visé. Il convient ensuite d'examiner la randomisation et l'assignation secrète, l'aveugle, les perdus de vue, les critères de jugement, le principe d'analyse et la communication sélective des résultats. Le résultat doit être apprécié à l'aide de la taille d'effet et de l'intervalle de confiance à 95 %, et non uniquement de la valeur de P. Pour les critères binaires, les effets relatifs et absolus sont tous deux nécessaires. Enfin, on évalue la pertinence clinique, la sécurité et la transposabilité au patient concerné.
CONSORT 2025 précise ce qu'un ECR publié doit rapporter au minimum, tandis que SPIRIT 2025 s'applique aux protocoles d'étude. Ces listes de contrôle améliorent la transparence mais ne sont pas des instruments de cotation de la qualité méthodologique [1,2]. Le risque de biais doit plutôt être évalué critère par critère à l'aide d'un outil structuré, par exemple Cochrane RoB 2 [3].
Place de l'ECR dans la médecine fondée sur les preuves
Ce que permet la randomisation
Dans un ECR, le traitement est déterminé par un mécanisme aléatoire. Contrairement à une étude observationnelle, l'allocation n'est donc pas influencée de manière systématique par le pronostic, le jugement du soignant ou la préférence du patient. La randomisation équilibre en espérance les facteurs pronostiques connus comme inconnus. C'est la principale raison pour laquelle un ECR bien conduit fournit généralement des preuves causales plus solides sur les effets d'une intervention qu'une comparaison non randomisée.
La randomisation ne garantit en revanche pas que les groupes seront identiques. Des différences fortuites, y compris cliniquement importantes, peuvent survenir, en particulier dans les petites études. Des différences à l'inclusion ne prouvent donc pas en elles-mêmes l'échec de la randomisation. Les tests de significativité portant sur les variables à l'inclusion sont inappropriés, car, si la randomisation est correcte, toutes les différences sont dues au hasard.
Un ECR ne protège pas non plus automatiquement contre les biais survenant après la randomisation. L'effet peut être faussé, par exemple, par :
- la connaissance de l'allocation à venir avant l'inclusion du patient
- des traitements concomitants ou un suivi différents entre les groupes
- des perdus de vue liés à la fois au traitement et au pronostic
- une mesure subjective du critère de jugement sans aveugle
- une analyse dans un autre groupe que celui auquel le participant a été randomisé
- la communication sélective de critères de jugement, de temps de mesure ou d'analyses
La recherche méta-épidémiologique a montré qu'une génération de séquence, une assignation secrète et un aveugle insuffisants ou mal décrits sont associés à des effets thérapeutiques estimés plus importants. Cette association est particulièrement nette pour les critères subjectifs. Les petites études tendent également à rapporter des effets plus importants que les grandes [4].
Ce à quoi un ECR peut et ne peut pas répondre
L'ECR se prête avant tout aux questions portant sur le bénéfice et les effets indésirables d'interventions préventives, thérapeutiques, diagnostiques ou organisationnelles. Il peut estimer l'effet dans des conditions idéales (efficacy) ou l'effet en pratique courante (effectiveness).
L'ECR est moins adapté lorsque :
- des effets indésirables rares ou très tardifs constituent la question principale
- l'exposition ne peut pas être attribuée de manière éthique
- une longue période de latence rendrait l'étude déraisonnablement grande ou longue
- le pronostic, la prévalence, l'étiologie ou la performance diagnostique constituent la véritable question
- l'intervention est déjà si bien établie qu'une randomisation contre l'absence de traitement serait contraire à l'éthique
Les données de sécurité issues des ECR sont souvent limitées par la sélection, la durée de suivi et la taille de l'échantillon. L'absence de différence statistiquement significative en matière d'effets indésirables ne démontre donc pas que l'intervention est sûre. Les données randomisées doivent souvent être complétées par des registres, la pharmacovigilance et d'autres données observationnelles.
De la question clinique au schéma d'étude
Formuler la question et l'effet thérapeutique
L'étude doit partir d'une question clinique explicite :
- population
- intervention
- comparateur
- critère de jugement
- temps de mesure pertinent
- contexte de soins
Il ne suffit pas d'indiquer que deux traitements seront comparés. Le protocole doit préciser quel effet doit être estimé. En pratique, un estimand décrit :
- la population
- les interventions
- le critère de jugement
- la manière de prendre en compte les événements survenant après la randomisation
- la mesure d'effet au niveau de la population
Les événements survenant après la randomisation peuvent être un arrêt du traitement, un changement de traitement, un traitement additionnel, une transplantation ou un décès avant la mesure prévue. Les différentes façons de les prendre en compte répondent à des questions cliniques différentes. Un effet de stratégie thérapeutique peut par exemple intégrer tous les événements survenant après la randomisation, tandis qu'un effet hypothétique cherche à estimer ce qui se serait passé en l'absence de changement de traitement.
Un protocole détaillé et un plan d'analyse statistique doivent être accessibles au public. SPIRIT 2025 définit 34 items minimaux pour les protocoles et met notamment l'accent sur l'enregistrement, les critères de jugement principaux, les effets indésirables, la population d'analyse, les perdus de vue, le partage des données et la participation des patients [5].
Choix du groupe contrôle
Le groupe contrôle détermine la question à laquelle l'étude répond.
| Contrôle | Question appropriée | Limites importantes |
|---|---|---|
| Placebo ou intervention simulée | Effet spécifique au-delà de l'attente, de l'évolution naturelle et du contact avec les soins | Peut être contraire à l'éthique si un traitement efficace est refusé |
| Absence d'intervention | Effet total par rapport à l'abstention | Aveugle difficile, risque de différences d'attention et de soins additionnels |
| Soins usuels | Effet de l'introduction de l'intervention dans la pratique actuelle | Les soins usuels doivent être décrits et peuvent varier entre centres |
| Contrôle actif | Comparaison avec un traitement établi | Nécessite souvent une étude plus grande, en particulier en non-infériorité |
| Dose ou stratégie | Laquelle de plusieurs stratégies actives est la meilleure | Les différences d'observance et de traitements concomitants doivent être rapportées |
Le contrôle par placebo est précieux sur le plan méthodologique mais n'est pas toujours pertinent cliniquement. Un contrôle actif peut mieux étayer le choix thérapeutique, mais le résultat dépend de l'administration adéquate du traitement contrôle et de l'obtention de l'effet attendu dans le contexte étudié.
Choix des critères de jugement
Le critère de jugement principal doit être cliniquement pertinent, bien défini, validé et mesurable avec une précision suffisante. Sa définition doit inclure la méthode de mesure, le temps de mesure, la forme d'analyse et la prise en compte des événements concurrents.
Les critères importants pour le patient, par exemple la survie, les symptômes, la fonction et la qualité de vie, sont en règle générale plus directement utiles que des valeurs biologiques. Les critères de substitution peuvent raccourcir les études mais peuvent être trompeurs si leur lien avec les critères importants pour le patient n'est pas validé pour la même maladie, la même intervention et le même contexte. La publication d'études utilisant des critères de substitution doit justifier clairement la validité biologique et empirique du critère de substitution [6].
Les critères composites augmentent souvent le nombre d'événements mais peuvent masquer le fait que l'effet est principalement porté par une composante moins importante et fréquente. Il faut donc évaluer :
- si les composantes ont une importance clinique comparable
- si leurs fréquences attendues sont comparables
- si l'effet thérapeutique est raisonnablement similaire
- si chaque composante est rapportée séparément
Plusieurs critères de jugement principaux, temps de mesure et méthodes d'analyse créent une multiplicité. Si chaque test est réalisé au seuil de 5 %, le risque d'au moins un résultat faussement positif augmente. La stratégie de contrôle du risque d'erreur de type 1 doit être prédéfinie, par exemple par des tests hiérarchiques ou un seuil de significativité ajusté.
Taille de l'échantillon et différence cible
Le calcul de la taille de l'échantillon doit reposer sur le critère de jugement principal et sur une différence cible cliniquement pertinente, et non sur l'effet le plus important qui rend l'étude économiquement réalisable. Il requiert généralement des hypothèses concernant :
- le seuil de significativité, souvent 5 % en bilatéral
- la puissance statistique, souvent 80 ou 90 %
- la différence cible cliniquement pertinente
- le risque d'événement dans le groupe contrôle ou l'écart-type des critères de jugement
- les perdus de vue
- le ratio d'allocation
- la corrélation en cas de mesures répétées ou de schéma en grappes
Si la différence cible à détecter est divisée par deux, un essai à deux bras avec un critère continu de distribution normale nécessite environ quatre fois plus de participants, toutes autres hypothèses égales par ailleurs. Le choix de la différence cible a donc des conséquences à la fois scientifiques et éthiques [7].
Une petite étude peut donner un résultat exact mais très imprécis. Un résultat non statistiquement significatif ne signifie pas que les traitements sont équivalents. L'intervalle de confiance indique quels effets cliniquement importants restent compatibles avec les données.
Randomisation, allocation et aveugle
Génération de la séquence de randomisation
Une séquence correcte peut être produite à l'aide de nombres aléatoires générés par ordinateur. L'alternance systématique, la date de naissance, le numéro de dossier ou le jour de la semaine ne constituent pas une randomisation, car l'allocation suivante peut être prévue.
Les méthodes courantes sont :
- la randomisation simple
- la randomisation par blocs pour obtenir des groupes de taille à peu près égale
- la randomisation stratifiée pour équilibrer quelques facteurs pronostiques importants
- la minimisation, généralement avec une composante aléatoire, en présence de plusieurs facteurs d'équilibrage
Des blocs petits et de taille fixe peuvent rendre l'allocation à venir prévisible. La taille des blocs doit donc souvent être variable et cachée au personnel chargé du recrutement.
Assignation secrète
L'assignation secrète (allocation concealment) signifie que le traitement suivant ne peut pas être prévu avant l'inclusion définitive du participant. Elle se distingue de l'aveugle, qui concerne la connaissance du traitement après l'allocation.
Les méthodes robustes sont par exemple :
- la randomisation centralisée par internet
- la randomisation centralisée par téléphone
- l'allocation gérée par la pharmacie
- des enveloppes scellées, opaques, numérotées séquentiellement et inviolables, à condition que la procédure soit appliquée de manière stricte
Des formulations telles que « les participants ont été randomisés » ou « des enveloppes scellées ont été utilisées » sont insuffisantes. Le rapport doit décrire la génération de la séquence, qui a créé la séquence, qui a inclus les participants et comment l'allocation a été tenue secrète. Des défaillances à cette étape peuvent permettre d'influencer quels patients reçoivent chacun des traitements et ainsi annuler le bénéfice de la randomisation [4].
Aveugle
L'aveugle réduit le risque que la connaissance du traitement influence le comportement, les traitements concomitants, la déclaration, la mesure ou l'analyse. Le rapport doit préciser qui était en aveugle :
- les participants
- le personnel soignant administrant le traitement
- les autres personnels soignants
- les évaluateurs des critères de jugement
- les personnes chargées de la revue des données et le comité d'adjudication
- les statisticiens
Les termes simple aveugle et double aveugle sont ambigus et doivent être évités.
L'aveugle est particulièrement important pour les critères subjectifs tels que la douleur, la fonction et les évaluations cliniques. Pour des critères objectifs comme la mortalité toutes causes, le risque de biais de mesure est moindre, mais la connaissance du traitement peut néanmoins influencer les traitements additionnels et le suivi.
Si les participants ou les soignants ne peuvent pas être mis en aveugle, l'étude doit envisager :
- une évaluation en aveugle des critères de jugement
- des traitements concomitants standardisés
- des critères de jugement objectifs ou évalués de manière centralisée
- des critères prédéfinis de changement de traitement
- une analyse statistique en aveugle lorsque cela est possible
Schémas d'étude courants
| Schéma | Point fort | Risque particulier ou question d'analyse |
|---|---|---|
| Groupes parallèles, randomisation individuelle | Interprétation simple, généralement robuste | Contamination entre participants, perdus de vue |
| Randomisé en grappes | Adapté aux interventions organisationnelles et de groupe | Corrélation intra-grappe, recrutement après l'allocation |
| Essai croisé | Chaque participant est son propre témoin | Effet rémanent du traitement et effet période |
| Factoriel | Permet de tester efficacement plusieurs interventions | Interaction entre les interventions |
| Pragmatique | Grande pertinence pour la pratique courante | Variabilité de l'observance, des traitements concomitants et de la mise en œuvre |
| Non-infériorité | Compare un nouveau traitement à un standard efficace | Choix de la marge, population d'analyse et assay sensitivity |
| Essai adaptatif ou plateforme | Peut modifier l'étude selon des règles prédéfinies | Multiplicité, groupes contrôles contemporains et évolutions temporelles |
| Étude pilote et de faisabilité | Teste si un ECR définitif peut être mené | Ne doit normalement pas servir à conclure sur l'effet thérapeutique |
Randomisation en grappes
Dans la randomisation en grappes, ce sont par exemple des centres de soins primaires, des hôpitaux ou des communes qui sont alloués, plutôt que des individus. Ce schéma est utilisé lorsque l'intervention cible une organisation ou lorsqu'une randomisation individuelle entraînerait une contamination importante.
Les participants d'une même grappe sont corrélés. Le contenu effectif en information est donc inférieur à celui d'un nombre égal d'individus indépendants. Le calcul de la taille de l'échantillon et l'analyse doivent tenir compte de la corrélation intra-grappe. Dans une revue de 300 essais en grappes, seuls 55 % rapportaient un calcul de la taille de l'échantillon et 35 % indiquaient une mesure de la corrélation intra-grappe [8].
Un biais de sélection particulier peut survenir si les individus sont identifiés après que l'allocation de la grappe est connue. Dans une revue systématique d'essais en grappes, environ un quart étaient potentiellement affectés par la procédure de recrutement [9]. Les critères d'éligibilité et le recrutement doivent donc, si possible, être établis avant la randomisation ou réalisés par des personnes ignorant l'allocation. CONSORT dispose d'une extension spécifique aux essais randomisés en grappes [10].
Essais croisés
Dans un essai croisé, chaque participant reçoit plusieurs interventions dans un ordre randomisé. Ce schéma peut être efficace dans les affections chroniques stables, lorsque l'effet du traitement est rapidement réversible et que le critère de jugement peut être mesuré de façon répétée.
Il est inadapté aux traitements curatifs, aux critères irréversibles, aux maladies d'évolution rapide ou aux effets thérapeutiques prolongés. Les effets période et séquence doivent être pris en compte. Une période de washout peut réduire l'effet rémanent (carryover) mais ne garantit pas son élimination.
Des grappes peuvent également être randomisées vers différentes séquences de traitement au cours du temps. Cela peut accroître l'efficacité statistique mais nécessite d'analyser la corrélation intra-grappe, les effets période et l'effet rémanent au niveau individuel comme au niveau de la grappe [11].
Orientation pragmatique ou explicative
Pragmatique et explicatif sont les extrémités d'un continuum. Une étude explicative cherche avant tout à savoir si l'intervention fonctionne dans des conditions contrôlées. Une étude pragmatique cherche à savoir si elle fonctionne lorsqu'elle est introduite dans les soins courants.
L'orientation pragmatique comporte souvent des critères d'inclusion plus larges, les soins usuels comme contrôle, un traitement flexible, des traitements concomitants habituels et des critères importants pour le patient. Le qualificatif pragmatique n'implique toutefois pas des exigences méthodologiques moindres. La randomisation, l'allocation, la mesure des critères de jugement et l'analyse doivent rester robustes.
Une revue systématique de 57 essais pragmatiques sur la douleur a montré que la flexibilité des interventions et la pertinence clinique des critères de jugement étaient souvent bonnes, alors que le recrutement et le suivi supplémentaire exigé par l'étude étaient moins représentatifs des soins courants [12].
Essais adaptatifs et essais plateformes
Un essai adaptatif peut, selon des règles prédéfinies, modifier par exemple la taille de l'échantillon, le ratio de randomisation ou les bras de traitement poursuivis. Un essai plateforme peut ajouter et arrêter des traitements au sein d'un protocole continu.
Ces schémas peuvent utiliser les ressources de manière efficace mais imposent des exigences particulières en matière de :
- planification fondée sur des simulations
- contrôle du risque d'erreur de type 1
- surveillance indépendante des données
- règles d'arrêt claires
- comparabilité entre groupes contemporains
- prise en compte des évolutions temporelles de la population et des soins
- transparence sur toutes les adaptations
Un groupe contrôle non contemporain peut être trompeur si le pronostic, le diagnostic ou le traitement standard évoluent au cours du temps. L'analyse doit donc distinguer la comparaison randomisée contemporaine de la comparaison avec des témoins historiques ou non contemporains.
Études pilotes et de faisabilité
La question principale d'une étude pilote est de savoir si une future étude définitive peut et doit être menée et, le cas échéant, comment. Les critères pertinents sont le recrutement, la rétention, l'acceptabilité, l'observance, le recueil des données et des critères prédéfinis de poursuite du développement.
Les études pilotes sont normalement trop petites pour tester de manière fiable une hypothèse d'effet clinique. L'absence de significativité statistique ne démontre pas l'absence d'effet, et un résultat nominalement significatif a souvent une faible reproductibilité. L'extension CONSORT pour les études pilotes déconseille donc les tests d'hypothèse formels sur l'effet lorsque l'étude n'a pas été dimensionnée à cette fin [13].
Analyse des essais randomisés
Intention de traiter et analyse selon le groupe de randomisation
Le principe fondamental d'un essai de supériorité est que les participants sont analysés dans le groupe auquel ils ont été randomisés, indépendamment de l'observance, d'un changement de traitement ou d'un traitement administré par erreur. Cela préserve l'équilibre pronostique de la randomisation et estime souvent l'effet de l'attribution d'une stratégie thérapeutique.
Le terme intention de traiter est utilisé de manière incohérente. Le rapport doit donc préciser exactement :
- quels participants randomisés ont été inclus
- dans quel groupe ils ont été analysés
- comment les données manquantes sur le critère de jugement ont été traitées
- si des participants ont été exclus et pourquoi
Une analyse per protocole n'inclut que les participants ayant satisfait à certaines exigences du protocole. Elle peut être cliniquement pertinente mais n'est plus protégée par la randomisation. L'observance peut dépendre du pronostic, des effets indésirables et de la réponse précoce au traitement. L'analyse per protocole devient donc une comparaison non randomisée, sauf si des méthodes causales avancées sont utilisées.
Données manquantes sur le critère de jugement
Les perdus de vue posent principalement problème lorsque la probabilité qu'un critère de jugement soit manquant est liée à la valeur réelle de ce critère, au traitement ou aux deux. La proportion de perdus de vue ne suffit donc pas à elle seule pour évaluer le biais.
Les hypothèses habituelles sont :
- MCAR, les données manquantes sont totalement indépendantes des données observées et non observées
- MAR, les données manquantes peuvent être expliquées par les données observées
- MNAR, les données manquantes dépendent aussi des valeurs non observées
L'analyse des cas complets requiert souvent l'hypothèse MCAR ou d'autres conditions fortes. L'imputation multiple peut être raisonnable sous l'hypothèse MAR si le modèle d'imputation inclut le groupe de traitement, les variables pronostiques et les facteurs prédictifs des données manquantes et du critère de jugement. Aucune méthode statistique ne peut, sans hypothèses, restituer une information qui n'a jamais été observée.
Une revue méthodologique a identifié 101 travaux sur les données manquantes. La plupart portaient sur des méthodes sous les hypothèses MAR ou MNAR, alors que de nombreux ECR publiés utilisent encore des méthodes qui, en pratique, requièrent l'hypothèse plus forte MCAR [14]. L'analyse principale doit donc être complétée par des analyses de sensibilité selon des scénarios MNAR cliniquement plausibles.
Analyses ajustées
L'ajustement sur des variables pronostiques fortes mesurées à l'inclusion peut améliorer la précision. Les variables et les modèles doivent être prédéfinis. L'ajustement sur des variables apparues après la randomisation, par exemple l'observance ou la réponse au traitement, peut introduire un biais et modifier la question à laquelle l'analyse répond.
Pour les critères continus, l'ajustement sur la valeur initiale est souvent plus efficace que l'analyse de la variation par rapport à l'inclusion. En cas de randomisation stratifiée, les facteurs de stratification doivent généralement être pris en compte dans l'analyse.
Analyses en sous-groupes
Un effet de sous-groupe signifie que l'effet du traitement diffère entre les groupes, et non que l'effet est significatif dans un groupe mais non significatif dans un autre. L'analyse pertinente est un test d'interaction.
La crédibilité augmente si :
- l'hypothèse et le sens de l'effet ont été spécifiés à l'avance
- seul un petit nombre de sous-groupes a été testé
- le découpage repose sur des variables mesurées à l'inclusion
- l'interaction est statistiquement convaincante
- le même profil est observé pour des critères voisins et dans d'autres études
- il existe une explication biologique ou clinique solide
Les analyses en sous-groupes ont souvent une faible puissance statistique, alors que la multiplication des analyses entraîne un risque élevé de résultats faussement positifs. Dans une revue d'ECR dans l'hypertension pulmonaire, seuls 37 % utilisaient un test d'interaction. La plupart des allégations d'effet de sous-groupe satisfaisaient au plus quatre des dix critères de crédibilité [15].
Supériorité, non-infériorité et équivalence
Supériorité
Un essai de supériorité teste si une intervention est meilleure que le contrôle. Si l'intervalle de confiance inclut l'absence d'effet, on ne peut pas conclure que les traitements sont équivalents. Un résultat non significatif peut refléter une similitude réelle, une précision insuffisante, une mauvaise observance ou un nombre important de perdus de vue.
Non-infériorité
Un essai de non-infériorité teste si le nouveau traitement n'est pas inacceptablement moins bon qu'un traitement établi. La marge doit être fixée avant l'étude et correspondre à la plus grande perte d'effet acceptable. Elle doit être justifiée à la fois cliniquement et au regard des données antérieures sur l'effet du traitement contrôle [16].
Le nouveau traitement doit offrir un autre avantage, par exemple :
- moins d'effets indésirables graves
- une administration plus simple
- un coût moindre
- une meilleure disponibilité
- un traitement moins invasif
Une mauvaise observance, des changements de traitement et une mesure peu spécifique du critère de jugement peuvent rendre les groupes plus semblables et ainsi favoriser artificiellement une conclusion de non-infériorité. L'analyse selon le groupe de randomisation et l'analyse per protocole doivent normalement être rapportées toutes deux, avec des conclusions concordantes.
Une revue systématique de 823 essais de non-infériorité a montré que la marge était indiquée dans environ 95 % des cas mais justifiée dans seulement 57 % des études de 2019. Moins de la moitié utilisaient à la fois une analyse de type intention de traiter et une analyse per protocole, et plus de la moitié étaient des essais ouverts [17].
Équivalence
Un essai d'équivalence teste si l'effet du traitement se situe dans un intervalle prédéfini de part et d'autre de l'absence d'effet. L'équivalence ne peut donc pas être démontrée par un test de supériorité non significatif. L'intervalle de confiance doit se situer entièrement entre les deux bornes d'équivalence.
Interprétation des résultats
Mesures d'effet
Pour un critère binaire, on peut calculer :
- le risque dans le groupe intervention, EER
- le risque dans le groupe contrôle, CER
- le risque relatif, RR = EER / CER
- la différence de risque absolue, RD = EER moins CER
- la réduction relative du risque = 1 moins RR, lorsque le risque diminue
- le nombre de sujets à traiter, NNT = 1 / réduction absolue du risque
Le NNT doit être arrondi à l'entier supérieur et doit être accompagné du critère de jugement, de la période considérée, du risque dans le groupe contrôle et de l'intervalle de confiance. Le NNT n'est pas une propriété constante d'un médicament. Un même effet relatif procure un bénéfice absolu plus grand et un NNT plus faible lorsque le risque de base est plus élevé.
L'odds ratio peut donner une impression exagérée du risque relatif lorsque l'événement est fréquent. Le hazard ratio décrit un rapport d'intensités instantanées de survenue des événements et n'équivaut pas directement à un risque relatif ni à une différence de survie médiane. L'hypothèse de proportionnalité doit être plausible.
Pour les critères continus, la différence de moyennes doit être interprétée au regard de la différence cliniquement importante propre à l'échelle. La différence de moyennes standardisée facilite la comparaison entre échelles différentes mais s'exprime en écarts-types et est moins intuitive.
Valeur de P et intervalle de confiance
La valeur de P est la probabilité, sous le modèle statistique et l'hypothèse nulle, d'obtenir un résultat au moins aussi extrême que celui observé. Ce n'est pas la probabilité que l'hypothèse nulle soit vraie, et elle n'indique ni la taille de l'effet ni sa pertinence clinique.
Un intervalle de confiance à 95 % indique à la fois le sens et la précision de l'effet. Lors de la lecture critique, il convient de se demander :
- L'intervalle inclut-il l'absence d'effet ?
- Inclut-il un bénéfice cliniquement important ?
- Inclut-il un préjudice cliniquement important ?
- L'intervalle est-il suffisamment étroit pour prendre une décision ?
La dichotomisation au seuil P = 0,05 est souvent trompeuse. Des résultats avec P = 0,049 et P = 0,051 ne sont pas fondamentalement différents. L'accent doit porter sur l'estimation, la précision, la qualité de l'étude et la cohérence avec les autres données probantes.
La présentation des résultats est souvent moins bonne que recommandé. Dans une revue de 88 ECR chirurgicaux, 68 % ne rapportaient que la valeur de P, sans intervalle de confiance à 95 %, pour le bénéfice. Seuls 6 % indiquaient le NNT, et aucun ne rapportait le nombre de sujets à traiter pour nuire (number needed to harm) [18].
Bénéfices et effets indésirables
Tous les critères de jugement pertinents doivent être mis en balance. Une réduction modérée d'un événement fréquent et bénin peut avoir moins d'importance qu'une légère augmentation d'un effet indésirable rare et grave.
Évaluer :
- comment les effets indésirables ont été définis et recherchés
- si le recueil était actif ou passif
- la durée de suivi
- le nombre de participants exposés
- les arrêts de traitement pour effets indésirables
- les événements graves et la mortalité
- les risques absolus et les intervalles de confiance
CONSORT Harms recommande une présentation transparente de la manière dont les effets indésirables ont été définis, recueillis, codés et analysés [19]. Un ECR est souvent dimensionné pour l'efficacité, et non pour des effets indésirables rares, ce qui rend l'incertitude sur les critères de sécurité importante.
Lecture critique en pratique clinique
flowchart TD
A["Définir la question clinique<br>et l'estimand pertinent"] --> B["Comparer protocole, registre<br>et publication"]
B --> C["Examiner la randomisation<br>et l'assignation secrète"]
C --> D["Examiner les écarts,<br>l'aveugle et les traitements concomitants"]
D --> E["Examiner les perdus de vue<br>et la mesure des critères"]
E --> F["Vérifier le groupe d'analyse,<br>la multiplicité et la sélection"]
F --> G["Interpréter la taille d'effet<br>et l'IC à 95 %"]
G --> H["Mettre en balance bénéfice absolu<br>et effets indésirables"]
H --> I["Évaluer la transposabilité<br>au patient et au contexte de soins"]Étape 1 : la question est-elle pertinente ?
Identifier la population, l'intervention, le comparateur, le critère de jugement et le temps de mesure. Vérifier si la question principale de l'étude correspond à votre décision clinique. Une étude bien conduite peut être sans pertinence si le traitement contrôle, la dose ou le contexte de soins ne correspondent pas à la pratique suédoise.
Étape 2 : les méthodes étaient-elles prédéfinies ?
Rechercher le numéro d'enregistrement, le protocole et le plan d'analyse statistique. Comparer :
- le critère de jugement principal
- le temps de mesure
- la taille de l'échantillon
- les sous-groupes
- la population d'analyse
- les règles d'arrêt
- la marge de non-infériorité
Des modifications peuvent être justifiées, mais leur moment et leurs motifs doivent être indiqués. Les modifications apportées après accès aux données sur les critères de jugement comportent un risque plus élevé d'être guidées par les résultats.
Étape 3 : existe-t-il un risque de biais ?
RoB 2 évalue cinq domaines principaux :
- le processus de randomisation
- les écarts par rapport aux interventions prévues
- les données manquantes sur le critère de jugement
- la mesure du critère de jugement
- la sélection du résultat rapporté
L'évaluation doit porter sur un résultat spécifique, car le risque peut différer, par exemple, entre la mortalité et une douleur autodéclarée. RoB 2 aboutit aux catégories risque faible, quelques préoccupations et risque élevé, et non à un score numérique de qualité [3].
Étape 4 : le résultat est-il cliniquement important ?
Partir de l'analyse principale prédéfinie. Rechercher les nombres absolus d'événements, la différence de risque et l'intervalle de confiance. Évaluer si la taille de l'effet atteint un seuil cliniquement important et si elle justifie les coûts, la charge thérapeutique et les effets indésirables.
Se méfier du spin. Dans une revue de 93 ECR cardiovasculaires dont le critère de jugement principal était non significatif, une présentation orientée favorablement était présente dans 57 % des résumés et 67 % des textes principaux [20]. Les stratégies fréquentes consistaient à mettre l'accent sur des critères secondaires significatifs, des sous-groupes ou des variations au sein du groupe traité.
Étape 5 : le résultat est-il transposable ?
La validité interne détermine si le résultat est crédible dans la population étudiée. La validité externe concerne la possibilité d'appliquer le résultat à d'autres patients et d'autres contextes de soins.
Examiner en particulier :
- l'âge et la fragilité
- le sexe et l'origine ethnique
- les comorbidités et la polymédication
- la sévérité de la maladie et le risque de base
- les traitements antérieurs
- le niveau de soins et la compétence des soignants
- l'observance et l'accès à la surveillance
- la dose et l'intensité réellement délivrées de l'intervention
Une revue systématique de 305 ECR a montré une proportion médiane d'exclusion de 77,1 % lorsque les critères des études étaient appliqués à des populations cliniques. Les motifs fréquents étaient l'âge, les comorbidités et les traitements concomitants [21]. Les effets relatifs peuvent parfois être transposés d'un niveau de risque à l'autre, mais les effets absolus et les effets indésirables changent lorsque le risque de base diffère.
Étape 6 : le résultat concorde-t-il avec les autres données probantes ?
Un ECR isolé est rarement décisif à lui seul. Il faut évaluer l'étude conjointement avec :
- les autres ECR
- les revues systématiques et méta-analyses
- la plausibilité biologique
- les données de sécurité
- les préférences des patients
- les ressources nécessaires et la faisabilité
Des effets importants dans une étude petite, arrêtée précocement ou méthodologiquement faible appellent une prudence particulière. La réplication dans des études indépendantes et des effets absolus cohérents renforcent la fiabilité.
Publication et intégrité de la recherche
CONSORT 2025 comprend une liste de contrôle de 30 items et un diagramme de flux des participants. Les nouveaux éléments portent notamment sur le partage des données, les conflits d'intérêts, la participation des patients, les effets indésirables, les groupes d'analyse, les données manquantes et la manière dont l'intervention a réellement été mise en œuvre [1]. CONSORT doit être utilisé avec les extensions pertinentes, par exemple pour les essais en grappes, la non-infériorité, les schémas adaptatifs et les études pilotes.
Un rapport CONSORT complet ne correspond pas nécessairement à une étude bien conduite. La liste de contrôle indique ce qui doit être rapporté, et non quels choix méthodologiques sont toujours corrects. À l'inverse, une étude méthodologiquement robuste peut être impossible à évaluer si sa présentation est incomplète.
Une publication fiable exige :
- un enregistrement prospectif avant la première randomisation
- un protocole et un plan d'analyse publics
- la présentation de toutes les modifications importantes du protocole
- un diagramme de flux CONSORT
- les résultats pour tous les critères de jugement principaux et secondaires prédéfinis
- les effets absolus et relatifs avec intervalles de confiance
- une présentation transparente des effets indésirables
- le financement et les conflits d'intérêts
- des informations sur l'accès aux données anonymisées et au code d'analyse
CONSORT 2025 remplace CONSORT 2010. Les publications plus anciennes doivent naturellement être évaluées à partir des informations disponibles, mais la version 2025 doit être utilisée pour la planification, la publication et la lecture critique des nouveaux ECR [1,2].
Sources
- Hopewell S et al. CONSORT 2025 statement: updated guideline for reporting randomised trials. BMJ 2025. PMID: 40228833
- Hopewell S et al. CONSORT 2025 explanation and elaboration: updated guideline for reporting randomised trials. BMJ 2025. PMID: 40228832
- Sterne JAC et al. RoB 2: a revised tool for assessing risk of bias in randomised trials. BMJ 2019. PMID: 31462531
- Wang H et al. Trial-level characteristics associate with treatment effect estimates: a systematic review of meta-epidemiological studies. BMC Medical Research Methodology 2022. PMID: 35705904
- Chan AW et al. SPIRIT 2025 statement: updated guideline for protocols of randomised trials. BMJ 2025. PMID: 40294953
- Manyara AM et al. Reporting of surrogate endpoints in randomised controlled trial reports (CONSORT-Surrogate): extension checklist with explanation and elaboration. BMJ 2024. PMID: 38981645
- Cook JA et al. Choosing the target difference ('effect size') for a randomised controlled trial: DELTA2 guidance protocol. Trials 2017. PMID: 28606102
- Rutterford C et al. Reporting and methodological quality of sample size calculations in cluster randomized trials could be improved: a review. Journal of Clinical Epidemiology 2015. PMID: 25523375
- Eldridge S et al. Internal and external validity of cluster randomised trials: systematic review of recent trials. BMJ 2008. PMID: 18364360
- Campbell MK et al. Consort 2010 statement: extension to cluster randomised trials. BMJ 2012. PMID: 22951546
- McKenzie JE et al. Reporting of cluster randomised crossover trials: extension of the CONSORT 2010 statement with explanation and elaboration. BMJ 2025. PMID: 39761979
- Hohenschurz-Schmidt D et al. Pragmatic trials of pain therapies: a systematic review of methods. Pain 2022. PMID: 34490854
- Eldridge SM et al. CONSORT 2010 statement: extension to randomised pilot and feasibility trials. BMJ 2016. PMID: 27777223
- Medcalf E et al. Addressing missing outcome data in randomised controlled trials: A methodological scoping review. Contemporary Clinical Trials 2024. PMID: 38857674
- Rodríguez-Ramallo H et al. Subgroup Analysis in Pulmonary Hypertension-Specific Therapy Clinical Trials: A Systematic Review. Journal of Personalized Medicine 2022. PMID: 35743648
- Piaggio G et al. Reporting of noninferiority and equivalence randomized trials: extension of the CONSORT 2010 statement. JAMA 2012. PMID: 23268518
- Sengul A et al. Non-Inferiority Trials: A Systematic Review on Methodological Quality and Reporting Standards. Journal of General Internal Medicine 2024. PMID: 38954320
- Stubenrouch FE et al. Systematic review of reporting benefits and harms of surgical interventions in randomized clinical trials. BJS Open 2020. PMID: 32207574
- Junqueira DR et al. CONSORT Harms 2022 statement, explanation, and elaboration: updated guideline for the reporting of harms in randomised trials. BMJ 2023. PMID: 37094878
- Khan MS et al. Level and Prevalence of Spin in Published Cardiovascular Randomized Clinical Trial Reports With Statistically Nonsignificant Primary Outcomes: A Systematic Review. JAMA Network Open 2019. PMID: 31050775
- He J et al. Exclusion rates in randomized controlled trials of treatments for physical conditions: a systematic review. Trials 2020. PMID: 32102686