Tests diagnostiques : sensibilité, spécificité et valeurs prédictives

Résumé

La sensibilité est la probabilité d'un test positif chez les personnes atteintes de la condition cible, tandis que la spécificité est la probabilité d'un test négatif chez les personnes qui en sont indemnes. Les valeurs prédictives positive et négative répondent à la question clinique : quelle est la probabilité que le patient soit atteint, ou non atteint, de la condition après un test positif ou négatif ? Les valeurs prédictives dépendent fortement de la probabilité pré-test. Un test positif peut donc avoir une faible valeur prédictive lorsqu'il est réalisé dans une population à faible risque, même si la sensibilité et la spécificité sont élevées [1,2].

Les rapports de vraisemblance sont souvent les plus utiles pour transposer un résultat de test à un patient donné. La cote pré-test est multipliée par le rapport de vraisemblance du résultat obtenu pour donner la cote post-test. Le résultat est ensuite converti en probabilité post-test selon le théorème de Bayes [3,4]. Un test ne devrait être prescrit que si son résultat peut faire passer la probabilité au-dessus d'un seuil de traitement ou d'investigations complémentaires, ou en dessous d'un seuil permettant d'écarter la condition.

La sensibilité et la spécificité ne sont pas des propriétés immuables du laboratoire. Elles varient selon le seuil de décision choisi, la sévérité de la maladie, la sélection des patients, le contexte clinique, la réalisation du test et la référence standard. Les résultats des études diagnostiques doivent donc être évalués à la fois en termes de risque de biais et d'applicabilité à sa propre population. Une utilisation diagnostique sûre impose d'examiner conjointement le couple sensibilité-spécificité, les intervalles de confiance, la population de patients, la référence standard, la gestion des résultats non concluants et le rôle prévu du test.

Notions fondamentales

Condition cible, test index et référence standard

Une étude de performance diagnostique compare un test index, le test évalué, à une référence standard, la méthode utilisée pour déterminer si la condition cible est réellement présente. La condition cible peut être une maladie, un stade, une anomalie anatomique ou un autre état cliniquement pertinent.

La notion de test diagnostique dépasse les seules analyses de laboratoire. Symptômes, signes cliniques, imagerie, histopathologie, microbiologie, explorations fonctionnelles, scores cliniques et algorithmes peuvent tous être évalués en tant que test index.

Le rôle prévu du test doit être défini avant d'en interpréter la performance :

  • Test de dépistage : utilisé chez des personnes sans maladie connue.
  • Test de triage : détermine qui a besoin d'un test plus coûteux en ressources ou invasif.
  • Test additionnel : utilisé après le bilan existant pour améliorer la classification.
  • Test de remplacement : destiné à remplacer un test établi.
  • Test de confirmation : utilisé principalement pour confirmer un diagnostic suspecté.
  • Test d'exclusion : utilisé principalement pour abaisser la probabilité à un niveau acceptable.

Le rôle clinique détermine quelles erreurs sont les plus graves. Un test de triage destiné à exclure une affection dangereuse nécessite généralement une sensibilité très élevée, tandis qu'un test conduisant à un traitement ou à une chirurgie à risque nécessite souvent une spécificité élevée [5].

Le tableau de contingence 2 × 2

Lorsque le test index et la référence standard sont tous deux classés comme positifs ou négatifs, quatre issues sont possibles.

Condition cible présente Condition cible absente
Test positif Vrai positif, VP Faux positif, FP
Test négatif Faux négatif, FN Vrai négatif, VN

La sensibilité et la spécificité se calculent verticalement dans le tableau, au sein des groupes avec et sans condition cible respectivement. Les valeurs prédictives se calculent horizontalement, au sein des groupes avec test positif et test négatif respectivement.

Indicateurs essentiels et formules

Indicateur Formule Interprétation clinique
Sensibilité VP / (VP + FN) Proportion des sujets atteints dont le test est positif
Spécificité VN / (VN + FP) Proportion des sujets indemnes dont le test est négatif
Taux de faux négatifs FN / (VP + FN) 1 moins la sensibilité
Taux de faux positifs FP / (VN + FP) 1 moins la spécificité
Valeur prédictive positive, VPP VP / (VP + FP) Probabilité de la condition après un test positif
Valeur prédictive négative, VPN VN / (VN + FN) Probabilité d'absence de la condition après un test négatif
Rapport de vraisemblance positif, RV+ Sensibilité / (1 moins spécificité) Dans quelle mesure un test positif augmente la cote
Rapport de vraisemblance négatif, RV− (1 moins sensibilité) / spécificité Dans quelle mesure un test négatif diminue la cote
Exactitude globale (VP + VN) / total Proportion de sujets correctement classés dans la population étudiée
Odds ratio diagnostique RV+ / RV− Mesure synthétique de discrimination, mais qui masque l'équilibre entre sensibilité et spécificité

L'exactitude globale peut être trompeuse. Si une affection touche 1 % de la population, la stratégie consistant à déclarer tout le monde indemne atteint 99 % de classification correcte, bien qu'aucun cas ne soit identifié. Cet indicateur ne doit donc pas remplacer la présentation de la sensibilité et de la spécificité.

Sensibilité et spécificité

Sensibilité

La sensibilité est la probabilité d'un test positif sachant que la condition cible est présente :

Sensibilité = P(test positif | condition cible présente)

Un test d'une sensibilité de 95 % donne, dans la population étudiée et au seuil de décision considéré, un résultat négatif chez 5 % des personnes atteintes de la condition cible.

Une sensibilité élevée est particulièrement importante lorsque :

  • une affection méconnue peut entraîner un préjudice grave
  • un traitement précoce efficace existe
  • le test est utilisé comme premier triage avant le diagnostic de certitude
  • un résultat négatif doit permettre de clore ou de simplifier le bilan.

La conséquence clinique d'un test négatif ne dépend toutefois pas uniquement de la sensibilité. La spécificité et la probabilité pré-test influencent le RV− et donc la probabilité post-test résiduelle. La règle mnémotechnique selon laquelle un test très sensible négatif exclut la maladie ne s'applique que lorsque la sensibilité est suffisamment élevée dans la population concernée et lorsque la probabilité post-test se situe réellement sous le seuil clinique d'exclusion [1,4].

Spécificité

La spécificité est la probabilité d'un test négatif sachant que la condition cible est absente :

Spécificité = P(test négatif | condition cible absente)

Un test d'une spécificité de 90 % donne un résultat positif chez 10 % des personnes indemnes de la condition cible.

Une spécificité élevée est particulièrement importante lorsque :

  • un résultat positif conduit à un traitement à risque ou coûteux
  • le diagnostic a des conséquences psychologiques, sociales ou assurantielles importantes
  • le test est utilisé pour confirmer un diagnostic après un test de triage sensible
  • les résultats faussement positifs entraînent des investigations invasives.

Un test très spécifique positif peut apporter un fort argument en faveur du diagnostic, mais seulement si le rapport de vraisemblance positif est suffisamment élevé et si le test est utilisé dans le bon contexte clinique.

Sensibilité et spécificité doivent être rapportées ensemble

La sensibilité et la spécificité forment un couple. Un test ne peut être évalué en ne mentionnant que l'un de ces deux indicateurs. Une analyse biologique avec un seuil de décision bas peut, par exemple, avoir une sensibilité élevée mais une faible spécificité. Si le seuil est relevé, la sensibilité diminue généralement tandis que la spécificité augmente.

Il est donc insuffisant de décrire un test comme, par exemple, exact à 95 % sans préciser :

  • le seuil de décision choisi
  • la sensibilité
  • la spécificité
  • les intervalles de confiance
  • la population de patients
  • la référence standard
  • la proportion de résultats non concluants ou manquants.

Les indicateurs diagnostiques sont en outre sensibles au plan d'étude. Les études comparant des patients manifestement malades à des témoins sains donnent souvent une performance plus élevée que les études portant sur des patients consécutifs présentant une incertitude diagnostique réaliste [2,6].

Valeurs prédictives et probabilité pré-test

Valeur prédictive positive

La VPP est la probabilité que la condition cible soit présente après un test positif :

VPP = P(condition cible présente | test positif)

Elle ne doit pas être confondue avec la sensibilité. La sensibilité part des personnes déjà classées comme malades. La VPP part des personnes ayant un test positif et demande combien d'entre elles sont réellement atteintes.

Valeur prédictive négative

La VPN est la probabilité que la condition cible soit absente après un test négatif :

VPN = P(condition cible absente | test négatif)

Il s'agit là aussi d'une probabilité conditionnelle inverse par rapport à la spécificité. Une spécificité élevée n'implique pas automatiquement une VPN élevée.

Prévalence et probabilité clinique

Les valeurs prédictives dépendent de la proportion de personnes atteintes de la condition cible dans la population testée. Lorsque la probabilité pré-test augmente :

  • la VPP augmente
  • la VPN diminue.

Lorsque la probabilité pré-test diminue :

  • la VPP diminue
  • la VPN augmente.

La prévalence observée dans une étude diagnostique ne peut servir de probabilité pré-test que si la population de l'étude correspond à celle dans laquelle le test sera utilisé. Pour un patient donné, la probabilité pré-test doit reposer sur les informations cliniques pertinentes, telles que les symptômes, les signes cliniques, les facteurs de risque, les résultats de tests antérieurs et le niveau de soins [3].

Exemple chiffré

Soit un test avec :

  • une sensibilité de 90 %
  • une spécificité de 90 %
  • une probabilité pré-test de 10 %
  • 1 000 personnes testées.
Issue Nombre
Vrais positifs 90
Faux négatifs 10
Vrais négatifs 810
Faux positifs 90

La VPP est :

90 / (90 + 90) = 50 %

La VPN est :

810 / (810 + 10) = 98,8 %

Malgré une sensibilité de 90 % et une spécificité de 90 %, seule la moitié des personnes ayant un test positif sont atteintes de la condition cible.

Si le même test est utilisé dans une population dont la probabilité pré-test est de 1 %, on obtient parmi 10 000 personnes :

  • 90 vrais positifs
  • 10 faux négatifs
  • 990 faux positifs
  • 8 910 vrais négatifs.

La VPP devient alors :

90 / (90 + 990) = 8,3 %

Le résultat positif est donc plus souvent faux que vrai. Cet exemple montre pourquoi le dépistage large de personnes à faible risque peut générer de nombreux résultats faussement positifs, même lorsque la spécificité du test paraît élevée.

Rapports de vraisemblance et théorème de Bayes

Rapports de vraisemblance

Le rapport de vraisemblance indique dans quelle mesure un résultat de test donné est plus probable chez une personne atteinte de la condition cible que chez une personne qui en est indemne.

Pour un test binaire :

RV+ = sensibilité / (1 moins spécificité)

RV− = (1 moins sensibilité) / spécificité

Le RV+ doit être aussi élevé que possible. Le RV− doit être aussi proche de zéro que possible.

Rapport de vraisemblance Effet habituel sur la probabilité
RV+ supérieur à 10 Forte augmentation
RV+ de 5 à 10 Augmentation modérée
RV+ de 2 à 5 Faible augmentation
RV+ proche de 1 Information diagnostique minimale
RV− de 0,5 à 1 Diminution minimale ou faible
RV− de 0,2 à 0,5 Faible diminution
RV− de 0,1 à 0,2 Diminution modérée
RV− inférieur à 0,1 Forte diminution

Ces bornes sont des repères pédagogiques et non des critères cliniques universels. L'ampleur de la modification nécessaire dépend de la probabilité initiale et des décisions que le test doit orienter.

Du pré-test au post-test

Le théorème de Bayes peut être appliqué en trois étapes :

  1. Convertir la probabilité pré-test en cote pré-test.
  2. Multiplier la cote pré-test par le rapport de vraisemblance pertinent.
  3. Convertir la cote post-test en probabilité post-test.

Formules :

Cote pré-test = probabilité pré-test / (1 moins probabilité pré-test)

Cote post-test = cote pré-test × rapport de vraisemblance

Probabilité post-test = cote post-test / (1 + cote post-test)

Pour le test de l'exemple précédent :

  • sensibilité 0,90
  • spécificité 0,90
  • RV+ = 0,90 / 0,10 = 9
  • RV− = 0,10 / 0,90 = 0,11.

Avec une probabilité pré-test de 10 %, la cote pré-test est de 0,10 / 0,90 = 0,111.

Après un test positif :

  • cote post-test = 0,111 × 9 = 1
  • probabilité post-test = 1 / 2 = 50 %.

Après un test négatif :

  • cote post-test = 0,111 × 0,11 = 0,0123
  • la probabilité post-test est d'environ 1,2 %.

Ces résultats correspondent à la VPP et au complément de la VPN du tableau 2 × 2. Les rapports de vraisemblance sont particulièrement pratiques, car les mêmes caractéristiques du test peuvent être combinées à différentes probabilités pré-test [3,4].

Tests à plusieurs niveaux et rapports de vraisemblance par intervalle

Dichotomiser des résultats continus en positif ou négatif entraîne une perte d'information. Une valeur très au-dessus du seuil de décision augmente souvent davantage la probabilité qu'une valeur proche du seuil. De la même manière, une valeur très basse peut diminuer la probabilité davantage qu'un résultat tout juste négatif.

Lorsque les données le permettent, les tests continus ou ordinaux doivent être découpés en intervalles cliniquement pertinents, avec un rapport de vraisemblance pour chaque intervalle. Cette approche est souvent plus informative qu'un seuil unique et est recommandée pour la présentation critique des tests diagnostiques [4].

Plusieurs tests successifs

En cas de tests séquentiels, la probabilité post-test après le premier test devient la probabilité pré-test du suivant. Les rapports de vraisemblance ne peuvent être multipliés que si les résultats des tests sont suffisamment indépendants conditionnellement au statut pathologique. Si deux tests mesurent le même phénomène biologique, leurs erreurs peuvent être corrélées. Une simple multiplication risque alors de surestimer le niveau de preuve.

En pratique, il convient de :

  • mettre à jour la probabilité après chaque résultat significatif
  • tenir compte du fait que les tests mesurent le même phénomène ou des phénomènes différents
  • éviter de traiter plusieurs constatations étroitement liées comme des preuves indépendantes
  • utiliser des algorithmes diagnostiques validés lorsqu'ils existent.

Seuils de décision et courbes ROC

Choix du seuil de décision

Pour un test continu, il faut choisir un seuil définissant ce qui sera considéré comme positif. Si des valeurs plus élevées orientent vers la condition cible, l'abaissement du seuil conduit généralement à :

  • une sensibilité plus élevée
  • une spécificité plus faible
  • davantage de résultats faussement positifs
  • moins de résultats faussement négatifs.

Le relèvement du seuil produit l'effet inverse.

Le seuil de décision diagnostique n'est pas nécessairement identique à l'intervalle de référence du laboratoire. Un intervalle de référence décrit habituellement la distribution dans une population de référence. Un seuil de décision clinique est choisi pour départager des options de prise en charge et doit être validé à cette fin [1].

La courbe ROC

Une courbe ROC représente la sensibilité sur l'axe vertical en fonction du taux de faux positifs, c'est-à-dire 1 moins la spécificité, sur l'axe horizontal, pour tous les seuils de décision possibles [5].

La courbe peut servir à :

  • décrire le compromis entre sensibilité et spécificité
  • comparer la discrimination du test à différents seuils
  • identifier des seuils de décision possibles
  • comparer des tests, à condition que la comparaison soit correctement conçue.

Aire sous la courbe ROC

L'AUC peut s'interpréter comme la probabilité qu'une personne tirée au hasard et atteinte de la condition cible ait une valeur de test plus anormale qu'une personne tirée au hasard et qui en est indemne. Une AUC de 0,5 correspond à une absence de discrimination, tandis que 1,0 correspond à un classement parfait [5].

L'AUC présente d'importantes limites :

  • Elle n'indique ni la sensibilité ni la spécificité au seuil utilisé en clinique.
  • Elle pondère des portions de la courbe ROC qui peuvent être cliniquement non pertinentes.
  • Deux tests peuvent avoir la même AUC mais des performances totalement différentes dans la zone pertinente.
  • L'AUC ne renseigne pas directement sur la calibration, les valeurs prédictives ou l'utilité clinique.
  • Une AUC élevée ne garantit pas l'existence d'un seuil décisionnel utile.

Les études portant sur les analyses ROC ont mis en évidence des problèmes fréquents : absence d'intervalles de confiance, comparaisons insuffisantes entre tests et analyse erronée de données appariées [6]. Le seuil de décision devrait de préférence être prédéfini en fonction des conséquences cliniques ou de données externes. S'il est choisi sur le même jeu de données pour maximiser, par exemple, la somme de la sensibilité et de la spécificité, le résultat est optimiste et nécessite une validation externe [7].

Des caractéristiques du test à la décision clinique

Seuil de test et seuil de traitement

La prise en charge diagnostique peut être envisagée comme trois zones de probabilité :

  1. Sous le seuil de test, la condition cible est si improbable que des examens supplémentaires ne sont pas justifiés.
  2. Entre le seuil de test et le seuil de traitement, un test peut modifier la prise en charge.
  3. Au-dessus du seuil de traitement, la probabilité est si élevée qu'un traitement ou une autre mesure ciblée peut être justifié sans test supplémentaire, à condition que les risques de cette mesure soient acceptables.

Un test est le plus utile lorsque la probabilité pré-test se situe entre les seuils et qu'un résultat positif ou négatif peut faire franchir au patient l'un d'entre eux.

flowchart TD
A["Évaluer la probabilité<br>pré-test clinique"] --> B["La probabilité se situe-t-elle<br>dans une zone où le test<br>peut modifier la prise en charge ?"]
B -->|"Non, très faible"| C["Renoncer au test<br>et envisager une autre explication"]
B -->|"Non, très élevée"| D["Envisager un traitement ou<br>un diagnostic de certitude"]
B -->|"Oui"| E["Choisir le test selon le rôle clinique,<br>le RV, le risque et la disponibilité"]
E --> F["Interpréter le résultat avec<br>le théorème de Bayes"]
F --> G["Probabilité post-test sous<br>le seuil d'exclusion"]
F --> H["Probabilité post-test entre<br>les seuils"]
F --> I["Probabilité post-test au-dessus<br>du seuil d'action"]
G --> J["Clore ou réorienter<br>le bilan"]
H --> K["Compléter par un test indépendant<br>ou un suivi"]
I --> L["Confirmer si nécessaire et<br>initier une mesure ciblée"]

La performance diagnostique n'est pas synonyme d'utilité clinique

Un test performant n'améliore pas automatiquement le devenir des patients. Son utilité dépend :

  • de la capacité du résultat à modifier les décisions cliniques
  • de l'efficacité du traitement qui en découle
  • du délai d'obtention du résultat
  • des coûts et des ressources nécessaires
  • des complications du prélèvement ou des investigations ultérieures
  • des conséquences des résultats faussement positifs et faussement négatifs
  • des valeurs du patient.

STARD 2015 souligne que les études diagnostiques doivent préciser l'usage prévu du test, son rôle clinique et ses conséquences possibles pour les patients [7,8]. Les tests rapides en cas de mal de gorge en offrent un exemple concret. Des essais randomisés ont montré qu'une prise en charge guidée par le test réduisait la proportion de prescriptions d'antibiotiques d'environ 25 points de pourcentage, mais les données concernant les complications et les autres critères de jugement centrés sur le patient restaient incertaines [20]. Les données de performance doivent donc être complétées par des études évaluant l'effet du test sur le parcours de soins et sur la santé.

L'analyse de courbe de décision permet d'estimer le bénéfice net d'une stratégie de test à différents seuils de probabilité clinique. La méthode met en balance les résultats vrais positifs et faux positifs en fonction des conséquences au seuil choisi. Elle peut montrer qu'un modèle ayant une AUC plus élevée a néanmoins une utilité clinique moindre en raison d'une calibration insuffisante ou de décisions inappropriées [19].

Interprétation selon les situations cliniques

Dépistage et faible probabilité pré-test

Lors d'un dépistage, la plupart des personnes testées sont indemnes. Même un faible taux de faux positifs peut donc produire davantage de faux positifs que de vrais positifs. Les exigences en matière de spécificité, de tests de confirmation et d'algorithmes de suivi clairs sont élevées.

Un programme de dépistage ne doit pas être évalué uniquement sur sa sensibilité. Il faut également prendre en compte :

  • le nombre absolu de faux positifs
  • le surdiagnostic
  • les examens de suivi invasifs
  • l'anxiété et l'étiquetage de maladie
  • la consommation de ressources
  • le fait qu'un diagnostic plus précoce améliore ou non les critères de jugement pertinents pour le patient.

Affection aiguë grave

En cas de suspicion d'affection aiguë grave, le coût d'un résultat faussement négatif est souvent élevé. La stratégie de test doit donc privilégier un RV− faible. Si la probabilité pré-test est élevée, un test négatif avec un RV− modéré peut être insuffisant pour exclure l'affection.

Un test négatif ne doit pas être interprété isolément si :

  • le prélèvement a été réalisé trop tôt ou trop tard dans l'évolution de la maladie
  • la qualité de l'échantillon était insuffisante
  • le traitement a pu influencer le test
  • le patient appartient à un groupe dans lequel la sensibilité est plus faible
  • le test n'a pas été validé pour la présentation clinique concernée.

Diagnostic de confirmation

Lorsqu'un test positif conduit à un traitement important, à une chirurgie ou à un diagnostic au long cours, un RV+ élevé est souvent requis. Un second test, méthodologiquement indépendant, est parfois nécessaire pour réduire le risque qu'un même facteur de confusion soit à l'origine des deux résultats.

Imagerie

Les études d'imagerie diagnostique sont particulièrement sensibles :

  • à l'expérience de l'examinateur
  • à l'équipement technique et aux protocoles
  • à la connaissance des données cliniques
  • à la connaissance des résultats d'autres examens d'imagerie
  • à des seuils de décision imprécis ou multiples
  • à une vérification portant principalement sur les patients dont le test est positif.

Le rôle clinique du test doit être précisé. Une méthode peut être suffisamment spécifique pour localiser une lésion avant une chirurgie, mais insuffisamment sensible pour exclure la maladie. Dans une revue Cochrane sur l'imagerie de l'endométriose, la performance variait selon la localisation anatomique et le rôle clinique. Aucune modalité d'examen ne pouvait remplacer de façon fiable le diagnostic chirurgical pour l'ensemble de l'endométriose pelvienne, malgré de bonnes performances pour certaines lésions circonscrites [21].

Lecture critique des études diagnostiques

Sélection des patients

Le plan d'étude le plus applicable inclut généralement des patients consécutifs ou sélectionnés au hasard, chez qui le test serait envisagé en pratique clinique. Une étude cas-témoins comparant des patients atteints d'une maladie avancée et certaine à des témoins sains crée un spectre artificiellement large. De telles études risquent de surestimer à la fois la sensibilité et la spécificité.

À examiner :

  • les critères d'inclusion et d'exclusion
  • le niveau de soins et les filières d'adressage
  • les tests antérieurs
  • le stade et la sévérité de la maladie
  • les diagnostics différentiels pertinents dans le groupe sans condition cible
  • le caractère consécutif, aléatoire ou de convenance du recrutement.

Des revues méthodologiques empiriques ont identifié la variation liée aux caractéristiques démographiques, à la prévalence de la maladie, à sa sévérité, à la vérification, à l'observateur et à l'instrument comme des causes importantes de la variabilité des résultats de performance [9,11].

Référence standard

La référence standard n'a pas besoin d'être parfaite, mais elle doit classer la condition cible de manière suffisamment exacte et indépendamment du test index. Une référence standard imparfaite peut faire paraître un bon test index moins performant, ou inversement.

Les risques comprennent :

  • Biais d'incorporation : le test index fait partie du diagnostic de référence.
  • Biais de revue : la personne qui interprète la référence standard connaît le résultat du test index.
  • Vérification différentielle : des références standards différentes sont utilisées selon le résultat du test index.
  • Vérification partielle : seuls certains patients, souvent ceux dont le test est positif, bénéficient de la référence standard.
  • Évolution dans le temps : la condition cible se modifie entre le test index et la référence standard.

En l'absence de référence standard reconnue, on peut recourir à des critères composites, à un panel d'experts, à un suivi longitudinal ou à des modèles statistiques à classes latentes. Chaque méthode repose sur des hypothèses explicites et peut donner des résultats différents [12]. Les modèles à classes latentes traitent le statut pathologique réel comme une variable non observée, mais leurs résultats peuvent dépendre fortement des hypothèses concernant la dépendance mutuelle des tests et la constance de leur performance d'une population à l'autre [13].

Insu et informations cliniques disponibles

Le test index et la référence standard devraient, dans la mesure du possible, être interprétés sans connaissance du résultat de l'autre. L'étude doit en même temps reproduire l'utilisation clinique prévue. Si un radiologue a habituellement accès aux symptômes, aux examens d'imagerie antérieurs et aux résultats biologiques, un insu total peut fournir une estimation moins réaliste.

L'étude doit donc préciser clairement :

  • les informations dont disposait l'interprète du test
  • les informations dont disposait l'évaluateur de la référence
  • si les seuils de décision étaient prédéfinis
  • la formation et l'expérience de l'interprète
  • la gestion des désaccords entre évaluateurs.

Flux, intervalle de temps et perdus de vue

Tous les patients inclus doivent être pris en compte. Une attention particulière s'impose lorsque :

  • la référence standard manque chez de nombreux participants
  • les données manquantes diffèrent entre patients positifs et négatifs au test
  • le traitement a été instauré avant la vérification
  • un long intervalle permet une évolution de la condition
  • les résultats non concluants sont exclus de l'analyse.

Exclure les résultats techniquement en échec ou difficiles à interpréter peut donner une image exagérément favorable de la performance pratique du test. La proportion de ces résultats et leur prise en charge clinique doivent être rapportées séparément.

QUADAS-2 et STARD

QUADAS-2 évalue les études diagnostiques selon quatre domaines :

  1. sélection des patients
  2. test index
  3. référence standard
  4. flux des patients et chronologie.

Les trois premiers sont également évalués en termes d'applicabilité [10]. STARD 2015 est une recommandation de présentation comportant 30 items essentiels pour un compte rendu transparent des études de performance diagnostique [8]. STARD n'est pas un label de qualité, mais l'absence d'informations rend difficile l'évaluation des biais.

Pour les comparaisons directes entre deux tests, l'idéal est que les deux tests soient réalisés chez les mêmes patients ou que les patients soient randomisés entre stratégies de test. Sinon, les différences entre études distinctes peuvent tenir à la population et à la réalisation plutôt qu'aux tests eux-mêmes. QUADAS-C complète QUADAS-2 pour ce type de comparaisons [18].

Incertitude statistique et méta-analyse

Intervalles de confiance

Tous les indicateurs diagnostiques sont des estimations sur échantillon et doivent être rapportés avec leurs intervalles de confiance. La précision de la sensibilité dépend principalement du nombre de personnes atteintes de la condition cible, tandis que celle de la spécificité dépend du nombre de personnes qui en sont indemnes.

Une sensibilité de 100 % dans une étude portant sur dix patients malades est très incertaine. L'absence de faux négatifs observés ne prouve pas que la sensibilité réelle soit de 100 %.

Les études diagnostiques sont souvent de trop petite taille. Dans un recensement de 43 études, la médiane était de 49 participants atteints de la condition cible et seulement 5 % rapportaient un calcul préalable de la taille d'échantillon [14]. Dans une analyse ultérieure de 89 études portant sur des instruments de dépistage de la dépression, seulement 3 % présentaient un calcul d'effectif exploitable, et seulement 8 % avaient un intervalle de confiance de la sensibilité d'une largeur d'au plus 10 points de pourcentage [15].

La taille d'échantillon doit être planifiée en fonction :

  • de la sensibilité et de la spécificité minimales acceptables
  • de la largeur souhaitée des intervalles de confiance
  • de la prévalence attendue
  • de la proportion de résultats non concluants et de données manquantes
  • des analyses en sous-groupes prévues
  • de la comparaison éventuelle de plusieurs tests [16].

Méta-analyse de la performance diagnostique

La sensibilité et la spécificité sont corrélées, en particulier lorsque les études utilisent des seuils de décision différents. Elles ne doivent donc pas faire l'objet de méta-analyses comme des critères totalement indépendants. Les modèles recommandés comprennent le modèle bivarié et le modèle hiérarchique de courbe ROC récapitulative. Ceux-ci tiennent compte à la fois de la variabilité intra-étude, de la variabilité inter-études et de la relation entre sensibilité et spécificité [17].

Une estimation poolée ne doit pas être interprétée sans examiner :

  • les différences de population de patients
  • les seuils de décision
  • le prélèvement et la technique d'analyse
  • la référence standard
  • le contexte de soins
  • le risque de biais des études
  • les intervalles de prédiction et l'hétérogénéité.

Les valeurs prédictives ne doivent généralement pas être transposées directement d'une méta-analyse à une population locale. Elles peuvent plutôt être calculées à partir de la sensibilité et de la spécificité poolées et d'une probabilité pré-test locale pertinente.

Liste de vérification pratique

Lors de l'évaluation d'un résultat de test diagnostique, vérifier les points suivants :

  1. Quelle est la condition cible ? Sa définition doit être cliniquement pertinente.
  2. Quel est le rôle du test ? Dépistage, triage, test additionnel, remplacement ou confirmation.
  3. Quelle est la probabilité pré-test ? Partir du patient, du niveau de soins et des informations antérieures.
  4. Quel seuil de décision est utilisé ? Vérifier qu'il correspond à celui de la validation de l'étude et du laboratoire.
  5. Quelles sont la sensibilité et la spécificité ? Les lire comme un couple.
  6. Quels sont le RV+ et le RV− ? Utiliser le rapport de vraisemblance pertinent pour actualiser la probabilité.
  7. Quelle est la précision du résultat ? Examiner les intervalles de confiance et le nombre de personnes avec et sans condition cible.
  8. La population de l'étude ressemble-t-elle au patient ? Tenir compte de l'âge, du stade, des comorbidités, des symptômes et des tests antérieurs.
  9. La référence standard est-elle crédible ? Rechercher une vérification partielle, différentielle ou par incorporation.
  10. Comment les résultats non concluants et les données manquantes ont-ils été gérés ? Leur exclusion peut surestimer la performance du test.
  11. La probabilité post-test modifie-t-elle la prise en charge ? Sinon, le test n'était probablement pas justifié.
  12. La stratégie de test est-elle cliniquement utile ? Performance, coût, risque et devenir des patients doivent être mis en balance.

Sources

  1. Habibzadeh F. Diagnostic tests performance indices: an overview. Biochemia Medica 2025. PMID: 39974192
  2. Eusebi P. Diagnostic accuracy measures. Cerebrovascular Diseases 2013. PMID: 24135733
  3. Bours MJ. Bayes' rule in diagnosis. Journal of Clinical Epidemiology 2021. PMID: 33741123
  4. Fischer JE, Bachmann LM, Jaeschke R. A readers' guide to the interpretation of diagnostic test properties: clinical example of sepsis. Intensive Care Medicine 2003. PMID: 12734652
  5. Hajian-Tilaki K. Receiver Operating Characteristic (ROC) Curve Analysis for Medical Diagnostic Test Evaluation. Caspian Journal of Internal Medicine 2013. PMID: 24009950
  6. Obuchowski NA, Lieber ML, Wians FH Jr. ROC curves in clinical chemistry: uses, misuses, and possible solutions. Clinical Chemistry 2004. PMID: 15142978
  7. Cohen JF, Korevaar DA, Altman DG et al. STARD 2015 guidelines for reporting diagnostic accuracy studies: explanation and elaboration. BMJ Open 2016. PMID: 28137831
  8. Bossuyt PM, Reitsma JB, Bruns DE et al. STARD 2015: an updated list of essential items for reporting diagnostic accuracy studies. BMJ 2015. PMID: 26511519
  9. Whiting P, Rutjes AW, Reitsma JB et al. Sources of variation and bias in studies of diagnostic accuracy: a systematic review. Annals of Internal Medicine 2004. PMID: 14757617
  10. Whiting PF, Rutjes AW, Westwood ME et al. QUADAS-2: a revised tool for the quality assessment of diagnostic accuracy studies. Annals of Internal Medicine 2011. PMID: 22007046
  11. Whiting P, Rutjes AW, Dinnes J et al. Development and validation of methods for assessing the quality of diagnostic accuracy studies. Health Technology Assessment 2004. PMID: 15193208
  12. Rutjes AW, Reitsma JB, Coomarasamy A et al. Evaluation of diagnostic tests when there is no gold standard. A review of methods. Health Technology Assessment 2007. PMID: 18021577
  13. Collins J, Huynh M. Estimation of diagnostic test accuracy without full verification: a review of latent class methods. Statistics in Medicine 2014. PMID: 24910172
  14. Bachmann LM, Puhan MA, ter Riet G et al. Sample sizes of studies on diagnostic accuracy: literature survey. BMJ 2006. PMID: 16627488
  15. Thombs BD, Rice DB. Sample sizes and precision of estimates of sensitivity and specificity from primary studies on the diagnostic accuracy of depression screening tools: a survey of recently published studies. International Journal of Methods in Psychiatric Research 2016. PMID: 27060912
  16. Hajian-Tilaki K. Sample size estimation in diagnostic test studies of biomedical informatics. Journal of Biomedical Informatics 2014. PMID: 24582925
  17. Ma X, Nie L, Cole SR et al. Statistical methods for multivariate meta-analysis of diagnostic tests: an overview and tutorial. Statistical Methods in Medical Research 2016. PMID: 23804970
  18. Yang B, Mallett S, Takwoingi Y et al. QUADAS-C: A Tool for Assessing Risk of Bias in Comparative Diagnostic Accuracy Studies. Annals of Internal Medicine 2021. PMID: 34698503
  19. Van Calster B, Wynants L, Verbeek JFM et al. Reporting and Interpreting Decision Curve Analysis: A Guide for Investigators. European Urology 2018. PMID: 30241973
  20. Cohen JF, Pauchard JY, Hjelm N et al. Efficacy and safety of rapid tests to guide antibiotic prescriptions for sore throat. Cochrane Database of Systematic Reviews 2020. PMID: 32497279
  21. Nisenblat V, Bossuyt PM, Farquhar C et al. Imaging modalities for the non-invasive diagnosis of endometriosis. Cochrane Database of Systematic Reviews 2016. PMID: 26919512

Mis à jour 29 septembre 2026