Kaplan–Meier, censure, log-rank et hazard ratio — sur une étude que vous concevez vous-même.
Laddar modellen…
Modellen
Les patients sont simulés avec une survie de loi exponentielle, donc à risque instantané constant. C'est la distribution qui rend le hazard ratio exactement interprétable et qui sous-tend la plupart des calculs de puissance. Chaque patient reçoit une date d'inclusion tirée uniformément sur la période d'inclusion, ce qui produit la censure administrative apparaissant à la clôture de l'étude : celui qui est entré en dernier est celui qui a été suivi le moins longtemps.
Les courbes sont estimées par l'estimateur produit-limite de Kaplan–Meier et les bandes de confiance par la formule de Greenwood. Le log-rank compare le nombre d'événements observé et attendu sous l'hypothèse nulle, et le hazard ratio est estimé par la méthode de Peto–Pike, qui est l'estimation ponctuelle propre au test du log-rank.
Le hasard est initialisé par une graine. Les mêmes réglages donnent toujours la même étude, et c'est bien l'objectif : on doit pouvoir déplacer un curseur et voir ce que ce curseur, et lui seul, a fait. Changez de graine pour voir la part du pur hasard.
Prenez Étude trop petite : le hazard ratio vrai reste inchangé à 0,70, mais la valeur de p devient non significative. L'effet existe ; c'est l'étude qui manque d'événements pour le montrer. L'absence de preuve n'est pas la preuve de l'absence.
Changez seulement de graine aléatoire quelques fois, avec le même schéma. L'écart entre les exécutions est tout ce que le hasard seul peut produire — et il est plus grand que la plupart ne l'imaginent.
Augmentez le nombre de patients en gardant un suivi court. Comparez ensuite avec le fait de garder le nombre et d'allonger le suivi. C'est le nombre d'événements qui donne la puissance, pas le nombre d'inclus.
Prenez Suivi trop court et cherchez la médiane. Elle est absente, parce que la courbe n'atteint jamais 50 %. Une médiane non atteinte n'est pas une mauvaise médiane, ce n'est pas une médiane du tout.
Activez beaucoup de perdus de vue et regardez la queue de la courbe : la bande de confiance s'élargit et la courbe devient hachée, tandis que la ligne des sujets à risque sous l'axe se vide. Lisez toujours cette ligne avant d'interpréter une queue de courbe.
Mettez le HR à 1,0 et voyez les courbes se croiser dans un sens puis dans l'autre. Voilà à quoi ressemble l'absence d'effet — pas à deux droites parallèles.
Förenklingar. Le risque instantané constant est une simplification : les évolutions réelles présentent souvent des pics précoces ou des effets tardifs, et un hazard ratio unique en est alors un résumé trompeur. L'estimation de Peto–Pike tire en outre facilement vers 1 quand le rapport vrai est loin de 1 et que la censure est importante, ce qui se voit si l'on enchaîne plusieurs graines et qu'on les compare à la valeur vraie. Le modèle suppose aussi une censure indépendante, c'est-à-dire que celui qui sort de l'étude ne le fait pas parce que son pronostic a changé — une hypothèse qui ne peut pas être éprouvée dans les données et qui est la faiblesse cachée la plus fréquente des analyses de survie réelles. Aucun ajustement sur des covariables n'est fait, et les intervalles de confiance sont asymptotiques et deviennent peu fiables quand les événements sont peu nombreux.
Modellen bygger på
Kaplan EL, Meier P. Nonparametric estimation from incomplete observations. J Am Stat Assoc 1958.
Peto R, Pike MC et al. Design and analysis of randomized clinical trials requiring prolonged observation. Br J Cancer 1977.
HR 0,70 med 300 per arm och lång uppföljning. Kurvorna separerar tidigt.
Kaplan–Meier med 95 % konfidensband. Lodräta streck är censurerade patienter — de lämnar riskmängden utan att räknas som händelse. Raderna under axeln är antalet kvar i risk, och det är där kurvans trovärdighet ska läsas av: en svans byggd på tio patienter betyder ingenting.
Log-rank
0.001p
Skattad HR
0.72 (0.59–0.88)
Sann HR
0.70
Händelser totalt
382
Kontroll
205/300 händelser
Behandling
177/300 händelser
Median kontroll
21.2 mån
Median behandling
30.7 mån
Skillnaden är statistiskt säkerställd. Konfidensintervallet för hazardkvoten utesluter 1,0 — men läs bredden på det, inte bara p-värdet.