Wikipedia · einfach zusammengefasst · Stand
Kaplan-Meier-Schätzer
Konfidenzintervall. Bearbeiten. Das Konfidenzintervall kann wie gewohnt aus der Varianz bzw. dem Standardfehler berechnet werden. SE ^ { S ^ ( t ) } ≈ [ S …
Inhalt6 Abschnitte
Grundidee
Der Kaplan-Meier-Schätzer, auch Produkt-Grenzwert-Schätzer (PGS), schätzt die Wahrscheinlichkeit, dass ein bestimmtes Ereignis bei einem Versuchsobjekt innerhalb eines Zeitintervalls nicht eintritt. Er ist eine nichtparametrische Schätzung der Überlebensfunktion in der Ereigniszeitanalyse. Die zugrunde liegenden Daten dürfen rechts-zensiert sein: Bei einer Zensierung endet die Beobachtung, ohne dass bis dahin das Ereignis eingetreten ist.
Die Überlebensfunktion S(t) beschreibt die Wahrscheinlichkeit, dass die Zeit bis zum Eintreten des Ereignisses größer als t ist. Der Kaplan-Meier-Schätzer berücksichtigt sowohl eingetretene Ereignisse als auch Zensierungen. Als Produkt-Grenzwert-Schätzer kann er als Grenzwert von Sterbetafelschätzungen mit gegen null gehenden Intervalllängen verstanden werden.
Berechnung
Für die Überlebensfunktion lautet der Kaplan-Meier-Schätzer:
Ŝ(t) = ∏(t_(i) ≤ t) (n_i − d_i) / n_i = ∏(t_(i) ≤ t) (1 − d_i / n_i)
Dabei ist Ŝ(0) = 1. t_(i) bezeichnet einen Zeitpunkt, an dem Ereignisse auftreten können. d_i ist die Zahl der Versuchsobjekte, bei denen das Ereignis zum Zeitpunkt t_(i) eingetreten ist. n_i ist die Zahl der Versuchsobjekte, die zu diesem Zeitpunkt noch unter Risiko stehen, bei denen das Ereignis also noch nicht eingetreten ist und die noch beobachtet werden.
Für jeden Ereigniszeitpunkt wird der bisherige Schätzwert mit (n_i − d_i) / n_i multipliziert. Eine Zensierung verändert den Schätzwert nicht, weil sie einem Faktor (n_i − 0) / n_i = 1 entspricht. Sie verringert aber die Zahl der später noch unter Risiko stehenden Versuchsobjekte.
Klinisches Beispiel
In einer beispielhaften klinischen Studie werden zunächst 15 Patienten beobachtet. Die Ereignisse können beispielsweise das Eintreten eines bestimmten Krankheits- oder Studienereignisses sein; die Tabelle legt nur fest, ob ein Ereignis eingetreten oder die Beobachtung zensiert worden ist.
Am Tag 1 verlässt ein Patient die Studie, ohne dass das Ereignis beobachtet wurde. Daher gilt:
Ŝ(1) = (15 − 0) / 15 = 1.
Die Zensierung verringert die Zahl der Patienten unter Risiko auf 14, ändert aber den Schätzwert nicht. Am Tag 12 tritt bei einem Patienten das Ereignis ein:
Ŝ(12) = (14 − 1) / 14 = 0,9286.
Danach stehen noch 13 Patienten unter Risiko. Am Tag 22 wird ein weiterer Patient zensiert; deshalb bleibt Ŝ(22) = Ŝ(12), während sich die Zahl der Patienten unter Risiko auf 12 verringert. Am Tag 29 tritt bei einem weiteren Patienten das Ereignis ein:
Ŝ(29) = ((12 − 1) / 12) · ((14 − 1) / 14) = 0,9167 · 0,9286 = 0,8512.
Weitere Ereignisse treten in der Tabelle an den Tagen 31, 61 und 70 auf. Die zugehörigen tabellarischen Schätzwerte betragen ungefähr 0,77, 0,64 und 0,52. Zensierungen sind unter anderem an den Tagen 36, 38, 50, 60, 88, 99, 110 und 140 angegeben. Die schwarzen Kreuze in der grafischen Darstellung markieren solche Zensurzeitpunkte.
Da die Zahl der Patienten unter Risiko im Zeitverlauf abnimmt, wird die Schätzung für spätere Zeitpunkte unsicherer. Das zeigt sich durch ein breiteres Konfidenzintervall. Die am längsten beobachteten Patienten befinden sich am Ende der Kurve.
Statistische Eigenschaft
Der Kaplan-Meier-Schätzer maximiert die empirische Likelihood. Er benötigt keine bestimmte parametrische Verteilung der Überlebenszeiten und kann deshalb nichtparametrisch eingesetzt werden.
Varianzschätzung
Für t_k ≤ t ≤ t_(k+1) kann die Varianz des Schätzers näherungsweise mit
Var̂{Ŝ(t)} ≈ [Ŝ(t)]² · {Σ(i=1 bis k) d_i / [n_i(n_i − d_i)]}
berechnet werden. In der Summe werden die Ereigniszeitpunkte bis zum betrachteten Bereich berücksichtigt. Die Varianz beschreibt, wie stark die Schätzung um den tatsächlichen, unbekannten Wert schwanken kann.
Konfidenzintervall
Aus der Varianz beziehungsweise dem Standardfehler lässt sich ein Konfidenzintervall für Ŝ(t) berechnen. Der näherungsweise Standardfehler lautet:
SÊ{Ŝ(t)} ≈ Ŝ(t) · {Σ(i=1 bis k) d_i / [n_i(n_i − d_i)]}^(1/2).
Diese Berechnung wird als Greenwood-Formel oder Greenwoodsches Formel bezeichnet. Das 95-%-Konfidenzintervall ist:
[Ŝ(t) − 1,96 · SÊ{Ŝ(t)}; Ŝ(t) + 1,96 · SÊ{Ŝ(t)}].
Mit zunehmender Beobachtungszeit stehen meist weniger Versuchsobjekte unter Risiko. Dadurch nimmt die Unsicherheit zu, und das Konfidenzintervall wird typischerweise breiter.