Wikipedia · einfach zusammengefasst · Stand
Bootstrapping-Verfahren
Aus dieser Verteilung der Statistik T kann direkt ein Konfidenzintervall mithilfe der inversen Verteilungsfunktion erzeugt werden. Zudem lassen sich …
Inhalt6 Abschnitte
Grundidee und Zweck
Das Bootstrapping-Verfahren ist in der Statistik eine Methode des Resampling: Aus vorhandenen Daten werden wiederholt neue Stichproben erzeugt, um Eigenschaften einer Statistik zu schätzen. Die Grundannahme lautet, dass die vorliegende Zufallsstichprobe repräsentativ für die Grundgesamtheit ist. Konzeptionell wird deshalb die unbekannte Grundgesamtheit durch die vorhandene Stichprobe ersetzt.
Meist ersetzt Bootstrap die theoretische Verteilungsfunktion F einer Zufallsvariablen durch die empirische Verteilungsfunktion F_n der Stichprobe x_1, ..., x_n. Durch wiederholtes Ziehen mit Zurücklegen entstehen Bootstrap-Stichproben. Auf ihnen werden Statistiken berechnet, zum Beispiel Mittelwerte, Standardfehler, Varianzen oder Konfidenzintervalle. Das Verfahren ist besonders nützlich, wenn die theoretische Verteilung der interessierenden Statistik nicht bekannt ist.
Bootstrapping kann als Monte-Carlo-Methode verstanden werden, weil wiederholt zufällige Stichproben aus einer Verteilung gezogen werden. Nichtparametrisches Bootstrapping kommt weitgehend ohne Modellannahmen aus, funktioniert aber nur gut, wenn die empirische Verteilungsfunktion die tatsächliche Verteilungsfunktion hinreichend gut approximiert. Dafür braucht man eine gewisse Größe der ursprünglichen Stichprobe. Bei Verteilungen mit unendlicher Varianz ist das nichtparametrische Bootstrap unzuverlässig.
Anwendungen
Bootstrap-Methoden können auf viele Arten von Grundgesamtheiten angewendet werden, sofern die Daten unabhängig, auch zeitlich unabhängig, verwendet werden können. Ein Beispiel sind 60 historische aufeinander folgende Monatsrenditen r_j: Zieht man daraus zufällig 12 einzelne Monatsrenditen und multipliziert die Wachstumsfaktoren (1+r_j) zu Jahresrenditen, kann man diesen Vorgang sehr häufig wiederholen und so eine Verteilungsfunktion erwarteter Jahresrenditen erhalten.
Das Verfahren eignet sich für deskriptive Kennzahlen wie das arithmetische Mittel oder den Median. Es kann aber auch bei komplexeren inferenzstatistischen Methoden wie Regressionsmodellen genutzt werden. Durch seine Flexibilität kann Bootstrapping Standardfehler für beliebige Statistiken erzeugen und damit statistische Schlüsse erleichtern.
Typische Anwendungen sind Bootstrap-Konfidenzbereiche und Bootstrap-Konfidenzintervalle, Bootstrap-Tests sowie Bootstrap aggregating. Bootstrap-Konfidenzintervalle sind selbst mit Unsicherheiten verbunden, unter anderem im Zusammenhang mit empirischen Quantilen.
Wichtige Verfahren
Beim i.i.d. Bootstrap geht man von einer Stichprobe x_1, ..., x_n aus, die als Realisierung unabhängig und identisch verteilter Zufallsvariablen X_1, ..., X_n mit unbekannter Verteilungsfunktion F verstanden wird. Für b=1, ..., B werden Bootstrap-Stichproben x_b=(x_1^, ..., x_n^) erzeugt, indem jeweils n-mal mit Zurücklegen aus der ursprünglichen Stichprobe gezogen wird. Für jede Bootstrap-Stichprobe berechnet man die Statistik T_b(x_1^, ..., x_n^)=T(x_b). Die empirische Verteilung der B Werte approximiert die Verteilung von T(X_1, ..., X_n). Daraus lassen sich zum Beispiel Konfidenzintervalle über die inverse Verteilungsfunktion sowie Erwartungswert und Varianz über Stichprobenmittelwert und Stichprobenvarianz schätzen.
Die Zahl der möglichen unterschiedlichen Stichprobenwiederholungen beim Ziehen mit Zurücklegen und Beachtung der Reihenfolge beträgt n^n. Sie wächst sehr schnell mit der Stichprobengröße n, deshalb verwendet man typischerweise nur eine bestimmte Zahl zufälliger Wiederholungen als Monte-Carlo-Simulation.
Der Block-Bootstrap wird bei zeitlich korrelierten Daten eingesetzt, weil i.i.d. Bootstrap zeitliche Korrelation zerstören würde. Die Daten werden in überlappende oder nichtüberlappende zusammenhängende Blöcke eingeteilt. Häufig trennt man ein Signal in Trend- und Residualanteil, zieht Residualblöcke mit Zurücklegen, hängt sie bis zur ursprünglichen Länge aneinander und addiert sie wieder zur Trendzeitreihe. Dieser Vorgang wird oft wiederholt, zum Beispiel B=100 bis 1000.
Beim parametrischen Bootstrap nimmt man an, dass die ursprüngliche Stichprobe einer bekannten Verteilung mit Parametern θ folgt. Die Parameter werden geschätzt, etwa mit der Maximum-Likelihood-Methode, wodurch man den Schätzwert θ̂ erhält. Die geschätzte Verteilungsfunktion ist F̂=F_θ̂; aus ihr werden wiederholt Stichproben gezogen. Beim m-out-of-n Bootstrap werden kleinere Stichprobenwiederholungen gezogen, was zum Beispiel beim Bootstrapping von Extremwerten nötig sein kann. Beim bayesschen Bootstrap wird das klassische Ziehen als Ziehen von Stichprobengewichten aufgefasst; statt diskreter Gewichte aus einer Multinomialverteilung können auch kontinuierliche, nicht-ganzzahlige Gewichte verwendet werden.
Stichprobenverteilungen und Tests
Wenn eine hinreichend große Stichprobe repräsentativ für die Grundgesamtheit ist, kann die Stichprobenverteilung einer beliebigen Stichprobenfunktion nichtparametrisch mit dem Bootstrap-Verfahren geschätzt werden. Dabei muss die Verteilung der Stichprobenvariablen X_i nicht bekannt sein.
Ein Bootstrap-Test für zwei Stichproben aus den Verteilungen F und G kann die Nullhypothese H_0:F=G prüfen. Er verläuft ähnlich wie ein Permutationstest, verwendet aber Ziehen mit Zurücklegen aus dem fusionierten Datensatz statt Permutationen. Bootstrap-Tests können auch die Nullhypothese H_0:F≠G testen und damit für Äquivalenztests eingesetzt werden.
Theoretisch wird das Bootstrapping-Verfahren durch den Satz von Gliwenko-Cantelli gestützt. Dieser Hintergrund erklärt, warum die empirische Verteilungsfunktion unter geeigneten Bedingungen als Näherung der tatsächlichen Verteilungsfunktion verwendet werden kann.
Beispiel Aspirin-Studie
Efron und Tibshirani beschreiben ein Beispiel zum parametrischen Bootstrap aus einer Studie, über die die Titelseite der New York Times am 27. Januar 1987 berichtete. Es ging um die Frage, ob regelmäßige Einnahme kleiner Dosen Aspirin das Herzinfarktrisiko reduziert. In der Aspirin-Gruppe traten 104 Herzinfarkte bei 11037 Probanden auf, in der Placebo-Gruppe 189 Herzinfarkte bei 11034 Probanden.
Die Herzinfarktraten erfüllen 104/11037 < 189/11034. Der Quotient der Raten ist (104/11037)/(189/11034) und liegt unter 1. Die Daten deuten also darauf hin, dass Aspirin das Risiko reduziert. Die statistische Frage lautet, ob dieser Befund signifikant ist und auf die Grundgesamtheit übertragen werden kann oder durch Zufall erklärbar ist. Möglich ist zum Beispiel der exakte Test nach Fisher; eine andere Möglichkeit ist Bootstrapping.
Sei p die Wahrscheinlichkeit für einen Herzinfarkt in der Aspirin-Gruppe und q die entsprechende Wahrscheinlichkeit in der Placebo-Gruppe. Ziel ist ein approximatives Bootstrap-Konfidenzintervall für p/q. Man wählt X~Bin(11037,p) und Y~Bin(11034,q). Beobachtet wurde (x,y)=(104,189). Ein Schätzer ist T=(X/11037)/(Y/11034), mit beobachteter Realisierung 0,55. Statt die Studie zu wiederholen, schätzt man p und q durch p̂=104/11037 und q̂=189/11034. Dann simuliert man X^~Bin(11037,p̂) und Y^~Bin(11034,q̂). Über t_i^=(x_i^/11037)/(y_i^*/11034) für i=1,2,...,B entstehen Bootstrap-Realisierungen von T. Deren empirischer Mittelwert und empirische Varianz schätzen Erwartungswert und Varianz; das Konfidenzintervall für p/q kann über empirische Quantile konstruiert werden.
Grenzen und Anpassungen
Bootstrap-Verfahren haben Grenzen. In hohen Dimensionen ist Residual-Bootstrap bei Regressionsmodellen sehr anti-konservativ, während Pair-Bootstrap sehr konservativ ist. Außerdem enthält eine Bootstrap-Stichprobe mit Zurücklegen nicht alle ursprünglichen Werte. Für eine Stichprobe der Größe n ist die Wahrscheinlichkeit, dass ein bestimmtes Sample bei einer Ziehung nicht ausgewählt wird, p=1-1/n. Die Wahrscheinlichkeit, dass es n-mal nicht ausgewählt wird, nähert sich für große n dem Grenzwert lim_{n→∞}(1-1/n)^n=e^{-1}≈0,368=1-0,632. Daher enthält eine Stichprobenwiederholung im Durchschnitt nur 63,2 % der zugrundeliegenden Werte, wobei ausgewählte Werte mehrfach vorkommen können. Daraus entstehen Korrekturen wie der 632 Bootstrap zur Abschätzung des Generalisierungsfehlers eines angepassten Modells.
Die Größe der Bootstrap-Stichprobe kann das Ergebnis beeinflussen, zum Beispiel beim Bootstrapping der Verteilung von Extremwerten. Dort muss die Bootstrap-Stichprobengröße kleiner sein als die ursprüngliche Stichprobengröße, um konsistente Ergebnisse zu erhalten.
Bei endlichen Grundgesamtheiten, aus denen Stichproben ohne Zurücklegen gezogen wurden, sind Anpassungen nötig. Die i.i.d.-Annahme des üblichen Bootstrapping-Verfahrens würde Ziehen mit Zurücklegen voraussetzen. Ein Beispiel für eine Anpassung an endliche Grundgesamtheiten und Ziehen ohne Zurücklegen ist das population bootstrap.