Zum Inhalt springen
L

Wikipedia · einfach zusammengefasst · Stand

Bootstrapping-Verfahren

Aus dieser Verteilung der Statistik T kann direkt ein Konfidenzintervall mithilfe der inversen Verteilungsfunktion erzeugt werden. Zudem lassen sich …

Inhalt6 Abschnitte
  1. 1. Grundidee und Zweck
  2. 2. Anwendungen
  3. 3. Wichtige Verfahren
  4. 4. Stichprobenverteilungen und Tests
  5. 5. Beispiel Aspirin-Studie
  6. 6. Grenzen und Anpassungen

Grundidee und Zweck

Das Bootstrapping-Verfahren ist in der Statistik eine Methode des Resampling: Aus vorhandenen Daten werden wiederholt neue Stichproben erzeugt, um Eigenschaften einer Statistik zu schätzen. Die Grundannahme lautet, dass die vorliegende Zufallsstichprobe repräsentativ für die Grundgesamtheit ist. Konzeptionell wird deshalb die unbekannte Grundgesamtheit durch die vorhandene Stichprobe ersetzt.

Meist ersetzt Bootstrap die theoretische Verteilungsfunktion F einer Zufallsvariablen durch die empirische Verteilungsfunktion F_n der Stichprobe x_1, ..., x_n. Durch wiederholtes Ziehen mit Zurücklegen entstehen Bootstrap-Stichproben. Auf ihnen werden Statistiken berechnet, zum Beispiel Mittelwerte, Standardfehler, Varianzen oder Konfidenzintervalle. Das Verfahren ist besonders nützlich, wenn die theoretische Verteilung der interessierenden Statistik nicht bekannt ist.

Bootstrapping kann als Monte-Carlo-Methode verstanden werden, weil wiederholt zufällige Stichproben aus einer Verteilung gezogen werden. Nichtparametrisches Bootstrapping kommt weitgehend ohne Modellannahmen aus, funktioniert aber nur gut, wenn die empirische Verteilungsfunktion die tatsächliche Verteilungsfunktion hinreichend gut approximiert. Dafür braucht man eine gewisse Größe der ursprünglichen Stichprobe. Bei Verteilungen mit unendlicher Varianz ist das nichtparametrische Bootstrap unzuverlässig.

Anwendungen

Bootstrap-Methoden können auf viele Arten von Grundgesamtheiten angewendet werden, sofern die Daten unabhängig, auch zeitlich unabhängig, verwendet werden können. Ein Beispiel sind 60 historische aufeinander folgende Monatsrenditen r_j: Zieht man daraus zufällig 12 einzelne Monatsrenditen und multipliziert die Wachstumsfaktoren (1+r_j) zu Jahresrenditen, kann man diesen Vorgang sehr häufig wiederholen und so eine Verteilungsfunktion erwarteter Jahresrenditen erhalten.

Das Verfahren eignet sich für deskriptive Kennzahlen wie das arithmetische Mittel oder den Median. Es kann aber auch bei komplexeren inferenzstatistischen Methoden wie Regressionsmodellen genutzt werden. Durch seine Flexibilität kann Bootstrapping Standardfehler für beliebige Statistiken erzeugen und damit statistische Schlüsse erleichtern.

Typische Anwendungen sind Bootstrap-Konfidenzbereiche und Bootstrap-Konfidenzintervalle, Bootstrap-Tests sowie Bootstrap aggregating. Bootstrap-Konfidenzintervalle sind selbst mit Unsicherheiten verbunden, unter anderem im Zusammenhang mit empirischen Quantilen.

Wichtige Verfahren

Beim i.i.d. Bootstrap geht man von einer Stichprobe x_1, ..., x_n aus, die als Realisierung unabhängig und identisch verteilter Zufallsvariablen X_1, ..., X_n mit unbekannter Verteilungsfunktion F verstanden wird. Für b=1, ..., B werden Bootstrap-Stichproben x_b=(x_1^, ..., x_n^) erzeugt, indem jeweils n-mal mit Zurücklegen aus der ursprünglichen Stichprobe gezogen wird. Für jede Bootstrap-Stichprobe berechnet man die Statistik T_b(x_1^, ..., x_n^)=T(x_b). Die empirische Verteilung der B Werte approximiert die Verteilung von T(X_1, ..., X_n). Daraus lassen sich zum Beispiel Konfidenzintervalle über die inverse Verteilungsfunktion sowie Erwartungswert und Varianz über Stichprobenmittelwert und Stichprobenvarianz schätzen.

Die Zahl der möglichen unterschiedlichen Stichprobenwiederholungen beim Ziehen mit Zurücklegen und Beachtung der Reihenfolge beträgt n^n. Sie wächst sehr schnell mit der Stichprobengröße n, deshalb verwendet man typischerweise nur eine bestimmte Zahl zufälliger Wiederholungen als Monte-Carlo-Simulation.

Der Block-Bootstrap wird bei zeitlich korrelierten Daten eingesetzt, weil i.i.d. Bootstrap zeitliche Korrelation zerstören würde. Die Daten werden in überlappende oder nichtüberlappende zusammenhängende Blöcke eingeteilt. Häufig trennt man ein Signal in Trend- und Residualanteil, zieht Residualblöcke mit Zurücklegen, hängt sie bis zur ursprünglichen Länge aneinander und addiert sie wieder zur Trendzeitreihe. Dieser Vorgang wird oft wiederholt, zum Beispiel B=100 bis 1000.

Beim parametrischen Bootstrap nimmt man an, dass die ursprüngliche Stichprobe einer bekannten Verteilung mit Parametern θ folgt. Die Parameter werden geschätzt, etwa mit der Maximum-Likelihood-Methode, wodurch man den Schätzwert θ̂ erhält. Die geschätzte Verteilungsfunktion ist F̂=F_θ̂; aus ihr werden wiederholt Stichproben gezogen. Beim m-out-of-n Bootstrap werden kleinere Stichprobenwiederholungen gezogen, was zum Beispiel beim Bootstrapping von Extremwerten nötig sein kann. Beim bayesschen Bootstrap wird das klassische Ziehen als Ziehen von Stichprobengewichten aufgefasst; statt diskreter Gewichte aus einer Multinomialverteilung können auch kontinuierliche, nicht-ganzzahlige Gewichte verwendet werden.

Stichprobenverteilungen und Tests

Wenn eine hinreichend große Stichprobe repräsentativ für die Grundgesamtheit ist, kann die Stichprobenverteilung einer beliebigen Stichprobenfunktion nichtparametrisch mit dem Bootstrap-Verfahren geschätzt werden. Dabei muss die Verteilung der Stichprobenvariablen X_i nicht bekannt sein.

Ein Bootstrap-Test für zwei Stichproben aus den Verteilungen F und G kann die Nullhypothese H_0:F=G prüfen. Er verläuft ähnlich wie ein Permutationstest, verwendet aber Ziehen mit Zurücklegen aus dem fusionierten Datensatz statt Permutationen. Bootstrap-Tests können auch die Nullhypothese H_0:F≠G testen und damit für Äquivalenztests eingesetzt werden.

Theoretisch wird das Bootstrapping-Verfahren durch den Satz von Gliwenko-Cantelli gestützt. Dieser Hintergrund erklärt, warum die empirische Verteilungsfunktion unter geeigneten Bedingungen als Näherung der tatsächlichen Verteilungsfunktion verwendet werden kann.

Beispiel Aspirin-Studie

Efron und Tibshirani beschreiben ein Beispiel zum parametrischen Bootstrap aus einer Studie, über die die Titelseite der New York Times am 27. Januar 1987 berichtete. Es ging um die Frage, ob regelmäßige Einnahme kleiner Dosen Aspirin das Herzinfarktrisiko reduziert. In der Aspirin-Gruppe traten 104 Herzinfarkte bei 11037 Probanden auf, in der Placebo-Gruppe 189 Herzinfarkte bei 11034 Probanden.

Die Herzinfarktraten erfüllen 104/11037 < 189/11034. Der Quotient der Raten ist (104/11037)/(189/11034) und liegt unter 1. Die Daten deuten also darauf hin, dass Aspirin das Risiko reduziert. Die statistische Frage lautet, ob dieser Befund signifikant ist und auf die Grundgesamtheit übertragen werden kann oder durch Zufall erklärbar ist. Möglich ist zum Beispiel der exakte Test nach Fisher; eine andere Möglichkeit ist Bootstrapping.

Sei p die Wahrscheinlichkeit für einen Herzinfarkt in der Aspirin-Gruppe und q die entsprechende Wahrscheinlichkeit in der Placebo-Gruppe. Ziel ist ein approximatives Bootstrap-Konfidenzintervall für p/q. Man wählt X~Bin(11037,p) und Y~Bin(11034,q). Beobachtet wurde (x,y)=(104,189). Ein Schätzer ist T=(X/11037)/(Y/11034), mit beobachteter Realisierung 0,55. Statt die Studie zu wiederholen, schätzt man p und q durch p̂=104/11037 und q̂=189/11034. Dann simuliert man X^~Bin(11037,p̂) und Y^~Bin(11034,q̂). Über t_i^=(x_i^/11037)/(y_i^*/11034) für i=1,2,...,B entstehen Bootstrap-Realisierungen von T. Deren empirischer Mittelwert und empirische Varianz schätzen Erwartungswert und Varianz; das Konfidenzintervall für p/q kann über empirische Quantile konstruiert werden.

Grenzen und Anpassungen

Bootstrap-Verfahren haben Grenzen. In hohen Dimensionen ist Residual-Bootstrap bei Regressionsmodellen sehr anti-konservativ, während Pair-Bootstrap sehr konservativ ist. Außerdem enthält eine Bootstrap-Stichprobe mit Zurücklegen nicht alle ursprünglichen Werte. Für eine Stichprobe der Größe n ist die Wahrscheinlichkeit, dass ein bestimmtes Sample bei einer Ziehung nicht ausgewählt wird, p=1-1/n. Die Wahrscheinlichkeit, dass es n-mal nicht ausgewählt wird, nähert sich für große n dem Grenzwert lim_{n→∞}(1-1/n)^n=e^{-1}≈0,368=1-0,632. Daher enthält eine Stichprobenwiederholung im Durchschnitt nur 63,2 % der zugrundeliegenden Werte, wobei ausgewählte Werte mehrfach vorkommen können. Daraus entstehen Korrekturen wie der 632 Bootstrap zur Abschätzung des Generalisierungsfehlers eines angepassten Modells.

Die Größe der Bootstrap-Stichprobe kann das Ergebnis beeinflussen, zum Beispiel beim Bootstrapping der Verteilung von Extremwerten. Dort muss die Bootstrap-Stichprobengröße kleiner sein als die ursprüngliche Stichprobengröße, um konsistente Ergebnisse zu erhalten.

Bei endlichen Grundgesamtheiten, aus denen Stichproben ohne Zurücklegen gezogen wurden, sind Anpassungen nötig. Die i.i.d.-Annahme des üblichen Bootstrapping-Verfahrens würde Ziehen mit Zurücklegen voraussetzen. Ein Beispiel für eine Anpassung an endliche Grundgesamtheiten und Ziehen ohne Zurücklegen ist das population bootstrap.

Weiterlesen

Zufallsstichprobe In der mathematischen Statistik sind Zufallsstichproben die Grundlage für den Rückschluss von der Stichprobe auf Eigenschaften der Grundgesamtheit. Die … Repräsentativität Repräsentativität bezeichnet in der Statistik und der empirischen Forschung die Frage, inwieweit eine Stichprobe beziehungsweise die aus ihr gewonnenen … Grundgesamtheit Die Grundgesamtheit bezeichnet diejenige Menge aller Objekte, über die eine Aussage getroffen werden soll. Grundgesamtheiten werden häufig nur unvollständig … Urnenmodell Mit Urnenmodellen wird die Wahrscheinlichkeit für das Auftreten bestimmter Farbkombinationen untersucht, wenn aus einer Urne mit verschiedenfarbigen Kugeln … Zufallsvariable Beispiele für reelle Zufallsvariablen sind die Augensumme von zwei geworfenen Würfeln und die Gewinnhöhe in einem Glücksspiel. Zufallsvariablen können aber auch … Empirische Verteilungsfunktion Eine empirische Verteilungsfunktion – auch Summenhäufigkeitsfunktion, (empirische) Verteilungsfunktion der Stichprobe oder Stichprobenverteilungsfunktion … Redewendung Redewendung. feste Verbindung mehrerer Wörter, deren Gesamtbedeutung sich nicht unmittelbar aus der Bedeutung der Einzelelemente ergibt. Artikel · Diskussion. Regressionsanalyse Die Regressionsanalyse ist ein Instrumentarium statistischer Analyseverfahren, die zum Ziel haben, Beziehungen zwischen einer abhängigen (auch erklärte … Standardfehler Allgemein gilt: Je größer der Stichprobenumfang, desto kleiner der Standardfehler; je kleiner die Varianz, desto kleiner der Standardfehler. Eine wichtige Rolle … Empirisches Quantil Diese sind Kennzahlen einer Wahrscheinlichkeitsverteilung und damit einer abstrakten (Mengen-)Funktion (ähnlich dem Erwartungswert), während die empirischen … Histogramm Die Höhe jedes Rechtecks stellt dann die (relative oder absolute) Häufigkeitsdichte dar, also die (relative oder absolute) Häufigkeit dividiert durch die Breite … Konfidenzintervall Ein Konfidenzintervall, kurz KI, auch Vertrauensintervall, Konfidenzbereich, Vertrauensbereich oder Erwartungsbereich genannt, ist in der frequentistischen …