Zum Inhalt springen
L

Wikipedia · einfach zusammengefasst · Stand

Bayessche Statistik

Grundlagen sind der bayessche Wahrscheinlichkeitsbegriff und der Satz von Bayes. In der bayesschen Statistik drückt die Wahrscheinlichkeit den „Grad der …

Inhalt6 Abschnitte
  1. 1. Grundidee und Bedeutung
  2. 2. Bayesscher Wahrscheinlichkeitsbegriff
  3. 3. Aufbau bayesscher Verfahren
  4. 4. Münzwurf als Beispiel
  5. 5. Wahl des Priors
  6. 6. Vergleich und historische Beispiele

Grundidee und Bedeutung

Die bayessche Statistik ist ein Zweig der Statistik, der auf dem bayesschen Wahrscheinlichkeitsbegriff und dem Satz von Bayes beruht. Wahrscheinlichkeit bedeutet hier nicht nur eine langfristige relative Häufigkeit, sondern den „Grad der Überzeugung“ oder die Glaubwürdigkeit einer Aussage nach dem bisherigen Kenntnisstand und den vorliegenden Daten. Eine Wahrscheinlichkeit kann also ausdrücken, wie plausibel eine Hypothese ist.

Dieser Ansatz unterscheidet sich von der klassischen frequentistischen Deutung, bei der Wahrscheinlichkeit als Grenzwert relativer Häufigkeiten in sehr vielen Wiederholungen eines Zufallsexperiments verstanden wird. Bayessche Statistik kann deshalb auch bei Fragestellungen eingesetzt werden, bei denen keine unendlich oft wiederholbaren Experimente vorausgesetzt werden sollen oder die Datengrundlage klein ist. Dafür muss aber eine plausible A-priori-Wahrscheinlichkeit festgelegt werden.

Bayessche Verfahren betrachten Wahrscheinlichkeitsverteilungen streng und vollständig. Das macht sie oft rechnerisch aufwändig. Ein Grund dafür, dass sich im 20. Jahrhundert häufig frequentistische und Ad-hoc-Methoden durchsetzten, war ihre einfachere Berechenbarkeit. Durch Computer und Monte-Carlo-Sampling-Verfahren sind auch kompliziertere bayessche Verfahren heute leichter umsetzbar.

Bayesscher Wahrscheinlichkeitsbegriff

Der bayessche Wahrscheinlichkeitsbegriff definiert Wahrscheinlichkeiten als „Grad vernünftiger Erwartung“, also als Maß für die Glaubwürdigkeit einer Aussage. Der Wert reicht von 0 für falsch oder unglaubwürdig bis 1 für wahr oder glaubwürdig. Anders als in der klassischen Logik, in der Aussagen nur wahr oder falsch sind, erlaubt dieser Begriff Zwischenstufen. Eine Wahrscheinlichkeit von 0,25 kann zum Beispiel bedeuten, dass eher gegen die Aussage spricht, aber keine Gewissheit besteht.

Bayessche Wahrscheinlichkeiten P(A) beziehen sich auf Aussagen A. Aus einfachen Aussagen lassen sich komplexere Wahrscheinlichkeiten bilden. Wichtige Formen sind gemeinsame Wahrscheinlichkeiten P(A,B), also die Wahrscheinlichkeit, dass A und B zugleich wahr sind, und bedingte Wahrscheinlichkeiten P(A|B), also die Wahrscheinlichkeit, dass A wahr ist, wenn B bereits gegeben ist. Ein Beispiel aus dem Artikel ist das Wetter: P(A,B) fragt danach, wie wahrscheinlich es ist, dass gleichzeitig die Sonne scheint und Regen fällt; P(A|B) fragt danach, wie wahrscheinlich Sonnenschein während eines Regenzeitraums ist.

Aufbau bayesscher Verfahren

Bayessche Verfahren beginnen mit Vorwissen, das als A-priori-Wahrscheinlichkeitsverteilung, kurz Prior, formuliert wird. Neue Daten werden genutzt, um diese Verteilung zu aktualisieren. Das Ergebnis ist die A-posteriori-Wahrscheinlichkeitsverteilung, kurz Posterior. Sie beschreibt die verbesserte Einschätzung nach Einbeziehung der Daten.

Für ein Modell M, einen Datensatz D und Vorwissen I wird gesucht, wie die Wahrscheinlichkeiten der Modellparameter verteilt sind, wenn Daten und Vorwissen gegeben sind: Pr(M|D,I). Der Satz von Bayes lautet hier:

Pr(M|D,I) = Pr(D|M,I) Pr(M|I) / Pr(D|I).

Die Bestandteile haben feste Namen. Pr(M|I) ist die A-priori-Wahrscheinlichkeit, also die Verteilung für M nur auf Grundlage des Vorwissens I. Pr(M|D,I) ist die A-posteriori-Wahrscheinlichkeit, also die Verteilung für M nach Einbeziehung von Vorwissen und Messdaten. Pr(D|M,I) heißt Likelihood, inverse Wahrscheinlichkeit oder „Plausibilität“; sie beschreibt die Wahrscheinlichkeit der Messdaten D, wenn Modellparameter M und Vorwissen I gegeben sind. Pr(D|I) heißt Evidenz und dient als Normierungsfaktor.

Ein wichtiger Gedanke ist die fortlaufende Aktualisierung: Nach einem Experiment wird aus Prior und Messdaten ein Posterior berechnet. In späteren Experimenten kann dieser Posterior als neuer Prior dienen, also als erweitertes Vorwissen I' = {I,D}. Wenn neue Messdaten gut zu bisherigen Erwartungen passen, kann die Wahrscheinlichkeitsverteilung schmaler und genauer werden. Weichen sie vom Vorwissen ab, kann die Varianz größer werden und der Erwartungswert sich verschieben. Bei wenig Daten bleibt die Verteilung breit und wenig lokalisiert.

Münzwurf als Beispiel

Der Münzwurf zeigt anschaulich, wie bayessche Inferenz funktioniert. Untersucht wird, ob bei einem Wurf „Kopf“ (1) oder Nicht-Kopf, also „Zahl“ (0), eintritt. Im Alltag nimmt man oft p(K)=0,5 an. Diese Annahme ist aber bei einer unregelmäßigen oder manipulierten Münze nicht selbstverständlich. Deshalb wird die Wahrscheinlichkeit für Kopf nicht festgesetzt, sondern als unbekannter Parameter μ betrachtet.

Gesucht ist eine Wahrscheinlichkeitsverteilung für μ, also dafür, wie ausgewogen die Münze ist. In einem Experiment mit N Würfen werden m Kopfwürfe und N−m Zahlwürfe beobachtet. Die gesuchte Posteriorverteilung ist Pr(μ|m,N). Mit dem bayesschen Satz ergibt sich proportional:

Pr(μ|m,N) ∝ Pr(m|μ,N) Pr(μ).

Dabei ist Pr(m|μ,N) die Likelihood. Sie gibt an, wie wahrscheinlich m Kopfwürfe bei gegebener Münzbalance μ und gegebener Wurfzahl N sind. Diese Verteilung ist die Binomialverteilung:

Pr(m|μ,N) = Binom(m|μ,N) = (N über m) μ^m (1−μ)^(N−m).

Als Prior eignet sich bei dieser Likelihood eine Betaverteilung:

Pr(μ) = Beta(μ|α,β) = 1/B(α,β) · μ^(α−1)(1−μ)^(β−1).

Das Produkt aus Binomial-Likelihood und Beta-Prior ergibt wieder eine Betaverteilung als Posterior:

Pr(μ|m,N,α,β) = Beta(μ|α+m, β+(N−m)).

Die Parameter des Posteriors entstehen also direkt aus den Priorparametern α und β sowie den beobachteten Daten. Diese Posteriorverteilung kann bei weiteren Münzwürfen wieder als neuer Prior verwendet werden. Sie liefert nicht nur einen wahrscheinlichsten Wert für μ, sondern auch eine Aussage über die Genauigkeit dieser Schätzung. Im Artikel wird außerdem ein simuliertes Beispiel mit μ=0,35 beschrieben: Mit steigender Anzahl der Würfe nähert sich der Mittelwert der Beta-Verteilung dem wahren Wert an.

Wahl des Priors

Die Wahl der A-priori-Verteilung ist nicht beliebig. Im Münzwurfbeispiel wurde ein konjugierter Prior verwendet. Ein konjugierter Prior ist mathematisch praktisch, weil der Posterior zur gleichen Verteilungsfamilie gehört wie der Prior. Bei einer Binomialverteilung als Likelihood passt eine Betaverteilung als Prior.

Die Verteilung Beta(μ|α=1,β=1) macht jedes μ gleich wahrscheinlich. Sie entspricht dem Fall, dass kein nennenswertes Vorwissen über μ vorliegt. Nach wenigen Beobachtungen kann daraus bereits eine genauere Verteilung entstehen, zum Beispiel Beta(μ|α=11,β=12).

Ein Prior kann auch Expertenwissen enthalten. Bei einer normalen Münze kann man etwa erwarten, dass μ in der Nähe von 50 % liegt und Werte nahe 0 % oder 100 % unwahrscheinlich sind. Dann kann ein Prior mit Erwartungswert 0,5 sinnvoll sein. In einem anderen Fall, etwa bei roten und schwarzen Kugeln in einer Urne, wäre ein solcher Prior möglicherweise nicht angebracht, wenn das Mischverhältnis unbekannt ist oder nicht einmal sicher ist, ob beide Farben vorhanden sind.

Der Jeffreys’ Prior ist ein sogenannter nicht-informativer Prior beziehungsweise ein Verfahren, um einen nicht-informativen Prior zu bestimmen. Seine Grundidee ist, dass eine Prior-Wahl ohne Vorkenntnis von Daten nicht von der Parametrisierung abhängen sollte. Für einen Bernoulli-Prozess ist der Jeffreys Prior Beta(μ|α=1/2,β=1/2). Andere Prior-Verteilungen sind möglich, können die Bestimmung des Posteriors aber erschweren, sodass sie oft nur numerisch bewältigt werden kann. Konjugierte Prioren existieren für alle Mitglieder der Exponentialfamilie.

Vergleich und historische Beispiele

Nicht-bayessche Verfahren unterscheiden sich meist in zwei Punkten von bayesschen Verfahren: Sie geben dem Satz von Bayes keinen zentralen Stellenwert oder verwenden ihn gar nicht, und sie beruhen oft auf dem frequentistischen Wahrscheinlichkeitsbegriff. In dieser Sicht sind Wahrscheinlichkeiten Häufigkeitsverhältnisse unendlich oft wiederholbarer Experimente.

Je nach Verfahren wird nicht eine ganze Wahrscheinlichkeitsverteilung bestimmt, sondern nur ein Erwartungswert und gegebenenfalls ein Konfidenzintervall. Das kann rechnerisch einfacher sein. Nicht-bayessche Verfahren stellen außerdem umfangreiche Techniken zur Validierung ihrer Ergebnisse bereit.

Ein wichtiges nicht-bayessches Standardverfahren ist der Maximum-Likelihood-Ansatz. Dabei wird nicht mit dem Satz von Bayes eine Posteriorverteilung bestimmt. Stattdessen wird der Modellparameter so gewählt, dass die Likelihood-Funktion maximal wird. Im frequentistischen Bild sind nur die beobachteten Ereignisse D Zufallsvariablen. Die Likelihood wird deshalb als Funktion L: M ↦ Pr(D|M) betrachtet. Das Ergebnis ist ein Maximum-Likelihood-Schätzer M_ML, der am ehesten mit dem Erwartungswert der Posteriorverteilung im bayesschen Ansatz vergleichbar ist. Die Methode steht nicht völlig im Widerspruch zur bayesschen Statistik: Mit der Kullback-Leibler-Divergenz kann gezeigt werden, dass Maximum-Likelihood-Methoden näherungsweise Modellparameter schätzen, die der tatsächlichen Verteilung entsprechen.

Ein historisches Beispiel stammt von Pierre-Simon Laplace. Er leitete den Satz von Bayes erneut ab und nutzte ihn, um die Masse des Saturn und anderer Planeten einzugrenzen. Dabei standen A für die Aussage, dass die Masse des Saturn in einem bestimmten Intervall liegt, B für Daten von Observatorien über gegenseitige Störungen von Jupiter und Saturn, und C für die Einschränkung, dass der Saturn weder so klein sein darf, dass er seine Ringe verliert, noch so groß, dass er das Sonnensystem zerstört. Bouvard berechnete 1814 die Saturnmasse als den 3512,0ten Teil der Sonnenmasse. Ein NASA-Wert von 2004 wird mit 3499,1 angegeben. Die Abweichung beträgt (3512,0−3499,1)/3499,1 = 0,0037 < 0,01, also etwa 0,37 Prozent und damit deutlich weniger als ein Hundertstel.

Weiterlesen

Thomas Bayes Nach ihm ist der Satz von Bayes benannt, der in der Wahrscheinlichkeitsrechnung große Bedeutung hat. Einzig bekanntes Porträt, das möglicherweise Bayes abbildet … Bayesscher Wahrscheinlichkeitsbegriff Der nach dem englischen Mathematiker Thomas Bayes () benannte bayessche Wahrscheinlichkeitsbegriff (engl. Bayesianism) interpretiert Wahrscheinlichkeit als … Satz von Bayes Probleme mit wenigen Klassen und einfachen Verteilungen lassen sich übersichtlich im Baumdiagramm für die Aufteilung der Häufigkeiten darstellen. ... {MATHE} \ : … Monte-Carlo-Simulation Als Grundlage für Monte-Carlo-Simulationen ist vor allem das Gesetz der großen Zahlen zu sehen. Die Zufallsexperimente können entweder – etwa durch Würfeln … Zufallsexperiment Zufallsexperiment ; Eigenschaften · Es gibt einen genau festgelegten Plan zur Durchführung. · Alle möglichen Ergebnisse des Experiments sind vorab bekannt. Aussagenlogik Eine Konjunktion ist eine aus zwei Aussagen zusammengesetzte Aussage, die ... Die Erde ist keine Scheibe, und die Erde ist kein Würfel. oder in schönerem Deutsch. Wahrscheinlichkeitsfunktion Eine Wahrscheinlichkeitsfunktion, auch Zähldichte genannt, ist eine spezielle reellwertige Funktion in der Stochastik. Wahrscheinlichkeitsfunktionen werden … Binomialverteilung Die Binomialverteilung wurde von Jakob Bernoulli in seinem Werk Ars Conjectandi (1713) eingeführt. Der Begriff fand erstmals 1895 durch Karl Pearson Eingang in … Saturn (Planet) Das Innere des Gesteinskerns ist sehr heiß, es herrscht eine Temperatur von 12.000 Kelvin. Als Grund dafür wird unter anderem der Kelvin-Helmholtz-Mechanismus … Jupiter (Planet) Physikalische Eigenschaften · Jupiter ist der massereichste Planet im Sonnensystem. Er ist etwa 2,5-mal so massereich wie alle anderen sieben Planeten zusammen. Sonnensystem Das Sonnensystem ist das Planetensystem, in dem sich die Erde befindet. Es besteht aus der Sonne, acht sie umkreisenden Planeten (von innen nach außen: … Pierre-Simon Laplace März 1827 in Paris) war ein französischer Mathematiker, Physiker und Astronom. Er beschäftigte sich unter anderem mit der Wahrscheinlichkeitstheorie und mit …