Zum Inhalt springen
L

Wikipedia · einfach zusammengefasst · Stand

Satz von Bayes

Probleme mit wenigen Klassen und einfachen Verteilungen lassen sich übersichtlich im Baumdiagramm für die Aufteilung der Häufigkeiten darstellen. ... {MATHE} \ : …

Inhalt6 Abschnitte
  1. 1. Grundformel und Bedeutung
  2. 2. Herleitung aus der bedingten Wahrscheinlichkeit
  3. 3. Interpretation und Anwendungsgebiete
  4. 4. Urnenversuch
  5. 5. Medizinischer Test und Prävalenzfehler
  6. 6. Bayessche Statistik und Erweiterung

Grundformel und Bedeutung

Der Satz von Bayes ist ein mathematischer Satz der Wahrscheinlichkeitstheorie. Er berechnet eine bedingte Wahrscheinlichkeit, wenn die umgekehrte bedingte Wahrscheinlichkeit, eine Ausgangswahrscheinlichkeit und die Wahrscheinlichkeit des beobachteten Ereignisses bekannt sind. Damit lässt sich eine Schlussfolgerung in gewissem Sinn umkehren: Aus P(B|A) wird die gesuchte Wahrscheinlichkeit P(A|B).

Für zwei Ereignisse A und B mit P(B)>0 gilt: P(A|B) = [P(B|A) · P(A)] / P(B).

Dabei bezeichnet P(A|B) die Wahrscheinlichkeit von A unter der Bedingung, dass B eingetreten ist. P(B|A) ist die Wahrscheinlichkeit von B unter der Bedingung, dass A eingetreten ist. P(A) und P(B) sind die jeweiligen A-priori-Wahrscheinlichkeiten, also Wahrscheinlichkeiten vor der zusätzlichen Beobachtung.

Für eine Zerlegung der Ergebnismenge in disjunkte Ereignisse Aᵢ, i=1,…,N, gilt: P(Aᵢ|B) = [P(B|Aᵢ) · P(Aᵢ)] / P(B) = [P(B|Aᵢ) · P(Aᵢ)] / [Σⱼ₌₁ᴺ P(B|Aⱼ) · P(Aⱼ)].

Die Umformung des Nenners wird Marginalisierung genannt. Für ein Ereignis A und sein Komplement Aᶜ ergibt sich insbesondere: P(A|B) = [P(B|A) · P(A)] / [P(B|A) · P(A) + P(B|Aᶜ) · P(Aᶜ)]. Der Satz gilt außerdem für abzählbar viele paarweise disjunkte Ereignisse, die den Grundraum Ω zerlegen.

Herleitung aus der bedingten Wahrscheinlichkeit

Der Satz folgt direkt aus der Definition der bedingten Wahrscheinlichkeit und der Schnittmenge A∩B: P(A|B) = P(A∩B) / P(B) = [(P(A∩B) / P(A)) · P(A)] / P(B) = [P(B|A) · P(A)] / P(B).

Für eine Zerlegung A₁,…,A_N gilt außerdem das Gesetz der totalen Wahrscheinlichkeit: P(B) = Σⱼ₌₁ᴺ P(Aⱼ∩B) = Σⱼ₌₁ᴺ P(B|Aⱼ) · P(Aⱼ).

Ein Wahrscheinlichkeits- oder Ereignisbaum macht diese Beziehungen anschaulich: Der Pfad A und anschließend B hat die Wahrscheinlichkeit P(A)·P(B|A)=P(A∩B). Die Bayes-Formel vergleicht anschließend den für A passenden Pfadanteil mit allen Pfadanteilen, die zum Ereignis B führen.

Interpretation und Anwendungsgebiete

Wichtig ist, dass P(B|A) und P(A|B) im Allgemeinen nicht gleich sind. Wer von der Wahrscheinlichkeit eines Testergebnisses bei Kranken direkt auf die Wahrscheinlichkeit einer Krankheit bei positiv Getesteten schließt, begeht einen Prävalenzfehler. Die A-priori-Wahrscheinlichkeit P(A) muss berücksichtigt werden. Beide bedingten Wahrscheinlichkeiten sind nur dann ungefähr gleich groß, wenn auch P(A) und P(B) ungefähr gleich groß sind. Außerdem beweisen bedingte Wahrscheinlichkeiten für sich allein keine Kausalbeziehung.

Entscheidungsbäume und Vierfeldertafeln helfen bei der Darstellung; das Verfahren wird auch Rückwärtsinduktion genannt. Der Satz wird unter anderem in folgenden Bereichen eingesetzt:

  • In der Statistik wird eine A-priori-Einschätzung aufgrund von Erfahrungen in eine A-posteriori-Verteilung überführt.
  • Im Data-Mining liefern Bayes-Klassifikatoren theoretische Entscheidungsregeln mit beweisbar minimaler Fehlerrate.
  • Bei der Spamerkennung werden charakteristische Wörter einer E-Mail genutzt, um die Wahrscheinlichkeit für Spam einzuschätzen.
  • In der künstlichen Intelligenz ermöglicht der Satz Schlussfolgerungen bei unsicherem Wissen sowie Hypothesenbildung und Lernen.
  • Weitere Anwendungen gibt es im Qualitätsmanagement, in der Entscheidungstheorie und Informationsökonomik, bei der Verkehrsverteilung, in der Bioinformatik, Kommunikationstheorie, Ökonometrie und den Neurowissenschaften.

Urnenversuch

In Urne A liegen sieben rote und drei weiße Kugeln, in Urne B eine rote und neun weiße Kugeln. Beide Urnen enthalten zehn Kugeln. Eine Urne wird zufällig ausgewählt, sodass P(A)=P(B)=1/2. Das Ereignis R bedeutet, dass die gezogene Kugel rot ist. Gesucht ist P(A|R), also die Wahrscheinlichkeit, dass eine rote Kugel aus Urne A stammt.

Es gilt: P(R|A)=7/10 und P(R|B)=1/10. Mit dem Gesetz der totalen Wahrscheinlichkeit erhält man: P(R) = (7/10)·(1/2) + (1/10)·(1/2) = 2/5.

Damit folgt: P(A|R) = [(7/10)·(1/2)]/(2/5) = 7/8 = 87,5 %.

Die Erklärung über Häufigkeiten ist ebenfalls anschaulich: Bei wiederholter Auswahl mit Zurücklegen entstehen im Durchschnitt acht rote und zwölf weiße Ziehungen je 20 Ziehungen. Von den acht roten Kugeln stammen sieben aus A und eine aus B. Daher beträgt der Anteil der roten Kugeln aus A 7/8.

Medizinischer Test und Prävalenzfehler

Eine Krankheit tritt mit einer Prävalenz von 20 pro 100 000 Personen auf. Für K, das Ereignis „eine Person trägt die Krankheit“, gilt P(K)=0,0002; für gesunde Personen gilt P(Kᶜ)=0,9998. Ein Test T zeigt die Krankheit bei Erkrankten mit 95 % Wahrscheinlichkeit an: P(T|K)=0,95. Bei Gesunden ist er mit Wahrscheinlichkeit 1 % falsch positiv: P(T|Kᶜ)=0,01. Die Spezifität beträgt deshalb 1−0,01=0,99.

Gesucht ist der positive prädiktive Wert P(K|T), also die Wahrscheinlichkeit, dass eine positiv getestete Person tatsächlich krank ist: P(K|T) = [0,95·0,0002] / [0,95·0,0002 + 0,01·0,9998] ≈ 0,0186.

Das entspricht etwa 1,86 %. Ein Ereignisbaum mit 100 000 Personen verdeutlicht das Ergebnis: 20 Personen sind tatsächlich krank, davon werden 19 richtig positiv und eine falsch negativ getestet. Von 99 980 gesunden Personen werden etwa 99 % richtig als gesund erkannt; ungefähr 1 %, also etwa 1000 Personen, erhalten ein falsch positives Ergebnis. Von insgesamt etwa 1019 positiv Getesteten sind somit nur 19 krank: P(K|T)≈19/1019≈0,0186.

Die hohe Sensitivität von 95 % bedeutet daher nicht, dass eine positiv getestete Person mit hoher Wahrscheinlichkeit krank ist. Bei sehr kleiner Prävalenz kann die Zahl falsch positiver Ergebnisse die Zahl tatsächlich Erkrankter deutlich übersteigen. Ein Massenscreening erscheint unter diesen Zahlenwerten daher wohl nicht sinnvoll, weil neben den Kosten für 100 000 Tests auch unnötige Ängste und möglicherweise Behandlungen entstehen.

Bayessche Statistik und Erweiterung

Die Bayessche Statistik verwendet den Satz von Bayes in der induktiven Statistik zur Schätzung von Parametern und zum Testen von Hypothesen. Ein unbekannter Umweltzustand ϑ, etwa ein Parameter einer Wahrscheinlichkeitsverteilung, soll anhand einer Beobachtung x einer Zufallsvariablen X geschätzt werden. Das Vorwissen wird durch eine A-priori-Wahrscheinlichkeitsverteilung von ϑ beschrieben. Je nach Auffassung kann sie subjektive Überzeugungen, allgemeines Vorwissen, eine aus Voruntersuchungen bekannte Verteilung oder eine objektive Verteilung bei angenommener Unkenntnis darstellen.

Die Verteilung von X unter der Bedingung ϑ=ϑ₀ wird als f(x|ϑ₀) bezeichnet und heißt Likelihood. Bei einer diskreten A-priori-Verteilung gilt: P(ϑ=ϑ₀|x) = [f(x|ϑ₀)·P(ϑ=ϑ₀)] / [Σ_{ϑ'∈Θ} f(x|ϑ')·P(ϑ=ϑ')]. Die A-posteriori-Verteilung verbindet Beobachtung und Vorwissen. Als Schätzwert wird in der subjektivistischen Statistik meist ihr Erwartungswert, manchmal ihr Modalwert verwendet.

Im Urnenbeispiel enthält eine Urne zehn Kugeln, deren Anzahl ϑ der roten Kugeln unbekannt ist. Alle Werte von 0 bis 10 gelten zunächst als gleich wahrscheinlich, also P(ϑ=ϑ₀)=1/11. Werden fünfmal Kugeln mit Zurücklegen gezogen und sind davon x rot, ist X unter ϑ=ϑ₀ binomialverteilt: f(x|ϑ₀)=C(5,x)·(ϑ₀/10)^x·(1−ϑ₀/10)^(5−x), für x∈{0,1,…,5}.

Für x=2 besitzt unter der A-posteriori-Verteilung ϑ=4 mit 0,207 die größte Wahrscheinlichkeit; der A-posteriori-Modus ist also 4. Der A-posteriori-Erwartungswert beträgt ungefähr 4,287. Zur Definition bedingter Wahrscheinlichkeitsdichten kann schließlich eine reguläre bedingte Verteilung verwendet werden. Ihre Dichte lautet: f_{Y|X}(y|x) := f(x,y)/f_X(x).

Lernvideos zu Satz von Bayes

Weiterlesen

Internationales Phonetisches Alphabet Das Internationale Phonetische Alphabet (kurz IPA) ist ein phonetisches Alphabet und somit eine Sammlung von Zeichen, mit deren Hilfe die Laute aller … Wahrscheinlichkeitstheorie Bedingte Wahrscheinlichkeit. Bearbeiten. Unter einer bedingten Wahrscheinlichkeit versteht man die Wahrscheinlichkeit für das Eintreten eines Ereignisses A … Bedingte Wahrscheinlichkeit Bedingte Wahrscheinlichkeit (auch konditionale Wahrscheinlichkeit) ist die Wahrscheinlichkeit des Eintretens eines Ereignisses A {\displaystyle A} … Thomas Bayes Nach ihm ist der Satz von Bayes benannt, der in der Wahrscheinlichkeitsrechnung große Bedeutung hat. Einzig bekanntes Porträt, das möglicherweise Bayes abbildet … Ereignis (Wahrscheinlichkeitstheorie) Ein Ereignis (auch Zufallsereignis) ist in der Wahrscheinlichkeitstheorie ein Teil einer Menge von Ergebnissen eines Zufallsexperiments, dem eine … Partition (Mengenlehre) Anders gesagt: Eine Partition einer Menge ist eine Zerlegung dieser Menge in nichtleere paarweise disjunkte Teilmengen. Insbesondere ist jede Partition einer … Entscheidungsbaum Entscheidungsbäume (englisch: decision tree) sind geordnete, gerichtete Bäume, die der Darstellung von Entscheidungsregeln dienen. Die grafische Darstellung … Fehlschluss Ein Fehlschluss beruht auf einem Irrtum in der Anwendung von Schlussregeln; er ist nach den Regeln einer formalen Logik nicht korrekt. Gelegentlich werden aber … Kausalität Kausalität (von lateinisch causa, „Ursache“, und causalis, „ursächlich, kausal“) ist die Beziehung zwischen Ursache und Wirkung. Sie betrifft die Abfolge … Bayessche Statistik Grundlagen sind der bayessche Wahrscheinlichkeitsbegriff und der Satz von Bayes. In der bayesschen Statistik drückt die Wahrscheinlichkeit den „Grad der … Data-Mining Andere Verfahren wie der EM-Algorithmus oder k-Means-Algorithmus bevorzugen sphärische Cluster. Objekte, die keinem Cluster zugeordnet wurden, können als … Bayes-Klassifikator Er ordnet jedes Objekt der Klasse zu, zu der es mit der größten Wahrscheinlichkeit gehört, oder bei der durch die Einordnung die wenigsten Kosten entstehen.