Wikipedia · einfach zusammengefasst · Stand
Bedingter Erwartungswert
Der bedingte Erwartungswert beschreibt in der Wahrscheinlichkeitstheorie und Statistik den Erwartungswert einer Zufallsvariablen unter der Voraussetzung, …
Inhalt6 Abschnitte
Grundidee und Bedeutung
Der bedingte Erwartungswert beschreibt, welchen Mittelwert man für eine Zufallsvariable erwartet, wenn zusätzliche Informationen über das Zufallsexperiment bekannt sind. Diese Information kann das Eintreten eines Ereignisses B, der beobachtete Wert einer weiteren Zufallsvariablen X oder allgemeiner eine Teil-σ-Algebra 𝓑 sein. Eine σ-Algebra fasst dabei die Ereignisse zusammen, über deren Eintreten man informiert ist.
Der bedingte Erwartungswert ist im Allgemeinen selbst eine Zufallsvariable. Er reduziert die ursprüngliche Information auf das, was anhand von 𝓑 erkennbar ist. Deshalb kann man ihn als Glättung einer Zufallsvariablen auf einer Teil-σ-Algebra verstehen. Der gewöhnliche Erwartungswert ist der Extremfall, bei dem die gesamte Information auf eine einzige Zahl reduziert wird.
Für ein Ereignis B mit P(B)>0 gilt E(Y|B) = E(1_B·Y)/P(B). Dabei ist 1_B die Indikatorfunktion: Sie hat auf B den Wert 1 und sonst den Wert 0. Analog lautet die bedingte Wahrscheinlichkeit P(A|B) = P(A∩B)/P(B). Beide Begriffe hängen eng zusammen, denn P(A|…) = E(1_A|…). Umgekehrt lassen sich bedingte Erwartungswerte durch Summen oder Integrale bezüglich bedingter Wahrscheinlichkeiten berechnen.
Man unterscheidet E(Y|X=x), also den Mittelwert bei einem bestimmten beobachteten Wert x, E(Y|X) als vom beobachteten X abhängige Zufallsvariable und E(Y|𝓑) bei gegebener Teil-σ-Algebra. Dabei entspricht dem Wissen über X die erzeugte σ-Algebra σ(X). Bedingte Erwartungswerte sind besonders für stochastische Prozesse wichtig und werden unter anderem zur Definition von Martingalen verwendet.
Diskrete Berechnung und totale Wahrscheinlichkeit
Im diskreten Fall, in dem P(X=x)>0 für jeden möglichen Wert x gilt, kann direkt mit der elementaren bedingten Wahrscheinlichkeit gerechnet werden: P(A|X=x) = P(A∩{X=x})/P(X=x). Die Abbildung P(·|X=x) ist dann ein Wahrscheinlichkeitsmaß und heißt reguläre bedingte Wahrscheinlichkeit. Ist auch Y diskret, so ergibt sich E(Y|X=x) = Σ_y yP(Y=y|X=x) = Σ_y y·P(X=x,Y=y)/P(X=x), wobei über alle möglichen Werte y von Y summiert wird.
Die totale Wahrscheinlichkeit zerlegt die Wahrscheinlichkeit eines Ereignisses A nach den Werten von X: P(A) = Σ_x P(X=x)P(A|X=x). Für B={X∈E} aus σ(X) gilt allgemeiner P(B∩A) = Σ_{x∈E} P(X=x)P(A|X=x) = ∫_B P(A|X)dP.
Beispiel: X und Y seien die Augenzahlen zweier unabhängiger Würfe mit einem regelmäßigen Würfel, Z=X+Y die Summe. Ist X=4 bekannt, nimmt Z die Werte 5 bis 10 jeweils mit Wahrscheinlichkeit 1/6 an. Daher gilt E(Z|X=4) = (1/6)(5+6+…+10) = 7,5. Für einen beliebigen Wert x erhält man E(Z|X=x)=x+3,5 und somit als Zufallsvariable E(Z|X)=X+3,5. Schon beim Bedingen auf das Ereignis, eine 5 oder 6 gewürfelt zu haben, ergibt sich für die Augenzahl Y eines einzelnen Würfels E(Y|B)=5,5.
Allgemeiner Fall und formale Definition
Im allgemeinen Fall können Ereignisse wie {X=x} die Wahrscheinlichkeit 0 besitzen. Dann ist eine punktweise Bedingung nicht eindeutig bestimmbar. Sind beispielsweise X und Y unabhängig und standardnormalverteilt und ist Z=2X+Y−3, so gilt gewöhnlich E(Z|X)=2X−3. Der Wert bei X=0 könnte jedoch verändert werden, ohne die gemeinsame Verteilung zu ändern, weil P(X=0)=0 ist. Bedingte Erwartungswerte sind deshalb nur bis auf Nullmengen eindeutig, also fast sicher.
Seien (Ω,𝓐,P) ein Wahrscheinlichkeitsraum, 𝓑⊆𝓐 eine Teil-σ-Algebra und X eine integrierbare Zufallsvariable. Eine Zufallsvariable Z ist ein bedingter Erwartungswert von X gegeben 𝓑, wenn
• Z 𝓑-messbar ist und • E(1_B Z)=E(1_B X) für alle B∈𝓑 gilt.
Man schreibt Z=E(X|𝓑). Die zweite Bedingung bedeutet gleichwertig ∫_B E(X|𝓑)dP = ∫_B XdP. Sie stellt sicher, dass der geglättete Wert auf jedem durch 𝓑 beschreibbaren Bereich denselben gewichteten Mittelwert wie X besitzt. Die Existenz für integrierbare Zufallsvariablen folgt aus dem Satz von Radon-Nikodým.
Die bedingte Wahrscheinlichkeit wird definiert durch P(A|𝓑)=E(1_A|𝓑). Im Allgemeinen muss P(·|𝓑)(ω) kein Wahrscheinlichkeitsmaß sein. Lassen sich die Versionen jedoch zu einem stochastischen Kern π zusammenfassen, spricht man von einer regulären bedingten Wahrscheinlichkeit. Dann ist E(X|𝓑)(ω)=∫π(ω;dω′)X(ω′). Solche regulären Versionen existieren insbesondere in Standard-Borel-Räumen.
Für mehrere Zufallsvariablen bedeutet E(X|X₁,…,Xₙ) das Bedingen auf σ(X₁,…,Xₙ). Es gibt eine messbare Funktion f mit E(X|X₁,…,Xₙ)(ω)=f(X₁(ω),…,Xₙ(ω)). Damit kann man formal E(X|X₁=x₁,…,Xₙ=xₙ)=f(x₁,…,xₙ) schreiben; bei Ereignissen mit Wahrscheinlichkeit 0 ist wegen der fehlenden punktweisen Eindeutigkeit Vorsicht nötig. Die Definition gilt außerdem für Bochner-integrierbare Zufallsvariablen mit Werten in einem Banachraum.
Spezialfälle und bedingte Dichten
Beim Bedingen auf die triviale σ-Algebra {∅,Ω} bleibt keine zusätzliche Information erhalten. Daher gilt konstant E(X|𝓑)=E(X) und P(A|𝓑)=P(A). Dasselbe gilt beim Bedingen auf eine konstante Zufallsvariable.
Ist X bereits 𝓑-messbar, ist sein Wert durch die vorhandene Information bekannt und E(X|𝓑)=X. Ist X dagegen von 𝓑 unabhängig, gilt E(X|𝓑)=E(X), und die bedingte Verteilung stimmt mit der unbedingten Verteilung überein.
Für eine einfache σ-Algebra und ein unteilbares Ereignis B∈𝓑 mit P(B)>0 nimmt P(A|𝓑) auf B den bekannten Wert P(A∩B)/P(B) an. Damit stimmt die allgemeine Definition mit der elementaren und der diskreten Definition überein.
Besitzen X und Y eine beschränkte gemeinsame Dichte f_{X,Y} auf (a,b)×(c,d), so kann eine bedingte Dichte durch f_{X|Y}(x,y) = f_{X,Y}(x,y) / ∫a^b f{X,Y}(u,y)du definiert werden. Dann gilt E(X|Y)=∫a^b x·f{X|Y}(x,Y)dx.
Zentrale Rechenregeln
Alle Gleichheiten für bedingte Erwartungswerte gelten im Allgemeinen nur fast sicher.
• Linearität: E(X₁+X₂|𝓑)=E(X₁|𝓑)+E(X₂|𝓑) und E(aX|𝓑)=aE(X|𝓑). • Bekannte Faktoren: Ist X 𝓑-messbar, dann E(XY|𝓑)=X·E(Y|𝓑). • Unabhängigkeit: Ist X unabhängig von 𝓑, dann E(X|𝓑)=E(X). Ist X außerdem von Y unabhängig, gilt E(XY|𝓑)=E(X)E(Y|𝓑). • Totaler Erwartungswert: E(E(X|𝓑))=E(X). • Turmeigenschaft: Für 𝓑₁⊂𝓑₂⊂𝓐 gilt E(E(X|𝓑₂)|𝓑₁)=E(X|𝓑₁). Auch E(E(X|𝓑₁)|𝓑₂)=E(X|𝓑₁). • Monotonie: Aus X₁≤X₂ folgt E(X₁|𝓑)≤E(X₂|𝓑). • Jensensche Ungleichung: Für eine konvexe Funktion f gilt f(E(X|𝓑))≤E(f(X)|𝓑).
Auch monotone und dominierte Konvergenz sowie das Lemma von Fatou besitzen bedingte Fassungen. Für Xₙ↑X gilt unter der angegebenen Endlichkeitsbedingung E(Xₙ|𝓑)↑E(X|𝓑). Aus Xₙ→X und |Xₙ|≤Y mit E(Y|𝓑)<∞ folgt E(Xₙ|𝓑)→E(X|𝓑).
Im Raum L²(P) ist E(X|𝓑) die orthogonale Projektion von X auf den Unterraum der 𝓑-messbaren Funktionen. Für 𝓑-messbares Y gilt E(Y(X−E(X|𝓑)))=0. Der bedingte Erwartungswert ist damit die beste Approximation von X durch eine anhand der gegebenen Information bestimmbare Funktion.
Die bedingte Varianz ist Var(X|𝓑)=E((X−E(X|𝓑))²|𝓑). Es gelten Var(X|𝓑)=E(X²|𝓑)−(E(X|𝓑))² und die Varianzzerlegung Var(X)=E(Var(X|𝓑))+Var(E(X|𝓑)). Für auf- oder absteigende Folgen von Teil-σ-Algebren konvergieren die entsprechenden bedingten Erwartungswerte gemäß dem angegebenen Martingalkonvergenzsatz gegen den bedingten Erwartungswert bezüglich der erzeugten beziehungsweise geschnittenen σ-Algebra.
Typische Anwendungen
Beim Beispiel mit zwei unabhängigen Würfen lässt sich das Ergebnis ohne vollständige Verteilungsrechnung gewinnen: E(Z|X)=E(X+Y|X)=E(X|X)+E(Y|X)=X+E(Y)=X+3,5. Hier werden Linearität, das Herausziehen bekannter Größen und die Unabhängigkeit von Y und X benutzt.
Sind X und Y unabhängig und Poisson-verteilt mit Parametern λ und μ, dann ist die bedingte Verteilung von X unter der Bedingung X+Y=n eine Binomialverteilung mit den Parametern n und p=λ/(λ+μ): P(X=k|X+Y=n) = (n über k)p^k(1−p)^{n−k} für k=0,…,n, sonst 0. Daraus folgen E(X|X+Y=n)=np=λn/(λ+μ) und als Zufallsvariable E(X|X+Y)=λ/(λ+μ).