Wikipedia · einfach zusammengefasst · Stand
Randverteilung
Außerdem kann man die Randverteilung sowohl für absolute Häufigkeiten als auch für relative Häufigkeiten bilden. Die einzelnen Werte der Randverteilung …
Inhalt6 Abschnitte
Grundidee und praktische Bedeutung
Randverteilungen, auch Marginalverteilungen genannt, sind die Wahrscheinlichkeitsverteilungen einzelner Zufallsvariablen oder von Teilfamilien aus einer gemeinsamen Verteilung. Die gemeinsame Verteilung beschreibt die gesamte Familie von Zufallsvariablen. Für zwei Zufallsvariablen X und Y sind die Verteilungen von X und Y die Randverteilungen des Zufallsvektors (X,Y).
Randverteilungen können für diskrete und stetige Merkmale sowie für absolute und relative Häufigkeiten gebildet werden. Die einzelnen Werte heißen Randhäufigkeiten, Marginalhäufigkeiten oder marginale Häufigkeiten.
Bei kategorialen Merkmalen lassen sich Randhäufigkeiten am Rand einer Kontingenztafel ablesen. Sie entstehen, indem man über das jeweils nicht betrachtete Merkmal summiert. In einer Tabelle mit den Klassen 10 und 11 sowie den Merkmalen Mann und Frau ergeben sich für Klasse 10 die Häufigkeiten 10 und 10 und damit die Randhäufigkeit 20. Für Klasse 11 ergeben sich 4 und 16 und ebenfalls die Randhäufigkeit 20. Insgesamt gibt es 14 Männer, 26 Frauen und 40 Schüler. Die Randverteilung des Merkmals Klasse ist daher gleichverteilt, weil beide Klassen gleich viele Schüler enthalten.
Relative Randhäufigkeiten sind gemäß der frequentistischen Interpretation Schätzer für Randwahrscheinlichkeiten. Stetige Merkmale wie Körpergröße haben fließende Übergänge und können nicht unmittelbar in einer Kontingenztafel dargestellt werden. Durch Klassengrenzen, etwa 142 cm, kann man sie in disjunkte Kategorien einteilen: größer als 142 cm und nicht größer als 142 cm.
Mathematische Definition
Gegeben sei eine Ω₁ × ⋯ × Ωₙ-wertige Zufallsvariable Z=(X₁,…,Xₙ) mit der multivariaten Verteilung P_Z als Wahrscheinlichkeitsmaß. Die i-te Randverteilung ist für eine Menge A definiert durch
P_{Xᵢ}(A) := P_Z(Ω₁ × ⋯ × Ωᵢ₋₁ × A × Ωᵢ₊₁ × ⋯ × Ωₙ).
Gleichwertig gilt:
P_{Xᵢ}(A) = P(X₁∈Ω₁,…,Xᵢ₋₁∈Ωᵢ₋₁,Xᵢ∈A,Xᵢ₊₁∈Ωᵢ₊₁,…,Xₙ∈Ωₙ).
Alle Koordinaten außer der i-ten werden also auf ihren gesamten Wertebereich gesetzt. Für Z=(X,Y) lautet die erste Randverteilung beispielsweise P_X(A)=P_Z(A×Ω₂) beziehungsweise P_X(A)=P(X∈A,Y∈Ω₂).
Allgemeiner kann man eine Teilmenge J⊆I={1,…,n} betrachten. Ist |J|=m, erhält man eine m-dimensionale Randverteilung. Dabei bleiben die Koordinaten aus J erhalten, während alle anderen Koordinaten über ihre gesamten Wertebereiche berücksichtigt werden.
Eigenschaften und Dimensionen
Für eine n-dimensionale Zufallsvariable gibt es genau (n über m) m-dimensionale Randverteilungen. Maßtheoretisch sind Randverteilungen Bildmaße unter Projektionen auf eine oder mehrere Koordinaten.
Sind X₁,…,Xₙ stochastisch unabhängige Zufallsvariablen, dann ist ihre gemeinsame Verteilung genau das Produkt ihrer eindimensionalen Randverteilungen. Im Allgemeinen enthalten die Randverteilungen allein jedoch nicht die vollständige Information über die Abhängigkeiten zwischen den Variablen.
Randverteilungen können eindimensional oder mehrdimensional sein. Bei einer mehrdimensionalen Randverteilung werden nur die ausgewählten Komponenten gemeinsam betrachtet; alle übrigen Komponenten werden vernachlässigt beziehungsweise ausintegriert oder aufsummiert.
Rand-Verteilungsfunktion
Besitzt Z die Verteilungsfunktion F_Z: ℝⁿ→[0,1], erhält man die Rand-Verteilungsfunktion einer einzelnen Komponente, indem alle anderen Komponenten auf unendlich gesetzt werden:
F_{Xᵢ}(xᵢ)=F_Z(∞,…,∞,xᵢ,∞,…,∞).
Für eine m-dimensionale Rand-Verteilungsfunktion bleiben die Komponenten aus der ausgewählten Indexmenge J erhalten; alle anderen werden auf unendlich gesetzt. Im zweidimensionalen Fall Z=(X,Y) gilt für die erste Rand-Verteilungsfunktion:
F_X(x)=F_Z(x,∞).
Die Rand-Verteilungsfunktion beschreibt damit die Verteilung einer ausgewählten Zufallsvariablen, unabhängig davon, welche Werte die übrigen Variablen annehmen.
Randdichten und Rand-Wahrscheinlichkeitsfunktionen
Für stetige Zufallsvariablen heißen die Dichten der Randverteilungen Randdichten. Ist f_{Xᵢ} die Randdichte von Xᵢ, gilt
F_{Xᵢ}(xᵢ)=∫{−∞}^{xᵢ} f{Xᵢ}(t) dt.
Besitzt Z die gemeinsame Dichte f_Z(x₁,…,xₙ), erhält man f_{Xᵢ}, indem man über alle Komponenten außer xᵢ integriert. Für Z=(X,Y) gilt:
f_X(x)=∫_{−∞}^{∞} f_Z(x,y) dy,
f_Y(y)=∫_{−∞}^{∞} f_Z(x,y) dx.
Bei diskreten Zufallsvariablen wird anstelle der Integration summiert. Für die i-te Rand-Wahrscheinlichkeitsfunktion gilt:
f_{Xᵢ}(xᵢ)=Σ_{j≠i, xⱼ∈ℤ} f_Z(x₁,…,xₙ).
Die betrachtete Komponente wird dabei nicht mitsummiert. Im zweidimensionalen Fall ergeben sich:
f_X(xᵢ)=Σ_{k∈K} f_Z(xᵢ,y_k),
f_Y(y_k)=Σ_{i∈I} f_Z(x_i,y_k).
Beispiel: Multinomialverteilung und Abhängigkeiten
Sei Z=(X,Y) zweidimensional multinomialverteilt, also Z∼M(n,(p,1−p)). Die gemeinsame Wahrscheinlichkeitsfunktion lautet
f_Z(x,y) = { n über x,y · pˣ(1−p)ʸ, wenn x+y=n; 0 sonst }.
Setzt man y=n−x, folgt:
f_Z(x,y) = { n über x · pˣ(1−p)ⁿ⁻ˣ }.
Die Randverteilung von X entsteht durch Aufsummieren über y und ist eine Binomialverteilung mit den Parametern n und p:
f_X(x) = { n über x · pˣ(1−p)ⁿ⁻ˣ }.
Allgemein sei Z=(X₁,…,Xₘ) multinomialverteilt mit Z∼M(n,(p₁,…,pₘ)) und p₁+⋯+pₘ=1. Die Wahrscheinlichkeitsfunktion ist
f_Z(x₁,…,xₘ) = { {n über x₁,…,xₘ} p₁ˣ¹⋯pₘˣᵐ, wenn x₁,…,xₘ∈ℕ₀ und x₁+⋯+xₘ=n; 0 sonst }.
Zur Berechnung der ersten Randverteilung summiert man über x₂,…,xₘ, fasst p₂+⋯+pₘ zu 1−p₁ zusammen und verwendet das Multinomialtheorem. Die Randverteilung ist wieder binomialverteilt mit den Parametern n und p₁.
In Anwendungen werden Randverteilungen und Abhängigkeiten häufig getrennt modelliert. Randverteilungen und Korrelation beschreiben eine multivariate Verteilung nicht immer vollständig; die Abhängigkeit muss gegebenenfalls genauer modelliert werden. Dazu kann die Kalibrierung einer Copula dienen. Außerdem lässt sich mithilfe von Randverteilungen aus einer multivariaten Verteilung die bedingte Verteilung bestimmen, die zusätzliches Wissen über den Wert einer Zufallsvariablen berücksichtigt.