Zum Inhalt springen
L

Wikipedia · einfach zusammengefasst · Stand

Randverteilung

Außerdem kann man die Randverteilung sowohl für absolute Häufigkeiten als auch für relative Häufigkeiten bilden. Die einzelnen Werte der Randverteilung …

Inhalt6 Abschnitte
  1. 1. Grundidee und praktische Bedeutung
  2. 2. Mathematische Definition
  3. 3. Eigenschaften und Dimensionen
  4. 4. Rand-Verteilungsfunktion
  5. 5. Randdichten und Rand-Wahrscheinlichkeitsfunktionen
  6. 6. Beispiel: Multinomialverteilung und Abhängigkeiten

Grundidee und praktische Bedeutung

Randverteilungen, auch Marginalverteilungen genannt, sind die Wahrscheinlichkeitsverteilungen einzelner Zufallsvariablen oder von Teilfamilien aus einer gemeinsamen Verteilung. Die gemeinsame Verteilung beschreibt die gesamte Familie von Zufallsvariablen. Für zwei Zufallsvariablen X und Y sind die Verteilungen von X und Y die Randverteilungen des Zufallsvektors (X,Y).

Randverteilungen können für diskrete und stetige Merkmale sowie für absolute und relative Häufigkeiten gebildet werden. Die einzelnen Werte heißen Randhäufigkeiten, Marginalhäufigkeiten oder marginale Häufigkeiten.

Bei kategorialen Merkmalen lassen sich Randhäufigkeiten am Rand einer Kontingenztafel ablesen. Sie entstehen, indem man über das jeweils nicht betrachtete Merkmal summiert. In einer Tabelle mit den Klassen 10 und 11 sowie den Merkmalen Mann und Frau ergeben sich für Klasse 10 die Häufigkeiten 10 und 10 und damit die Randhäufigkeit 20. Für Klasse 11 ergeben sich 4 und 16 und ebenfalls die Randhäufigkeit 20. Insgesamt gibt es 14 Männer, 26 Frauen und 40 Schüler. Die Randverteilung des Merkmals Klasse ist daher gleichverteilt, weil beide Klassen gleich viele Schüler enthalten.

Relative Randhäufigkeiten sind gemäß der frequentistischen Interpretation Schätzer für Randwahrscheinlichkeiten. Stetige Merkmale wie Körpergröße haben fließende Übergänge und können nicht unmittelbar in einer Kontingenztafel dargestellt werden. Durch Klassengrenzen, etwa 142 cm, kann man sie in disjunkte Kategorien einteilen: größer als 142 cm und nicht größer als 142 cm.

Mathematische Definition

Gegeben sei eine Ω₁ × ⋯ × Ωₙ-wertige Zufallsvariable Z=(X₁,…,Xₙ) mit der multivariaten Verteilung P_Z als Wahrscheinlichkeitsmaß. Die i-te Randverteilung ist für eine Menge A definiert durch

P_{Xᵢ}(A) := P_Z(Ω₁ × ⋯ × Ωᵢ₋₁ × A × Ωᵢ₊₁ × ⋯ × Ωₙ).

Gleichwertig gilt:

P_{Xᵢ}(A) = P(X₁∈Ω₁,…,Xᵢ₋₁∈Ωᵢ₋₁,Xᵢ∈A,Xᵢ₊₁∈Ωᵢ₊₁,…,Xₙ∈Ωₙ).

Alle Koordinaten außer der i-ten werden also auf ihren gesamten Wertebereich gesetzt. Für Z=(X,Y) lautet die erste Randverteilung beispielsweise P_X(A)=P_Z(A×Ω₂) beziehungsweise P_X(A)=P(X∈A,Y∈Ω₂).

Allgemeiner kann man eine Teilmenge J⊆I={1,…,n} betrachten. Ist |J|=m, erhält man eine m-dimensionale Randverteilung. Dabei bleiben die Koordinaten aus J erhalten, während alle anderen Koordinaten über ihre gesamten Wertebereiche berücksichtigt werden.

Eigenschaften und Dimensionen

Für eine n-dimensionale Zufallsvariable gibt es genau (n über m) m-dimensionale Randverteilungen. Maßtheoretisch sind Randverteilungen Bildmaße unter Projektionen auf eine oder mehrere Koordinaten.

Sind X₁,…,Xₙ stochastisch unabhängige Zufallsvariablen, dann ist ihre gemeinsame Verteilung genau das Produkt ihrer eindimensionalen Randverteilungen. Im Allgemeinen enthalten die Randverteilungen allein jedoch nicht die vollständige Information über die Abhängigkeiten zwischen den Variablen.

Randverteilungen können eindimensional oder mehrdimensional sein. Bei einer mehrdimensionalen Randverteilung werden nur die ausgewählten Komponenten gemeinsam betrachtet; alle übrigen Komponenten werden vernachlässigt beziehungsweise ausintegriert oder aufsummiert.

Rand-Verteilungsfunktion

Besitzt Z die Verteilungsfunktion F_Z: ℝⁿ→[0,1], erhält man die Rand-Verteilungsfunktion einer einzelnen Komponente, indem alle anderen Komponenten auf unendlich gesetzt werden:

F_{Xᵢ}(xᵢ)=F_Z(∞,…,∞,xᵢ,∞,…,∞).

Für eine m-dimensionale Rand-Verteilungsfunktion bleiben die Komponenten aus der ausgewählten Indexmenge J erhalten; alle anderen werden auf unendlich gesetzt. Im zweidimensionalen Fall Z=(X,Y) gilt für die erste Rand-Verteilungsfunktion:

F_X(x)=F_Z(x,∞).

Die Rand-Verteilungsfunktion beschreibt damit die Verteilung einer ausgewählten Zufallsvariablen, unabhängig davon, welche Werte die übrigen Variablen annehmen.

Randdichten und Rand-Wahrscheinlichkeitsfunktionen

Für stetige Zufallsvariablen heißen die Dichten der Randverteilungen Randdichten. Ist f_{Xᵢ} die Randdichte von Xᵢ, gilt

F_{Xᵢ}(xᵢ)=∫{−∞}^{xᵢ} f{Xᵢ}(t) dt.

Besitzt Z die gemeinsame Dichte f_Z(x₁,…,xₙ), erhält man f_{Xᵢ}, indem man über alle Komponenten außer xᵢ integriert. Für Z=(X,Y) gilt:

f_X(x)=∫_{−∞}^{∞} f_Z(x,y) dy,

f_Y(y)=∫_{−∞}^{∞} f_Z(x,y) dx.

Bei diskreten Zufallsvariablen wird anstelle der Integration summiert. Für die i-te Rand-Wahrscheinlichkeitsfunktion gilt:

f_{Xᵢ}(xᵢ)=Σ_{j≠i, xⱼ∈ℤ} f_Z(x₁,…,xₙ).

Die betrachtete Komponente wird dabei nicht mitsummiert. Im zweidimensionalen Fall ergeben sich:

f_X(xᵢ)=Σ_{k∈K} f_Z(xᵢ,y_k),

f_Y(y_k)=Σ_{i∈I} f_Z(x_i,y_k).

Beispiel: Multinomialverteilung und Abhängigkeiten

Sei Z=(X,Y) zweidimensional multinomialverteilt, also Z∼M(n,(p,1−p)). Die gemeinsame Wahrscheinlichkeitsfunktion lautet

f_Z(x,y) = { n über x,y · pˣ(1−p)ʸ, wenn x+y=n; 0 sonst }.

Setzt man y=n−x, folgt:

f_Z(x,y) = { n über x · pˣ(1−p)ⁿ⁻ˣ }.

Die Randverteilung von X entsteht durch Aufsummieren über y und ist eine Binomialverteilung mit den Parametern n und p:

f_X(x) = { n über x · pˣ(1−p)ⁿ⁻ˣ }.

Allgemein sei Z=(X₁,…,Xₘ) multinomialverteilt mit Z∼M(n,(p₁,…,pₘ)) und p₁+⋯+pₘ=1. Die Wahrscheinlichkeitsfunktion ist

f_Z(x₁,…,xₘ) = { {n über x₁,…,xₘ} p₁ˣ¹⋯pₘˣᵐ, wenn x₁,…,xₘ∈ℕ₀ und x₁+⋯+xₘ=n; 0 sonst }.

Zur Berechnung der ersten Randverteilung summiert man über x₂,…,xₘ, fasst p₂+⋯+pₘ zu 1−p₁ zusammen und verwendet das Multinomialtheorem. Die Randverteilung ist wieder binomialverteilt mit den Parametern n und p₁.

In Anwendungen werden Randverteilungen und Abhängigkeiten häufig getrennt modelliert. Randverteilungen und Korrelation beschreiben eine multivariate Verteilung nicht immer vollständig; die Abhängigkeit muss gegebenenfalls genauer modelliert werden. Dazu kann die Kalibrierung einer Copula dienen. Außerdem lässt sich mithilfe von Randverteilungen aus einer multivariaten Verteilung die bedingte Verteilung bestimmen, die zusätzliches Wissen über den Wert einer Zufallsvariablen berücksichtigt.

Weiterlesen

Stochastik Statistik · Daten, Stichprobe, Grundgesamtheit, Häufigkeit (absolute, relative), Merkmal, Merkmalsausprägung · Häufigkeitsverteilung, Stabdiagramm, Kreisdiagramm, … Zufallsvariable Beispiele für reelle Zufallsvariablen sind die Augensumme von zwei geworfenen Würfeln und die Gewinnhöhe in einem Glücksspiel. Zufallsvariablen können aber auch … Wahrscheinlichkeitsraum Ein Wahrscheinlichkeitsraum, kurz W-Raum, ist ein grundlegender Begriff aus dem mathematischen Teilgebiet der Wahrscheinlichkeitstheorie. Stetige Funktion In der Mathematik ist eine stetige Abbildung oder stetige Funktion eine Funktion, bei der hinreichend kleine Änderungen des Arguments nur beliebig kleine … Absolute Häufigkeit Die absolute Häufigkeit ist das Ergebnis einer einfachen Zählung von Objekten oder Ereignissen (besser Elementarereignissen). Sie gibt an, wie viele Elemente … Relative Häufigkeit Sie wird berechnet, indem die absolute Häufigkeit eines Merkmals in einer zugrundeliegenden Menge durch die Anzahl der Objekte in dieser Menge geteilt wird. Die … Kontingenztafel Kontingenztafeln (auch: Kontingenztabellen oder Kreuztabellen) sind Tabellen, die die absoluten oder relativen Häufigkeiten (Häufigkeitstabellen) von … Klasseneinteilung (Statistik) Quartile. Das 1. Quartil liegt in der 2. Klasse, also: 200 < 1. Quartil ≤ 300. Das 2. Quartil = Median liegt in der 3. Klasse, also: 300 < 2. Quartil ≤ 400. Wahrscheinlichkeitsmaß Ein Wahrscheinlichkeitsmaß dient dazu, den Begriff der Wahrscheinlichkeit zu quantifizieren und Ereignissen, die durch Mengen modelliert werden, eine Zahl … Stochastisch unabhängige Zufallsvariablen Die stochastische Unabhängigkeit von Zufallsvariablen wird beispielsweise bei der Formulierung des Zentralen Grenzwertsatzes benötigt. Verteilungsfunktion Die Verteilungsfunktion ist eine spezielle reelle Funktion in der Stochastik und ein zentrales Konzept bei der Untersuchung von … Wahrscheinlichkeitsfunktion Eine Wahrscheinlichkeitsfunktion, auch Zähldichte genannt, ist eine spezielle reellwertige Funktion in der Stochastik. Wahrscheinlichkeitsfunktionen werden …