Zum Inhalt springen
L

Wikipedia · einfach zusammengefasst · Stand

Chi-Quadrat-Verteilung

Die Chi-Quadrat-Verteilung ermöglicht damit unter anderem ein Urteil über die Kompatibilität eines vermuteten funktionalen Zusammenhangs (Abhängigkeit von der …

Inhalt6 Abschnitte
  1. 1. Grundidee und Definition
  2. 2. Dichte, Verteilung und wichtigste Eigenschaften
  3. 3. Nichtzentrale Chi-Quadrat-Verteilung
  4. 4. Stichprobenvarianz und Konfidenzintervall
  5. 5. Beziehungen zu anderen Verteilungen
  6. 6. Herleitung und Quantile

Grundidee und Definition

Die Chi-Quadrat-Verteilung (χ²-Verteilung) ist eine stetige Wahrscheinlichkeitsverteilung über den nichtnegativen reellen Zahlen. Die zentrale Chi-Quadrat-Verteilung besitzt einen Parameter: die Anzahl der Freiheitsgrade n.

Sind Z₁,…,Zₙ unabhängige, standardnormalverteilte Zufallsvariablen, dann ist die Summe ihrer Quadrate chi-quadrat-verteilt:

X = Z₁² + ⋯ + Zₙ², X ∼ χ²ₙ bzw. X ∼ χ²(n).

Die Verteilung ist wichtig, weil Summen quadrierter Abweichungen unter anderem bei der Stichprobenvarianz auftreten. Mit ihr lassen sich zufällige Schwankungen quantifizieren, Modelle anhand ihrer Anpassungsgüte vergleichen und Vertrauensintervalle für die unbekannte Varianz einer Grundgesamtheit bestimmen. Bei mehreren Erklärungsmodellen gilt ein kleinerer Chi-Quadrat-Wert als Hinweis auf eine bessere Anpassung der Daten.

Dichte, Verteilung und wichtigste Eigenschaften

Für x < 0 ist die Dichte fₙ(x) = 0. Für x > 0 lautet sie

fₙ(x) = [1/(2ⁿᐟ² Γ(n/2))] xⁿᐟ²⁻¹ exp(−x/2),

wobei Γ die Gammafunktion bezeichnet. Für ihre Berechnung gelten Γ(1/2) = √π, Γ(1) = 1 und Γ(x+1) = x·Γ(x) für x ∈ ℝ⁺. Bei n = 2 gilt f₂(x) = ½ exp(−x/2).

Die Verteilungsfunktion wird mit der regularisierten unvollständigen Gammafunktion P ausgedrückt:

Fₙ(x) = P(n/2, x/2).

Für n = 2 vereinfacht sie sich zu F₂(x) = 1 − exp(−x/2) für x > 0. Für natürliche n gibt es getrennte Darstellungen mit der Fehlerfunktion erf, je nachdem, ob n gerade oder ungerade ist.

Die Chi-Quadrat-Verteilung ist reproduktiv: Sind X ∼ χ²ₘ und Y ∼ χ²ₙ und entstehen beide aus unabhängigen standardnormalverteilten Zufallsvariablen, dann gilt X + Y ∼ χ²ₘ₊ₙ.

Für n Freiheitsgrade gelten

E(χ²ₙ) = n und Var(χ²ₙ) = 2n.

Für n ≥ 3 liegt der Modus bei n − 2. Bei einem oder zwei Freiheitsgraden ist die Dichte monoton fallend; ihr Supremum wird auf (0, ∞) nicht angenommen. Deshalb wird teils auch der Modus 0 angegeben.

Die Schiefe beträgt γₘ(χ²ₙ) = 2√2/√n. Sie ist positiv, die Verteilung ist also rechtsschief; mit wachsendem n nimmt die Schiefe ab. Die Kurtosis ist β₂ = 3 + 12/n, der Exzess gegenüber der Normalverteilung γ₂ = 12/n. Auch der Exzess sinkt bei größerem n.

Die momenterzeugende Funktion lautet Mₓ(t) = 1/(1−2t)ⁿᐟ², die charakteristische Funktion φₓ(s) = 1/(1−2is)ⁿᐟ². Die Entropie in Nats ist H(X) = ln(2Γ(n/2)) + (1−n/2)ψ(n/2) + n/2, wobei ψ die Digamma-Funktion bezeichnet.

Nichtzentrale Chi-Quadrat-Verteilung

Sind die normalverteilten Zufallsvariablen nicht auf den Erwartungswert 0 zentriert, entsteht die nichtzentrale Chi-Quadrat-Verteilung. Sie besitzt neben n den Nichtzentralitätsparameter λ > 0.

Für Zᵢ ∼ 𝒩(μᵢ, 1), i = 1,…,n, gilt

∑ᵢ₌₁ⁿ Zᵢ² ∼ χ²(n, λ), λ = ∑ᵢ₌₁ⁿ μᵢ².

Außerdem folgt aus X ∼ χ²(n−1) und Z ∼ 𝒩(√λ, 1), dass X + Z² ∼ χ²(n, λ). Eine weitere Erzeugungsmöglichkeit ist eine Mischverteilung zentraler Chi-Quadrat-Verteilungen: χ²(n+2j) = χ²(n, λ), wenn j ∼ 𝒫(λ/2) aus einer Poisson-Verteilung gezogen wird.

Die Dichte ist für x < 0 null. Für x ≥ 0 gilt

f(x) = [exp(−(x+λ)/2)/2ⁿᐟ²] · ∑ⱼ₌₀∞ [xⁿᐟ²⁺ʲ⁻¹ λʲ/(2²ʲ Γ(n/2+j)j!)].

Diese Summe kann mithilfe der modifizierten Bessel-Funktion erster Gattung I_q(x) umgeschrieben werden. Der Erwartungswert ist n + λ, die Varianz 2n + 4λ. Für λ → 0 gehen Dichte, Erwartungswert und Varianz in die entsprechenden Ausdrücke der zentralen Chi-Quadrat-Verteilung über. Die Verteilungsfunktion lautet F(x) = 1 − Qₙᐟ₂(√λ, √x), wobei Q_M die Marcum-Q-Funktion ist.

Stichprobenvarianz und Konfidenzintervall

Für n Messwerte x₁,…,xₙ aus einer normalverteilten Grundgesamtheit mit Varianz σ² seien der empirische Mittelwert x̄ = (1/n)∑ᵢ₌₁ⁿ xᵢ und die korrigierte Stichprobenvarianz s² = [1/(n−1)]∑ᵢ₌₁ⁿ(xᵢ−x̄)². Dann gilt

[(n−1)s²]/σ² ∼ χ²ₙ₋₁.

Der Grund für n−1 Freiheitsgrade ist, dass die Abweichungen vom empirischen Mittelwert die Bedingung ∑ᵢ₌₁ⁿ(xᵢ−x̄) = 0 erfüllen. Ist n−1 Abweichungen bekannt, ist die letzte bereits festgelegt. Nur n−1 Abweichungen können daher frei variieren.

Die Beziehung ermöglicht ein Konfidenzintervall für die Varianz σ²:

[(n−1)/χ²_b]s² ≤ σ² ≤ [(n−1)/χ²_a]s².

Dabei sind χ²_b und χ²_a so gewählt, dass Fₙ₋₁(χ²_b) = 0,975 und Fₙ₋₁(χ²_a) = 0,025 für ein 95-%-Konfidenzintervall gilt.

Beispiel: Für n = 100 und s² = 1,0 ergeben sich mit der inversen kumulierten Chi-Quadrat-Verteilung, etwa CHIINV(p, n−1), die Grenzen

99 · s² / CHIINV(0,025; 99) = 0,7709

und

99 · s² / CHIINV(0,975; 99) = 1,3495.

Das 95-%-Konfidenzintervall reicht somit von 0,7709 bis 1,3495.

Beziehungen zu anderen Verteilungen

Die Chi-Quadrat-Verteilung ist ein Spezialfall der Gammaverteilung: Aus X ∼ χ²ₙ folgt X ∼ 𝒢(n/2, 1/2).

Eine Chi-Quadrat-Verteilung mit 2 Freiheitsgraden ist eine Exponentialverteilung Exp(λ) mit λ = 1/2. Eine Chi-Quadrat-Verteilung mit 2n Freiheitsgraden ist identisch mit einer Erlang-Verteilung Erl(λ, n) mit λ = 1/2.

Sind X₁ und X₂ unabhängig chi-quadrat-verteilt mit r₁ beziehungsweise r₂ Freiheitsgraden, dann ist

(X₁/r₁)/(X₂/r₂)

F-verteilt mit r₁ Zählerfreiheitsgraden und r₂ Nennerfreiheitsgraden.

Zur Normalverteilung besteht die grundlegende Beziehung über die Quadratsumme standardnormalverteilter Variablen. Für n ≥ 30 ist Y = √(2X) − √(2n−1) näherungsweise standardnormalverteilt. Für n > 100 ist X näherungsweise normalverteilt mit Erwartungswert n und Standardabweichung √(2n). Bei der nichtzentralen Verteilung lauten diese Werte n + λ und √(2n + 4λ).

Zur Poisson-Verteilung gilt: Die Wahrscheinlichkeit, n oder mehr Ereignisse bei einer mittleren Ereigniszahl λ zu beobachten, entspricht der Wahrscheinlichkeit χ²₂ₙ ≤ 2λ. Außerdem gilt 1 − Q(n, λ) = P(n, λ), wobei P und Q regularisierte Gammafunktionen sind.

Ist U gleichverteilt auf [0,1], dann gilt −2 ln(U) ∼ χ²(2). Für unabhängige U₁,…,Uₘ ∼ 𝒰(0,1) folgt daher −2∑ₖ₌₁ᵐ ln(Uₖ) ∼ χ²(2m).

Herleitung und Quantile

Zur Herleitung der Dichte betrachtet man X = Z₁² + ⋯ + Zₙ². Die gemeinsame Dichte der unabhängigen standardnormalverteilten Variablen ist (2π)⁻ⁿᐟ² exp[−(z₁²+⋯+zₙ²)/2]. Die Menge K = {x ≤ z₁²+⋯+zₙ² ≤ x+h} liegt zwischen zwei n-dimensionalen Kugeln mit Radien √(x+h) und √x. Ihr Volumenunterschied ist Vₙ(√(x+h)) − Vₙ(√x), wobei Vₙ(R) = πⁿᐟ²Rⁿ/Γ(n/2+1). Ableiten nach x und Einsetzen in die gemeinsame Dichte liefert die Dichte der Chi-Quadrat-Verteilung.

Das p-Quantil x_p erfüllt p = P(n/2, x_p/2). Daher gilt x_p = 2P⁻¹(n/2, p), wobei P⁻¹ die Inverse der regularisierten unvollständigen Gammafunktion ist. Für n = 1, 2 und 4 gibt es spezielle Formen:

n = 1: x_p = 2(Erf⁻¹(p))²;

n = 2: x_p = −2 ln(1−p);

n = 4: x_p = −2(1 + W₋₁(−(1−p)/e)),

wobei Erf die Fehlerfunktion und W₋₁ den unteren Zweig der Lambert-W-Funktion bezeichnet.

Für feste Wahrscheinlichkeiten kann man die Quantile mit

x_p ≈ n + a√(n + sgn(a)√n) + b + c/n

annähern. Die Parameter a, b und c hängen von p ab. Für p = 0,025 gelten beispielsweise a = −2,787, b = 0,6 und c = −0,69; für p = 0,975 gelten a = 2,78, b = 0,43 und c = −0,4. Der relative Fehler liegt ab n > 3 unter 0,4 % und ab n > 10 unter 0,1 %. Der Median entspricht p = 0,5.

Weiterlesen

Reelle Zahl Die reellen Zahlen bilden einen in der Mathematik bedeutenden Zahlenbereich. Er ist eine Erweiterung des Bereichs der rationalen Zahlen, womit die Maßzahlen … Normalverteilung Ihre Wahrscheinlichkeitsdichtefunktion wird auch Gauß-Funktion, gaußsche Normalverteilung, gaußsche Verteilungskurve, Gauß-Kurve, gaußsche Glockenkurve … Zufallsvariable Beispiele für reelle Zufallsvariablen sind die Augensumme von zwei geworfenen Würfeln und die Gewinnhöhe in einem Glücksspiel. Zufallsvariablen können aber auch … Schätzfunktion Schätzfunktionen sind die Basis zur Berechnung von Punktschätzungen und zur Bestimmung von Konfidenzintervallen mittels Bereichsschätzern und werden als … Empirische Varianz Die Wurzel der empirischen Varianz ist die empirische Standardabweichung. Die empirische Standardabweichung stellt das gebräuchlichste Streuungsmaß dar. Sie ist … Chi-Quadrat-Test Chi-Quadrat-Test · Verteilungstest (auch Anpassungstest genannt): Hier wird geprüft, ob vorliegende Daten auf eine bestimmte Weise verteilt sind. Stochastisch unabhängige Zufallsvariablen Die stochastische Unabhängigkeit von Zufallsvariablen wird beispielsweise bei der Formulierung des Zentralen Grenzwertsatzes benötigt. Wahrscheinlichkeitsdichtefunktion Dort dienen die Wahrscheinlichkeitsdichtefunktionen zur Konstruktion von Wahrscheinlichkeitsverteilungen mithilfe von Integralen sowie zur Untersuchung und … Verteilungsfunktion Die Verteilungsfunktion ist eine spezielle reelle Funktion in der Stochastik und ein zentrales Konzept bei der Untersuchung von … Natürliche Zahl Die natürlichen Zahlen (ℕ) sind Teil der ganzen Zahlen (ℤ), die Teil der rationalen Zahlen (ℚ), die wiederum Teil der reellen Zahlen (ℝ) sind. Die dabei global … Erwartungswert Der Erwartungswert beschreibt für eine Zufallsvariable mit endlich vielen Funktionswerten das mit der Wahrscheinlichkeit des Auftretens gewichtete arithmetische … Varianz (Stochastik) Mathematisch wird sie definiert als die mittlere quadratische Abweichung einer reellen Zufallsvariablen von ihrem Erwartungswert. Sie ist das zentrale Moment …