Wikipedia · einfach zusammengefasst · Stand
F-Verteilung
F-Verteilung · 1 Definition · 2 Eigenschaften. 2.1 Erwartungswert; 2.2 Varianz; 2.3 Verteilungsfunktion · 3 Beziehungen zu anderen Verteilungen. 3.1 Beziehung zur …
Inhalt5 Abschnitte
Grundidee und Bedeutung
Die F-Verteilung, auch Fisher-Verteilung oder Fisher-Snedecor-Verteilung, ist eine stetige Wahrscheinlichkeitsverteilung auf positiven Zahlen. Sie wird durch zwei unabhängige Parameter beschrieben: m Freiheitsgrade im Zähler und n Freiheitsgrade im Nenner. Freiheitsgrade geben hier an, wie viele unabhängige Informationen in die zugrunde liegenden Größen eingehen.
Die Verteilung entsteht als Quotient zweier unabhängiger Chi-Quadrat-verteilter Zufallsvariablen, nachdem jede durch ihre Zahl an Freiheitsgraden geteilt wurde:
F_{m,n} = (χ²_m/m)/(χ²_n/n).
Dabei besitzen χ²_m und χ²_n jeweils m beziehungsweise n Freiheitsgrade. Diese Konstruktion erklärt, weshalb die F-Verteilung besonders für den Vergleich von Varianzen geeignet ist. Im F-Test wird geprüft, ob sich zwei Stichprobenvarianzen nur aufgrund statistischer Schwankungen unterscheiden oder ob der Unterschied auf verschiedene Grundgesamtheiten hinweist. Auch die Varianzanalyse verwendet eine F-Statistik, um signifikante Unterschiede zwischen Gruppen zu untersuchen.
Definition und zentrale Kennwerte
Eine stetige Zufallsvariable X folgt der F-Verteilung F(m,n), wenn sie für x > 0 die Dichte
f(x|m,n) = m^(m/2)n^(n/2) · Γ((m+n)/2)/[Γ(m/2)Γ(n/2)] · x^(m/2−1)/(mx+n)^((m+n)/2)
besitzt. Γ bezeichnet die Gammafunktion. Da die Verteilung aus einem Quotienten nichtnegativer Chi-Quadrat-Größen entsteht, liegt ihr Wertebereich im positiven Bereich.
Der Erwartungswert existiert nur für n > 2. Dann gilt:
E(F_{m,n}) = n/(n−2).
Die Varianz ist nur für n > 4 definiert und beträgt:
Var(F_{m,n}) = 2n²(m+n−2)/[m(n−2)²(n−4)].
Für m > 2 erreicht die Dichte ihr Maximum bei
x_max = n(m−2)/[m(n+2)].
Die Entropie, also ein Maß für die Unbestimmtheit der Verteilung, wird in nats angegeben. Mit der Digamma-Funktion ψ lautet sie:
H(X) = ln((n/m) · Γ(m/2)Γ(n/2)/Γ(m/2+n/2)) + (1−m/2)ψ(m/2) − (1+n/2)ψ(n/2) + (m+n)/2 · ψ((m+n)/2).
Verteilungsfunktion und Quantile
Die Verteilungsfunktion gibt die Wahrscheinlichkeit P(X ≤ x) an. Sie lässt sich mithilfe der regularisierten unvollständigen Betafunktion geschlossen darstellen:
F(x|m;n) = I(mx/(mx+n), m/2, n/2),
wobei
I(z,a,b) = 1/B(a,b) · ∫₀ᶻ t^(a−1)(1−t)^(b−1) dt
die regularisierte unvollständige Betafunktion ist. Ihre Werte werden meist numerisch berechnet.
Das p-Quantil x_p ist derjenige Wert, für den p = F(x_p|m,n) gilt. Mit der inversen regularisierten unvollständigen Betafunktion I⁻¹ erhält man
x_p = nI⁻¹(p,m/2,n/2) / [m(1−I⁻¹(p,m/2,n/2))].
Quantile werden üblicherweise in F-Verteilungstabellen für ausgewählte Wahrscheinlichkeiten sowie Freiheitsgrade m und n angegeben. Dabei hilft die Beziehung
F⁻¹(p;m;n) = 1/F⁻¹(1−p;n;m).
Sie verbindet ein Quantil mit dem Kehrwert eines Quantils, bei dem die beiden Freiheitsgrade vertauscht sind.
Für bestimmte Freiheitsgrade gibt es einfache explizite Formeln. Allgemein gilt beispielsweise
x_p(2,n) = n/2 · (1/(1−p)^(2/n) − 1)
und
x_p(m,2) = 2/m · p^(2/m)/(1−p^(2/m)).
Spezialfälle sind unter anderem x_p(1,1) = tan(πp/2)² und x_p(2,2) = p/(1−p). Für manche kleinen Kombinationen von m und n ist in der angegebenen Übersicht keine explizite invertierbare Formel verzeichnet.
Beziehungen zu anderen Verteilungen
Die F-Verteilung ist eng mit mehreren wichtigen Wahrscheinlichkeitsverteilungen verbunden. Das Zeichen „∼“ bedeutet dabei „ist verteilt wie“.
Zur Beta-Verteilung: Für F_{m,n} ist die transformierte Zufallsvariable
Y = [(m/n)F_{m,n}]/[1+(m/n)F_{m,n}]
betaverteilt mit den Parametern m/2 und n/2, also Y ∼ Beta(m/2,n/2). Zugleich gilt
Y ∼ χ²_m/(χ²_m+χ²_n),
wenn die beiden Chi-Quadrat-Größen unabhängig sind.
Zur Chi-Quadrat-Verteilung: Sind χ²_m und χ²_n unabhängig und besitzen m beziehungsweise n Freiheitsgrade, so ist
(χ²_m/m)/(χ²_n/n) ∼ F(m,n).
Zur Normalverteilung: Seien X₁,…,X_m und Y₁,…,Y_n unabhängige normalverteilte Zufallsvariablen mit E(X_i)=μ, Var(X_i)=σ² sowie E(Y_j)=ν, Var(Y_j)=τ². Für ihre unabhängigen Stichprobenvarianzen S_X² und S_Y² gilt
S_X²/σ² ∼ χ²_{m−1}/(m−1), S_Y²/τ² ∼ χ²_{n−1}/(n−1).
Daher folgt
F = (S_X²/σ²)/(S_Y²/τ²)
einer F-Verteilung mit m−1 Freiheitsgraden im Zähler und n−1 Freiheitsgraden im Nenner. Dies ist die Grundlage für den statistischen Vergleich von Varianzen.
Zur Studentschen t-Verteilung: Wenn X ∼ t_n gilt, dann ist X² ∼ F(1,n). Das Quadrat einer t-verteilten Zufallsvariablen mit n Freiheitsgraden besitzt somit eine F-Verteilung mit einem Freiheitsgrad im Zähler und n Freiheitsgraden im Nenner.
Nichtzentrale Form und Herleitung der Dichte
Die nichtzentrale F-Verteilung verallgemeinert die zentrale F-Verteilung. Sind X ∼ χ²(δ,m) und Y ∼ χ²(n) unabhängig, wobei χ²(δ,m) eine nichtzentrale Chi-Quadrat-Verteilung mit Nichtzentralitätsparameter δ und m Freiheitsgraden ist, dann gilt für
Z = (X/m)/(Y/n):
Z ∼ F(δ,m,n).
Für δ = 0 entsteht wieder die zentrale F-Verteilung F(m,n). Die Dichte der nichtzentralen Form lautet
g(z|m,n,δ) = f(z|m,n) · e^(−δ/2) · ₁ℱ₁((m+n)/2, m/2, mzδ/[2(mz+n)]).
Dabei bezeichnet ₁ℱ₁ die spezielle hypergeometrische oder Kummersche Funktion, während f die Dichte der zentralen F-Verteilung ist. Erwartungswert und Varianz sind
E(Z) = n(1+δ/m)/(n−2) für n > 2
und
Var(Z) = 2n²[m(1+δ/m)²+(n−2)(1+2δ/m)]/[m(n−2)²(n−4)] für n > 4.
Für δ → 0 gehen beide Ausdrücke in die entsprechenden Formeln der zentralen F-Verteilung über.
Die zentrale Dichte kann aus der gemeinsamen Dichte der unabhängigen Variablen χ²_m und χ²_n hergeleitet werden. Dazu führt man die Transformation
f = (x/m)/(y/n), v = y
ein. Die zugehörige Jacobideterminante, welche die Änderung des Flächenelements bei der Transformation berücksichtigt, ist (m/n)v. Nach Einsetzen in die gemeinsame Dichte erhält man die gemeinsame Dichte von F und χ²_n. Anschließend wird über die nicht interessierende Variable v von 0 bis ∞ integriert. Diese Randverteilung ergibt genau
g_{m,n}(f) = m^(m/2)n^(n/2) · Γ(m/2+n/2)/[Γ(m/2)Γ(n/2)] · f^(m/2−1)/(mf+n)^((m+n)/2),
also die definierende Dichte der F-Verteilung.