Wikipedia · einfach zusammengefasst · Stand
F-Test
Als F-Test wird eine Gruppe von statistischen Tests bezeichnet, bei denen die Teststatistik unter der Nullhypothese einer F-Verteilung folgt.
Inhalt6 Abschnitte
Grundidee
Als F-Test bezeichnet man eine Gruppe statistischer Hypothesentests, bei denen die Teststatistik unter der Nullhypothese einer F-Verteilung folgt. Eine Teststatistik ist eine aus Stichprobendaten berechnete Zahl, mit der eine Vermutung geprüft wird. Die Nullhypothese ist die Ausgangsannahme, die nur bei genügend starkem Widerspruch durch die Daten verworfen wird.
F-Tests werden in verschiedenen Bereichen der Statistik verwendet. In der Regressionsanalyse prüft man damit Kombinationen linearer Gleichungshypothesen. In der Varianzanalyse wird mit einem F-Test geprüft, ob sich zwei unabhängige, normalverteilte Populationen hinsichtlich ihrer Varianz wesentlich unterscheiden. Die Varianz misst, wie stark Werte um ihren Mittelwert streuen. Der Test dient damit auch zur allgemeinen Überprüfung von Unterschieden zwischen statistischen Populationen.
Der Artikel weist darauf hin, dass er nicht hinreichend mit Belegen ausgestattet ist. Die Darstellung geht außerdem auf Ronald Aylmer Fisher (1890–1962) zurück, nach dem die F-Verteilung und der F-Test benannt sind.
Zwei Stichproben
Beim F-Test für zwei Stichproben werden zwei unabhängige normalverteilte Grundgesamtheiten betrachtet. Sie haben die Parameter μ1 und σ1² beziehungsweise μ2 und σ2². Die Größen σ1² und σ2² sind die Varianzen der beiden Gruppen. Typisch ist die Frage, ob die Varianz der zweiten Grundgesamtheit größer sein könnte als die der ersten.
Aus beiden Grundgesamtheiten wird je eine Zufallsstichprobe gezogen. Die Stichprobenumfänge n1 und n2 dürfen unterschiedlich groß sein. Die Stichprobenvariablen X1,1, …, X1,n1 und X2,1, …, X2,n2 müssen unabhängig sein, sowohl innerhalb jeder Gruppe als auch zwischen den Gruppen.
Geprüft wird zum Beispiel die Nullhypothese H0: σ2² = σ1² gegen die Alternativhypothese H1: σ2² > σ1². Die Alternativhypothese beschreibt also eine gerichtete Vermutung: Die zweite Varianz soll größer sein als die erste.
Teststatistik und Entscheidung
Die Teststatistik ist der Quotient der geschätzten Varianzen der beiden Stichproben:
F_Stichprobe = S2² / S1² = [1/(n2 − 1) · Σ(i=1 bis n2)(X2,i − X̄2)²] / [1/(n1 − 1) · Σ(i=1 bis n1)(X1,i − X̄1)²].
Dabei sind S1² und S2² die Stichprobenvarianzen, X̄1 und X̄2 die Stichprobenmittel der beiden Gruppen. Wenn die Nullhypothese gilt, ist F_Stichprobe F-verteilt mit n2 − 1 Freiheitsgraden im Zähler und n1 − 1 Freiheitsgraden im Nenner. Freiheitsgrade geben hier an, wie viele unabhängige Informationsanteile in der jeweiligen Varianzschätzung stecken.
Die Nullhypothese wird für zu große Werte der Teststatistik abgelehnt. Dazu bestimmt man entweder einen kritischen Wert K oder berechnet den p-Wert. Der kritische Wert erfüllt die Bedingung P(F(n2 − 1, n1 − 1) ≥ K | H0) ≤ α0. Das Signifikanzniveau α0 legt fest, wie groß die Wahrscheinlichkeit für eine fälschliche Ablehnung der Nullhypothese höchstens sein soll. Häufig wird α0 = 5 % gewählt, dies ist aber nur eine gängige Konvention.
Der p-Wert lautet p = P(F(n2 − 1, n1 − 1) ≥ f_Stichprobe | H0), wobei f_Stichprobe der beobachtete Wert der Teststatistik ist. Hat man K bestimmt, lehnt man H0 ab, falls f_Stichprobe ≥ K. Hat man den p-Wert berechnet, lehnt man H0 ab, falls p ≤ α0. Aus der Wahrscheinlichkeit P(F | H0) kann man jedoch nicht direkt auf die Wahrscheinlichkeit schließen, dass die Alternativhypothese gilt.
Verteilung der Prüfgröße
Damit eine Testentscheidung möglich ist, muss bekannt sein, welcher Verteilung die Teststatistik folgt. Beim F-Test betrachtet man dafür Zähler und Nenner der Prüfgröße genauer. Beide beruhen auf Summen quadrierter Abweichungen normalverteilter Zufallsvariablen von ihrem Mittelwert, jeweils geteilt durch die um eins verringerte Stichprobengröße.
Unter der Nullhypothese gilt σ1² = σ2². Teilt man Zähler und Nenner durch diese gemeinsame Varianz, verändert sich der Wert des Quotienten nicht. Die entsprechenden standardisierten Summen folgen jeweils einer Chi-Quadrat-Verteilung. Daraus entsteht der Quotient zweier passend skalierter Chi-Quadrat-verteilter Größen, und dieser Quotient folgt einer F-Verteilung.
Im Artikel wird dies beispielhaft für die erste Stichprobe mit der Beziehung dargestellt: (S1² / σ1²) · (n1 − 1) = [(n1 − 1) / σ1²] · [1/(n1 − 1)] · Σ(i=1 bis n1)(X1,i − X̄1)² = Σ(i=1 bis n1)((X1,i − X̄) / σ1)². Damit wird begründet, warum der Varianzquotient als F-verteilte Teststatistik verwendet werden kann.
Produktionsbeispiel
Ein Unternehmen möchte die Herstellung eines Produkts auf ein neues Verfahren B umstellen, das bessere Qualität verspricht. Es ist zwar teurer, soll aber eine kleinere Streuung liefern. Verglichen werden 100 Produkte aus dem neuen Verfahren B mit 120 Produkten aus dem alten Verfahren A. Die Varianz beträgt bei B 80 und bei A 95.
Getestet wird H0: σA = σB gegen H1: σA > σB. Der Prüfwert ist f_Stichprobe = sA² / sB² = 95 / 80 = 1,1875. Unter der Nullhypothese stammt dieser Wert aus einer F(119; 99)-Verteilung. Der p-Wert ist P(F(119; 99) ≥ 1,1875) ≈ 0,189. Da dieser Wert bei einem üblichen Signifikanzniveau von 5 % nicht klein genug ist, kann die Nullhypothese nicht abgelehnt werden. Im Beispiel wird deshalb nicht auf das neue Verfahren umgestellt.
Der Artikel betont aber, dass damit nicht bewiesen ist, dass das neue Verfahren keine kleinere Varianz hat. Ein echter Unterschied könnte in der Stichprobe unentdeckt geblieben sein. Um dies einzuschätzen, betrachtet man die Teststärke. Sie gibt an, mit welcher Wahrscheinlichkeit ein Test einen bestimmten tatsächlichen Unterschied erkennt. Für α0 = 5 % wird aus einer Tabelle der kritische Wert f_krit = 1,378 abgelesen, also P(F_Stichprobe ≥ 1,378 | H0) = 0,05.
Für den Fall σB = 0,75σA, also eine Abnahme der Standardabweichung um 25 %, ergibt sich P(H0 ablehnen | σB = 3/4 σA) = P(F(119; 99) ≥ 0,775) = 0,91. Das bedeutet: Wenn die Varianz beziehungsweise Streuung entsprechend stark abnimmt, wird dies in mindestens 91 % der Fälle entdeckt.
Weitere Anwendungen
Der F-Test spielt auch bei mehreren Stichprobenvergleichen eine Rolle. Der einfachen Varianzanalyse liegt ebenfalls ein F-Test zugrunde. Dabei werden die Quadratsumme der Behandlung und die Residuenquadratsumme miteinander verglichen. Die Quadratsumme der Behandlung beschreibt Streuung, die auf Unterschiede zwischen den Gruppen zurückgeführt wird; die Residuenquadratsumme beschreibt verbleibende Streuung innerhalb der Gruppen.
In der Regressionsanalyse gibt es den globalen F-Test, auch Overall-F-Test oder F-Test auf Gesamtsignifikanz eines Modells genannt. Dabei wird geprüft, ob mindestens eine erklärende Variable einen Erklärungsgehalt für das Modell liefert. Wenn das der Fall ist, gilt das Modell als Ganzes als signifikant.
F-Tests werden außerdem eingeordnet als in der Regel Beispiele für Likelihood-Quotienten-Tests. Solche Tests vergleichen, vereinfacht gesagt, wie gut Daten unter verschiedenen statistischen Annahmen erklärbar sind.