Wikipedia · einfach zusammengefasst · Stand
Teststatistik
Teststatistiken werden als Hilfsfunktionen bei der Definition von statistischen Tests verwendet. So wird beispielsweise bei einem Hypothesentest die …
Inhalt4 Abschnitte
Begriff und Grunddefinition
Eine Teststatistik, auch Prüfgröße, Testgröße, Testprüfgröße oder Prüffunktion genannt, ist eine spezielle reellwertige Funktion der Testtheorie, eines Teilgebiets der mathematischen Statistik. Sie wird als Hilfsfunktion bei der Definition statistischer Tests verwendet. Bei einem Hypothesentest wird die Nullhypothese beispielsweise abgelehnt, wenn die Teststatistik einen vorher festgelegten Zahlenwert über- oder unterschreitet.
Gegeben ist eine Funktion T: 𝒳 → ℝ. Der Stichprobenraum 𝒳 ist die Menge aller möglichen Stichprobenwerte einer Stichprobenvariablen X. Außerdem sei ein statistischer Test φ: 𝒳 → [0,1] durch
φ(X) = { 1, falls T(X) > k; 0, falls T(X) ≤ k }
definiert. Die feste Zahl k heißt kritischer Wert. Die Zufallsvariable T wird dann Teststatistik genannt. Der Test entscheidet in dieser Darstellung anhand des Vergleichs von T(X) mit k.
Die Definition gilt ebenfalls für randomisierte Tests sowie für Varianten dieser Testdefinition. Dabei können unter anderem die Ungleichheitszeichen verändert oder vertauscht sowie die Werte null und eins vertauscht werden.
Wichtige Teststatistiken
Eine typische Teststatistik ist die z-Statistik. Für das Stichprobenmittel gilt
X̄ = 1/n · (X₁ + X₂ + … + Xₙ).
Auf dem Stichprobenraum 𝒳 = ℝⁿ ist die z-Statistik definiert durch
T(X) = √n · (X̄ − μ) / σ.
Dabei ist σ eine positive Zahl und μ eine beliebige reelle Zahl. Die z-Statistik wird beispielsweise bei Gauß-Tests verwendet. Sind die Stichprobenvariablen X₁, X₂, …, Xₙ normalverteilt mit Erwartungswert μ und Varianz σ², so ist die Teststatistik standardnormalverteilt: T ~ 𝒩(0,1).
Eine weitere wichtige Teststatistik ist die t-Statistik. Dazu wird zunächst die korrigierte Stichprobenvarianz definiert:
V*(X) = 1/(n−1) · Σᵢ₌₁ⁿ (Xᵢ − X̄)².
Die t-Statistik lautet
T(X) = √n · (X̄ − μ) / √V*(X).
Hier ist μ wieder eine beliebige reelle Zahl. Die Teststatistik wird beim Einstichproben-t-Test verwendet. Sind die Stichprobenvariablen normalverteilt mit Mittelwert μ und Varianz σ², dann ist T t-verteilt mit (n−1) Freiheitsgraden: T ~ tₙ₋₁.
Eine dritte wichtige Teststatistik ist die Chi-Quadrat-Summe:
T(X) := Σᵢ₌₁ⁿ ((Xᵢ − μ)/σ)².
Dabei gilt μ ∈ ℝ und σ > 0. Die Chi-Quadrat-Summe wird beispielsweise beim Chi-Quadrat-Test für die Varianz verwendet. Sind die Stichprobenvariablen normalverteilt mit Erwartungswert μ und Varianz σ², so ist T Chi-Quadrat-verteilt.
Ablehnbereich und Fehlerwahrscheinlichkeiten
Für einen Test φ bezeichnet E_ϑ den Erwartungswert bezüglich der Wahrscheinlichkeitsverteilung P_ϑ. In der Testtheorie treten häufig die Ausdrücke E_ϑ₀(φ) und 1 − E_ϑ₁(φ) auf. Der erste Ausdruck entspricht dem Fehler 1. Art, der zweite dem Fehler 2. Art, wenn ϑ₀ zur Nullhypothese und ϑ₁ zur Alternative gehört. Allgemein sind diese Ausdrücke schwer zu berechnen, weil der Test φ selbst nur wenig Struktur besitzen kann.
Bei einem nichtrandomisierten Test lässt sich φ als Indikatorfunktion schreiben:
φ(X) = 𝟙_A(X).
Die Indikatorfunktion 𝟙_A(X) ist genau dann eins, wenn X in der Menge A liegt, und sonst null. A heißt Ablehnbereich des Tests. Daraus folgt
E_ϑ(φ) = P_ϑ(A).
Wird der Test durch eine Teststatistik T und einen kritischen Wert k definiert, gilt bei der oben beschriebenen Regel
A = {X ∈ 𝒳 | T(X) > k}.
Damit wird die Berechnung des Erwartungswertes zu
E_ϑ(φ) = P_ϑ(A) = P_ϑ({X ∈ 𝒳 | T(X) > k}).
Ist die Verteilung der Teststatistik bekannt, kann diese Wahrscheinlichkeit direkt bestimmt werden. Bei vielen wichtigen Tests ist dies der Fall, etwa bei den genannten z-, t- und Chi-Quadrat-Statistiken. Im randomisierten Fall sind leichte Anpassungen erforderlich.
Bedeutung für die Durchführung von Tests
Teststatistiken erleichtern sowohl die Konstruktion als auch die Anwendung statistischer Tests. Vor der Datenauswertung kann bei einem Hypothesentest die Verteilung der Teststatistik genutzt werden, um den kritischen Wert k so anzupassen, dass der Test den gewünschten Fehler 1. Art einhält.
Nach der Datenauswertung wird die Verteilung der Teststatistik bei Signifikanztests zur Bestimmung des p-Wertes verwendet. Der p-Wert basiert damit auf der beobachteten Teststatistik und ihrer bekannten oder vorausgesetzten Verteilung. Insgesamt reduzieren Teststatistiken die Berechnung von Testeigenschaften auf Wahrscheinlichkeiten bezüglich einer einzelnen, strukturierten Größe.