Wikipedia · einfach zusammengefasst · Stand
Statistischer Test
Ein statistischer Test dient in der Testtheorie, einem Teilgebiet der mathematischen Statistik, dazu, anhand vorliegender Beobachtungen eine begründete …
Inhalt6 Abschnitte
Grundidee und Ablauf
Ein statistischer Test (Hypothesentest) ist in der mathematischen Statistik eine Regel, die Beobachtungsdaten einer Entscheidung über eine Hypothese zuordnet. Weil Daten Realisierungen von Zufallsvariablen sind, lässt sich die Wahrheit einer Hypothese meist nicht sicher feststellen. Deshalb werden die Wahrscheinlichkeiten von Fehlentscheidungen kontrolliert. Üblich ist ein Signifikanztest mit vorgegebenem Signifikanzniveau α.
Man formuliert eine Nullhypothese H₀, von der zunächst ausgegangen wird, und eine Gegen- oder Alternativhypothese H₁. Wie beim Gerichtsvergleich wird H₀ erst bei ausreichend starken Hinweisen verworfen: Der Fehler 1. Art – H₀ wird verworfen, obwohl sie wahr ist – erhält Vorrang. Der Fehler 2. Art besteht darin, H₀ nicht zu verwerfen, obwohl sie falsch ist.
Praktisch werden H₀ und H₁ formuliert, eine Teststatistik T gewählt und vor der Stichprobe ein kritischer Bereich K zum Niveau α festgelegt. Dann wird der beobachtete Wert t_obs berechnet. Gilt t_obs∈K, wird H₀ zugunsten von H₁ abgelehnt; sonst wird H₀ beibehalten. Eine Nichtablehnung bestätigt H₀ jedoch nicht statistisch.
Formale Begriffe, Fehler und Güte
Bei einer parametrisierten Verteilungsfamilie P={P_θ: θ∈Θ} definieren disjunkte Teilmengen Θ₀ und Θ₁ das Problem H₀: θ∈Θ₀ gegen H₁: θ∈Θ₁. Häufig, aber nicht zwingend, zerlegen sie Θ.
Ein nichtrandomisierter Test ist eine messbare Funktion φ: 𝒳→{0,1}: φ(x)=1 bedeutet, H₀ abzulehnen, φ(x)=0 bedeutet, H₀ nicht abzulehnen. Sein Ablehnungs- oder kritischer Bereich ist K_φ={x∈𝒳 | φ(x)=1}; das Komplement heißt Nichtablehnungs- oder Annahmebereich.
Die Gütefunktion G_φ(θ)=P_θ(X∈K_φ)=P_θ(φ(X)=1) gibt für jeden Parameter die Ablehnwahrscheinlichkeit an. Für θ∈Θ₀ ist sie die Fehlerwahrscheinlichkeit 1. Art; für θ∈Θ₁ ist 1−G_φ(θ) die Fehlerwahrscheinlichkeit 2. Art. Ein Niveau-α-Test erfüllt für alle θ∈Θ₀: P_θ(X∈K_φ)≤α, äquivalent sup_{θ∈Θ₀}P_θ(X∈K_φ)≤α. Der Umfang beziehungsweise das tatsächliche Niveau ist diese linke obere Schranke. Bei Gleichheit mit α liegt ein Umfang-α-Test vor; ist der Umfang kleiner, ist der Test konservativ.
Angestrebt werden bei eingehaltenem Niveau kleine Fehlerwahrscheinlichkeiten 2. Art. Unverfälschtheit verlangt: sup_{θ∈Θ₀}P_θ(X∈K_φ)≤inf_{θ∈Θ₁}P_θ(X∈K_φ). Häufig wird die n-dimensionale Stichprobe durch eine reellwertige Teststatistik T=T(X) auf eine Prüfgröße reduziert.
Randomisierung, große Stichproben und Modellannahmen
Ein randomisierter Test ist eine Funktion φ:𝒳→[0,1]. Im strikten Ablehnungsbereich K₁ wird H₀ sicher verworfen, im strikten Annahmebereich K₀ sicher beibehalten; im Randomisierungsbereich K₀₁ wird H₀ mit Wahrscheinlichkeit γ(x) verworfen. Dazu ist ein weiteres Zufallsexperiment nötig. Randomisierung kann bei diskreten Teststatistiken ein vorgegebenes Niveau exakt ausschöpfen. Ein Binomialtest ist wegen seiner Diskretheit meist konservativ, lässt sich aber randomisiert zu einem Umfang-α-Test machen. In Anwendungen spielen solche Tests kaum eine Rolle, weil die Entscheidung dann etwa von Würfelwurf oder Zufallsgenerator abhängt.
Ist die exakte Nullverteilung der Teststatistik unbekannt, werden asymptotische Tests verwendet. Ihr Bereich K erfüllt für alle θ∈Θ₀: limsup_{n→∞}P_θ(T(X)∈K)≤α. Meist beruht dies auf einer Normalapproximation, etwa bei einfachem und doppeltem t-Test durch den zentralen Grenzwertsatz. Delta-Methode und nichtparametrische Delta- beziehungsweise Einflussfunktionsmethode erlauben weitere asymptotische Normalapproximationen, etwa für Varianz, Kurtosis oder Korrelationskoeffizient.
Mit wachsendem Stichprobenumfang soll ein guter Test Abweichungen von H₀ eher erkennen; sehr kleine Abweichungen benötigen jedoch große Stichproben und sind nicht immer praktisch bedeutsam. Ergebnisse hängen zudem von Modellannahmen ab, die empirisch überprüft werden müssen. Strenge Voraussetzungen typischer Tests sind in der Praxis selten vollständig erfüllt.
Wichtige Testarten und Testformen
Parametrische Tests nehmen eine durch Parameter beschriebene Verteilungsfamilie an, zum Beispiel Normalverteilungen mit Mittelwert und Varianz. Ihre Voraussetzungen müssen geprüft werden; manche Verfahren sind bei großen Stichproben robust, etwa der t-Test bei Abweichungen von der Normalverteilung. Sind die Annahmen falsch, können Ergebnisse unbrauchbar werden und die Trennschärfe – die Fähigkeit, falsche H₀ zu erkennen – sinken.
Nichtparametrische oder parameterfreie Tests legen keine parametrisierte Verteilungsfamilie fest, benötigen aber oft andere Annahmen, etwa Stetigkeit oder Symmetrie. Beispiele sind Kolmogorow-Smirnow-Test, Wilcoxon-Mann-Whitney-Test, Kruskal-Wallis-Test, Wilcoxon-Vorzeichen-Rang-Test und Friedman-Test. Der Wilcoxon-Vorzeichen-Rang-Test setzt beispielsweise eine symmetrische stetige Verteilung voraus; Bindungen durch Rundung machen häufig Korrekturen nötig. Verteilungsgebundene Tests hängen von der Verteilung der Stichprobenvariablen ab, verteilungsfreie nicht.
Exakte Tests kontrollieren den Fehler 1. Art auf Grundlage einer unter H₀ exakt geltenden Teststatistikverteilung; dazu zählen Fisher-Test, Permutationstest und Binomialtest. Bei einer Normalapproximation der Binomialverteilung gilt als Beispiel n·π₀·(1−π₀)≥9; eventuell ist eine Stetigkeitskorrektur nötig.
Einseitige Hypothesen lauten etwa H₀: θ≤θ₀ gegen H₁: θ>θ₀, zweiseitige H₀: θ=θ₀ gegen H₁: θ≠θ₀. Typische Ablehnungsbereiche sind entsprechend (a,∞), (−∞,b) oder (−∞,c)∪(d,∞). Ein Äquivalenztest prüft H₀: |μ₁−μ₂|>c gegen H₁: |μ₁−μ₂|≤c. Ein Nichtunterlegenheitstest prüft H₀: μ₁<μ₀−c gegen H₁: μ₁≥μ₀−c.
Signifikanztests behandeln die Fehler asymmetrisch und verwenden häufig α=10 %, 5 %, 1 % oder 0,1 %. Alternativtests behandeln zwei sich ausschließende Hypothesen gleichberechtigt und kontrollieren Fehler 1. und 2. Art gleichzeitig.
Beispiel: Test auf hellseherische Fähigkeiten
Eine Person soll bei 25 zufällig gewählten Spielkarten jeweils eine von vier Farben vorhersagen. X ist die Trefferzahl. Ohne hellseherische Fähigkeit beträgt die Trefferwahrscheinlichkeit p=1/4; bei hellseherischer Fähigkeit soll sie größer sein. Somit gilt H₀: p=1/4 gegen H₁: p>1/4.
Ab einer kritischen Trefferzahl c wird H₀ verworfen. Bei c=25 beträgt unter H₀ die Wahrscheinlichkeit für 25 Zufallstreffer (1/4)^25≈10^−15. Bei c=10 ist sie wesentlich größer: P(X≥10 | p=1/4)=∑_{i=10}^{25} (25 über i)(1/4)^i(1−1/4)^(25−i)≈0,07.
Vorab wird α festgelegt, typisch zwischen 1 % und 5 %. Für α=1 % wird c so gewählt, dass P(X≥c | p=1/4)≤0,01 gilt. Um den Fehler 2. Art möglichst klein zu halten, nimmt man die kleinste passende Zahl: Hier ist c=13. Es handelt sich um einen Binomialtest, weil X unter H₀ binomialverteilt ist.
Mehrere Tests, Abgrenzung und Überblick
Beim multiplen Testen werden mit denselben Beobachtungen mehrere Tests durchgeführt. Dafür müssen Fehler 1. Art und Fehlerwahrscheinlichkeiten auf mehrere Tests verallgemeinert, Konsistenzbedingungen wie Kohärenz, Konsonanz und Abgeschlossenheit beachtet und Signifikanzniveaus wegen der Alphafehler-Kumulierung abgestimmt werden. Beim Durchschnitts-Vereinigungs-Test wird eine Vereinigungs-Nullhypothese nur verworfen, wenn alle Teilhypothesen verworfen werden; sein Ablehnungsbereich ist der Durchschnitt der Einzelbereiche. Beim Vereinigungs-Durchschnitts-Test genügt die Ablehnung einer Teilhypothese; der Ablehnungsbereich ist die Vereinigung.
Statistische Tests unterscheiden sich von psychologischen Tests, die nicht direkt messbare Eigenschaften über Hilfsvariablen messen, und von medizinischen Labortests. Medizinische Tests sind binäre Klassifikationen von krank oder gesund. Bei einfacher H₀ und H₁ heißen falsche Entscheidungen falsch-positiv beziehungsweise falsch-negativ; Spezifität ist 1−α, Sensitivität ist 1−β und bezeichnet die Wahrscheinlichkeit einer richtigen positiven Diagnose. Die ROC-Kurve beschreibt mögliche Kombinationen der Fehlerwahrscheinlichkeiten bei verschiedenen Trennwerten.
Die Übersicht ordnet Tests nach Zweck, Zahl und Abhängigkeit der Stichproben sowie Voraussetzungen. Sie enthält Lageparameter-Tests wie t-, Gauß-, Vorzeichen-, Wilcoxon-, Kruskal-Wallis-, Friedman- und Varianzanalyse-Tests; Streuungstests wie F-, Bartlett- und Levene-Test; Zusammenhangstests wie Chi-Quadrat-Unabhängigkeitstest, Fisher-Test und McNemar-Test; Anpassungs- und Verteilungstests wie Chi-Quadrat-, Anderson-Darling-, Kolmogorow-Smirnow-, Cramér-von-Mises-, Jarque-Bera-, Lilliefors- und Shapiro-Wilk-Test. Für Regression und Zeitreihen werden unter anderem globaler F-Test, t-Test, Goldfeld-Quandt-, Chow-, Durbin-Watson-, Box-Pierce- und Ljung-Box-Test genannt. Sequentielles Testen entscheidet während der laufenden Datenerhebung, ohne den Stichprobenumfang vorher festzulegen.