Wikipedia · einfach zusammengefasst · Stand
Fehler 1. und 2. Art
Beim Test einer Hypothese liegt ein Fehler 1. Art vor, wenn die Nullhypothese zurückgewiesen wird, obwohl sie in Wirklichkeit wahr ist (beruhend auf einer …
Inhalt5 Abschnitte
Grundidee und Entscheidungsmöglichkeiten
Fehler 1. und 2. Art sind mögliche Fehlentscheidungen bei einem Hypothesentest, also einem statistischen Verfahren zur Entscheidung zwischen einer Nullhypothese H₀ und einer Alternativhypothese H₁. Ein Fehler 1. Art, auch α-Fehler, liegt vor, wenn H₀ verworfen wird, obwohl sie wahr ist. Ein Fehler 2. Art, auch β-Fehler, liegt vor, wenn H₀ nicht verworfen wird, obwohl H₁ wahr ist.
Die vier möglichen Ergebnisse sind: Ist H₀ wahr und der Test entscheidet für H₀, handelt es sich um eine richtige negative Entscheidung mit Wahrscheinlichkeit 1 − α; entscheidet er trotzdem für H₁, ist dies ein falsch positives Ergebnis mit Wahrscheinlichkeit α. Ist H₁ wahr und der Test entscheidet für H₁, ist dies eine richtige positive Entscheidung mit Wahrscheinlichkeit 1 − β; entscheidet er für H₀, ist dies ein falsch negatives Ergebnis mit Wahrscheinlichkeit β.
Im Qualitätsmanagement und in der Qualitätskontrolle heißen die Risiken häufig Produzentenrisiko und Konsumentenrisiko. Bei Qualitätsregelkarten spricht man von blindem Alarm und unterlassenem Alarm. Das Konzept wurde von Jerzy Neyman und Egon Pearson eingeführt.
Formale Beschreibung und Signifikanzniveau
Ein Test bezieht sich auf einen unbekannten Parameter θ im Parameterraum Θ. Dieser wird in zwei disjunkte Teilmengen Θ₀ und Θ₁ zerlegt. H₀: θ ∈ Θ₀ ist die Nullhypothese, H₁: θ ∈ Θ₁ die Alternativhypothese; wegen der Disjunktheit kann nur eine von beiden wahr sein.
Sind Teststatistik T und Ablehnbereich A festgelegt, wird H₀ verworfen, wenn T ∈ A gilt. Die Gütefunktion ist G(θ) = P(T ∈ A | θ). Sie gibt für jeden Parameterwert die Wahrscheinlichkeit an, H₀ abzulehnen.
Für θ ∈ Θ₀ sind die Werte G(θ) die Wahrscheinlichkeiten eines Fehlers 1. Art. Bei einer zusammengesetzten Nullhypothese gibt es daher im Allgemeinen mehrere solcher Wahrscheinlichkeiten. Ein Signifikanztest zum Niveau α erfüllt für alle θ ∈ Θ₀: P(T ∈ A | θ) ≤ α. α heißt Signifikanzniveau oder zugelassene Irrtumswahrscheinlichkeit. Bei einer einfachen Nullhypothese H₀: θ = θ₀ lässt sich häufig G(θ₀) = α erreichen. Bei einer zusammengesetzten Nullhypothese kann oft maxθ∈Θ₀ G(θ) = α gelten; dann schöpft der Test das Signifikanzniveau aus.
Für θ ∈ Θ₁ sind die Fehlerwahrscheinlichkeiten 2. Art P(T ∉ A | θ) = 1 − G(θ). Die Komplemente G(θ) heißen Trennschärfe. Ziel ist bei vorgegebenem α, unter den Signifikanztests die Fehler 2. Art zu minimieren beziehungsweise die Trennschärfe gegen relevante Alternativen zu maximieren.
Zusammenhang von α, β und Testgüte
α und β lassen sich im Allgemeinen nicht beide gleichzeitig minimieren: Wird α verringert, erhöht sich gewöhnlich die Wahrscheinlichkeit eines Fehlers 2. Art – und umgekehrt. Eine hohe Trennschärfe bedeutet deshalb eine kleine Fehlerwahrscheinlichkeit 2. Art.
β hängt vom tatsächlich in der Grundgesamtheit vorliegenden Parameter ab. Anders als die Fehlerwahrscheinlichkeit 1. Art kann sie meist nicht vorab bestimmt werden, weil die Alternativhypothese oft viele Möglichkeiten umfasst. Bei H₀: μ = 0 und H₁: μ ≠ 0 hängt β etwa vom unbekannten tatsächlichen Mittelwert μ₁ ab. Je näher μ₁ am durch H₀ behaupteten μ₀ liegt, desto größer wird β; für μ₁ → μ₀ nähert sich β dem Grenzwert 1 − α. Ein rein formal-logischer Umgang damit kann zu Fehlentscheidungen führen, weil eine sehr kleine Abweichung praktisch möglicherweise keine Rolle spielt.
Bei biometrischen und medizinstatistischen Anwendungen heißt die Wahrscheinlichkeit einer Entscheidung für H₀ bei wahrer H₀ Spezifität. Die Wahrscheinlichkeit einer Entscheidung für H₁ bei wahrer H₁ heißt Sensitivität. Wünschenswert sind hohe Sensitivität und hohe Spezifität.
Typische Fehlentscheidungen
Ein Fehler 1. Art bedeutet beispielsweise: Ein gesunder Patient wird als krank angesehen, ein unschuldiger Angeklagter wird verurteilt oder einer berechtigten Person wird der Zugang verweigert. Übliche Signifikanzniveaus sind 5 % („signifikant“) oder 1 % („sehr signifikant“).
Bei einem Spam-Filter kann H₀ lauten: Die E-Mail ist normale Post und kein Spam; H₁: Sie ist Spam. Wird eine normale E-Mail als Spam klassifiziert, ist dies ein falsch positives Ergebnis und damit ein Fehler 1. Art.
Bei der Untersuchung einer neuen Lernmethode kann H₁ behaupten, dass damit unterrichtete Schüler eine höhere Lernleistung haben. Wird H₀ verworfen und die Methode als wirksam angesehen, obwohl in den Populationen tatsächlich kein Unterschied besteht, liegt ein Fehler 1. Art vor. Der beobachtete Unterschied kann dann zufällig oder durch andere Einflüsse entstanden sein.
Ein Fehler 2. Art liegt etwa vor, wenn eine Untersuchung zu gesunder Ernährung bei Kindern keinen Leistungsunterschied feststellt und daher H₀ beibehält, obwohl gesund ernährte Kinder in der Population tatsächlich bessere kognitive Leistungen zeigen. Gleichheit in Stichproben kann auf zufällige Streuung der Messwerte oder eine ungünstige Stichprobenzusammenstellung zurückgehen. Ob Fehler 1. oder 2. Art schwerer wiegt, hängt vom Untersuchungsgegenstand ab.
Medizinische Begriffe und ergänzende Einordnung
Bei medizinischen Tests ist die Nullhypothese häufig einfach, etwa H₀: θ = 0. Je nach Fragestellung bedeutet sie keinen Effekt, keinen Unterschied, keine Wirkung, nicht erkrankt oder nicht infiziert. Ein Testergebnis heißt Befund. Ein Befund, der zur Ablehnung von H₀ führt, ist positiv; andernfalls ist er negativ. Fehler 1. Art heißt falsch-positive Entscheidung oder Diagnose, Fehler 2. Art falsch-negative Entscheidung oder Diagnose.
Bei einfacher Null- und einfacher Alternativhypothese gibt es jeweils genau einen α- und einen β-Fehler. Das Komplement des α-Fehlers ist die Spezifität; das Komplement des β-Fehlers heißt in der Statistik Trennschärfe, Macht oder Güte und bei Tests Sensitivität. Sensitivität ist die Wahrscheinlichkeit einer richtigen positiven, Spezifität die einer richtigen negativen Diagnose.
Die Bezeichnung Beta-Fehler kann verwirren: In der mathematischen Statistik wird die Gütefunktion G(θ) häufig selbst mit β(θ) bezeichnet. Dann sind die Fehlerwahrscheinlichkeiten 2. Art für θ ∈ Θ₁ gleich 1 − β(θ).
G(θ) = P(T ∈ A | θ) wird umgangssprachlich manchmal als bedingte Wahrscheinlichkeit bezeichnet, weil die Wahrscheinlichkeit vom Parameterwert abhängt. Im streng wahrscheinlichkeitstheoretischen Sinn ist θ jedoch kein Ereignis. In der Bayesschen Statistik kann θ als realisierter Wert einer Zufallsvariablen θ̃ aufgefasst werden; dann ist P(T ∈ A | θ̃ = θ) eine bedingte Wahrscheinlichkeit. Es gibt außerdem Testansätze, die beide Fehler simultan kontrollieren, etwa über eine Verlustfunktion, Niveau-α-β-Tests mit Indifferenzbereich oder agnostische Tests mit einem Bereich ohne Entscheidung.