Zum Inhalt springen
L

Wikipedia · einfach zusammengefasst · Stand

Fehler 1. und 2. Art

Beim Test einer Hypothese liegt ein Fehler 1. Art vor, wenn die Nullhypothese zurückgewiesen wird, obwohl sie in Wirklichkeit wahr ist (beruhend auf einer …

Inhalt5 Abschnitte
  1. 1. Grundidee und Entscheidungsmöglichkeiten
  2. 2. Formale Beschreibung und Signifikanzniveau
  3. 3. Zusammenhang von α, β und Testgüte
  4. 4. Typische Fehlentscheidungen
  5. 5. Medizinische Begriffe und ergänzende Einordnung

Grundidee und Entscheidungsmöglichkeiten

Fehler 1. und 2. Art sind mögliche Fehlentscheidungen bei einem Hypothesentest, also einem statistischen Verfahren zur Entscheidung zwischen einer Nullhypothese H₀ und einer Alternativhypothese H₁. Ein Fehler 1. Art, auch α-Fehler, liegt vor, wenn H₀ verworfen wird, obwohl sie wahr ist. Ein Fehler 2. Art, auch β-Fehler, liegt vor, wenn H₀ nicht verworfen wird, obwohl H₁ wahr ist.

Die vier möglichen Ergebnisse sind: Ist H₀ wahr und der Test entscheidet für H₀, handelt es sich um eine richtige negative Entscheidung mit Wahrscheinlichkeit 1 − α; entscheidet er trotzdem für H₁, ist dies ein falsch positives Ergebnis mit Wahrscheinlichkeit α. Ist H₁ wahr und der Test entscheidet für H₁, ist dies eine richtige positive Entscheidung mit Wahrscheinlichkeit 1 − β; entscheidet er für H₀, ist dies ein falsch negatives Ergebnis mit Wahrscheinlichkeit β.

Im Qualitätsmanagement und in der Qualitätskontrolle heißen die Risiken häufig Produzentenrisiko und Konsumentenrisiko. Bei Qualitätsregelkarten spricht man von blindem Alarm und unterlassenem Alarm. Das Konzept wurde von Jerzy Neyman und Egon Pearson eingeführt.

Formale Beschreibung und Signifikanzniveau

Ein Test bezieht sich auf einen unbekannten Parameter θ im Parameterraum Θ. Dieser wird in zwei disjunkte Teilmengen Θ₀ und Θ₁ zerlegt. H₀: θ ∈ Θ₀ ist die Nullhypothese, H₁: θ ∈ Θ₁ die Alternativhypothese; wegen der Disjunktheit kann nur eine von beiden wahr sein.

Sind Teststatistik T und Ablehnbereich A festgelegt, wird H₀ verworfen, wenn T ∈ A gilt. Die Gütefunktion ist G(θ) = P(T ∈ A | θ). Sie gibt für jeden Parameterwert die Wahrscheinlichkeit an, H₀ abzulehnen.

Für θ ∈ Θ₀ sind die Werte G(θ) die Wahrscheinlichkeiten eines Fehlers 1. Art. Bei einer zusammengesetzten Nullhypothese gibt es daher im Allgemeinen mehrere solcher Wahrscheinlichkeiten. Ein Signifikanztest zum Niveau α erfüllt für alle θ ∈ Θ₀: P(T ∈ A | θ) ≤ α. α heißt Signifikanzniveau oder zugelassene Irrtumswahrscheinlichkeit. Bei einer einfachen Nullhypothese H₀: θ = θ₀ lässt sich häufig G(θ₀) = α erreichen. Bei einer zusammengesetzten Nullhypothese kann oft maxθ∈Θ₀ G(θ) = α gelten; dann schöpft der Test das Signifikanzniveau aus.

Für θ ∈ Θ₁ sind die Fehlerwahrscheinlichkeiten 2. Art P(T ∉ A | θ) = 1 − G(θ). Die Komplemente G(θ) heißen Trennschärfe. Ziel ist bei vorgegebenem α, unter den Signifikanztests die Fehler 2. Art zu minimieren beziehungsweise die Trennschärfe gegen relevante Alternativen zu maximieren.

Zusammenhang von α, β und Testgüte

α und β lassen sich im Allgemeinen nicht beide gleichzeitig minimieren: Wird α verringert, erhöht sich gewöhnlich die Wahrscheinlichkeit eines Fehlers 2. Art – und umgekehrt. Eine hohe Trennschärfe bedeutet deshalb eine kleine Fehlerwahrscheinlichkeit 2. Art.

β hängt vom tatsächlich in der Grundgesamtheit vorliegenden Parameter ab. Anders als die Fehlerwahrscheinlichkeit 1. Art kann sie meist nicht vorab bestimmt werden, weil die Alternativhypothese oft viele Möglichkeiten umfasst. Bei H₀: μ = 0 und H₁: μ ≠ 0 hängt β etwa vom unbekannten tatsächlichen Mittelwert μ₁ ab. Je näher μ₁ am durch H₀ behaupteten μ₀ liegt, desto größer wird β; für μ₁ → μ₀ nähert sich β dem Grenzwert 1 − α. Ein rein formal-logischer Umgang damit kann zu Fehlentscheidungen führen, weil eine sehr kleine Abweichung praktisch möglicherweise keine Rolle spielt.

Bei biometrischen und medizinstatistischen Anwendungen heißt die Wahrscheinlichkeit einer Entscheidung für H₀ bei wahrer H₀ Spezifität. Die Wahrscheinlichkeit einer Entscheidung für H₁ bei wahrer H₁ heißt Sensitivität. Wünschenswert sind hohe Sensitivität und hohe Spezifität.

Typische Fehlentscheidungen

Ein Fehler 1. Art bedeutet beispielsweise: Ein gesunder Patient wird als krank angesehen, ein unschuldiger Angeklagter wird verurteilt oder einer berechtigten Person wird der Zugang verweigert. Übliche Signifikanzniveaus sind 5 % („signifikant“) oder 1 % („sehr signifikant“).

Bei einem Spam-Filter kann H₀ lauten: Die E-Mail ist normale Post und kein Spam; H₁: Sie ist Spam. Wird eine normale E-Mail als Spam klassifiziert, ist dies ein falsch positives Ergebnis und damit ein Fehler 1. Art.

Bei der Untersuchung einer neuen Lernmethode kann H₁ behaupten, dass damit unterrichtete Schüler eine höhere Lernleistung haben. Wird H₀ verworfen und die Methode als wirksam angesehen, obwohl in den Populationen tatsächlich kein Unterschied besteht, liegt ein Fehler 1. Art vor. Der beobachtete Unterschied kann dann zufällig oder durch andere Einflüsse entstanden sein.

Ein Fehler 2. Art liegt etwa vor, wenn eine Untersuchung zu gesunder Ernährung bei Kindern keinen Leistungsunterschied feststellt und daher H₀ beibehält, obwohl gesund ernährte Kinder in der Population tatsächlich bessere kognitive Leistungen zeigen. Gleichheit in Stichproben kann auf zufällige Streuung der Messwerte oder eine ungünstige Stichprobenzusammenstellung zurückgehen. Ob Fehler 1. oder 2. Art schwerer wiegt, hängt vom Untersuchungsgegenstand ab.

Medizinische Begriffe und ergänzende Einordnung

Bei medizinischen Tests ist die Nullhypothese häufig einfach, etwa H₀: θ = 0. Je nach Fragestellung bedeutet sie keinen Effekt, keinen Unterschied, keine Wirkung, nicht erkrankt oder nicht infiziert. Ein Testergebnis heißt Befund. Ein Befund, der zur Ablehnung von H₀ führt, ist positiv; andernfalls ist er negativ. Fehler 1. Art heißt falsch-positive Entscheidung oder Diagnose, Fehler 2. Art falsch-negative Entscheidung oder Diagnose.

Bei einfacher Null- und einfacher Alternativhypothese gibt es jeweils genau einen α- und einen β-Fehler. Das Komplement des α-Fehlers ist die Spezifität; das Komplement des β-Fehlers heißt in der Statistik Trennschärfe, Macht oder Güte und bei Tests Sensitivität. Sensitivität ist die Wahrscheinlichkeit einer richtigen positiven, Spezifität die einer richtigen negativen Diagnose.

Die Bezeichnung Beta-Fehler kann verwirren: In der mathematischen Statistik wird die Gütefunktion G(θ) häufig selbst mit β(θ) bezeichnet. Dann sind die Fehlerwahrscheinlichkeiten 2. Art für θ ∈ Θ₁ gleich 1 − β(θ).

G(θ) = P(T ∈ A | θ) wird umgangssprachlich manchmal als bedingte Wahrscheinlichkeit bezeichnet, weil die Wahrscheinlichkeit vom Parameterwert abhängt. Im streng wahrscheinlichkeitstheoretischen Sinn ist θ jedoch kein Ereignis. In der Bayesschen Statistik kann θ als realisierter Wert einer Zufallsvariablen θ̃ aufgefasst werden; dann ist P(T ∈ A | θ̃ = θ) eine bedingte Wahrscheinlichkeit. Es gibt außerdem Testansätze, die beide Fehler simultan kontrollieren, etwa über eine Verlustfunktion, Niveau-α-β-Tests mit Indifferenzbereich oder agnostische Tests mit einem Bereich ohne Entscheidung.

Weiterlesen

Statistischer Test Ein statistischer Test dient in der Testtheorie, einem Teilgebiet der mathematischen Statistik, dazu, anhand vorliegender Beobachtungen eine begründete … Mathematische Statistik Als mathematische Statistik bezeichnet man das Teilgebiet der Statistik, das die Methoden und Verfahren der Statistik mit mathematischen Mitteln analysiert … Hypothese (Statistik) In der Statistik bezeichnet man mit Hypothese eine Annahme, die mit Methoden der mathematischen Statistik auf Basis empirischer Daten geprüft wird. Teststatistik Teststatistiken werden als Hilfsfunktionen bei der Definition von statistischen Tests verwendet. So wird beispielsweise bei einem Hypothesentest die … Bedingte Wahrscheinlichkeit Bedingte Wahrscheinlichkeit (auch konditionale Wahrscheinlichkeit) ist die Wahrscheinlichkeit des Eintretens eines Ereignisses A {\displaystyle A} … Bayessche Statistik Grundlagen sind der bayessche Wahrscheinlichkeitsbegriff und der Satz von Bayes. In der bayesschen Statistik drückt die Wahrscheinlichkeit den „Grad der … Grundgesamtheit Die Grundgesamtheit bezeichnet diejenige Menge aller Objekte, über die eine Aussage getroffen werden soll. Grundgesamtheiten werden häufig nur unvollständig … Wahrscheinlichkeit Die Wahrscheinlichkeit ist ein allgemeines Maß der Erwartung für ein unsicheres Ereignis. Auf der einen Seite sollen Vorhersagen (Prognosen) über den … Urnenmodell Mit Urnenmodellen wird die Wahrscheinlichkeit für das Auftreten bestimmter Farbkombinationen untersucht, wenn aus einer Urne mit verschiedenfarbigen Kugeln … Stichprobe Als Stichprobe bezeichnet man entweder. eine Teilmenge einer Grundgesamtheit (Population), die unter bestimmten Gesichtspunkten ausgewählt wurde … E-Mail Die oder das E-Mail (englisch [ˈiːmeɪl], im Deutschen kurz Mail; englisch electronic mail für „elektronische Post“ oder „elektronischer Brief“) ist zum … Erwartungswert Der Erwartungswert beschreibt für eine Zufallsvariable mit endlich vielen Funktionswerten das mit der Wahrscheinlichkeit des Auftretens gewichtete arithmetische …