Wikipedia · einfach zusammengefasst · Stand
Beurteilung eines binären Klassifikators
Vierfeldertafel mit relativen Häufigkeiten und Berechnung der Vorhersagewerte. krank, gesund, Summe, Vorhersagewert. positiv, s ⋅ p {\displaystyle s\cdot p} …
Inhalt6 Abschnitte
Grundidee und Wahrheitsmatrix
Ein binärer Klassifikator ordnet Objekte anhand bestimmter Merkmale einer von zwei Klassen zu, meist in Form einer Ja-Nein-Frage. Beispiele sind: Ist eine Person krank oder gesund? Ist ein Feuer ausgebrochen oder nicht? Die Zuverlässigkeit wird anhand der relativen Häufigkeit richtiger und falscher Entscheidungen beurteilt. Die Kennzahlen können zugleich als Schätzungen bedingter Wahrscheinlichkeiten verstanden werden.
Für die Bewertung benötigt man Fälle, deren tatsächliche Klasse bekannt ist. Bei einem medizinischen Test werden Testergebnis und tatsächlicher Gesundheitszustand verglichen. Es entstehen vier Fälle:
- Richtig positiv (rₚ): Die Person ist krank und der Test erkennt dies.
- Falsch negativ (fₙ): Die Person ist krank, wird aber als gesund eingestuft.
- Falsch positiv (fₚ): Die Person ist gesund, wird aber als krank eingestuft.
- Richtig negativ (rₙ): Die Person ist gesund und wird korrekt als gesund erkannt.
Diese vier Häufigkeiten werden in der Wahrheitsmatrix oder Konfusionsmatrix zusammengefasst. Dabei steht f für „falsch“, r für „richtig“; p bezeichnet positiv und n negativ. Die Zahl der tatsächlich Kranken ist rₚ + fₙ, die Zahl der tatsächlich Gesunden fₚ + rₙ. Die Zahl der positiven Testergebnisse ist rₚ + fₚ, die der negativen Ergebnisse fₙ + rₙ. Die Matrix ist eine 2×2-Kontingenztafel mit dem Urteil des Klassifikators und der tatsächlichen Klasse. Für N Klassen wird sie zu einer N×N-Matrix erweitert.
Binäre Klassifikationen ähneln statistischen Tests, bei denen zwischen Nullhypothese und Alternativhypothese entschieden wird. Als Alternative zu Kennzahlen, die vorhergesagte Wahrscheinlichkeiten künstlich dichotomisieren, können Scoring Rules verwendet werden. Sie bewerten auch die Kalibrierung der Wahrscheinlichkeiten; eine Dichotomisierung kann Aussagekraft verlieren.
Die wichtigsten Gütemaße
Die Sensitivität, auch Richtig-positiv-Rate, Empfindlichkeit oder Trefferquote, ist der Anteil der tatsächlich positiven Objekte, die korrekt positiv klassifiziert werden: Sensitivität = rₚ / (rₚ + fₙ). Bei einem Virustest bedeutet eine Sensitivität von 98 %, dass 98 % der Infizierten erkannt und 2 % der Infizierten falsch negativ getestet werden. Im statistischen Hypothesentest wird sie als Trennschärfe bezeichnet.
Die Falsch-negativ-Rate ist der Anteil der tatsächlich positiven Objekte, die fälschlich als negativ klassifiziert werden: Falsch-negativ-Rate = fₙ / (rₚ + fₙ). Sensitivität und Falsch-negativ-Rate beziehen sich beide auf die tatsächlich positiven Fälle und addieren sich daher zu 1 beziehungsweise 100 %.
Die Spezifität, auch Richtig-negativ-Rate oder kennzeichnende Eigenschaft, ist der Anteil der tatsächlich negativen Objekte, die korrekt negativ klassifiziert werden: Spezifität = rₙ / (rₙ + fₚ). Eine Spezifität von 98 % bedeutet beispielsweise, dass 98 % der Nicht-Infizierten korrekt als nicht infiziert erkannt und 2 % fälschlich als infiziert ausgewiesen werden.
Die Falsch-positiv-Rate, auch Ausfallrate, gibt den Anteil der tatsächlich negativen Objekte an, die fälschlich positiv klassifiziert werden: Falsch-positiv-Rate = fₚ / (rₙ + fₚ). Sie beschreibt die Wahrscheinlichkeit eines Fehlalarms. Spezifität und Falsch-positiv-Rate beziehen sich auf die tatsächlich negativen Fälle und addieren sich zu 1 beziehungsweise 100 %.
Die Korrektklassifikationsrate oder Accuracy ist der Anteil aller korrekt klassifizierten Objekte: (rₚ + rₙ) / (rₚ + fₚ + rₙ + fₙ). Die Falschklassifikationsrate ist der Anteil aller Fehlklassifikationen: (fₚ + fₙ) / (rₚ + fₚ + rₙ + fₙ). Beide Raten addieren sich zu 1.
Vorhersagewerte und Likelihood-Quotienten
Der positive Vorhersagewert (PPV), auch Precision, Relevanz oder positiver prädiktiver Wert, beantwortet die Frage, welcher Anteil der positiv getesteten Objekte tatsächlich positiv ist: PPV = rₚ / (rₚ + fₚ). Sein Komplement ist die Falscherkennungsrate (FDR): fₚ / (rₚ + fₚ).
Der negative Vorhersagewert (NPV) gibt an, welcher Anteil der negativ getesteten Objekte tatsächlich negativ ist: NPV = rₙ / (rₙ + fₙ). Sein Komplement ist die Falschauslassungsrate (FOR): fₙ / (rₙ + fₙ). Der positive und der negative Vorhersagewert addieren sich nicht zu 1, weil sie sich auf unterschiedliche Testergebnisgruppen beziehen.
Für die Vorhersagewerte sind Sensitivität, Spezifität und die Prätestwahrscheinlichkeit p wichtig. Bei Krankheiten entspricht p der Prävalenz in der untersuchten Population. Mit Sensitivität s und Spezifität z gilt:
- PPV = (s · p) / (s · p + (1 − z) · (1 − p))
- NPV = z · (1 − p) / ((1 − s) · p + z · (1 − p))
Der PPV steigt bei hoher Prätestwahrscheinlichkeit, der NPV bei niedriger Prätestwahrscheinlichkeit. Vorhersagewerte lassen sich deshalb nur dann auf andere Kollektive übertragen, wenn dort die relative Häufigkeit positiver Fälle gleich ist.
Likelihood-Quotienten beschreiben, wie sich die Chance einer Krankheit durch ein Testergebnis verändert. Der positive Likelihood-Quotient beziehungsweise Bayes-Faktor ist LQ₊ = Sensitivität / (1 − Spezifität). Die Chance nach einem positiven Test lautet o(krank | positiv) = o vor dem Test · Sensitivität / (1 − Spezifität). Der negative Likelihood-Quotient ist LQ₋ = (1 − Sensitivität) / Spezifität. Das diagnostische Chancenverhältnis (DOR) ist prävalenzunabhängig und berechnet sich als DOR = LQ₊ / LQ₋ = (Sensitivität · Spezifität) / ((1 − Sensitivität) · (1 − Spezifität)).
Kombinierte Maße, Funktionsgraphen und Zielkonflikte
Da einzelne Gütemaße nicht unabhängig voneinander optimiert werden können, wurden kombinierte Maße entwickelt. Das F-Maß verbindet Precision P und Recall R durch das gewichtete harmonische Mittel: F = 2 · (P · R) / (P + R). Dieses Maß heißt auch F₁, weil beide Werte gleich gewichtet werden. Allgemein gilt für positive α: Fα = (1 + α²) · (P · R) / (α² · P + R). F₂ gewichtet die Trefferquote viermal so hoch wie die Genauigkeit; F₀,₅ gewichtet die Genauigkeit viermal so hoch wie die Trefferquote.
Das Effektivitätsmaß E ist ebenfalls ein gewichtetes harmonisches Mittel und wurde 1979 von Cornelis Joost van Rijsbergen eingeführt: E = 1 − 1 / (α · (1/P) + (1 − α) · (1/R)). Die Effektivität liegt zwischen 0 (beste Effektivität) und 1 (schlechte Effektivität). Für α = 0 ist E äquivalent zur Trefferquote, für α = 1 äquivalent zur Genauigkeit.
Die sechs Kennzahlen Sensitivität, Falsch-negativ-Rate, Spezifität, Falsch-positiv-Rate, positiver Vorhersagewert und negativer Vorhersagewert können als normierte zweidimensionale Funktionen von Verhältnissen dargestellt werden. Für x = rₚ/fₙ gilt beispielsweise Sensitivität = x/(x + 1) und Falsch-negativ-Rate = 1/(x + 1). Die zugrunde liegenden Funktionen sind f₁(x) = x/(x + 1) und f₂(x) = 1/(x + 1); ihre Graphen sind bezüglich P = 0,5 spiegelsymmetrisch.
Sensitivität und Spezifität stehen typischerweise in einem Zielkonflikt. Ein liberaler Klassifikator, der fast alle Fälle als positiv einstuft, erreicht hohe Sensitivität, aber auch eine hohe Falsch-positiv-Rate und geringe Spezifität. Ein konservativer Klassifikator erreicht hohe Spezifität, übersieht aber mehr positive Fälle. Welche Einstellung sinnvoll ist, hängt von den Folgen der Fehler ab. Kostenmatrizen können diese Folgen gewichten. ROC-Kurven stellen für verschiedene Schwellenwerte die Sensitivität der Falsch-positiv-Rate gegenüber.
Seltene positive Fälle und unvollständige Daten
Bei seltenen positiven Fällen können Kennzahlen besonders irreführend sein. Ist eine Krankheit selten, kann der positive Vorhersagewert trotz hoher Sensitivität und Spezifität niedrig sein. In solchen Situationen sollte zusätzlich oder alternativ der Likelihood-Quotient angegeben werden. Häufig werden preiswerte Screening-Tests so eingestellt, dass möglichst wenige falsch negative Ergebnisse entstehen. Die dabei entstehenden falsch positiven Ergebnisse werden anschließend durch einen teureren Bestätigungstest überprüft. Bei schwerwiegenden Erkrankungen sollte ein Bestätigungstest durchgeführt werden; für die HIV-Bestimmung ist dieses Vorgehen gefordert.
Eine Wahrheitsmatrix ist oft unvollständig. Falsch negative Fälle bleiben beispielsweise unentdeckt, wenn Personen mit negativer Diagnose nicht weiter untersucht werden. Auch bei einer Recherche ist ein relevantes Dokument möglicherweise unbekannt, weil es nicht gefunden wurde. Dann können nur positiv klassifizierte Ergebnisse ausgewertet und insbesondere der positive Vorhersagewert berechnet werden.
Im Information Retrieval bezeichnet die Trefferquote (Recall) den Anteil der relevanten Dokumente, die gefunden werden, und damit die Vollständigkeit. Die Genauigkeit (Precision) ist der Anteil relevanter Dokumente an allen gefundenen Dokumenten. Der Fallout ist der Anteil gefundener irrelevanter Dokumente an allen irrelevanten Dokumenten und entspricht der Falsch-positiv-Rate. Steigt die Trefferquote, sinkt im Allgemeinen die Genauigkeit, weil mehr irrelevante Ergebnisse aufgenommen werden; bei höherer Genauigkeit werden häufig mehr relevante Dokumente übersehen.
Im Precision-Recall-Diagramm werden für unterschiedlich große Treffermengen Genauigkeit auf der y-Achse und Trefferquote auf der x-Achse aufgetragen. Der höchste Punkt, an dem beide Werte gleich sind, heißt Genauigkeit-Trefferquote-Breakeven-Punkt. Zwischen diskreten Punkten darf nicht interpoliert werden. In der Praxis erschweren unbekannte Gesamtzahlen relevanter Dokumente, subjektive Relevanz, die Rangfolge der Treffer und stark unterschiedlich große Treffermengen die Bewertung. Die relative Trefferquote und die Rückfangmethode können bei großen Datenbanken helfen.
Beispiele und statistische Testtheorie
Bei einer Datenbank mit 36 Dokumenten sind 20 relevant und 16 nicht relevant. Eine Suche findet 12 Dokumente, davon 8 relevante und 4 nicht relevante. Von den relevanten Dokumenten werden 12 nicht gefunden, ebenso 12 der nicht relevanten Dokumente. Damit beträgt die Trefferquote 8/(8 + 12) = 8/20 = 2/5 = 0,4, die Genauigkeit 8/(8 + 4) = 8/12 = 2/3 ≈ 0,67 und der Fallout 4/(4 + 12) = 4/16 = 1/4 = 0,25.
Das HIV-Beispiel zeigt den Einfluss der Prävalenz: Bei 82.000.000 Einwohnern in Deutschland, 67.000 HIV-Positiven und einem angenommenen nicht-kombinierten Test mit Sensitivität und Spezifität von jeweils 0,999 würden 67 Infizierte nicht erkannt, aber etwa 82.000 Gesunde fälschlich positiv getestet. Von 148.866 positiven Ergebnissen wären etwa 55 % falsch positiv; der positive Vorhersagewert läge nur bei 45 %. Ursache ist die geringe HIV-Häufigkeit von etwa 0,08 % (Stand 2009).
In den USA werden jährlich etwa vier Millionen Menschen wegen Brustschmerzen unter Verdacht auf Herzinfarkt eingewiesen. Nur etwa 32 % erlitten tatsächlich einen Infarkt, bei 68 % war die Verdachtsdiagnose falsch positiv. Gleichzeitig werden jährlich etwa 34.000 Patienten mit unerkanntem Herzinfarkt entlassen, ungefähr 0,8 % falsch negative Diagnosen. Die Sensitivität beträgt etwa 99,8 %. Die Spezifität lässt sich nicht bestimmen, weil die relevanten falsch positiven Ergebnisse der eigentlichen Untersuchung fehlen.
Zur Beurteilung statistischer Tests kann man viele Stichproben unter Gültigkeit der Nullhypothese oder der Alternativhypothese erzeugen. Die Annahmerate der Alternativhypothese unter der Nullhypothese schätzt den Fehler 1. Art; die Ablehnungsrate der Alternativhypothese unter ihrer Gültigkeit schätzt den Fehler 2. Art. Für die Signifikanz einer Klassifikation prüft der Chi-Quadrat-Unabhängigkeitstest bei mehreren Klassen, ob Klassifikatorurteil und tatsächliche Klasse unabhängig sind. Bei zwei Klassen wird der Vierfeldertest verwendet, bei wenigen Beobachtungen der Exakte Fisher-Test. Kontingenzkoeffizienten beziehungsweise der Phi-Koeffizient schätzen die Stärke der Korrelation. Ein signifikanter Zusammenhang bedeutet jedoch nur, dass der Klassifikator besser als zufälliges Raten ist, nicht automatisch, dass er gut ist. Zum Vergleich zweier Klassifikatoren wurden unter anderem unabhängige und verbundene Zweistichproben-t-Tests, Varianten mit 10-facher Kreuzvalidierung, der McNemar-Test sowie der 5x2cv-Test untersucht. Der 5x2cv-Test verhielt sich am besten, war aber rechenaufwendig; der McNemar-Test war etwas schlechter und deutlich weniger aufwendig.