Wikipedia · einfach zusammengefasst · Stand
Klassifikationsverfahren
Das Erzeugen von Strukturen aus vorhandenen Daten wird auch als Mustererkennung, Diskriminierung oder überwachtes Lernen bezeichnet. Dabei werden …
Inhalt4 Abschnitte
Begriff und Bedeutung
Klassifikationsverfahren, auch Klassifizierungsverfahren, sind Methoden und Kriterien, mit denen Objekte oder Situationen in Klassen eingeteilt werden. Diese Einteilung heißt Klassierung beziehungsweise Klassifizierung; ein Verfahren kann auch Klassifikator genannt werden. Viele Verfahren lassen sich als Algorithmus umsetzen. Dann spricht man von maschineller oder automatischer Klassifikation.
Klassifikationsverfahren sind anwendungsbezogen, deshalb gibt es viele unterschiedliche Methoden. Sie werden unter anderem in der Mustererkennung, der künstlichen Intelligenz, der Dokumentationswissenschaft und beim Information Retrieval eingesetzt. Die Qualität eines Klassifikators lässt sich mit verschiedenen Kenngrößen beurteilen.
Im engen Sinn werden Klassifikationsverfahren von Klassierungsverfahren unterschieden: Klassierungsverfahren ordnen Objekte bereits vorhandenen Klassen zu. Im allgemeinen Sprachgebrauch wird zwischen „klassifizieren“ und „klassieren“ jedoch nicht unterschieden.
Einteilungsmöglichkeiten und automatische Klassifikation
Eine streng hierarchische Einteilung ist kaum möglich. Verfahren können nach mehreren Eigenschaften unterschieden werden: manuell oder automatisch, numerisch oder nichtnumerisch, statistisch oder verteilungsfrei, überwacht oder nicht überwacht, fest dimensioniert oder lernend sowie parametrisch oder nichtparametrisch.
Bei automatischen Verfahren übernimmt Software die Klassifizierung. Maschinelle Klassifikation ist eine formale Methode, in neuen Situationen aufgrund erlernter Strukturen zu entscheiden, und ein Teilgebiet des maschinellen Lernens.
Zunächst erzeugt ein lernender Algorithmus aus bekannten, bereits klassifizierten Fällen, der Datenbasis, Strukturen. Danach ordnet ein auswertender Algorithmus einen neuen, bisher unbekannten Fall einer bekannten Zielklasse zu. Grundlage dafür sind die beobachteten Attribute und deren Ausprägungen.
Wahrscheinlichkeiten, Trennflächen und Lernen
Statistische Verfahren beruhen auf Dichteberechnungen und Wahrscheinlichkeiten. Verteilungsfreie Verfahren verwenden dagegen klare Trennflächen, um Klassen voneinander zu trennen. Die Grenzen zwischen Klassen im Merkmalsraum können durch Diskriminanzfunktionen angegeben werden. Beispiele statistischer Verfahren sind der Bayes-Klassifikator, der Fuzzy-Pattern-Klassifikator und der Kerndichteschätzer. Support-Vector-Maschinen ermöglichen die Berechnung von Trennflächen.
Beim überwachten Lernen, auch Mustererkennung oder Diskriminierung genannt, werden Strukturen aus vorhandenen Daten erzeugt. Die Klasseneinteilungen sind dabei vorgegeben; dies kann auch durch Stichproben erfolgen. Beim nichtüberwachten Lernen sind die Klassen der Daten nicht vorgegeben und müssen ebenfalls erlernt werden. Beim bestärkenden Lernen (englisch reinforcement learning) können zusätzlich Informationen darüber vorliegen, ob eine Klasseneinteilung richtig oder falsch war. Ein unüberwachtes Verfahren ist die Clusteranalyse.
Parametrische Verfahren verwenden parametrische Wahrscheinlichkeitsdichten. Nichtparametrische Verfahren, zum Beispiel die Nächste-Nachbarn-Klassifikation, basieren auf lokalen Dichteberechnungen.
Genannte Verfahren
Als Beispiele werden Quader-Klassifikator, Abstandsklassifikator, Nächste-Nachbarn-Klassifikation, Polynomklassifikator, Clusterverfahren, künstliches neuronales Netz, latente Klassenanalyse und Entscheidungsbaum genannt.