Wikipedia · einfach zusammengefasst · Stand
Data-Mining
Andere Verfahren wie der EM-Algorithmus oder k-Means-Algorithmus bevorzugen sphärische Cluster. Objekte, die keinem Cluster zugeordnet wurden, können als …
Inhalt6 Abschnitte
Kernidee und Einordnung
Data Mining bezeichnet als Teilgebiet der Informatik und Informationstechnik die systematische Anwendung statistischer Methoden auf große Datenbestände, zum Beispiel in Datenbanken. Ziel ist es, neue Querverbindungen, Trends oder Muster zu erkennen und die daraus gewonnene Information weiterzuverwenden. In Big-Data-Architekturen ist Data Mining ein zentraler Baustein für die Analyse von Daten.
Fachleute definieren Data Mining als „ein[en] Schritt des KDD-Prozesses, der darin besteht, Datenanalyse- und Entdeckungsalgorithmen anzuwenden, die unter akzeptablen Effizienzbegrenzungen eine spezielle Auflistung von Mustern (oder Modellen) der Daten liefern“. Nach dem NIST ist Data Mining ein „analytischer Prozess, der darauf abzielt, in großen Datensätzen Korrelationen oder Muster zu finden, um Daten oder Wissen zu erschließen.“
Im engeren Sinn ist Data Mining nur der eigentliche Analyseschritt innerhalb der „Knowledge Discovery in Databases“ (KDD), also der Wissensentdeckung in Datenbanken. In der Praxis wurde der Begriff seit den 1990er bis 2000er Jahren aber oft auf den gesamten KDD-Prozess übertragen, der auch Vorverarbeitung und Auswertung umfasst. Seit den 2010er Jahren gewann Data Mining durch große Datenmengen und Big Data weiter an Bedeutung. Die Digitalisierung von Informationen seit etwa den 2000er Jahren wird im Artikel als „Datafizierung“ bezeichnet.
Wichtig ist die Abgrenzung: Data Mining meint im wissenschaftlichen Kontext nicht einfach das Erfassen, Speichern oder Verarbeiten großer Datenmengen. Es geht um die Extraktion von Wissen, das „gültig (im statistischen Sinne), bisher unbekannt und potentiell nützlich“ ist, um Regelmäßigkeiten, Gesetzmäßigkeiten und verborgene Zusammenhänge zu bestimmen. Der Begriff ist insofern irreführend, als nicht neue Daten „abgebaut“ werden, sondern Wissen aus bereits vorhandenen Daten gewonnen wird.
Technische Grundlagen und Ablauf
Viele Data-Mining-Verfahren stammen aus der Statistik, besonders aus der multivariaten Statistik, also der Analyse mehrerer Merkmale zugleich. Für Data Mining werden sie oft so angepasst, dass sie auch bei großen Datenmengen in akzeptabler Zeit funktionieren. Dabei kann Genauigkeit verloren gehen; aus rein statistischer Sicht können Verfahren dadurch problematisch sein. In der praktischen Anwendung zählen jedoch häufig experimentell geprüfter Nutzen und akzeptable Laufzeit. Das Schließen von Daten auf hypothetische Modelle heißt statistische Inferenz.
Auch Datenbanktechnik ist wichtig. Datenbanksysteme und insbesondere Indexstrukturen können die Komplexität verringern. Eine typische Aufgabe ist die Nächste-Nachbarn-Suche, bei der ähnliche oder nahe Datenobjekte gefunden werden. Ein geeigneter Datenbankindex kann solche Suchen beschleunigen und dadurch die Laufzeit eines Data-Mining-Algorithmus verbessern.
Data Mining ist eng mit maschinellem Lernen verwandt. Beim Data Mining liegt der Schwerpunkt auf dem Finden „neuer“ Muster. Beim maschinellen Lernen sollen dagegen vor allem „bekannte“ Muster automatisch in neuen Daten wiedererkannt werden. Die Trennung ist aber nicht immer klar: Assoziationsregeln aus Daten zu gewinnen ist typisch für Data Mining, kann aber auch Ziele des maschinellen Lernens erfüllen. Unüberwachtes Lernen ist besonders eng mit Data Mining verwandt.
Ein verbreitetes Prozessmodell ist CRISP-DM, der Cross Industry Standard Process for Data Mining. Der Ablauf beginnt mit Aufgabendefinition, Zweck oder Kundenanforderung. Danach folgen Fokussieren und Verstehen der Daten, Datenerhebung und Selektion sowie das Bestimmen vorhandenen Wissens. Anschließend werden Daten vorverarbeitet, etwa durch Bereinigung, Integration von Quellen und Beseitigung von Inkonsistenzen. Danach werden sie in ein passendes Format transformiert, zum Beispiel durch Attributauswahl oder Diskretisierung. Es folgt die Modellierung als eigentlicher Data-Mining-Schritt. Danach werden die gefundenen Muster durch Fachleute evaluiert und die Ziele kontrolliert. Zum Schluss werden Ergebnisse eingesetzt oder der Prozess wird in einer weiteren Iteration wiederholt.
Typische Aufgaben
Typische Aufgaben des Data Mining sind Ausreißer-Erkennung, Clusteranalyse, Klassifikation, Assoziationsanalyse, Regressionsanalyse und Zusammenfassung. Grob lassen sie sich in Beobachtungsprobleme und Prognoseprobleme gliedern. Zu den Beobachtungsproblemen zählen Ausreißer-Erkennung und Clusteranalyse; zu den Prognoseproblemen zählen Klassifikation und Regressionsanalyse.
Bei der Ausreißer-Erkennung werden Datenobjekte gesucht, die nicht zum Rest der Daten passen. Das können ungewöhnliche Attributswerte, Fehler oder Abweichungen von einem Trend sein. Der Local Outlier Factor sucht zum Beispiel Objekte, deren Dichte deutlich von der Dichte ihrer Nachbarn abweicht; dies heißt dichtebasierte Ausreißer-Erkennung. Ausreißer werden oft manuell geprüft und aus dem Datensatz ausgeblendet, weil sie andere Verfahren stören können. In Bereichen wie Betrugserkennung sind gerade diese Ausreißer besonders interessant.
Die Clusteranalyse sucht Gruppen von Objekten, die einander ähnlicher sind als Objekte anderer Gruppen. Solche Gruppen heißen Cluster. Verfahren wie DBSCAN oder OPTICS können Cluster beliebiger Formen finden, während der EM-Algorithmus oder der k-Means-Algorithmus eher sphärische Cluster bevorzugen. Objekte ohne Clusterzuordnung können als Ausreißer gelten.
Bei der Klassifikation werden Objekte vordefinierten Klassen zugeordnet, etwa „Fahrräder“ oder „Autos“. Anders als bei der Clusteranalyse sind die Klassen hier normalerweise vorher bekannt. Verfahren aus dem maschinellen Lernen helfen dann, neue oder bisher nicht zugeordnete Objekte einzuordnen.
Die Assoziationsanalyse sucht häufige Zusammenhänge und formuliert sie meist als Regeln, etwa „Aus A und B folgt normalerweise C“. Ein bekanntes, im Artikel als anscheinend fiktiv bezeichnetes Beispiel ist die Warenkorbanalyse mit der Regel „Kunde kauft Windeln ⇒ Kunde kauft Bier“. Daraus wurde angeblich abgeleitet, dass Männer beim Windelkauf zusätzlich Bier kaufen, und das Bierregal entsprechend platziert.
Die Regressionsanalyse modelliert statistische Zusammenhänge zwischen abhängigen und unabhängigen Variablen. Damit lassen sich fehlende Werte prognostizieren oder Abweichungen analysieren. Werden Erkenntnisse aus der Clusteranalyse genutzt und eigene Modelle pro Cluster berechnet, können Prognosen oft besser werden. Die Zusammenfassung reduziert große und komplexe Datensätze auf handhabbare Beschreibungen, ohne wesentlichen Informationsverlust. Dabei helfen Ausreißer-Erkennung, Clusteranalyse, Regressionsanalyse, Klassifikation und Assoziationsanalyse, weil sie wichtige Einzelobjekte, Gruppen oder abstrakte Modelle liefern.
Spezialisierungen und Anwendungen
Neben allgemeinen Verfahren gibt es Spezialisierungen für besondere Datentypen. Textmining analysiert große Textbestände. Es kann zum Beispiel der Plagiats-Erkennung dienen oder Texte klassifizieren. Webmining untersucht verteilte Daten wie Internetseiten. Dabei werden nicht nur Seiteninhalte betrachtet, sondern besonders auch Beziehungen zwischen Seiten, also Hyperlinks. Zusätzliche Schwierigkeiten entstehen durch ständig wechselnde Inhalte und nicht garantierte Verfügbarkeit. Webmining ist eng mit Information Retrieval verbunden, also der computergestützten Suche nach komplexen Inhalten und ihrer Darstellung für Nutzer.
Die Zeitreihenanalyse betrachtet Daten, bei denen zeitliche Aspekte wichtig sind. Dabei können bestehende Data-Mining-Verfahren mit speziellen Distanzfunktionen wie der Dynamic-Time-Warping-Distanz verwendet werden. Eine wichtige Aufgabe ist es, Reihen mit ähnlichem Verlauf zu erkennen, auch wenn sie zeitlich verschoben sind.
In der Industrie und in verwandten Bereichen der Informatik wird Data Mining vielfältig eingesetzt. Beispiele sind Entscheidungsunterstützungssysteme, Betrugserkennung bei Rechnungsprüfung, Kreditscoring zur Bestimmung von Ausfallwahrscheinlichkeiten, Marktsegmentierung, Warenkorbanalyse, Zielgruppen-Auswahl für Werbung, Kundenprofile im Customer-Relationship-Management, Business Intelligence, Angriffserkennung, Empfehlungsdienste für Filme oder Musik, Netzwerkanalyse in sozialen Netzwerken, Web-Usage-Mining, Text Mining, Pharmakovigilanz, Medizin, Pflegewesen, Bibliometrie, explorative Datenanalyse sowie Prozessanalyse und Prozessoptimierung.
Bei technischen Prozessen kann Data Mining Zusammenhänge zwischen Prozessgrößen sichtbar machen und so Steuerung und Optimierung unterstützen. Erste erfolgreiche Ansätze werden für chemische Industrie und Kunststoffverarbeitung genannt. Auch Produktdaten aus Wartung, Service und dem Produktlebenszyklus können analysiert werden, um Produkte zu verbessern und Innovationen zu erzeugen.
Im Bildungsbereich heißt die Anwendung Educational Data Mining. Besonders in der Hochschullehre sollen aus großen Datenmengen überschaubare Typen, Profile, Zusammenhänge, Cluster, typische Abfolgen und kritische Werte ermittelt werden. Daraus werden Handlungsempfehlungen abgeleitet, um pädagogische Prozesse planen zu können.
Probleme und Bewertung
Viele Schwierigkeiten entstehen durch ungenügende Vorverarbeitung oder durch systematische Fehler und Verzerrungen bei der Datenerfassung. Solche Probleme sind oft statistischer Natur und müssen bereits beim Erfassen gelöst werden. Aus nicht repräsentativen Daten können keine repräsentativen Ergebnisse gewonnen werden. Deshalb sind ähnliche Anforderungen wichtig wie bei der Erstellung einer repräsentativen Stichprobe.
Ein weiteres Problem ist die Parametrisierung. Viele Algorithmen besitzen mehrere Parameter, die passend gewählt werden müssen. Zwar können verschiedene Einstellungen gültige Ergebnisse liefern, aber nicht alle Ergebnisse sind nützlich. Beim Clusteranalyse-Algorithmus DBSCAN führen kleine Werte für minPts und ε zu einer fein aufgelösten Struktur, können Cluster aber in kleine Stücke zerlegen. Größere Werte finden eher nur Hauptcluster, die möglicherweise schon bekannt sind. OPTICS ist eine Weiterentwicklung von DBSCAN und eliminiert den Parameter ε weitgehend.
Die Evaluation, also Bewertung der Ergebnisse, ist schwierig, weil Data Mining neue Erkenntnisse liefern soll. Bei Prognoseproblemen wie Klassifikation, Regressionsanalyse und Assoziationsanalyse kann man prüfen, wie gut die Prognose auf neuen Daten funktioniert. Bei Beschreibungsproblemen wie Ausreißer-Erkennung und Clusteranalyse ist das schwieriger. Cluster werden intern anhand mathematischer Kompaktheit oder extern anhand ihrer Übereinstimmung mit bekannten Klassen bewertet. Ausreißer-Ergebnisse werden mit bekannten Ausreißern verglichen. Dabei bleibt die Frage, ob wirklich neue Erkenntnisse bewertet werden oder nur die Reproduktion alter Erkenntnisse.
Auch die Interpretation ist entscheidend. Die Algorithmen analysieren Daten statistisch, besitzen aber kein Hintergrundwissen über die Bedeutung der Daten. Sie liefern meist einfache Modelle wie Gruppen oder Mittelwerte. Ergebnisse können schwer nachvollziehbar sein und müssen von Nutzerinnen und Nutzern interpretiert werden, bevor man sie tatsächlich als Wissen bezeichnen kann.
Recht, Moral und Software
Data Mining als wissenschaftliche Disziplin ist zunächst wertneutral. Die Verfahren können Daten aus fast beliebigen Quellen analysieren, etwa Messwerte von Bauteilen oder historische Knochenfunde. Wenn sich Daten jedoch auf Personen beziehen, entstehen rechtliche und moralische Probleme. Diese beginnen oft schon bei Erfassung und Speicherung der Daten, nicht erst bei der Analyse.
Rechtlich problematisch ist, dass unzureichend anonymisierte Daten durch Analyse wieder konkreten Personen zugeordnet werden können. Das nennt man Deanonymisierung. Der Artikel betont, dass dafür oft einfachere Methoden als Data Mining ausreichen. Werden Bewegungsdaten nur pseudonymisiert, kann eine einfache Datenbankanfrage genügen, um Personen zu identifizieren, wenn Wohnort und Arbeitsplatz bekannt sind. Häufig reichen die 2–3 Orte, an denen jemand die meiste Zeit verbringt, zur eindeutigen Identifizierung. Nach Datenschutzrecht betrifft das allgemein die „Erhebung, Verarbeitung oder Nutzung“ personenbezogener Daten. Ein zuverlässiger Schutz vor missbräuchlicher Analyse ist nur möglich, wenn entsprechende Daten gar nicht erst erfasst und gespeichert werden.
Moralisch stellt sich die Frage, ob Computerprogramme Menschen in Klassen einteilen sollten. Viele Verfahren eignen sich auch zur Überwachung und zu fortgeschrittener Rasterfahndung. Als Beispiel nennt der Artikel den SCHUFA-Score, der Menschen durch Statistik, vielleicht auch Data Mining, in „kreditwürdig“ und „nicht kreditwürdig“ einteilt und kritisiert wird.
Psychologisch kann es problematisch sein, Menschen mit Wahrscheinlichkeitsberechnungen über sich selbst zu konfrontieren. Die Verfahren arbeiten wertneutral, aber die Ergebnisse können überraschen, beleidigen oder befremden. Der Artikel nennt als Beispiele Google-Zielgruppen, die oft falsch liegen können, und eine amerikanische Kaufhauskette, die anhand von Einkaufsverhalten eine Schwangerschaft und sogar das Geburtsdatum vorhersagen kann.
Als Softwarepakete nennt der Artikel unter anderem Clustan, ELKI, KNIME, Neural Designer, PSPP, das GNU R-Projekt, RapidMiner, WEKA und Scikit-learn. Ihre Schwerpunkte liegen je nach Paket etwa auf Clusteranalyse, Ausreißer-Erkennung, Statistik, Regressionsanalyse, maschinellem Lernen oder dem gesamten Data-Mining-Prozess.