Wikipedia · einfach zusammengefasst · Stand
Explorative Datenanalyse
Die explorative Datenanalyse (EDA) oder explorative Statistik ist ein Teilgebiet der Statistik. Sie untersucht und begutachtet Daten, von denen nur ein …
Inhalt5 Abschnitte
Grundidee und Bedeutung
Die explorative Datenanalyse (EDA), auch explorative Statistik genannt, ist ein Teilgebiet der Statistik. Sie untersucht und begutachtet Daten, über deren Zusammenhänge zunächst nur wenig bekannt ist. Ziel ist nicht zuerst, eine fertige Hypothese zu prüfen, sondern in den Daten Muster, Auffälligkeiten und mögliche Erklärungen zu entdecken.
Viele Techniken der EDA werden im Data-Mining eingesetzt. Außerdem wird EDA häufig in Statistik-Lehrveranstaltungen genutzt, weil sie einen anschaulichen Einstieg in statistisches Denken bietet. John W. Tukey führte die Bezeichnung in den 1970er Jahren ein. Er kritisierte, dass Statistik zu stark auf das Auswerten und Testen vorgegebener Hypothesen ausgerichtet sei, und schlug vor, Daten auch zur Gewinnung möglicher Hypothesen zu verwenden, die anschließend getestet werden.
Ziele
Die explorative Statistik soll helfen, Annahmen oder Hypothesen über Ursache und Grund beobachteter Daten zu bilden. Sie dient außerdem dazu einzuschätzen, worauf statistische Inferenz, also schließende Statistik, sinnvoll basieren kann.
Weitere Ziele sind die Auswahl passender statistischer Werkzeuge und Techniken sowie die Vorbereitung weiterer Datensammlungen. Dazu können zum Beispiel Umfragen oder statistische Versuchsplanung gehören.
Methoden und Verfahren
In der EDA werden besonders häufig grafische Methoden verwendet, weil sie Strukturen und Auffälligkeiten in Daten sichtbar machen. Zu den grundlegenden grafischen Verfahren gehören Box-Plot, Histogramm, QQ-Diagramm, Streudiagramm, Mosaik-Plot, MultiVari Chart, Run Chart, Paretodiagramm und Stamm-Blatt-Diagramm.
Daneben gibt es grundlegende quantitative Methoden. Dazu zählen Median polish, Letter values, Resistant line, Resistant smooth und Rootogram. Diese Verfahren beschreiben Daten rechnerisch oder unterstützen robuste Auswertungen, also Auswertungen, die weniger empfindlich gegenüber Ausreißern oder ungewöhnlichen Werten sind.
Spezielle Verfahren
Als spezielle Verfahren nennt der Artikel Grand Tour, Projection Pursuit und Falscherkennungsrate. Sie gehören zu weiterführenden Methoden der explorativen Datenanalyse und dienen dazu, komplexere Datenstrukturen oder besondere Auswertungsfragen zu untersuchen.
Risiken und Abgrenzung
Ein Problem entsteht, wenn mit demselben Datensatz zuerst Hypothesen gebildet und diese anschließend auch auf demselben Datensatz getestet werden. Dadurch können scheinbar signifikante Resultate oder Scheinkorrelationen entstehen, die sich in einem unabhängigen Datensatz zum gleichen Sachverhalt nicht wieder zeigen. Dieses Problem wird als P-Hacking bezeichnet.
Ein Ausweg ist die strikte Trennung von Datensätzen: Ein Datensatz wird genutzt, um Hypothesen zu bilden, ein anderer zur Validierung der gefundenen Hypothesen. Der Artikel verweist hierzu auf Kreuzvalidierungsverfahren.
EDA ist eine Weiterentwicklung der deskriptiven Statistik und arbeitet stärker induktiv: Aus den Daten werden Neues, Vermutungen, Besonderheiten und Darstellungen gewonnen. Die beurteilende Statistik arbeitet dagegen deduktiv: Eine Hypothese wird verworfen oder beibehalten. Beide Ansätze schließen sich nicht aus, sondern ergänzen sich.