Zum Inhalt springen
L

Wikipedia · einfach zusammengefasst · Stand

Explorative Datenanalyse

Die explorative Datenanalyse (EDA) oder explorative Statistik ist ein Teilgebiet der Statistik. Sie untersucht und begutachtet Daten, von denen nur ein …

Inhalt5 Abschnitte
  1. 1. Grundidee und Bedeutung
  2. 2. Ziele
  3. 3. Methoden und Verfahren
  4. 4. Spezielle Verfahren
  5. 5. Risiken und Abgrenzung

Grundidee und Bedeutung

Die explorative Datenanalyse (EDA), auch explorative Statistik genannt, ist ein Teilgebiet der Statistik. Sie untersucht und begutachtet Daten, über deren Zusammenhänge zunächst nur wenig bekannt ist. Ziel ist nicht zuerst, eine fertige Hypothese zu prüfen, sondern in den Daten Muster, Auffälligkeiten und mögliche Erklärungen zu entdecken.

Viele Techniken der EDA werden im Data-Mining eingesetzt. Außerdem wird EDA häufig in Statistik-Lehrveranstaltungen genutzt, weil sie einen anschaulichen Einstieg in statistisches Denken bietet. John W. Tukey führte die Bezeichnung in den 1970er Jahren ein. Er kritisierte, dass Statistik zu stark auf das Auswerten und Testen vorgegebener Hypothesen ausgerichtet sei, und schlug vor, Daten auch zur Gewinnung möglicher Hypothesen zu verwenden, die anschließend getestet werden.

Ziele

Die explorative Statistik soll helfen, Annahmen oder Hypothesen über Ursache und Grund beobachteter Daten zu bilden. Sie dient außerdem dazu einzuschätzen, worauf statistische Inferenz, also schließende Statistik, sinnvoll basieren kann.

Weitere Ziele sind die Auswahl passender statistischer Werkzeuge und Techniken sowie die Vorbereitung weiterer Datensammlungen. Dazu können zum Beispiel Umfragen oder statistische Versuchsplanung gehören.

Methoden und Verfahren

In der EDA werden besonders häufig grafische Methoden verwendet, weil sie Strukturen und Auffälligkeiten in Daten sichtbar machen. Zu den grundlegenden grafischen Verfahren gehören Box-Plot, Histogramm, QQ-Diagramm, Streudiagramm, Mosaik-Plot, MultiVari Chart, Run Chart, Paretodiagramm und Stamm-Blatt-Diagramm.

Daneben gibt es grundlegende quantitative Methoden. Dazu zählen Median polish, Letter values, Resistant line, Resistant smooth und Rootogram. Diese Verfahren beschreiben Daten rechnerisch oder unterstützen robuste Auswertungen, also Auswertungen, die weniger empfindlich gegenüber Ausreißern oder ungewöhnlichen Werten sind.

Spezielle Verfahren

Als spezielle Verfahren nennt der Artikel Grand Tour, Projection Pursuit und Falscherkennungsrate. Sie gehören zu weiterführenden Methoden der explorativen Datenanalyse und dienen dazu, komplexere Datenstrukturen oder besondere Auswertungsfragen zu untersuchen.

Risiken und Abgrenzung

Ein Problem entsteht, wenn mit demselben Datensatz zuerst Hypothesen gebildet und diese anschließend auch auf demselben Datensatz getestet werden. Dadurch können scheinbar signifikante Resultate oder Scheinkorrelationen entstehen, die sich in einem unabhängigen Datensatz zum gleichen Sachverhalt nicht wieder zeigen. Dieses Problem wird als P-Hacking bezeichnet.

Ein Ausweg ist die strikte Trennung von Datensätzen: Ein Datensatz wird genutzt, um Hypothesen zu bilden, ein anderer zur Validierung der gefundenen Hypothesen. Der Artikel verweist hierzu auf Kreuzvalidierungsverfahren.

EDA ist eine Weiterentwicklung der deskriptiven Statistik und arbeitet stärker induktiv: Aus den Daten werden Neues, Vermutungen, Besonderheiten und Darstellungen gewonnen. Die beurteilende Statistik arbeitet dagegen deduktiv: Eine Hypothese wird verworfen oder beibehalten. Beide Ansätze schließen sich nicht aus, sondern ergänzen sich.

Weiterlesen

Daten Daten bezeichnet als Plural von Datum Fakten, Zeitpunkte oder kalendarische Zeitangaben. Als Pluralwort steht es für durch Beobachtungen, Messungen u. a. Data-Mining Andere Verfahren wie der EM-Algorithmus oder k-Means-Algorithmus bevorzugen sphärische Cluster. Objekte, die keinem Cluster zugeordnet wurden, können als … John W. Tukey John Wilder Tukey (* 16. Juni 1915 in New Bedford, Massachusetts; † 26. Juli 2000 in New Brunswick (New Jersey)) war ein US-amerikanischer Statistiker. Hypothese Eine Hypothese (von altgriechisch ὑπόθεσις hypóthesis → spätlateinisch hypothesis, wörtlich ‚Unterstellung') im wissenschaftlichen Sinn ist eine auf dem … Ziel Unternehmen · Unternehmensziele · Arbeitssicherheit, Führungsziele, Gewinnmaximierung, Leistungsziele, Liquidität, Organisationsziele, Rentabilität … Statistische Versuchsplanung Mit der statistischen Versuchsplanung wird mit möglichst wenigen Versuchen (Einzelexperimenten) der Wirkzusammenhang zwischen Einflussfaktoren (= unabhängige … Box-Plot Ein Box-Plot soll schnell einen Eindruck davon vermitteln, in welchem Bereich die Daten liegen und wie sie sich über diesen Bereich verteilen. Dazu werden alle … Histogramm Die Höhe jedes Rechtecks stellt dann die (relative oder absolute) Häufigkeitsdichte dar, also die (relative oder absolute) Häufigkeit dividiert durch die Breite … Streudiagramm Ein Streudiagramm, auch Punktwolke genannt (engl. scatter plot), ist die graphische Darstellung von beobachteten Wertepaaren zweier statistischer Merkmale. Deskriptive Statistik Tabellen: In Tabellen werden Daten in einer Matrix mit Zeilen und Spalten dargestellt, wenn die Datenstruktur dies erlaubt. Dabei entspricht üblicherweise …