80% der Statistik Basics in 18 min! Ein Leitfaden für Statistik-Einsteiger! numiqo - Deutsch https://www.youtube.com/watch?v=XQIU-4G9-4s Transkript (automatisch erstellt) 0:00 hi in diesem Video möchte ich dir die Welt der Statistik in einfachen Worten und mit vielen anschaulichen Bildern erklären nach dem Video weißt du was 0:09 Statistik ist was deskriptive Statistik ist und was Inferenzstatistik ist also starten wir mit der ersten Frage was ist Statistik Statistik befasst sich mit der 0:19 Erhebung Analyse und Präsentation von Daten ein Beispiel wir möchten wissen ob das Geschlecht einen Einfluss auf die bevorzugte Zeitung hat dann sind 0:30 Geschlecht und Zeitung unsere sogenannten Variablen die wir untersuchen möchten damit wir untersuchen können ob das Geschlecht 0:37 einen Einfluss auf die bevorzugte Zeitung hat müssen wir natürlich erstmal Daten sammeln dazu erstellen wir einen Fragebogen der nach dem Geschlecht und 0:46 der bevorzugten Zeitung fragt dann verschicken wir die Umfrage und warten zwei Wochen anschließend geben wir uns die erhaltenen Antworten in einer 0:54 Tabelle aus in dieser Tabelle haben wir für jede Variable eine Spalte eine für Geschlecht und eine für Zeitung auf der anderen Seite ist jede Reihe eine 1:05 befragte Person die erste Person hat männlich angegeben und die Zeitung die Welt die zweite weiblich und Süddeutsche Zeitung und so weiter und soofort 1:16 natürlich müssen die Daten nicht aus einer Umfrage stammen die Daten können auch aus einem Experiment kommen mit dem du die Wirkung von zwei Medikamenten auf 1:25 den Blutdruck untersuchen möchtest jetzt ist der erste Schritt getan wir haben Daten gesammelt nun können wir mit der Analyse der Daten starten aber was 1:33 wollen wir analysieren wir haben nicht die gesamte Grundgesamtheit befragt sondern nur eine Stichprobe genommen unsere erhobenen Daten stammen also aus 1:42 einer Stichprobe die große Frage ist jetzt wollen wir rein die erhobenen Daten beschreiben oder wollen wir eine Aussage über die gesamte Grundgesamtheit 1:50 treffen wenn wir uns rein auf die Stichprobe beschränken wie also nur die gesammelten Daten beschreiben möchten verwenden wir die deskriptive Statistik 1:59 mit Hilfe der deskriptiven Statistik erhalten wir einen detaillierten Überblick über die stichprobendaten wenn wir jedoch Rückschlüsse auf die 2:07 Grundgesamtheit Zehen wollen müssen wir die Inferenzstatistik verwenden mit Hilfe der Inferenzstatistik können wir ausgehend von den stichprobendaten eine 2:16 Aussage über die Grundgesamtheit treffen schauen wir uns beide Bereiche genauer an starten wir mit der deskriptiven Statistik warum ist die deskriptive 2:25 Statistik so wichtig angenommen ein Unternehmen möchte wissen wie seine Mitarbeiter zur Arbeit fahren um diese Frage zu beantworten erstellt das 2:33 Unternehmen eine kleine Umfrage sobald genügend Daten gesammelt wordurden können diese Daten dann mit Hilfe der deskriptiven Statistik ausgewertet 2:42 werden aber was ist die deskriptive Statistik die deskriptive Statistik befasst sich mit der Zusammenfassung und Darstellung von Daten es ist jedoch 2:51 wichtig zu beachten dass die deskriptive Statistik nur die gesammelten Daten beschreibt ohne Rückschlüsse auf die Grundgesamtheit zu machen einfach 3:00 ausgedrückt nur weil wir wissen wie einige Mitarbeiter eines Unternehmens zur Arbeit kommen können wir nicht sagen wie alle Mitarbeiter des Unternehmens 3:08 zur Arbeit kommen das ist Aufgabe der inferenstatistik auf die wir später eingehen um Daten deskriptiv zu beschreiben schauen wir uns nun die vier 3:16 wichtigsten Bereiche an lagemaße streuungsmaße Tabellen und Diagramme starten wir mit den lagemaßen lagemaße sind z.B der Mittelwert der Median und 3:26 der Modus werfen wir zunächst einen Blick auf den Mittel wert das arithmetische Mittel ist einfach die Summe aller Beobachtungen geteilt durch 3:35 die Anzahl der Beobachtungen ein Beispiel stell dir vor wir haben die Testergebnisse von fünf Schülern den Mittelwert berechnen wir einfach dadurch 3:43 indem wir alle Punktzahlen aufadiieren und durch die Anzahl der Schüler teilen die durchschnittliche testpunktzahl dieser fünf Schüler ist also 3:53 86,6 was ist der Median wenn die Werte in einem Datensatz aufsteigend geordnet sind dann ist der Median an der Wert in der Mitte nun gibt es noch einen 4:02 Unterschied zwischen ungeraden und geraden Zahlen wenn es eine ungerade Zahl an Werten gibt ist der Median einfach der Wert in der Mitte bei einer 4:09 geraden Anzahl von Werten ist der Median der Durchschnitt der beiden mittleren Werte es ist wichtig zu wissen dass der Median robust gegenüber Extremwerten und 4:18 Ausreißern ist schauen wir uns das an einem Beispiel an egal wie groß die letzte Person ist die Person in der Mitte bleibt die Person in der Mitte 4:27 also ändert sich der Median nicht beim Mittelwert hingegen hat es einen Einfluss wie groß die letzte Person ist der Mittelwert ist daher nicht robust 4:35 gegenüber Ausreiser schauen wir uns noch den Modus auch Modalwert genannt an der Modus bezeichnet sich auf den Wert oder die Werte die am häufigsten in einem 4:44 Datensatz vorkommen wenn z.B 14 Personen mit dem Auto zur Arbeit fahren sechs mit dem Fahrrad fünf zu Fuß und fünf mit den öffentlichen Verkehrsmitteln dann ist 4:53 das Auto das häufigste Verkehrsmittel und damit der Modus super dann können wir nun zu den streuungsm Maßen kommen streuungsmaße beschreiben wie weit die 5:02 Werte in einem Datensatz verteilt sind streuungsmaße sind z.B die Varianz die Standardabweichung die Spannweite oder der quartilelsabstand starten wir mit 5:12 der Standardabweichung die Standardabweichung gibt den durchschnittlichen Abstand zwischen den Werten und dem Mittelwert an aber was 5:19 bedeutet das jede Person hat einen gewissen Abstand zum Mittelwert jetzt wollen wir wissen wie weit die Personen im Mittel von dem Mittelwert abweichen 5:28 in diesem Beispiel bitte trägt der mittlere Abweichung vom Mittelwert 11,5 cm zu beachten ist dass es sich hierbei um den quadratischen Mittelwert handelt 5:37 um die Standardabweichung zu berechnen können wir diese Gleichung verwenden σma ist die Standardabweichung n ist die Anzahl der Personen XI ist die Größe der 5:46 jeweiligen Person und x STR der Mittelwert der Personen aber Achtung es gibt zwei leicht unterschiedliche Gleichung für die Standardabweichung der 5:55 Unterschied ist dass wir einmal 1 durch n teilen und einmal 1 dur n- 1 einfach gesagt wenn unsere Umfrage nicht die gesamte Grundgesamtheit abdeckt 6:05 verwenden wir diese Gleichung um die Standardabweichung zu schätzen genauso wenn wir eine klinische Studie durchgeführt haben verwenden wir auch 6:13 diese Gleichung um die Standardabweichung zu schätzen aber was ist der Unterschied zwischen der Standardabweichung und der Varianz wie 6:20 wir jetzt wissen ist die Standardabweichung das quadratische Mittel des Abstandes vom Mittelwert die Varianz ist nun die quadrierte Standard 6:29 Abweichung wenn du mehr über die Standardabweichung und die Varianz wissen möchtest dann schau dir hierfür gerne mein Video an weiter geht's mit 6:36 der Spannweite und dem quartilsabstand die beiden sind einfach zu verstehen die Spannweite ist einfach die Differenz zwischen dem Maximum und dem Minimum der 6:46 quartielsabstand oder interquartielsabstand gibt die mittleren 50% der Daten wieder er ist die Differenz zwischen dem ersten Quartil Q1 6:55 und dem dritten Quartil Q3 daher 25 % der Werte sind kleiner als der quartisabstand und 25% der Werte sind größer der interquartisabstand enthält 7:06 genau die mittleren 50% der Werte bevor wir zu den letzten beiden Punkten kommen lass uns kurz die lagemaße und die steuerungsmaße vergleichen nehmen wir an 7:16 wir messen den Blutdruck von Patienten lagemaße liefern einen einzigen Wert der den gesamten Datensatz beschreibt und dabei helfen einen mittleren Wert 7:26 anzugeben um den die Daten streuen streuungsmaße wie die Standardabweichung die Spannweite und der quartilsabstand geben an wie stark die Daten streuen 7:35 daher ob sie dicht zusammenliegen oder weit voneinander entfernt sind zusammengefasst lagemaße geben einen zentralen Punkt der Daten an während 7:45 steuerungsmaße angeben wie stark die Daten um diesen zentralen Punkt streuen damit schauen wir uns nun die beiden wichtigsten Tabellen an wir werfen einen 7:54 Blick auf die häufigkeitstabelle und die Kreuztabelle eine häufigkeitstabelle gibt an wie wie oft jeder einzelne Wert in einem Datensatz vorkommt schauen wir 8:03 uns das an unserem Beispiel an ein Unternehmen hat seine Mitarbeiter befragt um herauszufinden wie sie zur Arbeit pendeln die Option waren Auto 8:11 Fahrrad zu Fuß und öffentlicher Verkehr hier sind die Ergebnisse von 30 Mitarbeitern der erste antwortet Auto der nächste zu Fuß und so weiter und so 8:21 fort jetzt können wir eine häufigkeitstabell erstellen um diese Daten zusammenzufassen dazu tragen wir einfach die vier möglichen Option Auto 8:30 Fahrrad zu Fuß und öffentlicher Verkehr in die erste Spalte ein und dann sehen wir wie oft sie jeweils vorkommen aus der Tabelle geht hervor dass Auto das 8:40 häufigste Verkehrsmittel der Befragten Person ist 14 Personen bevorzugen es die häufigkeitstabelle bietet also eine übersichtliche Zusammenfassung der Daten 8:49 was ist aber wenn wir nicht nur eine sondern zwei kategoriale Variablen haben dann kommt die Kreuztabelle ins Spiel sagen wir das Unternehmen hat nicht nur 8:57 eine Fabrik sondern zwei eine in Berlin und eine in Hamburg daher fragen wir die Mitarbeiter auch an welchem Standort sie arbeiten wenn wir beide Variablen 9:07 darstellen möchten können wir eine Kreuztabelle verwenden eine Kreuztabelle bietet die Möglichkeit die Beziehung zwischen zwei kategorischen Variablen zu 9:15 analysieren die Reihen in der Kreuztabelle geben die Kategorien der einen variable wieder und die Spalten die Kategorien der anderen variable jede 9:24 Zelle in der Tabelle gibt an wie oft die jeweiligen Kategorien zusammen vorkommen die erste Zelle zeigt z.B an dass sechs Personen Auto und Berlin angegeben haben 9:34 und was ist mit den Diagrammen werfen wir einen Blick auf die wichtigsten hierfür gehen wir einfach auf datatap.de wenn du magst kannst du diesen 9:42 beispieldatensatz über den Link in der Videobeschreibung laden oder du kopierst einfach deine eigenen Daten in diese Tabelle hier unten siehst du die 9:50 Variablen Entfernung zur Arbeit Verkehrsmittel und Standort datatab erkennt automatisch das skaleniveau sollte das nicht richtig sein kannst du 9:58 es hier auch ändern wenn wir nun Verkehrsmittel anklicken erhalten wir hier eine häufigkeitstabelle und wenn wir weiter nach unten scrollen erhalten 10:06 wir ein Balkendiagramm und ein Kreisdiagramm hier auf der linken Seite können wir weitere Einstellung vornehmen z.B ob wir die Häufigkeiten oder die 10:15 Prozentwert angezeigt bekommen wollen oder ob die Balken vertikal oder horizontal sein sollen wenn wir nun noch stad auswählen erhalten wir hier eine 10:24 Kreuztabelle und bei den Diagrammen ein gropiertes Balkendiagramm hier können wir festlegen ob das Diagramm kopiert oder gestapelt sein soll wenn wir auf 10:34 Entfernung zur Arbeit und Verkehrsmittel klicken erhalten wir einen Balkendiagramm bei dem die Höhe der Balken die Mittelwerte der einzelnen 10:41 Gruppen wiedergibt hier können wir auch die Streuung Anzeigen außerdem erhalten wir ein Histogramm ein Boxplot ein violinplot und ein Rainbow Plot wenn du 10:51 mehr über den Boxplot den violin Plot oder den Rainbow Plot erfahren möchtest schau dir hierfür gerne unsere Videos an damit kommen wir nun zuur 10:59 Inferenzstatistik wir starten mit der Frage was Inferenzstatistik ist und dann besprechen wir die sechs wichtigsten Schritte der 11:06 Inferenzstatistik was ist also Inferenzstatistik mit Hilfe der Inferenzstatistik können wir aus den Daten einer Stichprobe Rückschlüsse über 11:14 die Grundgesamtheit treffen was ist die Grundgesamtheit und was ist die Stichprobe die Grundgesamtheit sind alle Personen an denen wir interessiert sind 11:22 wenn du die durchschnittliche Körpergröße aller Erwachsenen in den USA untersuchen möchtest dann wäre die grundgesamt alle Erwachsenen in den USA 11:31 die Stichprobe ist eine kleinere Gruppe von Personen die wir tatsächlich untersuchen und die natürlich aus der Grundgesamtheit stammt es wurden z.B 150 11:40 Erwachsene aus den USA gezogen und jetzt wollen wir diese Stichprobe verwenden um eine Aussage über die Grundgesamtheit zu treffen und hier sind die sechs Schritte 11:49 wie wir das machen Nummer 1 Hypothese zuerst brauchen wir natürlich eine Aussage eine Hypothese die wir testen möchten wir wollen z.B wissen ob ein ein 11:59 Medikament eine positive Wirkung auf den Blutdruck von Patienten mit hohen Blutdruck hat aber was kommt als nächstes in unserer Hypothese haben wir 12:07 angenommen dass wir Menschen mit hohem Blutdruck untersuchen möchten unsere Grundgesamtheit besteht also aus allen Menschen mit hohen Blutdruck z.B in den 12:16 USA natürlich können wir nicht von der gesamten Grundgesamtheit Daten sammeln also nehmen wir eine Stichprobe aus der Grundgesamtheit anhand dieser Stichprobe 12:25 möchten wir nun eine Aussage über die Grundgesamtheit treffen aber wie machen wir das hierfür brauchen wir einen Hypothesentest Hypothesentest überprüfen 12:34 eine Aussage über einen Parameter in der Grundgesamtheit anhand von Daten aus einer Stichprobe perfekt das ist genau das was wir brauchen es gibt viele 12:44 verschiedene hypotheesentests am Ende des Videos zeige ich dir einen Weg wie du einfach den richtigen Test finden kannst und natürlich findest du auf 12:52 unserem youtubeekal Videos zu den meisten Hypothesentests aber wie funktioniert ein Hypothesentest wenn wir einen Hypothesentest durchführen starten 13:00 wir mit einer forschungshypothese auch Alternativhypothese genannt dies ist die Hypothese die wir belegen möchten in unserem Fall lautet die 13:09 forschungshypothese das Medikament hat eine Wirkung auf den Blutdruck aber diese Hypothese können wir leider nicht direkt mit einem klassischen 13:16 Hypothesentest testen also testen wir die gegengesetzte Hypothese die sogenannte Nullhypothese dass das Medikament keine Wirkung hat aber was 13:26 bedeutet das zunächst gehen wir davon aus dass das Medikament in der Grundgesamtheit keine Wirkung hat wir gehen also davon aus dass Menschen die 13:34 das Medikament einnehmen und Menschen die das Medikament nicht einnehmen im Durchschnitt den gleichen Blutdruck haben wenn wir nun eine Stichprobe 13:42 ziehen und in dieser Stichprobe hat das Medikament eine große Wirkung dann können wir fragen wie wahrscheinlich ist es eine solche Stichprobe zu ziehen oder 13:51 eine die noch mehr abweicht wenn das Medikament eigentlich keine Wirkung hat in Wirklichkeit gibt es also im Durchschnitt keinen Unterschied wenn 14:00 diese Wahrscheinlichkeit sehr gering ist können wir uns fragen vielleicht hat das Medikament eine Wirkung in der Grundgesamtheit und wir haben vielleicht 14:07 genügend Indizien die Nullhypothese dass das Medikament keine Wirkung hat zu verwerfen und genau diese Wahrscheinlichkeit gibt der p-Wert 14:15 wieder fassen wir dies in drei einfachen Schritten zusammen Nummer 1 die Nullhypothese sagt dass es keinen Unterschied in der Grundgesamtheit gibt 14:24 Nummer 2 der Hypothesentest bestimmt wie stark die Stich Probe von der Nullhypothese abweicht Nummer 3 der pwert gibt an wie hoch die 14:34 Wahrscheinlichkeit ist eine Stichprobe zu ziehen die genauso stark abweicht wie unsere Stichprobe oder sogar noch stärker als unsere Stichprobe wenn die 14:42 Nullhypothese als wahr angenommen wird aber ab wann ist der p-Wert klein genug um die Nullhypothese zu verwerfen das bringt uns zum nächsten Punkt 14:50 statistische Signifikanz wenn der p-Wert unter einem vorher festgelegten Schwellwert liegt ist das Ergebnis statistisch signifikant das bedeutet es 15:00 ist unwahrscheinlich dass das Ergebnis rein durch Zufall entstanden ist und dass wir genug Indizien haben die Nullhypothese zu verwerfen dieser 15:08 Schwellwert liegt oft bei 0,05 also 5%. ein kleiner p-Wert deutet also darauf hin dass die erhobenen Daten unsere Stichprobe mit der Nullhypothese 15:18 inkonsistent sind das führt dazu dass wir die Nullhypothese zu Gunsten der Alternativhypothese ablehnen ein großer p-Wert deutet darauf hin dass die 15:27 erhobene Daten istent mit der Nullhypothese sind und wir verwerfen nicht die Nullhypothese aber Achtung es besteht immer das Risiko einen Fehler zu 15:36 machenen ein kleiner p-Wert beweist nicht dass die Alternativhypothese wahr ist es sagt nur dass es unwahrscheinlich ist ein solches Ergebnis oder ein noch 15:46 extremeres zu erhalten wenn die Nullhypothese wahr ist und wie wir nun wissen wenn die Nullhypothese wahr ist gibt es keinen Unterschied in der 15:54 Grundgesamtheit umgekehrt beweist ein großer pwert nicht dass die Nullhypothese wahr ist er besagt nur dass es wahrscheinlich ist ein solches 16:03 Ergebnis oder ein noch extremeres zu erhalten wenn die Nullhypothese wahr ist es gibt also zwei Arten von Fehlern den Fehler erste Art und den Fehler zweite 16:13 Art starten wir mit dem Fehler erster Art bei einem Hypothesentest erhalten wir einen Fehler erster Art wenn eine wahre Nullhypothese abgelehnt wird in 16:22 Wirklichkeit ist die Nullhypothese also wahr aber wir entscheiden uns dazu die Nullhypothese zu verweren en in unserem Beispiel bedeutet das dass das 16:31 Medikament eigentlich keine Wirkung hat in Wirklichkeit gibt es also keinen Unterschied im Blutdruck zwischen den Personen die das Medikament einnehmen 16:39 und denen die es nicht einnehmen im Mittel ist in beiden Fällen der Blutdruck gleich aber unsere Stichprobe war zufällig so weit von der 16:46 Grundgesamtheit entfernt dass wir fälschlicherweise dachten das Medikament wirkt und ein Fehler zweite tritt auf wenn die Nullhypothese in der 16:55 Grundgesamtheit falsch ist jedoch im Rahmen des Hypothesen Test beibehalten wird in Wirklichkeit ist die Nullhypothese also falsch aber wir 17:03 treffen die Entscheidung die Nullhypothese nicht zu verwerfen in unserem Beispiel bedeutet das das Medikament hat tatsächlich gewirkt es 17:11 gibt einen Unterschied zwischen denen die das Medikament genommen haben und denen die es nicht genommen haben aber es war reiner Zufall dass die entnommene 17:19 Stichprobe keinen großen Unterschied zeigte und wir fälschlicherweise dachten dass das Medikament nicht wirkt und jetzt zeige ich dir wie die data hilft 17:28 einen geeigneten Hypothesentest zu finden und den Hypothesentest natürlich auch für dich berechnet und die Ergebnisse interpretiert dafür gehen wir 17:37 einfach auf datadap.de und wir kopieren unsere eigenen Daten hier in diese Tabelle ich verwende einfach mal diesen beispieldatensatz zugegeben der ist ein 17:46 wenig klein nachdem du deine Daten in die Tabelle kopiert hast erscheinen die Variablen hier unten datatab versucht automatisch das richtige skaliveau zu 17:55 bestimmen aber du kannst es natürlich auch hier oben ändern jetzt klicken wir einfach auf Hypothesentest und wählen die Variablen aus für die wir einen 18:03 Hypothesentest berechnen möchten datasep schlägt ihr dann einen geeigneten Test vor z.B wenn wir diese beiden Variablen anklicken einen 18:12 kquadrattest oder wenn wir diese Variablen Anklicken eine Varianzanalyse dann siehst du die Hypothesen und anschließend die 18:20 Ergebnisse wenn du dir nicht sicher bist wie Du die Ergebnisse interpretieren kannst klicke auf Zusammenfassung in Worten 18:28 außerdem kannst du die Voraussetzung prüfen und entscheiden ob du einen parametrischen oder einen nichtparametrischen Test berechnen 18:35 möchtest was der Unterschied zwischen parametrischen Test und nicht parametrischen Test ist erfährst in meinem nächsten Video ciao und bis zum 18:43 nächsten Mal