Zum Inhalt springen
L

Das Video kommt von YouTube: erst beim Abspielen verbindet sich die Seite mit YouTube (Google).

80% der Statistik Basics in 18 min! Ein Leitfaden für Statistik-Einsteiger!

numiqo - Deutsch18:49 152.446 Aufrufe veröffentlicht Auf YouTube

Das Wichtigste aus dem Video

Tipp auf eine Zeit – das Video springt genau dorthin.

Transkriptautomatisch erstellt · 129 Zeilen
Herunterladen
  1. hi in diesem Video möchte ich dir die Welt der Statistik in einfachen Worten und mit vielen anschaulichen Bildern erklären nach dem Video weißt du was
  2. Statistik ist was deskriptive Statistik ist und was Inferenzstatistik ist also starten wir mit der ersten Frage was ist Statistik Statistik befasst sich mit der
  3. Erhebung Analyse und Präsentation von Daten ein Beispiel wir möchten wissen ob das Geschlecht einen Einfluss auf die bevorzugte Zeitung hat dann sind
  4. Geschlecht und Zeitung unsere sogenannten Variablen die wir untersuchen möchten damit wir untersuchen können ob das Geschlecht
  5. einen Einfluss auf die bevorzugte Zeitung hat müssen wir natürlich erstmal Daten sammeln dazu erstellen wir einen Fragebogen der nach dem Geschlecht und
  6. der bevorzugten Zeitung fragt dann verschicken wir die Umfrage und warten zwei Wochen anschließend geben wir uns die erhaltenen Antworten in einer
  7. Tabelle aus in dieser Tabelle haben wir für jede Variable eine Spalte eine für Geschlecht und eine für Zeitung auf der anderen Seite ist jede Reihe eine
  8. befragte Person die erste Person hat männlich angegeben und die Zeitung die Welt die zweite weiblich und Süddeutsche Zeitung und so weiter und soofort
  9. natürlich müssen die Daten nicht aus einer Umfrage stammen die Daten können auch aus einem Experiment kommen mit dem du die Wirkung von zwei Medikamenten auf
  10. den Blutdruck untersuchen möchtest jetzt ist der erste Schritt getan wir haben Daten gesammelt nun können wir mit der Analyse der Daten starten aber was
  11. wollen wir analysieren wir haben nicht die gesamte Grundgesamtheit befragt sondern nur eine Stichprobe genommen unsere erhobenen Daten stammen also aus
  12. einer Stichprobe die große Frage ist jetzt wollen wir rein die erhobenen Daten beschreiben oder wollen wir eine Aussage über die gesamte Grundgesamtheit
  13. treffen wenn wir uns rein auf die Stichprobe beschränken wie also nur die gesammelten Daten beschreiben möchten verwenden wir die deskriptive Statistik
  14. mit Hilfe der deskriptiven Statistik erhalten wir einen detaillierten Überblick über die stichprobendaten wenn wir jedoch Rückschlüsse auf die
  15. Grundgesamtheit Zehen wollen müssen wir die Inferenzstatistik verwenden mit Hilfe der Inferenzstatistik können wir ausgehend von den stichprobendaten eine
  16. Aussage über die Grundgesamtheit treffen schauen wir uns beide Bereiche genauer an starten wir mit der deskriptiven Statistik warum ist die deskriptive
  17. Statistik so wichtig angenommen ein Unternehmen möchte wissen wie seine Mitarbeiter zur Arbeit fahren um diese Frage zu beantworten erstellt das
  18. Unternehmen eine kleine Umfrage sobald genügend Daten gesammelt wordurden können diese Daten dann mit Hilfe der deskriptiven Statistik ausgewertet
  19. werden aber was ist die deskriptive Statistik die deskriptive Statistik befasst sich mit der Zusammenfassung und Darstellung von Daten es ist jedoch
  20. wichtig zu beachten dass die deskriptive Statistik nur die gesammelten Daten beschreibt ohne Rückschlüsse auf die Grundgesamtheit zu machen einfach
  21. ausgedrückt nur weil wir wissen wie einige Mitarbeiter eines Unternehmens zur Arbeit kommen können wir nicht sagen wie alle Mitarbeiter des Unternehmens
  22. zur Arbeit kommen das ist Aufgabe der inferenstatistik auf die wir später eingehen um Daten deskriptiv zu beschreiben schauen wir uns nun die vier
  23. wichtigsten Bereiche an lagemaße streuungsmaße Tabellen und Diagramme starten wir mit den lagemaßen lagemaße sind z.B der Mittelwert der Median und
  24. der Modus werfen wir zunächst einen Blick auf den Mittel wert das arithmetische Mittel ist einfach die Summe aller Beobachtungen geteilt durch
  25. die Anzahl der Beobachtungen ein Beispiel stell dir vor wir haben die Testergebnisse von fünf Schülern den Mittelwert berechnen wir einfach dadurch
  26. indem wir alle Punktzahlen aufadiieren und durch die Anzahl der Schüler teilen die durchschnittliche testpunktzahl dieser fünf Schüler ist also
  27. 86,6 was ist der Median wenn die Werte in einem Datensatz aufsteigend geordnet sind dann ist der Median an der Wert in der Mitte nun gibt es noch einen
  28. Unterschied zwischen ungeraden und geraden Zahlen wenn es eine ungerade Zahl an Werten gibt ist der Median einfach der Wert in der Mitte bei einer
  29. geraden Anzahl von Werten ist der Median der Durchschnitt der beiden mittleren Werte es ist wichtig zu wissen dass der Median robust gegenüber Extremwerten und
  30. Ausreißern ist schauen wir uns das an einem Beispiel an egal wie groß die letzte Person ist die Person in der Mitte bleibt die Person in der Mitte
  31. also ändert sich der Median nicht beim Mittelwert hingegen hat es einen Einfluss wie groß die letzte Person ist der Mittelwert ist daher nicht robust
  32. gegenüber Ausreiser schauen wir uns noch den Modus auch Modalwert genannt an der Modus bezeichnet sich auf den Wert oder die Werte die am häufigsten in einem
  33. Datensatz vorkommen wenn z.B 14 Personen mit dem Auto zur Arbeit fahren sechs mit dem Fahrrad fünf zu Fuß und fünf mit den öffentlichen Verkehrsmitteln dann ist
  34. das Auto das häufigste Verkehrsmittel und damit der Modus super dann können wir nun zu den streuungsm Maßen kommen streuungsmaße beschreiben wie weit die
  35. Werte in einem Datensatz verteilt sind streuungsmaße sind z.B die Varianz die Standardabweichung die Spannweite oder der quartilelsabstand starten wir mit
  36. der Standardabweichung die Standardabweichung gibt den durchschnittlichen Abstand zwischen den Werten und dem Mittelwert an aber was
  37. bedeutet das jede Person hat einen gewissen Abstand zum Mittelwert jetzt wollen wir wissen wie weit die Personen im Mittel von dem Mittelwert abweichen
  38. in diesem Beispiel bitte trägt der mittlere Abweichung vom Mittelwert 11,5 cm zu beachten ist dass es sich hierbei um den quadratischen Mittelwert handelt
  39. um die Standardabweichung zu berechnen können wir diese Gleichung verwenden σma ist die Standardabweichung n ist die Anzahl der Personen XI ist die Größe der
  40. jeweiligen Person und x STR der Mittelwert der Personen aber Achtung es gibt zwei leicht unterschiedliche Gleichung für die Standardabweichung der
  41. Unterschied ist dass wir einmal 1 durch n teilen und einmal 1 dur n- 1 einfach gesagt wenn unsere Umfrage nicht die gesamte Grundgesamtheit abdeckt
  42. verwenden wir diese Gleichung um die Standardabweichung zu schätzen genauso wenn wir eine klinische Studie durchgeführt haben verwenden wir auch
  43. diese Gleichung um die Standardabweichung zu schätzen aber was ist der Unterschied zwischen der Standardabweichung und der Varianz wie
  44. wir jetzt wissen ist die Standardabweichung das quadratische Mittel des Abstandes vom Mittelwert die Varianz ist nun die quadrierte Standard
  45. Abweichung wenn du mehr über die Standardabweichung und die Varianz wissen möchtest dann schau dir hierfür gerne mein Video an weiter geht's mit
  46. der Spannweite und dem quartilsabstand die beiden sind einfach zu verstehen die Spannweite ist einfach die Differenz zwischen dem Maximum und dem Minimum der
  47. quartielsabstand oder interquartielsabstand gibt die mittleren 50% der Daten wieder er ist die Differenz zwischen dem ersten Quartil Q1
  48. und dem dritten Quartil Q3 daher 25 % der Werte sind kleiner als der quartisabstand und 25% der Werte sind größer der interquartisabstand enthält
  49. genau die mittleren 50% der Werte bevor wir zu den letzten beiden Punkten kommen lass uns kurz die lagemaße und die steuerungsmaße vergleichen nehmen wir an
  50. wir messen den Blutdruck von Patienten lagemaße liefern einen einzigen Wert der den gesamten Datensatz beschreibt und dabei helfen einen mittleren Wert
  51. anzugeben um den die Daten streuen streuungsmaße wie die Standardabweichung die Spannweite und der quartilsabstand geben an wie stark die Daten streuen
  52. daher ob sie dicht zusammenliegen oder weit voneinander entfernt sind zusammengefasst lagemaße geben einen zentralen Punkt der Daten an während
  53. steuerungsmaße angeben wie stark die Daten um diesen zentralen Punkt streuen damit schauen wir uns nun die beiden wichtigsten Tabellen an wir werfen einen
  54. Blick auf die häufigkeitstabelle und die Kreuztabelle eine häufigkeitstabelle gibt an wie wie oft jeder einzelne Wert in einem Datensatz vorkommt schauen wir
  55. uns das an unserem Beispiel an ein Unternehmen hat seine Mitarbeiter befragt um herauszufinden wie sie zur Arbeit pendeln die Option waren Auto
  56. Fahrrad zu Fuß und öffentlicher Verkehr hier sind die Ergebnisse von 30 Mitarbeitern der erste antwortet Auto der nächste zu Fuß und so weiter und so
  57. fort jetzt können wir eine häufigkeitstabell erstellen um diese Daten zusammenzufassen dazu tragen wir einfach die vier möglichen Option Auto
  58. Fahrrad zu Fuß und öffentlicher Verkehr in die erste Spalte ein und dann sehen wir wie oft sie jeweils vorkommen aus der Tabelle geht hervor dass Auto das
  59. häufigste Verkehrsmittel der Befragten Person ist 14 Personen bevorzugen es die häufigkeitstabelle bietet also eine übersichtliche Zusammenfassung der Daten
  60. was ist aber wenn wir nicht nur eine sondern zwei kategoriale Variablen haben dann kommt die Kreuztabelle ins Spiel sagen wir das Unternehmen hat nicht nur
  61. eine Fabrik sondern zwei eine in Berlin und eine in Hamburg daher fragen wir die Mitarbeiter auch an welchem Standort sie arbeiten wenn wir beide Variablen
  62. darstellen möchten können wir eine Kreuztabelle verwenden eine Kreuztabelle bietet die Möglichkeit die Beziehung zwischen zwei kategorischen Variablen zu
  63. analysieren die Reihen in der Kreuztabelle geben die Kategorien der einen variable wieder und die Spalten die Kategorien der anderen variable jede
  64. Zelle in der Tabelle gibt an wie oft die jeweiligen Kategorien zusammen vorkommen die erste Zelle zeigt z.B an dass sechs Personen Auto und Berlin angegeben haben
  65. und was ist mit den Diagrammen werfen wir einen Blick auf die wichtigsten hierfür gehen wir einfach auf datatap.de wenn du magst kannst du diesen
  66. beispieldatensatz über den Link in der Videobeschreibung laden oder du kopierst einfach deine eigenen Daten in diese Tabelle hier unten siehst du die
  67. Variablen Entfernung zur Arbeit Verkehrsmittel und Standort datatab erkennt automatisch das skaleniveau sollte das nicht richtig sein kannst du
  68. es hier auch ändern wenn wir nun Verkehrsmittel anklicken erhalten wir hier eine häufigkeitstabelle und wenn wir weiter nach unten scrollen erhalten
  69. wir ein Balkendiagramm und ein Kreisdiagramm hier auf der linken Seite können wir weitere Einstellung vornehmen z.B ob wir die Häufigkeiten oder die
  70. Prozentwert angezeigt bekommen wollen oder ob die Balken vertikal oder horizontal sein sollen wenn wir nun noch stad auswählen erhalten wir hier eine
  71. Kreuztabelle und bei den Diagrammen ein gropiertes Balkendiagramm hier können wir festlegen ob das Diagramm kopiert oder gestapelt sein soll wenn wir auf
  72. Entfernung zur Arbeit und Verkehrsmittel klicken erhalten wir einen Balkendiagramm bei dem die Höhe der Balken die Mittelwerte der einzelnen
  73. Gruppen wiedergibt hier können wir auch die Streuung Anzeigen außerdem erhalten wir ein Histogramm ein Boxplot ein violinplot und ein Rainbow Plot wenn du
  74. mehr über den Boxplot den violin Plot oder den Rainbow Plot erfahren möchtest schau dir hierfür gerne unsere Videos an damit kommen wir nun zuur
  75. Inferenzstatistik wir starten mit der Frage was Inferenzstatistik ist und dann besprechen wir die sechs wichtigsten Schritte der
  76. Inferenzstatistik was ist also Inferenzstatistik mit Hilfe der Inferenzstatistik können wir aus den Daten einer Stichprobe Rückschlüsse über
  77. die Grundgesamtheit treffen was ist die Grundgesamtheit und was ist die Stichprobe die Grundgesamtheit sind alle Personen an denen wir interessiert sind
  78. wenn du die durchschnittliche Körpergröße aller Erwachsenen in den USA untersuchen möchtest dann wäre die grundgesamt alle Erwachsenen in den USA
  79. die Stichprobe ist eine kleinere Gruppe von Personen die wir tatsächlich untersuchen und die natürlich aus der Grundgesamtheit stammt es wurden z.B 150
  80. Erwachsene aus den USA gezogen und jetzt wollen wir diese Stichprobe verwenden um eine Aussage über die Grundgesamtheit zu treffen und hier sind die sechs Schritte
  81. wie wir das machen Nummer 1 Hypothese zuerst brauchen wir natürlich eine Aussage eine Hypothese die wir testen möchten wir wollen z.B wissen ob ein ein
  82. Medikament eine positive Wirkung auf den Blutdruck von Patienten mit hohen Blutdruck hat aber was kommt als nächstes in unserer Hypothese haben wir
  83. angenommen dass wir Menschen mit hohem Blutdruck untersuchen möchten unsere Grundgesamtheit besteht also aus allen Menschen mit hohen Blutdruck z.B in den
  84. USA natürlich können wir nicht von der gesamten Grundgesamtheit Daten sammeln also nehmen wir eine Stichprobe aus der Grundgesamtheit anhand dieser Stichprobe
  85. möchten wir nun eine Aussage über die Grundgesamtheit treffen aber wie machen wir das hierfür brauchen wir einen Hypothesentest Hypothesentest überprüfen
  86. eine Aussage über einen Parameter in der Grundgesamtheit anhand von Daten aus einer Stichprobe perfekt das ist genau das was wir brauchen es gibt viele
  87. verschiedene hypotheesentests am Ende des Videos zeige ich dir einen Weg wie du einfach den richtigen Test finden kannst und natürlich findest du auf
  88. unserem youtubeekal Videos zu den meisten Hypothesentests aber wie funktioniert ein Hypothesentest wenn wir einen Hypothesentest durchführen starten
  89. wir mit einer forschungshypothese auch Alternativhypothese genannt dies ist die Hypothese die wir belegen möchten in unserem Fall lautet die
  90. forschungshypothese das Medikament hat eine Wirkung auf den Blutdruck aber diese Hypothese können wir leider nicht direkt mit einem klassischen
  91. Hypothesentest testen also testen wir die gegengesetzte Hypothese die sogenannte Nullhypothese dass das Medikament keine Wirkung hat aber was
  92. bedeutet das zunächst gehen wir davon aus dass das Medikament in der Grundgesamtheit keine Wirkung hat wir gehen also davon aus dass Menschen die
  93. das Medikament einnehmen und Menschen die das Medikament nicht einnehmen im Durchschnitt den gleichen Blutdruck haben wenn wir nun eine Stichprobe
  94. ziehen und in dieser Stichprobe hat das Medikament eine große Wirkung dann können wir fragen wie wahrscheinlich ist es eine solche Stichprobe zu ziehen oder
  95. eine die noch mehr abweicht wenn das Medikament eigentlich keine Wirkung hat in Wirklichkeit gibt es also im Durchschnitt keinen Unterschied wenn
  96. diese Wahrscheinlichkeit sehr gering ist können wir uns fragen vielleicht hat das Medikament eine Wirkung in der Grundgesamtheit und wir haben vielleicht
  97. genügend Indizien die Nullhypothese dass das Medikament keine Wirkung hat zu verwerfen und genau diese Wahrscheinlichkeit gibt der p-Wert
  98. wieder fassen wir dies in drei einfachen Schritten zusammen Nummer 1 die Nullhypothese sagt dass es keinen Unterschied in der Grundgesamtheit gibt
  99. Nummer 2 der Hypothesentest bestimmt wie stark die Stich Probe von der Nullhypothese abweicht Nummer 3 der pwert gibt an wie hoch die
  100. Wahrscheinlichkeit ist eine Stichprobe zu ziehen die genauso stark abweicht wie unsere Stichprobe oder sogar noch stärker als unsere Stichprobe wenn die
  101. Nullhypothese als wahr angenommen wird aber ab wann ist der p-Wert klein genug um die Nullhypothese zu verwerfen das bringt uns zum nächsten Punkt
  102. statistische Signifikanz wenn der p-Wert unter einem vorher festgelegten Schwellwert liegt ist das Ergebnis statistisch signifikant das bedeutet es
  103. ist unwahrscheinlich dass das Ergebnis rein durch Zufall entstanden ist und dass wir genug Indizien haben die Nullhypothese zu verwerfen dieser
  104. Schwellwert liegt oft bei 0,05 also 5%. ein kleiner p-Wert deutet also darauf hin dass die erhobenen Daten unsere Stichprobe mit der Nullhypothese
  105. inkonsistent sind das führt dazu dass wir die Nullhypothese zu Gunsten der Alternativhypothese ablehnen ein großer p-Wert deutet darauf hin dass die
  106. erhobene Daten istent mit der Nullhypothese sind und wir verwerfen nicht die Nullhypothese aber Achtung es besteht immer das Risiko einen Fehler zu
  107. machenen ein kleiner p-Wert beweist nicht dass die Alternativhypothese wahr ist es sagt nur dass es unwahrscheinlich ist ein solches Ergebnis oder ein noch
  108. extremeres zu erhalten wenn die Nullhypothese wahr ist und wie wir nun wissen wenn die Nullhypothese wahr ist gibt es keinen Unterschied in der
  109. Grundgesamtheit umgekehrt beweist ein großer pwert nicht dass die Nullhypothese wahr ist er besagt nur dass es wahrscheinlich ist ein solches
  110. Ergebnis oder ein noch extremeres zu erhalten wenn die Nullhypothese wahr ist es gibt also zwei Arten von Fehlern den Fehler erste Art und den Fehler zweite
  111. Art starten wir mit dem Fehler erster Art bei einem Hypothesentest erhalten wir einen Fehler erster Art wenn eine wahre Nullhypothese abgelehnt wird in
  112. Wirklichkeit ist die Nullhypothese also wahr aber wir entscheiden uns dazu die Nullhypothese zu verweren en in unserem Beispiel bedeutet das dass das
  113. Medikament eigentlich keine Wirkung hat in Wirklichkeit gibt es also keinen Unterschied im Blutdruck zwischen den Personen die das Medikament einnehmen
  114. und denen die es nicht einnehmen im Mittel ist in beiden Fällen der Blutdruck gleich aber unsere Stichprobe war zufällig so weit von der
  115. Grundgesamtheit entfernt dass wir fälschlicherweise dachten das Medikament wirkt und ein Fehler zweite tritt auf wenn die Nullhypothese in der
  116. Grundgesamtheit falsch ist jedoch im Rahmen des Hypothesen Test beibehalten wird in Wirklichkeit ist die Nullhypothese also falsch aber wir
  117. treffen die Entscheidung die Nullhypothese nicht zu verwerfen in unserem Beispiel bedeutet das das Medikament hat tatsächlich gewirkt es
  118. gibt einen Unterschied zwischen denen die das Medikament genommen haben und denen die es nicht genommen haben aber es war reiner Zufall dass die entnommene
  119. Stichprobe keinen großen Unterschied zeigte und wir fälschlicherweise dachten dass das Medikament nicht wirkt und jetzt zeige ich dir wie die data hilft
  120. einen geeigneten Hypothesentest zu finden und den Hypothesentest natürlich auch für dich berechnet und die Ergebnisse interpretiert dafür gehen wir
  121. einfach auf datadap.de und wir kopieren unsere eigenen Daten hier in diese Tabelle ich verwende einfach mal diesen beispieldatensatz zugegeben der ist ein
  122. wenig klein nachdem du deine Daten in die Tabelle kopiert hast erscheinen die Variablen hier unten datatab versucht automatisch das richtige skaliveau zu
  123. bestimmen aber du kannst es natürlich auch hier oben ändern jetzt klicken wir einfach auf Hypothesentest und wählen die Variablen aus für die wir einen
  124. Hypothesentest berechnen möchten datasep schlägt ihr dann einen geeigneten Test vor z.B wenn wir diese beiden Variablen anklicken einen
  125. kquadrattest oder wenn wir diese Variablen Anklicken eine Varianzanalyse dann siehst du die Hypothesen und anschließend die
  126. Ergebnisse wenn du dir nicht sicher bist wie Du die Ergebnisse interpretieren kannst klicke auf Zusammenfassung in Worten
  127. außerdem kannst du die Voraussetzung prüfen und entscheiden ob du einen parametrischen oder einen nichtparametrischen Test berechnen
  128. möchtest was der Unterschied zwischen parametrischen Test und nicht parametrischen Test ist erfährst in meinem nächsten Video ciao und bis zum
  129. nächsten Mal

Zum Nachlesen