Das Video kommt von YouTube: erst beim Abspielen verbindet sich die Seite mit YouTube (Google).
80% der Statistik Basics in 18 min! Ein Leitfaden für Statistik-Einsteiger!
Das Wichtigste aus dem Video
Tipp auf eine Zeit – das Video springt genau dorthin.
Transkriptautomatisch erstellt · 129 Zeilen
- hi in diesem Video möchte ich dir die Welt der Statistik in einfachen Worten und mit vielen anschaulichen Bildern erklären nach dem Video weißt du was
- Statistik ist was deskriptive Statistik ist und was Inferenzstatistik ist also starten wir mit der ersten Frage was ist Statistik Statistik befasst sich mit der
- Erhebung Analyse und Präsentation von Daten ein Beispiel wir möchten wissen ob das Geschlecht einen Einfluss auf die bevorzugte Zeitung hat dann sind
- Geschlecht und Zeitung unsere sogenannten Variablen die wir untersuchen möchten damit wir untersuchen können ob das Geschlecht
- einen Einfluss auf die bevorzugte Zeitung hat müssen wir natürlich erstmal Daten sammeln dazu erstellen wir einen Fragebogen der nach dem Geschlecht und
- der bevorzugten Zeitung fragt dann verschicken wir die Umfrage und warten zwei Wochen anschließend geben wir uns die erhaltenen Antworten in einer
- Tabelle aus in dieser Tabelle haben wir für jede Variable eine Spalte eine für Geschlecht und eine für Zeitung auf der anderen Seite ist jede Reihe eine
- befragte Person die erste Person hat männlich angegeben und die Zeitung die Welt die zweite weiblich und Süddeutsche Zeitung und so weiter und soofort
- natürlich müssen die Daten nicht aus einer Umfrage stammen die Daten können auch aus einem Experiment kommen mit dem du die Wirkung von zwei Medikamenten auf
- den Blutdruck untersuchen möchtest jetzt ist der erste Schritt getan wir haben Daten gesammelt nun können wir mit der Analyse der Daten starten aber was
- wollen wir analysieren wir haben nicht die gesamte Grundgesamtheit befragt sondern nur eine Stichprobe genommen unsere erhobenen Daten stammen also aus
- einer Stichprobe die große Frage ist jetzt wollen wir rein die erhobenen Daten beschreiben oder wollen wir eine Aussage über die gesamte Grundgesamtheit
- treffen wenn wir uns rein auf die Stichprobe beschränken wie also nur die gesammelten Daten beschreiben möchten verwenden wir die deskriptive Statistik
- mit Hilfe der deskriptiven Statistik erhalten wir einen detaillierten Überblick über die stichprobendaten wenn wir jedoch Rückschlüsse auf die
- Grundgesamtheit Zehen wollen müssen wir die Inferenzstatistik verwenden mit Hilfe der Inferenzstatistik können wir ausgehend von den stichprobendaten eine
- Aussage über die Grundgesamtheit treffen schauen wir uns beide Bereiche genauer an starten wir mit der deskriptiven Statistik warum ist die deskriptive
- Statistik so wichtig angenommen ein Unternehmen möchte wissen wie seine Mitarbeiter zur Arbeit fahren um diese Frage zu beantworten erstellt das
- Unternehmen eine kleine Umfrage sobald genügend Daten gesammelt wordurden können diese Daten dann mit Hilfe der deskriptiven Statistik ausgewertet
- werden aber was ist die deskriptive Statistik die deskriptive Statistik befasst sich mit der Zusammenfassung und Darstellung von Daten es ist jedoch
- wichtig zu beachten dass die deskriptive Statistik nur die gesammelten Daten beschreibt ohne Rückschlüsse auf die Grundgesamtheit zu machen einfach
- ausgedrückt nur weil wir wissen wie einige Mitarbeiter eines Unternehmens zur Arbeit kommen können wir nicht sagen wie alle Mitarbeiter des Unternehmens
- zur Arbeit kommen das ist Aufgabe der inferenstatistik auf die wir später eingehen um Daten deskriptiv zu beschreiben schauen wir uns nun die vier
- wichtigsten Bereiche an lagemaße streuungsmaße Tabellen und Diagramme starten wir mit den lagemaßen lagemaße sind z.B der Mittelwert der Median und
- der Modus werfen wir zunächst einen Blick auf den Mittel wert das arithmetische Mittel ist einfach die Summe aller Beobachtungen geteilt durch
- die Anzahl der Beobachtungen ein Beispiel stell dir vor wir haben die Testergebnisse von fünf Schülern den Mittelwert berechnen wir einfach dadurch
- indem wir alle Punktzahlen aufadiieren und durch die Anzahl der Schüler teilen die durchschnittliche testpunktzahl dieser fünf Schüler ist also
- 86,6 was ist der Median wenn die Werte in einem Datensatz aufsteigend geordnet sind dann ist der Median an der Wert in der Mitte nun gibt es noch einen
- Unterschied zwischen ungeraden und geraden Zahlen wenn es eine ungerade Zahl an Werten gibt ist der Median einfach der Wert in der Mitte bei einer
- geraden Anzahl von Werten ist der Median der Durchschnitt der beiden mittleren Werte es ist wichtig zu wissen dass der Median robust gegenüber Extremwerten und
- Ausreißern ist schauen wir uns das an einem Beispiel an egal wie groß die letzte Person ist die Person in der Mitte bleibt die Person in der Mitte
- also ändert sich der Median nicht beim Mittelwert hingegen hat es einen Einfluss wie groß die letzte Person ist der Mittelwert ist daher nicht robust
- gegenüber Ausreiser schauen wir uns noch den Modus auch Modalwert genannt an der Modus bezeichnet sich auf den Wert oder die Werte die am häufigsten in einem
- Datensatz vorkommen wenn z.B 14 Personen mit dem Auto zur Arbeit fahren sechs mit dem Fahrrad fünf zu Fuß und fünf mit den öffentlichen Verkehrsmitteln dann ist
- das Auto das häufigste Verkehrsmittel und damit der Modus super dann können wir nun zu den streuungsm Maßen kommen streuungsmaße beschreiben wie weit die
- Werte in einem Datensatz verteilt sind streuungsmaße sind z.B die Varianz die Standardabweichung die Spannweite oder der quartilelsabstand starten wir mit
- der Standardabweichung die Standardabweichung gibt den durchschnittlichen Abstand zwischen den Werten und dem Mittelwert an aber was
- bedeutet das jede Person hat einen gewissen Abstand zum Mittelwert jetzt wollen wir wissen wie weit die Personen im Mittel von dem Mittelwert abweichen
- in diesem Beispiel bitte trägt der mittlere Abweichung vom Mittelwert 11,5 cm zu beachten ist dass es sich hierbei um den quadratischen Mittelwert handelt
- um die Standardabweichung zu berechnen können wir diese Gleichung verwenden σma ist die Standardabweichung n ist die Anzahl der Personen XI ist die Größe der
- jeweiligen Person und x STR der Mittelwert der Personen aber Achtung es gibt zwei leicht unterschiedliche Gleichung für die Standardabweichung der
- Unterschied ist dass wir einmal 1 durch n teilen und einmal 1 dur n- 1 einfach gesagt wenn unsere Umfrage nicht die gesamte Grundgesamtheit abdeckt
- verwenden wir diese Gleichung um die Standardabweichung zu schätzen genauso wenn wir eine klinische Studie durchgeführt haben verwenden wir auch
- diese Gleichung um die Standardabweichung zu schätzen aber was ist der Unterschied zwischen der Standardabweichung und der Varianz wie
- wir jetzt wissen ist die Standardabweichung das quadratische Mittel des Abstandes vom Mittelwert die Varianz ist nun die quadrierte Standard
- Abweichung wenn du mehr über die Standardabweichung und die Varianz wissen möchtest dann schau dir hierfür gerne mein Video an weiter geht's mit
- der Spannweite und dem quartilsabstand die beiden sind einfach zu verstehen die Spannweite ist einfach die Differenz zwischen dem Maximum und dem Minimum der
- quartielsabstand oder interquartielsabstand gibt die mittleren 50% der Daten wieder er ist die Differenz zwischen dem ersten Quartil Q1
- und dem dritten Quartil Q3 daher 25 % der Werte sind kleiner als der quartisabstand und 25% der Werte sind größer der interquartisabstand enthält
- genau die mittleren 50% der Werte bevor wir zu den letzten beiden Punkten kommen lass uns kurz die lagemaße und die steuerungsmaße vergleichen nehmen wir an
- wir messen den Blutdruck von Patienten lagemaße liefern einen einzigen Wert der den gesamten Datensatz beschreibt und dabei helfen einen mittleren Wert
- anzugeben um den die Daten streuen streuungsmaße wie die Standardabweichung die Spannweite und der quartilsabstand geben an wie stark die Daten streuen
- daher ob sie dicht zusammenliegen oder weit voneinander entfernt sind zusammengefasst lagemaße geben einen zentralen Punkt der Daten an während
- steuerungsmaße angeben wie stark die Daten um diesen zentralen Punkt streuen damit schauen wir uns nun die beiden wichtigsten Tabellen an wir werfen einen
- Blick auf die häufigkeitstabelle und die Kreuztabelle eine häufigkeitstabelle gibt an wie wie oft jeder einzelne Wert in einem Datensatz vorkommt schauen wir
- uns das an unserem Beispiel an ein Unternehmen hat seine Mitarbeiter befragt um herauszufinden wie sie zur Arbeit pendeln die Option waren Auto
- Fahrrad zu Fuß und öffentlicher Verkehr hier sind die Ergebnisse von 30 Mitarbeitern der erste antwortet Auto der nächste zu Fuß und so weiter und so
- fort jetzt können wir eine häufigkeitstabell erstellen um diese Daten zusammenzufassen dazu tragen wir einfach die vier möglichen Option Auto
- Fahrrad zu Fuß und öffentlicher Verkehr in die erste Spalte ein und dann sehen wir wie oft sie jeweils vorkommen aus der Tabelle geht hervor dass Auto das
- häufigste Verkehrsmittel der Befragten Person ist 14 Personen bevorzugen es die häufigkeitstabelle bietet also eine übersichtliche Zusammenfassung der Daten
- was ist aber wenn wir nicht nur eine sondern zwei kategoriale Variablen haben dann kommt die Kreuztabelle ins Spiel sagen wir das Unternehmen hat nicht nur
- eine Fabrik sondern zwei eine in Berlin und eine in Hamburg daher fragen wir die Mitarbeiter auch an welchem Standort sie arbeiten wenn wir beide Variablen
- darstellen möchten können wir eine Kreuztabelle verwenden eine Kreuztabelle bietet die Möglichkeit die Beziehung zwischen zwei kategorischen Variablen zu
- analysieren die Reihen in der Kreuztabelle geben die Kategorien der einen variable wieder und die Spalten die Kategorien der anderen variable jede
- Zelle in der Tabelle gibt an wie oft die jeweiligen Kategorien zusammen vorkommen die erste Zelle zeigt z.B an dass sechs Personen Auto und Berlin angegeben haben
- und was ist mit den Diagrammen werfen wir einen Blick auf die wichtigsten hierfür gehen wir einfach auf datatap.de wenn du magst kannst du diesen
- beispieldatensatz über den Link in der Videobeschreibung laden oder du kopierst einfach deine eigenen Daten in diese Tabelle hier unten siehst du die
- Variablen Entfernung zur Arbeit Verkehrsmittel und Standort datatab erkennt automatisch das skaleniveau sollte das nicht richtig sein kannst du
- es hier auch ändern wenn wir nun Verkehrsmittel anklicken erhalten wir hier eine häufigkeitstabelle und wenn wir weiter nach unten scrollen erhalten
- wir ein Balkendiagramm und ein Kreisdiagramm hier auf der linken Seite können wir weitere Einstellung vornehmen z.B ob wir die Häufigkeiten oder die
- Prozentwert angezeigt bekommen wollen oder ob die Balken vertikal oder horizontal sein sollen wenn wir nun noch stad auswählen erhalten wir hier eine
- Kreuztabelle und bei den Diagrammen ein gropiertes Balkendiagramm hier können wir festlegen ob das Diagramm kopiert oder gestapelt sein soll wenn wir auf
- Entfernung zur Arbeit und Verkehrsmittel klicken erhalten wir einen Balkendiagramm bei dem die Höhe der Balken die Mittelwerte der einzelnen
- Gruppen wiedergibt hier können wir auch die Streuung Anzeigen außerdem erhalten wir ein Histogramm ein Boxplot ein violinplot und ein Rainbow Plot wenn du
- mehr über den Boxplot den violin Plot oder den Rainbow Plot erfahren möchtest schau dir hierfür gerne unsere Videos an damit kommen wir nun zuur
- Inferenzstatistik wir starten mit der Frage was Inferenzstatistik ist und dann besprechen wir die sechs wichtigsten Schritte der
- Inferenzstatistik was ist also Inferenzstatistik mit Hilfe der Inferenzstatistik können wir aus den Daten einer Stichprobe Rückschlüsse über
- die Grundgesamtheit treffen was ist die Grundgesamtheit und was ist die Stichprobe die Grundgesamtheit sind alle Personen an denen wir interessiert sind
- wenn du die durchschnittliche Körpergröße aller Erwachsenen in den USA untersuchen möchtest dann wäre die grundgesamt alle Erwachsenen in den USA
- die Stichprobe ist eine kleinere Gruppe von Personen die wir tatsächlich untersuchen und die natürlich aus der Grundgesamtheit stammt es wurden z.B 150
- Erwachsene aus den USA gezogen und jetzt wollen wir diese Stichprobe verwenden um eine Aussage über die Grundgesamtheit zu treffen und hier sind die sechs Schritte
- wie wir das machen Nummer 1 Hypothese zuerst brauchen wir natürlich eine Aussage eine Hypothese die wir testen möchten wir wollen z.B wissen ob ein ein
- Medikament eine positive Wirkung auf den Blutdruck von Patienten mit hohen Blutdruck hat aber was kommt als nächstes in unserer Hypothese haben wir
- angenommen dass wir Menschen mit hohem Blutdruck untersuchen möchten unsere Grundgesamtheit besteht also aus allen Menschen mit hohen Blutdruck z.B in den
- USA natürlich können wir nicht von der gesamten Grundgesamtheit Daten sammeln also nehmen wir eine Stichprobe aus der Grundgesamtheit anhand dieser Stichprobe
- möchten wir nun eine Aussage über die Grundgesamtheit treffen aber wie machen wir das hierfür brauchen wir einen Hypothesentest Hypothesentest überprüfen
- eine Aussage über einen Parameter in der Grundgesamtheit anhand von Daten aus einer Stichprobe perfekt das ist genau das was wir brauchen es gibt viele
- verschiedene hypotheesentests am Ende des Videos zeige ich dir einen Weg wie du einfach den richtigen Test finden kannst und natürlich findest du auf
- unserem youtubeekal Videos zu den meisten Hypothesentests aber wie funktioniert ein Hypothesentest wenn wir einen Hypothesentest durchführen starten
- wir mit einer forschungshypothese auch Alternativhypothese genannt dies ist die Hypothese die wir belegen möchten in unserem Fall lautet die
- forschungshypothese das Medikament hat eine Wirkung auf den Blutdruck aber diese Hypothese können wir leider nicht direkt mit einem klassischen
- Hypothesentest testen also testen wir die gegengesetzte Hypothese die sogenannte Nullhypothese dass das Medikament keine Wirkung hat aber was
- bedeutet das zunächst gehen wir davon aus dass das Medikament in der Grundgesamtheit keine Wirkung hat wir gehen also davon aus dass Menschen die
- das Medikament einnehmen und Menschen die das Medikament nicht einnehmen im Durchschnitt den gleichen Blutdruck haben wenn wir nun eine Stichprobe
- ziehen und in dieser Stichprobe hat das Medikament eine große Wirkung dann können wir fragen wie wahrscheinlich ist es eine solche Stichprobe zu ziehen oder
- eine die noch mehr abweicht wenn das Medikament eigentlich keine Wirkung hat in Wirklichkeit gibt es also im Durchschnitt keinen Unterschied wenn
- diese Wahrscheinlichkeit sehr gering ist können wir uns fragen vielleicht hat das Medikament eine Wirkung in der Grundgesamtheit und wir haben vielleicht
- genügend Indizien die Nullhypothese dass das Medikament keine Wirkung hat zu verwerfen und genau diese Wahrscheinlichkeit gibt der p-Wert
- wieder fassen wir dies in drei einfachen Schritten zusammen Nummer 1 die Nullhypothese sagt dass es keinen Unterschied in der Grundgesamtheit gibt
- Nummer 2 der Hypothesentest bestimmt wie stark die Stich Probe von der Nullhypothese abweicht Nummer 3 der pwert gibt an wie hoch die
- Wahrscheinlichkeit ist eine Stichprobe zu ziehen die genauso stark abweicht wie unsere Stichprobe oder sogar noch stärker als unsere Stichprobe wenn die
- Nullhypothese als wahr angenommen wird aber ab wann ist der p-Wert klein genug um die Nullhypothese zu verwerfen das bringt uns zum nächsten Punkt
- statistische Signifikanz wenn der p-Wert unter einem vorher festgelegten Schwellwert liegt ist das Ergebnis statistisch signifikant das bedeutet es
- ist unwahrscheinlich dass das Ergebnis rein durch Zufall entstanden ist und dass wir genug Indizien haben die Nullhypothese zu verwerfen dieser
- Schwellwert liegt oft bei 0,05 also 5%. ein kleiner p-Wert deutet also darauf hin dass die erhobenen Daten unsere Stichprobe mit der Nullhypothese
- inkonsistent sind das führt dazu dass wir die Nullhypothese zu Gunsten der Alternativhypothese ablehnen ein großer p-Wert deutet darauf hin dass die
- erhobene Daten istent mit der Nullhypothese sind und wir verwerfen nicht die Nullhypothese aber Achtung es besteht immer das Risiko einen Fehler zu
- machenen ein kleiner p-Wert beweist nicht dass die Alternativhypothese wahr ist es sagt nur dass es unwahrscheinlich ist ein solches Ergebnis oder ein noch
- extremeres zu erhalten wenn die Nullhypothese wahr ist und wie wir nun wissen wenn die Nullhypothese wahr ist gibt es keinen Unterschied in der
- Grundgesamtheit umgekehrt beweist ein großer pwert nicht dass die Nullhypothese wahr ist er besagt nur dass es wahrscheinlich ist ein solches
- Ergebnis oder ein noch extremeres zu erhalten wenn die Nullhypothese wahr ist es gibt also zwei Arten von Fehlern den Fehler erste Art und den Fehler zweite
- Art starten wir mit dem Fehler erster Art bei einem Hypothesentest erhalten wir einen Fehler erster Art wenn eine wahre Nullhypothese abgelehnt wird in
- Wirklichkeit ist die Nullhypothese also wahr aber wir entscheiden uns dazu die Nullhypothese zu verweren en in unserem Beispiel bedeutet das dass das
- Medikament eigentlich keine Wirkung hat in Wirklichkeit gibt es also keinen Unterschied im Blutdruck zwischen den Personen die das Medikament einnehmen
- und denen die es nicht einnehmen im Mittel ist in beiden Fällen der Blutdruck gleich aber unsere Stichprobe war zufällig so weit von der
- Grundgesamtheit entfernt dass wir fälschlicherweise dachten das Medikament wirkt und ein Fehler zweite tritt auf wenn die Nullhypothese in der
- Grundgesamtheit falsch ist jedoch im Rahmen des Hypothesen Test beibehalten wird in Wirklichkeit ist die Nullhypothese also falsch aber wir
- treffen die Entscheidung die Nullhypothese nicht zu verwerfen in unserem Beispiel bedeutet das das Medikament hat tatsächlich gewirkt es
- gibt einen Unterschied zwischen denen die das Medikament genommen haben und denen die es nicht genommen haben aber es war reiner Zufall dass die entnommene
- Stichprobe keinen großen Unterschied zeigte und wir fälschlicherweise dachten dass das Medikament nicht wirkt und jetzt zeige ich dir wie die data hilft
- einen geeigneten Hypothesentest zu finden und den Hypothesentest natürlich auch für dich berechnet und die Ergebnisse interpretiert dafür gehen wir
- einfach auf datadap.de und wir kopieren unsere eigenen Daten hier in diese Tabelle ich verwende einfach mal diesen beispieldatensatz zugegeben der ist ein
- wenig klein nachdem du deine Daten in die Tabelle kopiert hast erscheinen die Variablen hier unten datatab versucht automatisch das richtige skaliveau zu
- bestimmen aber du kannst es natürlich auch hier oben ändern jetzt klicken wir einfach auf Hypothesentest und wählen die Variablen aus für die wir einen
- Hypothesentest berechnen möchten datasep schlägt ihr dann einen geeigneten Test vor z.B wenn wir diese beiden Variablen anklicken einen
- kquadrattest oder wenn wir diese Variablen Anklicken eine Varianzanalyse dann siehst du die Hypothesen und anschließend die
- Ergebnisse wenn du dir nicht sicher bist wie Du die Ergebnisse interpretieren kannst klicke auf Zusammenfassung in Worten
- außerdem kannst du die Voraussetzung prüfen und entscheiden ob du einen parametrischen oder einen nichtparametrischen Test berechnen
- möchtest was der Unterschied zwischen parametrischen Test und nicht parametrischen Test ist erfährst in meinem nächsten Video ciao und bis zum
- nächsten Mal
Zum Nachlesen
Deskriptive StatistikTabellen: In Tabellen werden Daten in einer Matrix mit Zeilen und Spalten dargestellt, wenn die Datenstruktur dies erlaubt. Dabei entspricht üblicherweise …
Statistische SignifikanzStatistisch signifikant wird das Ergebnis eines statistischen Tests genannt, wenn Stichprobendaten so stark von einer vorher festgelegten Annahme (der …
Dispersionsmaß (Stochastik)Ein Dispersionsmaß, auch Streuungsmaß oder Streuungsparameter genannt, ist in der Stochastik eine Kennzahl der Verteilung einer Zufallsvariable …
VarianzDie Standardabweichung ist oft anschaulicher als die Varianz, da sie dieselbe Größenordnung hat wie die beobachteten Werte. Die Varianz ist dafür in …