Zum Inhalt springen
L

Das Video kommt von YouTube: erst beim Abspielen verbindet sich die Seite mit YouTube (Google).

Lineare Regression: Einfach erklärt

numiqo16:48 101.153 Aufrufe veröffentlicht Auf YouTube

Das Wichtigste aus dem Video

Tipp auf eine Zeit – das Video springt genau dorthin.

Transkriptautomatisch erstellt · 112 Zeilen
Herunterladen
  1. Hallo, in diesem Video erkläre ich dir, was eine einfache und multiple lineäre Rekression ist, wie du sie online berechnen kannst und wie du die
  2. Ergebnisse interpretierst. Und damit starten wir auch gleich. Eine Rekessionsanalyse ermöglicht es dir, ausgehend von einer oder mehreren
  3. Variablen auf eine weitere Variable zu schließen bzw. diese vorherzusehen. Sagen wir, du möchtest herausfinden, was einen Einfluss auf das Gehalt einer
  4. Person hat. Hierfür könntest du z.B. den höchsten Bildungsabschluss hernehmen, die wöchentliche Arbeitszeit oder das Alte einer Person. Du könntest nun, ob
  5. diese drei Variablen einen Einfluss auf das Geheilt von einer Person haben. Wenn ja, wenn dieses der Fall ist, dann kannst du das Geheilt einer Person
  6. vorhersehen, indem du den höchsten Bildungsabschluss der Person weißt, die wöchentliche Arbeitszeit und das Alter der Person. Die Variable, auf die du
  7. schließen möchtest, also die, die du fürsagen möchtest, heißt abhängige Variable oder Kriterium. Die Variablen, die du für die Vorhersage
  8. hernimmst, heißen unabhängige Variablen oder Prädiktoren. Mit der Regressionsanalyse können zwei Ziele verfolgt werden. Du kannst den
  9. Einfluss einer Variable oder mehrerer Variablen auf eine weitere Variable messen oder eine Variable anhand von anderen Variablen vorhersehen.
  10. Die einfache Linearregression wird verwendet, wenn nur eine unabhängige Variable vorliegt, um auf die abhängige Variable zu schließen. In dem Beispiel,
  11. wo wir das Gehalt einer Person vorhersagen möchten, verwenden wir nur eine Variable, entweder ob man studiert hat oder nicht, die wöchentliche
  12. Arbeitszeit oder das Alter einer Person. Bei der multiplen linearen Regission werden mehrere unabhängige Variablen verwendet. Um auf das Geheil zu
  13. schließen, verwendest du den höchsten Bildungsabschluss, die wöchentliche Arbeitszeit und das Alter von einer Person und alle drei Variablen
  14. gleichzeitig in einem Modell. Daher der Unterschied zwischen einer einfachen und einer multiplen Russession ist, dass im einen Fall nur eine unabhängige Variable
  15. verwendet wird und im anderen Fall mehrere. Beide haben gemeinsam, dass die abhängige Variable metrisch ist. Eine metrische Variable sind z.B. das Gehalt
  16. einer Person, die Körpergröße, die Schuhgröße oder z.B. der Stromverbrauch. Dem gegenüber steht die logistische Regession. Die logistische Regression
  17. wird verwendet, wenn du eine kategorisch abhängige Variable hast. In diesem Video geht es aber um die lineare Regression. Die logistische Regression wird in einem
  18. separaten Video in dieser Playlist betrachtet. Also, wir haben die einfache lineäre Regression. Hat die wöchentliche Arbeitszeit einen Einfluss auf den
  19. Stundenlohn von Angestellten? Wir haben nur eine unabhängige Variable und wir haben die multiple lineare Regression, haben die wöchentliche Arbeitszeit und
  20. das Alter von Angestellten einen Einfluss auf deren Stundenlohn. Hier haben wir zwei unabhängige Variablen, wöchentliche Arbeitszeit und das Alter
  21. und beide gehen gleichzeitig in das Regressionsmodell ein. Starten wir mit der einfachen linearen Regression. Das Ziel der einfachen linearen Regression
  22. ist es, den Wert einer abhängigen Variable aufgrund von einer unabhängigen Variable vorherzusagen. Je größer der lineäre Zusammenhang zwischen der
  23. unabhängigen Variable und der abhängigen Variable ist, desto genauer ist die Vorhersage. Visuell kann der Zusammenhang zwischen den Variablen in
  24. einem Streudiagramm dargestellt werden. Umso größer der lineäre Zusammenhang zwischen der abhängigen und der unabhängigen Variable ist, desto mehr
  25. liegen die Datenpunkte auf einer Geraden. Aufgabe der einfachen linearen Regression ist es nun, genau jene Gerade zu bestimmen, die den linearen
  26. Zusammenhang zwischen der abhängigen und der unabhängigen Variable am besten beschreibt. Im Rahmen der lineen Regressionsanalyse wird also grafisch
  27. ausgedrückt eine Gerade in das Streudiagramm eingezeichnet. Um diese gerade zu bestimmen, greift die lineare Regression auf die Methode der kleinsten
  28. Quadrate zurück. Sagen wir, ein Krankenhaus hat dich beauftragt und du sollst dem Krankenhaus eine Schätzung geben, ausgehend von dem Alter einer
  29. Person, wie lange diese Person nach einer OP im Krankenhaus bleibt. Hiermit möchte der Krankenhausbetreiber seine Planung optimieren. Deine abhängige
  30. Variable, also die, auf die du schließen möchtest, ist die Aufenthaltsdauer nach einer OP. Die unabhängige Variable ist das Alter. Die Gleichung, die dein
  31. Modell beschreibt, sieht nun folgendermaßen aus. Y Dach ist die geschätzte Aufenthalte, X ist das Alter, B ist die Steigung der Geraden und A ist
  32. der Aufpunkt. Das macht jetzt nicht viel Sinn, aber wenn eine Person 0 Jahre alt ist, würde sie genau a Tage im Krankenhaus bleiben, denn wir haben b* 0
  33. + A. Dementsprechend ist die geschätzte Aufenthaltsdauer genau a Tage. Das ist unser Aufpunkt. Ansonsten wird diese Steigung durch den Koeffizienten B
  34. beschrieben. Damit du die Koeffizienten berechnen kannst, muss das Krankenhaus dir natürlich eine Stichprobe von Personen geben, von denen du das Alter
  35. und die Aufenthaltsdauer nach einer OP weißt. Mit den dir vorliegenden Daten könntest du nun z.B. rausbekommen, dass B 0,14 ist und A 1,2. Das ist nun dein
  36. Modell, mit dem du die Aufenthaltsdauer nach einer OP ausgehend von dem Alter schätzen kannst. Sagen wir, eine Person, die 33 Jahre alt ist, ist für eine OP
  37. angemeldet, dann setzen wir für X 33 Jahre ein. Unser Modell sagt uns nun, dass diese Person nach einer OP 5,82 Tage im Krankenhaus bleibt. Jetzt ist
  38. natürlich die Frage, wie berechnet man die Steigung B und den Aufpunkt A? In der Regel verwendest du hierfür einfach ein Statistikprogramm wie Datat. Im
  39. Falle der einfachen lineen Regression geht es aber auch noch recht einfach per Hand. Der Koeffizient B ergibt sich über die Korrelation zwischen Alter und
  40. Aufenthalteauer nach einer OP mal die Standardabweichung von der Aufenthaltsdauer nach einer OP geteilt durch die Standardabweichung von dem
  41. Alter. A ergibt sich, indem wir den Mittelwert der Aufenthaltsdauer nach der OP hernehmen und davon B mal den Mittelwert von dem Alter abziehen. Die
  42. Regressionsgerade probiert immer bestmöglich die gegebenen Daten mit einer Gerade abzubilden. Natürlich ergibt sich daher auch immer ein Fehler.
  43. Dieser Fehler wird Epsilon genannt. Sagen wir, wir schätzen die Aufenthalteauer von einer Person, die 33 Jahre alt ist. Unser Modell sagt, dass
  44. diese Person 5,82 Tage im Krankenhaus bleibt. Also, wir schauen bei der X-Achse bei dem Alter 33 nach und schauen, wo wir die Gerade treffen. Hier
  45. würde sich dann ein Alter von 5,82 ergeben. Tatsächlich bleibt diese Person aber 7 Tage im Krankenhaus. Dann ist die Differenz zwischen dem geschätzten Wert
  46. und dem wahren Wert unser Fehler. Eben genau der Fehler wird EP genannt. Damit hast du nun einen guten Überblick, was eine einfache lineare Regression ist.
  47. Und wir kommen zur multiplen linearen Regression. Im Gegensatz zur einfachen linearen Regression können bei der multiplen
  48. linearen Regression zwei oder mehr unabhängige Variablen berücksichtigt werden. Ziel ist es, eine Variable auf Basis von mehreren anderen Variablen zu
  49. schätzen. Die Variable, die geschätzt werden soll, wird dabei als abhängige Variable Kriterium bezeichnet. Die Variablen, welche zur Vorhersage
  50. hereangezogen werden, heißen unabhängige Variablen bzw. Prädiktoren. Mit der multiplen lineären Regression kann der Einfluss daher von einer Drittvariable
  51. kontrolliert werden. Die multiple lineäre Regression kommt häufig in der empirischen Sozialforschung sowie in der Marktforschung zum Einsatz. In beiden
  52. Bereichen ist es von Interesse herauszufinden, welchen Einfluss verschiedene Faktoren auf eine Variable haben.
  53. Daher, wie wir bereits wissen, sieht die Gleichung für die einfache Linearregression so aus. Wir haben eine unabhängige Variable. Gehen wir nun den
  54. Weg zur multiplen lineären Regression, haben wir mehrere unabhängige Variablen. Also, wir haben die erste unabhängige Variable, wir haben die zweite
  55. unabhängige Variable und wir haben die Karte unabhängige Variable. Die Koeffizienten können nun ähnlich wie bei der Lineärenreionsgleichung
  56. interpretiert werden. Sind alle unabhängigen Variablen null, kommt der Wert a raus. Ändert sich eine unabhängige Variable um ein Einheit,
  57. gibt der Zugehörige Koeffizient B an. um wie viel sich die abhängige Variable verändert. Also sagen wir, das ist das Alter und das ist das Gehalt von einer
  58. Person. Ändert sich das Alter um ein Jahr, ändert sich dann das Gehalt der Person um B1. Sagen wir, wir wollen das Gehalt von
  59. einer Person schätzen, dadurch dass wir das Geschlecht abfragen, das Alter der Person und das Gewicht der Person. Der Koeffizient für die Variable Geschlecht
  60. wäre dann -372. Der Koeffizient für das Alter wäre dann 25,39, für das Gewicht 5,156
  61. und wir hätten den Aufpunkt von 1920. Also, wenn alles null ist, erhalten wir ein Gehalt von 1920. Eine Person, die ein Jahr älter ist,
  62. verdient 25,39 € mehr. Und eine Person, die 1 Kilogramm schwerer ist, verdient 5,51 weniger. Ist die Person männlich, würde sie in diesem
  63. Beispiel 372 € weniger verdienen als eine Frau. Das sind natürlich nur Beispieldaten. Und jetzt zeige ich euch, wie ihr online eine Rekrissionsanalyse
  64. berechnen könnt und wie ihr die Ergebnisse interpretiert. Dafür geht ihr bitte auf datatab.de, de. Klickt auf den Statistikrechner und wenn
  65. ihr eure eigenen Daten verwenden möchtet, lehrt ihr bitte die Tabelle und kopiert sie einfach in diese Tabelle hinein. Ich verwende die Beispieldaten.
  66. Wir möchten eine Regression berechnen, also klicken wir einfach auf Regression. Sagen wir, wir möchten das Einkommen von einer Person vorhersagen. Hierfür nehmen
  67. wir das Geschlecht, das Alter und das Gewicht her. Nun berechnet euch Datat automatisch eine lineare Regression. und ihr bekommt hier unten die Ergebnisse.
  68. Entweder ihr könnt einfach auf Zusammenfassung in Worten klicken, dann bekommt ihr eine Zusammenfassung von der Regression in Worten oder ihr geht die
  69. einzelnen Tabellen durch. Des weiteren könnt ihr auch noch die Voraussetzung für die Regression prüfen. Hierfür gibt es aber ein separates Video. Du siehst
  70. hier also die Modellzusammenfassung, die Anova und die Koeffizienten. Auf diese drei Tabellen gehen wir nun noch genauer ein. Also die Ergebnisse werden dir in
  71. dieser Form dargestellt. Du kannst natürlich einfach die Interpretation in Worten die anschauen, aber wir gehen jetzt trotzdem jeden Block einzeln durch
  72. und wir starten gleich mit der Modellzusammenfassung. Starten wir mit dem multiplen Korrelationskoeffizienten R. Dieser
  73. erfasst den Zusammenhang bzw. die Korrelation zwischen der abhängigen Variable und den unabhängigen Variablen. Damit dir das klarer wird, sehen wir
  74. oben noch einmal die Gleichung. Ein Statistikprogramm wie Datat berechnet dir hier hinten die Regressionskoeffizienten.
  75. Hast du die Regressionskoeffizienten berechnet, kannst du alle Variablen mit dem Regressionskoeffizienten multiplizieren und aufsummieren. Dann
  76. bekommst du hier hinten ein Wert raus und du hast natürlich die abhängige Variable. Wenn du nun zwischen der abhängigen Variable und allen
  77. aufsummierten Werten die Korrelation berechnest, dann hast du den multiplen Korrelationskoeffizienten R.
  78. Kommen wir zum nächsten Parameter, dem R². r² wird auch Varianzaufklärung genannt. Es gibt an, wie viel der Varianz der abhängigen Variable durch
  79. die unabhängige Variablen erklärt werden kann. Deine abhängige Variable hat eine gewisse Varianz. Umso mehr wir von dieser Varianz durch die unabhängigen
  80. Variablen erklären können, umso besser ist unser Modell. Nehmen wir das Beispiel her, wie lange man nach einer OP im Krankenhaus bleibt. Natürlich
  81. bleibt nicht jede Person gleich lange im Krankenhaus. Daher haben wir eine Schwankung. Genau diese Schwankung wollen wir ja mit Hilfe der
  82. Regressionsanalyse aufklären. Können wir z.B. mit dem Alter und der Operationsart die Aufenthalsdauer sehr gut vorhersagen, ist das R Quadrat sehr
  83. groß. können wir sogar alles aufklären, was natürlich in der Realität nicht passieren wird, würde eins rauskommen. In dem Fall könnten wir nur mit dem
  84. Alter und der Operationsart genau vorhersagen, wie lange eine Person nach einer OP im Krankenhaus bleibt. Aber wie gesagt, das wird natürlich nicht
  85. rauskommen. Also zusammengefasst sagt dir die Varianzaufklärung, wie gut dein Modell ist und sie liegt zwischen 0 und 1. Ein ist sehr gut, 0 ist nicht gut.
  86. Des weiteren haben wir noch das angepasste R². Das R² überschätzt die Varianzaufklärung gerade dann, wenn es sehr viele unabhängige Variablen gibt.
  87. Hierfür verwendet man dann das angepasste R². Dieses korrigiert das dann. Und als letztes haben wir noch den Standardschätzfehler. Der
  88. Standardschätzfehler gibt an, um wie viel sich das Modell bei der Vorhersage der abhängigen Variable im Mittel verschätzt. In dem Beispiel, was wir
  89. berechnet haben, wollen wir das Gehalt von einer Person schätzen. Unser Schätzfehler sagt uns nun, dass wir uns um 672 € verschätzen, wenn wir das
  90. Gehalt von einer Person vorhersagen möchten. Noch mal zurückgehend auf das Beispiel mit dem Krankenhaus, sollte hier z.B. rauskommen, dass der
  91. Standardschätzfehler 10 Tage ist, wird der Krankenhausbetreiber bestimmt sagen: "Hey, nee, das Modell bringt mir leider nicht viel, denn wenn ich einen
  92. Standardschätzfehler von 10 Tagen habe, dann kann ich damit nicht planen." Sollte jedoch herauskommen, dass der Standardschätzfehler nur zwei Tage ist,
  93. könnte der Krankenhausbetreiber sagen: "Hey, cool, das ist eine gute Vorhersage, damit probieren wir zu arbeiten." Daher, je nachdem, was du mit
  94. dem Regressionsmodell machen möchtest, schaut man eher auf den Standardschätzfehler oder auf das R bzw. R Quadrat wird die Regression zur
  95. Verhersage verwendet, interessiert dann eigentlich eher der Standardschätzfehler, denn man ist hauptsächlich daran interessiert, wie
  96. stark sich das Modell verschätzt. Möchte man den Einfluss von mehreren Variablen auf eine andere Variable wissen, dann interessiert ein eher das R Quadrat.
  97. Dann gibt es noch die statistische Absicherung. Es wird der F-Test gemacht, um die Nullhypothese zu prüfen, ob die Varianzaufklärung r² in der Population 0
  98. ist. Der Test ist oft nicht von großem Interesse. Der Test ist gleichbedeutend der Bedeutung, dass alle wahren Steigungskoeffizienten in der Population
  99. 0 sind. Also B1 ist 0, B2 ist 0 und bis hin zu BK ist 0. In diesem Fall, weil wir nur sehr wenig Daten haben, kommt sogar raus, dass der
  100. Signifikanzwert größer als 0,05 ist und damit wird die Nullhypothese beibehalten. So, und damit kommen wir nun zur
  101. Tabelle, die dich wahrscheinlich am meisten interessiert. Hier sehen wir einmal die unstandardisierten Koeffizienten, die standardisierten
  102. Koeffizienten und das Signifikanzniveau. Groß B, die unstandardisierten Koeffizienten sind genau die Koeffizienten, die du in dein
  103. Regressionsmodell eintragen kannst. Also, wenn wir das Gehalt vorhersagen möchten, haben wir eine Konstante von 1920, das ist unsere Konstante, minus
  104. dem Wert für die Variable Geschlecht plus der Wert von der Variable Alter und der Variable Gewicht. Damit können wir mit den unstandardisierten Koeffizienten
  105. unser Regessionsmodell aufstellen. Möchten wir das Gehalt vorhersagen, müssen wir nun nur noch die Variablen einsetzen. Better sind die
  106. standardisierten Koeffizienten. Hier kannst du ablesen, welche Variable den größten Einfluss auf das Gehalt hat. In diesem Fall hat das Alter den größten
  107. Einfluss auf das Gehalt. Das Alter hat den größten Wert. Und zum Schluss sehen wir noch die signifikanten. Werte kleiner als 0,05 werden als signifikant
  108. betrachtet. In diesem Fall sehen wir, dass kein einziger Koeffizient signifikant ist. Was bedeutet das nun? Die Nullhypothese ist, dass diese
  109. Koeffizienten in der Grundgesamtheit 0 sind. Wenn die Signifiz größer als 0,05 ist, können wir diese Nullhypothese nicht ablehnen. Und damit wird weiterhin
  110. davon ausgegangen, dass diese unstandardisierten Koeffizienten eigentlich in der Grundgesamtheit null sind. Dadurch, dass ich hier einen sehr
  111. kleinen Datensatz verwendet habe, ist es schwer auf signifikante Werte zu kommen. Was dir jetzt noch fehlt, sind die Voraussetzung für deine Taten, damit du
  112. überhaupt eine Regression berechnen kannst. Die Voraussetzung erkläre ich dir im nächsten Video. Also, wir sehen uns gleich wieder. Ciao.

Zum Nachlesen