Lineare Regression: Einfach erklärt numiqo https://www.youtube.com/watch?v=5DcQ4B2aLuY Transkript (automatisch erstellt) 0:00 Hallo, in diesem Video erkläre ich dir, was eine einfache und multiple lineäre Rekression ist, wie du sie online berechnen kannst und wie du die 0:09 Ergebnisse interpretierst. Und damit starten wir auch gleich. Eine Rekessionsanalyse ermöglicht es dir, ausgehend von einer oder mehreren 0:19 Variablen auf eine weitere Variable zu schließen bzw. diese vorherzusehen. Sagen wir, du möchtest herausfinden, was einen Einfluss auf das Gehalt einer 0:30 Person hat. Hierfür könntest du z.B. den höchsten Bildungsabschluss hernehmen, die wöchentliche Arbeitszeit oder das Alte einer Person. Du könntest nun, ob 0:41 diese drei Variablen einen Einfluss auf das Geheilt von einer Person haben. Wenn ja, wenn dieses der Fall ist, dann kannst du das Geheilt einer Person 0:50 vorhersehen, indem du den höchsten Bildungsabschluss der Person weißt, die wöchentliche Arbeitszeit und das Alter der Person. Die Variable, auf die du 0:59 schließen möchtest, also die, die du fürsagen möchtest, heißt abhängige Variable oder Kriterium. Die Variablen, die du für die Vorhersage 1:08 hernimmst, heißen unabhängige Variablen oder Prädiktoren. Mit der Regressionsanalyse können zwei Ziele verfolgt werden. Du kannst den 1:17 Einfluss einer Variable oder mehrerer Variablen auf eine weitere Variable messen oder eine Variable anhand von anderen Variablen vorhersehen. 1:28 Die einfache Linearregression wird verwendet, wenn nur eine unabhängige Variable vorliegt, um auf die abhängige Variable zu schließen. In dem Beispiel, 1:37 wo wir das Gehalt einer Person vorhersagen möchten, verwenden wir nur eine Variable, entweder ob man studiert hat oder nicht, die wöchentliche 1:45 Arbeitszeit oder das Alter einer Person. Bei der multiplen linearen Regission werden mehrere unabhängige Variablen verwendet. Um auf das Geheil zu 1:54 schließen, verwendest du den höchsten Bildungsabschluss, die wöchentliche Arbeitszeit und das Alter von einer Person und alle drei Variablen 2:02 gleichzeitig in einem Modell. Daher der Unterschied zwischen einer einfachen und einer multiplen Russession ist, dass im einen Fall nur eine unabhängige Variable 2:11 verwendet wird und im anderen Fall mehrere. Beide haben gemeinsam, dass die abhängige Variable metrisch ist. Eine metrische Variable sind z.B. das Gehalt 2:20 einer Person, die Körpergröße, die Schuhgröße oder z.B. der Stromverbrauch. Dem gegenüber steht die logistische Regession. Die logistische Regression 2:30 wird verwendet, wenn du eine kategorisch abhängige Variable hast. In diesem Video geht es aber um die lineare Regression. Die logistische Regression wird in einem 2:38 separaten Video in dieser Playlist betrachtet. Also, wir haben die einfache lineäre Regression. Hat die wöchentliche Arbeitszeit einen Einfluss auf den 2:47 Stundenlohn von Angestellten? Wir haben nur eine unabhängige Variable und wir haben die multiple lineare Regression, haben die wöchentliche Arbeitszeit und 2:57 das Alter von Angestellten einen Einfluss auf deren Stundenlohn. Hier haben wir zwei unabhängige Variablen, wöchentliche Arbeitszeit und das Alter 3:06 und beide gehen gleichzeitig in das Regressionsmodell ein. Starten wir mit der einfachen linearen Regression. Das Ziel der einfachen linearen Regression 3:15 ist es, den Wert einer abhängigen Variable aufgrund von einer unabhängigen Variable vorherzusagen. Je größer der lineäre Zusammenhang zwischen der 3:25 unabhängigen Variable und der abhängigen Variable ist, desto genauer ist die Vorhersage. Visuell kann der Zusammenhang zwischen den Variablen in 3:33 einem Streudiagramm dargestellt werden. Umso größer der lineäre Zusammenhang zwischen der abhängigen und der unabhängigen Variable ist, desto mehr 3:40 liegen die Datenpunkte auf einer Geraden. Aufgabe der einfachen linearen Regression ist es nun, genau jene Gerade zu bestimmen, die den linearen 3:49 Zusammenhang zwischen der abhängigen und der unabhängigen Variable am besten beschreibt. Im Rahmen der lineen Regressionsanalyse wird also grafisch 3:57 ausgedrückt eine Gerade in das Streudiagramm eingezeichnet. Um diese gerade zu bestimmen, greift die lineare Regression auf die Methode der kleinsten 4:05 Quadrate zurück. Sagen wir, ein Krankenhaus hat dich beauftragt und du sollst dem Krankenhaus eine Schätzung geben, ausgehend von dem Alter einer 4:13 Person, wie lange diese Person nach einer OP im Krankenhaus bleibt. Hiermit möchte der Krankenhausbetreiber seine Planung optimieren. Deine abhängige 4:22 Variable, also die, auf die du schließen möchtest, ist die Aufenthaltsdauer nach einer OP. Die unabhängige Variable ist das Alter. Die Gleichung, die dein 4:31 Modell beschreibt, sieht nun folgendermaßen aus. Y Dach ist die geschätzte Aufenthalte, X ist das Alter, B ist die Steigung der Geraden und A ist 4:43 der Aufpunkt. Das macht jetzt nicht viel Sinn, aber wenn eine Person 0 Jahre alt ist, würde sie genau a Tage im Krankenhaus bleiben, denn wir haben b* 0 4:53 + A. Dementsprechend ist die geschätzte Aufenthaltsdauer genau a Tage. Das ist unser Aufpunkt. Ansonsten wird diese Steigung durch den Koeffizienten B 5:02 beschrieben. Damit du die Koeffizienten berechnen kannst, muss das Krankenhaus dir natürlich eine Stichprobe von Personen geben, von denen du das Alter 5:10 und die Aufenthaltsdauer nach einer OP weißt. Mit den dir vorliegenden Daten könntest du nun z.B. rausbekommen, dass B 0,14 ist und A 1,2. Das ist nun dein 5:22 Modell, mit dem du die Aufenthaltsdauer nach einer OP ausgehend von dem Alter schätzen kannst. Sagen wir, eine Person, die 33 Jahre alt ist, ist für eine OP 5:32 angemeldet, dann setzen wir für X 33 Jahre ein. Unser Modell sagt uns nun, dass diese Person nach einer OP 5,82 Tage im Krankenhaus bleibt. Jetzt ist 5:43 natürlich die Frage, wie berechnet man die Steigung B und den Aufpunkt A? In der Regel verwendest du hierfür einfach ein Statistikprogramm wie Datat. Im 5:51 Falle der einfachen lineen Regression geht es aber auch noch recht einfach per Hand. Der Koeffizient B ergibt sich über die Korrelation zwischen Alter und 6:00 Aufenthalteauer nach einer OP mal die Standardabweichung von der Aufenthaltsdauer nach einer OP geteilt durch die Standardabweichung von dem 6:08 Alter. A ergibt sich, indem wir den Mittelwert der Aufenthaltsdauer nach der OP hernehmen und davon B mal den Mittelwert von dem Alter abziehen. Die 6:18 Regressionsgerade probiert immer bestmöglich die gegebenen Daten mit einer Gerade abzubilden. Natürlich ergibt sich daher auch immer ein Fehler. 6:27 Dieser Fehler wird Epsilon genannt. Sagen wir, wir schätzen die Aufenthalteauer von einer Person, die 33 Jahre alt ist. Unser Modell sagt, dass 6:35 diese Person 5,82 Tage im Krankenhaus bleibt. Also, wir schauen bei der X-Achse bei dem Alter 33 nach und schauen, wo wir die Gerade treffen. Hier 6:46 würde sich dann ein Alter von 5,82 ergeben. Tatsächlich bleibt diese Person aber 7 Tage im Krankenhaus. Dann ist die Differenz zwischen dem geschätzten Wert 6:56 und dem wahren Wert unser Fehler. Eben genau der Fehler wird EP genannt. Damit hast du nun einen guten Überblick, was eine einfache lineare Regression ist. 7:05 Und wir kommen zur multiplen linearen Regression. Im Gegensatz zur einfachen linearen Regression können bei der multiplen 7:13 linearen Regression zwei oder mehr unabhängige Variablen berücksichtigt werden. Ziel ist es, eine Variable auf Basis von mehreren anderen Variablen zu 7:23 schätzen. Die Variable, die geschätzt werden soll, wird dabei als abhängige Variable Kriterium bezeichnet. Die Variablen, welche zur Vorhersage 7:31 hereangezogen werden, heißen unabhängige Variablen bzw. Prädiktoren. Mit der multiplen lineären Regression kann der Einfluss daher von einer Drittvariable 7:40 kontrolliert werden. Die multiple lineäre Regression kommt häufig in der empirischen Sozialforschung sowie in der Marktforschung zum Einsatz. In beiden 7:49 Bereichen ist es von Interesse herauszufinden, welchen Einfluss verschiedene Faktoren auf eine Variable haben. 7:56 Daher, wie wir bereits wissen, sieht die Gleichung für die einfache Linearregression so aus. Wir haben eine unabhängige Variable. Gehen wir nun den 8:04 Weg zur multiplen lineären Regression, haben wir mehrere unabhängige Variablen. Also, wir haben die erste unabhängige Variable, wir haben die zweite 8:13 unabhängige Variable und wir haben die Karte unabhängige Variable. Die Koeffizienten können nun ähnlich wie bei der Lineärenreionsgleichung 8:22 interpretiert werden. Sind alle unabhängigen Variablen null, kommt der Wert a raus. Ändert sich eine unabhängige Variable um ein Einheit, 8:31 gibt der Zugehörige Koeffizient B an. um wie viel sich die abhängige Variable verändert. Also sagen wir, das ist das Alter und das ist das Gehalt von einer 8:40 Person. Ändert sich das Alter um ein Jahr, ändert sich dann das Gehalt der Person um B1. Sagen wir, wir wollen das Gehalt von 8:49 einer Person schätzen, dadurch dass wir das Geschlecht abfragen, das Alter der Person und das Gewicht der Person. Der Koeffizient für die Variable Geschlecht 8:58 wäre dann -372. Der Koeffizient für das Alter wäre dann 25,39, für das Gewicht 5,156 9:07 und wir hätten den Aufpunkt von 1920. Also, wenn alles null ist, erhalten wir ein Gehalt von 1920. Eine Person, die ein Jahr älter ist, 9:18 verdient 25,39 € mehr. Und eine Person, die 1 Kilogramm schwerer ist, verdient 5,51 weniger. Ist die Person männlich, würde sie in diesem 9:29 Beispiel 372 € weniger verdienen als eine Frau. Das sind natürlich nur Beispieldaten. Und jetzt zeige ich euch, wie ihr online eine Rekrissionsanalyse 9:38 berechnen könnt und wie ihr die Ergebnisse interpretiert. Dafür geht ihr bitte auf datatab.de, de. Klickt auf den Statistikrechner und wenn 9:46 ihr eure eigenen Daten verwenden möchtet, lehrt ihr bitte die Tabelle und kopiert sie einfach in diese Tabelle hinein. Ich verwende die Beispieldaten. 9:55 Wir möchten eine Regression berechnen, also klicken wir einfach auf Regression. Sagen wir, wir möchten das Einkommen von einer Person vorhersagen. Hierfür nehmen 10:05 wir das Geschlecht, das Alter und das Gewicht her. Nun berechnet euch Datat automatisch eine lineare Regression. und ihr bekommt hier unten die Ergebnisse. 10:17 Entweder ihr könnt einfach auf Zusammenfassung in Worten klicken, dann bekommt ihr eine Zusammenfassung von der Regression in Worten oder ihr geht die 10:25 einzelnen Tabellen durch. Des weiteren könnt ihr auch noch die Voraussetzung für die Regression prüfen. Hierfür gibt es aber ein separates Video. Du siehst 10:33 hier also die Modellzusammenfassung, die Anova und die Koeffizienten. Auf diese drei Tabellen gehen wir nun noch genauer ein. Also die Ergebnisse werden dir in 10:43 dieser Form dargestellt. Du kannst natürlich einfach die Interpretation in Worten die anschauen, aber wir gehen jetzt trotzdem jeden Block einzeln durch 10:51 und wir starten gleich mit der Modellzusammenfassung. Starten wir mit dem multiplen Korrelationskoeffizienten R. Dieser 10:59 erfasst den Zusammenhang bzw. die Korrelation zwischen der abhängigen Variable und den unabhängigen Variablen. Damit dir das klarer wird, sehen wir 11:08 oben noch einmal die Gleichung. Ein Statistikprogramm wie Datat berechnet dir hier hinten die Regressionskoeffizienten. 11:15 Hast du die Regressionskoeffizienten berechnet, kannst du alle Variablen mit dem Regressionskoeffizienten multiplizieren und aufsummieren. Dann 11:23 bekommst du hier hinten ein Wert raus und du hast natürlich die abhängige Variable. Wenn du nun zwischen der abhängigen Variable und allen 11:31 aufsummierten Werten die Korrelation berechnest, dann hast du den multiplen Korrelationskoeffizienten R. 11:38 Kommen wir zum nächsten Parameter, dem R². r² wird auch Varianzaufklärung genannt. Es gibt an, wie viel der Varianz der abhängigen Variable durch 11:47 die unabhängige Variablen erklärt werden kann. Deine abhängige Variable hat eine gewisse Varianz. Umso mehr wir von dieser Varianz durch die unabhängigen 11:57 Variablen erklären können, umso besser ist unser Modell. Nehmen wir das Beispiel her, wie lange man nach einer OP im Krankenhaus bleibt. Natürlich 12:06 bleibt nicht jede Person gleich lange im Krankenhaus. Daher haben wir eine Schwankung. Genau diese Schwankung wollen wir ja mit Hilfe der 12:13 Regressionsanalyse aufklären. Können wir z.B. mit dem Alter und der Operationsart die Aufenthalsdauer sehr gut vorhersagen, ist das R Quadrat sehr 12:23 groß. können wir sogar alles aufklären, was natürlich in der Realität nicht passieren wird, würde eins rauskommen. In dem Fall könnten wir nur mit dem 12:32 Alter und der Operationsart genau vorhersagen, wie lange eine Person nach einer OP im Krankenhaus bleibt. Aber wie gesagt, das wird natürlich nicht 12:41 rauskommen. Also zusammengefasst sagt dir die Varianzaufklärung, wie gut dein Modell ist und sie liegt zwischen 0 und 1. Ein ist sehr gut, 0 ist nicht gut. 12:51 Des weiteren haben wir noch das angepasste R². Das R² überschätzt die Varianzaufklärung gerade dann, wenn es sehr viele unabhängige Variablen gibt. 13:01 Hierfür verwendet man dann das angepasste R². Dieses korrigiert das dann. Und als letztes haben wir noch den Standardschätzfehler. Der 13:09 Standardschätzfehler gibt an, um wie viel sich das Modell bei der Vorhersage der abhängigen Variable im Mittel verschätzt. In dem Beispiel, was wir 13:17 berechnet haben, wollen wir das Gehalt von einer Person schätzen. Unser Schätzfehler sagt uns nun, dass wir uns um 672 € verschätzen, wenn wir das 13:25 Gehalt von einer Person vorhersagen möchten. Noch mal zurückgehend auf das Beispiel mit dem Krankenhaus, sollte hier z.B. rauskommen, dass der 13:33 Standardschätzfehler 10 Tage ist, wird der Krankenhausbetreiber bestimmt sagen: "Hey, nee, das Modell bringt mir leider nicht viel, denn wenn ich einen 13:40 Standardschätzfehler von 10 Tagen habe, dann kann ich damit nicht planen." Sollte jedoch herauskommen, dass der Standardschätzfehler nur zwei Tage ist, 13:47 könnte der Krankenhausbetreiber sagen: "Hey, cool, das ist eine gute Vorhersage, damit probieren wir zu arbeiten." Daher, je nachdem, was du mit 13:54 dem Regressionsmodell machen möchtest, schaut man eher auf den Standardschätzfehler oder auf das R bzw. R Quadrat wird die Regression zur 14:02 Verhersage verwendet, interessiert dann eigentlich eher der Standardschätzfehler, denn man ist hauptsächlich daran interessiert, wie 14:09 stark sich das Modell verschätzt. Möchte man den Einfluss von mehreren Variablen auf eine andere Variable wissen, dann interessiert ein eher das R Quadrat. 14:18 Dann gibt es noch die statistische Absicherung. Es wird der F-Test gemacht, um die Nullhypothese zu prüfen, ob die Varianzaufklärung r² in der Population 0 14:28 ist. Der Test ist oft nicht von großem Interesse. Der Test ist gleichbedeutend der Bedeutung, dass alle wahren Steigungskoeffizienten in der Population 14:38 0 sind. Also B1 ist 0, B2 ist 0 und bis hin zu BK ist 0. In diesem Fall, weil wir nur sehr wenig Daten haben, kommt sogar raus, dass der 14:49 Signifikanzwert größer als 0,05 ist und damit wird die Nullhypothese beibehalten. So, und damit kommen wir nun zur 14:57 Tabelle, die dich wahrscheinlich am meisten interessiert. Hier sehen wir einmal die unstandardisierten Koeffizienten, die standardisierten 15:04 Koeffizienten und das Signifikanzniveau. Groß B, die unstandardisierten Koeffizienten sind genau die Koeffizienten, die du in dein 15:12 Regressionsmodell eintragen kannst. Also, wenn wir das Gehalt vorhersagen möchten, haben wir eine Konstante von 1920, das ist unsere Konstante, minus 15:22 dem Wert für die Variable Geschlecht plus der Wert von der Variable Alter und der Variable Gewicht. Damit können wir mit den unstandardisierten Koeffizienten 15:31 unser Regessionsmodell aufstellen. Möchten wir das Gehalt vorhersagen, müssen wir nun nur noch die Variablen einsetzen. Better sind die 15:39 standardisierten Koeffizienten. Hier kannst du ablesen, welche Variable den größten Einfluss auf das Gehalt hat. In diesem Fall hat das Alter den größten 15:47 Einfluss auf das Gehalt. Das Alter hat den größten Wert. Und zum Schluss sehen wir noch die signifikanten. Werte kleiner als 0,05 werden als signifikant 15:57 betrachtet. In diesem Fall sehen wir, dass kein einziger Koeffizient signifikant ist. Was bedeutet das nun? Die Nullhypothese ist, dass diese 16:06 Koeffizienten in der Grundgesamtheit 0 sind. Wenn die Signifiz größer als 0,05 ist, können wir diese Nullhypothese nicht ablehnen. Und damit wird weiterhin 16:16 davon ausgegangen, dass diese unstandardisierten Koeffizienten eigentlich in der Grundgesamtheit null sind. Dadurch, dass ich hier einen sehr 16:24 kleinen Datensatz verwendet habe, ist es schwer auf signifikante Werte zu kommen. Was dir jetzt noch fehlt, sind die Voraussetzung für deine Taten, damit du 16:32 überhaupt eine Regression berechnen kannst. Die Voraussetzung erkläre ich dir im nächsten Video. Also, wir sehen uns gleich wieder. Ciao.