Das Video kommt von YouTube: erst beim Abspielen verbindet sich die Seite mit YouTube (Google).
Lineare Regression: Einfach erklärt
Das Wichtigste aus dem Video
Tipp auf eine Zeit – das Video springt genau dorthin.
Transkriptautomatisch erstellt · 112 Zeilen
- Hallo, in diesem Video erkläre ich dir, was eine einfache und multiple lineäre Rekression ist, wie du sie online berechnen kannst und wie du die
- Ergebnisse interpretierst. Und damit starten wir auch gleich. Eine Rekessionsanalyse ermöglicht es dir, ausgehend von einer oder mehreren
- Variablen auf eine weitere Variable zu schließen bzw. diese vorherzusehen. Sagen wir, du möchtest herausfinden, was einen Einfluss auf das Gehalt einer
- Person hat. Hierfür könntest du z.B. den höchsten Bildungsabschluss hernehmen, die wöchentliche Arbeitszeit oder das Alte einer Person. Du könntest nun, ob
- diese drei Variablen einen Einfluss auf das Geheilt von einer Person haben. Wenn ja, wenn dieses der Fall ist, dann kannst du das Geheilt einer Person
- vorhersehen, indem du den höchsten Bildungsabschluss der Person weißt, die wöchentliche Arbeitszeit und das Alter der Person. Die Variable, auf die du
- schließen möchtest, also die, die du fürsagen möchtest, heißt abhängige Variable oder Kriterium. Die Variablen, die du für die Vorhersage
- hernimmst, heißen unabhängige Variablen oder Prädiktoren. Mit der Regressionsanalyse können zwei Ziele verfolgt werden. Du kannst den
- Einfluss einer Variable oder mehrerer Variablen auf eine weitere Variable messen oder eine Variable anhand von anderen Variablen vorhersehen.
- Die einfache Linearregression wird verwendet, wenn nur eine unabhängige Variable vorliegt, um auf die abhängige Variable zu schließen. In dem Beispiel,
- wo wir das Gehalt einer Person vorhersagen möchten, verwenden wir nur eine Variable, entweder ob man studiert hat oder nicht, die wöchentliche
- Arbeitszeit oder das Alter einer Person. Bei der multiplen linearen Regission werden mehrere unabhängige Variablen verwendet. Um auf das Geheil zu
- schließen, verwendest du den höchsten Bildungsabschluss, die wöchentliche Arbeitszeit und das Alter von einer Person und alle drei Variablen
- gleichzeitig in einem Modell. Daher der Unterschied zwischen einer einfachen und einer multiplen Russession ist, dass im einen Fall nur eine unabhängige Variable
- verwendet wird und im anderen Fall mehrere. Beide haben gemeinsam, dass die abhängige Variable metrisch ist. Eine metrische Variable sind z.B. das Gehalt
- einer Person, die Körpergröße, die Schuhgröße oder z.B. der Stromverbrauch. Dem gegenüber steht die logistische Regession. Die logistische Regression
- wird verwendet, wenn du eine kategorisch abhängige Variable hast. In diesem Video geht es aber um die lineare Regression. Die logistische Regression wird in einem
- separaten Video in dieser Playlist betrachtet. Also, wir haben die einfache lineäre Regression. Hat die wöchentliche Arbeitszeit einen Einfluss auf den
- Stundenlohn von Angestellten? Wir haben nur eine unabhängige Variable und wir haben die multiple lineare Regression, haben die wöchentliche Arbeitszeit und
- das Alter von Angestellten einen Einfluss auf deren Stundenlohn. Hier haben wir zwei unabhängige Variablen, wöchentliche Arbeitszeit und das Alter
- und beide gehen gleichzeitig in das Regressionsmodell ein. Starten wir mit der einfachen linearen Regression. Das Ziel der einfachen linearen Regression
- ist es, den Wert einer abhängigen Variable aufgrund von einer unabhängigen Variable vorherzusagen. Je größer der lineäre Zusammenhang zwischen der
- unabhängigen Variable und der abhängigen Variable ist, desto genauer ist die Vorhersage. Visuell kann der Zusammenhang zwischen den Variablen in
- einem Streudiagramm dargestellt werden. Umso größer der lineäre Zusammenhang zwischen der abhängigen und der unabhängigen Variable ist, desto mehr
- liegen die Datenpunkte auf einer Geraden. Aufgabe der einfachen linearen Regression ist es nun, genau jene Gerade zu bestimmen, die den linearen
- Zusammenhang zwischen der abhängigen und der unabhängigen Variable am besten beschreibt. Im Rahmen der lineen Regressionsanalyse wird also grafisch
- ausgedrückt eine Gerade in das Streudiagramm eingezeichnet. Um diese gerade zu bestimmen, greift die lineare Regression auf die Methode der kleinsten
- Quadrate zurück. Sagen wir, ein Krankenhaus hat dich beauftragt und du sollst dem Krankenhaus eine Schätzung geben, ausgehend von dem Alter einer
- Person, wie lange diese Person nach einer OP im Krankenhaus bleibt. Hiermit möchte der Krankenhausbetreiber seine Planung optimieren. Deine abhängige
- Variable, also die, auf die du schließen möchtest, ist die Aufenthaltsdauer nach einer OP. Die unabhängige Variable ist das Alter. Die Gleichung, die dein
- Modell beschreibt, sieht nun folgendermaßen aus. Y Dach ist die geschätzte Aufenthalte, X ist das Alter, B ist die Steigung der Geraden und A ist
- der Aufpunkt. Das macht jetzt nicht viel Sinn, aber wenn eine Person 0 Jahre alt ist, würde sie genau a Tage im Krankenhaus bleiben, denn wir haben b* 0
- + A. Dementsprechend ist die geschätzte Aufenthaltsdauer genau a Tage. Das ist unser Aufpunkt. Ansonsten wird diese Steigung durch den Koeffizienten B
- beschrieben. Damit du die Koeffizienten berechnen kannst, muss das Krankenhaus dir natürlich eine Stichprobe von Personen geben, von denen du das Alter
- und die Aufenthaltsdauer nach einer OP weißt. Mit den dir vorliegenden Daten könntest du nun z.B. rausbekommen, dass B 0,14 ist und A 1,2. Das ist nun dein
- Modell, mit dem du die Aufenthaltsdauer nach einer OP ausgehend von dem Alter schätzen kannst. Sagen wir, eine Person, die 33 Jahre alt ist, ist für eine OP
- angemeldet, dann setzen wir für X 33 Jahre ein. Unser Modell sagt uns nun, dass diese Person nach einer OP 5,82 Tage im Krankenhaus bleibt. Jetzt ist
- natürlich die Frage, wie berechnet man die Steigung B und den Aufpunkt A? In der Regel verwendest du hierfür einfach ein Statistikprogramm wie Datat. Im
- Falle der einfachen lineen Regression geht es aber auch noch recht einfach per Hand. Der Koeffizient B ergibt sich über die Korrelation zwischen Alter und
- Aufenthalteauer nach einer OP mal die Standardabweichung von der Aufenthaltsdauer nach einer OP geteilt durch die Standardabweichung von dem
- Alter. A ergibt sich, indem wir den Mittelwert der Aufenthaltsdauer nach der OP hernehmen und davon B mal den Mittelwert von dem Alter abziehen. Die
- Regressionsgerade probiert immer bestmöglich die gegebenen Daten mit einer Gerade abzubilden. Natürlich ergibt sich daher auch immer ein Fehler.
- Dieser Fehler wird Epsilon genannt. Sagen wir, wir schätzen die Aufenthalteauer von einer Person, die 33 Jahre alt ist. Unser Modell sagt, dass
- diese Person 5,82 Tage im Krankenhaus bleibt. Also, wir schauen bei der X-Achse bei dem Alter 33 nach und schauen, wo wir die Gerade treffen. Hier
- würde sich dann ein Alter von 5,82 ergeben. Tatsächlich bleibt diese Person aber 7 Tage im Krankenhaus. Dann ist die Differenz zwischen dem geschätzten Wert
- und dem wahren Wert unser Fehler. Eben genau der Fehler wird EP genannt. Damit hast du nun einen guten Überblick, was eine einfache lineare Regression ist.
- Und wir kommen zur multiplen linearen Regression. Im Gegensatz zur einfachen linearen Regression können bei der multiplen
- linearen Regression zwei oder mehr unabhängige Variablen berücksichtigt werden. Ziel ist es, eine Variable auf Basis von mehreren anderen Variablen zu
- schätzen. Die Variable, die geschätzt werden soll, wird dabei als abhängige Variable Kriterium bezeichnet. Die Variablen, welche zur Vorhersage
- hereangezogen werden, heißen unabhängige Variablen bzw. Prädiktoren. Mit der multiplen lineären Regression kann der Einfluss daher von einer Drittvariable
- kontrolliert werden. Die multiple lineäre Regression kommt häufig in der empirischen Sozialforschung sowie in der Marktforschung zum Einsatz. In beiden
- Bereichen ist es von Interesse herauszufinden, welchen Einfluss verschiedene Faktoren auf eine Variable haben.
- Daher, wie wir bereits wissen, sieht die Gleichung für die einfache Linearregression so aus. Wir haben eine unabhängige Variable. Gehen wir nun den
- Weg zur multiplen lineären Regression, haben wir mehrere unabhängige Variablen. Also, wir haben die erste unabhängige Variable, wir haben die zweite
- unabhängige Variable und wir haben die Karte unabhängige Variable. Die Koeffizienten können nun ähnlich wie bei der Lineärenreionsgleichung
- interpretiert werden. Sind alle unabhängigen Variablen null, kommt der Wert a raus. Ändert sich eine unabhängige Variable um ein Einheit,
- gibt der Zugehörige Koeffizient B an. um wie viel sich die abhängige Variable verändert. Also sagen wir, das ist das Alter und das ist das Gehalt von einer
- Person. Ändert sich das Alter um ein Jahr, ändert sich dann das Gehalt der Person um B1. Sagen wir, wir wollen das Gehalt von
- einer Person schätzen, dadurch dass wir das Geschlecht abfragen, das Alter der Person und das Gewicht der Person. Der Koeffizient für die Variable Geschlecht
- wäre dann -372. Der Koeffizient für das Alter wäre dann 25,39, für das Gewicht 5,156
- und wir hätten den Aufpunkt von 1920. Also, wenn alles null ist, erhalten wir ein Gehalt von 1920. Eine Person, die ein Jahr älter ist,
- verdient 25,39 € mehr. Und eine Person, die 1 Kilogramm schwerer ist, verdient 5,51 weniger. Ist die Person männlich, würde sie in diesem
- Beispiel 372 € weniger verdienen als eine Frau. Das sind natürlich nur Beispieldaten. Und jetzt zeige ich euch, wie ihr online eine Rekrissionsanalyse
- berechnen könnt und wie ihr die Ergebnisse interpretiert. Dafür geht ihr bitte auf datatab.de, de. Klickt auf den Statistikrechner und wenn
- ihr eure eigenen Daten verwenden möchtet, lehrt ihr bitte die Tabelle und kopiert sie einfach in diese Tabelle hinein. Ich verwende die Beispieldaten.
- Wir möchten eine Regression berechnen, also klicken wir einfach auf Regression. Sagen wir, wir möchten das Einkommen von einer Person vorhersagen. Hierfür nehmen
- wir das Geschlecht, das Alter und das Gewicht her. Nun berechnet euch Datat automatisch eine lineare Regression. und ihr bekommt hier unten die Ergebnisse.
- Entweder ihr könnt einfach auf Zusammenfassung in Worten klicken, dann bekommt ihr eine Zusammenfassung von der Regression in Worten oder ihr geht die
- einzelnen Tabellen durch. Des weiteren könnt ihr auch noch die Voraussetzung für die Regression prüfen. Hierfür gibt es aber ein separates Video. Du siehst
- hier also die Modellzusammenfassung, die Anova und die Koeffizienten. Auf diese drei Tabellen gehen wir nun noch genauer ein. Also die Ergebnisse werden dir in
- dieser Form dargestellt. Du kannst natürlich einfach die Interpretation in Worten die anschauen, aber wir gehen jetzt trotzdem jeden Block einzeln durch
- und wir starten gleich mit der Modellzusammenfassung. Starten wir mit dem multiplen Korrelationskoeffizienten R. Dieser
- erfasst den Zusammenhang bzw. die Korrelation zwischen der abhängigen Variable und den unabhängigen Variablen. Damit dir das klarer wird, sehen wir
- oben noch einmal die Gleichung. Ein Statistikprogramm wie Datat berechnet dir hier hinten die Regressionskoeffizienten.
- Hast du die Regressionskoeffizienten berechnet, kannst du alle Variablen mit dem Regressionskoeffizienten multiplizieren und aufsummieren. Dann
- bekommst du hier hinten ein Wert raus und du hast natürlich die abhängige Variable. Wenn du nun zwischen der abhängigen Variable und allen
- aufsummierten Werten die Korrelation berechnest, dann hast du den multiplen Korrelationskoeffizienten R.
- Kommen wir zum nächsten Parameter, dem R². r² wird auch Varianzaufklärung genannt. Es gibt an, wie viel der Varianz der abhängigen Variable durch
- die unabhängige Variablen erklärt werden kann. Deine abhängige Variable hat eine gewisse Varianz. Umso mehr wir von dieser Varianz durch die unabhängigen
- Variablen erklären können, umso besser ist unser Modell. Nehmen wir das Beispiel her, wie lange man nach einer OP im Krankenhaus bleibt. Natürlich
- bleibt nicht jede Person gleich lange im Krankenhaus. Daher haben wir eine Schwankung. Genau diese Schwankung wollen wir ja mit Hilfe der
- Regressionsanalyse aufklären. Können wir z.B. mit dem Alter und der Operationsart die Aufenthalsdauer sehr gut vorhersagen, ist das R Quadrat sehr
- groß. können wir sogar alles aufklären, was natürlich in der Realität nicht passieren wird, würde eins rauskommen. In dem Fall könnten wir nur mit dem
- Alter und der Operationsart genau vorhersagen, wie lange eine Person nach einer OP im Krankenhaus bleibt. Aber wie gesagt, das wird natürlich nicht
- rauskommen. Also zusammengefasst sagt dir die Varianzaufklärung, wie gut dein Modell ist und sie liegt zwischen 0 und 1. Ein ist sehr gut, 0 ist nicht gut.
- Des weiteren haben wir noch das angepasste R². Das R² überschätzt die Varianzaufklärung gerade dann, wenn es sehr viele unabhängige Variablen gibt.
- Hierfür verwendet man dann das angepasste R². Dieses korrigiert das dann. Und als letztes haben wir noch den Standardschätzfehler. Der
- Standardschätzfehler gibt an, um wie viel sich das Modell bei der Vorhersage der abhängigen Variable im Mittel verschätzt. In dem Beispiel, was wir
- berechnet haben, wollen wir das Gehalt von einer Person schätzen. Unser Schätzfehler sagt uns nun, dass wir uns um 672 € verschätzen, wenn wir das
- Gehalt von einer Person vorhersagen möchten. Noch mal zurückgehend auf das Beispiel mit dem Krankenhaus, sollte hier z.B. rauskommen, dass der
- Standardschätzfehler 10 Tage ist, wird der Krankenhausbetreiber bestimmt sagen: "Hey, nee, das Modell bringt mir leider nicht viel, denn wenn ich einen
- Standardschätzfehler von 10 Tagen habe, dann kann ich damit nicht planen." Sollte jedoch herauskommen, dass der Standardschätzfehler nur zwei Tage ist,
- könnte der Krankenhausbetreiber sagen: "Hey, cool, das ist eine gute Vorhersage, damit probieren wir zu arbeiten." Daher, je nachdem, was du mit
- dem Regressionsmodell machen möchtest, schaut man eher auf den Standardschätzfehler oder auf das R bzw. R Quadrat wird die Regression zur
- Verhersage verwendet, interessiert dann eigentlich eher der Standardschätzfehler, denn man ist hauptsächlich daran interessiert, wie
- stark sich das Modell verschätzt. Möchte man den Einfluss von mehreren Variablen auf eine andere Variable wissen, dann interessiert ein eher das R Quadrat.
- Dann gibt es noch die statistische Absicherung. Es wird der F-Test gemacht, um die Nullhypothese zu prüfen, ob die Varianzaufklärung r² in der Population 0
- ist. Der Test ist oft nicht von großem Interesse. Der Test ist gleichbedeutend der Bedeutung, dass alle wahren Steigungskoeffizienten in der Population
- 0 sind. Also B1 ist 0, B2 ist 0 und bis hin zu BK ist 0. In diesem Fall, weil wir nur sehr wenig Daten haben, kommt sogar raus, dass der
- Signifikanzwert größer als 0,05 ist und damit wird die Nullhypothese beibehalten. So, und damit kommen wir nun zur
- Tabelle, die dich wahrscheinlich am meisten interessiert. Hier sehen wir einmal die unstandardisierten Koeffizienten, die standardisierten
- Koeffizienten und das Signifikanzniveau. Groß B, die unstandardisierten Koeffizienten sind genau die Koeffizienten, die du in dein
- Regressionsmodell eintragen kannst. Also, wenn wir das Gehalt vorhersagen möchten, haben wir eine Konstante von 1920, das ist unsere Konstante, minus
- dem Wert für die Variable Geschlecht plus der Wert von der Variable Alter und der Variable Gewicht. Damit können wir mit den unstandardisierten Koeffizienten
- unser Regessionsmodell aufstellen. Möchten wir das Gehalt vorhersagen, müssen wir nun nur noch die Variablen einsetzen. Better sind die
- standardisierten Koeffizienten. Hier kannst du ablesen, welche Variable den größten Einfluss auf das Gehalt hat. In diesem Fall hat das Alter den größten
- Einfluss auf das Gehalt. Das Alter hat den größten Wert. Und zum Schluss sehen wir noch die signifikanten. Werte kleiner als 0,05 werden als signifikant
- betrachtet. In diesem Fall sehen wir, dass kein einziger Koeffizient signifikant ist. Was bedeutet das nun? Die Nullhypothese ist, dass diese
- Koeffizienten in der Grundgesamtheit 0 sind. Wenn die Signifiz größer als 0,05 ist, können wir diese Nullhypothese nicht ablehnen. Und damit wird weiterhin
- davon ausgegangen, dass diese unstandardisierten Koeffizienten eigentlich in der Grundgesamtheit null sind. Dadurch, dass ich hier einen sehr
- kleinen Datensatz verwendet habe, ist es schwer auf signifikante Werte zu kommen. Was dir jetzt noch fehlt, sind die Voraussetzung für deine Taten, damit du
- überhaupt eine Regression berechnen kannst. Die Voraussetzung erkläre ich dir im nächsten Video. Also, wir sehen uns gleich wieder. Ciao.
Zum Nachlesen
RegressionsanalyseDie Regressionsanalyse ist ein Instrumentarium statistischer Analyseverfahren, die zum Ziel haben, Beziehungen zwischen einer abhängigen (auch erklärte …
Lineare EinfachregressionDie Bezeichnung einfach gibt an, dass bei der linearen Einfachregression nur eine unabhängige Variable verwendet wird, um die Zielgröße zu erklären. Ziel ist …
Multiple lineare RegressionDie multiple lineare Regression ist ein statistisches Verfahren, mit dem versucht wird, eine beobachtete abhängige Variable durch mehrere unabhängige Variablen …
Lineare RegressionDie lineare Regression (kurz: LR) ist ein Spezialfall der Regressionsanalyse, also ein statistisches Verfahren, mit dem versucht wird, eine beobachtete …