Zum Inhalt springen
L

Wikipedia · einfach zusammengefasst · Stand

Lineare Regression

Die lineare Regression (kurz: LR) ist ein Spezialfall der Regressionsanalyse, also ein statistisches Verfahren, mit dem versucht wird, eine beobachtete …

Inhalt5 Abschnitte
  1. 1. Grundidee und einfache Regression
  2. 2. Multiple Regression und Fehlerannahmen
  3. 3. Erweiterte lineare Modelle
  4. 4. Orthogonale Regression und Regularisierung
  5. 5. Anwendungen und Modelle für eingeschränkte Zielgrößen

Grundidee und einfache Regression

Die lineare Regression (LR) ist ein Spezialfall der Regressionsanalyse. Sie versucht, eine beobachtete abhängige Variable durch eine oder mehrere unabhängige Variablen zu erklären. Dabei wird ein lineares Modell angenommen: Die abhängige Variable ist eine Linearkombination der Regressionskoeffizienten, aber nicht notwendigerweise der unabhängigen Variablen.

Bei der einfachen linearen Regression (ELR) werden zwei metrische Größen betrachtet: die Einflussgröße X und die Zielgröße Y. Eine Gerade, die Regressionsgerade, wird so durch eine Punktwolke gelegt, dass der lineare Zusammenhang zwischen X und Y möglichst gut beschrieben wird. Das Modell lautet:

Yᵢ = β₀ + β₁xᵢ + εᵢ, i = 1,…,n.

β₀ ist der Achsenabschnitt, β₁ der Steigungsparameter und εᵢ der Fehlerterm.

Multiple Regression und Fehlerannahmen

Die multiple lineare Regression (MLR) verallgemeinert die einfache Regression auf K Regressoren, die gemeinsam die abhängige Variable erklären. In Matrixnotation lautet das Modell:

y = Xβ + ε mit ε ∼ 𝒩(0, σ²I_T).

Beim klassischen multiplen linearen Modell wird zusätzlich angenommen, dass die Fehlerterme normalverteilt sind. Diese Annahme ist erforderlich, um statistische Inferenz durchzuführen, insbesondere um Konfidenzintervalle und Signifikanztests zu berechnen.

In der verallgemeinerten linearen Regression (VLR) sind außerdem Heteroskedastizität und Autokorrelation erlaubt. Die Varianz-Kovarianzmatrix der Fehler ist dann nicht mehr σ²I_T, sondern die nicht konstante Matrix Φ = σ²Ψ. Das Modell lautet:

y = Xβ + ε mit ε ∼ 𝒩(0, σ²Ψ).

Erweiterte lineare Modelle

Das allgemeine lineare Modell (ALM) behandelt den Fall, dass die abhängige Variable Y kein Skalar, sondern ein Vektor ist. Es wird konditionierte Linearität angenommen: E(y | X) = XB. Die Matrix B ersetzt dabei den Vektor β des klassischen linearen Modells. Das Modell lautet:

Y = XB + U.

Allgemeine lineare Modelle werden auch multivariate lineare Modelle genannt. Sie sind nicht mit multiplen linearen Modellen zu verwechseln. Für sie wurden multivariate Varianten der gewöhnlichen und der verallgemeinerten Methode der kleinsten Quadrate entwickelt.

Generalisierte lineare Modelle (GLM) erweitern lineare Modelle dadurch, dass nicht nur eine feste Datenmatrix untersucht wird, sondern auch die Datenmatrix zufallsbehaftet sein kann. Die Untersuchungsmethoden ändern sich dadurch nicht grundlegend, werden aber deutlich komplizierter und rechenaufwendiger.

Das allgemeine lineare Paneldatenmodell erlaubt, dass Achsenabschnitt und Steigungsparameter sowohl zwischen Individuen i als auch über die Zeit t variieren:

yᵢₜ = αᵢₜ + xᵢₜᵀβᵢₜ + εᵢₜ, i = 1,…,N; t = 1,…,T.

Dabei ist yᵢₜ eine skalare abhängige Variable, xᵢₜᵀ ein (K × 1)-Vektor unabhängiger Variablen und εᵢₜ ein skalarer Fehlerterm. Für die Fehler gilt Cov(ε) = E(εεᵀ) = Σ ⊗ I_T = Φ. Das Modell ist zu allgemein und nicht schätzbar, wenn es mehr Parameter als Beobachtungen gibt. Deshalb sind einschränkende Annahmen zur Variation von αᵢₜ und βᵢₜ sowie zum Verhalten der Fehler erforderlich.

Orthogonale Regression und Regularisierung

Die orthogonale lineare Regression berechnet für eine endliche Menge metrisch skalierter Datenpaare (xᵢ,yᵢ) eine Ausgleichsgerade nach der Methode der kleinsten Quadrate. Im Unterschied zur gewöhnlichen Betrachtung werden Fehler sowohl in x als auch in y angenommen.

Regularisierung ergänzt den Regressionsterm um Strafterme. Dadurch soll ein gewünschtes Verhalten der Regression erreicht und eine Überanpassung an den Trainingsdatensatz vermieden werden.

  • Bei der L₁- beziehungsweise LASSO-Regularisierung gilt: β̂ = arg min_β (‖y − Xβ‖² + λ‖β‖₁). Bevorzugt werden einzelne Elemente von β̂ minimiert; andere können betragsmäßig große Werte annehmen. Dies begünstigt dünnbesetzte Matrizen und damit effizientere Algorithmen.
  • Bei der L₂- beziehungsweise Ridge-Regularisierung gilt: β̂ = arg min_β (‖y − Xβ‖² + λ‖β‖²). Der gesamte Vektor β̂ wird gleichmäßig minimiert; die Matrizen bleiben jedoch voll besetzt.
  • Beim elastischen Netz gilt: β̂ = arg min_β (‖y − Xβ‖² + λ₂‖β‖² + λ₁‖β‖₁). Es verbindet L₁- und L₂-Regularisierung.

Anwendungen und Modelle für eingeschränkte Zielgrößen

Regressionsanalyse wird auch auf diskrete oder im Wertebereich eingeschränkte abhängige Variablen angewandt. Die geeignete Modellwahl richtet sich nach der Art der abhängigen Variable und nach der Einschränkung ihres Wertebereichs.

Für verschiedene Arten abhängiger Variablen werden genannt:

  • binär: logistische Regression und Probit-Regression;
  • ordinal: ordinale logistische Regression und ordinale Probit-Regression;
  • absolut: Poisson-Regression und negative binomiale Regression;
  • nominal: multinomiale logistische Regression.

Für verschiedene Einschränkungen des Wertebereichs gibt es:

  • bei zensierten Daten das Tobit-Modell;
  • bei gestutzten Daten die gestutzte Regression;
  • bei stichproben-selegierten Daten die stichproben-selegierte Regression.

In der Ökonometrie werden für quantitative Wirtschaftsanalysen unter anderem Wachstumsfunktionen wie das Gesetz des organischen Wachstums und die Zinseszinsrechnung, Abschwingfunktionen wie die hyperbolische Verteilungsfunktion und die Korachsche Preisfunktion, Schwanenhalsfunktionen wie die logistische Funktion, die Johnson-Funktion und die Potenzexponentialfunktion sowie degressive Saturationsfunktionen wie die Gompertz-Funktion und die Törnquist-Funktion eingesetzt.

Lernvideos zu Lineare Regression

Weiterlesen

Regressionsanalyse Die Regressionsanalyse ist ein Instrumentarium statistischer Analyseverfahren, die zum Ziel haben, Beziehungen zwischen einer abhängigen (auch erklärte … Lineares Modell In der Statistik wird die Bezeichnung lineares Modell (kurz: LM) auf unterschiedliche Arten verwendet und in unterschiedlichen Kontexten. Francis Galton Im Jahr 1879 veröffentlichte er die erste Studie zu Wortassoziationen. Weiterhin ist er Entwickler und Namensgeber des Galtonbretts, eines Modells zur … Lineares Gleichungssystem Die Cramersche Regel verwendet Determinanten, um Formeln für die Lösung eines quadratischen linearen Gleichungssystems zu erzeugen, wenn dieses eindeutig lösbar … Normalverteilung Ihre Wahrscheinlichkeitsdichtefunktion wird auch Gauß-Funktion, gaußsche Normalverteilung, gaußsche Verteilungskurve, Gauß-Kurve, gaußsche Glockenkurve … Konfidenzintervall Ein Konfidenzintervall, kurz KI, auch Vertrauensintervall, Konfidenzbereich, Vertrauensbereich oder Erwartungsbereich genannt, ist in der frequentistischen … Paneldaten Bei Paneldaten handelt es sich um zweidimensionale Daten, die im Rahmen einer Panelstudie erhoben werden. Bei einer Panelstudie wird dieselbe Stichprobe zu … Dünnbesetzte Matrix In der numerischen Mathematik bezeichnet man als dünnbesetzte oder schwachbesetzte Matrix (englisch sparse matrix) eine Matrix, bei der so viele Einträge … Ökonometrie Die Ökonometrie ist ein Teilgebiet der Wirtschaftswissenschaften, das die ökonomische Theorie sowie mathematische Methoden und statistische Daten … Logistische Funktion Die logistische Funktion charakterisiert eine stetige eindimensionale Wahrscheinlichkeitsverteilung (die logistische Verteilung) und ist eine funktionelle …