Zum Inhalt springen
L

Wikipedia · einfach zusammengefasst · Stand

Lineare Einfachregression

Die Bezeichnung einfach gibt an, dass bei der linearen Einfachregression nur eine unabhängige Variable verwendet wird, um die Zielgröße zu erklären. Ziel ist …

Inhalt6 Abschnitte
  1. 1. Grundidee und Modell
  2. 2. Voraussetzungen und Kleinste-Quadrate-Schätzung
  3. 3. Eigenschaften und Genauigkeit der Schätzer
  4. 4. Bestimmtheitsmaß und statistische Tests
  5. 5. Vorhersage, Kausalität und Sonderfall Ursprung
  6. 6. Matrixdarstellung, Verallgemeinerung und R

Grundidee und Modell

Die lineare Einfachregression (ELR) ist ein Verfahren der Regressionsanalyse und ein Spezialfall der linearen Regression. „Einfach“ bedeutet, dass genau eine unabhängige Variable verwendet wird, um eine abhängige Variable zu erklären. Ziel ist es, den Achsenabschnitt β₀, die Steigung β₁ und die Varianz σ² der Störgrößen zu schätzen.

Ausgangspunkt sind zwei metrische Größen: die Einflussgröße X beziehungsweise der Regressor und die Zielgröße Y beziehungsweise der Regressand. Es liegen n Messwertpaare (x₁,y₁), …, (xₙ,yₙ) vor, die in einem Streudiagramm dargestellt werden. Der Zusammenhang besteht aus einem systematischen und einem zufälligen Teil:

Yᵢ = f(xᵢ;β₀,β₁,…) + εᵢ.

Die Störgröße εᵢ beschreibt zufällige Einflüsse, etwa Messfehler. Der systematische Teil wird bei der linearen Einfachregression durch eine Gerade beschrieben:

f(xᵢ;β₀,β₁) = β₀ + β₁xᵢ.

Damit lautet das Modell Yᵢ = β₀ + β₁xᵢ + εᵢ, für i = 1,…,n. Yᵢ ist eine Zufallsvariable, die xᵢ-Werte gelten als bekannte, nicht zufällige Messwerte, β₀ und β₁ sind unbekannte Regressionsparameter und εᵢ ist eine unbeobachtbare zufällige Störgröße. Die beobachteten yᵢ sind Realisierungen der Yᵢ.

Nach der Schätzung erhält man die Stichproben-Regressionsfunktion ŷ = β̂₀ + β̂₁x. Die geschätzten Störgrößen heißen Residuen. Sie werden durch ε̂ᵢ = yᵢ − ŷᵢ berechnet und messen den vertikalen Abstand eines Beobachtungspunktes von der geschätzten Regressionsgeraden.

Voraussetzungen und Kleinste-Quadrate-Schätzung

Für das Modell wird angenommen, dass die xᵢ fest gegeben sind und nicht alle denselben Wert haben. Daher muss gelten: ∑ᵢ₌₁ⁿ(xᵢ − x̄)² > 0. Der wahre Zusammenhang zwischen xᵢ und yᵢ ist linear in den Parametern β₀ und β₁. Nichtlineare Transformationen der Variablen sind dennoch möglich, zum Beispiel log(yᵢ) = β₀ + β₁log(xᵢ) + εᵢ. Bei den Beobachtungen liegt eine Zufallsstichprobe (X₁,Y₁),…,(Xₙ,Yₙ) mit den Realisierungen (x₁,y₁),…,(xₙ,yₙ) vor.

Für die Störgrößen gelten normalerweise folgende Annahmen: E(εᵢ) = 0, die Störgrößen sind unabhängig beziehungsweise zumindest unkorreliert, und ihre Varianz ist konstant: Var(εᵢ) = Var(Yᵢ) = σ². Die Störgrößen sind dann unabhängig und identisch verteilt mit Erwartungswert 0 und Varianz σ². Die zusätzliche Annahme εᵢ ~ 𝒩(0,σ²) ist nur für bestimmte statistische Verfahren wie Konfidenzintervalle und Tests erforderlich. Unter dieser Annahme gilt Yᵢ ~ 𝒩(β₀ + β₁xᵢ,σ²).

Die unbekannten Parameter werden mit der Kleinste-Quadrate-Methode geschätzt. Dabei wird die Summe der quadrierten vertikalen Abweichungen minimiert:

(β̂₀,β̂₁) = arg min ∑ᵢ₌₁ⁿ[yᵢ − (β₀ + β₁xᵢ)]².

Die Schätzer lauten:

β̂₁ = [∑ᵢ₌₁ⁿ(xᵢ − x̄)(yᵢ − ȳ)] / [∑ᵢ₌₁ⁿ(xᵢ − x̄)²] = SPₓᵧ/SQₓ,

β̂₀ = ȳ − β̂₁x̄.

Dabei ist SPₓᵧ die Summe der Abweichungsprodukte und SQₓ die Summe der Abweichungsquadrate von x. Eine nichtzentrierte Form der Steigung ist β̂₁ = [∑xᵢyᵢ − n x̄ȳ] / [∑xᵢ² − n x̄²]. Außerdem gilt β̂₁ = rₓᵧ(sᵧ/sₓ), wobei rₓᵧ der Bravais-Pearson-Korrelationskoeffizient und sₓ sowie sᵧ die empirischen Standardabweichungen sind.

Eigenschaften und Genauigkeit der Schätzer

Enthält das Modell einen Achsenabschnitt, verläuft die Regressionsgerade durch den Schwerpunkt (x̄,ȳ) der Daten. Außerdem gleichen sich positive und negative Residuen aus:

∑ᵢ₌₁ⁿ ε̂ᵢ = 0 beziehungsweise ε̄̂ = 0.

Die Residuen sind mit den unabhängigen Variablen unkorreliert: ∑xᵢε̂ᵢ = 0. Ebenso gilt ∑ε̂ᵢŷᵢ = 0; Residuen und geschätzte Werte sind also unkorreliert. Diese Eigenschaften gelten bei der ersten Aussage zum Schwerpunkt nur bei einem Modell mit Achsenabschnitt.

Die Kleinste-Quadrate-Schätzer sind unter den Modellannahmen erwartungstreu:

E(β̂₁) = β₁ und E(β̂₀) = β₀.

Sie liefern im Mittel also die wahren Parameterwerte. Ihre Varianzen sind

Var(β̂₀) = σ²/n · (1 + x̄²/sₓ²) = σ²a₀

und

Var(β̂₁) = σ² / ∑ᵢ₌₁ⁿ(xᵢ − x̄)² = σ²a₁.

Die Kovarianz lautet Cov(β̂₀,β̂₁) = σ²[−x̄ / ∑ᵢ₌₁ⁿ(xᵢ − x̄)²]. Größere Stichproben, eine stärkere Streuung der x-Werte und eine kleinere Störgrößenvarianz σ² führen zu präziseren Schätzungen. Für n → ∞ sind die Schätzer konsistent, wenn ∑ᵢ₌₁ⁿ(xᵢ − x̄)² → ∞ gilt.

Da σ² unbekannt ist, wird sie durch das mittlere Residuenquadrat geschätzt:

σ̂² = [1/(n−2)]∑ᵢ₌₁ⁿ(yᵢ − β̂₀ − β̂₁xᵢ)².

Es gilt E(σ̂²) = σ². Die positive Quadratwurzel ist der Standardfehler der Regression. Durch Einsetzen von σ̂² erhält man geschätzte Varianzen und Standardfehler der Regressionsparameter. Der Kleinste-Quadrate-Schätzer ist außerdem der beste lineare erwartungstreue Schätzer (BLES beziehungsweise BLUE): Unter allen linearen erwartungstreuen Schätzern besitzt er die kleinste Varianz, auch ohne Normalverteilungsannahme.

Bestimmtheitsmaß und statistische Tests

Das Bestimmtheitsmaß R² misst die Anpassungsgüte des linearen Regressionsmodells. Es ist definiert als

R² = 1 − SQR/SQT,

also als Anteil der erklärten Variation an der Gesamtvariation. SQR ist die Residuenquadratsumme und SQT die totale Quadratsumme. R² liegt zwischen 0 und 1: Bei R² = 0 besteht kein erklärter linearer Zusammenhang; das beste lineare Modell enthält dann nur den Achsenabschnitt und β̂₁ = 0. Bei R² = 1 liegen alle Messpunkte auf einer nichthorizontalen Regressionsgeraden, sodass Y vollständig linear erklärt wird.

Ein kleines R² bedeutet nur, dass der lineare Zusammenhang schwach ist. Ein nichtlinearer Zusammenhang kann trotzdem stark sein. Ebenso kann ein hohes R² bedeuten, dass ein nichtlineares Modell die Daten noch besser beschreibt. Bei der einfachen linearen Regression gilt R² = rₓᵧ².

Im angegebenen Beispiel sind SQR = ∑ᵢ₌₁⁶(yᵢ − ŷᵢ)² = 5,98 und SQT = ∑ᵢ₌₁⁶(yᵢ − ȳ)² = 60. Daher gilt R² = 1 − 5,98/60 ≈ 0,90. Etwa 90 % der Streuung von Y werden durch das Modell erklärt, 10 % bleiben unerklärt.

Für Konfidenzintervalle und t-Tests wird die Normalverteilung der Störgrößen vorausgesetzt. Im klassischen linearen Modell der Normalregression gilt εᵢ ~ 𝒩(0,σ²). Für j = 0,1 lautet die t-Statistik

T = (β̂ⱼ − βⱼ⁰) / σ̂β̂ⱼ ~ t₍ₙ₋₂₎ unter H₀.

Für den Test H₀: βⱼ = 0 gegen H₁: βⱼ ≠ 0 wird T = β̂ⱼ/σ̂β̂ⱼ verwendet. Ein (1−α)-Konfidenzintervall für βⱼ hat die Form β̂ⱼ ± σ̂β̂ⱼ t₁₋α/₂(n−2). Die Standardfehler sind

SE(β̂₀) = √[MQR∑xᵢ²/(n∑(xᵢ−x̄)²)] und SE(β̂₁) = √[MQR/∑(xᵢ−x̄)²],

wobei MQR das mittlere Residuenquadrat bezeichnet.

Vorhersage, Kausalität und Sonderfall Ursprung

Für einen neuen Wert x₀ lautet die Punktvorhersage ŷ₀ = β̂₀ + β̂₁x₀. Der Vorhersagefehler ist ŷ₀ − y₀. Sein Erwartungswert beträgt 0, seine Varianz ist

σ₀² = σ²[1 + 1/n + (x₀ − x̄)² / ∑ᵢ₌₁ⁿ(xᵢ − x̄)²].

Ein (1−α)-Vorhersageintervall lautet

ŷ₀ ± t₍₁₋α/₂₎(n−2) · √[σ̂²(1 + 1/n + (x₀−x̄)²/∑(xᵢ−x̄)²)].

Es wird breiter, je weiter x₀ vom Schwerpunkt x̄ der beobachteten Daten entfernt ist. Vorhersagen außerhalb des Beobachtungsraums sind daher besonders unzuverlässig.

Eine hohe Korrelation oder ein hohes R² beweist keinen kausalen Zusammenhang und legt auch dessen Richtung nicht fest. Für zwei Variablen können zwei verschiedene Regressionen betrachtet werden: die Regression von Y auf X, y = gₓ(x), mit Minimierung vertikaler quadratischer Abweichungen, und die Regression von X auf Y, x = gᵧ(y), mit Minimierung horizontaler Abweichungen. Beide Geraden schneiden sich im Schwerpunkt (x̄,ȳ). Bei rₓᵧ = 0 stehen sie orthogonal zueinander; bei rₓᵧ = +1 oder −1 besteht ein streng linearer Zusammenhang.

Bei einer Regression durch den Ursprung wird β₀ weggelassen. Die empirische Gerade lautet ỹ = β̃₁x, und

β̃₁ = ∑xᵢyᵢ / ∑xᵢ².

Dieser Schätzer stimmt genau dann mit β̂₁ der Regression mit Achsenabschnitt überein, wenn x̄ = 0. Falls β₀ ≠ 0 gilt, ist β̃₁ verzerrt für β₁. Für diesen Sonderfall muss ein anderes Bestimmtheitsmaß verwendet werden, da das gewöhnliche R² negativ werden kann. Die Varianz der Steigung ist σ²/∑xᵢ².

Matrixdarstellung, Verallgemeinerung und R

In Matrixschreibweise lautet das wahre Modell

y = Xβ + ε,

mit

(y₁,…,yₙ)ᵀ = [1,x₁],[1,x₂],…,[1,xₙ]ᵀ + (ε₁,…,εₙ)ᵀ.

Diese Darstellung zeigt den Modellcharakter und erleichtert die Verallgemeinerung auf die multiple lineare Regression. Dort werden mehrere Regressoren verwendet:

yᵢ = β₀ + β₁xᵢ₁ + β₂xᵢ₂ + … + βₖxᵢₖ + εᵢ = xᵢᵀβ + εᵢ.

Für p = k + 1 Regressionsparameter ergibt sich bei p = 2 die lineare Einfachregression.

In R werden Daten beispielsweise als numerische Vektoren definiert:

Groesse <- c(176, 166, 172, 184, 179, 170, 176) Gewicht <- c(65, 55, 67, 82, 75, 65, 75).

Der Pearson-Korrelationskoeffizient wird mit cor(Gewicht, Groesse, method = "pearson") berechnet und beträgt im Beispiel 0.9295038. Eine lineare Regression mit Gewicht als Zielvariable wird mit reg <- lm(Gewicht~Groesse) durchgeführt. summary(reg) gibt die Regressionskoeffizienten und weitere Statistiken aus. Mit plot(Gewicht~Groesse) wird das Streudiagramm erzeugt; abline(reg) fügt die Regressionsgerade hinzu.

Lernvideos zu Lineare Einfachregression

Weiterlesen

Streudiagramm Ein Streudiagramm, auch Punktwolke genannt (engl. scatter plot), ist die graphische Darstellung von beobachteten Wertepaaren zweier statistischer Merkmale. Regressionsanalyse Die Regressionsanalyse ist ein Instrumentarium statistischer Analyseverfahren, die zum Ziel haben, Beziehungen zwischen einer abhängigen (auch erklärte … Lineare Regression Die lineare Regression (kurz: LR) ist ein Spezialfall der Regressionsanalyse, also ein statistisches Verfahren, mit dem versucht wird, eine beobachtete … Abhängige und unabhängige Variable In der Mathematik ist eine abhängige Variable eine Variable, deren Wert vom Effekt (einer) anderer(en) Variable(n) abhängt. Die Variable(n), mit deren Hilfe … Schätzfunktion Schätzfunktionen sind die Basis zur Berechnung von Punktschätzungen und zur Bestimmung von Konfidenzintervallen mittels Bereichsschätzern und werden als … Y-Achsenabschnitt Geht die y {\displaystyle y} {\displaystyle y} -Achse durch den Koordinatenursprung (0|0), dann bezeichnet der y-Achsenabschnitt, Ordinatenabschnitt oder … Steigung In der Mathematik, insbesondere in der Analysis, ist die Steigung (auch als Anstieg bezeichnet) ein Maß für die Steilheit einer Geraden oder einer Kurve. Funktion (Mathematik) In der Mathematik ist eine Funktion (lateinisch functio) oder Abbildung eine Beziehung (Relation) zwischen zwei Mengen, die jedem Element der einen Menge … Stochastik Statistik · Daten, Stichprobe, Grundgesamtheit, Häufigkeit (absolute, relative), Merkmal, Merkmalsausprägung · Häufigkeitsverteilung, Stabdiagramm, Kreisdiagramm, … Regressionsparameter In einem linearen Regressionsmodell beschreiben die Koeffizienten der Regressoren, wie sich der bedingte Erwartungswert der abhängigen Variablen bei einer … Lineare Funktion Lineare Funktionen gehören zu den grundlegenden Funktionen in der Mathematik. Sie sind stetig und differenzierbar. Viele Probleme lassen sich mithilfe linearer … Zufallsvariable Beispiele für reelle Zufallsvariablen sind die Augensumme von zwei geworfenen Würfeln und die Gewinnhöhe in einem Glücksspiel. Zufallsvariablen können aber auch …