Zum Inhalt springen
L

Wikipedia · einfach zusammengefasst · Stand

Klassisches lineares Modell der Normalregression

In der Statistik wird als Klassische Normalregression eine Regression bezeichnet, die zusätzlich zu den Gauß-Markov-Annahmen die Annahme der …

Inhalt6 Abschnitte
  1. 1. Grundidee und Modell
  2. 2. Annahmen des klassischen linearen Modells
  3. 3. Maximum-Likelihood-Methode
  4. 4. Schätzung des Steigungsparameters
  5. 5. Schätzung des Varianzparameters
  6. 6. Verallgemeinerung

Grundidee und Modell

Die klassische Normalregression ist eine multiple lineare Regression, bei der zusätzlich zu den Gauß-Markov-Annahmen vorausgesetzt wird, dass die Störgrößen normalverteilt sind. Diese zusätzliche Annahme ist wichtig für die statistische Inferenz: Sie ermöglicht insbesondere die Berechnung von Konfidenzintervallen und das Testen allgemeiner linearer Hypothesen. Außerdem lassen sich weitere Eigenschaften der Kleinste-Quadrate-Schätzung (KQ-Schätzung) herleiten.

Für T statistische Einheiten und K unabhängige Variablen lautet das multiple lineare Regressionsmodell für t = 1, 2, …, T:

yₜ = xₜ₁β₁ + xₜ₂β₂ + … + xₜKβK + εₜ = xₜᵀβ + εₜ.

In kompakter Matrixschreibweise wird es dargestellt als

y = Xβ + ε.

Dabei ist y der Vektor der abhängigen Variable, X die Datenmatrix der unabhängigen Variablen, β der Vektor der unbekannten Parameter und ε der Vektor der Störgrößen. Die Parameter in β müssen mithilfe der beobachteten Daten geschätzt werden.

Annahmen des klassischen linearen Modells

Das Modell y = Xβ + ε wird klassisches lineares Regressionsmodell genannt, wenn die folgenden Annahmen gelten:

  • A1: Die Störgrößen haben den Erwartungswert Null: E(ε) = 0. Das Modell ist damit im Mittel korrekt.
  • A2: Die Störgrößen sind unkorreliert und besitzen eine homogene Varianz. Für i ≠ j gilt Cov(εᵢ, εⱼ) = 0. Zusammengefasst ergibt sich Cov(ε) = σ²Iₜ, wobei σ² die gemeinsame Varianz und Iₜ die T × T-Einheitsmatrix ist.
  • A3: Die Datenmatrix X ist nichtstochastisch und besitzt vollen Spaltenrang: Rang(X) = K.

Aus A1 und A2 folgt für die abhängige Variable: E(y) = Xβ und Cov(y) = σ²Iₜ.

Das klassische lineare Modell der Normalregression liegt vor, wenn zusätzlich die Normalverteilung der Störgrößen angenommen wird:

y = Xβ + ε mit ε ∼ N(0, σ²Iₜ).

Die Normalverteilungsannahme beinhaltet bei der üblichen Modellierung auch die stochastische Unabhängigkeit der einzelnen Beobachtungen. Dadurch kann die gemeinsame Dichte aus den einzelnen Dichten der Störgrößen gebildet werden.

Maximum-Likelihood-Methode

Bei der Maximum-Likelihood-Schätzung werden diejenigen Parameterwerte gesucht, unter denen die beobachteten Daten die größte Plausibilität besitzen. Für eine einzelne normalverteilte Störgröße lautet die Dichte

f(εₜ | σ²) = 1/√(2πσ²) · exp{−εₜ²/(2σ²)}.

Da εₜ = yₜ − xₜᵀβ gilt, kann die Dichte auch in Abhängigkeit von der Beobachtung geschrieben werden:

f(yₜ | xₜᵀ, β, σ²) = 1/√(2πσ²) · exp{−(yₜ − xₜᵀβ)²/(2σ²)}.

Wegen der Unabhängigkeitsannahme ist die gemeinsame Dichte das Produkt der T Einzeldichten. In Matrixschreibweise lautet sie:

f(y | X, β, σ²) = (2πσ²)^(−T/2) · exp{−(y − Xβ)ᵀ(y − Xβ)/(2σ²)}.

Diese gemeinsame Dichte wird als Likelihood-Funktion betrachtet, wenn sie als Funktion der unbekannten Parameter aufgefasst wird:

L(β, σ²; y, X) = (2πσ²)^(−T/2) · exp{−(y − Xβ)ᵀ(y − Xβ)/(2σ²)}.

Praktisch wird häufig ihre logarithmierte Form, die logarithmische Likelihood oder logarithmische Plausibilitätsfunktion, maximiert:

ℓ(β, σ²; y, X) = −T/2 · ln(2π) − T/2 · ln(σ²) − (y − Xβ)ᵀ(y − Xβ)/(2σ²).

Die Maximum-Likelihood-Schätzer ergeben sich durch die Maximierung dieser Funktion nach β und σ² beziehungsweise durch das Nullsetzen der beiden Score-Funktionen, also der partiellen Ableitungen nach den Parametern.

Schätzung des Steigungsparameters

Beim Ableiten der logarithmischen Likelihood nach β entsteht derselbe Ausdruck wie bei der Herleitung des Kleinste-Quadrate-Schätzers. Das Maximum-Likelihood-Optimierungsproblem für β reduziert sich daher auf das Kleinste-Quadrate-Optimierungsproblem.

Unter der Voraussetzung, dass X vollen Spaltenrang besitzt, lautet der Schätzer des Parametervektors:

β̃ = b = (XᵀX)⁻¹Xᵀy.

Damit sind der Kleinste-Quadrate-Schätzer (KQS) und der Maximum-Likelihood-Schätzer (MLS) identisch. Die zusätzliche Normalverteilungsannahme verändert also die Schätzung des Parametervektors nicht. Bei normalverteilten Störgrößen ist b außerdem nach dem Satz von Lehmann-Scheffé der beste erwartungstreue Schätzer (best unbiased estimator, BUE).

Wegen der Gleichheit der beiden Schätzer stimmen auch die KQ- und ML-Residuen überein. Die Residuen sind die geschätzten Abweichungen zwischen den beobachteten Werten und den durch das Modell erklärten Werten:

ε̃ = y − Xβ̃ = y − Xb = ε̂.

Schätzung des Varianzparameters

Der Maximum-Likelihood-Schätzer für den Varianzparameter σ² ergibt sich aus der partiellen Ableitung der logarithmischen Likelihood nach σ². Er ist die durchschnittliche Residuenquadratsumme:

σ̃² = (y − Xβ̃)ᵀ(y − Xβ̃)/T = ε̃ᵀε̃/T = ε̂ᵀε̂/T.

Mit dem üblichen Varianzschätzer

σ̂² = ε̂ᵀε̂/(T − K)

kann derselbe Ausdruck auch geschrieben werden als

σ̃² = σ̂²(T − K)/T.

Der ML-Schätzer teilt die Residuenquadratsumme somit durch T. Er ist jedoch keine erwartungstreue Schätzung der Varianz der Störgrößen und erfüllt deshalb nicht alle gängigen Qualitätskriterien für Punktschätzer. Der Wert der logarithmischen Plausibilitätsfunktion an den geschätzten Parametern lautet:

ℓ(b, σ̃²; y, X) = −T/2 · ln(2π) − T/2 · ln(σ̃²) − (y − Xb)ᵀ(y − Xb)/(2σ̃²).

Verallgemeinerung

Im klassischen linearen Modell der Normalregression wird angenommen, dass die unbeobachtbare Zufallskomponente, also die Störgröße, normalverteilt ist. In verallgemeinerten linearen Modellen kann die Störgröße dagegen eine Verteilung aus der Klasse der Exponentialfamilie besitzen. Die Normalregression ist damit durch ihre Normalverteilungsannahme gekennzeichnet, während verallgemeinerte lineare Modelle eine größere Klasse möglicher Verteilungen zulassen.

Weiterlesen

Regressionsanalyse Die Regressionsanalyse ist ein Instrumentarium statistischer Analyseverfahren, die zum Ziel haben, Beziehungen zwischen einer abhängigen (auch erklärte … Normalverteilung Ihre Wahrscheinlichkeitsdichtefunktion wird auch Gauß-Funktion, gaußsche Normalverteilung, gaußsche Verteilungskurve, Gauß-Kurve, gaußsche Glockenkurve … Störgröße und Residuum Im Gegensatz zu den Störgrößen sind Residuen (lateinisch residuum = „das Zurückgebliebene“) berechnete Größen und messen den vertikalen Abstand zwischen … Lineares Modell In der Statistik wird die Bezeichnung lineares Modell (kurz: LM) auf unterschiedliche Arten verwendet und in unterschiedlichen Kontexten. Konfidenzintervall Ein Konfidenzintervall, kurz KI, auch Vertrauensintervall, Konfidenzbereich, Vertrauensbereich oder Erwartungsbereich genannt, ist in der frequentistischen … Multiple lineare Regression Die multiple lineare Regression ist ein statistisches Verfahren, mit dem versucht wird, eine beobachtete abhängige Variable durch mehrere unabhängige Variablen … Abhängige und unabhängige Variable In der Mathematik ist eine abhängige Variable eine Variable, deren Wert vom Effekt (einer) anderer(en) Variable(n) abhängt. Die Variable(n), mit deren Hilfe … Matrix (Mathematik) In der Mathematik versteht man unter einer Matrix (Plural Matrizen) eine rechteckig angeordnete Tabelle von sogenannten Elementen. Erwartungswert Der Erwartungswert beschreibt für eine Zufallsvariable mit endlich vielen Funktionswerten das mit der Wahrscheinlichkeit des Auftretens gewichtete arithmetische … Rang (Lineare Algebra) Der Rang ist ein Begriff aus der linearen Algebra. Man ordnet ihn einer Matrix oder einer linearen Abbildung zu. Übliche Schreibweisen sind rang ⁡ ( f ) … Varianz (Stochastik) Mathematisch wird sie definiert als die mittlere quadratische Abweichung einer reellen Zufallsvariablen von ihrem Erwartungswert. Sie ist das zentrale Moment … Grundgesamtheit Die Grundgesamtheit bezeichnet diejenige Menge aller Objekte, über die eine Aussage getroffen werden soll. Grundgesamtheiten werden häufig nur unvollständig …