Zum Inhalt springen
L

Wikipedia · einfach zusammengefasst · Stand

Multiple lineare Regression

Die multiple lineare Regression ist ein statistisches Verfahren, mit dem versucht wird, eine beobachtete abhängige Variable durch mehrere unabhängige Variablen …

Inhalt6 Abschnitte
  1. 1. Grundidee und Modell
  2. 2. Annahmen des klassischen Modells
  3. 3. Kleinste-Quadrate-Schätzung
  4. 4. Residuen, Varianz und Güte
  5. 5. Eigenschaften und Tests
  6. 6. Vorhersage, Verallgemeinerungen und Beispiel

Grundidee und Modell

Die multiple lineare Regression, auch mehrfache lineare Regression oder lineare Mehrfachregression genannt, ist ein Verfahren der Statistik. Sie versucht, eine beobachtete abhängige Variable durch mehrere unabhängige Variablen, die Regressoren, zu erklären. Sie verallgemeinert die einfache lineare Regression auf mehrere erklärende Größen. Das Modell ist linear in den Parametern: Die abhängige Variable wird als lineare Funktion der unabhängigen Variablen beschrieben, zusätzlich kommt eine additive Störgröße hinzu.

Für T Messungen und K Regressoren lautet das Modell:

{y_t = x_{t1}\beta_1 + x_{t2}\beta_2 + \ldots + x_{tK}\beta_K + \varepsilon_t}.

Dabei ist {y_t} die beobachtete abhängige Variable der Beobachtung {t}, {x_{tk}} sind die unabhängigen Variablen, {\beta_k} sind unbekannte Regressionsparameter und {\varepsilon_t} ist die unbeobachtbare Störgröße. In der üblichen Schreibweise ist {\beta_1} das Absolutglied, während {\beta_2, \beta_3, \dotsc, \beta_K} Steigungsparameter sind. In Matrixschreibweise lautet das Modell:

{\mathbf y = \mathbf X \boldsymbol\beta + \boldsymbol\varepsilon}.

Hier ist {\mathbf y} der Vektor der beobachteten Werte, {\mathbf X} die {T \times K}-Datenmatrix, {\boldsymbol\beta} der Parametervektor und {\boldsymbol\varepsilon} der Vektor der Störgrößen. Der Ausdruck {\mathbf x_t^\top\boldsymbol\beta} heißt linearer Prädiktor.

Annahmen des klassischen Modells

Das klassische Modell der linearen Mehrfachregression besteht aus der Gleichung {\mathbf y = \mathbf X\boldsymbol\beta + \boldsymbol\varepsilon} und den klassischen Annahmen über die Störgrößen. Die zentrale Idee ist: Das lineare Modell beschreibt bis auf zufällige Abweichungen das „wahre Modell“.

Die wichtigsten Annahmen sind:

  • Die Störgrößen haben den Erwartungswert null: {\operatorname E(\boldsymbol\varepsilon)=\mathbf 0}. Das bedeutet, dass die Abweichungen im Mittel nicht systematisch in eine Richtung gehen.
  • Die Störgrößen sind unkorreliert: {\operatorname{Cov}(\varepsilon_t,\varepsilon_s)=0} für {t\neq s}.
  • Die Störgrößen haben eine gleiche Varianz: {\operatorname{Cov}(\boldsymbol\varepsilon)=\sigma^2\mathbf I_T}. Dies heißt homogene Varianz oder Homoskedastizität.

Daraus folgt für die abhängige Variable:

{\operatorname E(\mathbf y)=\mathbf X\boldsymbol\beta} und {\operatorname{Cov}(\mathbf y)=\sigma^2\mathbf I_T}.

Weitere Verteilungsannahmen sind zunächst nicht nötig. Wenn zusätzlich angenommen wird, dass die Störgrößen mehrdimensional normalverteilt sind, lassen sich Schätzungen und Tests besonders gut herleiten. Dann gilt zum Beispiel: Unabhängigkeit der Störgrößen entspricht auch Unabhängigkeit der {y_t}.

Kleinste-Quadrate-Schätzung

Die unbekannten Regressionsparameter werden meist mit der Kleinste-Quadrate-Schätzung geschätzt. Dabei wird der Parametervektor so gewählt, dass die Summe der quadrierten Residuen möglichst klein wird. Residuen sind die berechenbaren Abweichungen zwischen beobachteten und geschätzten Werten.

Das Minimierungsproblem lautet:

{\underset{\boldsymbol\beta}{\operatorname{arg,min}}, Q(\boldsymbol\beta)=\underset{\boldsymbol\beta}{\operatorname{arg,min}}, (\mathbf y-\mathbf X\boldsymbol\beta)^\top(\mathbf y-\mathbf X\boldsymbol\beta)}.

Vorausgesetzt wird, dass {\mathbf X} den Rang {K} hat. Dann ist {\mathbf X^\top\mathbf X} invertierbar. Aus der Bedingung erster Ordnung ergibt sich das Normalgleichungssystem:

{\mathbf X^\top\mathbf X\mathbf b = \mathbf X^\top\mathbf y}.

Die Lösung ist der Kleinste-Quadrate-Schätzer:

{\mathbf b=(\mathbf X^\top\mathbf X)^{-1}\mathbf X^\top\mathbf y}.

Wenn der Rang von {\mathbf X} kleiner als {K} ist, ist {\mathbf X^\top\mathbf X} nicht invertierbar; das Normalgleichungssystem ist dann nicht eindeutig lösbar und {\mathbf b} nicht identifizierbar. Der Schätzer kann auch als Projektion auf die Ebene interpretiert werden, die durch die Regressoren aufgespannt wird.

Setzt man das wahre Modell ein, erhält man:

{\mathbf b = \boldsymbol\beta + (\mathbf X^\top\mathbf X)^{-1}\mathbf X^\top\boldsymbol\varepsilon}.

Für die Kovarianzmatrix des Schätzers gilt im klassischen Modell:

{\operatorname{Cov}(\mathbf b)=\sigma^2(\mathbf X^\top\mathbf X)^{-1}}.

Residuen, Varianz und Güte

Die geschätzten Zielwerte entstehen aus dem KQ-Schätzer durch:

{\hat{\mathbf y}=\mathbf X\mathbf b}.

Der Residualvektor ist:

{\hat{\boldsymbol\varepsilon}=\mathbf y-\hat{\mathbf y}=\mathbf y-\mathbf X\mathbf b}.

Mit der Projektionsmatrix {\mathbf P=\mathbf X(\mathbf X^\top\mathbf X)^{-1}\mathbf X^\top} gilt {\hat{\mathbf y}=\mathbf P\mathbf y}. Die Matrix {\mathbf P} projiziert die beobachteten Werte auf den Spaltenraum von {\mathbf X}. Die Residualmatrix ist {\mathbf M=\mathbf I-\mathbf P}.

Da die wahre Störgrößenvarianz {\sigma^2} in Anwendungen meist unbekannt ist, wird sie geschätzt. Der einfache Schätzer {\tilde s^2=\frac{1}{T}\sum_{t=1}^T\hat\varepsilon_t^2=\frac{1}{T}SQR} ist nicht erwartungstreu. Eine erwartungstreue Schätzung ist das mittlere Residuenquadrat:

{\hat\sigma^2=\frac{SQR}{T-K}=\frac{\hat{\boldsymbol\varepsilon}^\top\hat{\boldsymbol\varepsilon}}{T-K}}.

Das multiple Bestimmtheitsmaß {R^2} misst die Güte der Regression. Es kann unter anderem dargestellt werden als:

{R^2=1-\frac{\mathbf y^\top\mathbf y-\mathbf b^\top\mathbf X^\top\mathbf y}{\mathbf y^\top\mathbf y-T\overline y^2}}.

In der multiplen Regression entspricht {R^2} nicht einfach dem quadrierten Korrelationskoeffizienten zwischen {x} und {y}, sondern dem Quadrat des Korrelationskoeffizienten zwischen den beobachteten Werten {y_t} und den geschätzten Werten {\hat y_t}.

Eigenschaften und Tests

Der Kleinste-Quadrate-Schätzer hat wichtige Güteeigenschaften. Er ist erwartungstreu für {\boldsymbol\beta}, wenn die Exogenitätsannahme erfüllt ist. Exogenität bedeutet hier, dass Regressoren und Störgrößen unkorreliert sind, also {\operatorname E(\mathbf x^\top\cdot\boldsymbol\varepsilon)=0}. Wenn diese Annahme nicht gilt, ist der Schätzer verzerrt; dann ist {\operatorname{Bias}(\mathbf b)=\operatorname E(\mathbf b)-\boldsymbol\beta\neq\mathbf 0}.

Nach dem Satz von Gauß-Markow ist {\mathbf b} der beste lineare erwartungstreue Schätzer, kurz BLES oder BLUE: Unter allen linearen erwartungstreuen Schätzern hat er die kleinste Varianz beziehungsweise Kovarianzmatrix. Dafür ist keine bestimmte Verteilung der Störgrößen nötig. Sind die Störgrößen normalverteilt, ist {\mathbf b} außerdem Maximum-Likelihood-Schätzer und nach dem Satz von Lehmann-Scheffé beste erwartungstreue Schätzung.

Konsistenz bedeutet, dass der Schätzer bei wachsender Stichprobengröße in Wahrscheinlichkeit gegen den wahren Parameter konvergiert: {\operatorname{plim}(\mathbf b)=\boldsymbol\beta}. Eine wichtige Annahme dafür ist {\lim_{T\to\infty}((\mathbf X_T^\top\mathbf X_T)/T)=\mathbf Q} sowie {\operatorname{plim}((\mathbf X^\top\boldsymbol\varepsilon)/T)=0}. Auch die geschätzte Störgrößenvarianz ist konsistent: {\operatorname{plim}(\hat\sigma^2)=\sigma^2}.

Für statistische Inferenz wird zusätzlich Normalverteilung angenommen: {\boldsymbol\varepsilon\sim\mathcal N(\mathbf 0,\sigma^2\mathbf I_T)}. Dann gilt auch {\mathbf b\sim\mathcal N(\boldsymbol\beta,\sigma^2(\mathbf X^\top\mathbf X)^{-1})}.

Die Gesamtsignifikanz eines Modells kann mit einem F-Test geprüft werden. Die Nullhypothese lautet:

{H_0:\beta_1=\beta_2=\ldots=\beta_k=0\Rightarrow\rho^2=0}.

Die Prüfgröße ist:

{F=\frac{R^2/(K-1)}{(1-R^2)/(T-K)}\sim F(K-1,T-K)}.

Wird {H_0} abgelehnt, trägt mindestens ein Regressor vermutlich genügend Information zur Erklärung von {y} bei. Einzelne Regressoren werden über die Nullhypothese {H_0:\beta_k=0} getestet. Die Prüfgröße lautet:

{t_k=\frac{b_k}{\hat\sigma_{b_k}}\sim t(T-K)}.

Ist {|t_k|} größer als der kritische Wert, bleibt der Regressor im Modell. Die Residualanalyse prüft zusätzlich, ob lineare Beziehung, Ausreißer und Homoskedastizität plausibel sind. Dabei gilt wichtig: Das Residuum {\hat\varepsilon_t=y_t-\hat y_t} ist beobachtbar, die Störgröße {\varepsilon_t} dagegen nicht.

Vorhersage, Verallgemeinerungen und Beispiel

Für Vorhersagen wird ein Modell zukünftiger abhängiger Variablen verwendet:

{\mathbf y_0=\mathbf X_0\boldsymbol\beta+\boldsymbol\varepsilon_0}.

Die Vorhersage lautet:

{\hat{\mathbf y}_0=\mathbf X_0\mathbf b}.

Der Vorhersagefehler {\hat{\mathbf y}_0-\mathbf y_0} hat im Mittel null. Seine Kovarianzmatrix ist:

{\sigma^2(\mathbf X_0(\mathbf X^\top\mathbf X)^{-1}\mathbf X_0^\top+\mathbf I)}.

Für die einfache lineare Regression ergibt sich die Varianz des Vorhersagefehlers als:

{\operatorname{Var}(\hat y_0-y_0)=\sigma^2\left(1+\frac{1}{T}+\frac{(x_0-\overline x)^2}{\sum_{t=1}^{T}(x_t-\overline x)^2}\right)}.

Daraus folgt: Das Vorhersageintervall wird breiter, wenn sich {x_0} vom „Gravitationszentrum“ der Daten entfernt. Vorhersagen außerhalb des beobachteten Datenbereichs werden deshalb sehr unzuverlässig.

Das verallgemeinerte Modell der linearen Mehrfachregression erlaubt heteroskedastische und autokorrelierte Störgrößen. Dann gilt nicht mehr {\operatorname{Cov}(\boldsymbol\varepsilon)=\sigma^2\mathbf I_T}, sondern {\operatorname{Cov}(\boldsymbol\varepsilon)=\sigma^2\mathbf\Psi=\mathbf\Phi}, wobei {\mathbf\Psi} eine bekannte reelle nichtsinguläre positiv definite {T\times T}-Matrix ist. Eine weitere Verallgemeinerung ist die gewichtete multiple lineare Regression:

{\hat{\mathbf b}=(\mathbf X^\top\mathbf V^{-1}\mathbf X)^{-1}\mathbf X^\top\mathbf V^{-1}\mathbf y}.

Die polynomiale Regression ist ein Spezialfall der multiplen linearen Regression. Dabei wird der Erwartungswert durch ein Polynom vom Grad {p>1} beschrieben:

{\mu_Y=\beta_1+\beta_2x+\beta_3x^2+\ldots+\beta_Kx^p}.

Für {p=2} spricht man von quadratischer Regression.

Im Beispiel wird mit R untersucht, wie die abhängige Variable {\text{BWSb95}}, also Bruttowertschöpfung in Preisen von 95, von mehreren Wirtschaftsbereichen abhängt. Im ersten Modell mit allen Regressoren ergibt sich {R^2=0{,}9889}, ein adjustiertes {R^2=0{,}9828}, eine F-Statistik von {162{,}9} und ein p-Wert von {4{,}306\cdot10^{-10}}. Die Regressoren {\text{BBLandFF}} und {\text{BBFinVerm}} sind bei {\alpha=0{,}05} nicht signifikant. Nach Entfernen dieser Regressoren ergibt das zweite Modell {R^2=0{,}9886}, ein adjustiertes {R^2=0{,}985}, eine F-Statistik von {280{,}8} und einen p-Wert von {1{,}783\cdot10^{-12}}. Dieses Modell wird als besser beschrieben, weil alle Regressoren signifikant sind.

Weiterlesen

Regressionsanalyse Die Regressionsanalyse ist ein Instrumentarium statistischer Analyseverfahren, die zum Ziel haben, Beziehungen zwischen einer abhängigen (auch erklärte … Lineare Regression Die lineare Regression (kurz: LR) ist ein Spezialfall der Regressionsanalyse, also ein statistisches Verfahren, mit dem versucht wird, eine beobachtete … Störgröße und Residuum Im Gegensatz zu den Störgrößen sind Residuen (lateinisch residuum = „das Zurückgebliebene“) berechnete Größen und messen den vertikalen Abstand zwischen … Regressionsparameter In einem linearen Regressionsmodell beschreiben die Koeffizienten der Regressoren, wie sich der bedingte Erwartungswert der abhängigen Variablen bei einer … Zufallsvariable Beispiele für reelle Zufallsvariablen sind die Augensumme von zwei geworfenen Würfeln und die Gewinnhöhe in einem Glücksspiel. Zufallsvariablen können aber auch … Lineares Modell In der Statistik wird die Bezeichnung lineares Modell (kurz: LM) auf unterschiedliche Arten verwendet und in unterschiedlichen Kontexten. Lineares Gleichungssystem Die Cramersche Regel verwendet Determinanten, um Formeln für die Lösung eines quadratischen linearen Gleichungssystems zu erzeugen, wenn dieses eindeutig lösbar … Grundgesamtheit Die Grundgesamtheit bezeichnet diejenige Menge aller Objekte, über die eine Aussage getroffen werden soll. Grundgesamtheiten werden häufig nur unvollständig … Skalar (Mathematik) Im Gegensatz zur Skalarmultiplikation ist das Skalarprodukt eine Verknüpfung, die zwei Vektoren einen Skalar als Wert zuordnet. Der Begriff Skalar geht … Transponierte Matrix Die transponierte Matrix, gespiegelte Matrix oder gestürzte Matrix ist in der Mathematik diejenige Matrix, die durch Vertauschen der Rollen von Zeilen und … Korrelation Die Maßzahlen der Korrelation liegen betragsmäßig meist in einem Bereich von Null (kein Zusammenhang) bis Eins (starker Zusammenhang). · Ein Beispiel für eine … Nullvektor Der Nullvektor wird zur Definition einiger zentraler Begriffe der linearen Algebra wie lineare Unabhängigkeit, Basis und Kern verwendet. Er spielt eine …