Wikipedia · einfach zusammengefasst · Stand
Multiple lineare Regression
Die multiple lineare Regression ist ein statistisches Verfahren, mit dem versucht wird, eine beobachtete abhängige Variable durch mehrere unabhängige Variablen …
Inhalt6 Abschnitte
Grundidee und Modell
Die multiple lineare Regression, auch mehrfache lineare Regression oder lineare Mehrfachregression genannt, ist ein Verfahren der Statistik. Sie versucht, eine beobachtete abhängige Variable durch mehrere unabhängige Variablen, die Regressoren, zu erklären. Sie verallgemeinert die einfache lineare Regression auf mehrere erklärende Größen. Das Modell ist linear in den Parametern: Die abhängige Variable wird als lineare Funktion der unabhängigen Variablen beschrieben, zusätzlich kommt eine additive Störgröße hinzu.
Für T Messungen und K Regressoren lautet das Modell:
{y_t = x_{t1}\beta_1 + x_{t2}\beta_2 + \ldots + x_{tK}\beta_K + \varepsilon_t}.
Dabei ist {y_t} die beobachtete abhängige Variable der Beobachtung {t}, {x_{tk}} sind die unabhängigen Variablen, {\beta_k} sind unbekannte Regressionsparameter und {\varepsilon_t} ist die unbeobachtbare Störgröße. In der üblichen Schreibweise ist {\beta_1} das Absolutglied, während {\beta_2, \beta_3, \dotsc, \beta_K} Steigungsparameter sind. In Matrixschreibweise lautet das Modell:
{\mathbf y = \mathbf X \boldsymbol\beta + \boldsymbol\varepsilon}.
Hier ist {\mathbf y} der Vektor der beobachteten Werte, {\mathbf X} die {T \times K}-Datenmatrix, {\boldsymbol\beta} der Parametervektor und {\boldsymbol\varepsilon} der Vektor der Störgrößen. Der Ausdruck {\mathbf x_t^\top\boldsymbol\beta} heißt linearer Prädiktor.
Annahmen des klassischen Modells
Das klassische Modell der linearen Mehrfachregression besteht aus der Gleichung {\mathbf y = \mathbf X\boldsymbol\beta + \boldsymbol\varepsilon} und den klassischen Annahmen über die Störgrößen. Die zentrale Idee ist: Das lineare Modell beschreibt bis auf zufällige Abweichungen das „wahre Modell“.
Die wichtigsten Annahmen sind:
- Die Störgrößen haben den Erwartungswert null: {\operatorname E(\boldsymbol\varepsilon)=\mathbf 0}. Das bedeutet, dass die Abweichungen im Mittel nicht systematisch in eine Richtung gehen.
- Die Störgrößen sind unkorreliert: {\operatorname{Cov}(\varepsilon_t,\varepsilon_s)=0} für {t\neq s}.
- Die Störgrößen haben eine gleiche Varianz: {\operatorname{Cov}(\boldsymbol\varepsilon)=\sigma^2\mathbf I_T}. Dies heißt homogene Varianz oder Homoskedastizität.
Daraus folgt für die abhängige Variable:
{\operatorname E(\mathbf y)=\mathbf X\boldsymbol\beta} und {\operatorname{Cov}(\mathbf y)=\sigma^2\mathbf I_T}.
Weitere Verteilungsannahmen sind zunächst nicht nötig. Wenn zusätzlich angenommen wird, dass die Störgrößen mehrdimensional normalverteilt sind, lassen sich Schätzungen und Tests besonders gut herleiten. Dann gilt zum Beispiel: Unabhängigkeit der Störgrößen entspricht auch Unabhängigkeit der {y_t}.
Kleinste-Quadrate-Schätzung
Die unbekannten Regressionsparameter werden meist mit der Kleinste-Quadrate-Schätzung geschätzt. Dabei wird der Parametervektor so gewählt, dass die Summe der quadrierten Residuen möglichst klein wird. Residuen sind die berechenbaren Abweichungen zwischen beobachteten und geschätzten Werten.
Das Minimierungsproblem lautet:
{\underset{\boldsymbol\beta}{\operatorname{arg,min}}, Q(\boldsymbol\beta)=\underset{\boldsymbol\beta}{\operatorname{arg,min}}, (\mathbf y-\mathbf X\boldsymbol\beta)^\top(\mathbf y-\mathbf X\boldsymbol\beta)}.
Vorausgesetzt wird, dass {\mathbf X} den Rang {K} hat. Dann ist {\mathbf X^\top\mathbf X} invertierbar. Aus der Bedingung erster Ordnung ergibt sich das Normalgleichungssystem:
{\mathbf X^\top\mathbf X\mathbf b = \mathbf X^\top\mathbf y}.
Die Lösung ist der Kleinste-Quadrate-Schätzer:
{\mathbf b=(\mathbf X^\top\mathbf X)^{-1}\mathbf X^\top\mathbf y}.
Wenn der Rang von {\mathbf X} kleiner als {K} ist, ist {\mathbf X^\top\mathbf X} nicht invertierbar; das Normalgleichungssystem ist dann nicht eindeutig lösbar und {\mathbf b} nicht identifizierbar. Der Schätzer kann auch als Projektion auf die Ebene interpretiert werden, die durch die Regressoren aufgespannt wird.
Setzt man das wahre Modell ein, erhält man:
{\mathbf b = \boldsymbol\beta + (\mathbf X^\top\mathbf X)^{-1}\mathbf X^\top\boldsymbol\varepsilon}.
Für die Kovarianzmatrix des Schätzers gilt im klassischen Modell:
{\operatorname{Cov}(\mathbf b)=\sigma^2(\mathbf X^\top\mathbf X)^{-1}}.
Residuen, Varianz und Güte
Die geschätzten Zielwerte entstehen aus dem KQ-Schätzer durch:
{\hat{\mathbf y}=\mathbf X\mathbf b}.
Der Residualvektor ist:
{\hat{\boldsymbol\varepsilon}=\mathbf y-\hat{\mathbf y}=\mathbf y-\mathbf X\mathbf b}.
Mit der Projektionsmatrix {\mathbf P=\mathbf X(\mathbf X^\top\mathbf X)^{-1}\mathbf X^\top} gilt {\hat{\mathbf y}=\mathbf P\mathbf y}. Die Matrix {\mathbf P} projiziert die beobachteten Werte auf den Spaltenraum von {\mathbf X}. Die Residualmatrix ist {\mathbf M=\mathbf I-\mathbf P}.
Da die wahre Störgrößenvarianz {\sigma^2} in Anwendungen meist unbekannt ist, wird sie geschätzt. Der einfache Schätzer {\tilde s^2=\frac{1}{T}\sum_{t=1}^T\hat\varepsilon_t^2=\frac{1}{T}SQR} ist nicht erwartungstreu. Eine erwartungstreue Schätzung ist das mittlere Residuenquadrat:
{\hat\sigma^2=\frac{SQR}{T-K}=\frac{\hat{\boldsymbol\varepsilon}^\top\hat{\boldsymbol\varepsilon}}{T-K}}.
Das multiple Bestimmtheitsmaß {R^2} misst die Güte der Regression. Es kann unter anderem dargestellt werden als:
{R^2=1-\frac{\mathbf y^\top\mathbf y-\mathbf b^\top\mathbf X^\top\mathbf y}{\mathbf y^\top\mathbf y-T\overline y^2}}.
In der multiplen Regression entspricht {R^2} nicht einfach dem quadrierten Korrelationskoeffizienten zwischen {x} und {y}, sondern dem Quadrat des Korrelationskoeffizienten zwischen den beobachteten Werten {y_t} und den geschätzten Werten {\hat y_t}.
Eigenschaften und Tests
Der Kleinste-Quadrate-Schätzer hat wichtige Güteeigenschaften. Er ist erwartungstreu für {\boldsymbol\beta}, wenn die Exogenitätsannahme erfüllt ist. Exogenität bedeutet hier, dass Regressoren und Störgrößen unkorreliert sind, also {\operatorname E(\mathbf x^\top\cdot\boldsymbol\varepsilon)=0}. Wenn diese Annahme nicht gilt, ist der Schätzer verzerrt; dann ist {\operatorname{Bias}(\mathbf b)=\operatorname E(\mathbf b)-\boldsymbol\beta\neq\mathbf 0}.
Nach dem Satz von Gauß-Markow ist {\mathbf b} der beste lineare erwartungstreue Schätzer, kurz BLES oder BLUE: Unter allen linearen erwartungstreuen Schätzern hat er die kleinste Varianz beziehungsweise Kovarianzmatrix. Dafür ist keine bestimmte Verteilung der Störgrößen nötig. Sind die Störgrößen normalverteilt, ist {\mathbf b} außerdem Maximum-Likelihood-Schätzer und nach dem Satz von Lehmann-Scheffé beste erwartungstreue Schätzung.
Konsistenz bedeutet, dass der Schätzer bei wachsender Stichprobengröße in Wahrscheinlichkeit gegen den wahren Parameter konvergiert: {\operatorname{plim}(\mathbf b)=\boldsymbol\beta}. Eine wichtige Annahme dafür ist {\lim_{T\to\infty}((\mathbf X_T^\top\mathbf X_T)/T)=\mathbf Q} sowie {\operatorname{plim}((\mathbf X^\top\boldsymbol\varepsilon)/T)=0}. Auch die geschätzte Störgrößenvarianz ist konsistent: {\operatorname{plim}(\hat\sigma^2)=\sigma^2}.
Für statistische Inferenz wird zusätzlich Normalverteilung angenommen: {\boldsymbol\varepsilon\sim\mathcal N(\mathbf 0,\sigma^2\mathbf I_T)}. Dann gilt auch {\mathbf b\sim\mathcal N(\boldsymbol\beta,\sigma^2(\mathbf X^\top\mathbf X)^{-1})}.
Die Gesamtsignifikanz eines Modells kann mit einem F-Test geprüft werden. Die Nullhypothese lautet:
{H_0:\beta_1=\beta_2=\ldots=\beta_k=0\Rightarrow\rho^2=0}.
Die Prüfgröße ist:
{F=\frac{R^2/(K-1)}{(1-R^2)/(T-K)}\sim F(K-1,T-K)}.
Wird {H_0} abgelehnt, trägt mindestens ein Regressor vermutlich genügend Information zur Erklärung von {y} bei. Einzelne Regressoren werden über die Nullhypothese {H_0:\beta_k=0} getestet. Die Prüfgröße lautet:
{t_k=\frac{b_k}{\hat\sigma_{b_k}}\sim t(T-K)}.
Ist {|t_k|} größer als der kritische Wert, bleibt der Regressor im Modell. Die Residualanalyse prüft zusätzlich, ob lineare Beziehung, Ausreißer und Homoskedastizität plausibel sind. Dabei gilt wichtig: Das Residuum {\hat\varepsilon_t=y_t-\hat y_t} ist beobachtbar, die Störgröße {\varepsilon_t} dagegen nicht.
Vorhersage, Verallgemeinerungen und Beispiel
Für Vorhersagen wird ein Modell zukünftiger abhängiger Variablen verwendet:
{\mathbf y_0=\mathbf X_0\boldsymbol\beta+\boldsymbol\varepsilon_0}.
Die Vorhersage lautet:
{\hat{\mathbf y}_0=\mathbf X_0\mathbf b}.
Der Vorhersagefehler {\hat{\mathbf y}_0-\mathbf y_0} hat im Mittel null. Seine Kovarianzmatrix ist:
{\sigma^2(\mathbf X_0(\mathbf X^\top\mathbf X)^{-1}\mathbf X_0^\top+\mathbf I)}.
Für die einfache lineare Regression ergibt sich die Varianz des Vorhersagefehlers als:
{\operatorname{Var}(\hat y_0-y_0)=\sigma^2\left(1+\frac{1}{T}+\frac{(x_0-\overline x)^2}{\sum_{t=1}^{T}(x_t-\overline x)^2}\right)}.
Daraus folgt: Das Vorhersageintervall wird breiter, wenn sich {x_0} vom „Gravitationszentrum“ der Daten entfernt. Vorhersagen außerhalb des beobachteten Datenbereichs werden deshalb sehr unzuverlässig.
Das verallgemeinerte Modell der linearen Mehrfachregression erlaubt heteroskedastische und autokorrelierte Störgrößen. Dann gilt nicht mehr {\operatorname{Cov}(\boldsymbol\varepsilon)=\sigma^2\mathbf I_T}, sondern {\operatorname{Cov}(\boldsymbol\varepsilon)=\sigma^2\mathbf\Psi=\mathbf\Phi}, wobei {\mathbf\Psi} eine bekannte reelle nichtsinguläre positiv definite {T\times T}-Matrix ist. Eine weitere Verallgemeinerung ist die gewichtete multiple lineare Regression:
{\hat{\mathbf b}=(\mathbf X^\top\mathbf V^{-1}\mathbf X)^{-1}\mathbf X^\top\mathbf V^{-1}\mathbf y}.
Die polynomiale Regression ist ein Spezialfall der multiplen linearen Regression. Dabei wird der Erwartungswert durch ein Polynom vom Grad {p>1} beschrieben:
{\mu_Y=\beta_1+\beta_2x+\beta_3x^2+\ldots+\beta_Kx^p}.
Für {p=2} spricht man von quadratischer Regression.
Im Beispiel wird mit R untersucht, wie die abhängige Variable {\text{BWSb95}}, also Bruttowertschöpfung in Preisen von 95, von mehreren Wirtschaftsbereichen abhängt. Im ersten Modell mit allen Regressoren ergibt sich {R^2=0{,}9889}, ein adjustiertes {R^2=0{,}9828}, eine F-Statistik von {162{,}9} und ein p-Wert von {4{,}306\cdot10^{-10}}. Die Regressoren {\text{BBLandFF}} und {\text{BBFinVerm}} sind bei {\alpha=0{,}05} nicht signifikant. Nach Entfernen dieser Regressoren ergibt das zweite Modell {R^2=0{,}9886}, ein adjustiertes {R^2=0{,}985}, eine F-Statistik von {280{,}8} und einen p-Wert von {1{,}783\cdot10^{-12}}. Dieses Modell wird als besser beschrieben, weil alle Regressoren signifikant sind.