Wikipedia · einfach zusammengefasst · Stand
Standardfehler der Regression
Inhaltsverzeichnis · 1 Einführung in die Problemstellung · 2 Definition. 2.1 Einfache lineare Regression; 2.2 Multiple lineare Regression · 3 Einzelnachweise …
Inhalt4 Abschnitte
Bedeutung und Grundidee
Der geschätzte Standardfehler der Regression (SER), auch Standardschätzfehler, Standardfehler der Schätzung oder Root Mean Squared Error (RMSE), ist ein Maß für die Genauigkeit einer Regression. Er wird meist mit \hat{\sigma} oder \mathrm{SER}, gelegentlich mit s, bezeichnet.
Er ist die Quadratwurzel eines erwartungstreuen Schätzers der unbekannten Varianz der Störgrößen, also der Residualvarianz. Anschaulich ist er die Quadratwurzel des durchschnittlichen Residuenquadrats und misst damit den durchschnittlichen Abstand der Datenpunkte von der berechneten Regressionsgeraden. Er besitzt dieselbe Einheit wie die Zielgröße y.
Anders als das Bestimmtheitsmaß, das den Erklärungsgehalt eines Modells quantifiziert, schätzt der Standardfehler die Standardabweichung unbeobachtbarer Einflüsse auf die Zielgröße, nachdem die Effekte der erklärenden Variablen herausgerechnet wurden. Zusammen mit dem Bestimmtheitsmaß gehört er zu den häufig verwendeten Maßzahlen der Regressionsanalyse. Er dient außerdem dazu, Varianzen von Regressionsparametern und Konfidenzintervalle zu schätzen.
Residuen, Freiheitsgrade und Voraussetzungen
Residuen \hat{\varepsilon}_i sind die Abweichungen zwischen beobachteten und durch das Modell vorhergesagten Werten. Sie approximieren die wahren, nicht beobachtbaren Störgrößen: \varepsilon_i \approx \hat{\varepsilon}_i. Der in vielen Statistikprogrammen ausgegebene geschätzte Residualstandardfehler kann zur Beurteilung der Regressionsqualität verwendet werden.
Zunächst lässt sich ein geschätzter Residualstandardfehler als
\tilde{s}=\sqrt{\frac{1}{n}\sum_{i=1}^{n}\hat{\varepsilon}_i^2}
berechnen. Sein Quadrat \tilde{s}^2 ist jedoch ein verzerrter Schätzer für die wahre Störgrößenvarianz \sigma_\varepsilon^2=\sigma^2. In der einfachen linearen Regression werden zwei Parameter, \beta_0 und \beta_1, geschätzt; dadurch gehen zwei Freiheitsgrade verloren. Teilt man die Residuenquadratsumme SQR deshalb durch n-2 statt durch n, erhält man das mittlere Residuenquadrat MQR=SQR/(n-2). Dessen Quadratwurzel ist der Standardfehler der Regression.
Für die übliche Herleitung wird angenommen, dass die Residuen unkorreliert sind, den Erwartungswert null haben und eine homogene Varianz besitzen; dies sind Gauß-Markow-Annahmen. Wird mindestens eine Annahme verletzt, ist der so berechnete Standardfehler im Mittel kein unverzerrter Schätzer der unbekannten Standardabweichung.
Einfache lineare Regression
Bei einer einfachen linearen Regression lautet die Formel
\hat{\sigma}=\sqrt{SQR/(n-2)}=\sqrt{\frac{1}{n-2}\sum_{i=1}^{n}\hat{\varepsilon}_i^2}=\sqrt{\frac{1}{n-2}\sum_{i=1}^{n}(y_i-b_0-b_1x_i)^2}.
Dabei sind b_0 und b_1 Kleinste-Quadrate-Schätzer für Achsenabschnitt \beta_0 und Anstieg \beta_1:
b_1=\frac{\sum_{i=1}^{n}(x_i-\overline{x})(y_i-\overline{y})}{\sum_{i=1}^{n}(x_i-\overline{x})^2}, b_0=\overline{y}-b_1\overline{x}.
Unter den Gauß-Markow-Annahmen gilt \mathbb{E}(\hat{\sigma}^2)=\sigma^2; der Varianzschätzer ist also erwartungstreu. Ein großer Standardfehler bedeutet, dass die Messwerte im Durchschnitt stärker von der Regressionsgeraden abweichen und diese die Messwertverteilung schlechter beschreibt. Er ist in der Regel kleiner als der Standardfehler der Zielgröße \hat{\sigma}_y.
Setzt man \hat{\sigma} in die Varianzformeln der Parameter ein, erhält man erwartungstreue Schätzer:
\hat{\sigma}_{\hat{\beta}_0}^{2}=\hat{\sigma}^{2}\frac{\sum_{i=1}^{n}x_i^2}{n\sum_{i=1}^{n}(x_i-\overline{x})^2} und \hat{\sigma}_{\hat{\beta}_1}^{2}=\hat{\sigma}^{2}\frac{1}{\sum_{i=1}^{n}(x_i-\overline{x})^2}.
Multiple lineare Regression
Bei k erklärenden Variablen lautet der Standardfehler der Regression
\hat{\sigma}=\sqrt{MQR}=\sqrt{SQR/(n-k-1)}=\sqrt{\frac{\hat{\boldsymbol{\varepsilon}}^{\top}\hat{\boldsymbol{\varepsilon}}}{n-k-1}}=\sqrt{\frac{(\mathbf{y}-\mathbf{X}\mathbf{b})^{\top}(\mathbf{y}-\mathbf{X}\mathbf{b})}{n-k-1}},
wobei \mathbf{b}=(\mathbf{X}^{\top}\mathbf{X})^{-1}\mathbf{X}^{\top}\mathbf{y} der Kleinste-Quadrate-Schätzer ist. Über die residuenerzeugende Matrix \mathbf{Q} kann die Residuenquadratsumme auch als SQR=\hat{\boldsymbol{\varepsilon}}^{\top}\hat{\boldsymbol{\varepsilon}}=\boldsymbol{\varepsilon}^{\top}\mathbf{Q}\boldsymbol{\varepsilon} geschrieben werden. Daraus folgt alternativ
\hat{\sigma}=\sqrt{\frac{\mathbf{y}^{\top}\mathbf{y}-\mathbf{b}^{\top}\mathbf{X}^{\top}\mathbf{y}}{n-p}}=\sqrt{\frac{\mathbf{y}^{\top}\mathbf{Q}\mathbf{y}}{n-p}}=\sqrt{\frac{\boldsymbol{\varepsilon}^{\top}\mathbf{Q}\boldsymbol{\varepsilon}}{n-p}}.
Der Standardfehler eines Regressionskoeffizienten b_j ist
\operatorname{SE}(b_j)=\sqrt{\frac{\frac{1}{n-p}\sum_{i=1}^{n}\hat{\varepsilon}_i^2}{(1-R_j^2)\sum_{i=1}^{n}(x_{ij}-\overline{x}_j)^2}}.
Er hängt somit von der Residualvarianz, der Abhängigkeit der erklärenden Variablen untereinander und der Streuung der jeweiligen erklärenden Variablen ab. Beim Hinzufügen einer weiteren erklärenden Variable sinkt die Residuenquadratsumme stets, zugleich sinken aber die Freiheitsgrade. Daher kann der Standardfehler der Regression je nach dominierendem Effekt ab- oder zunehmen.