Zum Inhalt springen
L

Wikipedia · einfach zusammengefasst · Stand

Standardfehler der Regression

Inhaltsverzeichnis · 1 Einführung in die Problemstellung · 2 Definition. 2.1 Einfache lineare Regression; 2.2 Multiple lineare Regression · 3 Einzelnachweise …

Inhalt4 Abschnitte
  1. 1. Bedeutung und Grundidee
  2. 2. Residuen, Freiheitsgrade und Voraussetzungen
  3. 3. Einfache lineare Regression
  4. 4. Multiple lineare Regression

Bedeutung und Grundidee

Der geschätzte Standardfehler der Regression (SER), auch Standardschätzfehler, Standardfehler der Schätzung oder Root Mean Squared Error (RMSE), ist ein Maß für die Genauigkeit einer Regression. Er wird meist mit \hat{\sigma} oder \mathrm{SER}, gelegentlich mit s, bezeichnet.

Er ist die Quadratwurzel eines erwartungstreuen Schätzers der unbekannten Varianz der Störgrößen, also der Residualvarianz. Anschaulich ist er die Quadratwurzel des durchschnittlichen Residuenquadrats und misst damit den durchschnittlichen Abstand der Datenpunkte von der berechneten Regressionsgeraden. Er besitzt dieselbe Einheit wie die Zielgröße y.

Anders als das Bestimmtheitsmaß, das den Erklärungsgehalt eines Modells quantifiziert, schätzt der Standardfehler die Standardabweichung unbeobachtbarer Einflüsse auf die Zielgröße, nachdem die Effekte der erklärenden Variablen herausgerechnet wurden. Zusammen mit dem Bestimmtheitsmaß gehört er zu den häufig verwendeten Maßzahlen der Regressionsanalyse. Er dient außerdem dazu, Varianzen von Regressionsparametern und Konfidenzintervalle zu schätzen.

Residuen, Freiheitsgrade und Voraussetzungen

Residuen \hat{\varepsilon}_i sind die Abweichungen zwischen beobachteten und durch das Modell vorhergesagten Werten. Sie approximieren die wahren, nicht beobachtbaren Störgrößen: \varepsilon_i \approx \hat{\varepsilon}_i. Der in vielen Statistikprogrammen ausgegebene geschätzte Residualstandardfehler kann zur Beurteilung der Regressionsqualität verwendet werden.

Zunächst lässt sich ein geschätzter Residualstandardfehler als

\tilde{s}=\sqrt{\frac{1}{n}\sum_{i=1}^{n}\hat{\varepsilon}_i^2}

berechnen. Sein Quadrat \tilde{s}^2 ist jedoch ein verzerrter Schätzer für die wahre Störgrößenvarianz \sigma_\varepsilon^2=\sigma^2. In der einfachen linearen Regression werden zwei Parameter, \beta_0 und \beta_1, geschätzt; dadurch gehen zwei Freiheitsgrade verloren. Teilt man die Residuenquadratsumme SQR deshalb durch n-2 statt durch n, erhält man das mittlere Residuenquadrat MQR=SQR/(n-2). Dessen Quadratwurzel ist der Standardfehler der Regression.

Für die übliche Herleitung wird angenommen, dass die Residuen unkorreliert sind, den Erwartungswert null haben und eine homogene Varianz besitzen; dies sind Gauß-Markow-Annahmen. Wird mindestens eine Annahme verletzt, ist der so berechnete Standardfehler im Mittel kein unverzerrter Schätzer der unbekannten Standardabweichung.

Einfache lineare Regression

Bei einer einfachen linearen Regression lautet die Formel

\hat{\sigma}=\sqrt{SQR/(n-2)}=\sqrt{\frac{1}{n-2}\sum_{i=1}^{n}\hat{\varepsilon}_i^2}=\sqrt{\frac{1}{n-2}\sum_{i=1}^{n}(y_i-b_0-b_1x_i)^2}.

Dabei sind b_0 und b_1 Kleinste-Quadrate-Schätzer für Achsenabschnitt \beta_0 und Anstieg \beta_1:

b_1=\frac{\sum_{i=1}^{n}(x_i-\overline{x})(y_i-\overline{y})}{\sum_{i=1}^{n}(x_i-\overline{x})^2}, b_0=\overline{y}-b_1\overline{x}.

Unter den Gauß-Markow-Annahmen gilt \mathbb{E}(\hat{\sigma}^2)=\sigma^2; der Varianzschätzer ist also erwartungstreu. Ein großer Standardfehler bedeutet, dass die Messwerte im Durchschnitt stärker von der Regressionsgeraden abweichen und diese die Messwertverteilung schlechter beschreibt. Er ist in der Regel kleiner als der Standardfehler der Zielgröße \hat{\sigma}_y.

Setzt man \hat{\sigma} in die Varianzformeln der Parameter ein, erhält man erwartungstreue Schätzer:

\hat{\sigma}_{\hat{\beta}_0}^{2}=\hat{\sigma}^{2}\frac{\sum_{i=1}^{n}x_i^2}{n\sum_{i=1}^{n}(x_i-\overline{x})^2} und \hat{\sigma}_{\hat{\beta}_1}^{2}=\hat{\sigma}^{2}\frac{1}{\sum_{i=1}^{n}(x_i-\overline{x})^2}.

Multiple lineare Regression

Bei k erklärenden Variablen lautet der Standardfehler der Regression

\hat{\sigma}=\sqrt{MQR}=\sqrt{SQR/(n-k-1)}=\sqrt{\frac{\hat{\boldsymbol{\varepsilon}}^{\top}\hat{\boldsymbol{\varepsilon}}}{n-k-1}}=\sqrt{\frac{(\mathbf{y}-\mathbf{X}\mathbf{b})^{\top}(\mathbf{y}-\mathbf{X}\mathbf{b})}{n-k-1}},

wobei \mathbf{b}=(\mathbf{X}^{\top}\mathbf{X})^{-1}\mathbf{X}^{\top}\mathbf{y} der Kleinste-Quadrate-Schätzer ist. Über die residuenerzeugende Matrix \mathbf{Q} kann die Residuenquadratsumme auch als SQR=\hat{\boldsymbol{\varepsilon}}^{\top}\hat{\boldsymbol{\varepsilon}}=\boldsymbol{\varepsilon}^{\top}\mathbf{Q}\boldsymbol{\varepsilon} geschrieben werden. Daraus folgt alternativ

\hat{\sigma}=\sqrt{\frac{\mathbf{y}^{\top}\mathbf{y}-\mathbf{b}^{\top}\mathbf{X}^{\top}\mathbf{y}}{n-p}}=\sqrt{\frac{\mathbf{y}^{\top}\mathbf{Q}\mathbf{y}}{n-p}}=\sqrt{\frac{\boldsymbol{\varepsilon}^{\top}\mathbf{Q}\boldsymbol{\varepsilon}}{n-p}}.

Der Standardfehler eines Regressionskoeffizienten b_j ist

\operatorname{SE}(b_j)=\sqrt{\frac{\frac{1}{n-p}\sum_{i=1}^{n}\hat{\varepsilon}_i^2}{(1-R_j^2)\sum_{i=1}^{n}(x_{ij}-\overline{x}_j)^2}}.

Er hängt somit von der Residualvarianz, der Abhängigkeit der erklärenden Variablen untereinander und der Streuung der jeweiligen erklärenden Variablen ab. Beim Hinzufügen einer weiteren erklärenden Variable sinkt die Residuenquadratsumme stets, zugleich sinken aber die Freiheitsgrade. Daher kann der Standardfehler der Regression je nach dominierendem Effekt ab- oder zunehmen.

Weiterlesen

Quadratwurzel Hierbei handelt es sich um einen Algorithmus ähnlich dem gängigen Verfahren der schriftlichen Division. Intervallschachtelung: Dieses Verfahren ist recht … Regressionsanalyse Die Regressionsanalyse ist ein Instrumentarium statistischer Analyseverfahren, die zum Ziel haben, Beziehungen zwischen einer abhängigen (auch erklärte … Lineare Regression Die lineare Regression (kurz: LR) ist ein Spezialfall der Regressionsanalyse, also ein statistisches Verfahren, mit dem versucht wird, eine beobachtete … Regressionsparameter In einem linearen Regressionsmodell beschreiben die Koeffizienten der Regressoren, wie sich der bedingte Erwartungswert der abhängigen Variablen bei einer … Bestimmtheitsmaß Das Bestimmtheitsmaß gibt allerdings nur Auskunft über die Stärke des Zusammenhangs, nicht über Kausalität. Das Bestimmtheitsmaß zeigt zwar die „Qualität … Standardfehler Allgemein gilt: Je größer der Stichprobenumfang, desto kleiner der Standardfehler; je kleiner die Varianz, desto kleiner der Standardfehler. Eine wichtige Rolle … Approximation Die approximative Darstellung von Funktionen oder Zahlen. Ist ein explizit gegebenes mathematisches Objekt nur schwer handhabbar, dann ist eine Approximation … Störgröße und Residuum Im Gegensatz zu den Störgrößen sind Residuen (lateinisch residuum = „das Zurückgebliebene“) berechnete Größen und messen den vertikalen Abstand zwischen … Korrelation Die Maßzahlen der Korrelation liegen betragsmäßig meist in einem Bereich von Null (kein Zusammenhang) bis Eins (starker Zusammenhang). · Ein Beispiel für eine … Erwartungswert Der Erwartungswert beschreibt für eine Zufallsvariable mit endlich vielen Funktionswerten das mit der Wahrscheinlichkeit des Auftretens gewichtete arithmetische … Konfidenzintervall Ein Konfidenzintervall, kurz KI, auch Vertrauensintervall, Konfidenzbereich, Vertrauensbereich oder Erwartungsbereich genannt, ist in der frequentistischen … Multiple lineare Regression Die multiple lineare Regression ist ein statistisches Verfahren, mit dem versucht wird, eine beobachtete abhängige Variable durch mehrere unabhängige Variablen …