Zum Inhalt springen
L

Wikipedia · einfach zusammengefasst · Stand

Standardfehler

Allgemein gilt: Je größer der Stichprobenumfang, desto kleiner der Standardfehler; je kleiner die Varianz, desto kleiner der Standardfehler. Eine wichtige Rolle …

Inhalt6 Abschnitte
  1. 1. Grundidee und Bedeutung
  2. 2. Interpretation und Abgrenzung
  3. 3. Notation, Konfidenzintervalle und Tests
  4. 4. Standardfehler des Mittelwerts
  5. 5. Beispiele und endliche Population
  6. 6. Regression und Maximum-Likelihood

Grundidee und Bedeutung

Der Standardfehler, auch Stichprobenfehler genannt, ist ein Streuungsmaß für eine Schätzfunktion {\hat{\vartheta}}, mit der ein unbekannter Parameter \vartheta einer Grundgesamtheit geschätzt wird. Er ist definiert als die Standardabweichung der Schätzfunktion:

\sigma({\hat{\vartheta}})=\sqrt{\operatorname{Var}({\hat{\vartheta}})}.

Er beschreibt also, wie stark die geschätzten Werte typischerweise schwanken würden, wenn man viele Stichproben ziehen und jedes Mal denselben Parameter schätzen würde. In den Naturwissenschaften und der Metrologie wird dafür auch der Begriff Standardunsicherheit verwendet.

Bei einem erwartungstreuen Schätzer ist der Standardfehler ein Maß für die durchschnittliche Abweichung des geschätzten Parameterwertes vom wahren Parameterwert. Je kleiner der Standardfehler ist, desto genauer kann der unbekannte Parameter geschätzt werden. Er hängt besonders vom Stichprobenumfang und von der Varianz in der Grundgesamtheit ab: Je größer der Stichprobenumfang, desto kleiner der Standardfehler; je kleiner die Varianz, desto kleiner der Standardfehler.

Interpretation und Abgrenzung

Der Standardfehler gibt Auskunft über die Güte eines geschätzten Parameters. Wenn mehr Einzelwerte vorliegen, wird er kleiner, und die Schätzung des unbekannten Parameters wird genauer. Er macht die Streuung von Schätzungen bei Datensätzen mit unterschiedlichen Stichprobenumfängen vergleichbar, indem er die Standardabweichung auf den Stichprobenumfang bezieht.

Wichtig ist die Unterscheidung zur Standardabweichung: Die Standardabweichung beschreibt die tatsächliche Streuung der Einzelwerte in einer Grundgesamtheit, zum Beispiel bei Körpergrößen, Gewichten oder Einkommen. Diese Streuung bleibt auch bei sehr genauen Messungen bestehen. Der Standardfehler beschreibt dagegen die Streuung eines geschätzten Parameters, etwa eines Mittelwerts, über viele mögliche Stichproben hinweg.

Wenn mit mehreren Stichproben derselbe unbekannte Parameter geschätzt wird, unterscheiden sich die Ergebnisse wegen Zufallseinflüssen, zum Beispiel Messungenauigkeiten. Diese Variation der Schätzwerte wird durch den Standardfehler gemessen. Allgemein gilt: Um den Standardfehler zu halbieren, muss der Stichprobenumfang vervierfacht werden.

Notation, Konfidenzintervalle und Tests

Für den Standardfehler werden verschiedene Schreibweisen verwendet, um ihn von der Standardabweichung \sigma der Grundgesamtheit zu unterscheiden. Übliche Notationen sind \sigma_n, \sigma({\hat{\vartheta}}) oder \sigma_{\hat{\vartheta}}.

Der Standardfehler ist wichtig für Schätzfehler, Konfidenzintervalle und Teststatistiken. Ist die Schätzfunktion {\hat{\vartheta}} erwartungstreu und zumindest näherungsweise normalverteilt, also {\mathcal N}(\vartheta,\sigma^2({\hat{\vartheta}})), dann gilt näherungsweise:

({\hat{\vartheta}}-\vartheta)/\sigma({\hat{\vartheta}}) \approx {\mathcal N}(0;1).

Daraus ergibt sich ein (1-\alpha)-Konfidenzintervall für den unbekannten Parameter \vartheta:

P({\hat{\vartheta}}-z_{1-\alpha/2}\sigma({\hat{\vartheta}})\leq \vartheta \leq {\hat{\vartheta}}+z_{1-\alpha/2}\sigma({\hat{\vartheta}}))=1-\alpha.

Auch Tests lassen sich damit formulieren, zum Beispiel H_0:\vartheta=\vartheta_0 gegen H_1:\vartheta\neq\vartheta_0. Die Teststatistik lautet:

V=({\hat{\vartheta}}-\vartheta_0)/\sigma({\hat{\vartheta}})\approx {\mathcal N}(0;1).

Da \sigma({\hat{\vartheta}}) meist aus der Stichprobe geschätzt werden muss, verwendet man häufig {\hat{\sigma}}({\hat{\vartheta}}). Dann gilt näherungsweise V=({\hat{\vartheta}}-\vartheta_0)/{\hat{\sigma}}({\hat{\vartheta}})\approx t_{n-1}. Für n\geq 30 kann die t-Verteilung durch die Standardnormalverteilung approximiert werden.

Standardfehler des Mittelwerts

Für das arithmetische Mittel lautet der Standardfehler:

\sigma({\overline X})=\sigma/\sqrt n,

wobei \sigma die Standardabweichung einer einzelnen Messung und n der Stichprobenumfang ist. Der Standardfehler des Mittelwerts kann mit dieser Formel berechnet werden, wenn \sigma geschätzt wird. Alternativ können Bootstrapping oder die Jackknife-Methode verwendet werden.

Der Mittelwert einer Stichprobe ist definiert als:

{\overline x}=\frac{1}{n}\sum_{i=1}^{n}x_i.

Für unabhängige, identisch verteilte Zufallsvariablen X_1,\ldots,X_n mit endlicher Varianz \sigma^2 ergibt sich:

\operatorname{Var}({\overline X})=\sigma^2/n,

also \sigma({\overline X})=\sigma/\sqrt n. Wenn die einzelnen Zufallsvariablen unterschiedliche Varianzen \sigma_i^2 haben, gilt entsprechend:

\sigma({\overline X})^2=\frac{1}{n^2}\sum_{i=1}^{n}\sigma_i^2.

Da die Standardabweichung \sigma der Grundgesamtheit oft unbekannt ist, muss sie geschätzt werden. Für den Mittelwert nutzt man dazu die korrigierte Stichprobenvarianz. Bei bestimmten Verteilungen ergeben sich spezielle Formeln, zum Beispiel für die Binomialverteilung mit Parametern N,p: \sigma_{{\bar x},\mathrm{binom}}=\sqrt{N\cdot p\cdot(1-p)}/\sqrt n, für die Exponentialverteilung mit Parameter \lambda: \sigma_{{\bar x},\mathrm{exp}}=1/(\lambda\sqrt n), und für die Poisson-Verteilung mit Parameter \lambda: \sigma_{{\bar x},\mathrm{poisson}}=\sqrt{\lambda/n}.

Beispiele und endliche Population

Ein Grundbeispiel ist die Schätzung der mittleren Intelligenzleistung von Kindern, die Gymnasien besuchen. Zieht man zufällig eine Stichprobe von n Kindern und berechnet den Mittelwert, erhält man eine Schätzung. Zieht man weitere zufällige Stichproben derselben Größe, werden deren Mittelwerte nicht exakt übereinstimmen. Die Streuung dieser vielen Stichprobenmittelwerte um den Mittelwert der Grundgesamtheit ist der Standardfehler. Er beschreibt dabei nicht die Streuung der Intelligenzleistungen der einzelnen Kinder, sondern die Genauigkeit des geschätzten Mittelwerts.

Ein weiteres Beispiel sind Eiscreme-Daten zum Pro-Kopf-Verbrauch in Pint. Für 1951 betrug der Mittelwert 0,34680, der Standardfehler 0,01891, die Standardabweichung 0,05980 und die Beobachtungszahl 10. Für 1952 waren es 0,34954, 0,01636, 0,05899 und 13. Für 1953 waren es 0,39586, 0,03064, 0,08106 und 7. Weil 1953 weniger Beobachtungen vorlagen und die Standardabweichung größer war, war der Standardfehler fast doppelt so groß wie in den Jahren 1951 und 1952. Der Mittelwert von 1953 konnte daher ungenauer geschätzt werden.

Bei einer endlich großen Population mit Größe N und Stichprobengröße n ist die Varianz des geschätzten Mittelwertes:

\operatorname{Var}\left(\frac{1}{n}\sum_i X_i\right)=\frac{1}{n}\left(1-\frac{n}{N}\right)\sigma^2.

Wenn n=N, also die gesamte Population untersucht wird, ist die Varianz des Mittelwert-Schätzers Null.

Regression und Maximum-Likelihood

Auch in der einfachen linearen Regression treten Standardfehler auf. Im klassischen Regressionsmodell Y_i=\beta_0+\beta_1x_i+\varepsilon_i wird vorausgesetzt, dass die Störterme \varepsilon_i\sim(0,\sigma^2) normalverteilt und unabhängig sind und dass die Werte x_i fest vorgegeben sind. Für die Schätzer {\hat\beta}_1 und {\hat\beta}_0 gilt dann:

{\hat\beta}_1\sim {\mathcal N}(\beta_1,\sigma_{{\hat\beta}_1}^2) und {\hat\beta}_0\sim {\mathcal N}(\beta_0,\sigma_{{\hat\beta}_0}^2).

Die Standardfehler der Regressionskoeffizienten sind:

\sigma_{{\hat\beta}_1}=\sigma\sqrt{1/\sum_{i=1}^{n}(x_i-{\overline x})^2}

und

\sigma_{{\hat\beta}_0}=\sigma\sqrt{\sum_{i=1}^{n}x_i^2/(n\sum_{i=1}^{n}(x_i-{\overline x})^2)}.

Im Eiscreme-Beispiel wurde der Pro-Kopf-Verbrauch mit der mittleren Wochentemperatur als unabhängiger Variable regressiert. Die Schätzung ergab: Pro-Kopf-Verbrauch =0{,}20686+0{,}00311\cdot Temperatur. Für die Konstante betrug der Standardfehler 0,02470, für die Temperatur 0,00048. Obwohl der geschätzte Temperatur-Koeffizient 0,00311 klein war, war sein Standardfehler noch kleiner; der t-Wert betrug 6,502.

Beim Maximum-Likelihood-Schätzer wird der Ausdruck \sigma({\hat\theta}_{ML})=1/\sqrt{-\frac{\partial^2}{\partial\theta^2}\ell({\hat\theta}_{ML})} als Standardfehler bezeichnet. Dabei ist \ell(\cdot)=\log {\mathcal L}(\cdot) die Log-Likelihood-Funktion, und -\frac{\partial^2}{\partial\theta^2}\ell({\hat\theta}_{ML}) ist die beobachtete Fisher-Information.

Weiterlesen

Schätzfunktion Schätzfunktionen sind die Basis zur Berechnung von Punktschätzungen und zur Bestimmung von Konfidenzintervallen mittels Bereichsschätzern und werden als … Grundgesamtheit Die Grundgesamtheit bezeichnet diejenige Menge aller Objekte, über die eine Aussage getroffen werden soll. Grundgesamtheiten werden häufig nur unvollständig … Quadratwurzel Hierbei handelt es sich um einen Algorithmus ähnlich dem gängigen Verfahren der schriftlichen Division. Intervallschachtelung: Dieses Verfahren ist recht … Varianz (Stochastik) Mathematisch wird sie definiert als die mittlere quadratische Abweichung einer reellen Zufallsvariablen von ihrem Erwartungswert. Sie ist das zentrale Moment … GUM (Norm) GUM ist die Abkürzung für den 1993 veröffentlichten und zuletzt 2008 überarbeiteten ISO/BIPM-Leitfaden Guide to the Expression of Uncertainty in Measurement … Konfidenzintervall Ein Konfidenzintervall, kurz KI, auch Vertrauensintervall, Konfidenzbereich, Vertrauensbereich oder Erwartungsbereich genannt, ist in der frequentistischen … Teststatistik Teststatistiken werden als Hilfsfunktionen bei der Definition von statistischen Tests verwendet. So wird beispielsweise bei einem Hypothesentest die … Mittelwert Ein Mittelwert (kurz auch nur Mittel; anderes Wort Durchschnitt) ist eine Zahl, die aus gegebenen Zahlen nach einer bestimmten Rechenvorschrift ermittelt … Normalverteilung Ihre Wahrscheinlichkeitsdichtefunktion wird auch Gauß-Funktion, gaußsche Normalverteilung, gaußsche Verteilungskurve, Gauß-Kurve, gaußsche Glockenkurve … Quantil (Wahrscheinlichkeitstheorie) Ein Quantil () ist ein Lagemaß in der Statistik für Wahrscheinlichkeitsverteilungen oder gleichwertig für Zufallsvariablen. Auch die empirische Schätzung … Bootstrapping-Verfahren Aus dieser Verteilung der Statistik T kann direkt ein Konfidenzintervall mithilfe der inversen Verteilungsfunktion erzeugt werden. Zudem lassen sich … Binomialverteilung Die Binomialverteilung wurde von Jakob Bernoulli in seinem Werk Ars Conjectandi (1713) eingeführt. Der Begriff fand erstmals 1895 durch Karl Pearson Eingang in …