Wikipedia · einfach zusammengefasst · Stand
Empirische Varianz
Die Wurzel der empirischen Varianz ist die empirische Standardabweichung. Die empirische Standardabweichung stellt das gebräuchlichste Streuungsmaß dar. Sie ist …
Inhalt6 Abschnitte
Kernidee und Grundbegriffe
Die empirische Varianz, auch Stichprobenvarianz oder veraltet empirisches Streuungsquadrat, ist ein Maß dafür, wie stark konkrete erhobene Werte einer Stichprobe streuen. Sie gehört zur beschreibenden Statistik und beschreibt die mittlere quadratische Abweichung der Werte vom empirischen Mittelwert. Anschaulich ist sie also ein „durchschnittliches Abweichungsquadrat“.
Wichtige Zeichen sind: n für die Anzahl der Werte, x_1, ..., x_n für die beobachteten Stichprobenwerte, \overline{x} für den empirischen Mittelwert und s^2 für die empirische Varianz. Die Varianz der Grundgesamtheit wird mit σ^2 bezeichnet, ihr Mittelwert mit μ.
Die Varianz der Grundgesamtheit einer endlichen Population mit N Werten ist definiert als σ^2 = (1/N) Σ_{i=1}^N (x_i - μ)^2, wobei μ = (1/N) Σ_{i=1}^N x_i der Populationsmittelwert ist. In der Praxis ist diese Varianz oft unbekannt, weil nicht alle Elemente der Grundgesamtheit untersucht werden können. Deshalb nutzt man Stichproben und berechnet daraus eine empirische Varianz.
Der empirische Mittelwert einer Stichprobe ist \overline{x} = (1/n)(x_1 + x_2 + ... + x_n) = (1/n) Σ_{i=1}^n x_i. Er dient als Schätzer für den Populationsmittelwert μ.
Berechnung und Bedeutung der Formeln
Zur Berechnung werden zuerst die Abweichungen der Werte vom arithmetischen Mittel gebildet: x_i - \overline{x}. Diese Abweichungen werden quadriert und aufsummiert. Die Summe heißt Abweichungsquadratsumme: Σ_{i=1}^n (x_i - \overline{x})^2.
Durch das Quadrieren heben sich positive und negative Abweichungen nicht gegenseitig auf. Die Varianz ist deshalb immer positiv oder null. Eine größere Varianz bedeutet eine größere Unterschiedlichkeit der Werte. Einzelne starke Ausreißer können das Ergebnis stark beeinflussen.
Die gebräuchlichste Formel ist die korrigierte empirische Varianz: s^2 = (1/(n-1)) Σ_{i=1}^n (x_i - \overline{x})^2. Die Division durch n - 1 heißt Bessel-Korrektur. Sie sorgt dafür, dass s^2 ein erwartungstreuer Schätzer für die Populationsvarianz σ^2 ist, also E(s^2) = σ^2 gilt.
Alternativ gibt es die unkorrigierte empirische Varianz: \tilde{s}^2 = (1/n) Σ_{i=1}^n (x_i - \overline{x})^2. Sie wird durch n geteilt und ist kein erwartungstreuer Schätzer der Populationsvarianz; im Mittel liefert sie zu kleine Werte. Sie kann aber sinnvoll sein, wenn ein gegebener Datensatz möglichst gut durch eine Normalverteilung beschrieben werden soll.
Wenn der Mittelwert der Grundgesamtheit μ bekannt ist, kann man {s*}^2 = (1/n) Σ_{i=1}^n (x_i - μ)^2 verwenden. Auch diese Formel ist erwartungstreu, weil kein empirischer Mittelwert geschätzt werden muss und deshalb kein Freiheitsgrad verloren geht.
Bei der Bezeichnung gibt es keine vollständige Einheitlichkeit: Manche Autoren nennen nur \tilde{s}^2 empirische Varianz und s^2 Stichprobenvarianz; andere sprechen bei s^2 von erwartungstreuer Stichprobenvarianz, theoretischer Varianz oder induktiver Varianz.
Spezielle Datentypen und laufende Berechnung
Für Häufigkeitsdaten nimmt man an, dass die n Stichprobenwerte nur k konkrete Ausprägungen a_j annehmen. Man zählt zunächst die absoluten Häufigkeiten h_j, berechnet daraus die relativen Häufigkeiten f_j und nutzt dann die Formel \tilde{s}^2 = Σ_{j=1}^k (a_j - \overline{x})^2 f_j. Der empirische Mittelwert ist dabei \overline{x} = Σ_{j=1}^k f_j a_j = (1/n) Σ_{j=1}^k h_j a_j.
Bei Daten aus einer Zeitreihe kommen Messwerte x_k nacheinander an, zum Beispiel sekündlich. Wenn die Varianz jeweils sofort nach Eintreffen eines neuen Werts berechnet werden soll, wären die normalen Summenformeln mit wachsender Datenmenge immer aufwendiger. Deshalb können rekursive Formeln verwendet werden, die auf den bisherigen Schätzwerten aufbauen: \hat{μ}k = \hat{μ}{k-1} + (1/k)(x_k - \hat{μ}_{k-1}) und \hat{σ}k^2 = \hat{σ}{k-1}^2 + (1/k)[(x_k - \hat{μ}k)^2 - \tilde{σ}{k-1}^2].
Für diese rekursive Berechnung braucht man Startwerte bei k = 0. Für \hat{μ}_0 kommen 0, der erste Messwert oder ein erwarteter Mittelwert infrage; für \hat{σ}_0 kommen 0 oder ein erwarteter Varianzwert infrage.
Eigenschaften und Genauigkeit
Für unabhängige, normalverteilte Zufallsvariablen folgt die korrigierte empirische Varianz s^2 einer skalierten Chi-Quadrat-Verteilung: (n-1) s^2 / σ^2 ~ χ^2_{n-1}. Daraus folgen E(s^2) = σ^2 und Var[s^2] = 2σ^4/(n-1).
Bei Transformationen gelten einfache Regeln. Wird zu allen Daten ein konstanter Wert c addiert, ändert sich die Varianz nicht: s^2(x) = s^2(y), \tilde{s}^2(x) = \tilde{s}^2(y) und {s*}^2(x) = {s*}^2(y), wenn y = (x_1 + c, ..., x_n + c). Wird jeder Wert mit einem Faktor a ≠ 0 multipliziert, dann wird die Varianz mit a^2 multipliziert: s^2(y) = a^2 s^2(x), \tilde{s}^2(y) = a^2 \tilde{s}^2(x) und {s*}^2(y) = a^2 {s*}^2(x).
Auch die berechnete Stichprobenvarianz streut von Stichprobe zu Stichprobe. Diese Streuung zeigt, wie genau die Varianzbestimmung ist. Bei unbekanntem wahrem Mittelwert kann die Standardabweichung der Stichprobenvarianz näherungsweise mit √Var(s^2) = √((2/(n-1)) s^4) abgeschätzt werden. Bei bekanntem wahrem Mittelwert μ gilt entsprechend √Var({s*}^2) = √((2/n) {s*}^4).
Ein Beispiel aus dem Artikel zeigt: Bei n = 10 und s^2 = 1,0 ergibt sich √Var(s^2) = √((2/9) · 1,0^2) = √0,2222 = 0,47. Das ist im Verhältnis zur Varianz groß. Bei n = 100 ergibt sich √Var(s^2) = √((2/99) · 1,0^2) = √0,0202 = 0,14. Eine genaue Berechnung der empirischen Varianz erfordert daher oft größere Stichproben, als man zunächst vermuten würde.
Alternative Darstellungen und abgeleitete Maße
In der Varianzanalyse wird die Varianz oft als mittleres oder durchschnittliches Abweichungsquadrat MQ beschrieben: s^2 = SQ/FG, also Summe der Abweichungsquadrate geteilt durch die Freiheitsgrade. Für die korrigierte Varianz gilt s^2 = Σ_{i=1}^n (x_i - \overline{x})^2/(n-1).
Mit dem Verschiebungssatz kann man die Varianz auch über Quadratsummen darstellen: s^2 = (1/(n-1)) Σ x_i^2 - (n/(n-1)) \overline{x}^2, \tilde{s}^2 = (1/n) Σ x_i^2 - \overline{x}^2 und {s*}^2 = (1/n) Σ x_i^2 - μ^2. Diese Darstellung kann numerisch ungünstig sein, weil dabei möglicherweise zwei sehr große Werte voneinander abgezogen werden.
Eine weitere Darstellung verwendet eine Doppelsumme und benötigt keine vorherige Berechnung des empirischen Mittels: s^2 = (1/(2n(n-1))) Σ_{i=1}^n Σ_{j=1}^n (x_i - x_j)^2 und \tilde{s}^2 = (1/(2n^2)) Σ_{i=1}^n Σ_{j=1}^n (x_i - x_j)^2.
Die empirische Standardabweichung ist die Wurzel aus der jeweiligen empirischen Varianz. Sie ist leichter anschaulich zu deuten, weil sie dieselben Einheiten wie die ursprünglichen Werte besitzt. Formeln sind s = √[(1/(n-1)) Σ (x_i - \overline{x})^2], \tilde{s} = √[(1/n) Σ (x_i - \overline{x})^2] und s* = √[(1/n) Σ (x_i - μ)^2].
Der empirische Variationskoeffizient ist ein einheitenloses Streuungsmaß. Er drückt s in Prozent des empirischen Mittelwerts aus: v = (s/\overline{x}) · 100 %. In der Finanzmarkttheorie werden Varianzen oder Volatilitäten von Renditen häufig annualisiert, also auf ein Jahr hochgerechnet. Bei täglichen Daten wird oft der Annualisierungsfaktor A = 250 verwendet: \hat{σ}^2 = 250 · s^2 = (250/(n-1)) Σ (x_i - \overline{x})^2.
Rechenbeispiel
Für die Stichprobe x_1 = 10, x_2 = 9, x_3 = 13, x_4 = 15, x_5 = 16 gilt n = 5. Der empirische Mittelwert ist \overline{x} = (1/5)(10 + 9 + 13 + 15 + 16) = 63/5 = 12,6.
Die Abweichungsquadratsumme beträgt (10 - 12,6)^2 + (9 - 12,6)^2 + (13 - 12,6)^2 + (15 - 12,6)^2 + (16 - 12,6)^2 = (-2,6)^2 + (-3,6)^2 + 0,4^2 + 2,4^2 + 3,4^2 = 37,2.
Mit der korrigierten Formel erhält man s^2 = 37,2/(5 - 1) = 37,2/4 = 9,3. Mit der unkorrigierten Formel erhält man \tilde{s}^2 = 37,2/5 = 7,44.
Wenn der Mittelwert der Grundgesamtheit vorab als μ = 12 bekannt ist, ergibt sich die Summe (10 - 12)^2 + (9 - 12)^2 + (13 - 12)^2 + (15 - 12)^2 + (16 - 12)^2 = 39. Damit ist {s*}^2 = 39/5 = 7,8.
Die entsprechenden empirischen Standardabweichungen sind s = √9,3 ≈ 3,05, \tilde{s} = √7,44 ≈ 2,73 und s* = √7,8 ≈ 2,79.