Zum Inhalt springen
L

Wikipedia · einfach zusammengefasst · Stand

Empirische Varianz

Die Wurzel der empirischen Varianz ist die empirische Standardabweichung. Die empirische Standardabweichung stellt das gebräuchlichste Streuungsmaß dar. Sie ist …

Inhalt6 Abschnitte
  1. 1. Kernidee und Grundbegriffe
  2. 2. Berechnung und Bedeutung der Formeln
  3. 3. Spezielle Datentypen und laufende Berechnung
  4. 4. Eigenschaften und Genauigkeit
  5. 5. Alternative Darstellungen und abgeleitete Maße
  6. 6. Rechenbeispiel

Kernidee und Grundbegriffe

Die empirische Varianz, auch Stichprobenvarianz oder veraltet empirisches Streuungsquadrat, ist ein Maß dafür, wie stark konkrete erhobene Werte einer Stichprobe streuen. Sie gehört zur beschreibenden Statistik und beschreibt die mittlere quadratische Abweichung der Werte vom empirischen Mittelwert. Anschaulich ist sie also ein „durchschnittliches Abweichungsquadrat“.

Wichtige Zeichen sind: n für die Anzahl der Werte, x_1, ..., x_n für die beobachteten Stichprobenwerte, \overline{x} für den empirischen Mittelwert und s^2 für die empirische Varianz. Die Varianz der Grundgesamtheit wird mit σ^2 bezeichnet, ihr Mittelwert mit μ.

Die Varianz der Grundgesamtheit einer endlichen Population mit N Werten ist definiert als σ^2 = (1/N) Σ_{i=1}^N (x_i - μ)^2, wobei μ = (1/N) Σ_{i=1}^N x_i der Populationsmittelwert ist. In der Praxis ist diese Varianz oft unbekannt, weil nicht alle Elemente der Grundgesamtheit untersucht werden können. Deshalb nutzt man Stichproben und berechnet daraus eine empirische Varianz.

Der empirische Mittelwert einer Stichprobe ist \overline{x} = (1/n)(x_1 + x_2 + ... + x_n) = (1/n) Σ_{i=1}^n x_i. Er dient als Schätzer für den Populationsmittelwert μ.

Berechnung und Bedeutung der Formeln

Zur Berechnung werden zuerst die Abweichungen der Werte vom arithmetischen Mittel gebildet: x_i - \overline{x}. Diese Abweichungen werden quadriert und aufsummiert. Die Summe heißt Abweichungsquadratsumme: Σ_{i=1}^n (x_i - \overline{x})^2.

Durch das Quadrieren heben sich positive und negative Abweichungen nicht gegenseitig auf. Die Varianz ist deshalb immer positiv oder null. Eine größere Varianz bedeutet eine größere Unterschiedlichkeit der Werte. Einzelne starke Ausreißer können das Ergebnis stark beeinflussen.

Die gebräuchlichste Formel ist die korrigierte empirische Varianz: s^2 = (1/(n-1)) Σ_{i=1}^n (x_i - \overline{x})^2. Die Division durch n - 1 heißt Bessel-Korrektur. Sie sorgt dafür, dass s^2 ein erwartungstreuer Schätzer für die Populationsvarianz σ^2 ist, also E(s^2) = σ^2 gilt.

Alternativ gibt es die unkorrigierte empirische Varianz: \tilde{s}^2 = (1/n) Σ_{i=1}^n (x_i - \overline{x})^2. Sie wird durch n geteilt und ist kein erwartungstreuer Schätzer der Populationsvarianz; im Mittel liefert sie zu kleine Werte. Sie kann aber sinnvoll sein, wenn ein gegebener Datensatz möglichst gut durch eine Normalverteilung beschrieben werden soll.

Wenn der Mittelwert der Grundgesamtheit μ bekannt ist, kann man {s*}^2 = (1/n) Σ_{i=1}^n (x_i - μ)^2 verwenden. Auch diese Formel ist erwartungstreu, weil kein empirischer Mittelwert geschätzt werden muss und deshalb kein Freiheitsgrad verloren geht.

Bei der Bezeichnung gibt es keine vollständige Einheitlichkeit: Manche Autoren nennen nur \tilde{s}^2 empirische Varianz und s^2 Stichprobenvarianz; andere sprechen bei s^2 von erwartungstreuer Stichprobenvarianz, theoretischer Varianz oder induktiver Varianz.

Spezielle Datentypen und laufende Berechnung

Für Häufigkeitsdaten nimmt man an, dass die n Stichprobenwerte nur k konkrete Ausprägungen a_j annehmen. Man zählt zunächst die absoluten Häufigkeiten h_j, berechnet daraus die relativen Häufigkeiten f_j und nutzt dann die Formel \tilde{s}^2 = Σ_{j=1}^k (a_j - \overline{x})^2 f_j. Der empirische Mittelwert ist dabei \overline{x} = Σ_{j=1}^k f_j a_j = (1/n) Σ_{j=1}^k h_j a_j.

Bei Daten aus einer Zeitreihe kommen Messwerte x_k nacheinander an, zum Beispiel sekündlich. Wenn die Varianz jeweils sofort nach Eintreffen eines neuen Werts berechnet werden soll, wären die normalen Summenformeln mit wachsender Datenmenge immer aufwendiger. Deshalb können rekursive Formeln verwendet werden, die auf den bisherigen Schätzwerten aufbauen: \hat{μ}k = \hat{μ}{k-1} + (1/k)(x_k - \hat{μ}_{k-1}) und \hat{σ}k^2 = \hat{σ}{k-1}^2 + (1/k)[(x_k - \hat{μ}k)^2 - \tilde{σ}{k-1}^2].

Für diese rekursive Berechnung braucht man Startwerte bei k = 0. Für \hat{μ}_0 kommen 0, der erste Messwert oder ein erwarteter Mittelwert infrage; für \hat{σ}_0 kommen 0 oder ein erwarteter Varianzwert infrage.

Eigenschaften und Genauigkeit

Für unabhängige, normalverteilte Zufallsvariablen folgt die korrigierte empirische Varianz s^2 einer skalierten Chi-Quadrat-Verteilung: (n-1) s^2 / σ^2 ~ χ^2_{n-1}. Daraus folgen E(s^2) = σ^2 und Var[s^2] = 2σ^4/(n-1).

Bei Transformationen gelten einfache Regeln. Wird zu allen Daten ein konstanter Wert c addiert, ändert sich die Varianz nicht: s^2(x) = s^2(y), \tilde{s}^2(x) = \tilde{s}^2(y) und {s*}^2(x) = {s*}^2(y), wenn y = (x_1 + c, ..., x_n + c). Wird jeder Wert mit einem Faktor a ≠ 0 multipliziert, dann wird die Varianz mit a^2 multipliziert: s^2(y) = a^2 s^2(x), \tilde{s}^2(y) = a^2 \tilde{s}^2(x) und {s*}^2(y) = a^2 {s*}^2(x).

Auch die berechnete Stichprobenvarianz streut von Stichprobe zu Stichprobe. Diese Streuung zeigt, wie genau die Varianzbestimmung ist. Bei unbekanntem wahrem Mittelwert kann die Standardabweichung der Stichprobenvarianz näherungsweise mit √Var(s^2) = √((2/(n-1)) s^4) abgeschätzt werden. Bei bekanntem wahrem Mittelwert μ gilt entsprechend √Var({s*}^2) = √((2/n) {s*}^4).

Ein Beispiel aus dem Artikel zeigt: Bei n = 10 und s^2 = 1,0 ergibt sich √Var(s^2) = √((2/9) · 1,0^2) = √0,2222 = 0,47. Das ist im Verhältnis zur Varianz groß. Bei n = 100 ergibt sich √Var(s^2) = √((2/99) · 1,0^2) = √0,0202 = 0,14. Eine genaue Berechnung der empirischen Varianz erfordert daher oft größere Stichproben, als man zunächst vermuten würde.

Alternative Darstellungen und abgeleitete Maße

In der Varianzanalyse wird die Varianz oft als mittleres oder durchschnittliches Abweichungsquadrat MQ beschrieben: s^2 = SQ/FG, also Summe der Abweichungsquadrate geteilt durch die Freiheitsgrade. Für die korrigierte Varianz gilt s^2 = Σ_{i=1}^n (x_i - \overline{x})^2/(n-1).

Mit dem Verschiebungssatz kann man die Varianz auch über Quadratsummen darstellen: s^2 = (1/(n-1)) Σ x_i^2 - (n/(n-1)) \overline{x}^2, \tilde{s}^2 = (1/n) Σ x_i^2 - \overline{x}^2 und {s*}^2 = (1/n) Σ x_i^2 - μ^2. Diese Darstellung kann numerisch ungünstig sein, weil dabei möglicherweise zwei sehr große Werte voneinander abgezogen werden.

Eine weitere Darstellung verwendet eine Doppelsumme und benötigt keine vorherige Berechnung des empirischen Mittels: s^2 = (1/(2n(n-1))) Σ_{i=1}^n Σ_{j=1}^n (x_i - x_j)^2 und \tilde{s}^2 = (1/(2n^2)) Σ_{i=1}^n Σ_{j=1}^n (x_i - x_j)^2.

Die empirische Standardabweichung ist die Wurzel aus der jeweiligen empirischen Varianz. Sie ist leichter anschaulich zu deuten, weil sie dieselben Einheiten wie die ursprünglichen Werte besitzt. Formeln sind s = √[(1/(n-1)) Σ (x_i - \overline{x})^2], \tilde{s} = √[(1/n) Σ (x_i - \overline{x})^2] und s* = √[(1/n) Σ (x_i - μ)^2].

Der empirische Variationskoeffizient ist ein einheitenloses Streuungsmaß. Er drückt s in Prozent des empirischen Mittelwerts aus: v = (s/\overline{x}) · 100 %. In der Finanzmarkttheorie werden Varianzen oder Volatilitäten von Renditen häufig annualisiert, also auf ein Jahr hochgerechnet. Bei täglichen Daten wird oft der Annualisierungsfaktor A = 250 verwendet: \hat{σ}^2 = 250 · s^2 = (250/(n-1)) Σ (x_i - \overline{x})^2.

Rechenbeispiel

Für die Stichprobe x_1 = 10, x_2 = 9, x_3 = 13, x_4 = 15, x_5 = 16 gilt n = 5. Der empirische Mittelwert ist \overline{x} = (1/5)(10 + 9 + 13 + 15 + 16) = 63/5 = 12,6.

Die Abweichungsquadratsumme beträgt (10 - 12,6)^2 + (9 - 12,6)^2 + (13 - 12,6)^2 + (15 - 12,6)^2 + (16 - 12,6)^2 = (-2,6)^2 + (-3,6)^2 + 0,4^2 + 2,4^2 + 3,4^2 = 37,2.

Mit der korrigierten Formel erhält man s^2 = 37,2/(5 - 1) = 37,2/4 = 9,3. Mit der unkorrigierten Formel erhält man \tilde{s}^2 = 37,2/5 = 7,44.

Wenn der Mittelwert der Grundgesamtheit vorab als μ = 12 bekannt ist, ergibt sich die Summe (10 - 12)^2 + (9 - 12)^2 + (13 - 12)^2 + (15 - 12)^2 + (16 - 12)^2 = 39. Damit ist {s*}^2 = 39/5 = 7,8.

Die entsprechenden empirischen Standardabweichungen sind s = √9,3 ≈ 3,05, \tilde{s} = √7,44 ≈ 2,73 und s* = √7,8 ≈ 2,79.

Weiterlesen

Varianz Die Standardabweichung ist oft anschaulicher als die Varianz, da sie dieselbe Größenordnung hat wie die beobachteten Werte. Die Varianz ist dafür in … Streuungsmaß (Statistik) Die mittlere absolute Abweichung wird in der mathematischen Statistik meist zugunsten der quadratischen Abweichung umgangen, welche analytisch leichter zu … Stichprobe Als Stichprobe bezeichnet man entweder. eine Teilmenge einer Grundgesamtheit (Population), die unter bestimmten Gesichtspunkten ausgewählt wurde … Deskriptive Statistik Tabellen: In Tabellen werden Daten in einer Matrix mit Zeilen und Spalten dargestellt, wenn die Datenstruktur dies erlaubt. Dabei entspricht üblicherweise … Arithmetisches Mittel Er wird berechnet, indem die Summe der betrachteten Zahlen durch ihre Anzahl geteilt wird. Wie andere Mittelwerte beschreibt er das Zentrum einer Verteilung … Varianzanalyse Die einfachste Form der Varianzanalyse testet den Einfluss einer einzelnen nominalskalierten auf eine intervallskalierte Variable, indem sie die Mittelwerte der … Grundgesamtheit Die Grundgesamtheit bezeichnet diejenige Menge aller Objekte, über die eine Aussage getroffen werden soll. Grundgesamtheiten werden häufig nur unvollständig … Schätzfunktion Schätzfunktionen sind die Basis zur Berechnung von Punktschätzungen und zur Bestimmung von Konfidenzintervallen mittels Bereichsschätzern und werden als … Ausreißer Die blaue Gerade wurde ohne Einbeziehung des Ausreißers erstellt, die violette mit der Einbeziehung. Der Boxplot auf einem Zahlenstrahl dargestellt. Erwartungswert Der Erwartungswert beschreibt für eine Zufallsvariable mit endlich vielen Funktionswerten das mit der Wahrscheinlichkeit des Auftretens gewichtete arithmetische … Normalverteilung Ihre Wahrscheinlichkeitsdichtefunktion wird auch Gauß-Funktion, gaußsche Normalverteilung, gaußsche Verteilungskurve, Gauß-Kurve, gaußsche Glockenkurve … Absolute Häufigkeit Die absolute Häufigkeit ist das Ergebnis einer einfachen Zählung von Objekten oder Ereignissen (besser Elementarereignissen). Sie gibt an, wie viele Elemente …