Wikipedia · einfach zusammengefasst · Stand
Varianz
Die Standardabweichung ist oft anschaulicher als die Varianz, da sie dieselbe Größenordnung hat wie die beobachteten Werte. Die Varianz ist dafür in …
Inhalt6 Abschnitte
Grundidee und Bedeutung
Die Varianz ist ein Begriff der Wahrscheinlichkeitsrechnung und ein Maß dafür, wie stark reelle Werte um einen Mittelwert beziehungsweise Zufallsvariablen um ihren Erwartungswert streuen. Sie wird berechnet, indem man das mittlere Abweichungsquadrat bildet: Man betrachtet also die quadrierten Abweichungen vom Mittel- oder Erwartungswert und mittelt sie.
Die Quadratwurzel aus der Varianz ist die Standardabweichung. Die Standardabweichung ist oft anschaulicher, weil sie dieselbe Größenordnung hat wie die beobachteten Werte. Die Varianz ist dagegen für weiterführende Rechnungen praktisch, weil sich zum Beispiel Varianzbeiträge unabhängiger Zufallseinflüsse addieren lassen. Umgekehrt kann eine Varianzanalyse eine Gesamtvarianz in Beiträge oder Ursachen zerlegen.
Wichtige Zeichen sind: \mu für den Mittelwert der Grundgesamtheit, \sigma^2 für die Varianz der Grundgesamtheit, n für die Anzahl gegebener Werte, x_1,\ldots,x_n für beobachtete Stichprobenwerte, \overline{x} für das Stichprobenmittel beziehungsweise den empirischen Mittelwert, s^2 für die Stichprobenvarianz beziehungsweise empirische Varianz, \operatorname{E}(X) für den Erwartungswert und \operatorname{Var}(X) für die Varianz einer Zufallsvariablen.
Eigenschaften der Varianz
Durch das Quadrieren der Abweichungen vom Mittelwert heben sich positive und negative Abweichungen nicht gegenseitig auf. Deshalb ist die Varianz einer Stichprobe immer positiv oder gleich Null. Sie ist genau dann Null, wenn alle Stichprobenwerte identisch sind.
Eine größere Varianz bedeutet eine größere Unterschiedlichkeit der Werte. Weil Abweichungen quadriert werden, haben wenige, aber starke Ausreißer einen großen Einfluss auf das Ergebnis.
Empirische Varianz aus Stichproben
In der beschreibenden Statistik spricht man von empirischer Varianz, wenn die Varianz aus konkreten Daten berechnet wird. Diese Daten sind häufig eine Stichprobe aus einer Grundgesamtheit, also aus der Gesamtheit aller betrachteten Daten. Deshalb wird auch die Bezeichnung Stichprobenvarianz verwendet.
Für beobachtete reelle Werte x_1,\ldots,x_n bildet man zuerst die Abweichungen vom arithmetischen Mittel \overline{x}, also (x_1-\overline{x}),\ldots,(x_n-\overline{x}). Die Summe der quadrierten Abweichungen heißt Abweichungsquadratsumme: \sum_{i=1}^{n}(x_i-\overline{x})^2.
Teilt man diese Summe durch n-1, erhält man die korrigierte Stichprobenvarianz oder korrigierte empirische Varianz: s^2=\frac{1}{n-1}\sum_{i=1}^{n}(x_i-\overline{x})^2. Der Faktor 1/(n-1) heißt Bessel-Korrektur. Diese Formel dient dazu, die Varianz der Grundgesamtheit zu schätzen, und ist ein erwartungstreuer Schätzer.
Teilt man stattdessen durch n, erhält man die unkorrigierte Stichprobenvarianz: \tilde{s}^2=\frac{1}{n}\sum_{i=1}^{n}(x_i-\overline{x})^2. Diese Formel beschreibt den Datensatz möglichst gut durch eine Normalverteilung; dabei werden die Parameter so gewählt, dass der quadratische Fehler minimal ist, nämlich \mu=\overline{x} und \sigma=\tilde{s}. Sie ist aber kein erwartungstreuer Schätzer für die Varianz der Grundgesamtheit und liefert im Mittel zu kleine Ergebnisse.
Ist der Mittelwert der Grundgesamtheit \mu bekannt, wird berechnet: {s^*}^2=\frac{1}{n}\sum_{i=1}^{n}(x_i-\mu)^2. Auch diese Formel ist erwartungstreu. Die Bezeichnungen sind in der Literatur nicht einheitlich: Einige Autoren nennen Formel s^2 Stichprobenvarianz und Formel \tilde{s}^2 empirische Varianz.
Vollerhebung und Populationsvarianz
Wenn die Stichprobe alle N Werte der Grundgesamtheit enthält, spricht man von einer Vollerhebung. Dann gilt N=n. Der wahre Mittelwert der Grundgesamtheit \mu ist gleich dem arithmetischen Mittel \overline{x}: \mu=\frac{1}{N}\sum_{i=1}^{N}x_i=\frac{1}{n}\sum_{i=1}^{n}x_i=\overline{x}.
In diesem Fall fallen \tilde{s}^2 und {s^*}^2 zusammen. Die Varianz der Grundgesamtheit, auch Populationsvarianz genannt, ist dann gleich der Stichprobenvarianz und wird berechnet durch: \sigma^2=\frac{1}{N}\sum_{i=1}^{N}(x_i-\mu)^2.
Theoretische Varianz in der Stochastik
In der mathematischen Statistik wird die Varianz allgemeiner behandelt als in der beschreibenden Statistik. Eine Zufallsvariable ordnet dem Ergebnis eines Zufallsexperiments eine Größe zu. Die Varianz ist dann die erwartete quadratische Abweichung der Zufallsvariablen von ihrem Erwartungswert und wird zur Abgrenzung auch theoretische Varianz genannt.
Sei (\Omega,\Sigma,P) ein Wahrscheinlichkeitsraum und X:\Omega\to A eine Zufallsvariable auf eine Menge A. Mit \mu:=\mathbb{E}[X] wird der Erwartungswert bezeichnet, sofern er existiert. Die Varianz ist definiert als: \operatorname{Var}(X):=\mathbb{E}((X-\mu)^2)=\int_{\Omega}(X-\mu)^2\,\mathrm{d}P.
Nicht jede Wahrscheinlichkeitsverteilung besitzt einen Erwartungswert und eine Varianz; als Beispiel nennt der Artikel die Cauchy-Verteilung. Deshalb ist die Varianz nicht für jede Zufallsvariable definiert. Außerdem zeigt eine Varianz von Null in dieser allgemeinen Betrachtung nicht unbedingt an, dass die Zufallsvariable stets denselben Wert liefert.
Berechnung über Verteilungen und Schätzfunktionen
Bei stetigen Zufallsvariablen mit Wahrscheinlichkeitsdichtefunktion f_X auf einer Menge A berechnet man den Erwartungswert und die Varianz durch Integrale: \mu=\int_A x f_X(x)\,\mathrm{d}x, \operatorname{Var}(X)=\int_A (x-\mu)^2 f_X(x)\,\mathrm{d}x.
Bei diskreten Zufallsvariablen mit Wahrscheinlichkeitsfunktion p_X berechnet man Erwartungswert und Varianz durch Summen: \mu=\sum_{x_k\in A}x_kp_X(x_k), \operatorname{Var}(X)=\sum_{x_k\in A}(x_k-\mu)^2p_X(x_k).
Statt konkreter Stichprobenwerte x_1,\ldots,x_n kann man in der mathematischen Statistik Stichprobenvariablen X_1,\ldots,X_n verwenden. Daraus entstehen Schätzfunktionen für die unbekannte Varianz \sigma^2=\operatorname{Var}(X): S^2=\frac{1}{n-1}\sum_{i=1}^{n}(X_i-\overline{X})^2, \tilde{S}^2=\frac{1}{n}\sum_{i=1}^{n}(X_i-\overline{X})^2, {S^*}^2=\frac{1}{n}\sum_{i=1}^{n}(X_i-\mu)^2.
Die empirischen Formeln mit x_i sind Spezialfälle dieser allgemeineren Formeln mit X_i. In statistischen Tests, Konfidenzintervallen und ähnlichen Verfahren werden Mittelwert \mu und Varianz \sigma^2 der Grundgesamtheit oft benötigt, sind in der Praxis aber unbekannt. Daher werden sie mit solchen Schätzfunktionen geschätzt.
Lernvideos zu Varianz
3:12
Varianz und Standardabweichung (Beispiel: ungeordnet, mit Zurücklegen)
Mathe - simpleclub · 764.362 Aufrufe
4:42
Statistische Kennzahlen - Mittelwert, Varianz, Standardabweichung...
Mathe - simpleclub · 84.270 Aufrufe
8:10
Varianz (Einfach erklärt)
numiqo · 57.104 Aufrufe
3:46
Varianz und Standardabweichung (Streuungsmaße) | Lernen mit ClassNinjas
Classninjas · 53.105 Aufrufe