Zum Inhalt springen
L

Wikipedia · einfach zusammengefasst · Stand

Varianz (Stochastik)

Mathematisch wird sie definiert als die mittlere quadratische Abweichung einer reellen Zufallsvariablen von ihrem Erwartungswert. Sie ist das zentrale Moment …

Inhalt6 Abschnitte
  1. 1. Bedeutung und Definition
  2. 2. Berechnung und Stichprobe
  3. 3. Wichtige Rechenregeln
  4. 4. Standardabweichung, Kovarianz und Interpretation
  5. 5. Sätze, bedingte Varianz und Verallgemeinerung
  6. 6. Typische Verteilungen und Beispiele

Bedeutung und Definition

Die Varianz ist ein Maß für die Streuung einer Wahrscheinlichkeitsverteilung um ihren Erwartungswert beziehungsweise Schwerpunkt. Für eine reelle Zufallsvariable X mit Erwartungswert \mathbb{E}(X)=\mu ist sie das zentrale Moment zweiter Ordnung und definiert durch

\operatorname{Var}(X):=\mathbb{E}((X-\mu)^2)=\int_{\Omega}(X(\omega)-\mu)^2\,\mathrm{d}P(\omega).

Sie ist also die mittlere quadratische Abweichung der möglichen Werte von X vom Mittelwert. Das Quadrieren sorgt dafür, dass sich positive und negative Abweichungen nicht aufheben. Existiert der Erwartungswert nicht endlich, ist die Varianz nicht definiert; sie kann auch unendlich sein.

Übliche Schreibweisen sind \operatorname{Var}[X], \operatorname{V}(X), \sigma_X^2 oder, wenn eindeutig, \sigma^2. Erwartungswert und Varianz sind wichtige Kenngrößen einer Verteilung, etwa X\sim(\mu,\sigma^2).

Berechnung und Stichprobe

Für eine diskrete Zufallsvariable mit möglichen Werten x_i und Wahrscheinlichkeiten p_i=P(X=x_i) gilt

\operatorname{Var}(X)=\sum_{i\geq1}(x_i-\mu)^2p_i, mit \mu=\sum_{i\geq1}x_ip_i.

Die Varianz ist damit eine gewichtete Summe: Seltene und häufige Werte gehen entsprechend ihrer Wahrscheinlichkeit ein. Für eine stetige Zufallsvariable mit Dichte f(x) gilt

\operatorname{Var}(X)=\int_{-\infty}^{\infty}(x-\mathbb{E}[X])^2f(x)\,\mathrm{d}x, wobei \mathbb{E}[X]=\int_{-\infty}^{\infty}xf(x)\,\mathrm{d}x.

Für eine Stichprobe N=\{x_1,\dots,x_n\} mit Mittelwert \overline{x}=\frac1n\sum_{i=1}^n x_i lautet die unkorrigierte empirische Varianz

\widetilde{s}_N^2=\frac1n\sum_{i=1}^n(x_i-\overline{x})^2.

Die Bessel-Korrektur liefert die korrigierte empirische Varianz s_N^2=\frac1{n-1}\sum_{i=1}^n(x_i-\overline{x})^2=\frac{n}{n-1}\widetilde{s}_N^2. Für N=\{1,4,10\} ist \overline{x}=5, \widetilde{s}_N^2=14 und s_N^2=21. Bei unabhängigen, identisch verteilten Beobachtungen dient die Stichprobenvarianz als Schätzer für die unbekannte Varianz.

Wichtige Rechenregeln

Die Varianz ist nie negativ: \operatorname{Var}(X)\geq0. Sie ist genau dann null, wenn P(X=a)=1 für ein a\in\mathbb{R}; dann ist X fast sicher konstant. Für die Cauchy-Verteilung existiert sie nicht, weil schon der Erwartungswert nicht existiert; bei der Lévy-Verteilung kann sie \infty sein.

Besonders praktisch ist der Verschiebungssatz:

\operatorname{Var}(X)=\mathbb{E}(X^2)-\mathbb{E}(X)^2=\mathbb{E}(X^2)-\mu^2.

Allgemeiner gilt \mathbb{E}((X-a)^2)=\operatorname{Var}(X)+(\mu-a)^2. Daher minimiert der Erwartungswert die mittlere quadratische Abweichung: \operatorname{Var}(X)=\min_{a\in\mathbb{R}}\mathbb{E}((X-a)^2).

Bei einer linearen Transformation Y=aX+b gilt \operatorname{Var}(Y)=a^2\operatorname{Var}(X): Eine Verschiebung um b ändert die Streuung nicht, eine Multiplikation mit a skaliert sie mit a^2. Standardisierung ist eine solche Transformation und erzeugt eine Zufallsvariable mit Erwartungswert 0 und Varianz 1.

Für zwei Zufallsvariablen gilt \operatorname{Var}(X+Y)=\operatorname{Var}(X)+\operatorname{Var}(Y)+2\operatorname{Cov}(X,Y). Sind sie unkorreliert, ist ihre Kovarianz 0 und die Varianzen addieren sich. Für paarweise unkorrelierte X_1,\dots,X_n gilt \operatorname{Var}(\sum_{i=1}^n a_iX_i)=\sum_{i=1}^n a_i^2\operatorname{Var}(X_i). Haben alle dieselbe Varianz \sigma^2, dann ist \operatorname{Var}(\overline{X})=\sigma^2/n.

Standardabweichung, Kovarianz und Interpretation

Die Standardabweichung ist die Quadratwurzel der Varianz:

\operatorname{SD}(X)=\sqrt{\operatorname{Var}(X)}.

Sie hat dieselbe Einheit wie X, während die Varianz in Quadrateinheiten angegeben wird. Für a,b\in\mathbb{R} gilt \operatorname{SD}(aX+b)=|a|\operatorname{SD}(X). Bei einer Normalverteilung liegen etwa 68 % der Werte im Intervall \mu\pm\sigma; ihre Wendepunkte liegen bei \mu-\sigma und \mu+\sigma.

Die Kovarianz misst die gemeinsame Variabilität zweier Zufallsvariablen. Es gilt \operatorname{Cov}(X,X)=\operatorname{Var}(X) und (\operatorname{Cov}(X,Y))^2\leq\operatorname{Var}(X)\operatorname{Var}(Y).

Anschaulich ist die Varianz der mittlere quadrierte Abstand eines Wertes von \mu. In der physikalischen Deutung ist \mu der Schwerpunkt von Massepunkten und die Varianz ihr Trägheitsmoment um den Schwerpunkt. Große Varianz bedeutet eine breite Verteilung und größere Unsicherheit bei Vorhersagen; Varianz 0 beschreibt eine degenerierte Verteilung mit P(X=\mu)=1.

Sätze, bedingte Varianz und Verallgemeinerung

Die Tschebyscheffsche Ungleichung schätzt ohne Annahme einer bestimmten Verteilungsform ab, wie wahrscheinlich große Abweichungen sind:

P(|X-\mu|\geq k)\leq\frac{\sigma^2}{k^2} für k>0.

Sie gilt für symmetrische und schiefe Verteilungen, liefert aber nur eine grobe Schranke. Ist X zwischen m=\operatorname{inf}(X) und M=\operatorname{sup}(X) beschränkt, dann gilt nach Popoviciu \sigma^2\leq\frac14(M-m)^2.

Mit Zusatzinformation Y heißt \operatorname{Var}(X\mid Y=y)=\mathbb{E}((X-\mathbb{E}(X\mid Y=y))^2\mid Y=y) bedingte Varianz. Das Gesetz der totalen Varianz zerlegt die Varianz von Y in zwei Anteile:

\operatorname{Var}(Y)=\mathbb{E}[\operatorname{Var}(Y\mid X)]+\operatorname{Var}(\mathbb{E}[Y\mid X]).

Für einen Zufallsvektor \boldsymbol{X}=(X_1,\dots,X_p)^{\mathsf{T}} enthält die Varianz-Kovarianzmatrix \operatorname{Cov}(\boldsymbol{X})=\mathbb{E}((\boldsymbol{X}-\boldsymbol{\mu})(\boldsymbol{X}-\boldsymbol{\mu})^{\mathsf{T}}) auf der Diagonalen die Varianzen und außerhalb der Diagonalen die Kovarianzen. Für eine Linearkombination gilt \operatorname{Var}(\boldsymbol{a}^{\mathsf{T}}\boldsymbol{X})=\boldsymbol{a}^{\mathsf{T}}\boldsymbol{\Sigma}_{\boldsymbol{X}}\boldsymbol{a}.

Typische Verteilungen und Beispiele

Wichtige Varianzen sind: Normalverteilung \sigma^2, Bernoulli-Verteilung p(1-p), Binomialverteilung np(1-p), stetige Gleichverteilung \frac1{12}(b-a)^2, Poisson-Verteilung \lambda und degenerierte Verteilung 0. Die Cauchy-Verteilung besitzt keine Varianz.

Beim siebenmaligen Werfen einer fairen Münze zählt X die Ergebnisse „Zahl“. Dann ist X binomialverteilt mit n=7, p=\frac12, Erwartungswert \mu=3{,}5, Varianz \sigma^2=\frac74=1{,}75 und Standardabweichung \sigma=\sqrt{1{,}75}\approx1{,}323.

Für die stetige Dichte f(x)=\frac1x für 1\leq x\leq e und 0 sonst ist \mathbb{E}(X)=e-1, \mathbb{E}(X^2)=\frac{e^2}{2}-\frac12 und damit \sigma^2=\frac{e^2}{2}-\frac12-(e-1)^2\approx0{,}242.

Lernvideos zu Varianz (Stochastik)

Weiterlesen

Empirische Varianz Die Wurzel der empirischen Varianz ist die empirische Standardabweichung. Die empirische Standardabweichung stellt das gebräuchlichste Streuungsmaß dar. Sie ist … Varianz Die Standardabweichung ist oft anschaulicher als die Varianz, da sie dieselbe Größenordnung hat wie die beobachteten Werte. Die Varianz ist dafür in … Dichtefunktion Eine Dichtefunktion, kurz Dichte, ist eine spezielle reellwertige Funktion, die hauptsächlich in den mathematischen Teilgebieten der Stochastik und der … Normalverteilung Ihre Wahrscheinlichkeitsdichtefunktion wird auch Gauß-Funktion, gaußsche Normalverteilung, gaußsche Verteilungskurve, Gauß-Kurve, gaußsche Glockenkurve … Zufallsvariable Beispiele für reelle Zufallsvariablen sind die Augensumme von zwei geworfenen Würfeln und die Gewinnhöhe in einem Glücksspiel. Zufallsvariablen können aber auch … Erwartungswert Der Erwartungswert beschreibt für eine Zufallsvariable mit endlich vielen Funktionswerten das mit der Wahrscheinlichkeit des Auftretens gewichtete arithmetische … Quadratwurzel Hierbei handelt es sich um einen Algorithmus ähnlich dem gängigen Verfahren der schriftlichen Division. Intervallschachtelung: Dieses Verfahren ist recht … Wendepunkt In der Mathematik ist ein Wendepunkt ein Punkt auf einer Kurve, an dem diese ihr Krümmungsverhalten ändert. Sie wechselt hier entweder von einer Rechts- in … Streuungsmaß (Statistik) Die mittlere absolute Abweichung wird in der mathematischen Statistik meist zugunsten der quadratischen Abweichung umgangen, welche analytisch leichter zu … Moment (Stochastik) Im Spezialfall der Cauchy-Verteilung existiert also nicht einmal das erste Moment (der Erwartungswert), das ist auch bei der Lévy-Verteilung der Fall. Dispersionsmaß (Stochastik) Ein Dispersionsmaß, auch Streuungsmaß oder Streuungsparameter genannt, ist in der Stochastik eine Kennzahl der Verteilung einer Zufallsvariable … Stochastik Statistik · Daten, Stichprobe, Grundgesamtheit, Häufigkeit (absolute, relative), Merkmal, Merkmalsausprägung · Häufigkeitsverteilung, Stabdiagramm, Kreisdiagramm, …