Wikipedia · einfach zusammengefasst · Stand
Streuungsmaß (Statistik)
Die mittlere absolute Abweichung wird in der mathematischen Statistik meist zugunsten der quadratischen Abweichung umgangen, welche analytisch leichter zu …
Inhalt6 Abschnitte
Grundidee und Anforderungen
Streuungsmaße, auch Dispersionsmaße oder Streuungsparameter genannt, beschreiben, wie stark Beobachtungswerte oder eine Häufigkeitsverteilung um einen geeigneten Lageparameter streuen. Sie ergänzen damit Lageparameter wie den arithmetischen Mittelwert oder den Median. Die verschiedenen Streuungsmaße unterscheiden sich besonders darin, wie empfindlich sie auf Ausreißer reagieren.
Für Beobachtungswerte (x₁,…,xₙ) ist ein Streuungsmaß s eine Funktion, die im Allgemeinen folgende Eigenschaften besitzt:
- s(x₁,…,xₙ) ist nichtnegativ und gleich 0, wenn alle Beobachtungen gleich sind. Bei vielfältigeren Daten soll es zunehmen.
- Das Maß soll umso größer sein, je stärker die Beobachtungswerte voneinander abweichen. Häufig wird zusätzlich gefordert, dass es sich durch das Ersetzen eines Beobachtungswertes durch einen neuen Merkmalswert nicht verkleinert.
- Es ist translationsinvariant: Eine Verschiebung des Nullpunkts ändert das Maß nicht. Es gilt s(x₁+a,…,xₙ+a)=s(x₁,…,xₙ) für alle a∈ℝ.
- Wünschenswert ist außerdem die Äquivarianz gegenüber Maßstabsänderungen.
Die einfache Summe der Abweichungen vom empirischen Mittelwert ist kein geeignetes Streuungsmaß: Σᵢ(xᵢ−x̄)=0, weil sich positive und negative Abweichungen aufgrund der Schwerpunkteigenschaft aufheben. Deshalb summiert man meist Absolutbeträge oder Quadrate der Abweichungen.
Streuung um das arithmetische Mittel
Für die Beobachtungswerte x₁,…,xₙ bezeichnet x̄=1/n·Σᵢ₌₁ⁿxᵢ den arithmetischen Mittelwert.
Die Summe der Abweichungsquadrate (SQ) ist definiert als SQ:=Σᵢ₌₁ⁿ(xᵢ−x̄)².
Die empirische Varianz ist ein wichtiges Streuungsmaß: s²=1/n·Σᵢ₌₁ⁿ(xᵢ−x̄)².
Äquivalente Darstellungen lauten: s²=1/n·Σᵢ₌₁ⁿxᵢ²−x̄² und s²=1/(2n²)·Σᵢ₌₁ⁿΣⱼ₌₁ⁿ(xᵢ−xⱼ)².
Die empirische Standardabweichung ist die Wurzel aus der Varianz: s=√(1/n·Σᵢ₌₁ⁿ(xᵢ−x̄)²). Im Unterschied zur Varianz hat sie dieselbe Dimension und dieselben Einheiten wie die Beobachtungswerte.
Die mittlere absolute Abweichung vom arithmetischen Mittelwert ist e=1/n·Σᵢ₌₁ⁿ|xᵢ−x̄|. Sie wird in der mathematischen Statistik häufig zugunsten der quadratischen Abweichung weniger verwendet, weil die Betragsfunktion nicht überall differenzierbar ist und dadurch die Bestimmung eines Minimums erschwert wird. Aufgrund der Ungleichung vom arithmetisch-quadratischen Mittel gilt e≤s; Gleichheit tritt nur bei konstanten Zufallsgrößen auf.
Streuung um den Median und weitere Maße
Der Quantilsabstand vergleicht das p-Quantil mit dem (1−p)-Quantil: QAₚ=Q₁₋ₚ−Qₚ mit 0≤p<0,5. Innerhalb dieses Abstands liegen ungefähr 100·(1−2p) Prozent der Beobachtungswerte.
Der Interquartilsabstand (IQR) ist die Differenz des 0,75- und des 0,25-Quantils: IQR=Q₀,₇₅−Q₀,₂₅. Er umfasst 50 % aller Messwerte, ist wie der Median beziehungsweise Q₀,₅ unempfindlich gegenüber Ausreißern und hat den Bruchpunkt ε*=0,25. Der IQR ist gleich dem Quantilsabstand QA₀,₂₅.
Für einen eindeutigen Median x̃ ist die mittlere absolute Abweichung vom Median definiert als MD=1/n·Σᵢ₌₁ⁿ|xᵢ−x̃|. Wegen der Extremaleigenschaft des Medians gilt MD≤e; sie ist also ebenfalls höchstens so groß wie die mittlere absolute Abweichung vom arithmetischen Mittelwert und damit erst recht kleiner als die Standardabweichung.
Die mittlere absolute Abweichung beziehungsweise MAD (median absolute deviation, auch MedMed) ist der Median der absoluten Abweichungen vom Median: MAD=median{|xᵢ−x̃| | i=1,…,n}. Sie ist ein robuster Schätzer für die Standardabweichung und besitzt den Bruchpunkt ε*=0,5.
Weitere Streuungsmaße sind die Spannweite R=xmax−xmin, die nur den größten und den kleinsten Wert verwendet und daher nicht robust gegenüber Ausreißern ist. Ginis mittlere Differenz lautet Δ=1/n²·Σᵢ₌₁ⁿΣⱼ₌₁ⁿ|xᵢ−xⱼ|. Die mittlere absolute Differenz ist Δ̄=1/[n(n−1)]·Σᵢ₌₁ⁿΣⱼ₌₁ⁿ|xᵢ−xⱼ|=2/[n(n−1)]·Σᵢ₌₁ⁿ⁻¹Σⱼ₌ᵢ₊₁ⁿ|xᵢ−xⱼ|. Die geometrische Standardabweichung ist ein Streuungsmaß um das geometrische Mittel.
Relative Streuungsmaße
Relative Streuungsmaße, auch relative Streumaße oder Dispersionskoeffizienten genannt, sind typischerweise Quotienten aus einem Streuungsmaß und einem Lagemaß. Sie sind dadurch häufig dimensionslos und eignen sich zum Vergleich von Streuungen mit unterschiedlichen Einheiten oder Größenordnungen.
Die relative Spannweite ist der Quotient aus Spannweite und Bereichsmitte: vR=R/[(xmin+xmax)/2].
Der empirische Variationskoeffizient ist der Quotient aus empirischer Standardabweichung s und arithmetischem Mittelwert x̄: v=s/x̄, x̄>0. Er ist dimensionslos und daher nicht einheitenbehaftet.
Der Gini-Koeffizient G steht mit Ginis mittlerer Differenz Δ und dem arithmetischen Mittelwert x̄ in folgendem Zusammenhang: G=Δ/(2x̄). Er ist somit ebenfalls ein relatives Streuungsmaß.
Die relative durchschnittliche Abweichung vom Median ist vd=MD/x̃, also der Quotient aus der durchschnittlichen Abweichung vom Median und dem Median. Der relative Quartilsabstand ist vq=IQR/x̃, also der Quotient aus Interquartilsabstand und Median.
Stichprobenvarianz und korrigierte Maße
In der schließenden beziehungsweise induktiven Statistik sind x₁,…,xₙ Stichprobenwerte und Realisierungen von Stichprobenvariablen X₁,…,Xₙ. Häufig wird angenommen, dass diese stochastisch unabhängig und identisch verteilt sind. Dann können viele deskriptive Streuungsmaße als Schätzwerte für entsprechende Streuungsmaße der Grundgesamtheit verwendet werden. Nach dem Satz von Glivenko und Cantelli nähert sich die Häufigkeitsverteilung der Stichprobenwerte bei wachsendem Stichprobenumfang in einem sehr weitgehenden Sinn der Verteilung der Grundgesamtheit an.
Die aus einer Stichprobe berechnete Varianz s² heißt Stichprobenvarianz oder empirische Varianz. Die zugehörige Stichprobenfunktion lautet S²=1/n·Σᵢ₌₁ⁿ(Xᵢ−X̄)². Sie ist eine Schätzfunktion für die Grundgesamtheitsvarianz σ². Bei unabhängigen und identisch verteilten Stichprobenvariablen gilt Var[Xᵢ]=σ².
Soll σ² geschätzt werden, verwendet man häufig die korrigierte Stichprobenvarianz sₖ²=1/(n−1)·Σᵢ₌₁ⁿ(xᵢ−x̄)². Ihre Stichprobenfunktion Sₖ² ist unter den genannten Voraussetzungen erwartungstreu: E[Sₖ²]=σ². Für S² gilt dagegen E[S²]=(n−1)/n·σ²=σ²−σ²/n; sie ist verzerrt mit E[S²]−σ²=−σ²/n. Die Erwartungstreue der Korrektur hängt entscheidend von der stochastischen Unabhängigkeit ab und ist bei allgemeineren Stichprobenplänen nicht automatisch erfüllt. In der rein beschreibenden Statistik gibt es keine Begründung, sₖ² statt s² zu verwenden.
Die korrigierte Stichprobenstandardabweichung lautet sₖ=√(1/(n−1)·Σᵢ₌₁ⁿ(xᵢ−x̄)²). Sie wird als Schätzwert für die Grundgesamtheitsstandardabweichung σ verwendet, ist aber im Allgemeinen nicht erwartungstreu für σ. Bei normalverteilten Grundgesamtheiten ist durch eine modifizierte Schätzfunktion eine erwartungstreue Schätzung möglich.
In vielen Anwendungsbereichen wird die korrigierte Stichprobenvarianz als Stichprobenvarianz, empirische Streuung oder empirische Varianz bezeichnet und mit s² notiert. In Darstellungen der induktiven Statistik steht häufig S² für die korrigierte Stichprobenvarianz und S für die korrigierte Stichprobenstandardabweichung.
Wahrscheinlichkeitstheorie und grafische Darstellung
In der Wahrscheinlichkeitstheorie charakterisieren Streuungsmaßzahlen Eigenschaften einer Wahrscheinlichkeitsverteilung. Sie sind teilweise analog zu den Streuungsmaßzahlen der deskriptiven Statistik konstruiert. In der mathematischen Statistik werden Verfahren zur Charakterisierung von Wahrscheinlichkeitsverteilungen durch beschreibende Kennzahlen der deskriptiven Statistik zugerechnet.
Zur grafischen Darstellung von Streuung dienen insbesondere Box-Whisker-Plots, Streuungsfächerkarten und Streudiagramme.