Zum Inhalt springen
L

Wikipedia · einfach zusammengefasst · Stand

Median

In der Statistik ist der Median (Plural Mediane) – auch Zentralwert genannt – ein Mittelwert und Lageparameter. Der Median der Messwerte einer Urliste ist …

Inhalt6 Abschnitte
  1. 1. Definition und Bestimmung
  2. 2. Median einer Stichprobe
  3. 3. Robustheit und Vergleich mit anderen Lagemaßen
  4. 4. Anwendungsbereiche und Beispiele
  5. 5. Algorithmen und gruppierte Daten
  6. 6. Beispiel für gruppierte Einkommen und Alternativen

Definition und Bestimmung

Der Median, auch Zentralwert genannt, ist in der Statistik ein Mittelwert und Lageparameter. Er bezeichnet den Wert, der in einer der Größe nach geordneten Liste genau in der Mitte liegt. Allgemein teilt er einen Datensatz, eine Stichprobe oder eine Verteilung in zwei gleich große Teile: In der einen Hälfte sind die Werte nicht größer als der Median, in der anderen nicht kleiner. Der Median ist außerdem das 1/2-Quantil.

Zur Bestimmung werden alle Werte aufsteigend geordnet. Bei einer ungeraden Anzahl von Werten ist der mittlere Wert der Median. Bei einer geraden Anzahl gibt es zwei mittlere Werte. Meist wird dann ihr arithmetisches Mittel als Median verwendet; die beiden Werte heißen Untermedian und Obermedian.

Beispiel: Die ungeordnete Urliste 4, 1, 37, 2, 1 wird zu 1, 1, 2, 4, 37 geordnet. Der Median ist 2.

Median einer Stichprobe

Ein Wert m ist Median einer Stichprobe, wenn mindestens die Hälfte der Stichprobenelemente nicht größer als m und mindestens die Hälfte nicht kleiner als m ist. Bei einer ungeraden Anzahl von Beobachtungen gibt es ein einzelnes mittleres Element. Bei einer geraden Anzahl können dagegen alle Werte zwischen den beiden mittleren Beobachtungswerten diese Bedingung erfüllen. Bei kardinal skalierten Messgrößen, bei denen Differenzen sinnvoll berechnet werden können, verwendet man meist das arithmetische Mittel der beiden mittleren Werte.

Für eine geordnete Stichprobe (x₁, x₂, …, xₙ) lautet die übliche Definition:

x̃ = xₘ₊₁ für ungerades n = 2m + 1

x̃ = 1/2 (xₘ + xₘ₊₁) für gerades n = 2m.

Diese Definition hat den Vorteil, dass bei Stichproben aus symmetrischen Verteilungen das arithmetische Mittel und der Median im Erwartungswert identisch sind.

Wenn der Median selbst ein Element der Stichprobe sein soll, wird bei n = 2m entweder der Untermedian x̃ᵤ = xₘ oder der Obermedian x̃ₒ = xₘ₊₁ gewählt. Bei n = 2m + 1 gilt für beide Varianten x̃ = x̃ᵤ = x̃ₒ = xₘ₊₁. Mit Gauß-Klammern lassen sich die Indizes so schreiben: x̃ᵤ = x_{⌊(n+1)/2⌋} und x̃ₒ = x_{⌈(n+1)/2⌉}. Diese Bestimmung ist beispielsweise bei Datenbanksystemen und SELECT-Abfragen mittels des Medians der Mediane wichtig.

Robustheit und Vergleich mit anderen Lagemaßen

Eine wichtige Eigenschaft des Medians ist seine Robustheit gegenüber Ausreißern, also gegenüber extrem abweichenden Werten. Bei sieben Messwerten 4, 1, 15, 2, 4, 5, 4 ergibt die Sortierung 1, 2, 4, 4, 4, 5, 15 und damit den Median 4. Wird durch einen Fehler eine 4 durch 46 ersetzt, lautet die sortierte Liste 1, 2, 4, 4, 5, 15, 46; der Median bleibt 4. Das arithmetische Mittel steigt dagegen von 5 auf 11.

Der Median kann auch für ordinal skalierte Variablen verwendet werden. Bei solchen Variablen gibt es eine natürliche Rangfolge, aber keinen sinnvoll messbaren quantitativen Abstand. Das arithmetische Mittel ist dort nicht geeignet. Für intervall- und verhältnisskalierte Daten können sowohl Median als auch arithmetisches Mittel verwendet werden, wobei sie unterschiedliche Vorteile und Nachteile haben.

Der Median minimiert die Summe der absoluten Abweichungen. Für alle Werte x gilt:

Σᵢ₌₁ⁿ |x̃ − xᵢ| ≤ Σᵢ₌₁ⁿ |x − xᵢ|.

Bei einer geraden Anzahl von Messwerten gilt diese Eigenschaft für alle Werte zwischen Unter- und Obermedian. Deshalb bildet der Median die Grundlage der Methode der kleinsten absoluten Abweichungen und robuster Regressionsverfahren. Das arithmetische Mittel minimiert dagegen die Summe der Abweichungsquadrate und ist Grundlage der Methode der kleinsten Quadrate und der Regressionsanalyse. Es ist mathematisch leichter zu handhaben, aber nicht robust gegenüber Ausreißern.

Der Median ist für nominal skalierte Variablen ohne natürliche Rangfolge, etwa das Geburtsland, nicht anwendbar. Dort kann als einziges Lagemaß der Modalwert bestimmt werden.

Anwendungsbereiche und Beispiele

Der Median wird in drei Bedeutungen verwendet: als Lagemaß der deskriptiven Statistik zur Beschreibung einer konkreten Liste von Stichprobenwerten, als Median einer Wahrscheinlichkeitsverteilung oder Zufallsvariablen sowie in der mathematischen Statistik als Median einer Zufallsstichprobe zur robusten Schätzung unbekannter Verteilungen.

Auch Notenstufen können mit dem Median beschrieben werden, obwohl ihre Abstände nicht quantitativ festgelegt sind. Beim angegebenen Notenspiegel ist der Median 3−. Etwas weniger als die Hälfte der Ergebnisse ist schlechter; durch die Einbeziehung der Notenstufe 3− wird die Hälfte gerade überschritten.

Ein Vergleich mit dem arithmetischen Mittel zeigt sich bei zehn Personen mit unterschiedlichen Monatseinkommen. Eine Person erhält 1.000.000 €, die übrigen neun erhalten 1.000 €, 2.000 €, 3.000 € bis 9.000 €. Das arithmetische Mittel beträgt 104.500 €. Nur eine Person verdient mehr als diesen Betrag, während die neun anderen deutlich weniger verdienen. Der Median beträgt dagegen 5.500 €: Fünf Personen verdienen mehr und fünf weniger.

Bei nominal skalierten Daten ist der Median nicht verwendbar; bei ordinalen Daten wie Notenstufen ist er dagegen möglich. Bei metrischen Daten kann er eine robuste Alternative zum arithmetischen Mittel sein.

Algorithmen und gruppierte Daten

Für die Berechnung muss die gesamte Datenmenge nicht vollständig sortiert werden. Auswahlalgorithmen suchen die benötigten mittleren Werte direkt in der Menge. Für den Mittelwert von Unter- und Obermedian müssen zwei Werte ausgewählt werden. Effiziente Verfahren wie Introselect erreichen eine lineare Worst-Case-Rechenzeit O(n). Eine vollständige Sortierung benötigt im Allgemeinen die höhere Rechenzeit Ω(n log n); nur bei speziellen Klassen von Eingabedaten ist auch eine Rechenzeit O(n) möglich. Zur Abschätzung gehört beispielsweise die Cornish-Fisher-Methode.

Bei gruppierten Daten liegen die einzelnen Messwerte oft nicht exakt vor, sondern nur in Intervallen. Das kommt besonders in den Sozialwissenschaften vor, etwa wenn bei einer Umfrage nur Einkommensklassen und nicht die exakten Einkommen erfasst werden. Sind nur die Häufigkeiten der Klassen bekannt, lässt sich der Median im Allgemeinen nur näherungsweise bestimmen.

Für die Gesamtzahl n, die Gruppengrößen nᵢ sowie die unteren und oberen Intervallgrenzen uᵢ und oᵢ wird zunächst die mediane Klasse bestimmt. Die m-te Klasse ist diejenige, für die gilt: Σₖ₌₁ᵐ⁻¹ nₖ < n/2, aber Σₖ₌₁ᵐ nₖ ≥ n/2. Unter der Annahme einer Gleichverteilung innerhalb dieser Klasse wird der Median durch lineare Interpolation geschätzt:

x_med = uₘ + [(n/2 − Σₖ₌₁ᵐ⁻¹ nₖ) / nₘ] · (oₘ − uₘ).

Ohne weitere Angaben kann jedoch jede andere Verteilung innerhalb des Intervalls vorliegen. Daher kann auch jeder Wert in der medianen Klasse der tatsächliche Median sein. Der geschätzte Wert muss außerdem kein Element der tatsächlichen Datenmenge sein. Eine grafische Bestimmung ist mit einer Summenkurve möglich: Gesucht wird der Abszissenwert x_med, der zum Ordinatenwert n/2 gehört. Bei kleinerem und geradem n kann auch n/2 + 1 verwendet werden. Eine Bevölkerungspyramide für Tansania aus dem Jahr 2016 veranschaulicht beispielsweise einen geschätzten Median von 18 Jahren.

Beispiel für gruppierte Einkommen und Alternativen

Bei gruppierten Einkommen gelten folgende Klassen: 0 bis unter 1500 mit 160 Personen, 1500 bis unter 2500 mit 320 Personen und 2500 bis unter 3500 mit 212 Personen. Insgesamt gibt es 692 Personen, also ist n/2 = 346. Da die erste Klasse nur 160 Personen umfasst, liegt der Median in der zweiten Klasse. Die Interpolation ergibt:

x_med = 1500 + [(346 − 160) / 320] · (2500 − 1500) = 2081,25.

Da die tatsächliche Verteilung innerhalb der zweiten Klasse unbekannt ist, kann der Wert 2081,25 bis zu 581,25 zu groß oder bis zu 418,75 zu klein sein. Der Schätzfehler kann somit bis zu 28 % betragen.

Eine Alternative zum Median bei der Ermittlung des Masseneinkommens ist die Wohlfahrtsfunktion. Um extreme Werte zu berücksichtigen, kann auch ein getrimmtes Mittel verwendet werden. Dabei werden vor der Berechnung die kleinsten und größten Werte entfernt; typisch ist das Weglassen von 5 % der Werte.

Nach Butler gibt es außerdem eine strengere, weniger gebräuchliche Definition: Die Zahl der kleineren Werte soll gleich der Zahl der größeren Werte sein. Für Sonderfälle wie 3, 3, 3, 3, 4 oder 1, 2, 3, 3, 3 gibt es ein Verfahren, mit dem trotz dieser strengeren Definition ein eindeutiger Median bestimmt werden kann.

Lernvideos zu Median

Weiterlesen

Median (Stochastik) Der Median, auch Zentralwert genannt, ist in der Stochastik ein Lagemaß für Wahrscheinlichkeitsverteilungen und Verteilungen von Zufallsvariablen. Mittelwert Ein Mittelwert (kurz auch nur Mittel; anderes Wort Durchschnitt) ist eine Zahl, die aus gegebenen Zahlen nach einer bestimmten Rechenvorschrift ermittelt … Lageparameter (deskriptive Statistik) Als Lageparameter oder Lagemaße bezeichnet man in der deskriptiven Statistik gewisse Kennzahlen beobachter Werte (Daten), die eine zentrale Tendenz des … Urliste Die Urliste, auch Beobachtungsreihe genannt, ist im Bereich der Statistik das direkte Ergebnis einer Datenerhebung, also die ursprüngliche Aufzeichnung der … Arithmetisches Mittel Er wird berechnet, indem die Summe der betrachteten Zahlen durch ihre Anzahl geteilt wird. Wie andere Mittelwerte beschreibt er das Zentrum einer Verteilung … Ausreißer Die blaue Gerade wurde ohne Einbeziehung des Ausreißers erstellt, die violette mit der Einbeziehung. Der Boxplot auf einem Zahlenstrahl dargestellt. Erwartungswert Der Erwartungswert beschreibt für eine Zufallsvariable mit endlich vielen Funktionswerten das mit der Wahrscheinlichkeit des Auftretens gewichtete arithmetische … Quantil (Wahrscheinlichkeitstheorie) Ein Quantil () ist ein Lagemaß in der Statistik für Wahrscheinlichkeitsverteilungen oder gleichwertig für Zufallsvariablen. Auch die empirische Schätzung … Modus (Statistik) Häufigkeit, Rel. Häufigkeit, Häufigkeitsdichte. 0–20, 5, 57, 0,208, 0,010. 20–30, 4, 93, 0,339, 0,034. 30–37, 3, 92, 0,336, 0,048. 37–46, 2, 29, 0,106, 0,012. Geometrie Dieser Artikel behandelt das Teilgebiet der Mathematik. Zum Werk von René Descartes siehe La Géométrie. Einerseits versteht man unter Geometrie die zwei- und … Wahrscheinlichkeitstheorie Bedingte Wahrscheinlichkeit. Bearbeiten. Unter einer bedingten Wahrscheinlichkeit versteht man die Wahrscheinlichkeit für das Eintreten eines Ereignisses A … Deskriptive Statistik Tabellen: In Tabellen werden Daten in einer Matrix mit Zeilen und Spalten dargestellt, wenn die Datenstruktur dies erlaubt. Dabei entspricht üblicherweise …