Zum Inhalt springen
L

Wikipedia · einfach zusammengefasst · Stand

Klasseneinteilung (Statistik)

Quartile. Das 1. Quartil liegt in der 2. Klasse, also: 200 < 1. Quartil ≤ 300. Das 2. Quartil = Median liegt in der 3. Klasse, also: 300 < 2. Quartil ≤ 400.

Inhalt5 Abschnitte
  1. 1. Grundidee der Klasseneinteilung
  2. 2. Klassengrenzen und Klassenbreite
  3. 3. Klassenmitte und Häufigkeitsdichte
  4. 4. Tabellarische und grafische Darstellung
  5. 5. Lageparameter aus klassierten Daten

Grundidee der Klasseneinteilung

Klasseneinteilung, Klassenbildung oder Klassierung bezeichnet die Einteilung von Merkmalswerten oder statistischen Reihen in getrennte Gruppen, Klassen oder Größenklassen. Jedes Element der untersuchten Gesamtheit wird abhängig von seinem Wert genau einer Klasse zugeordnet. Das ist besonders nützlich, wenn eine Zufallsvariable sehr viele verschiedene Werte besitzt, die Daten nur Näherungen der wahren Werte sind oder quasi-stetige Variablen mit Verfahren für diskrete Variablen untersucht werden sollen.

Bei kategorialen Merkmalen spricht man von Gruppen; Daten, die diesen Gruppen zugeordnet sind, heißen gruppierte Daten. Bei einer Klassierung stetiger Merkmale entstehen klassierte Daten. Klassen sind disjunkte, also nicht überlappende, aneinandergrenzende Intervalle von Merkmalswerten. Sie werden durch eine untere und eine obere Klassengrenze eindeutig festgelegt.

Die Klassierung verbessert die Übersicht und erleichtert die Verarbeitung. Ihr Nachteil ist Informationsverlust: Die einzelnen Beobachtungswerte gehen bei alleiniger Betrachtung der Klassen verloren. Für weitere Analysen stehen dann beispielsweise nur die Anzahl der Beobachtungen in einer Klasse oder die Klassenmitte zur Verfügung. Innerhalb einer Klasse sollten die Beobachtungen möglichst gleichverteilt sein; sie sollten sich also nicht nur in einem kleinen Teil des Intervalls häufen.

Klassengrenzen und Klassenbreite

Eine Klassengrenze ist ein Wert einer metrisch skalierten Zufallsvariablen, der eine Klasse nach unten oder oben begrenzt. Die Klasse j wird durch die untere Grenze xⱼᵘ und die obere Grenze xⱼᵒ bestimmt, wobei j = 1, …, k und k die Anzahl der Klassen bezeichnet. Die obere Grenze einer Klasse ist zugleich die untere Grenze der folgenden Klasse:

xⱼᵒ = xⱼ₊₁ᵘ für j = 1, …, k − 1.

Für die Zuordnung gemeinsamer Grenzwerte gibt es zwei Möglichkeiten. Entweder gehört die untere Grenze zur jeweiligen Klasse und die obere Grenze zur nächsten Klasse: xⱼᵘ ≤ x < xⱼᵒ. Oder die untere Grenze gehört zur vorherigen und die obere Grenze zur jeweiligen Klasse: xⱼᵘ < x ≤ xⱼᵒ. Dadurch wird jeder Beobachtungswert xᵢ mit i = 1, …, n genau einer Klasse zugeordnet.

Im Beispiel mit vier Klassen lautet die erste Variante: Klasse 1 < 100, Klasse 2 ≥ 100 bis < 120, Klasse 3 ≥ 120 bis < 150 und Klasse 4 ≥ 150. Die zweite Variante lautet: Klasse 1 ≤ 100, Klasse 2 > 100 bis ≤ 120, Klasse 3 > 120 bis ≤ 150 und Klasse 4 > 150. Für Klasse 2 bedeutet das entweder „mindestens 100 und unter 120“ oder „über 100 und höchstens 120“.

Die Klassenbreite ist die Differenz aus oberer und unterer Klassengrenze:

Δxⱼ = xⱼᵒ − xⱼᵘ für j = 1, …, k.

Im genannten Beispiel beträgt die Breite der Klasse 2 20 und die der Klasse 3 30. Für die nach oben oder unten offenen Klassen 1 und 4 ist die Klassenbreite unbestimmt. Klassen müssen nicht gleich breit sein. Welche Anzahl und Breite sinnvoll ist, hängt von den Daten und den Zielen der Untersuchung ab. Der Jenks-Caspall-Algorithmus ist ein Verfahren zur automatischen Klassierung.

Klassenmitte und Häufigkeitsdichte

Die Klassenmitte kann als repräsentativer Wert einer Klasse verwendet werden. Bei symmetrischer Verteilung der Elemente innerhalb einer Klasse wird sie als arithmetisches Mittel aus unterer und oberer Klassengrenze berechnet:

xⱼ = (xⱼᵘ + xⱼᵒ) / 2 für j = 1, …, k.

Im Beispiel beträgt die Klassenmitte der Klasse 2 110 und die der Klasse 3 135. Für die offenen Klassen 1 und 4 ist sie unbestimmt.

Bei unterschiedlich breiten Klassen reicht die absolute oder relative Klassenhäufigkeit allein nicht aus, um Klassen zu vergleichen. Die Häufigkeitsdichte setzt deshalb die Häufigkeit ins Verhältnis zur Klassenbreite. Sie entspricht der Säulenhöhe im Histogramm. Für die Klasse xⱼᵘ ≤ X < xⱼ gilt:

ĥ(xⱼ) = h(xⱼ) / (xⱼᵒ − xⱼᵘ),

wobei h(xⱼ) die absolute Häufigkeit der Klasse j ist. Mit der relativen Häufigkeit f(xⱼ) lautet die entsprechende Formel:

f̂(xⱼ) = f(xⱼ) / (xⱼᵒ − xⱼᵘ).

Als Beispiel nennt der Artikel das metrisch stetige Merkmal „Nettojahreseinkommen“. Da mit steigendem Einkommen die Zahl der Personen geringer wird, können die oberen Einkommensklassen breiter als die mittleren und unteren gewählt werden. Die Häufigkeitsdichte macht die unterschiedlich breiten Klassen miteinander vergleichbar.

Tabellarische und grafische Darstellung

Eine Häufigkeitstabelle stellt eine klassierte stetige Zufallsvariable systematisch dar. Sie enthält für jede Merkmalsklasse xⱼᵘ ≤ X < xⱼ die absolute Häufigkeit h(xⱼ) und die relative Häufigkeit f(xⱼ). In der Summenzeile steht bei den absoluten Häufigkeiten n, also die Anzahl der Untersuchungsobjekte, und bei den relativen Häufigkeiten 1.

Für mehrdimensionale Häufigkeitsverteilungen können Kreuztabellen verwendet werden. Zur grafischen Darstellung klassierter Variablen eignen sich Histogramme, Säulen- oder Stabdiagramme und Balkendiagramme. Bei sehr wenigen Klassen ist auch ein Tortendiagramm möglich.

Lageparameter aus klassierten Daten

Da bei einer Klassierung nur Intervalle und keine exakten Einzelwerte bekannt sind, lassen sich Lageparameter grundsätzlich nur als Intervalle bestimmen. Das Beispiel betrachtet die Zahl der PKW pro 1000 Einwohner in europäischen Ländern:

  • Klasse 1: über 0 bis 200, 5 Länder, Häufigkeitsdichte 0,025.
  • Klasse 2: über 200 bis 300, 6 Länder, Häufigkeitsdichte 0,06.
  • Klasse 3: über 300 bis 400, 6 Länder, Häufigkeitsdichte 0,06.
  • Klasse 4: über 400 bis 500, 9 Länder, Häufigkeitsdichte 0,09.
  • Klasse 5: über 500 bis 700, 6 Länder, Häufigkeitsdichte 0,03.

Für das arithmetische Mittel ergeben sich die Grenzen

(5·0 + 6·200 + 6·300 + 9·400 + 6·500) / 32 = 300

und

(5·200 + 6·300 + 6·400 + 9·500 + 6·700) / 32 = 434,375.

Damit gilt: 300 < arithmetisches Mittel ≤ 434,375.

Die Quartile liegen in bestimmten Klassen: Das 1. Quartil liegt in Klasse 2, also 200 < 1. Quartil ≤ 300. Das 2. Quartil beziehungsweise der Median liegt in Klasse 3, also 300 < 2. Quartil ≤ 400. Das 3. Quartil liegt in Klasse 4, also 400 < 3. Quartil ≤ 500. Der genaue Modus kann wegen der unbekannten Verteilung innerhalb der Klassen nicht ermittelt werden; es gilt nur 0 < Modus ≤ 700. Die Modalklasse, also die Klasse mit der höchsten Häufigkeitsdichte, ist Klasse 4 mit der Häufigkeitsdichte 0,09.

Nimmt man zusätzlich an, dass die Werte innerhalb jeder Klasse gleichverteilt und symmetrisch zur Klassenmitte liegen, kann eine eindeutige Urliste konstruiert werden. Sie enthält die Werte 20; 60; 100; 140; 180 in Klasse 1, 208,33; 225; 241,67; 258,33; 275; 291,67 in Klasse 2, 308,33; 325; 341,67; 358,33; 375; 391,67 in Klasse 3, 405,56; 416,67; 427,78; 438,89; 450; 461,11; 472,22; 483,33; 494,44 in Klasse 4 sowie 516,67; 550; 583,33; 616,67; 650; 683,33 in Klasse 5.

Aus dieser Urliste folgen das arithmetische Mittel 367,1875, das 1. Quartil 250, der Median 383,33 und das 3. Quartil 477,78. Da jeder Wert genau einmal vorkommt, ist jeder Wert ein Modus. Unter diesen Zusatzannahmen können außerdem Streuungsparameter berechnet werden.

Weiterlesen

Grundgesamtheit Die Grundgesamtheit bezeichnet diejenige Menge aller Objekte, über die eine Aussage getroffen werden soll. Grundgesamtheiten werden häufig nur unvollständig … Zufallsvariable Beispiele für reelle Zufallsvariablen sind die Augensumme von zwei geworfenen Würfeln und die Gewinnhöhe in einem Glücksspiel. Zufallsvariablen können aber auch … Realisierung (Stochastik) Als Realisierung bezeichnet man dort einen konkreten Wert, den eine Zufallsvariable annimmt, vergleichbar einem Wert einer Funktion für ein gegebenes Argument. Histogramm Die Höhe jedes Rechtecks stellt dann die (relative oder absolute) Häufigkeitsdichte dar, also die (relative oder absolute) Häufigkeit dividiert durch die Breite … Absolute Häufigkeit Die absolute Häufigkeit ist das Ergebnis einer einfachen Zählung von Objekten oder Ereignissen (besser Elementarereignissen). Sie gibt an, wie viele Elemente … Relative Häufigkeit Sie wird berechnet, indem die absolute Häufigkeit eines Merkmals in einer zugrundeliegenden Menge durch die Anzahl der Objekte in dieser Menge geteilt wird. Die … Säulendiagramm Das Säulendiagramm, bei schmalen Säulen auch Stabdiagramm genannt, ist ein Diagramm zur vergleichenden Darstellung, das durch auf der x {\displaystyle x} … Urliste Die Urliste, auch Beobachtungsreihe genannt, ist im Bereich der Statistik das direkte Ergebnis einer Datenerhebung, also die ursprüngliche Aufzeichnung der … Partition (Mengenlehre) Anders gesagt: Eine Partition einer Menge ist eine Zerlegung dieser Menge in nichtleere paarweise disjunkte Teilmengen. Insbesondere ist jede Partition einer …