Wikipedia · einfach zusammengefasst · Stand
Häufigkeitsverteilung
Eine Häufigkeitsverteilung ist in der mathematischen Statistik zunächst eine Funktion, die zu jedem vorkommenden wie auch zu jedem möglichen Wert angibt, …
Inhalt5 Abschnitte
Begriff und Bedeutung
Eine Häufigkeitsverteilung ist in der mathematischen Statistik eine Funktion, die jedem vorkommenden und jedem möglichen Wert eines Merkmals zuordnet, wie häufig dieser Wert vorgekommen ist. Ihre Definitionsmenge umfasst die möglichen Merkmalsausprägungen; ihre Wertemenge besteht aus absoluten oder relativen Häufigkeiten.
Häufigkeitsverteilungen dienen in der deskriptiven Statistik dazu, Daten wie Messwerte oder Umfrageergebnisse zusammenzufassen und anschaulich darzustellen. Wie andere Funktionen können sie als Tabelle, als Grafik oder modellhaft durch eine Funktionsgleichung beschrieben werden. Ein Beispiel ist die prognostizierte Altersverteilung für Deutschland im Jahr 2050.
In der deskriptiven Statistik entspricht die Häufigkeitsverteilung der Wahrscheinlichkeitsverteilung aus der Wahrscheinlichkeitstheorie und der schließenden Statistik. Mathematische Verteilungen wie die Normalverteilung können verwendet werden, um beobachtete Häufigkeitsverteilungen näherungsweise zu beschreiben und zu untersuchen.
Vom Rohdatensatz zu den Häufigkeiten
Am Anfang steht die Urliste, also die zunächst ungeordnete Menge der erhobenen Daten. Sie wird geordnet beziehungsweise sortiert und heißt danach Rangliste. Aus dieser lassen sich bereits wichtige statistische Größen ablesen: der Medianwert, die Spannweite als Maß der statistischen Streuung, Quantile und der Interquartilsabstand. Auch die Standardabweichung kann abgeschätzt werden.
Anschließend werden gleiche Merkmalswerte zusammengefasst. Die Anzahl, mit der ein bestimmter Wert vorkommt, heißt absolute Häufigkeit. Die relative Häufigkeit setzt diese Anzahl zur Gesamtzahl aller Werte ins Verhältnis. Ist der Probenumfang n und tritt ein Wert h-mal auf, entspricht seine relative Häufigkeit somit h/n. Das Ergebnis ist eine geordnete Menge von Wertepaaren aus jeweils einem Merkmalswert und seiner zugehörigen relativen Häufigkeit. Sie kann zugleich als Rangfolge betrachtet werden.
Kumulierte Häufigkeit und Darstellung
Werden die relativen Häufigkeiten der aufeinanderfolgenden Merkmalswerte addiert, entsteht die Verteilungssumme, auch kumulierte Häufigkeit genannt. Sie gibt für jeden Merkmalswert an, welcher Anteil der Beobachtungen kleiner oder gleich diesem Wert ist.
Bei vielen Häufigkeitsverteilungen beginnt die Verteilungssumme am Nullpunkt und steigt bis auf 1 beziehungsweise 100 Prozent. Ihre grafische Darstellung ist eine schwach monoton steigende Kurve: Mit zunehmendem Merkmalswert nimmt sie also niemals ab. Häufig besitzt sie eine gestreckte S-Form. Reale Verteilungssummen können näherungsweise durch Funktionsgleichungen beschrieben werden. Die Darstellung der Verteilungssumme in Abhängigkeit von den Merkmalswerten ist die einfachste Form, eine Häufigkeitsverteilung darzustellen.
Klassen, Dichte und andere Messgrößen
Für weitere Berechnungen werden die Merkmalswerte in Klassen eingeteilt. Dazu zerlegt man die vorkommenden Wertebereiche meistens in gleich breite Abschnitte. Seltene Werte an den Rändern, sogenannte Ausreißer, werden häufig in größeren Klassen zusammengefasst.
Aus der Klasseneinteilung ergeben sich Dichtefunktionen. Bei einer stetigen Verteilung ist die Dichtefunktion die Ableitung der empirischen Verteilungsfunktion nach dem Merkmalswert. Die empirische Verteilungsfunktion beschreibt dabei die aus den beobachteten Daten gewonnene kumulierte Häufigkeit.
Häufigkeit muss nicht ausschließlich durch Zählen bestimmt werden. Sie kann beispielsweise auch durch Wiegen gemessen werden. Dann entsteht statt einer Anzahlverteilung eine Massenverteilung. Grundsätzlich kann jede additive Größe, deren Einzelwerte sich sinnvoll addieren lassen, zur Messung der Häufigkeit verwendet werden.
Abweichungen und mehrgipfelige Verteilungen
Weicht die Häufigkeitsverteilung einer Zufallsstichprobe stark von der erwarteten Verteilung ab, kommen mehrere Ursachen infrage. Die Abweichung kann durch den Stichprobenzufall entstehen, aber auch durch unerkannte Einflüsse, Auswahleffekte oder einen Trend.
Eine Verteilung muss nicht nur ein Maximum besitzen. Besteht der Probenumfang aus einer Überlagerung mehrerer Teilmengen, etwa verschiedener Altersgruppen, Berufe oder anderer Gruppen, kann die Häufigkeitsverteilung zwei oder mehrere Gipfel aufweisen. Sie wird dann als zwei- beziehungsweise mehrgipfelig bezeichnet.