Zum Inhalt springen
L

Wikipedia · einfach zusammengefasst · Stand

Empirische Verteilungsfunktion

Eine empirische Verteilungsfunktion – auch Summenhäufigkeitsfunktion, (empirische) Verteilungsfunktion der Stichprobe oder Stichprobenverteilungsfunktion …

Inhalt6 Abschnitte
  1. 1. Grunddefinition und Bedeutung
  2. 2. Darstellungen für unklassierte Daten
  3. 3. Klassierte Daten
  4. 4. Empirische Verteilung und zufällige Funktion
  5. 5. Schätzung und statistische Eigenschaften
  6. 6. Beispiele und grafische Darstellung

Grunddefinition und Bedeutung

Die empirische Verteilungsfunktion beschreibt in der deskriptiven Statistik und der Stochastik, welcher Anteil der beobachteten Stichprobenwerte höchstens so groß ist wie eine reelle Zahl x. Für Beobachtungswerte x₁,…,xₙ ist sie definiert durch

Fₙ(x) := Anzahl der Beobachtungswerte ≤ x / n = (1/n) Σᵢ₌₁ⁿ 1₍₋∞,x₎(xᵢ), x ∈ ℝ.

Dabei ist 1_A die Indikatorfunktion der Menge A: Sie hat den Wert 1, falls ihr Argument in A liegt, und den Wert 0 andernfalls. Fₙ(x) ist somit die relative Häufigkeit der Werte, die kleiner oder gleich x sind. Sie beginnt links vom kleinsten Beobachtungswert bei 0 und erreicht rechts vom größten Beobachtungswert den Wert 1.

Die empirische Verteilungsfunktion ist eine monoton wachsende, rechtsstetige Treppenfunktion. Sie ist damit eine anschauliche Zusammenfassung einer Stichprobe: An jeder Stelle lässt sich unmittelbar ablesen, wie groß der kumulierte relative Anteil der Beobachtungen bis zu dieser Stelle ist.

Darstellungen für unklassierte Daten

Ordnet man die Beobachtungswerte aufsteigend als geordnete Stichprobe x₁:ₙ ≤ x₂:ₙ ≤ … ≤ xₙ:ₙ, dann ist Fₙ(x) links vom kleinsten Wert 0, zwischen den geordneten Werten gleich dem bis dahin erreichten kumulierten Anteil und rechts vom größten Wert 1.

Verwendet man nur die verschiedenen Merkmalswerte a₁ < … < aₖ und ihre relativen Häufigkeiten h₁,…,hₖ, gilt:

Fₙ(x) = 0 für x < a₁, Fₙ(x) = Σⱼ₌₁ⁱ hⱼ für aᵢ ≤ x < aᵢ₊₁, i ∈ {1,…,k−1}, Fₙ(x) = 1 für aₖ ≤ x.

An der Stelle aⱼ springt die Funktion um die Höhe hⱼ. Bei mehrfach auftretenden Werten entspricht die Sprunghöhe daher ihrer relativen Häufigkeit.

Eine weitere Schreibweise ist

Fₙ(x) = (1/n) Σᵢ₌₁ⁿ 1₍₋∞,x₎(xᵢ) = (1/n) Σᵢ₌₁ⁿ 1₍[xᵢ,∞)₎(x).

Die erste Form stellt Fₙ(x) als arithmetisches Mittel transformierter Beobachtungen dar; die zweite zeigt Fₙ als arithmetisches Mittel der empirischen Verteilungsfunktionen der einzelnen Werte xᵢ. Die zugehörige diskrete Wahrscheinlichkeitsfunktion kann mit dem Dirac-Maß geschrieben werden: fₙ(x) = (1/n) Σᵢ₌₁ⁿ δₓᵢ(x). In bestimmten Anwendungsbereichen wird außerdem die Dirac-Delta-Distribution verwendet und Fₙ als Integral dargestellt: Fₙ(x) = ∫₋∞ˣ (1/n) Σᵢ₌₁ⁿ δ(xᵢ−y) dy.

Klassierte Daten

Liegen die Daten nicht einzeln, sondern nur in J Klassen vor, verwendet man Klassenuntergrenzen xⱼᵘ, Klassenobergrenzen xⱼᵒ und relative Klassenhäufigkeiten hⱼ für j = 1,…,J. Die empirische Verteilungsfunktion wird dann definiert durch

Fₙ(x) = 0 für x < x₁ᵘ, Fₙ(x) = Σⱼ₌₁ⁱ⁻¹ hⱼ + ((x−xᵢᵘ)/(xᵢᵒ−xᵢᵘ)) hᵢ für xᵢᵘ ≤ x < xᵢᵒ, i ∈ {1,…,J}, Fₙ(x) = 1 für xⱼᵒ ≤ x.

An den Klassenunter- und -obergrenzen stimmt diese Funktion mit der unklassierten Definition überein. Innerhalb einer Klasse wird jedoch linear interpoliert. Dabei wird angenommen, dass die Beobachtungen innerhalb der Klasse gleichmäßig verteilt sind. Die Funktion ist deshalb stetig, aber nur zwischen den Klassengrenzen differenzierbar. Ihr Anstieg entspricht der Höhe der jeweiligen Säule des zugrunde liegenden Histogramms.

Die Klassengrenzen sollten möglichst so gewählt werden, dass Beobachtungswerte zwischen den Grenzen und nicht direkt auf ihnen liegen. Je nach Wahl der Grenzen können für denselben Datenbestand leicht verschiedene Summenhäufigkeitspolygone entstehen.

Empirische Verteilung und zufällige Funktion

Zur Stichprobe x₁,…,xₙ gehört die empirische Verteilung Pₙ. Für eine Menge B ⊆ ℝ ist sie definiert durch

Pₙ(B) = (1/n) Σᵢ₌₁ⁿ 1_B(xᵢ).

Die empirische Verteilungsfunktion ist ihre Verteilungsfunktion:

Fₙ(x) = Pₙ((−∞,x]) für x ∈ ℝ.

Sind alle n Beobachtungswerte verschieden, weist Pₙ jedem Beobachtungspunkt die Wahrscheinlichkeit 1/n zu. Treten Werte mehrfach auf, erhält der entsprechende Punkt seine relative Häufigkeit. Die relativen Häufigkeiten addieren sich zu 1. Formal besitzt Pₙ die Eigenschaften einer Wahrscheinlichkeitsverteilung; in der deskriptiven Statistik kann sie jedoch einfach als relative Häufigkeitsverteilung ohne stochastische Interpretation aufgefasst werden.

Werden die Beobachtungen als Realisierungen von Zufallsvariablen X₁,…,Xₙ aufgefasst, lautet die zufällige empirische Verteilungsfunktion

F̃ₙ(x) = (1/n) Σᵢ₌₁ⁿ 1₍₋∞,x₎(Xᵢ).

Sie ist eine zufällige Funktion beziehungsweise ein stochastischer Prozess. Die beobachtete empirische Verteilungsfunktion Fₙ ist ein realisierter Pfad dieses Prozesses. Entsprechend kann die zufällige empirische Verteilung durch P̃ₙ(B) = (1/n) Σᵢ₌₁ⁿ 1_B(Xᵢ) beschrieben werden, wobei F̃ₙ(x) = P̃ₙ((−∞,x]) gilt.

Schätzung und statistische Eigenschaften

Im inferenzstatistischen Zusammenhang gelten X₁,…,Xₙ als stochastisch unabhängige und identisch verteilte Zufallsvariablen mit derselben unbekannten Verteilungsfunktion F. Dann ist Fₙ eine konkrete Schätzung von F, während F̃ₙ ein Schätzer für F ist. In theoretischen Arbeiten wird die zufällige empirische Verteilungsfunktion häufig ebenfalls mit Fₙ bezeichnet. Die Schreibweise 1₍₋∞,x₎(Xᵢ) wird oft durch 1_{{Xᵢ≤x}} ersetzt.

Für festen Stichprobenumfang n gilt an jeder Stelle x:

• 1₍₋∞,x₎(Xᵢ) ist Bernoulli-verteilt mit Parameter F(x). • nF̃ₙ(x) ∼ Bin(n,F(x)). • E[F̃ₙ(x)] = F(x); der Schätzer ist erwartungstreu. • Var[F̃ₙ(x)] = F(x)(1−F(x))/n. • Für Gₙ(x) = √n(F̃ₙ(x)−F(x)) gilt E[Gₙ(x)] = 0 und Var[Gₙ(x)] = F(x)(1−F(x)).

Die maximale Abweichung ist Dₙ = supₓ∈ℝ |F̃ₙ(x)−F(x)|. Bei stetigem F hängt ihre Verteilung nicht von F ab; Dₙ ist dann eine verteilungsfreie Statistik und bildet die Grundlage des Kolmogorow-Smirnow-Anpassungstests.

Für n → ∞ konvergiert F̃ₙ(x) nach dem starken Gesetz der großen Zahlen für jedes x fast sicher gegen F(x). Außerdem gilt

√n(F̃ₙ(x)−F(x)) →ᵈ 𝒩(0,F(x)(1−F(x))),

beziehungsweise nach Standardisierung gegen 𝒩(0,1). Der Satz von Glivenko-Cantelli verschärft die punktweise Aussage zur gleichmäßigen fast sicheren Konvergenz: Dₙ = ||F̃ₙ−F||∞ → 0. Nach Kolmogorow konvergiert √nDₙ bei stetigem F gegen die Kolmogorow-Verteilung. Die Dvoretzky–Kiefer–Wolfowitz-Ungleichung lautet P(Dₙ > ε) ≤ C e^(−2nε²) für alle ε > 0; zunächst war C unspezifiziert, später wurde durch Massart die bestmögliche Konstante C = 2 angegeben. Der Prozess Gₙ kann unter bestimmten Voraussetzungen asymptotisch durch eine Brownsche Brücke charakterisiert werden.

Beispiele und grafische Darstellung

Bei den Pferdetrittdaten von Ladislaus von Bortkewitsch starben von 1875 bis 1894 in 14 Kavallerieregimentern der preußischen Armee insgesamt 196 Soldaten an Pferdetritten. Für die verschiedenen beobachteten Werte 3, 4, 5, 6, 7, 8, 9, 10, 11, 12, 14, 15, 17 und 18 lauten die relativen Häufigkeiten 0,05; 0,05; 0,10; 0,10; 0,05; 0,05; 0,10; 0,05; 0,15; 0,05; 0,05; 0,10; 0,05 und 0,05. Die zugehörigen Werte von Fₙ sind 0,05; 0,10; 0,20; 0,30; 0,35; 0,40; 0,50; 0,55; 0,70; 0,75; 0,80; 0,90; 0,95 und 1,00. Beispielsweise gilt Fₙ(6,5) = 0,3.

Werden dieselben Daten in Klassen der Breite 2 eingeteilt, nämlich [2,4), [4,6), [6,8), [8,10), [10,12), [12,14), [14,16) und [16,18), sind die relativen Klassenhäufigkeiten 0,10; 0,20; 0,10; 0,15; 0,20; 0,05; 0,10 und 0,10. An den Klassenobergrenzen ergeben sich die kumulierten Werte 0,10; 0,30; 0,40; 0,55; 0,75; 0,80; 0,90 und 1,00. Wegen der linearen Interpolation gilt nun Fₙ(6,5) = 0,3 + ((6,5−6)/(8−6)) · 0,1 = 0,325.

Eine empirische Verteilungsfunktion wird häufig als Ogive oder kumulierte Verteilungsfunktion dargestellt. Auf der waagerechten Achse stehen die geordneten, oft gruppierten Merkmalsausprägungen; auf der senkrechten Achse die kumulierten relativen Häufigkeiten in Prozent. Bei einer Stichprobe von 50 Zufallszahlen aus einer Standardnormalverteilung nähert sich die empirische Funktion mit wachsender Zahl von Zufallszahlen zunehmend der theoretischen Verteilungsfunktion an.

Lernvideos zu Empirische Verteilungsfunktion

Weiterlesen

Deskriptive Statistik Tabellen: In Tabellen werden Daten in einer Matrix mit Zeilen und Spalten dargestellt, wenn die Datenstruktur dies erlaubt. Dabei entspricht üblicherweise … Stochastik Statistik · Daten, Stichprobe, Grundgesamtheit, Häufigkeit (absolute, relative), Merkmal, Merkmalsausprägung · Häufigkeitsverteilung, Stabdiagramm, Kreisdiagramm, … Funktion (Mathematik) In der Mathematik ist eine Funktion (lateinisch functio) oder Abbildung eine Beziehung (Relation) zwischen zwei Mengen, die jedem Element der einen Menge … Zufallsstichprobe In der mathematischen Statistik sind Zufallsstichproben die Grundlage für den Rückschluss von der Stichprobe auf Eigenschaften der Grundgesamtheit. Die … Verteilungsfunktion Die Verteilungsfunktion ist eine spezielle reelle Funktion in der Stochastik und ein zentrales Konzept bei der Untersuchung von … Wahrscheinlichkeitsfunktion Eine Wahrscheinlichkeitsfunktion, auch Zähldichte genannt, ist eine spezielle reellwertige Funktion in der Stochastik. Wahrscheinlichkeitsfunktionen werden … Relative Häufigkeit Sie wird berechnet, indem die absolute Häufigkeit eines Merkmals in einer zugrundeliegenden Menge durch die Anzahl der Objekte in dieser Menge geteilt wird. Die … Delta-Distribution Die Delta-Distribution (auch δ-Funktion; Dirac-Funktion, -Impuls, -Puls, -Stoß (nach Paul Dirac), Stoßfunktion, Nadelimpuls, Impulsfunktion oder … Klasseneinteilung (Statistik) Quartile. Das 1. Quartil liegt in der 2. Klasse, also: 200 < 1. Quartil ≤ 300. Das 2. Quartil = Median liegt in der 3. Klasse, also: 300 < 2. Quartil ≤ 400. Summenhäufigkeitspolygon Ein Summenhäufigkeitspolygon ist eine grafische Darstellung eines eindimensionalen, metrischen Datensatzes. Summenhäufigkeitspolygon von 75 … Stetige Funktion In der Mathematik ist eine stetige Abbildung oder stetige Funktion eine Funktion, bei der hinreichend kleine Änderungen des Arguments nur beliebig kleine … Histogramm Die Höhe jedes Rechtecks stellt dann die (relative oder absolute) Häufigkeitsdichte dar, also die (relative oder absolute) Häufigkeit dividiert durch die Breite …