Wikipedia · einfach zusammengefasst · Stand
Lorenz-Kurve
Der Gini-Koeffizient ist der Anteil der Fläche zwischen der perfekten Gleichverteilungsgerade und der beobachteten Lorenz-Kurve an der Fläche unter der …
Inhalt5 Abschnitte
Grundidee und Aufbau
Die Lorenz-Kurve, auch Lorenzkurve oder Disparitätskurve genannt, stellt statistische Verteilungen grafisch dar. Sie zeigt, wie ungleich oder konzentriert eine Merkmalssumme innerhalb einer Grundgesamtheit verteilt ist. Verwendet wird sie insbesondere für Einkommen und Vermögen, aber auch für Marktmacht, räumliche Verteilungen, die logistische ABC-Analyse und ökologische Untersuchungen.
Ausgangspunkt ist eine Liste von Einzeleinkommen oder Einzelvermögen, die von links nach rechts aufsteigend sortiert wird. Anschließend werden die Anteile schrittweise kumuliert. Im Einheitsquadrat des 1. Quadranten stehen auf der x-Achse die kumulierten Anteile der Merkmalsträger, zum Beispiel der Haushalte oder der Bevölkerung. Auf der y-Achse stehen die kumulierten Anteile der gesamten Merkmalssumme, zum Beispiel des Gesamteinkommens.
Jeder Punkt der Kurve lässt sich als Aussage lesen: „Die unteren 20 % aller Haushalte beziehen 10 % des Gesamteinkommens.“ Je stärker sich die Kurve unterhalb der Diagonalen wölbt, desto größer ist die Ungleichverteilung.
Bei perfekter Gleichverteilung besitzen alle Personen denselben Anteil. Die unteren N % der Gesellschaft verfügen dann über N % des Einkommens. Die Kurve ist die Gerade y = x, die perfekte Gleichverteilungsgerade. Bei perfekter Ungleichverteilung besitzt eine Person das gesamte Einkommen, während alle anderen kein Einkommen beziehen. Dann gilt y = 0 = 0 % für alle x < 1 = 100 % und y = 1 = 100 % bei x = 1 = 100 %. Diese Kurve heißt perfekte Ungleichverteilungsgerade.
Der Gini-Koeffizient misst die Ungleichheit als Anteil der Fläche zwischen perfekter Gleichverteilungsgerade und beobachteter Lorenz-Kurve an der Fläche unter der Gleichverteilungsgeraden. Im Einheitsquadrat ist er das Zweifache der Fläche zwischen Lorenz-Kurve und Diagonale. Sein Wert liegt zwischen 0 und 1; je größer er ist, desto ungleicher ist die Verteilung. Die Lorenz-Kurve wurde 1905 vom US-amerikanischen Statistiker und Ökonomen Max Otto Lorenz (1876–1959) entwickelt.
Berechnung in diskreten und stetigen Fällen
Im diskreten Fall ist die Lorenz-Kurve ein abschnittsweise linearer Polygonzug durch die Punkte (0|0), (u₁|v₁), (u₂|v₂), …, (uₙ|vₙ), (1|1). Sind xⱼ die Anteile an der Gesamtheit der Merkmalsträger und yⱼ die Anteile an der gesamten Merkmalssumme, dann gelten für i = 1, …, n:
uᵢ = Σⱼ₌₁ⁱ xⱼ und vᵢ = Σⱼ₌₁ⁱ yⱼ.
Für eine Population der Größe n mit aufsteigend geordneten Werten yᵢ, wobei yᵢ ≤ yᵢ₊₁ gilt, verbindet die stetige, abschnittsweise lineare Kurve die Punkte (Fᵢ, Lᵢ), i = 0, 1, …, n. Dabei sind F₀ = 0, L₀ = 0 sowie:
Fᵢ = i/n, Sᵢ = Σⱼ₌₁ⁱ yⱼ, Lᵢ = Sᵢ/Sₙ.
Sᵢ wird auch Lorenz-Asymmetrie-Koeffizient genannt.
Für eine diskrete Wahrscheinlichkeitsfunktion f(y) werden nur Werte yᵢ mit Non-/Nicht-Null-Wahrscheinlichkeiten betrachtet und aufsteigend geordnet, yᵢ < yᵢ₊₁. Dann gilt:
Fᵢ = Σⱼ₌₁ⁱ f(yⱼ), Sᵢ = Σⱼ₌₁ⁱ f(yⱼ) · yⱼ, Lᵢ = Sᵢ/Sₙ.
Für die Laplace-Verteilung mit f(yᵢ) = 1/n für alle i = 1, …, n erhält man die vorherigen Formeln für Fᵢ und Lᵢ.
Für eine Wahrscheinlichkeitsdichte f(x), ihre kumulierte Verteilungsfunktion F(x) und den Erwartungswert μ ist die Lorenz-Kurve definiert durch
L[F(x)] = (∫₋∞ˣ t · f(t) dt) / (∫₋∞⁺∞ t · f(t) dt) = (∫₋∞ˣ t · f(t) dt) / μ.
Existiert die Umkehrfunktion x(F), gilt außerdem:
L(F) = (∫₀ᶠ x(F₁) dF₁) / (∫₀¹ x(F₁) dF₁).
Da eine kumulierte Verteilungsfunktion Sprungstellen oder Intervalle konstanter Werte haben kann, muss x(F) nicht existieren. Die Formel bleibt gültig, wenn x(F₁) allgemeiner als inf{y : F(y) ≥ F₁} definiert wird.
Nach Joseph Lewis Gastwirth wird für eine nichtnegative Zufallsvariable X mit normierter Quantilsfunktion Q* die Abbildung L: [0,1] → [0,1] mit L(α) = ∫₀ᵅ Q*(α̃) dα̃ als stetige Lorenz-Kurve von X beziehungsweise seiner Verteilung bezeichnet.
Eigenschaften und Grenzfälle
Die Lorenz-Kurve beginnt immer im Koordinatenursprung (0|0) und endet bei (1|1). Ihre Ableitung ist monoton steigend. Deshalb ist die Kurve konvex und liegt unterhalb der Diagonalen. Im offenen Intervall (0,1) ist sie stetig; im diskreten Fall ist sie zusätzlich stückweise linear. Für einen Mittelwert der Wahrscheinlichkeitsverteilung von null oder unendlich ist sie nicht definiert.
Die Lorenz-Kurve einer Wahrscheinlichkeitsverteilung ist stetig. Lorenz-Kurven unstetiger Funktionen können jedoch als Grenzwerte von Lorenz-Kurven von Wahrscheinlichkeitsverteilungen entstehen, beispielsweise die perfekte Ungleichheitsgerade. Die Daten einer Lorenz-Kurve können unter anderem durch den Gini-Koeffizienten und den Lorenz-Asymmetrie-Koeffizienten zusammengefasst werden.
Unter positiver Skalierung bleibt die Lorenz-Kurve unverändert: Wenn X eine Zufallsvariable ist, besitzt c · X für jede positive Zahl c dieselbe Lorenz-Kurve wie X. Unter Translation, also einer konstanten Verschiebung, ist sie dagegen nicht invariant. Hat X die Lorenz-Kurve Lₓ(F) und den Mittelwert μₓ, dann gilt für X + c mit c ≠ −μₓ:
F − Lₓ₊꜀(F) = [μₓ/(μₓ + c)] · [F − Lₓ(F)].
Für 0 < F < 1 gilt bei Differenzierbarkeit:
dL(F)/dF = x(F)/μ.
Ist die Lorenz-Kurve zweifach differenzierbar, existiert an diesem Punkt die Dichte f(x), und es gilt:
d²L(F)/dF² = 1/[μ · f(x(F))].
Ist L(F) stetig differenzierbar, dann ist die Tangente im Punkt F(μ) parallel zur perfekten Gleichheitsgeraden. In diesem Punkt ist der vertikale Abstand F − L(F), die Gleichheitsdiskrepanz, am größten. Er entspricht der Hälfte der relativen mittleren Abweichung:
F(μ) − L[F(μ)] = mittlere Abweichung/(2μ).
Beim Übergang von X zu −X wird die Lorenz-Kurve am Punkt (0,5|0,5) gespiegelt. Es gilt L₋ₓ(F) = 1 − Lₓ(1 − F).
Je gleichmäßiger die Merkmalssumme verteilt ist, desto näher liegt die Kurve an der Diagonalen. Bei ökonomischer Gleichverteilung fällt sie mit der Diagonalen zusammen. Bei maximaler Ungleichverteilung verläuft sie bis 1 − 1/n auf der Abszisse und führt von dort zum Punkt (1|1).
Vergleich von Verteilungen und weitere Maße
Die Lorenz-Kurve ist ein anschauliches Maß für relative Konzentration beziehungsweise Disparität. Schneiden sich zwei Kurven, lässt sich aus der Grafik jedoch nicht eindeutig erkennen, welche Verteilung ungleicher ist; außerdem ist eine rein grafische Messung ungenau. Präzisere Maßzahlen sind der Gini-Koeffizient und der Variationskoeffizient.
Die Lorenz-Dominanz beschreibt das Verhältnis zweier Verteilungen. Für x ∈ ℝ₊ⁿ bezeichnet x̂ = (x̂₁, x̂₂, …, x̂ₙ) die nicht absteigend sortierten Werte, also x̂₁ ≤ x̂₂ ≤ … ≤ x̂ₙ. Der Vektor x Lorenz-dominiert y, wenn beide dieselbe Summe besitzen, Σᵢ₌₁ⁿ xᵢ = Σᵢ₌₁ⁿ yᵢ, und für alle p ∈ {1, 2, …, n − 1} gilt:
Σᵢ₌₁ᵖ x̂ᵢ ≥ Σᵢ₌₁ᵖ ŷᵢ,
wobei die Ungleichung für mindestens ein p strikt sein muss. Dies heißt starke Lorenz-Dominanz und wird mit x ≻Lor y abgekürzt. Grafisch liegt dann die zugehörige Lorenz-Kurve nicht unterhalb und mindestens einmal oberhalb der anderen.
Der Satz von Rothschild und Stiglitz besagt für zwei Verteilungen (x₁, …, xₙ) und (x₁*, …, xₙ*) mit gleicher Summe: Die Lorenz-Kurve der ersten Verteilung liegt genau dann oberhalb derjenigen der zweiten, wenn für jede symmetrische und quasikonvexe Funktion F gilt:
F(x₁, …, xₙ) ≤ F(x₁*, …, xₙ*).
Schneiden sich zwei Lorenz-Kurven, hängt es daher von der Wahl der jeweiligen symmetrischen und quasikonvexen Funktion F ab, welche als ungleicher bezeichnet wird.
Auch die Lorenz-Kurven-Länge Lᴸ kann als Disparitätsmaß verwendet werden. Ihr Wertebereich ist √2 ≤ Lᴸ ≤ 2; der Definitionsbereich ist 0 ≤ x ≤ 1. Im diskreten Fall werden die euklidischen Längen aller Streckenabschnitte addiert:
Lᴸ = Σⱼ₌₀ⁿ⁻¹ √[(F(xⱼ₊₁) − F(xⱼ))² + (L(xⱼ₊₁) − L(xⱼ))²].
Bei Gleichverteilung ist Lᴸ = √(1² + 1²) = √2, bei absoluter Konzentration auf nur einen Merkmalswert Lᴸ = 1² + 1² = 2. Im stetig differenzierbaren Fall lautet die Länge zwischen A(0|0) und B(1|1) bis zu einem Punkt a ∈ [0,1]:
Lᴸ(a) = ∫₀ᵃ √[1 + (L′(F))²] dF.
Beispiel und Anwendungen
Bei fünf diskret klassierten Gruppen werden zunächst die relativen Häufigkeiten fⱼ und die Anteile hⱼ der Merkmalssumme bestimmt. Durch Kumulieren entstehen Fⱼ, die kumulierten relativen Häufigkeiten, und Lⱼ, die kumulierten Anteile beziehungsweise kumulierten Disparitäten. Die Beispieltabelle lautet:
j: 1 | fⱼ = 0,2 | Fⱼ = 0,2 | hⱼ = 0,00 | Lⱼ = 0,00 j: 2 | fⱼ = 0,4 | Fⱼ = 0,6 | hⱼ = 0,05 | Lⱼ = 0,05 j: 3 | fⱼ = 0,1 | Fⱼ = 0,7 | hⱼ = 0,15 | Lⱼ = 0,20 j: 4 | fⱼ = 0,1 | Fⱼ = 0,8 | hⱼ = 0,30 | Lⱼ = 0,50 j: 5 | fⱼ = 0,2 | Fⱼ = 1,0 | hⱼ = 0,50 | Lⱼ = 1,00.
Für die Zeichnung werden Fⱼ auf der Abszisse und Lⱼ auf der Ordinate eingetragen; anschließend verbindet man die Punkte durch einen Streckenzug. Ein weiteres Beispiel für eine Lorenz-Kurve enthält der Artikel zur Paretoverteilung.
In der Wirtschaftswissenschaft wird die Kurve vor allem genutzt, um für die unteren x % der Haushalte den Anteil y % des Gesamteinkommens darzustellen. Der Haushaltsanteil steht auf der Abszisse, der Einkommensanteil auf der Ordinate. Deshalb wird die Kurve häufig als Maß sozialer Ungleichheit verwendet. Weitere Anwendungen sind die Darstellung von Marktmacht und räumlichen Verteilungen, die logistische ABC-Analyse sowie Geschäftsmodelle in der Konsumentenfinanzierung. Dort kann sie die reale Nichtzahlung bei Fälligkeit, die Delinquenz Y %, von X % der Konsumenten mit den schlechtesten vorhergesagten Risiko- beziehungsweise Kreditscores zeigen.
In der Ökologie und Biodiversitätsforschung werden kumulierte Anteile von Tierarten den kumulierten Anteilen an Individuen gegenübergestellt.
Disparität und absolute Konzentration sind verwandt, aber nicht identisch. Die Lorenz-Kurve vergleicht Anteile mit Anteilen: Anteile der Merkmalssumme werden den Anteilen der Merkmalsträger gegenübergestellt. Die Konzentrationskurve vergleicht dagegen Anteile der Merkmalssumme mit absoluten Zahlen von Merkmalsträgern. Daher können hohe Disparität und geringe Konzentration oder hohe Konzentration und geringe Disparität gleichzeitig vorkommen. Bei x Unternehmen verdeutlichen die Beispiele x₁ = 90, x₂ = x₃ = 5 eine hohe Konzentration und hohe Disparität, während x₁ = 34, x₂ = x₃ = 33 eine hohe Konzentration und geringe Disparität darstellen. Geringe Konzentration bei hoher Disparität wird durch x₁ = … = x₄₀₀ = 0,9 und x₄₀₁ = … = x₁₀₀₀ = 0,01 veranschaulicht; geringe Konzentration und geringe Disparität durch x₁ = … = x₄₀₀ = 0,9 und x₄₀₁ = … = x₁₀₀₀ = 0,89.