Wikipedia · einfach zusammengefasst · Stand
Logarithmische Normalverteilung
Die logarithmische Normalverteilung (kurz Log-Normalverteilung) ist eine kontinuierliche Wahrscheinlichkeitsverteilung für eine Variable, die nur positive …
Inhalt6 Abschnitte
Grundidee und Definition
Die logarithmische Normalverteilung, kurz Log-Normalverteilung, ist eine kontinuierliche Wahrscheinlichkeitsverteilung für Zufallsvariablen, die nur positive Werte annehmen können. Eine positive Zufallsvariable X ist log-normalverteilt, wenn ihr Logarithmus Y = ln(X) normalverteilt ist. Gilt also Y ~ N(μ, σ²), dann gilt X = e^Y ~ LN(μ, σ²) mit σ > 0.
Sie ist besonders wichtig für Größen, die durch viele multiplikative Einflüsse entstehen. Während die gewöhnliche Normalverteilung oft zu Summen vieler Zufallseinflüsse passt, passt die Log-Normalverteilung zu Produkten vieler positiver Zufallsvariablen. Dadurch eignet sie sich für viele Messgrößen in Naturwissenschaften, Medizin, Technik, Ökonomie und anderen Bereichen, zum Beispiel für Konzentrationen, Energien, Längen, Massen oder Mengenangaben.
Eine standardnormalverteilte Zufallsvariable Z erzeugt eine log-normalverteilte Zufallsvariable durch X = e^(μ + σZ) = e^μ(e^Z)^σ. Alternativ zu μ und σ können die multiplikativen Parameter μ* = e^μ und σ* = e^σ > 1 verwendet werden. μ* ist ein Skalenparameter, σ beziehungsweise σ* bestimmt die Form der Verteilung.
Wird eine log-normalverteilte Zufallsvariable X mit einem positiven Faktor a multipliziert, dann ist Y = aX ebenfalls log-normalverteilt, mit den Parametern ln(a) + μ und σ beziehungsweise aμ* und σ*. Auch X^b ist log-normalverteilt, mit den Parametern bμ und bσ beziehungsweise (μ*)^b und (σ*)^b.
Dichte, Verteilungsfunktion und Normalverteilung
Die Dichtefunktion einer log-normalverteilten Zufallsvariable X ~ LN(μ, σ²) lautet für x > 0:
f(x) = 1/(sqrt(2π)σx) · exp(-((ln(x) - μ)²)/(2σ²)) = 1/(xσ) · φ((ln(x) - μ)/σ),
wobei φ die Dichtefunktion der Standardnormalverteilung ist. Die Verteilungsfunktion gibt an, mit welcher Wahrscheinlichkeit X höchstens den Wert x annimmt. Für x ≥ 0 gilt:
F(x) = ∫₀ˣ f(t) dt = Φ((ln(x) - μ)/σ),
wobei Φ die Verteilungsfunktion der Standardnormalverteilung ist. Auf logarithmisch geteiltem Wahrscheinlichkeitspapier erscheint die Verteilungsfunktion der Log-Normalverteilung als Gerade.
Die Beziehung zur Normalverteilung ist zentral: Der Logarithmus einer log-normalverteilten Zufallsvariablen ist normalverteilt. Umgekehrt ist e^Y log-normalverteilt, wenn Y normalverteilt ist. Wenn σ gegen 0 geht und damit σ* gegen 1, nähert sich die Form der Log-Normalverteilung der gewöhnlichen Normalverteilung an.
Es gibt auch eine mehrdimensionale Variante. Ist Z ein multivariat normalverteilter Zufallsvektor mit Z ~ N(μ, Σ), dann ist X = exp(Z), also X_j = exp(Z_j), multivariat log-normalverteilt. Diese mehrdimensionale Log-Normalverteilung ist laut Artikel deutlich weniger bedeutsam als der eindimensionale Fall.
Wichtige Kenngrößen
Die Quantile der Log-Normalverteilung lassen sich aus den Quantilen der Standardnormalverteilung berechnen. Ist u_(p) das p-Quantil der Standardnormalverteilung, also Φ(u_(p)) = p, dann ist das p-Quantil der Log-Normalverteilung:
x_(p) = e^(μ + u_(p) · σ).
Der Median beträgt μ* = e^μ. Er wird auch multiplikativer oder geometrischer Erwartungswert genannt und entspricht dem geometrischen Mittel. Er ist ein Skalenparameter, weil μ*(aX) = aμ*(X) gilt. Die multiplikative oder geometrische Standardabweichung ist σ* = e^σ mit σ* > 1. Sie beschreibt, wie stark die Werte auf multiplikativer Skala streuen.
Der Erwartungswert ist E(X) = e^(μ + σ²/2). Der Modus, also der häufigste Wert beziehungsweise die Stelle des Maximums der Dichtefunktion, ist Modus(X) = x_D = e^(μ - σ²).
Die Varianz lautet Var(X) = e^(2μ + σ²)(e^(σ²) - 1). Die Standardabweichung ist sqrt(Var(X)) = e^(μ + σ²/2) · sqrt(e^(σ²) - 1). Der Variationskoeffizient ergibt sich aus Erwartungswert und Varianz als VarK(X) = sqrt(e^(σ²) - 1).
Die Schiefe ist γ_m = (e^(σ²) + 2)sqrt(e^(σ²) - 1) > 0. Die Log-Normalverteilung ist also rechtsschief: Es gibt viele kleinere Werte und eine lange rechte Seite mit möglichen sehr großen Werten. Je größer σ ist, desto höher ist die Wahrscheinlichkeit für extrem große Ausprägungen. Erwartungswert und Median unterscheiden sich um den Faktor e^(σ²/2).
Alle Momente existieren. Für n ∈ N gilt E(X^n) = e^(nμ + n²σ²/2). Die momenterzeugende Funktion und die charakteristische Funktion existieren jedoch nicht in expliziter Form. Außerdem ist die Log-Normalverteilung ein Beispiel für eine Wahrscheinlichkeitsverteilung, die durch die Angabe aller Momente nicht eindeutig charakterisiert ist, weil andere Verteilungen dieselben Momente haben können. Die Entropie in nats beträgt μ + 1/2 ln(2πeσ²).
Rechnen mit log-normalverteilten Variablen
Das Produkt unabhängiger log-normalverteilter Zufallsvariablen ist wieder log-normalverteilt. Für zwei unabhängige Variablen X₁ und X₂ mit Parametern μ₁, σ₁ und μ₂, σ₂ hat das Produkt die Parameter μ = μ₁ + μ₂ und σ² = σ₁² + σ₂². Entsprechendes gilt für das Produkt von n solchen Variablen.
Ein Grenzwertsatz beschreibt, dass das geometrische Mittel von n unabhängigen, gleich verteilten, positiven Zufallsvariablen für n → ∞ näherungsweise einer Log-Normalverteilung folgt. Diese nähert sich dabei immer mehr einer gewöhnlichen Normalverteilung an, weil σ abnimmt.
Für die mehrdimensionale Log-Normalverteilung gilt: Der Erwartungswert-Vektor hat die Komponenten E[X]_i = e^(μ_i + 1/2 Σ_ii). Die Kovarianzmatrix, die gemeinsame Streuungen zwischen Komponenten beschreibt, ist Var[X]_ij = e^(μ_i + μ_j + 1/2(Σ_ii + Σ_jj))(e^(Σ_ij) - 1).
Die Log-Normalverteilung gehört zu den Verteilungen mit schweren Rändern. Das bedeutet, dass sehr große Werte im Vergleich zu vielen anderen Verteilungen relativ bedeutsam sein können.
Parameterschätzung und Statistik
Die Parameter einer Log-Normalverteilung werden aus einer Stichprobe meist bestimmt, indem man zuerst alle Beobachtungen logarithmiert. Für Beobachtungen X₁, ..., X_n gilt:
μ̂ = (1/n) Σᵢ₌₁ⁿ ln(X_i),
σ̂² = (1/(n - 1)) Σᵢ₌₁ⁿ (ln(X_i) - μ̂)².
Die multiplikativen Parameter werden daraus berechnet durch μ̂* = exp(μ̂) und σ̂* = exp(σ̂). μ̂* ist das geometrische Mittel. Seine Verteilung ist log-normal mit multiplikativem Erwartungswert μ* und geschätzter multiplikativer Standardabweichung, genauer multiplikativem Standardfehler, SEM* = (σ̂*)^(1/sqrt(n)).
Wenn keine Einzelwerte vorliegen, sondern nur der Mittelwert X̄ und die empirische Varianz var̂ der nicht logarithmierten Werte, erhält man passende Parameterwerte durch σ̂² = ln(var̂/X̄² + 1) und μ̂ = ln(X̄) - σ̂²/2. Alternativ wird direkt μ̂ = ln(X̄² · sqrt(1/(var̂ + X̄²))) angegeben.
Für statistische Auswertungen ist es meist am einfachsten, log-normalverteilte Größen zu logarithmieren und dann Methoden zu verwenden, die auf der gewöhnlichen Normalverteilung beruhen. Danach können Ergebnisse wie Vertrauens- oder Vorhersageintervalle wieder in die ursprüngliche Skala zurücktransformiert werden.
Für eine gewöhnliche Normalverteilung liegen etwa 2/3, genauer 68 %, der Wahrscheinlichkeit im Bereich μ ± σ und 95 % im Bereich μ ± 2σ. Entsprechend enthält bei der Log-Normalverteilung das Intervall [μ*/σ*, μ* · σ*] etwa 2/3 der Wahrscheinlichkeit und das Intervall [μ*/(σ*)², μ* · (σ*)²] etwa 95 %. Diese Intervalle sind auf der ursprünglichen Skala asymmetrisch.
Anwendungen
Die Log-Normalverteilung beschreibt viele natürliche und technische Phänomene, bei denen kleine prozentuale Abweichungen zusammenwirken und sich Effekte multiplizieren. Bei Wachstumsprozessen ist das besonders naheliegend. Auch viele grundlegende Naturgesetze enthalten Multiplikationen und Divisionen. Auf logarithmischer Skala werden daraus Additionen und Subtraktionen; durch den zentralen Grenzwertsatz entsteht dort eine Normalverteilung, die zurücktransformiert zur Log-Normalverteilung wird. Diese multiplikative Version des Grenzwertsatzes heißt Gesetz von Gibrat. Robert Gibrat (1904–1980) formulierte es für Unternehmen.
In einigen Wissenschaften werden Messgrößen bereits logarithmiert angegeben. Der pH-Wert ist als negativer Logarithmus der Wasserstoffionen-Aktivität definiert. Eine Lautstärke wird in Dezibel (dB) angegeben, mit dB = 10 log₁₀(E), wobei E das Verhältnis des Schalldruckpegels zu einem entsprechenden Referenzwert ist. Ähnliches gilt für andere Energie-Pegel. In der Finanzmathematik wird oft direkt mit logarithmierten Preisen, Kursen oder Erträgen gerechnet.
Generell eignet sich die Log-Normalverteilung für positive Messgrößen wie Konzentrationen, Massen, Gewichte, räumliche Größen und Energien. Beispiele aus dem Artikel sind Elementkonzentrationen in der Geologie, Partikelgrößen- und Molmassenverteilungen in Kolloid- und Polymerchemie, Extremwerte von Regenmengen oder Gewässerabflüssen in der Hydrologie und die Häufigkeit von Arten in der Ökologie.
In Biologie und Medizin werden unter anderem Größen von Lebewesen wie Länge, Hautfläche und Gewicht, physiologische Größen wie Blutdruck, Inkubationszeiten ansteckender Krankheiten, Impulsraten von Nervenzellen, Sensitivität gegenüber Fungiziden sowie bestimmte Eigenschaften von Bakterien, Zellwänden und gelösten Stoffen genannt. Der Artikel weist darauf hin, dass Referenzbereiche für gesunde Blutdruckwerte auf Grundlage einer Log-Normalverteilung geschätzt werden sollten.
In Sozialwissenschaften und Ökonomie zeigen Einkommensverteilungen bis auf wenige Extremwerte näherungsweise eine Log-Normalverteilung; für das obere Ende eignet sich laut Artikel die Pareto-Verteilung. In der Finanzmathematik werden logarithmierte Erträge und Preise oft als normalverteilt modelliert, was bedeutet, dass die ursprünglichen Größen log-normalverteilt sind. Das gilt auch für das Black-Scholes-Modell zur Preisbildung von Optionen und Derivaten. Für extrem große Werte, besonders bei Börsenstürzen, kann nach genauer Analyse die Lévy-Verteilung besser passen. Weitere Beispiele sind Einwohnerzahlen von Städten, Längen von Kommentaren in Internet-Foren, Verweildauer bei Online-Artikeln, Dauer von Schachspielen, Reparaturzeiten in der Zuverlässigkeitsmodellierung sowie Dateigrößen von öffentlich verfügbaren Audio- und Video-Dateien und Datenverkehr im Internet.