Zum Inhalt springen
L

Wikipedia · einfach zusammengefasst · Stand

Normalverteilung

Ihre Wahrscheinlichkeitsdichtefunktion wird auch Gauß-Funktion, gaußsche Normalverteilung, gaußsche Verteilungskurve, Gauß-Kurve, gaußsche Glockenkurve …

Inhalt6 Abschnitte
  1. 1. Begriff, Bedeutung und Definition
  2. 2. Gestalt, Kennwerte und Standardisierung
  3. 3. Verteilungsfunktion und Wahrscheinlichkeiten
  4. 4. Anwendungen und typische Beispiele
  5. 5. Binomialapproximation und verwandte Verteilungen
  6. 6. Prüfung und Erzeugung normalverteilter Daten

Begriff, Bedeutung und Definition

Die Normalverteilung oder Gauß-Verteilung ist eine der wichtigsten stetigen Wahrscheinlichkeitsverteilungen. Sie beschreibt Größen, deren Werte symmetrisch um einen Mittelwert streuen. Ihre besondere Bedeutung folgt aus dem zentralen Grenzwertsatz: Entsteht eine Größe durch die additive Überlagerung vieler unabhängiger Einflüsse, ist ihre Verteilung unter schwachen Voraussetzungen annähernd normalverteilt. Deshalb eignet sie sich beispielsweise zur Beschreibung von Messwertstreuungen, Fertigungsabweichungen und der brownschen Molekularbewegung.

Eine Zufallsvariable X ist mit Erwartungswert μ und Varianz σ² normalverteilt, geschrieben X ∼ N(μ,σ²), wenn sie für μ ∈ ℝ und σ > 0 die Dichte

f(x | μ,σ²) = 1/(σ√(2π)) · e^(−(1/2)((x−μ)/σ)²), x ∈ ℝ,

besitzt. Der Erwartungswert μ ist der Lageparameter und bestimmt den Mittelpunkt; die Standardabweichung σ ist der Skalenparameter und bestimmt die Breite. Die Varianz ist σ². Der Träger, also die Menge aller grundsätzlich möglichen Werte, ist ℝ. Die gesamte Fläche unter der Dichtekurve beträgt 1.

Für μ = 0 und σ² = 1 erhält man die Standardnormalverteilung N(0,1) mit der Dichte φ(x) = 1/√(2π) · e^(−x²/2). Eine entsprechend verteilte Zufallsvariable heißt standardnormalverteilt.

Gestalt, Kennwerte und Standardisierung

Der Graph der Dichte ist die Gaußsche Glockenkurve. Er ist achsensymmetrisch zur Geraden x = μ. Erwartungswert, Median und Modus stimmen überein und sind gleich μ. Die Wendepunkte liegen bei x = μ ± σ. Ein größeres σ macht die Kurve breiter und niedriger, ein kleineres σ schmaler und höher. Die Schiefe beträgt 0, die Wölbung 3 und der Exzess, also die um 3 verminderte Wölbung, 0.

Für X ∼ N(μ,σ²) gelten E(X) = μ und Var(X) = σ². Die momenterzeugende Funktion lautet mX(t) = exp(μt + σ²t²/2), die charakteristische Funktion ψX(t) = exp(iμt − σ²t²/2). Alle ungeraden zentralen Momente sind 0; für gerade n gilt μn = (n−1)!! · σⁿ. Die mittlere absolute Abweichung ist √(2/π)σ ≈ 0,80σ, der Interquartilsabstand etwa 1,349σ. Die Halbwertsbreite der Glockenkurve beträgt 2√(2 ln 2)σ ≈ 2,355σ.

Durch Standardisierung wird jede normalverteilte Zufallsvariable auf die Standardnormalverteilung zurückgeführt:

Z = (X−μ)/σ ∼ N(0,1).

Allgemeiner gilt für Y = aX+b mit a ≠ 0: Y ∼ N(aμ+b,a²σ²). Normalverteilungen bilden daher eine Lage-Skalen-Familie.

Die Normalverteilung ist außerdem gegenüber Faltung invariant: Sind X ∼ N(μX,σX²) und Y ∼ N(μY,σY²) unabhängig, dann gilt

X+Y ∼ N(μX+μY, σX²+σY²).

Die Standardabweichung der Summe ist somit √(σX²+σY²). Allgemein ist jede Linearkombination unabhängiger normalverteilter Zufallsvariablen wieder normalverteilt. Für gegebenen Erwartungswert und gegebene Varianz besitzt die Normalverteilung unter allen stetigen Verteilungen die größte Shannon-Entropie; diese beträgt log₂(σ√(2πe)).

Verteilungsfunktion und Wahrscheinlichkeiten

Die Verteilungsfunktion gibt die Wahrscheinlichkeit P(X ≤ x) an:

F(x) = 1/(σ√(2π)) · ∫ von −∞ bis x e^(−(1/2)((t−μ)/σ)²) dt.

Da dieses Integral nicht elementar berechnet werden kann, verwendet man Tabellen oder numerische Verfahren. Mit der Verteilungsfunktion Φ der Standardnormalverteilung gilt

F(x) = Φ((x−μ)/σ),

Φ(x) = 1/√(2π) · ∫ von −∞ bis x e^(−t²/2) dt

und Φ(x) = 1/2 · (1 + erf(x/√2)), wobei erf die Fehlerfunktion ist. Für ein Intervall [a,b] gilt P(a ≤ X ≤ b) = F(b)−F(a). Wegen der Symmetrie ist Φ(−x) = 1−Φ(x).

Für normalverteilte Werte gilt die wichtige 68-95-99,7-Regel:

• ungefähr 68,3 % liegen in μ ± σ,

• ungefähr 95,4 % liegen in μ ± 2σ,

• ungefähr 99,7 % liegen in μ ± 3σ.

Allgemein ist P(μ−zσ ≤ X ≤ μ+zσ) = P(−z ≤ Z ≤ z) = 2Φ(z)−1 = erf(z/√2). Umgekehrt gilt für eine vorgegebene Wahrscheinlichkeit p: z = Φ⁻¹((p+1)/2) = √2 · erf⁻¹(p).

Werte außerhalb von zwei oder drei Standardabweichungen können verdächtig erscheinen, sind aber nicht automatisch Ausreißer: Bei einer echten Normalverteilung liegt etwa jeder 20. Messwert außerhalb von μ ± 2σ und etwa jeder 370. außerhalb von μ ± 3σ.

Anwendungen und typische Beispiele

Normalverteilungen modellieren in Naturwissenschaft, Technik, Wirtschaft und Statistik zahlreiche Größen, auf die viele ungefähr unabhängige Einflüsse wirken. In der Statistik dienen sie zur Beschreibung von Merkmalsverteilungen und Messfehlern; außerdem treten sie als asymptotische Verteilungen von Schätzfunktionen und anderen Statistiken auf. Außerhalb direkter Wahrscheinlichkeitsmodelle beschreiben Gauß-Funktionen unter anderem Amplitudenprofile von Gauß-Strahlen und werden in der Gabor-Transformation der Signal- und Bildbearbeitung eingesetzt.

Ein Beispiel liefert eine Stichprobe mit 1.284 Mädchen und 1.063 Jungen im Alter von 14 bis 18 Jahren. Bei den Mädchen betrug die mittlere Körpergröße 166,3 cm bei σ = 6,39 cm, bei den Jungen 176,8 cm bei σ = 7,46 cm. Unter Annahme einer näherungsweisen Normalverteilung liegen etwa 68,3 % der Mädchen in 166,3 cm ± 6,39 cm und 95,4 % in 166,3 cm ± 12,8 cm. Ungefähr 16 % sind kleiner als 160 cm und ebenso viele größer als 173 cm; ungefähr 2,5 % sind kleiner als 154 cm und ebenso viele größer als 179 cm. Für Jungen werden entsprechend etwa 68,3 % im Bereich 176,8 cm ± 7,46 cm und 95,4 % im Bereich 176,8 cm ± 14,92 cm erwartet.

Eine kontaminierte Normalverteilung entsteht beispielsweise als Mischung P = 0,9·N(μ,σ²) + 0,1·N(μ,(10σ)²). Sie kann optisch fast wie eine Normalverteilung aussehen, besitzt aber ein anderes Streuverhalten. Das Modell beschreibt etwa zehn Präzisionsmaschinen, von denen eine schlecht justiert ist und zehnmal so große Abweichungen erzeugt wie die übrigen neun. Bei einer gestutzten Normalverteilung wird die Dichte außerhalb eines Intervalls [a,b] auf 0 gesetzt und innerhalb so erhöht, dass ihr Integral 1 bleibt.

Im Qualitätsmanagement nutzt Six Sigma die sehr geringe Wahrscheinlichkeit von Werten außerhalb von sechs Standardabweichungen, ungefähr 2 ppb. Wegen einer angenommenen langfristigen Verschiebung des Erwartungswertes um 1,5σ wird jedoch mit 3,4 ppm Fehlern gerechnet; dies entspricht 4,5σ. Die 6σ-Punkte sind praktisch schwer zu bestimmen, besonders wenn die Normalverteilung nicht gesichert ist.

Binomialapproximation und verwandte Verteilungen

Für große n nähert sich die Binomialverteilung B(n,p) einer Normalverteilung mit μ = np und σ² = np(1−p). Als Faustregel für eine brauchbare Approximation gilt np(1−p) ≥ 9, also σ ≥ 3. Ist dies nicht erfüllt, kann die Näherung noch vertretbar sein, wenn gleichzeitig np ≥ 4 und n(1−p) ≥ 4 gelten.

Da die Binomialverteilung diskret, die Normalverteilung aber stetig ist, verwendet man die Stetigkeitskorrektur:

P(x₁ ≤ X ≤ x₂) ≈ Φ((x₂+0,5−μ)/σ) − Φ((x₁−0,5−μ)/σ).

Die untere Grenze wird also um 0,5 vermindert und die obere um 0,5 erhöht. Außerdem muss zwischen < und ≤ unterschieden werden: P(X < x) = P(X ≤ x−1), beispielsweise P(X < 70) = P(X ≤ 69). Nur bei sehr großem σ kann die Stetigkeitskorrektur entfallen.

Wichtige Beziehungen zu anderen Verteilungen sind:

• Der Quotient zweier unabhängiger standardnormalverteilter Zufallsvariablen ist Cauchy-verteilt.

• Für Z ∼ N(0,1) gilt Z² ∼ χ²(1). Die Summe der Quadrate n unabhängiger standardnormalverteilter Variablen ist χ²(n)-verteilt. Die Chi-Quadrat-Verteilung dient unter anderem zur Konfidenzschätzung der Varianz einer normalverteilten Grundgesamtheit und nähert sich bei sehr vielen Freiheitsgraden, df ≫ 100, der Normalverteilung.

• Für unabhängige X und Y mit Mittelwert 0 und gleicher Varianz σ² ist √(X²+Y²) Rayleigh-verteilt.

• Ist X ∼ N(μ,σ²), dann ist eˣ logarithmisch-normalverteilt. Die Normalverteilung entspricht dem additiven, die logarithmische Normalverteilung dem multiplikativen Zusammenwirken vieler Zufallsgrößen.

• Quotienten geeigneter Stichprobenvarianzen normalverteilter Daten führen zur F-Verteilung.

• Der standardisierte Stichprobenmittelwert (X̄−μ)/(S/√n) ist bei unbekannter Varianz studentsch-t-verteilt mit n−1 Freiheitsgraden. Ab ungefähr df > 30 kann die t-Verteilung bei Bedarf durch die Normalverteilung angenähert werden.

Prüfung und Erzeugung normalverteilter Daten

Ob Daten mit einer Normalverteilung vereinbar sind, lässt sich mit Chi-Quadrat-, Kolmogorow-Smirnow-, Anderson-Darling-, Lilliefors-, Cramér-von-Mises-, Shapiro-Wilk- oder Jarque-Bera-Test prüfen. Die Verfahren reagieren unterschiedlich auf Abweichungen: Der Kolmogorow-Smirnow-Test erkennt Abweichungen in der Verteilungsmitte eher als an den Rändern, während der Jarque-Bera-Test empfindlich auf stark abweichende Randwerte reagiert. Beim Lilliefors-Test dürfen μ und σ unbekannt sein. Grafisch dienen Q-Q-Plots beziehungsweise Normal-Quantil-Diagramme zur Kontrolle. Mit der Maximum-Likelihood-Methode können μ und σ geschätzt und die angepasste Verteilung mit den Daten verglichen werden.

Zur Simulation werden meist zunächst standardnormalverteilte Zahlen erzeugt. Aus x ∼ N(0,1) entsteht durch ax+b eine Zufallsvariable aus N(b,a²). Die Box-Muller-Methode erzeugt aus unabhängigen U₁,U₂ ∼ U(0,1) zwei unabhängige Standardnormalvariablen:

X = cos(2πU₁)√(−2 ln U₂), Y = sin(2πU₁)√(−2 ln U₂).

Die Polar-Methode von George Marsaglia vermeidet trigonometrische Funktionen und ist auf Computern schneller. Der ebenfalls von Marsaglia entwickelte Ziggurat-Algorithmus ist effizienter als Box-Muller und wird standardmäßig in Matlab und Octave eingesetzt. Weitere Möglichkeiten sind Verwerfungs- und Inversionsmethoden; die Inversion erfordert wegen der nicht elementar darstellbaren inversen Verteilungsfunktion aufwendige numerische Verfahren.

Die Zwölferregel approximiert eine Standardnormalverteilung durch Y−6, wobei Y die Summe von zwölf unabhängigen, auf [0,1] gleichverteilten Zufallsvariablen ist. Y−6 hat Erwartungswert 0 und Varianz 1, ist aber nicht exakt normalverteilt. Das Verfahren ist ineffizient; außerdem kann bei linearen Kongruenzgeneratoren die erforderliche Unabhängigkeit fehlen. Für numerische Simulationen werden daher andere Verfahren bevorzugt.

Lernvideos zu Normalverteilung

Weiterlesen

Carl Friedrich Gauß Gauß-Newton-Verfahren, ein Verfahren zur Lösung nichtlinearer Gleichungen; Gauß-Seidel-Verfahren, ein Verfahren zur Lösung von linearen Gleichungssystemen … Stochastik Statistik · Daten, Stichprobe, Grundgesamtheit, Häufigkeit (absolute, relative), Merkmal, Merkmalsausprägung · Häufigkeitsverteilung, Stabdiagramm, Kreisdiagramm, … Wahrscheinlichkeitsdichtefunktion Dort dienen die Wahrscheinlichkeitsdichtefunktionen zur Konstruktion von Wahrscheinlichkeitsverteilungen mithilfe von Integralen sowie zur Untersuchung und … Zentraler Grenzwertsatz Der zentrale Grenzwertsatz liefert die Begründung für das Phänomen, dass der Stichprobenmittelwert als Zufallsvariable (unter gewissen Bedingungen) … Erwartungswert Der Erwartungswert beschreibt für eine Zufallsvariable mit endlich vielen Funktionswerten das mit der Wahrscheinlichkeit des Auftretens gewichtete arithmetische … Brownsche Bewegung Die brownsche Bewegung ist die vom Botaniker Robert Brown im Jahr 1827 unter dem Mikroskop entdeckte unregelmäßige und ruckartige Wärmebewegung kleiner … Satz von Moivre-Laplace kann diese Approximation durch ein Galtonbrett experimentell veranschaulicht werden. Mit wachsender Zahl von Punkten nähert sich die diskrete Binomialverteilung … Binomialkoeffizient Der Binomialkoeffizient ist eine mathematische Funktion, mit der sich eine der Grundaufgaben der Kombinatorik lösen lässt, nämlich auf wie viele … Integralrechnung Die Integralrechnung ist aus der Aufgabe entstanden, Flächeninhalte oder Volumina zu berechnen, die durch gekrümmte Linien bzw. Flächen begrenzt sind. Unter dem … Pierre-Simon Laplace März 1827 in Paris) war ein französischer Mathematiker, Physiker und Astronom. Er beschäftigte sich unter anderem mit der Wahrscheinlichkeitstheorie und mit … Francis Galton Im Jahr 1879 veröffentlichte er die erste Studie zu Wortassoziationen. Weiterhin ist er Entwickler und Namensgeber des Galtonbretts, eines Modells zur … Zufallsvariable Beispiele für reelle Zufallsvariablen sind die Augensumme von zwei geworfenen Würfeln und die Gewinnhöhe in einem Glücksspiel. Zufallsvariablen können aber auch …