Wikipedia · einfach zusammengefasst · Stand
Normalverteilungsmodell
Als Normalverteilungsmodell oder Gauß'sches Produktmodell bezeichnet man in der Statistik ein spezielles statistisches Modell, das sich durch einfache …
Inhalt4 Abschnitte
Grundidee und Voraussetzungen
Das Normalverteilungsmodell, auch Gauß’sches Produktmodell, ist ein statistisches Modell für Daten, die stochastisch unabhängig voneinander erhoben werden und alle normalverteilt sind. Je nach Situation sind ein oder zwei Parameter unbekannt: der Erwartungswert μ als mittlerer Wert und die Varianz σ² als Maß der Streuung.
Das Modell ist wichtig, weil es gut untersucht ist und deshalb geeignete Parameterschätzer, Konfidenzintervalle und Tests bereitstellt. Außerdem tritt die Normalverteilung nach dem zentralen Grenzwertsatz auf, wenn sich viele voneinander unabhängige zufällige Einflüsse überlagern.
Es gibt drei Grundfälle: Ist μ bekannt, wird σ² geschätzt, etwa bei der Eichung einer Waage mit einem genormten Gewicht. Ist σ² bekannt, wird μ geschätzt, etwa bei einem Messgerät mit bekannter Herstellerungenauigkeit. Sind beide Größen unbekannt, werden beide aus den Daten geschätzt, beispielsweise bei Schuhgrößen von Männern.
Bekannter Erwartungswert, unbekannte Varianz
Hier stammen n unabhängige Beobachtungen aus N(μ₀,σ²), wobei μ₀ bekannt und σ² > 0 unbekannt ist. Die Verteilungsklasse lautet P = {N^⊗n(μ₀,σ²) | σ² ∈ (0,∞)}. Es ist ein einparametriges Produktmodell und Teil einer einparametrigen Exponentialfamilie. Geschätzt wird g(σ²) = σ².
Maximum-Likelihood-Methode und Momentenmethode liefern die nicht korrigierte Stichprobenvarianz V(X) = (1/n)∑ᵢ₌₁ⁿ(Xᵢ − μ₀)². Sie ist erwartungstreu, also im Mittel gleich der tatsächlichen Varianz. Sie ist zudem suffizient: Sie enthält für σ² alle in der Stichprobe relevanten Informationen. Da sie vollständig ist, ist sie nach dem Satz von Lehmann-Scheffé ein gleichmäßig bester erwartungstreuer Schätzer.
Für Konfidenzintervalle nutzt man die Pivot-Statistik T(X,σ²) = (n/σ²)V(X) = ∑ᵢ₌₁ⁿ((Xᵢ − μ₀)/σ)². Sie besitzt eine Chi-Quadrat-Verteilung mit n Freiheitsgraden: T(X,σ²) ∼ χ²ₙ. Ein zweiseitiges Intervall zum Konfidenzniveau 1 − α ist [nV(X)/χ²ₙ;1−α/2; nV(X)/χ²ₙ;α/2], wobei χ²ₙ;α das α-Quantil der Chi-Quadrat-Verteilung mit n Freiheitsgraden bezeichnet. Für eine Varianz in einer Stichprobe gibt es den Chi-Quadrat-Test, zum Vergleich zweier Varianzen den F-Test.
Bekannte Varianz, unbekannter Erwartungswert
Hier gilt P = {N^⊗n(μ,σ₀²) | μ ∈ ℝ}; die Varianz σ₀² ist bekannt, der Erwartungswert μ unbekannt. Auch dies ist ein einparametriges Produktmodell und Teil einer einparametrigen Exponentialfamilie. Geschätzt wird g(μ) = μ.
Beide Schätzmethoden, Maximum Likelihood und Momente, ergeben das Stichprobenmittel X̄ = (1/n)∑ᵢ₌₁ⁿXᵢ. Es ist erwartungstreu, suffizient und vollständig und damit nach Lehmann-Scheffé ein gleichmäßig bester erwartungstreuer Schätzer.
Die Pivot-Statistik T(X,μ) = √n(X̄ − μ)/σ₀ ist für jedes μ standardnormalverteilt: T(X,μ) ∼ N(0,1). Mit uα als α-Quantil der Standardnormalverteilung erhält man zum Niveau 1 − α die einseitigen Intervalle [X̄ − (σ₀/√n)u₁−α; ∞) und (−∞; X̄ + (σ₀/√n)u₁−α]. Das zweiseitige Intervall ist [X̄ − (σ₀/√n)u₁−α/2; X̄ + (σ₀/√n)u₁−α/2]. Als Tests nennt das Modell den Einstichproben-Gauß-Test, den Einstichproben-t-Test und für zwei Stichproben den Zweistichproben-Gauß-Test.
Unbekannter Erwartungswert und unbekannte Varianz
In diesem allgemeinen Fall gilt P = {N^⊗n(μ,σ²) | σ² ∈ (0,∞), μ ∈ ℝ}. Das Modell ist parametrisch, ein Produktmodell und Teil einer zweiparametrigen Exponentialfamilie. Geschätzt werden g₁(μ;σ²) = μ und g₂(μ;σ²) = σ².
Für μ liefern Maximum-Likelihood- und Momentenmethode wieder X̄ = (1/n)∑ᵢ₌₁ⁿXᵢ; dieser Schätzer ist erwartungstreu. Für σ² liefern beide Methoden zunächst V(X) = (1/n)∑ᵢ₌₁ⁿ(Xᵢ − X̄)². Diese nicht korrigierte Stichprobenvarianz ist nicht erwartungstreu, sondern nur asymptotisch erwartungstreu. Die Bessel-Korrektur ergibt den erwartungstreuen Schätzer V*(X) = (1/(n−1))∑ᵢ₌₁ⁿ(Xᵢ − X̄)².
Für den Erwartungswert verwendet man Sn(X) = √((1/(n−1))∑ᵢ₌₁ⁿ(Xᵢ − X̄)²) und die t-Pivot-Statistik T(X,μ) = √n(X̄ − μ)/Sn(X). Ein einseitiges Intervall zum Niveau 1 − α ist [X̄ − Sn(X)tₙ−₁;1−α/√n; ∞). Das zweiseitige Intervall lautet [X̄ − Sn(X)tₙ−₁;1−α/2/√n; X̄ − S*n(X)tₙ−₁;α/2/√n]. Dabei ist tₙ;α das α-Quantil der Studentschen t-Verteilung mit n Freiheitsgraden.
Für σ² werden Chi-Quadrat-Quantile mit n − 1 Freiheitsgraden verwendet. Das einseitige Intervall ist [0; (1/χ²ₙ−₁;α)∑ᵢ₌₁ⁿ(Xᵢ − X̄)²). Das zweiseitige Intervall lautet ((1/χ²ₙ−₁;1−α/2)∑ᵢ₌₁ⁿ(Xᵢ − X̄)²; (1/χ²ₙ−₁;α/2)∑ᵢ₌₁ⁿ(Xᵢ − X̄)²). Für Varianzen stehen der Chi-Quadrat-Test und der F-Test zur Verfügung; für den Erwartungswert bei zwei Stichproben verweist das Modell auf das Behrens-Fisher-Problem.