Zum Inhalt springen
L

Wikipedia · einfach zusammengefasst · Stand

Mathematische Statistik

Als mathematische Statistik bezeichnet man das Teilgebiet der Statistik, das die Methoden und Verfahren der Statistik mit mathematischen Mitteln analysiert …

Inhalt6 Abschnitte
  1. 1. Gegenstand und Ziele
  2. 2. Statistische Inferenz und Modelle
  3. 3. Schätzen unbekannter Größen
  4. 4. Hypothesentests und weitere Verfahren
  5. 5. Formaler Rahmen und mathematische Grundlagen
  6. 6. Praktische Anwendung und Entwicklung

Gegenstand und Ziele

Die mathematische Statistik ist das Teilgebiet der Statistik, das statistische Methoden mathematisch begründet und untersucht. Weitgehend synonym sind die Bezeichnungen induktive, beurteilende, schließende oder Inferenzstatistik. Anders als die beschreibende Statistik, die vorhandene Daten zusammenfasst, zieht sie aus den Daten einer Stichprobe begründete Schlüsse über eine größere Grundgesamtheit. Zusammen mit der Wahrscheinlichkeitstheorie bildet sie die Stochastik; ihre mathematische Grundlage ist die Wahrscheinlichkeitstheorie.

Eine Grundgesamtheit umfasst alle betrachteten Mitglieder, die ein bestimmtes Merkmal besitzen. Untersucht wird, wie häufig die möglichen Merkmalswerte auftreten oder welchen Wert daraus abgeleitete Größen wie der Durchschnitt haben. Da eine Vollerhebung bei großen Grundgesamtheiten, etwa der gesamten deutschen Bevölkerung, sehr aufwändig ist, untersucht man häufig nur eine zufällig ausgewählte Teilmenge, die Stichprobe. Aus deren Ergebnissen sollen möglichst zuverlässige Aussagen über die Grundgesamtheit gewonnen werden. Die mathematische Statistik liefert das Fundament für die Planung solcher Erhebungen und für die Beurteilung der Genauigkeit und Sicherheit ihrer Ergebnisse.

Ein weiteres Ziel ist die Untersuchung möglicher kausaler Einflüsse. Mit statistischen Methoden allein lässt sich jedoch niemals eine gerichtete Kausalbeziehung nachweisen. Bei einer verbundenen Stichprobe werden dieselben Mitglieder hinsichtlich mehrerer Eigenschaften betrachtet, beispielsweise Körpergröße und Gewicht oder der Krankheitszustand vor und nach einer Medikamentation. Bei Zweistichprobenproblemen werden dagegen Stichproben aus verschiedenen Grundgesamtheiten verglichen, etwa die Einkommen von Personen mit und ohne Hochschulabschluss.

Statistische Inferenz und Modelle

Wäre die Verteilung eines Merkmals in der Grundgesamtheit bekannt, könnte man mit der Wahrscheinlichkeitstheorie berechnen, welche Stichprobenergebnisse mit welchen Wahrscheinlichkeiten auftreten. Die mathematische Statistik kehrt diese Richtung um: Aus einem tatsächlich beobachteten Stichprobenergebnis wird auf diejenigen Verteilungen der Grundgesamtheit geschlossen, die das Ergebnis plausibel erklären. Dieser Schluss heißt statistische Inferenz. Dabei wird auch untersucht, wie genau und wie sicher er ist.

Formal werden die Merkmale durch Zufallsvariablen beschrieben. Ihre Wahrscheinlichkeitsverteilung entspricht den relativen Häufigkeiten der Merkmalswerte in der Grundgesamtheit. Beim Beispiel der Altersverteilung ist ein realisierter Wert der Zufallsvariablen das Alter eines zufällig ausgewählten Deutschen. Die Stichprobendaten können als Realisierungen unabhängig und identisch verteilter Zufallsvariablen aufgefasst werden.

Das Vorwissen wird durch eine Familie möglicher Wahrscheinlichkeitsverteilungen beziehungsweise Wahrscheinlichkeitsmaße und deren Parameter dargestellt. Diese Verteilungsannahme kann sowohl mögliche Werte festlegen, beispielsweise nur ganze Zahlen, als auch einen Verteilungstyp wie die Normalverteilung. Statistische Methoden bestimmen dann, welche Parameter das beobachtete Ergebnis plausibel erklären. Werden bei jedem Mitglied mehrere numerische Merkmale erfasst, lassen sie sich durch eine vektorwertige Zufallsvariable mit Werten im n-dimensionalen Raum ℝⁿ darstellen. Auch solche Verteilungen, etwa die mehrdimensionale Normalverteilung, können häufig durch wenige Parameter beschrieben werden.

Schätzen unbekannter Größen

Die Schätztheorie ist ein zentrales Gebiet der mathematischen Statistik. Sie entwickelt Verfahren zur Bestimmung unbekannter Parameter einer Grundgesamtheit. Eine Stichprobenfunktion ist eine Funktion, deren Wert aus den beobachteten Stichprobendaten berechnet wird. Dient sie zur Parameterschätzung, heißt sie Schätzfunktion oder Schätzer.

Ausgehend von einer Verteilungsannahme untersucht und vergleicht die Schätztheorie Klassen solcher Funktionen. Maßstäbe sind unter anderem ihre Plausibilität im Sinne der Maximum-Likelihood-Methode sowie Qualitätskriterien wie Suffizienz und Effizienz.

Soll beispielsweise die durchschnittliche Körpergröße erwachsener Frauen in Deutschland geschätzt werden, kann eine Normalverteilung mit den unbekannten Parametern Erwartungswert und Varianz angenommen werden. Für eine Schätzfunktion lassen sich dann abhängig von diesen Parametern mögliche Fehler und deren Wahrscheinlichkeiten untersuchen. Erwartungstreu heißt ein Schätzer, wenn sein Erwartungswert dem gesuchten Wert entspricht. Der Mittelwert der Stichprobenergebnisse ist für den Erwartungswert eine erwartungstreue Schätzfunktion.

Neben einer einzelnen Näherung gibt es Bereichsschätzungen. Ein Konfidenzintervall ist ein durch die Stichprobe bestimmtes Intervall, das den unbekannten Parameter mit hoher Wahrscheinlichkeit einschließt.

Hypothesentests und weitere Verfahren

Ein Hypothesentest prüft eine konkrete Vermutung über die Grundgesamtheit. Aus dem Stichprobenergebnis entsteht eine 0-1-Entscheidung: Die Hypothese wird verworfen oder beibehalten. Wichtige Qualitätskriterien sind geringe Wahrscheinlichkeiten für falsche Entscheidungen. Ein Fehler 1. Art liegt vor, wenn eine tatsächlich richtige Hypothese verworfen wird; ein Fehler 2. Art, wenn eine tatsächlich falsche Hypothese nicht verworfen wird. Vorrangig wird die Wahrscheinlichkeit des Fehlers 1. Art begrenzt.

Die Prüfgröße, auch Testgröße oder Teststatistik genannt, ist eine aus den Stichprobendaten berechnete Stichprobenfunktion. Für sie wird ein Verwerfungsbereich festgelegt. Grundlage ist das Signifikanzniveau, also die tolerierte Höchstwahrscheinlichkeit für einen Fehler 1. Art. Die Hypothese wird genau dann verworfen, wenn der berechnete Wert der Prüfgröße im Verwerfungsbereich liegt.

Manche Tests benötigen keine Verteilungsannahme. Das gilt insbesondere, wenn eine Hypothese nur Datenränge statt Verteilungsparameter betrifft, etwa bei der Frage, ob der Median einen bestimmten Wert überschreitet. Solche Verfahren gehören zur nichtparametrischen Statistik.

Zur Analyse möglicher kausaler Einflüsse bei verbundenen Stichproben dienen unter anderem Regressionsanalyse und Varianzanalyse. Bei Stichproben aus unterschiedlichen Grundgesamtheiten kann ein Homogenitätstest prüfen, ob ihre Verteilungen übereinstimmen. Zur mathematischen Statistik gehören außerdem die Theorie statistischer Auswahlverfahren sowie die optimale Versuchs- und Erhebungsplanung.

Eine Sonderrolle besitzt die Bayessche Statistik. Sie interpretiert Wahrscheinlichkeit nicht frequentistisch als langfristige Häufigkeit, sondern als Sicherheit einer persönlichen Einschätzung eines Sachverhalts.

Formaler Rahmen und mathematische Grundlagen

Ein statistisches Modell, auch statistischer Raum genannt, formalisiert eine statistische Fragestellung vollständig und benötigt nicht zwingend eine ausdrücklich festgelegte Grundgesamtheit. Die möglichen Stichprobenergebnisse x bilden den Stichprobenraum 𝒳. Die beobachtbaren Ereignisse werden durch eine auf 𝒳 definierte σ-Algebra ℱ beschrieben. Die möglichen Verteilungen bilden eine Familie (P_ϑ)_{ϑ∈Θ} von Wahrscheinlichkeitsmaßen auf (𝒳, ℱ). Das statistische Modell ist damit das Tripel (𝒳, ℱ, P_ϑ: ϑ∈Θ).

Ist ϑ ein reeller Parametervektor und gilt Θ ⊆ ℝᵈ, liegt ein parametrisches Modell mit Parameterraum Θ vor. Für d = 1 spricht man von einem einparametrigen Modell. Eine messbare Funktion S von (𝒳, ℱ) in einen weiteren Messraum (𝒮, Σ) heißt Stichprobenfunktion oder Statistik. Ein Schätzer für eine Kenngröße τ(ϑ) ∈ 𝒮 ist eine Stichprobenfunktion T: 𝒳 → 𝒮.

Die grundlegende mathematische Disziplin ist die Wahrscheinlichkeitsrechnung. Einige ihrer Begriffe und Inhalte wurden historisch durch statistische Anwendungen angeregt. Dazu gehören Testverteilungen, also die Wahrscheinlichkeitsverteilungen von Prüfgrößen. Bedeutende Beispiele sind die Studentsche t-Verteilung, die Chi-Quadrat-Verteilung und die F-Verteilung. Die ersten beiden werden jeweils durch eine Anzahl von Freiheitsgraden parametrisiert, die F-Verteilung durch zwei Anzahlen von Freiheitsgraden.

Praktische Anwendung und Entwicklung

Bei großen Stichproben ist die Durchführung statistischer Verfahren ohne Hilfsmittel sehr aufwändig. Aus vielen Beobachtungen muss der Wert einer Prüf- oder Schätzfunktion berechnet werden. Bei Hypothesentests muss zusätzlich der Verwerfungsbereich anhand der Wahrscheinlichkeitsverteilung der Prüfgröße bestimmt werden; dafür verwendete man früher Quantiltabellen. Heute bieten Tabellenkalkulationsprogramme wie Excel vordefinierte Funktionen für diese Aufgaben. Daneben werden Statistikprogramme wie SPSS und universelle Programmiersprachen eingesetzt. Besonders R hat aufgrund seiner kostenlos erhältlichen Entwicklungsumgebung zunehmend Verbreitung gefunden.

Wichtige Grundlagen der modernen mathematischen Statistik gehen auf britische Forscher zurück: Karl Pearson beschrieb 1900 den Chi-Quadrat-Test. William Sealy Gosset veröffentlichte 1908 unter dem Pseudonym Student sein Konzept des t-Tests. Ronald Aylmer Fisher legte 1922 eine umfassende Systematisierung statistischer Methoden und Argumentationsweisen vor.

Lernvideos zu Mathematische Statistik

Weiterlesen

Wahrscheinlichkeitstheorie Bedingte Wahrscheinlichkeit. Bearbeiten. Unter einer bedingten Wahrscheinlichkeit versteht man die Wahrscheinlichkeit für das Eintreten eines Ereignisses A … Stochastik Statistik · Daten, Stichprobe, Grundgesamtheit, Häufigkeit (absolute, relative), Merkmal, Merkmalsausprägung · Häufigkeitsverteilung, Stabdiagramm, Kreisdiagramm, … Mathematik An deutschen Universitäten gehört die Mathematik meistens zur selben Fakultät wie die Naturwissenschaften, und so wird Mathematikern nach der Promotion in der … Grundgesamtheit Die Grundgesamtheit bezeichnet diejenige Menge aller Objekte, über die eine Aussage getroffen werden soll. Grundgesamtheiten werden häufig nur unvollständig … Mittelwert Ein Mittelwert (kurz auch nur Mittel; anderes Wort Durchschnitt) ist eine Zahl, die aus gegebenen Zahlen nach einer bestimmten Rechenvorschrift ermittelt … Zufall – Beim Wurf mit einem idealen Würfel tritt jeder Wert von 1 bis 6 mit gleicher Wahrscheinlichkeit auf, vor dem Werfen kann nicht vorhergesagt werden, welches … Stichprobe Als Stichprobe bezeichnet man entweder. eine Teilmenge einer Grundgesamtheit (Population), die unter bestimmten Gesichtspunkten ausgewählt wurde … Kausalität Kausalität (von lateinisch causa, „Ursache“, und causalis, „ursächlich, kausal“) ist die Beziehung zwischen Ursache und Wirkung. Sie betrifft die Abfolge … Zufallsvariable Beispiele für reelle Zufallsvariablen sind die Augensumme von zwei geworfenen Würfeln und die Gewinnhöhe in einem Glücksspiel. Zufallsvariablen können aber auch … Relative Häufigkeit Sie wird berechnet, indem die absolute Häufigkeit eines Merkmals in einer zugrundeliegenden Menge durch die Anzahl der Objekte in dieser Menge geteilt wird. Die … Realisierung (Stochastik) Als Realisierung bezeichnet man dort einen konkreten Wert, den eine Zufallsvariable annimmt, vergleichbar einem Wert einer Funktion für ein gegebenes Argument. Wahrscheinlichkeitsmaß Ein Wahrscheinlichkeitsmaß dient dazu, den Begriff der Wahrscheinlichkeit zu quantifizieren und Ereignissen, die durch Mengen modelliert werden, eine Zahl …