Zum Inhalt springen
L

Wikipedia · einfach zusammengefasst · Stand

Repräsentativität

Repräsentativität bezeichnet in der Statistik und der empirischen Forschung die Frage, inwieweit eine Stichprobe beziehungsweise die aus ihr gewonnenen …

Inhalt6 Abschnitte
  1. 1. Grundidee und Bedeutung
  2. 2. Zufall, Quoten und Schlussfolgerungen
  3. 3. Beurteilung einer Erhebung
  4. 4. Stichprobengröße und Genauigkeit
  5. 5. Typische Fehlerquellen
  6. 6. Praktische Anwendung

Grundidee und Bedeutung

Repräsentativität bezeichnet in Statistik und empirischer Forschung die Frage, inwieweit eine Stichprobe oder die daraus gewonnenen Ergebnisse eine festgelegte Grundgesamtheit in Bezug auf bestimmte Merkmale oder Fragestellungen angemessen abbilden. Eine Stichprobe gilt in einer verbreiteten Bedeutung als repräsentativ hinsichtlich eines Merkmals, wenn die Verteilung dieses Merkmals in der Stichprobe der Verteilung in der Grundgesamtheit hinreichend ähnlich ist. Dafür muss die Verteilung in der Grundgesamtheit bekannt sein.

Wichtig ist die Unterscheidung zwischen Repräsentativität als Eigenschaft einer ausgewählten Stichprobe und der Möglichkeit, mit Inferenzstatistik von einer Stichprobe auf eine Grundgesamtheit zu schließen. Bei einer Wahrscheinlichkeitsstichprobe hat jedes Element der Grundgesamtheit eine positive und bekannte Einschlusswahrscheinlichkeit. Nur bei der einfachen Zufallsstichprobe sind diese Wahrscheinlichkeiten für alle Elemente gleich. Bei komplexeren Stichprobenplänen können sie unterschiedlich sein und müssen bei der Schätzung berücksichtigt werden.

Repräsentativität ist besonders wichtig bei Meinungsumfragen, Marktforschung, Wahlforschung und anderen Stichprobenerhebungen, deren Ergebnisse auf eine größere Grundgesamtheit übertragen werden sollen.

Zufall, Quoten und Schlussfolgerungen

Eine Zufallsstichprobe und eine in bestimmten Merkmalen repräsentative Stichprobe sind verschiedene Konzepte. Zufälligkeit beschreibt das Verfahren der Auswahl. Repräsentativität im Sinne ähnlicher Merkmalsverteilungen beschreibt dagegen ein Ergebnis dieser Auswahl.

Auch eine korrekt gezogene einfache Zufallsstichprobe ist nicht automatisch ein exaktes verkleinertes Abbild der Grundgesamtheit. Besteht eine Grundgesamtheit zu gleichen Teilen aus zwei Gruppen A und B, enthält eine einfache Zufallsstichprobe von 100 Elementen nicht zwangsläufig genau 50 Elemente aus jeder Gruppe. Die Wahrscheinlichkeit dafür beträgt {100 \choose 50} · 0,5^100 ≈ 0,0796. Abweichungen können also allein durch Zufall entstehen.

Umgekehrt kann eine nicht zufällig ausgewählte Stichprobe bei einzelnen bekannten Merkmalen sehr gut zur Grundgesamtheit passen, ohne dass sie auch bei anderen Merkmalen passt. Bei einer Quotenstichprobe wird zum Beispiel versucht, bekannte Verteilungen wie Alter oder Geschlecht nachzubilden. Das hilft nur dann bei anderen Schätzungen, wenn diese Quotenmerkmale mit dem Auswahlmechanismus und den interessierenden Untersuchungsmerkmalen ausreichend zusammenhängen.

Für Wahrscheinlichkeitsstichproben liefert die Stichprobentheorie Verfahren, um die Unsicherheit von Schätzungen aus dem Stichprobenplan abzuleiten. Bei nichtprobabilistischen Stichproben fehlen bekannte Einschlusswahrscheinlichkeiten. Verallgemeinerungen auf eine Grundgesamtheit brauchen dann zusätzliche Modellannahmen, die oft schwer überprüfbar sind. Quoten oder nachträgliche Gewichte lösen dieses Grundproblem nicht vollständig.

Beurteilung einer Erhebung

Welche Anforderungen an eine Stichprobe gelten, hängt von der Fragestellung ab. Eine Erhebung kann für Aussagen über die Bevölkerung eines ganzen Staates ausreichend genau sein, aber für kleine Gebiete oder seltene Bevölkerungsgruppen nur ungenaue Schätzungen liefern. Repräsentativität ist besonders wichtig, wenn Verteilungen geschätzt werden sollen, etwa Anteile oder Mittelwerte.

Bei der Prüfung von Zusammenhangs- oder Kausalhypothesen kann interne Validität wichtiger sein als Übertragbarkeit auf eine gesamte Bevölkerung. Interne Validität bedeutet, dass die Untersuchung innerhalb ihres Designs belastbare Aussagen ermöglicht. Auch nichtprobabilistische Stichproben können daher für explorative Untersuchungen oder Experimente geeignet sein, wenn keine statistische Verallgemeinerung auf eine Grundgesamtheit beabsichtigt ist. Daraus folgt aber keine externe Validität, also keine automatische Übertragbarkeit der Ergebnisse.

Zur Beurteilung einer Stichprobenerhebung sind besonders wichtig: die sachliche, räumliche und zeitliche Abgrenzung der Grundgesamtheit; der Auswahlrahmen mit möglichen Über- oder Unterabdeckungen; die Stichprobentechnik und bei Wahrscheinlichkeitsstichproben die Einschlusswahrscheinlichkeiten; bei Quotenstichproben die Auswahl- oder Quotenmerkmale; die geplante und realisierte Stichprobengröße; Ausschöpfungsquote und Antwortausfälle; die Erhebungsmethode; Gewichtungs- und Anpassungsverfahren; sowie Angaben zur statistischen Unsicherheit.

Wenn geeignete Informationen über die Grundgesamtheit vorhanden sind, können bekannte Randverteilungen, zum Beispiel nach Alter oder Region, mit der realisierten Stichprobe verglichen werden. Eine Übereinstimmung bei solchen Merkmalen beweist jedoch nicht, dass auch andere Merkmale übereinstimmen.

Stichprobengröße und Genauigkeit

Die notwendige Stichprobengröße hängt unter anderem von der gewünschten Genauigkeit statistischer Schlüsse und vom verwendeten Stichprobenplan ab. Bei einer einfachen Zufallsstichprobe kann der nötige Umfang zum Beispiel aus einem tolerierbaren Stichprobenfehler und einer Irrtumswahrscheinlichkeit bestimmt werden.

Eine größere Stichprobe erhöht bei einem gegebenen Wahrscheinlichkeitsdesign im Allgemeinen die Präzision der Schätzung. Sie beseitigt aber keine systematischen Verzerrungen. Eine große, systematisch verzerrte Stichprobe kann daher einen falschen Wert sehr präzise schätzen.

Ein häufig genanntes Beispiel ist das Literary-Digest-Desaster bei der Präsidentschaftswahl in den Vereinigten Staaten 1936. The Literary Digest stützte die Vorhersage auf mehr als zwei Millionen zurückgesandte Fragebögen und sagte einen Sieg von Alf Landon über Franklin D. Roosevelt voraus. Die Adressen stammten unter anderem aus Telefonverzeichnissen und Kraftfahrzeugregistern. George Gallup sagte dagegen mit einer deutlich kleineren Quotenstichprobe von etwa 50.000 Personen den Sieg Roosevelts voraus.

Das Beispiel zeigt vor allem, dass ein großer Stichprobenumfang systematische Auswahlfehler nicht ausgleicht. Es ist kein allgemeiner Beleg für die Überlegenheit von Quotenstichproben: Bei der US-Präsidentschaftswahl 1948 scheiterten auch Gallups Quotenprognosen, während eine kleinere Wahrscheinlichkeitsstichprobe den späteren Sieger Harry S. Truman richtig bestimmte.

Typische Fehlerquellen

Die Verallgemeinerbarkeit von Stichprobenergebnissen kann durch verschiedene Fehlerquellen beeinträchtigt werden. Entscheidend ist nicht nur das Erhebungsmedium, sondern vor allem, wie die Stichprobe zustande kommt.

Abdeckungsfehler entstehen, wenn der Auswahlrahmen nicht vollständig zur angestrebten Grundgesamtheit passt. Es können Teile der Grundgesamtheit fehlen, also undercoverage, oder Einheiten enthalten sein, die nicht zur Grundgesamtheit gehören, also overcoverage.

Stichprobenfehler entstehen, weil auch eine korrekt gezogene Zufallsstichprobe zufällig von der Grundgesamtheit abweicht. Bei Wahrscheinlichkeitsstichproben kann diese Unsicherheit statistisch quantifiziert werden.

Antwortausfälle können verzerren, wenn ausgewählte Einheiten nicht teilnehmen und sich ihre interessierenden Merkmale systematisch von denen der Teilnehmenden unterscheiden. Selbstselektion entsteht bei offenen oder freiwilligen Erhebungen, wenn mögliche Teilnehmende selbst über ihre Teilnahme entscheiden und Teilnahmebereitschaft mit dem Untersuchungsmerkmal zusammenhängt.

Quotierung und Gewichtung können Unterschiede zwischen Stichprobe und Grundgesamtheit bei bekannten Hilfsmerkmalen verringern. Sie gewährleisten aber keine Übereinstimmung bei Merkmalen, die durch diese Hilfsvariablen nicht ausreichend erfasst werden. Bei Online-Umfragen muss außerdem zwischen Erhebungsform und Auswahlverfahren unterschieden werden: Eine Online-Erhebung ist nicht allein deshalb nichtprobabilistisch, weil sie über das Internet durchgeführt wird. Problematisch sind vor allem selbst rekrutierte Teilnahmen oder unbekannte Einschlusswahrscheinlichkeiten.

Praktische Anwendung

In der Praxis werden häufig komplexe Stichprobenpläne genutzt. Dabei können bestimmte Teile der Grundgesamtheit bewusst mit unterschiedlichen Wahrscheinlichkeiten ausgewählt werden. Solche Unterschiede sind kein Fehler, müssen aber bei der Auswertung berücksichtigt werden.

Bei der Designgewichtung werden Gewichte üblicherweise aus den inversen Einschlusswahrscheinlichkeiten abgeleitet. Zusätzliche Anpassungsgewichte können eingesetzt werden, wenn die realisierte Stichprobe zum Beispiel durch Antwortausfälle von der ursprünglich geplanten Stichprobe abweicht und geeignete Informationen über bekannte Randverteilungen der Grundgesamtheit vorliegen. Gewichtung kann Verzerrungen reduzieren, aber fehlende Informationen über den Auswahl- oder Teilnahmeprozess nicht beliebig ersetzen.

Ein Beispiel aus Deutschland ist die Allgemeine Bevölkerungsumfrage der Sozialwissenschaften, kurz ALLBUS. Seit 1980 werden für ihre Querschnittserhebungen regelmäßig Zufallsstichproben der deutschen Bevölkerung befragt.

Weiterlesen