Zum Inhalt springen
L

Wikipedia · einfach zusammengefasst · Stand

Kontingenztafel

Kontingenztafeln (auch: Kontingenztabellen oder Kreuztabellen) sind Tabellen, die die absoluten oder relativen Häufigkeiten (Häufigkeitstabellen) von …

Inhalt6 Abschnitte
  1. 1. Grundidee und Aufbau
  2. 2. Vierfeldertafel und Beispiel
  3. 3. Scheinkorrelation und dritte Variable
  4. 4. Anforderungen an Kategorien
  5. 5. Grafische Darstellung
  6. 6. Statistische Auswertung

Grundidee und Aufbau

Kontingenztafeln, auch Kontingenztabellen oder Kreuztabellen genannt, zeigen die absoluten oder relativen Häufigkeiten, mit denen bestimmte Merkmalsausprägungen gemeinsam auftreten. Sie machen also sichtbar, wie zwei oder mehr Merkmale durch „und“ miteinander verbunden sind. Ein häufiger Spezialfall mit zwei Merkmalen ist die Konfusionsmatrix.

Anders als bei einer flachen Tabelle stehen sowohl in den Zeilen als auch in den Spalten Merkmalsausprägungen. Für zwei Variablen X und Y werden die Ausprägungen x₁,…,xⱼ und y₁,…,yₖ gegenübergestellt. Die Zelle hⱼₖ enthält die absolute Häufigkeit, also die Anzahl der Beobachtungen, bei denen xⱼ und yₖ gemeinsam auftreten. Die Zahlen J und K geben an, wie viele Ausprägungen die beiden Variablen besitzen; sie müssen nicht gleich sein. Sind sie gleich, heißt die Kreuztabelle quadratisch.

Die Randhäufigkeiten sind die Summen der Zellen einer Zeile oder Spalte. Für eine Zeile gilt hⱼ• = hⱼ₁ + … + hⱼₖ, für eine Spalte h•ₖ = h₁ₖ + … + hⱼₖ. Die Gesamtsumme ist h•• = h₁• + … + hⱼ• = h•₁ + … + h•ₖ = n, wobei n die Anzahl aller Beobachtungen bezeichnet.

Statt absoluter Häufigkeiten können relative Häufigkeiten angegeben werden. Dafür wird häufig f statt h verwendet; dann gilt für die Gesamtsumme f•• = 1.

Vierfeldertafel und Beispiel

Die Vierfeldertafel ist eine zweidimensionale Kontingenztafel, bei der beide Variablen genau zwei Ausprägungen haben. Für Merkmale A und B enthalten ihre vier inneren Felder die Häufigkeiten h(A ∩ B), h(A ∩ B̄), h(Ā ∩ B) und h(Ā ∩ B̄). Dazu kommen die Randsummen h(A), h(Ā), h(B), h(B̄) und die Gesamtzahl n.

Ein Beispiel betrachtet 2000 Personen, die angeben, ob sie Produkt A oder Produkt B bevorzugen. Die Ergebnisse werden nach Geschlecht geordnet. Von 1000 Frauen bevorzugen 660 Produkt A und 340 Produkt B. Von 1000 Männern bevorzugen 340 Produkt A und 660 Produkt B. Insgesamt entfallen auf jedes Produkt 1000 Personen.

Bezogen auf alle 2000 Fälle lauten die relativen Häufigkeiten für die Kombinationen Produkt A/weiblich und Produkt B/männlich jeweils 0,33; für Produkt A/männlich und Produkt B/weiblich jeweils 0,17. Die Randsummen betragen bei beiden Produkten und beiden Geschlechtern jeweils 0,5, die Gesamtsumme beträgt 1.

Relative Häufigkeiten können außerdem auf einzelne Zeilen oder Spalten bezogen werden. Im Beispiel ergeben sich innerhalb der betreffenden Gruppen Anteile von 0,66 und 0,34; die jeweilige Bezugszeile oder Bezugsspalte summiert sich dann zu 1.

Scheinkorrelation und dritte Variable

Die zweidimensionale Tabelle erweckt zunächst den Eindruck, Frauen neigten zu Produkt A und Männer zu Produkt B. Eine weitere Auswertung nach Alter zeigt jedoch: Von den bis zu 40-Jährigen bevorzugen 700 Produkt A und 300 Produkt B; bei den über 40-Jährigen bevorzugen 300 Produkt A und 700 Produkt B. Das Kaufverhalten hängt damit auch mit dem Alter zusammen. Um solche Beziehungen gemeinsam zu untersuchen, wird eine dreidimensionale Kontingenztafel mit drei Merkmalen verwendet.

In der dreidimensionalen Tabelle werden Produkt, Alter und Geschlecht kombiniert. Bei den jüngeren Frauen bevorzugen 630 von 900, also 70 %, Produkt A; bei den jüngeren Männern sind es 70 von 100, ebenfalls 70 %. Bei den älteren Frauen bevorzugen 30 von 100, also 30 %, Produkt A; bei den älteren Männern sind es 270 von 900, ebenfalls 30 %. Für Produkt B gelten jeweils die umgekehrten Anteile von 30 % beziehungsweise 70 %. Innerhalb derselben Altersgruppe besteht somit keine Abhängigkeit der Produktneigung vom Geschlecht.

Der scheinbare Geschlechterunterschied entsteht durch die unausgewogene Zusammensetzung der Stichprobe: Unter den 1000 jüngeren Befragten sind 900 Frauen und 100 Männer, unter den 1000 älteren dagegen 100 Frauen und 900 Männer. Die jüngeren Personen bevorzugen Produkt A, die älteren Produkt B. Weil die jüngere Gruppe überwiegend weiblich und die ältere überwiegend männlich ist, erscheint das Geschlecht in der zweidimensionalen Betrachtung fälschlich als entscheidender Zusammenhang.

Anforderungen an Kategorien

Die verwendeten Kategorien müssen für statistische Auswertungen sorgfältig gebildet werden.

• Kategorien sollen streng genommen voneinander unabhängig beziehungsweise überschneidungsfrei sein. Eine Person soll nicht gleichzeitig mehreren Ausprägungen desselben Merkmals zugeordnet werden. Überschneidungen führen dazu, dass sich die Randhäufigkeiten nicht zu n beziehungsweise bei relativen Häufigkeiten nicht zu 1 addieren. Als problematisches Beispiel nennt der Artikel die Kategorien „hat Grundschule besucht“ und „hat Berufslehre abgeschlossen“, weil Mitglieder der zweiten Gruppe normalerweise zugleich zur ersten gehören.

• Es soll keine Zeile und keine Spalte geben, deren Häufigkeiten sich zu null addieren. In einer ausschließlich männlichen oder ausschließlich weiblichen Grundgesamtheit wäre daher eine Aufteilung in „männlich“ und „weiblich“ ungeeignet. Bei statistischen Berechnungen kann der Kehrwert einer solchen Summe auftreten; 1/0 ist nicht definiert.

• Eine Sammelkategorie „Sonstige“ sollte möglichst selten verwendet und, falls sie nötig ist, so klein wie möglich gehalten werden. Bei Kategorien wie „fährt Opel“, „fährt Peugeot“, „fährt Toyota“ und „fährt anderen Personenwagen“ sollte der letzte Sammelbereich durch eine durchdachte Einteilung begrenzt werden.

Grafische Darstellung

Zweidimensionale Kontingenztafeln lassen sich als 3D-Balkendiagramm darstellen. Dabei können Balken jedoch je nach Blickwinkel verdeckt werden. Auch die Perspektive erschwert den Vergleich der Balkenhöhen und damit die Beurteilung, welche Zelle mehr Beobachtungen enthält.

Bei Tafeln mit relativ wenigen Zellen kann ein gestapeltes Säulendiagramm verwendet werden, das sich auf relative Spaltenhäufigkeiten bezieht.

Als bessere Darstellung nennt der Artikel den Mosaikplot. Darin entsprechen die Flächen den Häufigkeiten der jeweiligen Kombinationen von Merkmalsausprägungen. Außerdem lässt sich die Unabhängigkeit von zwei oder mehr Variablen leicht darstellen. Als Beispiel wird ein Mosaikplot der Titanic-Passagiere nach Klasse, Geschlecht und Überleben genannt.

Statistische Auswertung

Bei komplexen Kontingenztafeln können Zusammenhänge nicht mehr zuverlässig mit dem Auge erkannt werden. Zur systematischen Untersuchung stehen verschiedene statistische Verfahren zur Verfügung.

Zusammenhangsmaße beschreiben die Stärke einer Beziehung. Dazu gehören als Kontingenzkoeffizienten der χ²-Koeffizient, der Kontingenzkoeffizient und seine korrigierte Form, Cramérs V sowie der Phi-Koeffizient. Als Fehlerreduktionsmaße werden Goodman und Kruskals λ beziehungsweise τ sowie der Unsicherheitskoeffizient eingesetzt.

Tests prüfen, ob Merkmale statistisch unabhängig sind. Genannt werden der Chi-Quadrat-Unabhängigkeitstest, der Vierfeldertest und der Exakte Test nach Fisher. Chi-Quadrat-Tests können unter gewissen Bedingungen verwendet werden, um von Zusammenhängen in einer Stichprobe auf Eigenschaften der zugrunde liegenden Grundgesamtheit zu schließen. Der Exakte Fisher-Test eignet sich auch bei kleinen Stichproben.

Als weiteres Analyseverfahren wird das log-lineare Modell aufgeführt.

Weiterlesen

Absolute Häufigkeit Die absolute Häufigkeit ist das Ergebnis einer einfachen Zählung von Objekten oder Ereignissen (besser Elementarereignissen). Sie gibt an, wie viele Elemente … Relative Häufigkeit Sie wird berechnet, indem die absolute Häufigkeit eines Merkmals in einer zugrundeliegenden Menge durch die Anzahl der Objekte in dieser Menge geteilt wird. Die … Konjunktion (Logik) Gelesen wird die Konjunktion zweier Aussagen A, B meist als „A und B“. In der klassischen Logik ist die Konjunktion zweier Aussagen „A und B“ genau dann wahr, … Zufallsstichprobe In der mathematischen Statistik sind Zufallsstichproben die Grundlage für den Rückschluss von der Stichprobe auf Eigenschaften der Grundgesamtheit. Die … Chi-Quadrat-Test Chi-Quadrat-Test · Verteilungstest (auch Anpassungstest genannt): Hier wird geprüft, ob vorliegende Daten auf eine bestimmte Weise verteilt sind. Statistischer Test Ein statistischer Test dient in der Testtheorie, einem Teilgebiet der mathematischen Statistik, dazu, anhand vorliegender Beobachtungen eine begründete … Grundgesamtheit Die Grundgesamtheit bezeichnet diejenige Menge aller Objekte, über die eine Aussage getroffen werden soll. Grundgesamtheiten werden häufig nur unvollständig … Kehrwert Daraus folgt die Rechenregel für das Dividieren durch einen Bruch: Durch einen Bruch wird dividiert, indem man mit seinem Kehrwert multipliziert. Siehe auch … Säulendiagramm Das Säulendiagramm, bei schmalen Säulen auch Stabdiagramm genannt, ist ein Diagramm zur vergleichenden Darstellung, das durch auf der x {\displaystyle x} … Titanic (Schiff) Die RMS Titanic (englisch [taɪˈtænɪk]) war ein britischer Passagierdampfer der Reederei White Star Line. Bei ihrer Fertigstellung im Frühjahr 1912 war sie …