Wikipedia · einfach zusammengefasst · Stand
McNemar-Test
Der McNemar-Test ist ein statistischer Test für verbundene Stichproben, bei denen ein dichotomes Merkmal betrachtet wird, wie es z.
Inhalt6 Abschnitte
Kernidee und Anwendungsbereich
Der McNemar-Test ist ein statistischer Test für verbundene Stichproben mit einem dichotomen Merkmal. Dichotom bedeutet: Es gibt nur zwei mögliche Ausprägungen, zum Beispiel positiv/negativ, dafür/dagegen oder Raucher/Nichtraucher. Verbundene Stichproben liegen vor, wenn die Beobachtungen zusammengehören, etwa weil dieselben Personen zweimal untersucht werden. Ein typischer Fall ist ein Vorher-Nachher-Vergleich in der medizinischen Statistik.
Der Test prüft, ob zwischen zwei verbundenen Messungen eine Veränderung eingetreten ist. Dabei geht es nicht um alle Einträge einer Vierfeldertafel, sondern vor allem um die Fälle, die sich geändert haben. Wenn bei einer Person das Ergebnis in beiden Messungen gleich bleibt, trägt sie wenig zur Frage bei, ob eine Veränderung stattgefunden hat. Entscheidend sind die beiden Zellen mit unterschiedlichen Ergebnissen, meist mit b und c bezeichnet.
Mathematische Formulierung
Die Daten werden in einer Vierfeldertafel dargestellt. Die Zellen a und d enthalten die Fälle, bei denen beide Stichproben dasselbe Ergebnis zeigen, also etwa (0,0) oder (1,1). Die Zellen b und c enthalten die Fälle, bei denen sich das Ergebnis zwischen Stichprobe 1 und Stichprobe 2 unterscheidet.
Der McNemar-Test prüft bei einer verbundenen Stichprobe, ob eine Veränderung eingetreten ist. Wenn es keine Veränderungen gab, müssten die Randhäufigkeiten ungefähr übereinstimmen, also a+b≈a+c beziehungsweise c+d≈b+d. Für die Wahrscheinlichkeiten des Auftretens der Tabellenfelder lauten die Hypothesen zunächst:
H0: p_a + p_c = p_a + p_b
H1: p_a + p_c ≠ p_a + p_b
Diese Hypothesen sind äquivalent zu:
H0: p_c = p_b
H1: p_c ≠ p_b
Die Nullhypothese H0 sagt also: Die beiden Arten von Wechseln treten gleich häufig auf. Die Alternativhypothese H1 sagt: Die beiden Arten von Wechseln treten nicht gleich häufig auf. Der Test ist zweiseitig: Er prüft, ob eine Veränderung besteht, aber nicht direkt, ob es sich um eine Zunahme oder Abnahme handelt.
Exakter Test und Chi-Quadrat-Test
Für den exakten Test betrachtet man nur die Beobachtungen in den beiden Wechsel-Zellen, also „links unten“ und „rechts oben“ in der Kontingenztabelle. Diese Beobachtungen werden als zufällige Ziehungen mit zwei möglichen Ergebnissen aufgefasst. Ist π die Wahrscheinlichkeit, dass eine Beobachtung „links unten“ landet, dann entsprechen die Hypothesen des McNemar-Tests einem Binomialtest:
H0: π = 0,5
H1: π ≠ 0,5
Die Teststatistik B, also die „Anzahl der Beobachtung rechts oben“, ist dann binomialverteilt mit B(b+c; 0,5), analog gilt dies für C. In SPSS wird der exakte Test zum Beispiel beim McNemar-Test verwendet, wenn b+c<25 ist.
McNemar verwendete 1947 einen χ²-Test zur Lösung des Testproblems. Unter der Nullhypothese sind die erwarteten Zellhäufigkeiten für die beiden Wechsel-Zellen jeweils (b+c)/2. Daraus ergibt sich die Teststatistik:
X'^2 = (b-c)^2/(b+c)
Diese Teststatistik ist näherungsweise χ²-verteilt mit einem Freiheitsgrad. „Näherungsweise“ ist wichtig, weil die Häufigkeiten diskret sind, während die χ²-Verteilung stetig ist. Dadurch kann ein Approximationsfehler entstehen.
Stetigkeitskorrekturen
Um den Approximationsfehler zwischen diskreten Häufigkeiten und stetiger χ²-Verteilung zu verkleinern, wurde die Yates-Korrektur vorgeschlagen. Dabei wird vom Betrag der Abweichung |b-c| der Wert 0,5 abgezogen. Die Teststatistik lautet:
X^2 = ((|b-c|-0,5)^2)/(b+c)
Der Subtrahend 0,5 heißt Yates-Korrektur. Unter der Voraussetzung einer symmetrischen Verteilung der beiden zu testenden Variablen beziehungsweise Stichproben verbessert diese Minderung die Approximation der χ²-verteilten Prüfgröße an die Ergebnisse des exakten Tests nach Fisher. Sie ist vor allem für kleinere Stichproben nötig, nämlich bei b+c<30, und kann bei größeren Stichproben weggelassen werden.
Da die Yates-Korrektur ursprünglich für 2x2-Kreuztabellen entwickelt wurde, beim McNemar-Test aber faktisch eine 2x1-Kreuztabelle betrachtet wird, kann sie hier zu stark korrigieren. Deshalb wird oft die Edwards-Korrektur verwendet:
X*^2 = ((|b-c|-1)^2)/(b+c)
In SPSS und R wird beim McNemar-Test mit Stetigkeitskorrektur die Edwards-Korrektur verwendet. Die Frage, ob 0,5 oder 1 abgezogen wird, spielt vor allem bei kleinen Stichprobenumfängen eine Rolle.
Praktisches Vorgehen
Beim praktischen Vorgehen vergleicht man die beiden Häufigkeiten b und c, also die Fälle, in denen die beiden verbundenen Stichproben unterschiedliche Ergebnisse zeigen. Dazu betrachtet man das Verhältnis des Unterschieds zwischen b und c zur Summe b+c. Die im Artikel angegebene Rechenvorschrift lautet:
X^2 = ((|b-c|-0,5)^2)/(b+c)
Die so berechnete Prüfgröße wird mit einem Wert der χ²-Verteilung verglichen, und zwar mit 1 Freiheitsgrad und einem passenden Konfidenzniveau. Häufig wird ein 95-%-Konfidenzniveau beziehungsweise ein 5-%-Signifikanzniveau verwendet. Für 1 Freiheitsgrad und das 95-%-Quantil beträgt der Vergleichswert zum Beispiel 3,84.
Ist die errechnete Prüfgröße gleich groß wie oder größer als der Vergleichswert, kann man von einem statistisch signifikanten Unterschied zwischen den beiden Stichproben ausgehen. Der Test sagt aber an sich nicht, ob diese Signifikanz eine Verbesserung oder Verschlechterung bedeutet. Die Richtung der Veränderung muss aus den Daten erschlossen werden, je nachdem, ob größere Häufigkeiten in Feld b oder c auftreten.
Liegen stetige Daten vor oder diskrete Daten mit zu vielen Merkmalsklassen, verwendet man oft die Mediandichotomisierung. Dabei werden die Daten in zwei Gruppen eingeteilt, damit sie mit dem McNemar-Test überprüft werden können.
Beispiele
Im Beispiel zur Anti-Rauch-Kampagne soll untersucht werden, ob eine Kampagne die Anzahl der Raucher reduziert. Dazu wird vor und nach der Kampagne erfasst, wer raucht und wer nicht raucht. Für den McNemar-Test interessieren nur die „Wechsler“, also Personen, deren Rauchverhalten sich zwischen den beiden Messungen verändert hat. Wenn die Kampagne keinen Einfluss hätte, sollte es ungefähr genauso viele Raucher geben, die zu Nichtrauchern werden, wie Nichtraucher, die zu Rauchern werden. Ein signifikanter McNemar-Test zeigt aber zunächst nur, dass eine Veränderung stattgefunden hat. Um zu beurteilen, ob die Zahl der Raucher abgenommen hat, muss man b und c ansehen. In diesem Fall müsste b deutlich kleiner sein als c, weil c für die Raucher steht, die zu Nichtrauchern geworden sind.
Im Beispiel „Autofreier Sonntag“ wurden 40 Personen vor und nach einem autofreien Sonntag gefragt, ob sie dafür oder dagegen sind. Die Tabelle enthält 8 Personen, die vorher und nachher dafür waren, 11 Personen, die vorher und nachher dagegen waren, 5 Personen, die von dafür zu dagegen wechselten, und 16 Personen, die von dagegen zu dafür wechselten. Die unveränderten Meinungen 8 und 11 sagen nichts über mögliche Veränderungen aus. Geprüft wird:
H0: p_dafür→dagegen = p_dagegen→dafür
H1: p_dafür→dagegen ≠ p_dagegen→dafür
Mit b=5 und c=16 ergeben sich die Prüfwerte v=5,2500 bei der Korrektur mit -0,5 und v*=4,7619 bei der Korrektur mit -1. Für α=5 % beträgt der kritische Wert χ²_1;0,95=3,84. Da beide Prüfwerte größer sind, wird die Nullhypothese in beiden Fällen abgelehnt. Es gibt also eine signifikante Veränderung in den Auffassungen.
Beim exakten Test ist B, die „Anzahl der geänderten Meinungen von dafür nach dagegen“, unter der Nullhypothese binomialverteilt mit B(n=b+c; p=0,5). Die kritischen Werte sind 6 und 15; liegt b oder c im Intervall [6;15], kann die Nullhypothese nicht verworfen werden. Im Beispiel wird sie auch mit dem exakten Test verworfen. Die angegebenen p-Werte sind 0,0266 für den exakten Test, 0,0291 für die Stetigkeitskorrektur nach Edwards mit -1 und 0,0219 für die Stetigkeitskorrektur nach Yates mit -0,5.