Wikipedia · einfach zusammengefasst · Stand
Statistische Signifikanz
Statistisch signifikant wird das Ergebnis eines statistischen Tests genannt, wenn Stichprobendaten so stark von einer vorher festgelegten Annahme (der …
Inhalt6 Abschnitte
Bedeutung und Grundlagen
Statistisch signifikant ist das Ergebnis eines statistischen Tests, wenn Stichprobendaten so stark von einer vorher festgelegten Annahme, der Nullhypothese, abweichen, dass diese nach einer vorher festgelegten Regel verworfen wird. Die Nullhypothese lautet bei vielen Untersuchungen vereinfacht: Es liegt kein Unterschied, kein Effekt oder keine Wirkung vor.
Für die Prüfung muss ein statistischer Test zum Datenmaterial und zu den untersuchten Parametern sowie deren Wahrscheinlichkeitsfunktion passen. Nur dann kann der p-Wert mathematisch korrekt berechnet werden. Der p-Wert gibt unter der Annahme, dass die Nullhypothese zutrifft, die Wahrscheinlichkeit an, ein Stichprobenergebnis wie das beobachtete oder ein noch extremeres Ergebnis zufallsbedingt zu erhalten. Er liegt zwischen 0 und 1 und beschreibt, welcher Anteil entsprechender Ergebnisse bei unendlich vielen Zufallsstichproben aus derselben Grundgesamtheit zu erwarten wäre.
Vor der Testdurchführung wird ein Signifikanzniveau α festgelegt. Der p-Wert wird mit dieser kritischen Schwelle verglichen. Liegt er höchstens beim Signifikanzniveau, wird die Nullhypothese verworfen und das Ergebnis als statistisch signifikant bezeichnet. Das Signifikanzniveau begrenzt dabei die Wahrscheinlichkeit eines Fehlers 1. Art: einer fälschlichen Ablehnung einer richtigen Nullhypothese.
Die statistische Signifikanz hängt besonders von der Stichprobengröße, der Repräsentativität und der Varianz ab. Eine kleine Stichprobe bildet die Grundgesamtheit möglicherweise weniger gut ab; zufällige Unterschiede fallen dann stärker ins Gewicht. Eine Stichprobe ist repräsentativ, wenn sie die Grundgesamtheit in ihren wesentlichen Merkmalen abbildet. Die Varianz bezeichnet die Streuung der Werte innerhalb der untersuchten Gruppe.
Typische Prüfungsfragen
Statistische Signifikanz wird typischerweise genutzt, um zu prüfen, ob ein beobachteter Unterschied oder Zusammenhang über zufällige Schwankungen hinausgeht:
- Wenn 55 % der Frauen zu Partei A tendieren, während 53 % der Männer Partei B bevorzugen, ist dies ein tatsächlicher Unterschied in der politischen Überzeugung oder lediglich eine Folge der zufälligen Auswahl der Befragten?
- Wenn ein neues Medikament eine höhere Heilungsrate zeigt als keine Behandlung, wirkt das Medikament tatsächlich oder wären die ausgewählten Patienten auch ohne Behandlung gesund geworden?
- Wenn eine bestimmte Krankheit in der Umgebung einer Chemiefabrik besonders häufig auftritt, handelt es sich um Zufall oder um einen Zusammenhang?
Der Test beantwortet dabei nur, wie gut die beobachteten Daten mit der Nullhypothese vereinbar sind. Fragen nach der Stärke eines Effekts, seiner praktischen Bedeutung oder seiner Übertragbarkeit auf andere Bedingungen beantwortet er nicht.
Irrtumswahrscheinlichkeit, Signifikanzniveau und Testfehler
Der Fehler 1. Art, auch α-Fehler oder Irrtumswahrscheinlichkeit genannt, tritt auf, wenn eine richtige Nullhypothese verworfen wird. Das Signifikanzniveau ist die obere Grenze dieser Wahrscheinlichkeit, die man noch akzeptieren will. Es ist grundsätzlich frei wählbar; häufig wird α = 5 % verwendet. Bei einer richtigen Nullhypothese bedeutet dies, dass sie im Mittel in höchstens 5 % der entsprechenden Untersuchungen fälschlich verworfen wird – etwa bei einem tatsächlich wirkungslosen Medikament, das dennoch als wirksam erscheint.
Bei α = 0,05 darf die Wahrscheinlichkeit eines Fehlers 1. Art höchstens 5 % betragen. Die Wahrscheinlichkeit, eine richtige Nullhypothese aufgrund des Tests nicht abzulehnen, beträgt dann 1 − α = 0,95, also mindestens 95 %. Bei gravierenden Folgen einer Fehlentscheidung kann ein niedrigeres Niveau, etwa 1 % oder 0,1 %, gewählt werden.
Der Fehler 2. Art liegt vor, wenn eine falsche Nullhypothese nicht abgelehnt wird. Seine Wahrscheinlichkeit wird mit β bezeichnet, im Artikel als Pr(H₀ | H̄₀) = β angegeben. Sie ist in der Regel umso größer, je kleiner das Signifikanzniveau ist. In einem Beispiel beträgt die zugrunde liegende Wahrscheinlichkeit p = ¼; geprüft wird die Hypothese p = 1/5. Bei 25 Versuchsdurchführungen wird die falsche Hypothese bei α = 5 % mit 93 % und bei α = 1 % mit 99 % für richtig befunden. Bei 1000 Versuchen liegen die entsprechenden Werte bei 3,6 % beziehungsweise 11,4 %.
Häufige Schwellen sind p ≤ 5 % für „signifikant“, p ≤ 1 % für „sehr signifikant“ und p ≤ 0,1 % für „hoch signifikant“. Diese Einteilung ist jedoch willkürlich, muss an die Anwendung angepasst und durch Wiederholungen bestätigt werden. Nicola Döring weist darauf hin, dass es in der Logik des klassischen Signifikanztests nicht sinnvoll ist, erst nach der Hypothesenprüfung bei sehr kleinem p-Wert von „hoch signifikant“ oder „höchst signifikant“ zu sprechen. In der strikten Neyman-Pearson-Testtheorie sind solche nachträglichen Signifikanzgrade nicht vorgesehen; zusätzliche Informationen wie der p-Wert sollen anders angegeben werden. Für den Nachweis des Higgs-Bosons wurde beispielsweise ein wesentlich strengeres Kriterium von 5 Standardabweichungen verwendet, entsprechend einem p-Wert von 1 in 3,5 Millionen.
Bei parametrischen Modellen hängen die Wahrscheinlichkeiten verschiedener Fehlentscheidungen vom unbekannten Verteilungsparameter ϑ ab und können mithilfe der Gütefunktion des Tests bestimmt werden. Ein Signifikanzniveau von 5 % ist zudem kein allgemeiner Beleg für eine neue Entdeckung, da bei richtiger Nullhypothese im Mittel 5 % der Untersuchungen trotzdem signifikant ausfallen.
Aussagewert, Trennschärfe und methodische Prüfung
Statistische Signifikanz und praktische Relevanz sind nicht dasselbe. Eine große Fallzahl kann wegen der hohen Trennschärfe, auch Teststärke genannt, zu sehr kleinen p-Werten führen. Der beobachtete Effekt oder Parameter kann trotzdem so klein sein, dass er praktisch kaum Bedeutung hat. Die statistische Signifikanz ist deshalb ein notwendiges, aber kein hinreichendes Kriterium für eine praktisch relevante Aussage. Zur Beurteilung der Relevanz ist die Effektstärke beziehungsweise Effektgröße wichtig.
Auch eine signifikante Studie muss methodisch kritisch geprüft werden. Dabei sind insbesondere folgende Punkte wichtig:
- Sind die statistischen Modellannahmen, etwa die angenommene Verteilung, korrekt?
- Wie viele statistische Tests wurden durchgeführt? Bei mehreren Tests sollte das Signifikanzniveau angepasst werden, wenn nicht eindeutig ein primärer Test festgelegt wurde.
- Wurden die Analysemethoden vor der „Entblindung“ einer doppelblinden Studie prospektiv definiert?
- Welche Folgen hätten ein Fehler 1. Art oder ein Fehler 2. Art, insbesondere mögliche Gefährdungen von Gesundheit und Leben?
Das Studiendesign beeinflusst die Aussagekraft erheblich. Als Qualitätsmerkmale gelten beispielsweise randomisierte, kontrollierte und doppelblinde Untersuchungen. Fehlen solche Eigenschaften, sind Aussagen etwa über die Wirksamkeit von Therapien mit äußerster Vorsicht zu behandeln.
Häufige Fehlinterpretationen
Der p-Wert oder das Signifikanzniveau geben nicht die Wahrscheinlichkeit an, dass die Nullhypothese oder eine Alternativhypothese wahr beziehungsweise falsch ist. Ebenso legen sie weder die Effektgröße noch die praktische Bedeutung eines Ergebnisses fest. Das Signifikanzniveau beschreibt ausschließlich die höchstens zugelassene Wahrscheinlichkeit eines Fehlers 1. Art unter der Voraussetzung, dass die Nullhypothese richtig ist.
„Signifikant“ bedeutet außerdem nicht automatisch „deutlich“. Eine geringfügige Änderung kann statistisch signifikant sein, wenn sie eindeutig gemessen wurde. Bei einer genügend großen Zahl von Messungen kann jeder tatsächlich vorhandene Effekt statistisch signifikant werden, auch wenn er praktisch unbedeutend ist.
Statistische Signifikanz ist auch nicht mit der Irrtumswahrscheinlichkeit gleichzusetzen. Statistikprogramme wie SPSS bezeichnen die Irrtumswahrscheinlichkeit teilweise missverständlich als „Sig.“ oder „Signifikanz“. Korrekt ist: Ein Ergebnis gilt als signifikant, wenn die für die konkrete Studie ermittelte Irrtumswahrscheinlichkeit nicht über dem zuvor festgelegten Signifikanzniveau liegt. Eine Wiederholung mit demselben Design kann trotzdem ein nicht signifikantes Ergebnis liefern.
Publikationsbias und fehlende Kausalität
Signifikante Ergebnisse werden eher veröffentlicht als nicht signifikante. Dadurch entsteht ein Publikationsbias: Die gesamte Bandbreite der durchgeführten Untersuchungen wird nicht sichtbar, sodass zufällige positive Ergebnisse die veröffentlichte Forschung verzerren können. Bei kleineren Studien werden zudem vor allem die größten Unterschiede oder stärksten Zusammenhänge signifikant; veröffentlichte Resultate überschätzen deshalb häufig die Effektgrößen. Auch p-Hacking und die Auswahl einzelner positiver Ergebnisse aus vielen vergleichbaren Untersuchungen verstärken dieses Problem.
Statistische Signifikanz beweist keinen kausalen Zusammenhang. Wenn in der Umgebung einer Chemiefabrik eine Krankheit signifikant häufiger vorkommt als in der Gesamtbevölkerung, folgt daraus nicht, dass die Fabrik die Ursache ist. Möglich wäre etwa, dass dort finanziell schwache Familien leben, die sich schlechter ernähren oder eine schlechtere Gesundheitsvorsorge haben. Die Kausalität könnte dann bei diesen Bedingungen liegen oder sogar darin, dass die Fabrik gerade an diesem Standort errichtet wurde.
Ebenso könnte die Krankheit wegen hoher Bevölkerungsdichte und größerer Ansteckungsgefahr in diesem Gebiet häufiger auftreten und die Fabrik nur zufällig dort stehen. In diesem Fall bestünde kein kausaler Zusammenhang. Wer nachträglich ein auffälliges Ereignis als Ursache einer signifikanten Häufung auswählt, begeht den Zielscheibenfehler. Der Schluss „cum hoc ergo propter hoc“ – aus gemeinsamem Auftreten auf Ursache und Wirkung zu schließen – ist logisch falsch.