Zum Inhalt springen
L

Wikipedia · einfach zusammengefasst · Stand

P-Wert

Der p-Wert (nach R. A. Fisher), auch Überschreitungswahrscheinlichkeit oder Signifikanzwert genannt ( p {\displaystyle p} {\displaystyle p} …

Inhalt6 Abschnitte
  1. 1. Grundidee und Bedeutung
  2. 2. Mathematische Definition und Testentscheid
  3. 3. Beispiel: Test einer Münze
  4. 4. Beziehung zum Signifikanzniveau
  5. 5. Fehlinterpretationen und Kritik
  6. 6. Weitere Eigenschaften und Alternativen

Grundidee und Bedeutung

Der p-Wert ist in der Statistik, besonders in der Testtheorie, ein Maß dafür, wie stark ein beobachtetes Ergebnis gegen die Nullhypothese spricht. Die Nullhypothese H₀ besagt häufig, dass kein bestimmter Zusammenhang besteht, etwa dass ein neues Medikament nicht wirksam ist. Der p-Wert wurde von R. A. Fisher eingeführt und wird auch Überschreitungswahrscheinlichkeit oder Signifikanzwert genannt.

Definiert ist der p-Wert als die Wahrscheinlichkeit, unter der Annahme, dass die Nullhypothese tatsächlich gilt, den beobachteten Wert der Prüfgröße oder einen in Richtung der Alternativhypothese noch extremeren Wert zu erhalten. Je kleiner der p-Wert, desto weniger stützen die Daten die Nullhypothese. Er kann Werte zwischen 0 und 1 annehmen; dadurch lassen sich Ergebnisse verschiedener Tests vergleichen. Sein konkreter Wert hängt von der gezogenen Stichprobe ab.

Üblicherweise wird ein Signifikanzniveau α vor dem Test festgelegt. Ist p < α, wird die Nullhypothese verworfen; das Ergebnis heißt dann statistisch signifikant. „Signifikant“ bedeutet dabei lediglich „überzufällig“ und nicht automatisch praktisch relevant oder wissenschaftlich bedeutsam. Die Größe des p-Werts macht außerdem keine Aussage über die Größe des wahren Effekts. Häufig verwendete Schwellenwerte sind 5 %, 1 % und 0,1 %.

Mathematische Definition und Testentscheid

Bei einem statistischen Test wird aus den Zufallsgrößen X₁, X₂, …, Xₙ eines Zufallsexperiments eine Prüfgröße T gebildet:

T = u(X₁, X₂, …, Xₙ).

Für einen konkreten Versuchsausgang X₁ = x₁, X₂ = x₂, …, Xₙ = xₙ ergibt sich der beobachtete Wert t = u(x₁, x₂, …, xₙ). Der p-Wert ist die Wahrscheinlichkeit unter H₀, den Wert t oder einen in Richtung der Alternative extremeren Wert zu beobachten. Für zusammengesetzte Nullhypothesen ist diese bedingte Wahrscheinlichkeit nur nach oben abschätzbar.

Ordnet eine Abbildung α ↦ T₁(α) jedem α ∈ (0,1) den zugehörigen Ablehnungsbereich zu, lautet die Definition:

p(t) := inf{α | t ∈ T₁(α)}.

Für einen rechtsseitigen Test gilt pᵣₑcₕₜₛ := P(T ≥ t | H₀), für einen linksseitigen Test pₗᵢₙₖₛ := P(T ≤ t | H₀). Bei einem zweiseitigen Test gilt p = 2 · min{pᵣₑcₕₜₛ, pₗᵢₙₖₛ}.

Der p-Wert entspricht damit dem kleinsten Signifikanzniveau, bei dem die Nullhypothese gerade noch verworfen werden kann. Ist p kleiner als das vorab festgelegte α, wird H₀ verworfen; andernfalls kann H₀ nicht verworfen werden. In der frequentistischen Sichtweise enthält der p-Wert keine zusätzliche Information über die Entscheidung hinaus, ob p ≤ α gilt. Diese Bedingung ist gleichbedeutend damit, dass die beobachtete Prüfgröße in der kritischen Region liegt.

Beispiel: Test einer Münze

Eine Münze soll darauf geprüft werden, ob sie fair ist. Die Nullhypothese H₀ lautet, dass Kopf und Zahl gleich wahrscheinlich sind. Die Alternativhypothese besagt, dass eines der beiden Ergebnisse wahrscheinlicher ist, ohne festzulegen, welches. Die Münze wird 20-mal geworfen; K bezeichnet die Anzahl der Kopf-Ergebnisse. Bei einer fairen Münze wären 10-mal Kopf zu erwarten. Deshalb wird als Prüfgröße Y = |K − 10| gewählt.

Ergibt sich K = 14, dann ist y = 4. Unter H₀ ist die Anzahl der Köpfe binomialverteilt mit n = 20 und p = 1/2. Der p-Wert ist

P(Y ≥ 4 | H₀) = 2 · (1 / 2²⁰) · ∑ⱼ₌₀⁶ (20 über j) ≈ 0,115.

Auf dem Signifikanzniveau α = 5 % = 0,05 wird H₀ nicht verworfen, weil 0,115 > 0,05. Aus diesen Daten kann daher nicht gefolgert werden, dass die Münze nicht fair ist.

Ergibt sich dagegen K = 15, also y = 5, beträgt der p-Wert

P(Y ≥ 5 | H₀) = 2 · ∑ⱼ₌₀⁵ (20 über j) / 2²⁰ ≈ 0,041.

Auf dem Niveau α = 5 % = 0,05 wird H₀ nun verworfen, weil 0,041 < 0,05. Man würde schließen, dass die Münze nicht fair ist. Auf dem Niveau von 1 % wären weitere Tests nötig. Das Nichtverwerfen von H₀ ist jedoch kein Beweis dafür, dass die Münze fair ist.

Beziehung zum Signifikanzniveau

Die Entscheidung mithilfe eines p-Werts ist äquivalent zu einem Test mit einem vorher festgelegten Signifikanzniveau und kritischen Wert. Für einen rechtsseitigen Test gelten:

p = P(T ≥ t | H₀),

α = P(T ≥ k | H₀),

p < α ⇔ t > k.

Dabei ist t der beobachtete Wert der Prüfgröße und k der kritische Wert. Ist p kleiner als α, liegt die Prüfgröße im Ablehnungsbereich und die Nullhypothese wird abgelehnt. In statistischer Software wird häufig direkt der p-Wert, etwa als „Asymptotische Signifikanz“, ausgegeben.

Die Software muss dann nicht ausdrücklich nach einem Signifikanzniveau fragen, um eine Testentscheidung zu ermöglichen. Gleichzeitig besteht die Gefahr, dass Forschende das eigentlich vorab festzulegende α nachträglich anpassen, bis das gewünschte Ergebnis entsteht.

Fehlinterpretationen und Kritik

Der p-Wert wird häufig falsch interpretiert. Er gibt nicht an, wie wahrscheinlich die Nullhypothese angesichts des Stichprobenergebnisses wahr ist. Ein kleiner p-Wert beschreibt vielmehr, wie extrem das Ergebnis unter der Annahme von H₀ ist.

Folgende Aussagen sind falsch:

  • Bei p = 0,05 beträgt die Wahrscheinlichkeit, dass H₀ wahr ist, 5 %.
  • Ein nicht signifikanter Unterschied zwischen zwei Mittelwerten bedeutet, dass die Mittelwerte gleich sind.
  • Nur ein signifikanter Unterschied kann praktisch oder klinisch wichtig sein.

Die American Statistical Association veröffentlichte 2016 eine Mitteilung zum Umgang mit p-Werten und statistischer Signifikanz. Einer kleinen kanadischen Feldstudie von 2019 zufolge werden p-Wert und statistische Signifikanz in etlichen Lehrbüchern nicht korrekt vermittelt. Studien von Oakes (1986) sowie Haller & Krauss (2002) zeigen, dass viele Studierende und Lehrende der Statistik p-Werte nicht richtig interpretieren können. Die falsche Verwendung und Manipulation von p-Werten, etwa durch p-Hacking, ist eine Kontroverse der Meta-Forschung.

Kritisiert wird insbesondere, dass die Entscheidung über statistische Signifikanz oft auf der willkürlichen Schwelle 0,05 beruht und dadurch viele falsch-positive Ergebnisse entstehen können. Der Anteil signifikanter Tests, bei denen H₀ tatsächlich wahr ist, kann beträchtlich höher als das Signifikanzniveau sein. Er hängt unter anderem davon ab, wie viele geprüfte Nullhypothesen falsch sind und wie hoch die Trennschärfe des Tests ist. Beinahe identische Datensätze können zu p-Werten führen, die sich stark hinsichtlich der Signifikanz unterscheiden. Bei Studien mit niedriger Trennschärfe, etwa in der Psychologie, können Signifikanztests zu höheren Fehlerraten führen. Die Signifikanzschwelle sollte deshalb nicht ohne Berücksichtigung der Folgen falsch-positiver und falsch-negativer Ergebnisse festgelegt werden.

Weitere Eigenschaften und Alternativen

Hat die Prüfgröße unter einer einpunktigen Nullhypothese eine stetige Verteilung, ist der p-Wert gleichverteilt auf dem Intervall [0,1].

Als Erweiterung gibt es p-Werte der zweiten Generation. Sie sollen verhindern, dass extrem kleine, praktisch irrelevante Effektgrößen als signifikant bewertet werden. In der bayesschen Statistik ist der Bayes-Faktor eine Alternative zum p-Wert.

Eine weitere Alternative beziehungsweise Umformung ist der S-Wert oder Überraschungswert. Er wird definiert als:

S-Wert = −log₂(p-Wert).

Die logarithmische Skala soll anschaulicher ausdrücken, wie „überrascht“ man über ein Ergebnis ist. Kleinere p-Werte führen dabei zu größeren S-Werten.

Weiterlesen