Wikipedia · einfach zusammengefasst · Stand
Regressions-Diskontinuitäts-Analyse
Die Regressions-Diskontinuitäts-Analyse, bzw. Regressionsdiskontinuitätsanalyse (englisch regression discontinuity design) ist ein Verfahren der …
Inhalt5 Abschnitte
Zweck und Grundidee
Die Regressions-Diskontinuitäts-Analyse (RD-Analyse; englisch regression discontinuity design) ist ein Verfahren der schließenden Statistik und Ökonometrie zur Identifikation kausaler Effekte: Sie untersucht, wie die Veränderung einer Variablen andere Variablen verursacht verändert. Sie nutzt eine Diskontinuität, also einen sprunghaften Übergang, in einer beobachtbaren Kontroll- oder Zuteilungsvariable. Dieser Übergang führt nahe einer festgelegten Grenze zu einer nahezu zufälligen Einteilung in Behandlungs- und Kontrollgruppe.
Damit kann die RD-Analyse ein Endogenitätsproblem überwinden. Endogenität liegt hier vor, wenn die erklärende Variable mit dem Fehlerterm korreliert. Dann ist die Methode der kleinsten Quadrate inkonsistent: Ihr Schätzer bleibt auch bei großen Stichproben nicht unverzerrt. Die RD-Analyse zählt wie der Instrumentvariablen-Ansatz und der Differenz-von-Differenzen-Ansatz zu den natürlichen oder Quasi-Experimenten.
Beispiel Klassengrößen
Joshua Angrist und Viktor Lavy untersuchten 1999 den Effekt von Klassengrößen auf Schülerleistungen. Sie verwendeten die in Israel an öffentlichen Schulen genutzte „Regel von Maimonides“: Eine Klasse darf höchstens 40 Schüler haben; bei mehr Schülern muss eine zweite Klasse gebildet werden.
Dadurch entsteht ein Sprung: Bei 39 Schülern gibt es eine Klasse mit 39 Schülern, bei 40 Schülern dagegen zwei Klassen mit je 20 Schülern. Ob eine Schule gerade 39 oder 40 Schüler hat, wird nicht vollständig von den Beteiligten kontrolliert und ist teilweise zufällig. Diese exogene Variation ermöglicht eine konsistente Schätzung des Effekts der Klassengröße auf die Schülerleistung.
Scharfe RD-Analyse
Bei der scharfen RD-Analyse bestimmt die Kontrollvariable die Behandlung perfekt, sie ist also eine deterministische Funktion der Zuteilungsvariable. Das Modell lautet: Y = β₀ + β_DD + β_XX + U. Dabei ist D eine Indikatorvariable für die Behandlung, X die Zuteilungsvariable, U der Fehlerterm und X = c die Stelle der Diskontinuität. Im Klassenbeispiel bedeutet D „ist in einer kleinen Klasse“, X ist die Schülerzahl der Schule und c = 40.
Unter der Annahme, dass E(U|X) stetig ist, gilt: E(Y|X=c) − lim(x→c−) E(Y|X=x) = β_D. Der Behandlungseffekt entspricht somit der Differenz zwischen dem Erwartungswert am Schwellenwert und dem linksseitigen Grenzwert unmittelbar davor.
Für die Schätzung können die Daten so umskaliert werden, dass c der Nullpunkt ist. Anschließend werden links und rechts der Grenze zwei Kleinste-Quadrate-Schätzungen durchgeführt; die Differenz ihrer Konstanten liefert die Differenz der Erwartungswerte. Möglich ist auch eine einzige Kleinste-Quadrate-Schätzung mit Interaktionstermen. Wenn Behandlungseffekte zwischen Individuen variieren, schätzt die scharfe RD-Analyse den durchschnittlichen Behandlungseffekt E(β_Di).
Unscharfe RD-Analyse
Bei der unscharfen RD-Analyse bestimmt die Kontrollvariable die Behandlung nicht vollkommen, verändert aber deren Wahrscheinlichkeit oder Erwartungswert. Neben Y = β₀ + β_DD + β_XX + U gilt: D = γ_ZZ + γ_XX + V. Z hat dabei keinen direkten Effekt auf Y.
Der Effekt wird als Verhältnis zweier Sprünge bestimmt: β_D = [E(Y|X=c) − lim(x→c−) E(Y|X=x)] / [E(D|X=c) − lim(x→c−) E(D|X=x)]. Der Sprung im Ergebnis Y wird also durch den Sprung in der tatsächlichen Behandlung D geteilt.
Die Schätzung kann wie eine Instrumentvariablenschätzung erfolgen: Z dient als Instrument für D. Zuerst wird D auf Z regressiert. Die geschätzten Werte D̂ werden danach in einer zweiten Regression als erklärende Variablen für Y verwendet.
Stärken, Grenzen und Verbreitung
Ein wesentlicher Vorteil besteht darin, dass die Zuteilung nahe der Schwelle zufällig sein kann, wenn Individuen die Zuteilungsvariable X nicht beeinflussen können. Sogar unvollständige Kontrolle genügt: Dann kann die Verteilung um die Diskontinuitätsstelle dennoch zufällig sein. Anders als bei vielen anderen quasi-experimentellen Ansätzen muss diese quasi-zufällige Zuteilung nicht vor allem durch verbale Argumente begründet werden. RDD ist Teil der in der angewandten Ökonomie als „Glaubwürdigkeitsrevolution“ bezeichneten Forschungsagenda, deren Vertreter experimentelle und quasi-experimentelle Ansätze als Grundlage glaubwürdigerer Ergebnisse ansehen.
Ein Problem ist die mögliche Fehlspezifikation der funktionalen Form. Ist der tatsächliche Zusammenhang nicht linear, kann eine lineare Schätzung verzerrt und nicht erwartungstreu sein. Abhilfe können höhere Polynome wie X², X³, X⁴, … oder nichtparametrische Schätzungen schaffen. Außerdem ist die externe Validität eingeschränkt: Die Effekte werden streng genommen nur an der untersuchten Diskontinuität zuverlässig gemessen und lassen sich schwer auf andere Länder, Bevölkerungsgruppen oder Politikmaßnahmen übertragen. Christopher Sims bezeichnet RDD und verwandte Ansätze als „nützlich, aber […] keine Allheimittel“; Angus Deaton befürchtet, dass Durchführbarkeit gegenüber Relevanz wichtiger werden könnte.
Die Methode wurde 1960 erstmals von den Psychologen Donald L. Thistlewaite und Donald T. Campbell verwendet. In Ökonomie und Ökonometrie verbreitete sie sich erst Ende der 90er und Anfang der 2000er Jahre stärker; wichtige frühe Studien waren die von Angrist und Lavy sowie ein Artikel von Wilbert van der Klaauw aus dem Jahr 2002. Seither ist die RD-Analyse in der empirischen Ökonomie weit verbreitet.