Wikipedia · einfach zusammengefasst · Stand
Regressionsanalyse
Die Regressionsanalyse ist ein Instrumentarium statistischer Analyseverfahren, die zum Ziel haben, Beziehungen zwischen einer abhängigen (auch erklärte …
Inhalt6 Abschnitte
Kernidee und Zweck
Die Regressionsanalyse ist eine Gruppe statistischer Verfahren, mit denen Beziehungen zwischen einer abhängigen Variable und einer oder mehreren unabhängigen Variablen modelliert werden. Die abhängige Variable heißt auch erklärte Variable, Kriteriumsvariable, vorhergesagte Variable, Antwortvariable oder Regressand. Die unabhängigen Variablen heißen auch erklärende Variablen, Prädiktorvariablen, Kontrollvariablen oder Regressoren.
Regressionen dienen vor allem dazu, Zusammenhänge quantitativ zu beschreiben oder Werte der abhängigen Variablen vorherzusagen. Für sich genommen zeigen Regressionen nur Beziehungen in einem vorhandenen Datensatz. Wer sie für Vorhersagen oder für Aussagen über Kausalzusammenhänge verwenden will, muss zusätzlich begründen, warum der beobachtete Zusammenhang auch in einem neuen Kontext gilt oder warum er kausal interpretiert werden darf. Das ist besonders wichtig bei Beobachtungsdaten, weil Korrelation und Kausalzusammenhang nicht dasselbe sind.
Die häufigste Form ist die lineare Regression. Dabei wird eine Gerade, Ebene oder allgemein eine lineare Funktion gesucht, die nach einem mathematischen Kriterium möglichst gut zu den Daten passt. Die gewöhnliche Methode der kleinsten Quadrate minimiert die Summe der quadrierten Abweichungen zwischen beobachteten Werten und Modellwerten, also die Residuenquadratsumme. Eine Regression kann durch eine Entscheidungsregel auch zu einem Klassifikationsverfahren erweitert werden.
Ablauf einer Analyse
Am Anfang steht die Datenaufbereitung. Dazu gehören die Plausibilisierung der Daten, der Umgang mit fehlenden Daten und gegebenenfalls Transformationen. Bei Transformationen werden Daten zum Beispiel so umgeformt, dass sie besser interpretierbar oder visualisierbar sind oder dass die Annahmen eines Verfahrens besser erfüllt sind. Bei linearer Regression werden unter anderem ein linearer Zusammenhang zwischen unabhängigen und abhängigen Variablen sowie Homoskedastizität vorausgesetzt, also eine konstante Streuung der Fehler. Für Linearisierungen kann etwa die Box-Cox-Transformation verwendet werden. Bei linearer Regression können außerdem Interaktionen berücksichtigt werden, also gemeinsame Effekte mehrerer unabhängiger Variablen.
Bei der Modellanpassung wählt man zuerst ein Modell und schätzt dann seine Parameter. Allgemein besteht ein Regressionsmodell aus unabhängigen Variablen, einer abhängigen Variable, unbekannten Parametern und unbeobachtbaren Störgrößen. Häufig wird die Beziehung als Y_i = f(X_i, β) + ε_i beschrieben. Dabei ist f die zu schätzende Funktion, β steht für unbekannte Parameter und ε_i für statistisches Rauschen oder nicht modellierte Einflüsse.
Nach der Schätzung erhält man einen geschätzten Parameterwert, meist als β̂ geschrieben. Damit kann ein angepasster oder vorhergesagter Wert berechnet werden: Ŷ_i = f(X_i, β̂). Bei der Kleinste-Quadrate-Schätzung wird der Wert von β gesucht, der die Residuenquadratsumme ∑(Y_i − f(X_i, β))² minimiert. Damit ein Modell sinnvoll geschätzt werden kann, müssen genügend Daten vorhanden sein. Für ein Kleinste-Quadrate-Modell mit k Parametern braucht man mindestens N ≥ k unterschiedliche Datenpunkte. Wenn N > k ist, gibt es normalerweise keine perfekte Anpassung; N − k ist dann die Zahl der Freiheitsgrade. Außerdem müssen die unabhängigen Variablen linear unabhängig sein, damit die Matrix X^T X invertierbar ist und eine Lösung β̂ existiert.
Prüfung, Vorhersage und Modellwahl
Ein wichtiger Schritt ist die Modellvalidierung, also die Prüfung, ob das Modell den Zusammenhang gut beschreibt. Dazu gehört die Residuenanalyse. Residuen sind die geschätzten Abweichungen zwischen beobachteten und vom Modell vorhergesagten Werten. Viele Verfahren machen Annahmen über diese Residuen, etwa über ihre Verteilung, konstante Varianz oder fehlende Autokorrelation. Zur Prüfung der Verteilung wird oft ein Quantil-Quantil-Diagramm verwendet.
Weitere Validierungsschritte sind die Prüfung auf Überanpassung, Ausreißer, einflussreiche Datenpunkte und Multikollinearität. Überanpassung entsteht, wenn zu viele unabhängige Variablen in ein Modell aufgenommen werden; ein Testverfahren dafür ist die Kreuzvalidierung. Ausreißer passen schlecht zur geschätzten Funktion, einflussreiche Datenpunkte beeinflussen diese Funktion besonders stark. Hilfsmittel dafür sind Cook-Abstand und Mahalanobis-Abstand. Multikollinearität bedeutet, dass unabhängige Variablen linear zusammenhängen; sie kann die numerische Stabilität und die Interpretation erschweren. Gemessen wird sie zum Beispiel mit Varianzinflationsfaktor und Korrelationsmatrix.
Ein validiertes Modell kann zur Vorhersage von y-Werten für gegebene x-Werte genutzt werden. Häufig wird neben dem prognostizierten Wert ein Vorhersageintervall angegeben, um Unsicherheit auszudrücken. Vorhersagen innerhalb des Wertebereichs der zur Modellanpassung verwendeten Daten heißen Interpolation. Vorhersagen außerhalb dieses Bereichs heißen Extrapolation und verlangen besondere Vorsicht, weil dabei zusätzliche Annahmen gemacht werden.
Wenn untersucht werden soll, welche unabhängigen Variablen besonders stark mit der abhängigen Variable y zusammenhängen, werden oft mehrere Modelle verglichen. Dafür verwendet man Kennzahlen wie das Bestimmtheitsmaß oder Informationskriterien. Automatisierte Verfahren wie die schrittweise Regression versuchen nacheinander ein geeignetes Modell zu finden; ihre Anwendung wird jedoch kontrovers diskutiert. In der bayesschen Statistik gibt es außerdem Verfahren, die mehrere Modelle durch averaging zu einem neuen Modell verbinden, um Unsicherheit aus der Modellwahl zu verringern.
Wichtige Verfahren
Bei der linearen Regression ist die abhängige Variable y eine Linearkombination der Parameter β_j. Das Modell muss also in den Parametern linear sein, nicht unbedingt in den unabhängigen Variablen. Die einfache lineare Regression mit einer unabhängigen Variable lautet y_i = β_0 + β_1x_i + ε_i für i = 1, …, n. Bei der multiplen linearen Regression werden mehrere unabhängige Variablen oder Funktionen davon verwendet, zum Beispiel y_i = β_0 + β_1x_i1 + β_2(x_i2)^2 + ε_i. Obwohl hier eine unabhängige Variable quadratisch vorkommt, ist das Modell linear in β_0, β_1 und β_2. Die Parameter werden mit der Methode der kleinsten Quadrate bestimmt.
Nichtparametrische Regression gibt die Form des funktionalen Zusammenhangs f nicht fest vor, sondern leitet sie weitgehend aus den Daten ab. Bei der Schätzung der Regressionsfunktion m(·) an einem Punkt (x_1, …, x_k) erhalten nahe Datenpunkte mehr Gewicht als entfernte. Verfahren sind zum Beispiel Kernregression mit lokal konstanter, lokal linearer oder lokal polynomialer Regression sowie multivariate adaptive Regressionssplines (MARS), bei denen die abhängige Variable als Linearkombination von Hockeystick-Funktionen dargestellt wird.
Semiparametrische Regression kombiniert parametrische und nichtparametrische Ideen. Sie wurde unter anderem entwickelt, weil nichtparametrische Verfahren unter dem Fluch der Dimensionalität leiden: Je mehr erklärende Variablen es gibt, desto mehr Beobachtungen werden benötigt, um m(x_1, …, x_k) zuverlässig zu schätzen. Additive Modelle schreiben die unbekannte Regressionsfunktion als Summe nichtparametrischer Funktionen, etwa m(x_1, …, x_k) = b_0 + b_1g_1(x_1) + … + b_kg_k(x_k). Index-Modelle verwenden nichtparametrische Funktionen von linearen Indizes; bei M = 1 spricht man vom Single-Index-Modell, bei M > 1 von Projection-Pursuit-Regression.
Robuste Regression wurde entwickelt, weil Verfahren auf Basis der Kleinste-Quadrate-Schätzung oder Maximum-Likelihood-Schätzung nicht robust gegenüber Ausreißern sind. Eine Alternative sind zum Beispiel M-Schätzer.
Verallgemeinerte und spezielle Modelle
Verallgemeinerte lineare Modelle schwächen die Annahmen der klassischen linearen Regression ab. Dort wird vorausgesetzt, dass die Störgrößen ε_i normalverteilt sind. In verallgemeinerten linearen Modellen dürfen die Störgrößen eine Verteilung aus der exponentiellen Familie besitzen. Dafür verwendet man eine bekannte Kopplungsfunktion g(·), die von der Verteilungsklasse der Störgrößen abhängt, und bestimmt die Modellparameter mit der Maximum-Likelihood-Methode.
Ein Spezialfall ist die logistische Regression. Sie wird häufig verwendet, wenn die Antwortvariable Y kategorial ist und nur zwei oder endlich viele Werte annehmen kann. Für die binäre logistische Regression gilt g(μ) = log(μ/(1−μ)) = β_0 + β_1x_i1 + … + β_kx_ik + ε_i mit μ = P(Y = 1 | X = x). Eine Alternative ist das Probit-Modell.
Die Idee der Verallgemeinerung gibt es auch für semiparametrische Modelle. Dazu gehören verallgemeinerte additive Modelle (GAM) mit g(μ) = β_0 + f_1(x_1) + … + f_k(x_k), verallgemeinerte partiell lineare Modelle (GPLM) mit g(μ) = β_0 + β_1z_1 + … + β_kz_k + f(x_1, …, x_q) und verallgemeinerte additive partiell lineare Modelle (GAPLM) mit g(μ) = β_0 + β_1z_1 + … + β_kz_k + f_1(x_1) + … + f_q(x_q).
Bei der Tensorregression enthalten die Regressionsmodelle Tensoren. Solche Modelle sind vor allem bei hochdimensionalen oder großen Daten interessant. Viele klassische Modelle, zum Beispiel verallgemeinerte lineare Modelle, haben ein entsprechendes Analogon in der Tensorwelt. Bei autoregressiven Modellen werden geordnete Daten betrachtet, etwa Zeitreihen; dann können vorhergehende Datenpunkte als „unabhängige“ Variablen genutzt werden.
Anwendungen und Beispiel
Regressionsverfahren werden praktisch vor allem für Vorhersage, Datenbeschreibung, Parameterschätzung, Variablenauswahl und Kontrolle einer Ausgangsvariable eingesetzt. Bei der Vorhersage sind einzelne Parameterschätzungen β_0, β_1, …, β_k weniger wichtig als der gesamte Einfluss der x-Variablen auf die Zielgröße y; gute Schätzer sollen aber hohe Vorhersagekraft haben. Bei der Datenbeschreibung fasst das geschätzte Modell beobachtete Daten zusammen. Bei der Parameterschätzung können die geschätzten Werte β̂_0, β̂_1, …, β̂_k theoretische Bedeutung für das angenommene Modell haben.
Bei der Variablenauswahl wird untersucht, wie wichtig jede Prädiktorvariable x_j für die Modellierung der Zielgröße y ist. Variablen, die viel zur Erklärung der Variation in y beitragen, werden beibehalten; Variablen mit wenig Beitrag oder redundanter Information können weggelassen werden. Wenn ein kausaler Zusammenhang zwischen Zielvariable und Prädiktorvariablen angenommen wird, kann ein geschätztes Modell außerdem genutzt werden, um für die Ausgangsvariable eines Prozesses zu kontrollieren, indem Eingangsvariablen variiert werden.
Als Beispiel nennt der Artikel eine Untersuchung analog zu Mincer (1974). Aus dem Current Population Survey 1985 wurden zufällig 534 Beobachtungen mit den Variablen lwage, educ und exper gezogen. lwage ist der natürliche Logarithmus des Stundenlohns, educ die Berufsausbildung in Jahren und exper die Berufserfahrung in Jahren, berechnet als Alter − Berufsausbildung − 6. Mit der Mincer-Einkommensgleichung wurde der Zusammenhang zwischen dem Logarithmus des Stundenlohns als abhängiger Variable und Berufsausbildung sowie Berufserfahrung als unabhängigen Variablen untersucht. Beispielhafte lineare Modelle sind lwage = b_0 + b_1educ + b_2exper und lwage = b_0 + b_1educ + b_2exper + b_3exper².