Wikipedia · einfach zusammengefasst · Stand
Imputation (Statistik)
Unter dem Begriff Imputation () werden in der Mathematischen Statistik Verfahren zusammengefasst, mit denen fehlende Daten in statistischen Erhebungen – die …
Inhalt5 Abschnitte
Grundidee und Zweck
Imputation bezeichnet in der mathematischen Statistik Verfahren, mit denen fehlende Daten in statistischen Erhebungen ergänzt werden. Solche fehlenden Werte heißen Antwortausfälle oder Missing Data. Ziel ist es, die Datenmatrix zu vervollständigen und die Schweigeverzerrung zu verringern, die durch Antwortausfälle entstehen kann.
Imputation gehört zu den Missing-Data-Techniken. Diese werden verwendet, wenn Stichprobendatensätze unvollständig sind. Das kann in Umfragen vorkommen, wenn Personen bestimmte Fragen nicht beantworten, etwa wegen mangelnden Wissens oder geringer Antwortmotivation. Fehlende Daten können aber auch durch technische Pannen oder Datenverlust entstehen.
Eine andere verbreitete Missing-Data-Technik ist das Eliminierungsverfahren, auch Complete-case analysis genannt. Dabei werden alle Datensätze gestrichen, in denen ein oder mehrere Erhebungsmerkmale fehlen. Das ist einfach, hat aber wichtige Nachteile: Bei vielen Item non responses, also fehlenden Einzelwerten, geht viel Information verloren. Außerdem kann die verbleibende Stichprobe verfälscht werden, wenn der Datenausfall systematisch mit dem fehlenden Merkmal zusammenhängt. Ein typisches Beispiel sind Einkommensumfragen: Personen mit relativ hohem Einkommen geben dieses möglicherweise ungern an, sodass gerade dort häufiger Werte fehlen. Imputationsverfahren versuchen deshalb, fehlende Daten nicht zu ignorieren, sondern durch plausible Werte zu ersetzen. Diese Werte können unter anderem mithilfe der beobachteten Werte desselben Datensatzes geschätzt werden.
Hauptarten der Imputation
Es gibt viele Verfahren, um fehlende Werte zu vervollständigen. Grundsätzlich unterscheidet man zwischen singulärer Imputation und multipler Imputation.
Bei der singulären Imputation wird jeder fehlende Wert durch genau einen bestimmten Schätzwert ersetzt. Die Datenmatrix enthält danach an jeder fehlenden Stelle einen einzelnen eingesetzten Wert. Dazu gehören einfache Ersetzungen durch Mittelwert, Median oder Modus, aber auch Verfahren mit Verhältnisschätzern, Hot-Deck- und Cold-Deck-Techniken sowie Regressionsverfahren.
Bei der multiplen Imputation werden für jedes Item non response mehrere Werte geschätzt. Dies geschieht meist durch Simulation, wobei ein oder mehrere Verteilungsmodelle zugrunde gelegt werden. Die mehreren erzeugten Werte können später gemittelt werden, oder es werden mehrere vollständig ergänzte Datenmatrizen erstellt.
Einfache singuläre Verfahren
Ein sehr einfaches singuläres Verfahren ist die Substitution durch Lagemaße. Dabei werden alle fehlenden Ausprägungen eines Erhebungsmerkmals durch ein empirisches Lagemaß der beobachteten Ausprägungen ersetzt. Meist ist das bei quantitativen Merkmalen der Mittelwert. Bei nichtquantitativen Merkmalen können Median oder Modus verwendet werden. Ein Nachteil ist, dass Verzerrungen auftreten können, wenn der Datenausfall von der Ausprägung des Merkmals abhängt. Außerdem wird die Standardabweichung der resultierenden Stichprobe systematisch unterschätzt, weil die eingesetzten Werte konstant sind und untereinander keine Streuung besitzen. Dieses Problem lässt sich teilweise abschwächen, wenn man nicht die ganze Stichprobe gemeinsam behandelt, sondern getrennte Merkmalsklassen bildet. Innerhalb jeder Klasse kann dann ein eigenes Klassenmittel berechnet werden, mit dem die fehlenden Werte dieser Klasse ersetzt werden.
Ein weiteres einfaches Verfahren ist die Substitution durch Verhältnisschätzer. Es nutzt einen möglichen funktionalen Zusammenhang zwischen zwei Stichprobenmerkmalen. Dabei ist eines der Merkmale vollständig beobachtet. Seien X und Y zwei Zufallsvariablen in einer Stichprobe vom Umfang n. X ist vollständig erhoben, und bei n_obs^(X,Y) von n Untersuchungsobjekten liegt auch der Y-Wert vor. Fehlende Y-Werte können dann geschätzt werden durch: y_hat_j^Ratio = (overline y / overline x) * x_j für alle j mit beobachtetem x_j und fehlendem y_j. Dabei ist overline x = (1 / n_obs^(X,Y)) * Summe der beobachteten x_i über alle Fälle, in denen x_i und y_i beobachtet sind, und overline y entsprechend der Mittelwert der beobachteten y_i in denselben vollständigen Wertepaaren. Dieser Schätzer ist nur in Spezialfällen sinnvoll, normalerweise wenn zwischen X und Y eine starke Korrelation angenommen werden kann.
Deck-Techniken und Regression
Hot-Deck- und Cold-Deck-Techniken ersetzen fehlende Stichprobenwerte durch beobachtete Ausprägungen desselben Merkmals. Der Unterschied liegt darin, woher die eingesetzten Werte stammen. Cold-Deck-Techniken verwenden Schätzwerte aus anderen Erhebungen, zum Beispiel aus historischen, „kalten“ Befragungen. Hot-Deck-Verfahren nutzen dagegen die aktuelle Datenmatrix und sind deutlich gängiger. Solche Verfahren werden meist innerhalb von Imputationsklassen angewandt. Das sind Merkmalsklassen, in die Datensätze nach einem vollständig erhobenen Merkmal eingeteilt werden.
Ein bekanntes Hot-Deck-Verfahren ist das sequentielle oder traditionelle Hot-Deck. Zuerst wird innerhalb jeder Imputationsklasse für jede unvollständig beobachtete Variable ein Startwert festgelegt. Dieser Startwert kann zum Beispiel der Mittelwert der vorhandenen Klassenausprägungen, ein Zufallswert aus der jeweiligen Klasse oder ein Cold-Deck-Schätzwert sein. Danach werden alle Elemente der Datenmatrix der Reihe nach durchlaufen. Ist bei einem Objekt die Ausprägung vorhanden, wird sie zum neuen aktuellen Imputationswert für dieses Merkmal in derselben Imputationsklasse. Fehlt die Ausprägung, wird der aktuelle Imputationswert eingesetzt. So wird fortgefahren, bis die Datenmatrix keine Lücken mehr enthält.
Regressionsverfahren nutzen mögliche funktionale Zusammenhänge zwischen zwei oder mehreren Stichprobenmerkmalen. Auch Imputation durch Stichprobenmittelwert oder Verhältnisschätzer kann als vereinfachte Form der Regressionsimputation verstanden werden. Bei quantitativen Merkmalen wird häufig lineare Regression nach der Methode der kleinsten Quadrate verwendet. Wenn X und Y gemeinsam in einer Stichprobe vom Umfang n erhoben werden, Y aber nur n_obs^(X,Y)-mal vorliegt, kann bei angenommener Korrelation aus den beobachteten (x,y)-Wertepaaren eine Regressionsgleichung von Y auf X berechnet werden: y_hat_j^Reg = alpha_hat_YX + beta_hat_YX * x_j für alle j mit beobachtetem x_j und fehlendem y_j. Die Regressionskoeffizienten alpha und beta werden aus den beobachteten Wertepaaren durch Kleinstquadrateschätzer geschätzt: alpha_hat_YX = overline y - beta_hat_YX * overline x und beta_hat_YX = [Summe(x_i * y_i) - n_obs^(X,Y) * overline x * overline y] / [Summe(x_i^2) - n_obs^(X,Y) * overline x^2], jeweils über die beobachteten Paare. Bei mehr als einem Regressormerkmal spricht man von multipler linearer Regression. Sie wird analog durchgeführt, ist aber rechenintensiver und in statistischen Softwarepaketen wie SPSS standardmäßig implementiert. Für nichtquantitative Merkmale ist lineare Regression nicht geeignet; für bestimmte kategoriale Variablen gibt es spezielle Verfahren, besonders die logistische Regression.
Multiple Imputation
Die multiple Imputation ist ein vergleichsweise anspruchsvolles Missing-Data-Verfahren. „Multiple“ bedeutet, dass für jeden fehlenden Wert mehrere Schätzwerte in mehreren Imputationsschritten erzeugt werden. Diese Schätzwerte können anschließend zu einem Wert gemittelt werden. Eine andere Möglichkeit ist, für jeden Imputationsschritt eine eigene vervollständigte Datenmatrix zu erstellen.
Häufig werden die Schätzwerte durch Simulation aus einem plausibel erscheinenden multivariaten Verteilungsmodell bestimmt. Ein multivariates Verteilungsmodell beschreibt die gemeinsame Verteilung mehrerer Zufallsvariablen. Wenn zum Beispiel die Zufallsvariablen X und Y als gemeinsam normalverteilt mit festgelegten Parametern angenommen werden, kann bei Fällen mit beobachtetem X-Wert und fehlendem Y-Wert die bedingte Verteilung von Y gegeben dem beobachteten X-Wert hergeleitet werden. In diesem einfachen Fall ist das eine univariate Normalverteilung. Aus dieser Verteilung können dann für jeden fehlenden Y-Wert mehrfach mögliche Imputationswerte simuliert werden.