Wikipedia · einfach zusammengefasst · Stand
Informationskriterium
Der Strafterm verhindert Überanpassung, denn die Erhöhung der Anzahl der Parameter im Modell verbessert fast immer die Anpassungsgüte. Anstelle des AIC nach …
Inhalt5 Abschnitte
Zweck und Grundidee
Ein Informationskriterium ist in der Statistik ein Kriterium zur Modellauswahl. Es hilft dabei, aus mehreren möglichen Modellen das geeignetste für vorhandene empirische Daten einer Stichprobe auszuwählen. Dabei werden zwei Ziele gegeneinander abgewogen: die Anpassungsgüte des Modells an die Daten und seine Komplexität, die meist durch die Anzahl seiner Parameter gemessen wird.
Die Grundidee folgt Ockhams Rasiermesser: Ein Modell soll nicht unnötig komplex sein. Ohne eine Strafe für zusätzliche Parameter wären Modelle mit vielen Parametern meist im Vorteil, weil sie sich fast immer besser an die beobachteten Daten anpassen können. Informationskriterien enthalten deshalb einen Strafterm für die Parameterzahl. Das korrigierte Bestimmtheitsmaß nach Henri Theil (1970) gilt in diesem Sinn als Vorläufer der heute bekannten Informationskriterien.
Informationskriterien können auf zwei Arten formuliert sein: als maximale Plausibilität oder als minimale Varianz der Residuen. Residuen sind die Abweichungen zwischen beobachteten und vom Modell vorhergesagten Werten. Bei einer Plausibilitätsformulierung ist das Modell mit dem höchsten Kriteriumswert am besten; die strafende Parameterzahl wird abgezogen. Bei einer Varianzformulierung wird die Parameterzahl addiert, sodass das Modell mit dem niedrigsten Kriteriumswert bevorzugt wird.
Akaike-Informationskriterium
Das Akaike-Informationskriterium (AIC; englisch Akaike information criterion) wurde 1973 von Hirotsugu Akaike vorgeschlagen. Es gehört zu den am häufigsten verwendeten Kriterien der Modellauswahl bei Likelihood-basierter Inferenz. Die Likelihood- oder Plausibilitätsfunktion beschreibt, wie gut ein Modell mit bestimmten Parameterwerten die beobachteten Daten erklärt.
In der Grundgesamtheit sei die unbekannte Dichtefunktion einer Variablen p. Bei der Maximum-Likelihood-Schätzung wird eine bekannte Verteilungsform mit unbekanntem Parameter θ angenommen, also eine Dichte q(θ). Die Kullback-Leibler-Divergenz D(P‖Q) dient als Entfernungsmaß zwischen p und q(θ̂), wobei θ̂ der geschätzte Parameter ist. Je besser das Maximum-Likelihood-Modell, desto kleiner ist D(P‖Q).
Für reguläre lineare Modelle zeigte Akaike, dass die negative log-Likelihood-Funktion −ℓ(θ̂) ein verzerrter Schätzer für die Kullback-Leibler-Divergenz ist. Ihre Verzerrung nähert sich bei wachsendem Stichprobenumfang asymptotisch der Zahl p der zu schätzenden Parameter an. Für einen p-dimensionalen Maximum-Likelihood-Parametervektor θ̂ML lautet die Definition:
AIC = −2ℓ(θ̂ML) + 2p.
Das AIC ist negativ orientiert: Unter den Kandidaten wird das Modell mit dem kleinsten AIC-Wert gewählt. Der Term −2ℓ(θ̂ML) bewertet die Anpassungsgüte, der Strafterm 2p bestraft hohe Komplexität und soll Überanpassung verhindern. Teilweise wird auch AIC/n verwendet, wobei n die Stichprobengröße ist.
AIC bei linearen Regressionsmodellen
Es seien n unabhängige Beobachtungen mit E(yi) = μi und Var(yi) = σ² gegeben. Die Variablen x0 = 1, x1, x2, …, xk stehen als mögliche Regressoren zur Verfügung. Ein Modell wird durch die Teilmenge M ⊂ {0, 1, 2, …, k} der einbezogenen erklärenden Variablen und durch die Versuchsplanmatrix XM festgelegt. Der Kleinste-Quadrate-Schätzer ist
β̂M = (XMᵀXM)⁻¹XMᵀy.
Allgemein gilt für dieses Modell:
AIC = −2ℓ(β̂M, σ̂²; y, XM) + 2(|M| + 1).
Dabei ist ℓ(β̂M, σ̂²) der Maximalwert der log-Likelihood-Funktion, nachdem die Maximum-Likelihood-Schätzer β̂M und σ̂² eingesetzt wurden. Kleinere AIC-Werte bedeuten eine bessere Modellanpassung. Die Parameterzahl ist |M| + 1, weil neben den Regressionsparametern auch die Varianz der Störgrößen als Parameter gezählt wird.
Für ein lineares Modell mit normalverteilten Störgrößen vereinfacht sich das Kriterium zu
AIC = n ln(σ̂²) + 2(|M| + 1).
Hierbei ist σ̂² die Varianz der Störgrößen. Sie wird über die Residuenquadratsumme geschätzt. Wichtig ist, dass die verwendete Schätzung verzerrt ist: σ̂² = (1/n) ε̂ᵀε̂, nicht die sonst häufig verwendete erwartungstreue Variante.
Bayessches Informationskriterium
Ein Nachteil des AIC besteht darin, dass sein Strafterm nicht von der Stichprobengröße abhängt. Bei großen Stichproben lassen sich Verbesserungen der log-Likelihood oder der Residualvarianz leichter erzielen. Dadurch kann das AIC bei großen Stichproben Modelle mit vergleichsweise vielen Parametern begünstigen.
Das von Gideon E. Schwarz 1978 vorgeschlagene bayessche Informationskriterium wird als BIC bezeichnet (auch Bayes-Informationskriterium, Schwarz-Bayes-Informationskriterium oder SBC; englisch Bayesian Information Criterion). Für einen Parametervektor θ, die log-Likelihood-Funktion ℓ(θ) und den Maximum-Likelihood-Schätzer θ̂ML gilt:
BIC = −2ℓ(θ̂ML) + p ln(n).
In der Varianzform lautet es:
BIC = n ln(σ̂²) + p ln(n).
Anders als beim AIC wächst der Faktor des Strafterms logarithmisch mit der Zahl n der Beobachtungen. Schon ab acht Beobachtungen gilt ln(8) = 2,07944 > 2; dann bestraft das BIC zusätzliche Parameter stärker als das AIC. Formal unterscheidet es sich vom AIC dadurch, dass der Faktor 2 durch ln(n) ersetzt wird. Wie beim AIC wird das Modell mit dem kleineren Wert bevorzugt.
Nach Kuha (2004) verfolgen beide Kenngrößen unterschiedliche Ziele: Das BIC versucht, das Modell auszuwählen, das a posteriori die größte Plausibilität besitzt, das wahre Modell zu sein. Das AIC geht dagegen davon aus, dass es kein wahres Modell gibt. Die Hälfte des negativen BIC wird auch Schwarz-Kriterium genannt.
Weitere Kriterien und Test
Weitere, seltener verwendete Informationskriterien sind das Hannan-Quinn-Informationskriterium (HQIC), das Devianz-Informationskriterium (DIC), das Erweiterte Informationskriterium (EIC), das Fokussierte Informationskriterium (FIC), das Generalized Information Criterion (GIC), das Netzwerkinformationskriterium (NIC) und das Takeuchi-Informationskriterium (TIC).
Ein statistischer Test, der auf Informationskriterien basiert, ist der Vuong-Test.