Wikipedia · einfach zusammengefasst · Stand
Zeitreihenanalyse
Die Zeitreihenanalyse befasst sich in der Statistik mit der inferenzstatistischen Analyse von Zeitreihen und der Vorhersage von Trends (Trendextrapolation) …
Inhalt6 Abschnitte
Grundbegriff und Formen von Zeitreihen
Eine Zeitreihe ist eine zeitlich geordnete Folge von Zahlen oder Beobachtungen. Die Reihenfolge der Merkmalsausprägungen ergibt sich zwingend aus dem Zeitablauf. Beispiele sind Aktienkurse, die Bevölkerungsentwicklung, Preisindizes, Wahlabsichtsbefragungen, Wetterdaten und Zinsindizes. Die Beobachtungszeitpunkte werden zur Menge T zusammengefasst; für jeden Zeitpunkt t ∈ T liegt genau eine Beobachtung vor.
Zeitreihendaten fallen diskret und in endlichen zeitlichen Abständen an. Die Abstände können konstant sein, etwa alle 5 Sekunden, regelmäßig, etwa werktäglich, oder unregelmäßig. Ein Datenpunkt kann aus einem einzelnen Zahlenwert bestehen (univariate Zeitreihe) oder aus mehreren Zahlenwerten (multivariate Zeitreihe). Bei einer multivariaten Zeitreihe müssen alle Datenpunkte gleich aufgebaut sein. Kontinuierliche Messsignale können durch Abtastung in Zeitreihen umgewandelt werden.
Eine Zeitreihe entsteht typischerweise aus dem Zusammenwirken regelhafter und zufälliger Ursachen. Regelhafte Ursachen können saisonale Schwankungen und langfristige Trends hervorbringen; zufällige Einflüsse werden häufig als Rauschen bezeichnet. Formal kann ein T-dimensionaler Vektor von Zufallsvariablen x₁, x₂, …, x_T beziehungsweise eine Folge {x_t}ₜ₌₁ᵀ als stochastischer Prozess aufgefasst werden. Eine beobachtete Zeitreihe ist eine Realisierung dieses datengenerierenden Prozesses. Ein Prozess kann im Allgemeinen beliebig viele Realisierungen mit denselben statistischen Eigenschaften haben.
Zur Beschreibung eines Prozesses können Momente erster und zweiter Ordnung verwendet werden: T Erwartungswerte E(xᵢ), T Varianzen Var(xᵢ) = E((xᵢ − E(xᵢ))²) und T(T−1)/2 Kovarianzen Cov(xᵢ,xⱼ) = E((xᵢ − E(xᵢ))(xⱼ − E(xⱼ))) für i < j. Diese Kovarianzen heißen auch Autokovarianzen. Bei einer mehrdimensionalen Normalverteilung legen die Momente erster und zweiter Ordnung den Prozess eindeutig fest. Für statistische Schlussfolgerungen muss meist die Annahme der Ergodizität getroffen werden: Stichprobenmomente einer endlichen Zeitreihe konvergieren für T → ∞ quasi gegen die Momente der Grundgesamtheit.
Zeitreihen kommen unter anderem in der Finanzwirtschaft, Ökonometrie, Biometrie, Meteorologie, Fernerkundung sowie in der quantitativen Kriegs- und Friedensforschung vor. Zeitabhängige Personen- oder Haushaltsdaten werden je nach Struktur als Trend-, Panel- oder Ereignisdaten bezeichnet und nicht mehr als einfache Zeitreihendaten.
Ziele und Ablauf der Analyse
Die Zeitreihenanalyse ist ein Teilgebiet der Statistik. Sie untersucht Zeitreihen inferenzstatistisch und dient außerdem der Vorhersage ihrer künftigen Entwicklung, insbesondere der Extrapolation von Trends. Sie ist eine Spezialform der Regressionsanalyse.
Wichtige Ziele sind:
- eine möglichst kurze Beschreibung einer historischen Zeitreihe,
- die Prognose künftiger Werte aus den bisherigen Werten, beispielsweise bei der Wettervorhersage,
- die Erkennung von Veränderungen, etwa in EEG- oder EKG-Daten während medizinischer Eingriffe,
- die Entfernung serieller oder saisonaler Abhängigkeiten beziehungsweise von Trends, damit einfache Größen wie Mittelwerte verlässlich geschätzt werden können. Diese Bereinigung wird Saisonbereinigung genannt.
Die Analyse wird meist in vier Arbeitsphasen gegliedert. In der Identifikationsphase wird ein geeignetes Modell ausgewählt. In der Schätzphase werden die Parameter des Modells bestimmt. In der Diagnosephase wird geprüft, ob das geschätzte Modell angemessen ist. In der Einsatzphase wird ein als geeignet beurteiltes Modell verwendet, insbesondere für Prognosen. Je nach Modelltyp unterscheiden sich die Verfahren. Der Artikel beschreibt beispielhaft die Box-Jenkins-Methode für stochastische, insbesondere lineare Modelle.
Modellidentifikation
Am Anfang steht die graphische Darstellung der empirischen Zeitreihenwerte. Sie ist eine einfache und anschauliche Möglichkeit, erste Hinweise auf Trends, saisonale Muster, Ausreißer, eine nicht konstante Varianz (Varianzinstationarität) und andere Auffälligkeiten zu erhalten.
Ein stochastischer Trend, also Instationarität, kann graphisch oder mit einem statistischen Test festgestellt werden. Genannt wird der erweiterte Dickey-Fuller-Test (augmented Dickey-Fuller test, ADF-Test). Soll die Instationarität später durch Differenzieren beseitigt werden, kann zuvor eine Varianzstabilisierung, beispielsweise mit der Box-Cox-Transformation, sinnvoll sein. Sie ist wichtig, weil beim Differenzieren negative Werte in der transformierten Zeitreihe auftreten können.
Grundsätzlich muss entschieden werden, ob die Zeitreihe durch ein deterministisches Modell beziehungsweise Trendmodell oder durch ein stochastisches Modell beschrieben wird. Die Wahl beeinflusst die Trendbereinigung: Beim Trendmodell wird der Trend durch Regressionsschätzung entfernt, beim stochastischen Modell durch Differenzenbildung.
Schätzen, prüfen und anwenden
In der Schätzphase werden Modellparameter und Koeffizienten mit unterschiedlichen Verfahren bestimmt. Für ein Trendmodell eignet sich die Kleinste-Quadrate-Schätzung. Im Box-Jenkins-Ansatz werden unter anderem die Momentenmethode, die nichtlineare Kleinste-Quadrate-Schätzung und die Maximum-Likelihood-Methode verwendet.
Die Diagnosephase bewertet die Güte eines oder mehrerer ausgewählter Modelle. Zuerst wird geprüft, ob die geschätzten Koeffizienten signifikant von Null verschieden sind. Für einzelne Koeffizienten dient der t-Test, für mehrere Koeffizienten gemeinsam der F-Test. Bei der Box-Jenkins-Methode werden außerdem die empirischen Autokorrelationskoeffizienten mit den theoretisch aus dem Modell erwarteten verglichen. Ergänzend können partielle Autokorrelationskoeffizienten und das Spektrum untersucht werden.
Besonders wichtig ist die Residuenanalyse. Residuen sind die nach der Modellanpassung verbleibenden Abweichungen. Sie sollten keine erkennbare Struktur mehr enthalten. Ihre Zentriertheit kann mit einem t-Test geprüft werden. Die Varianzkonstanz lässt sich graphisch im Zeitreihengraphen oder durch die Untersuchung verschiedener λ-Werte einer Box-Cox-Transformation beurteilen. Zur Prüfung der Autokorrelationsfreiheit kann jeder einzelne Autokorrelationskoeffizient auf einen signifikanten Unterschied zu Null getestet werden. Alternativ werden die ersten n Koeffizienten gemeinsam geprüft; dafür können Portmanteau-Tests und Informationskriterien eingesetzt werden.
In der Einsatzphase wird aus der in der Identifikationsphase aufgestellten und als brauchbar beurteilten Modellgleichung eine Vorhersagegleichung formuliert. Vorher muss ein Optimalitätskriterium festgelegt werden. Als Kriterium kann die minimale mittlere quadratische Abweichung (minimal mean squared error, MMSE) verwendet werden.
Komponenten und wichtige Verfahren
Zeitreihen können in Komponenten zerlegt werden. Die Trendkomponente bezeichnet die allgemeine Grundrichtung. Die Saisonkomponente beschreibt zyklische Bewegungen innerhalb eines Jahres. Die Zykluskomponente, bei ökonomischen Zeitreihen auch Konjunktur genannt, hat eine Periodenlänge von mehr als einem Jahr. Eine Kalenderkomponente entsteht durch Kalenderunregelmäßigkeiten. Die Rest- oder irreguläre Komponente umfasst Ausreißer, durch historische Ereignisse erklärbare Strukturbrüche und nicht näher identifizierbare Zufallsschwankungen. Diese Komponenten sind nicht unmittelbar beobachtbar, sondern beruhen auf einer Modellvorstellung.
Traditionelle Modelle behandeln Zufallsschwankungen als strukturell neutral und die systematischen Komponenten als deterministische Funktionen der Zeit. Ein Beispiel ist Yₜ = β₀ + β₁t + Zₜ. Neuere Ansätze geben den Zufallsschwankungen eine wichtige Rolle und modellieren die Zeitreihe als stochastischen Prozess. Ein MA(1)-Prozess wird durch Yₜ = θ₁Zₜ₋₁ + Zₜ dargestellt. Dabei ist t der Zeitindex; für Zₜ kann weißes Rauschen angenommen werden. Einen dazu konträren Modellierungsansatz bildet die Chaostheorie.
Zu den allgemeinen mathematischen Werkzeugen gehören Transformation, darunter die Box-Cox-Transformation, Aggregation, Regression, Filterung und gleitende Durchschnitte. Für stochastische Prozesse, insbesondere im Box-Jenkins-Ansatz, werden außerdem Frequenzbereichsanalyse mit Fourier-Theorie und Spektralanalyse, Autokovarianz- und Autokorrelationsfunktionen, partielle Autokorrelationsfunktionen sowie MA- und AR-Darstellungen eingesetzt.
Die inferenzstatistische Analyse schätzt Effekte auf Grundlage von Stichproben und berücksichtigt die Fehler der Ergebnisse. Komplexe Zeitreihenmodelle werden vor allem in der Ökonometrie für ökonomische Modelle spezifiziert und geschätzt. Eine wichtige Modellgruppe sind die ARMA-Prozesse.
Bei der ordinalen Zeitreihenanalyse werden nicht die konkreten Werte, sondern ihre Ordnungsrelationen, also das Auf und Ab, untersucht. Die Zeitreihe wird in ordinale Muster umgewandelt. Anschließend wird deren Verteilung statistisch analysiert, um Komplexität beziehungsweise Informationsgehalt zu messen. Ein bekannter Komplexitätsparameter ist die Permutationsentropie, die 2002 von Bandt und Pompe eingeführt wurde.
Künstliche neuronale Netze können Zeitreihen ähnlich wie ein ARIMA-Modell verarbeiten, wobei sich häufig vor allem die Terminologie unterscheidet. Bei einem Multilayer-Perceptron wird ein gleitendes Zeitfenster mit n vergangenen Werten über die Zeitreihe gelegt. Das Netz soll aus diesen n Werten den nächsten Wert bestimmen und wird mit bekannten Werten trainiert. Äußere Einflüsse eines dynamischen Systems können durch zusätzliche Eingabeneuronen berücksichtigt werden; auch diese Einflussgrößen müssen als Zeitreihen vorliegen.
Software
Für Zeitreihenanalysen können freie Softwarepakete wie R, gretl, OpenNN und RapidMiner verwendet werden. Zu den proprietären Lösungen gehören BOARD, Dataplore, EViews, Limdep, RATS, SPSS, Stata, SAS und WinRATS.