Zum Inhalt springen
L

Wikipedia · einfach zusammengefasst · Stand

Zeitreihenanalyse

Die Zeitreihenanalyse befasst sich in der Statistik mit der inferenzstatistischen Analyse von Zeitreihen und der Vorhersage von Trends (Trendextrapolation) …

Inhalt6 Abschnitte
  1. 1. Grundbegriff und Formen von Zeitreihen
  2. 2. Ziele und Ablauf der Analyse
  3. 3. Modellidentifikation
  4. 4. Schätzen, prüfen und anwenden
  5. 5. Komponenten und wichtige Verfahren
  6. 6. Software

Grundbegriff und Formen von Zeitreihen

Eine Zeitreihe ist eine zeitlich geordnete Folge von Zahlen oder Beobachtungen. Die Reihenfolge der Merkmalsausprägungen ergibt sich zwingend aus dem Zeitablauf. Beispiele sind Aktienkurse, die Bevölkerungsentwicklung, Preisindizes, Wahlabsichtsbefragungen, Wetterdaten und Zinsindizes. Die Beobachtungszeitpunkte werden zur Menge T zusammengefasst; für jeden Zeitpunkt t ∈ T liegt genau eine Beobachtung vor.

Zeitreihendaten fallen diskret und in endlichen zeitlichen Abständen an. Die Abstände können konstant sein, etwa alle 5 Sekunden, regelmäßig, etwa werktäglich, oder unregelmäßig. Ein Datenpunkt kann aus einem einzelnen Zahlenwert bestehen (univariate Zeitreihe) oder aus mehreren Zahlenwerten (multivariate Zeitreihe). Bei einer multivariaten Zeitreihe müssen alle Datenpunkte gleich aufgebaut sein. Kontinuierliche Messsignale können durch Abtastung in Zeitreihen umgewandelt werden.

Eine Zeitreihe entsteht typischerweise aus dem Zusammenwirken regelhafter und zufälliger Ursachen. Regelhafte Ursachen können saisonale Schwankungen und langfristige Trends hervorbringen; zufällige Einflüsse werden häufig als Rauschen bezeichnet. Formal kann ein T-dimensionaler Vektor von Zufallsvariablen x₁, x₂, …, x_T beziehungsweise eine Folge {x_t}ₜ₌₁ᵀ als stochastischer Prozess aufgefasst werden. Eine beobachtete Zeitreihe ist eine Realisierung dieses datengenerierenden Prozesses. Ein Prozess kann im Allgemeinen beliebig viele Realisierungen mit denselben statistischen Eigenschaften haben.

Zur Beschreibung eines Prozesses können Momente erster und zweiter Ordnung verwendet werden: T Erwartungswerte E(xᵢ), T Varianzen Var(xᵢ) = E((xᵢ − E(xᵢ))²) und T(T−1)/2 Kovarianzen Cov(xᵢ,xⱼ) = E((xᵢ − E(xᵢ))(xⱼ − E(xⱼ))) für i < j. Diese Kovarianzen heißen auch Autokovarianzen. Bei einer mehrdimensionalen Normalverteilung legen die Momente erster und zweiter Ordnung den Prozess eindeutig fest. Für statistische Schlussfolgerungen muss meist die Annahme der Ergodizität getroffen werden: Stichprobenmomente einer endlichen Zeitreihe konvergieren für T → ∞ quasi gegen die Momente der Grundgesamtheit.

Zeitreihen kommen unter anderem in der Finanzwirtschaft, Ökonometrie, Biometrie, Meteorologie, Fernerkundung sowie in der quantitativen Kriegs- und Friedensforschung vor. Zeitabhängige Personen- oder Haushaltsdaten werden je nach Struktur als Trend-, Panel- oder Ereignisdaten bezeichnet und nicht mehr als einfache Zeitreihendaten.

Ziele und Ablauf der Analyse

Die Zeitreihenanalyse ist ein Teilgebiet der Statistik. Sie untersucht Zeitreihen inferenzstatistisch und dient außerdem der Vorhersage ihrer künftigen Entwicklung, insbesondere der Extrapolation von Trends. Sie ist eine Spezialform der Regressionsanalyse.

Wichtige Ziele sind:

  • eine möglichst kurze Beschreibung einer historischen Zeitreihe,
  • die Prognose künftiger Werte aus den bisherigen Werten, beispielsweise bei der Wettervorhersage,
  • die Erkennung von Veränderungen, etwa in EEG- oder EKG-Daten während medizinischer Eingriffe,
  • die Entfernung serieller oder saisonaler Abhängigkeiten beziehungsweise von Trends, damit einfache Größen wie Mittelwerte verlässlich geschätzt werden können. Diese Bereinigung wird Saisonbereinigung genannt.

Die Analyse wird meist in vier Arbeitsphasen gegliedert. In der Identifikationsphase wird ein geeignetes Modell ausgewählt. In der Schätzphase werden die Parameter des Modells bestimmt. In der Diagnosephase wird geprüft, ob das geschätzte Modell angemessen ist. In der Einsatzphase wird ein als geeignet beurteiltes Modell verwendet, insbesondere für Prognosen. Je nach Modelltyp unterscheiden sich die Verfahren. Der Artikel beschreibt beispielhaft die Box-Jenkins-Methode für stochastische, insbesondere lineare Modelle.

Modellidentifikation

Am Anfang steht die graphische Darstellung der empirischen Zeitreihenwerte. Sie ist eine einfache und anschauliche Möglichkeit, erste Hinweise auf Trends, saisonale Muster, Ausreißer, eine nicht konstante Varianz (Varianzinstationarität) und andere Auffälligkeiten zu erhalten.

Ein stochastischer Trend, also Instationarität, kann graphisch oder mit einem statistischen Test festgestellt werden. Genannt wird der erweiterte Dickey-Fuller-Test (augmented Dickey-Fuller test, ADF-Test). Soll die Instationarität später durch Differenzieren beseitigt werden, kann zuvor eine Varianzstabilisierung, beispielsweise mit der Box-Cox-Transformation, sinnvoll sein. Sie ist wichtig, weil beim Differenzieren negative Werte in der transformierten Zeitreihe auftreten können.

Grundsätzlich muss entschieden werden, ob die Zeitreihe durch ein deterministisches Modell beziehungsweise Trendmodell oder durch ein stochastisches Modell beschrieben wird. Die Wahl beeinflusst die Trendbereinigung: Beim Trendmodell wird der Trend durch Regressionsschätzung entfernt, beim stochastischen Modell durch Differenzenbildung.

Schätzen, prüfen und anwenden

In der Schätzphase werden Modellparameter und Koeffizienten mit unterschiedlichen Verfahren bestimmt. Für ein Trendmodell eignet sich die Kleinste-Quadrate-Schätzung. Im Box-Jenkins-Ansatz werden unter anderem die Momentenmethode, die nichtlineare Kleinste-Quadrate-Schätzung und die Maximum-Likelihood-Methode verwendet.

Die Diagnosephase bewertet die Güte eines oder mehrerer ausgewählter Modelle. Zuerst wird geprüft, ob die geschätzten Koeffizienten signifikant von Null verschieden sind. Für einzelne Koeffizienten dient der t-Test, für mehrere Koeffizienten gemeinsam der F-Test. Bei der Box-Jenkins-Methode werden außerdem die empirischen Autokorrelationskoeffizienten mit den theoretisch aus dem Modell erwarteten verglichen. Ergänzend können partielle Autokorrelationskoeffizienten und das Spektrum untersucht werden.

Besonders wichtig ist die Residuenanalyse. Residuen sind die nach der Modellanpassung verbleibenden Abweichungen. Sie sollten keine erkennbare Struktur mehr enthalten. Ihre Zentriertheit kann mit einem t-Test geprüft werden. Die Varianzkonstanz lässt sich graphisch im Zeitreihengraphen oder durch die Untersuchung verschiedener λ-Werte einer Box-Cox-Transformation beurteilen. Zur Prüfung der Autokorrelationsfreiheit kann jeder einzelne Autokorrelationskoeffizient auf einen signifikanten Unterschied zu Null getestet werden. Alternativ werden die ersten n Koeffizienten gemeinsam geprüft; dafür können Portmanteau-Tests und Informationskriterien eingesetzt werden.

In der Einsatzphase wird aus der in der Identifikationsphase aufgestellten und als brauchbar beurteilten Modellgleichung eine Vorhersagegleichung formuliert. Vorher muss ein Optimalitätskriterium festgelegt werden. Als Kriterium kann die minimale mittlere quadratische Abweichung (minimal mean squared error, MMSE) verwendet werden.

Komponenten und wichtige Verfahren

Zeitreihen können in Komponenten zerlegt werden. Die Trendkomponente bezeichnet die allgemeine Grundrichtung. Die Saisonkomponente beschreibt zyklische Bewegungen innerhalb eines Jahres. Die Zykluskomponente, bei ökonomischen Zeitreihen auch Konjunktur genannt, hat eine Periodenlänge von mehr als einem Jahr. Eine Kalenderkomponente entsteht durch Kalenderunregelmäßigkeiten. Die Rest- oder irreguläre Komponente umfasst Ausreißer, durch historische Ereignisse erklärbare Strukturbrüche und nicht näher identifizierbare Zufallsschwankungen. Diese Komponenten sind nicht unmittelbar beobachtbar, sondern beruhen auf einer Modellvorstellung.

Traditionelle Modelle behandeln Zufallsschwankungen als strukturell neutral und die systematischen Komponenten als deterministische Funktionen der Zeit. Ein Beispiel ist Yₜ = β₀ + β₁t + Zₜ. Neuere Ansätze geben den Zufallsschwankungen eine wichtige Rolle und modellieren die Zeitreihe als stochastischen Prozess. Ein MA(1)-Prozess wird durch Yₜ = θ₁Zₜ₋₁ + Zₜ dargestellt. Dabei ist t der Zeitindex; für Zₜ kann weißes Rauschen angenommen werden. Einen dazu konträren Modellierungsansatz bildet die Chaostheorie.

Zu den allgemeinen mathematischen Werkzeugen gehören Transformation, darunter die Box-Cox-Transformation, Aggregation, Regression, Filterung und gleitende Durchschnitte. Für stochastische Prozesse, insbesondere im Box-Jenkins-Ansatz, werden außerdem Frequenzbereichsanalyse mit Fourier-Theorie und Spektralanalyse, Autokovarianz- und Autokorrelationsfunktionen, partielle Autokorrelationsfunktionen sowie MA- und AR-Darstellungen eingesetzt.

Die inferenzstatistische Analyse schätzt Effekte auf Grundlage von Stichproben und berücksichtigt die Fehler der Ergebnisse. Komplexe Zeitreihenmodelle werden vor allem in der Ökonometrie für ökonomische Modelle spezifiziert und geschätzt. Eine wichtige Modellgruppe sind die ARMA-Prozesse.

Bei der ordinalen Zeitreihenanalyse werden nicht die konkreten Werte, sondern ihre Ordnungsrelationen, also das Auf und Ab, untersucht. Die Zeitreihe wird in ordinale Muster umgewandelt. Anschließend wird deren Verteilung statistisch analysiert, um Komplexität beziehungsweise Informationsgehalt zu messen. Ein bekannter Komplexitätsparameter ist die Permutationsentropie, die 2002 von Bandt und Pompe eingeführt wurde.

Künstliche neuronale Netze können Zeitreihen ähnlich wie ein ARIMA-Modell verarbeiten, wobei sich häufig vor allem die Terminologie unterscheidet. Bei einem Multilayer-Perceptron wird ein gleitendes Zeitfenster mit n vergangenen Werten über die Zeitreihe gelegt. Das Netz soll aus diesen n Werten den nächsten Wert bestimmen und wird mit bekannten Werten trainiert. Äußere Einflüsse eines dynamischen Systems können durch zusätzliche Eingabeneuronen berücksichtigt werden; auch diese Einflussgrößen müssen als Zeitreihen vorliegen.

Software

Für Zeitreihenanalysen können freie Softwarepakete wie R, gretl, OpenNN und RapidMiner verwendet werden. Zu den proprietären Lösungen gehören BOARD, Dataplore, EViews, Limdep, RATS, SPSS, Stata, SAS und WinRATS.

Weiterlesen

Mathematische Statistik Als mathematische Statistik bezeichnet man das Teilgebiet der Statistik, das die Methoden und Verfahren der Statistik mit mathematischen Mitteln analysiert … Regressionsanalyse Die Regressionsanalyse ist ein Instrumentarium statistischer Analyseverfahren, die zum Ziel haben, Beziehungen zwischen einer abhängigen (auch erklärte … Zeit Als physikalische Größe hat die Zeit zumeist das Formelzeichen t (von lat. tempus für „Zeit“), ihre SI-Einheit ist die Sekunde s. Für die physikalischen, die … Folge (Mathematik) Als Folge oder Sequenz wird in der Mathematik eine Auflistung (Familie) von endlich oder unendlich vielen fortlaufend nummerierten Objekten (beispielsweise … Reihe (Mathematik) Mit jedem neuen Summanden wird der „Abstand“ zum Grenzwert halbiert. Eine Reihe, selten Summenfolge oder unendliche Summe und vor allem in älteren Darstellungen … Zahl Zahlen sind abstrakte mathematische Objekte beziehungsweise Objekte des Denkens, die sich historisch aus Vorstellungen von Größe und Anzahl entwickelten. Bevölkerungsentwicklung Bevölkerungsentwicklung beschreibt die Entwicklung der Zahl der Menschen (Einwohner) auf einer bestimmten Fläche. Sie ergibt sich zum einen aus der … Skalar (Mathematik) Im Gegensatz zur Skalarmultiplikation ist das Skalarprodukt eine Verknüpfung, die zwei Vektoren einen Skalar als Wert zuordnet. Der Begriff Skalar geht … Vektor Addition und Subtraktion · Multiplikation mit einem Skalar · Skalarprodukt · Kreuzprodukt · Spatprodukt · Länge/Betrag eines Vektors · Dyadisches Produkt. Stochastischer Prozess Martingale modellieren ein faires Spiel. Hat man zu einem Zeitpunkt bereits einen gewissen Betrag gewonnen, so ist der Erwartungswert für künftige Gewinne … Realisierung (Stochastik) Als Realisierung bezeichnet man dort einen konkreten Wert, den eine Zufallsvariable annimmt, vergleichbar einem Wert einer Funktion für ein gegebenes Argument. Verteilungsfunktion Die Verteilungsfunktion ist eine spezielle reelle Funktion in der Stochastik und ein zentrales Konzept bei der Untersuchung von …