Wikipedia · einfach zusammengefasst · Stand
Geostatistik
Die Geostatistik oder räumliche Statistik ist ein Teilgebiet der Statistik, welches unter Einbezug der Wahrscheinlichkeitsrechnung ortsabhängige Daten …
Inhalt5 Abschnitte
Grundidee und Bedeutung
Die Geostatistik, auch räumliche Statistik genannt, untersucht und modelliert ortsabhängige Daten (Geodaten) mithilfe von Statistik und Wahrscheinlichkeitsrechnung. Sie dient vor allem dazu, Messdaten stochastisch zu überprüfen und Werte an nicht gemessenen Orten zu schätzen. So lassen sich beispielsweise Relief- oder Temperaturkarten erstellen, ohne jeden einzelnen Punkt vermessen zu müssen.
Grundlegend ist die Annahme, dass Variablenwerte von ihrer räumlichen Lage stochastisch abhängen. Häufig ähneln sich benachbarte Messwerte stärker als weit voneinander entfernte Werte; die Daten sind also über die Entfernung korreliert. Diese räumliche Autokorrelation bezeichnet statistische Beziehungen zwischen Messwerten an verschiedenen Orten. Gewöhnliche statistische Verfahren sind deshalb nicht ohne Weiteres anwendbar, denn sie setzen meist stochastisch unabhängige Beobachtungen voraus.
Historisch entstanden die ersten Konzepte in der Lagerstättenkunde der 1950er Jahre. Danie G. Krige entwickelte statistische Schätzmethoden, mit denen sich die Zahl aufwendiger Probebohrungen zur Kartierung abbauwürdiger Gebiete verringern ließ. Als Begründer der Geostatistik gilt Georges Matheron, der 1971 ihre mathematisch-theoretischen Grundlagen als „Theorie der regionalisierten Variablen“ veröffentlichte.
Räumliches Wahrscheinlichkeitsmodell
Geostatistische Methoden betrachten ein an einem unbekannten Ort auftretendes Phänomen als Zufallsvariable. Sei Z(x) der Wert einer untersuchten Größe an der Stelle x, etwa Temperatur, Niederschlag oder geologische Fazies. Obwohl dort ein bestimmter, grundsätzlich messbarer Wert existiert, wird Z(x) als zufällig behandelt, solange er nicht gemessen wurde.
Die möglichen Werte werden durch eine kumulative Verteilungsfunktion (CDF) beschrieben:
F(z,x) = Prob{Z(x) ≤ z | Information}.
Sie gibt unter Berücksichtigung der vorhandenen Informationen die Wahrscheinlichkeit dafür an, dass Z(x) höchstens den Wert z besitzt. Bekannte Werte in der Nähe von x können diese Verteilung einschränken. Bei hoher räumlicher Kontinuität muss Z(x) den benachbarten Werten ähneln; ohne räumliche Kontinuität kann Z(x) dagegen jeden Wert annehmen.
Wird dasselbe räumliche Modell auf ein gesamtes Gebiet angewandt, nimmt man üblicherweise einen stationären Prozess an. Stationarität bedeutet hier, dass im ganzen Gebiet dieselben statistischen Eigenschaften gelten. Mehrere geostatistische Methoden können diese Annahme lockern.
Es gibt zwei zentrale Modellierungsziele:
• Beim Schätzproblem wird für Z(x) ein einzelner Wert bestimmt, typischerweise der Erwartungswert, Median oder Modus der zugehörigen Verteilung.
• Bei der Simulation werden Stichproben aus der gesamten Wahrscheinlichkeitsdichtefunktion f(z,x) gezogen. Dabei entstehen mehrere alternative räumliche Karten, sogenannte Realisierungen. Wird das Gebiet in N Gitterknoten oder Pixel zerlegt, ist jede Realisierung ein Muster aus der vollständigen N-dimensionalen gemeinsamen Verteilungsfunktion:
F(z,x) = Prob{Z(x₁) ≤ z₁, Z(x₂) ≤ z₂, ..., Z(xₙ) ≤ zₙ}.
Jede Realisierung stellt ein mögliches Szenario der wirklichen räumlichen Verteilung dar. Ein Ensemble solcher Realisierungen liefert entsprechend ein Ensemble von Vorhersagen und ermöglicht probabilistische Aussagen. Dieser Ansatz wird häufig eingesetzt, um räumliche Modelle bei inversen Problemen zu erzeugen oder zu aktualisieren.
Datenbeschreibung und Variogramm
Die klassische geostatistische Analyse besteht aus drei Bereichen: Datenbeschreibung, Interpretation und Schätzung. In der Datenbeschreibung werden mit deskriptiver Statistik und Variogrammen die zeitliche, räumliche und multivariate Struktur eines Datensatzes untersucht.
Die deskriptive Statistik fasst wichtige Merkmale zusammen. Dazu gehören Extrem- und Mittelwerte, Variationskoeffizient, Streuung und Verteilung. Histogramme und kumulative Verteilungsfunktionen können diese Eigenschaften darstellen.
Ein empirisches Semivariogramm beschreibt, wie stark Messwerte in Abhängigkeit von ihrer räumlichen Entfernung voneinander abweichen. Für die Abstände zwischen jeweils zwei Messorten werden die Differenzen ihrer Messwerte aufgetragen. Mit zunehmendem Abstand nimmt gewöhnlich auch die Unähnlichkeit zu, bis ein Grenzwert erreicht wird. Die Reichweite a gibt an, bis zu welcher maximalen Entfernung eine räumliche Abhängigkeit besteht. Der Sill ist der Plateauwert, der bei maximaler Reichweite erreicht wird.
An das empirische Semivariogramm wird eine Modellfunktion angepasst. Für die Modellierung sind kleine Distanzen innerhalb der Reichweite wichtiger als große. Vier klassische Funktionen sind:
• Das sphärische Modell steigt linear an und geht ab der Reichweite a in den Sill über.
• Das exponentielle Modell steigt exponentiell an und erreicht bei der Reichweite von ungefähr 3a asymptotisch den Sill.
• Das Gauß’sche Modell zeigt einen parabolischen Anstieg und geht bei einer Reichweite von ungefähr 2a in den Sill über.
• Das lineare Modell steigt stetig an und erreicht keinen Sill.
Der Nuggeteffekt bezeichnet eine schon bei sehr kleinen Abständen auftretende hohe, unregelmäßige Streuung beziehungsweise eine hohe Varianz zwischen eng benachbarten Stichprobenwerten. Diese Nuggetvarianz wird normalerweise als isotrope, also richtungsunabhängige, Komponente betrachtet; aus der Praxis sind jedoch Gegenbeispiele bekannt. Die angepasste Modellfunktion bildet später die Grundlage für die räumliche Interpolation der Schätzwerte.
Interpretation und Schätzung
Bei der Interpretation wird der Datensatz unter Einbezug lokaler Zusatzinformationen sowie früherer oder vergleichbarer Datenerhebungen auf den Untersuchungsgegenstand bezogen. Dieser Schritt dient besonders der geowissenschaftlichen Plausibilitätsprüfung, der Auswahl einer passenden Schätzmethode und einer aussagekräftigen Darstellung der Ergebnisse.
Die Schätzung approximiert aus Stichprobenwerten und weiteren gewonnenen Informationen Werte an nicht untersuchten Orten. Interpolation bezeichnet Schätzungen innerhalb, Extrapolation solche außerhalb des Untersuchungsgebiets. Wegen der räumlichen Korrelation beeinflussen nahe Messorte den Schätzwert einer physikalischen Größe, etwa der Oberflächentemperatur, stärker als weit entfernte Messorte. Man unterscheidet nichtstatistische und statistische Interpolationsverfahren; statistische Verfahren beruhen auf einem geostatistischen Modell, häufig einem speziellen Zufallsfeld.
Als geostatistische Interpolationsmethode hat sich das Kriging gegenüber linearer Interpolation, Polygonmethode und inverser Distanzwichtung etabliert. Beim Kriging erhalten Messwerte abhängig von ihrer Nähe zum Schätzort und vom modellierten Semivariogramm unterschiedliche Gewichtungsfaktoren. Nahe und räumlich besonders aussagekräftige Werte können dadurch stärker in den Schätzwert eingehen. Beim arithmetischen Mittel als Gegenbeispiel erhalten dagegen alle Messwerte dasselbe Gewicht.
Eine Voraussetzung für die Interpolation ist eine homogene Messwertverteilung im Untersuchungsgebiet. In der Praxis wird diese Forderung meist zur stochastischen Stationarität zweiter Ordnung abgeschwächt: Der Erwartungswert einer Zufallsfunktion ist dann unabhängig vom Ort, während die räumliche Abhängigkeit nur eine Funktion des Abstandsvektors ist.
Anwendungsgebiete
Die Geostatistik ist ein grundlegender Bestandteil der Lagerstättenkunde und des Bergbaus. Mithilfe einer Volumen- oder Blockschätzung lässt sich beispielsweise das Gesamtvorkommen einer Lagerstätte abschätzen. Kokriging kann zusätzliche, räumlich zusammenhängende Größen gemeinsam berücksichtigen und so etwa zur Bewertung der Abbauwürdigkeit beziehungsweise Reinheit von Erzen eingesetzt werden.
Flächenschätzungen ermöglichen außerdem digitale Geländemodelle und Karten. Mit geostatistischen Methoden lassen sich die Ausbreitung von Stoffkonzentrationen in Böden und Grundwasser sowie Nährstoffverhältnisse, Schwermetall- und Schadstoffkonzentrationen abschätzen. Ebenso können räumliche Verteilungen von Niederschlag, Lufttemperatur und Windfeldern modelliert werden. Deshalb wird die Geostatistik außer im Bergbau auch in Klimatologie, Hydrologie, Bodenkunde, Hydrogeologie, Geographie und Archäologie verwendet.