Wikipedia · einfach zusammengefasst · Stand
Geosemantik
Geosemantik baut auf Erkenntnissen aus der Geoinformatik, Geographie, Philosophie, Kognitionswissenschaft, Linguistik, Mathematik und Informatik auf. Al …
Inhalt6 Abschnitte
Begriff und Ziel
Geosemantik (englisch geospatial semantics) ist ein interdisziplinäres Forschungsfeld zur Bedeutung von Geoinformation. Geoinformation sind Daten mit räumlichem Bezug, etwa digitale Karten, Ortsnamen oder Sensormessungen. Ihre Bedeutung kann sich je nach Anwendungszweck und Wissen der Urheber unterscheiden.
Das zentrale Ziel ist semantische Interoperabilität: Daten aus unterschiedlichen Fachgebieten und Anwendungen sollen so ausgetauscht, kombiniert und verstanden werden, wie es die Datenanbieter beabsichtigen. Dafür entwickelt die Geosemantik Strategien, rechnerische Methoden und Werkzeuge, die Bedeutungen explizit und maschinenlesbar beschreiben. Sie stützt sich unter anderem auf Geoinformatik, Geographie, Philosophie, Kognitionswissenschaft, Linguistik, Mathematik und Informatik.
Al Gores Vision eines virtuellen Globus verdeutlicht den Nutzen: Digitale Karten, historische Dokumente und touristische Sehenswürdigkeiten sollen nahtlos verbunden werden, damit beispielsweise Klimawandel verständlich visualisiert werden kann. Das verlangt die Integration von Daten unterschiedlicher Herkunft und Qualität. Geosemantik macht verschiedene Sichtweisen auf die Welt ausdrücklich und entwickelt Verfahren zu ihrer Integration und Übersetzung.
Warum Bedeutungen bei Geodaten wichtig sind
Die gleiche Umwelt kann abhängig von Beruf, Sprache, kulturellem Hintergrund, Glauben, Alter und Zweck unterschiedlich beschrieben werden. Eine Straße ist für Straßenbauer eine Verbindung, die Mobilität erhöht, für Ökologen aber möglicherweise ein Hindernis, das Lebensräume zerschneidet.
Syntaktische Interoperabilität bedeutet, dass Daten technisch in einem gemeinsamen Format oder Zahlensystem verarbeitet werden können. Sie verhindert jedoch keine falsche Deutung. Werden Schienen- und Straßennetze ohne semantische Beschreibung kombiniert, kann eine Routenplanung für Autos unbrauchbar werden. Semantische Konflikte entstehen durch unterschiedliche Begriffsverständnisse, Auffassungen eines Wissensgebietes oder einen anderen Fokus bei der Datenerfassung.
Das Ortsschild von New Cuyama veranschaulicht dies: Bevölkerungszahl, Höhe über Meeresspiegel und Gründungsjahr können mathematisch korrekt addiert werden, ihre Summe hat aber keine Bedeutung. Für thematische Aspekte räumlicher Daten fehlt ein formales Referenzsystem wie für Raum und Zeit sowie ein gemeinsames Vokabular. Deshalb sind eindeutige Spezifikationen nötig. Software-Agenten können auf Basis maschinenlesbarer Beschreibungen Gemeinsamkeiten und Unterschiede erkennen.
Typische Folgen fehlender Semantik sind mehrdeutige Ortsnamen wie „Sydney“, falsche Distanzdarstellungen in Kartenprojektionen und Einheitenfehler: Der Mars Climate Orbiter verglühte 1999, weil Newton-Sekunden als Pfund-Sekunden interpretiert wurden. Auch Straßenbreite oder „Unterkunft“ können je nach Definition zu sehr verschiedenen Ergebnissen führen.
Anwendungen: Integration, Suche und Datenqualität
Geosemantik wird in Geoinformations- und Navigationssystemen, virtuellen Globen, Geodateninfrastrukturen und Sensornetzen eingesetzt. Wesentliche Bereiche sind Datenintegration, Suche, Nutzbarkeit und Datenintegrität.
Bei Web-Diensten reicht ein gemeinsames Datenformat nicht aus: Ein Anbieter kann eine Verbindung wegen ihrer Mindestbreite als Straße einordnen, während für eine Anfrage der Straßenbelag entscheidend ist. Semantische Beschreibungen erlauben es, Dienste automatisch zu finden und sinnvoll zusammenzufügen. Im Projekt SWING (Semantic Web-service Interoperability for Geospatial decision making) wurden Dienste so annotiert, dass sie etwa zur Verarbeitung von Lagerstätten kombiniert werden konnten; erforderlich war eine gemeinsam entwickelte Anwendungsontologie.
Das Semantische Sensor-Web verbindet Sensor Web Enablement (SWE) und Semantisches Web. Beobachtungen sollen nicht in Daten-Silos bleiben, sondern im Internet verfügbar sein. Langfristig sollen Dienste Sensoren automatisch auswählen, konfigurieren und abstimmen können. Eine Frage nach einer möglichen Überflutung eines Donau-Flussabschnitts bei weiterem Regen verlangt etwa Wissen über „Flussabschnitt“, „Donau“, „Überflutung“ und den Zusammenhang von Regen und Überflutung. Dafür können Sensor Planning Services (SPS) und Sensor Alerting Services (SAS) genutzt werden.
Die geographische Informationswiedergewinnung ergänzt die Textsuche um Raum und Zeit. Bei „Kneipen in der Wiener Altstadt“ müssen Thema und topologische Lage passen. Wichtige Aufgaben sind das Erkennen geographischer Referenzen in Texten, die Auflösung mehrdeutiger Ortsnamen, der Umgang mit vagen Gebieten, räumlich-textuelle Indizierung und räumlich-zeitliche Relevanzbewertung.
Gazetteers sind Ortsverzeichnisse. Sie verbinden Ortsnamen mit einer geographischen Region, beispielsweise einer Bounding Box, und einer Objektart wie „Stadt“. Sie liefern mindestens Ortsreferenz und Objektart und werden etwa in Karten, Suchmaschinen und Geoparsern eingesetzt. Bekannte Beispiele sind Getty Thesaurus of Geographic Names und Geonames.org.
In GIS können die beabsichtigte, implementierte, dokumentierte und erwartete Bedeutung eines Operators auseinanderfallen. Maschinenlesbare Operatorsemantik könnte nur zulässige Funktionen anbieten und etwa falsche konzentrische Distanzkreise in einer Mercator-Projektion verhindern. Für die Datenintegrität prüfen Regeln logische und topologische Konsistenz nach ISO 19113: Eine als Straße klassifizierte Fläche darf beispielsweise nicht unter drei Metern breit sein; eine Autobahn-Ausfahrt muss mit Autobahn und einer weiteren Straße verbunden sein. Bei einem Schnitt von Straße und See kann das System auch „Brücke“ oder „Fährverbindung“ vorschlagen.
Semantische Strategien
Informationsgemeinschaften, etwa in Katasterverwaltung oder Verkehrs-, Umwelt- und Ressourcenmanagement, brauchen gemeinsame Deutungen von Daten. Semantische Strategien sollen Kommunikation ermöglichen, indem sie mögliche Interpretationen so einschränken, dass möglichst die gewünschte bleibt.
Drei Qualitätsmaßstäbe beschreiben mögliche Übereinkünfte:
- Terminologische Übereinkunft: Einigung über Basisbegriffe für Definitionen, etwa Straßenname oder Teil-Ganzes-Beziehungen zwischen Lebensräumen.
- Ontologische Festlegung (ontological commitment): Festlegung, über welche Objekte gesprochen wird, zum Beispiel dass Straßen Arten, erkennbare Breite und eine Zugehörigkeit zu einem Straßennetz haben.
- Kontextfestlegung: Begriffe gelten nur in einer bestimmten Domäne. So kann Straßenbreite als befestigte Oberfläche ohne Radwege definiert werden.
Der Film „Der Engländer, der auf einen Hügel stieg und von einem Berg herunterkam“ zeigt die Bedeutung des Kontexts: Die Landvermesser nannten nur Erhebungen über 1000 Fuß Berge, während die Einwohner von Ffynnon Garw eine lokal dominante Erhebung als Berg verstanden. Beide verwendeten dieselben Wörter, aber in verschiedenen Kontexten.
Beim semantischen Engineering werden Übereinkünfte durch drei Strategien unterstützt. Erstens beschreibt eine Ontologie als formale Theorie eine bestimmte Sicht auf die Umwelt. Sie legt Vokabular und ontologische Festlegungen fest; formales Schließen kann dann aus vereinbarten Regeln Folgerungen ziehen. Zweitens wird bei emergent semantics Bedeutung gemeinschaftlich ausgehandelt, etwa durch Folksonomien: hierarchielose Sammlungen von Tags, die Nutzer mit Informationsquellen verknüpfen. Drittens trennt semantische Referenzierung Kontexte eindeutig. Sie soll das Symbolverankerungsproblem lösen, also Symbole mit ihren Referenten in der realen Welt verbinden. Semantische Referenzsysteme verallgemeinern räumliche und zeitliche Referenzsysteme und verankern Begriffe in nachvollziehbaren Beobachtungen.
Methoden und Werkzeuge
Bei der Suche nach Geoinformation helfen Ontologien und Gazetteers, Anfragen zu verfeinern oder eindeutige Ortsnamen vorzuschlagen. SPIRIT ist ein Beispiel für semantisch unterstützte Anfragenerweiterung. Explizite Anfragen können in einem regelähnlichen Format mit Vokabular aus Ontologien und Ortsverzeichnissen formuliert werden. Anfragen auf Grundlage der Semantic Web Rule Language (SWRL) können räumliches Schließen unterstützen, wenn räumliche Funktionen ergänzt werden.
Für die Indizierung werden Textverfahren wie Stemming oder Lemmatisierung eingesetzt. Data-Mining, etwa Latent Semantic Indexing, kann Schlüsselkonzepte und Ortsnamen ermitteln und sie semantisch mit räumlichen Ontologien annotieren. Relevanzbewertungen berücksichtigen zusätzlich zur thematischen Übereinstimmung die räumliche Distanz von Georeferenzen.
Bei automatischer Datenintegration übernimmt ein Reasoner die Auswertung: Er soll benötigte Dokumente und Datenquellen erkennen und in Arbeitsabläufe einbeziehen. Reasoning-Algorithmen prüfen außerdem logische und topologische Widersprüche, etwa nicht verbundene Flüsse oder Bäume in Seen, sofern Objekte mit Ontologiekonzepten verknüpft und Regeln formuliert sind.
Geoontologien entstehen meist durch eine Kombination zweier Wege. Top-down arbeiten Wissensingenieure mit Literaturrecherche, Data-Mining und Fachexperten; dies ist nötig, weil Wissen oft implizit ist und Definitionen widersprüchlich sein können. Bottom-up nutzt die Informationsgemeinschaft selbst, etwa frei gewählte Kategorien in OpenStreetMap. Bereits vorhandene Modelle und Vokabulare können wiederverwendet werden, beispielsweise SWEET, GEMET oder AGROVOC der FAO.
Für Schlussfolgerungen werden unter anderem Beschreibungslogiken (DL), entscheidbare Teillogiken der Prädikatenlogik erster Stufe, verwendet. Sie erlauben Tests auf Erfüllbarkeit und Widerspruchsfreiheit, Subsumption, Instanztests sowie das Auffinden gemeinsamer Oberklassen. Für OWL gibt es Tableau- und Resolutions-basierte Beweiser. Horn-Klausel-basierte Vorwärts- oder Rückwärtsverkettung kann regelbasierte Schlüsse und SWRL-Abfragen effizient lösen. Ausdrucksstärkere räumliche Theorien wie Region Connection Calculus, Mereologie oder Euklidische Geometrien benötigen teils Prädikatenlogik erster oder zweiter Ordnung und halbautomatische Verfahren.
Wichtige Standards sind XML, XML Schema, RDF, RDF-Schema, OWL und SWRL. Werkzeuge sind etwa der Ontologie-Editor Protégé, ConceptVista, Rabbit und CMapTools; Reuters Calais und Ontogen unterstützen Data-Mining. GeoSWRL integriert räumliche Relationen in SWRL. Reasoner wie Pellet, Jena und der beschreibungslogikbasierte, auf Ähnlichkeitsmessungen ausgerichtete SIM-DL ermöglichen maschinelle Schlussfolgerungen.
Entwicklung und offene Fragen
Die Geosemantik entwickelte sich in vier im Artikel beschriebenen Phasen. Bis 1990 wandelte sich die Auffassung von GIS als Werkzeugen zum Speichern und Verändern digitaler Karten hin zu einem Verständnis räumlicher und thematischer Information. Das „Las Navas Meeting“ im Juli 1990 brachte Forschende aus mehreren Disziplinen zusammen. Von etwa 1990 bis 2000 wurden geographische Darstellung und räumliches Schließen zentrale Themen; die NSF förderte ab 1988 das NCGIA. Ab etwa 1995 rückten World Wide Web, offene Schnittstellen des Open GIS Consortium beziehungsweise Open Geospatial Consortium und Fragen der Interoperabilität in den Vordergrund. Ab etwa 2005 ergänzen Web 2.0, Crowdsourcing, GPS-Daten, Fotos und OpenStreetMap die hierarchische Geodatenproduktion; Tags liefern Daten über unterschiedliche Begriffsinterpretationen.
Offene Forschungsfragen betreffen besonders Prozesse, Vagheit, Übersetzung, Vertrauenswürdigkeit und den Wandel von Bedeutungen. Umweltphänomene sind häufig Prozesse oder Ereignisse. Um etwa Sensordaten oder Klimawandel zu verstehen, müssen sowohl Messprozesse als auch die beobachteten Prozesse formalisiert werden; bisher genügen sich Forschende oft noch mit statischen Modellen.
Geowissenschaftliche Begriffe wie „Fluss“ sind häufig vage und nicht unabhängig von Kontext und Domäne eindeutig definierbar. Ontologien können mögliche Interpretationen einschränken, aber unerwünschte nicht vollständig ausschließen. Deshalb werden Methoden zum Umgang mit Vagheit und zur semantischen Übersetzung benötigt.
Semantische Übersetzung strebt keine einzige, allumfassende Definition an, sondern lässt unterschiedliche, für ihren Zweck sinnvolle Sichtweisen zu. Semantische Ausrichtung und Ähnlichkeitsmaße sollen Brücken zwischen ihnen bauen. Vertrauenswürdigkeit wird zunehmend als Maß der Informationsqualität verstanden, also als Brauchbarkeit von Daten für eine Aufgabe, nicht nur als Konsistenz oder Vollständigkeit. Schließlich verändern sich Begriffe, Ortsnamen und Klassifikationen im Lauf der Zeit. Zeitliches Indizieren von Ontologien wäre ein einfacher Ansatz, wird aber meist weder durchgeführt noch für Schlussfolgerungen genutzt; umfassendere Modelle der semantischen Entwicklung liegen mit heutigen Techniken größtenteils noch außer Reichweite.