Zum Inhalt springen
L

Wikipedia · einfach zusammengefasst · Stand

Big Data

Big Data wird häufig als Sammelbegriff für digitale Technologien verwendet, die in technischer Hinsicht für eine neue Ära digitaler Kommunikation und …

Inhalt6 Abschnitte
  1. 1. Definition und Merkmale
  2. 2. Datenquellen und Wachstum
  3. 3. Verarbeitung und Einsatzgebiete
  4. 4. Beispiele für Forschung, Bewertung und Beeinflussung
  5. 5. Datenschutz und gesellschaftliche Risiken
  6. 6. Grenzen und Kritik an Auswertungen

Definition und Merkmale

Big Data, deutsch auch Massendaten, bezeichnet Datenmengen, die zu groß, zu komplex, zu schnelllebig oder zu schwach strukturiert sind, um sie mit manuellen oder herkömmlichen Methoden der Datenverarbeitung auszuwerten. Der Begriff kann außerdem die digitalen Technologien bezeichnen, mit denen solche Daten gesammelt, gespeichert und analysiert werden. Big Data steht in engem Zusammenhang mit der Datafizierung, also der Umwandlung immer weiterer Lebens- und Arbeitsbereiche in auswertbare Daten.

Das „Big“ wird durch vier Dimensionen beschrieben:

  • Volume: Umfang beziehungsweise Volumen der Daten.
  • Velocity: Geschwindigkeit, mit der Daten erzeugt und übertragen werden.
  • Variety: Vielfalt der Datentypen und Datenquellen.
  • Veracity: Echtheit beziehungsweise Verlässlichkeit der Daten.

Ergänzend werden häufig Value, der wirtschaftliche oder praktische Wert, und Validity, die Richtigkeit und Qualität der Daten, genannt.

In Medien und Wirtschaft wird Big Data teilweise als weiter gefasstes Schlagwort verwendet. Gemeint sein können etwa Überwachung, personalisierte Werbung, Cloud Computing, Industrie 4.0, das Internet der Dinge, automatisierte Entscheidungen oder People Analytics. Diese Verwendungen betreffen jedoch nicht immer tatsächlich große oder komplexe Datenmengen.

Datenquellen und Wachstum

Big Data stammt aus zahlreichen Quellen. Dazu gehören Überwachungssysteme, Bezahl- und Kundenkarten, elektronische Kommunikation, soziale Netzwerke, Suchmaschinen, GPS und andere Navigationssysteme sowie Smartphones, Computer, Fahrzeuge, Smart Homes und Smart Meter. Auch Wearables wie Fitnessarmbänder und Smartwatches liefern Daten. Bei Smartphones können neben Nachrichten beispielsweise Eingabemuster, Bewegungsdaten und Sensordaten erfasst werden. Weitere Quellen sind Behörden und Unternehmen.

Die Datenmengen wachsen typischerweise exponentiell. Berechnungen aus dem Jahr 2011 zufolge verdoppelt sich das weltweit erzeugte Datenvolumen alle 2 Jahre. Ein wichtiger Grund ist, dass Maschinen automatisch immer mehr Daten erzeugen: etwa Verbindungsprotokolle der Telekommunikation, Logdateien von Webzugriffen sowie Aufzeichnungen von RFID-Lesern, Kameras, Mikrofonen und anderen Sensoren. Große Datenmengen entstehen außerdem bei Finanztransaktionen und Börsendaten, beim Energieverbrauch, im Gesundheitswesen sowie in Forschungsgebieten wie Geologie, Genetik, Klimaforschung und Kernphysik.

Ist eine vollständige Speicherung zu teuer, werden teilweise nur Metadaten gespeichert. Metadaten sind beschreibende Angaben über andere Daten. Alternativ beginnt die Auswertung bereits während der Entstehung der Daten oder mit nur geringer Verzögerung. Zugang zu besonders großen Datenbeständen haben vor allem große Konzerne wie Suchmaschinenanbieter und bestimmte staatliche Institutionen wie Geheimdienste.

Verarbeitung und Einsatzgebiete

Klassische relationale Datenbanken sowie herkömmliche Statistik- und Visualisierungsprogramme reichen zur Verarbeitung von Big Data häufig nicht aus. Deshalb werden Systeme eingesetzt, die Aufgaben parallel auf bis zu Hunderten oder Tausenden von Prozessoren oder Servern bearbeiten. Sie müssen sehr viele Datensätze und Spalten verarbeiten, große Mengen schnell importieren und die Daten möglichst sofort abfragbar machen. Weitere Anforderungen sind kurze Antwortzeiten, viele gleichzeitige Abfragen und die gemeinsame Analyse unterschiedlicher Informationstypen wie Zahlen, Texte und Bilder.

Ein bekannter Ansatz ist MapReduce. Dabei werden umfangreiche Berechnungen in Teilaufgaben zerlegt und auf mehrere Rechner verteilt. Der Ansatz wird unter anderem in Apache Hadoop und MongoDB sowie in kommerziellen Produkten wie Aster Data oder Greenplum eingesetzt. Die Softwareentwicklung für Big Data wird im Artikel als noch in einer frühen Phase beschrieben.

Unternehmen nutzen solche Analysen zur Verbesserung von Geschäftsprozessen, besonders in Informationstechnik, Technologieentwicklung und Marketing. Ziele sind Wettbewerbsvorteile, Einsparungen, neue Geschäftsfelder, Markt- und Trendforschung sowie Prognosen. Staatliche Stellen versprechen sich bessere Ergebnisse in Kriminalistik, Terrorismusbekämpfung und Verwaltung. In der Forschung können große Datenbestände verbunden und statistisch ausgewertet werden, um neue Zusammenhänge zu erkennen.

Zu den genannten Anwendungen zählen Bonitätsprüfungen, die Erkennung auffälliger Finanztransaktionen, intelligente Energieverbrauchssteuerung, medizinische Diagnostik, Epidemievorhersagen, Smart Farming, Fabriksteuerung und vorausschauende Wartung. Weitere Beispiele sind flexible Abrechnungssysteme in der Telekommunikation, die Verarbeitung von Wetter- und Sensordaten sowie die Erstellung von Bewegungs-, Kauf- und Persönlichkeitsprofilen. Versicherungen können Beiträge anhand von Fahrweise oder gesundheitsbezogenem Verhalten anpassen. Im Bildungswesen sollen Datenanalysen Lernformen und Bildungsprogramme optimieren.

Die Analyse von Kundendaten ist allerdings nicht automatisch Big Data. Viele Marketinganwendungen sind eher Small-Data-Analytics, weil die verwendeten Daten weder besonders groß noch komplex sind.

Beispiele für Forschung, Bewertung und Beeinflussung

In der Forschung sollen große Datenmengen zuverlässigere Ergebnisse ermöglichen. Genannt werden eine Studie mit rund 16.000 Kindern über Zusammenhänge zwischen Übergewicht und Diabetes sowie eine Fall-Kontroll-Studie über den Einfluss von Fluglärm, für die Krankenkassendaten von über einer Million Patienten ausgewertet wurden.

Beim Social Scoring werden gesammelte Daten verwendet, um beispielsweise Kreditwürdigkeit, Gesundheitsrisiken oder das Konsumverhalten einzuschätzen und Vorhersagen zu treffen. In China baut darauf ein System auf, das auch das soziale Verhalten der Einwohner kontrollieren, bewerten und verbessern soll.

Microtargeting bezeichnet die gezielte Ansprache bestimmter Personen mit individuell zugeschnittenen Inhalten. Bei der US-Präsidentschaftswahl 2016 und dem Brexit-Referendum im selben Jahr arbeitete Cambridge Analytica für die späteren Gewinner. Das Unternehmen erklärte nach der US-Wahl, psychometrische Analysen großer Datensätze hätten geholfen, unentschiedene oder leichter beeinflussbare Wähler, sogenannte Swing Voters, zu erkennen und ihnen über Facebook passende Wahlwerbung zu zeigen. Ob dieser Einsatz tatsächlich entscheidend für Donald Trumps Wahlsieg war, wird im Artikel nur als Behauptung des Unternehmens wiedergegeben.

Grundlage solcher Verfahren waren unter anderem Forschungen des Psychologen Michal Kosinski. Er verband Big-Data-Auswertungen mit psychologischen Verhaltensanalysen und zeigte, dass sich aus Facebook-Likes Persönlichkeitseigenschaften sowie sexuelle Orientierung, Drogenkonsum und religiöse und politische Einstellungen vorhersagen lassen.

Datenschutz und gesellschaftliche Risiken

Big Data kann sehr private Bereiche erfassen. Das Interesse von Unternehmen und Behörden an möglichst umfassendem Datenzugriff steht daher im Konflikt mit Persönlichkeitsrechten. Anonymisierung soll Personen schützen, ist aber nicht immer zuverlässig: Der Datenwissenschaftler Andreas Dewes zeigte, dass angeblich anonyme, von Werbefirmen verkaufte Daten wieder Personen zugeordnet werden konnten. Sein Datensatz umfasste etwa drei Millionen Deutsche, darunter Mitglieder des Deutschen Bundestags und von Landesparlamenten, Richter, Polizeibeamte und weitere Personen des öffentlichen Lebens.

Der Europäische Datenschutzbeauftragte Giovanni Buttarelli betonte im März 2013, persönliche Informationen seien keine Ware. Bei der Anpassung von Versicherungsbeiträgen anhand persönlicher Daten wird zudem vor einer „schleichenden Entsolidarisierung in der Versicherung“ gewarnt.

Ungeklärt oder umstritten ist, wem gesammelte Daten gehören, wer über sie verfügen darf und wer ihre Verwendung kontrolliert. Auch die Wirksamkeit der europäischen Datenschutz-Grundverordnung, die seit dem 25. Mai 2018 anzuwenden ist, wird diskutiert. Kritiker warnen vor Manipulation, Diskriminierung, wirtschaftlicher Ausbeutung und staatlicher Kontrolle. Shoshana Zuboff bezeichnet die Nutzung persönlicher Erfahrungen als Rohmaterial für Überwachung, Vorhersage und Beeinflussung als Überwachungskapitalismus. Sie fordert die Zerschlagung datenbeherrschender Konzerne und Verbote gegen Datenkonzentrationen. Als gemeinwohlorientierten Gegenentwurf schlägt Nils Zurawski eine „solidarische Datenspeicherung“ vor.

Grenzen und Kritik an Auswertungen

Große Datenmengen sind nicht automatisch gute Daten. Kritisiert wird, dass Daten häufig nach technischer Verfügbarkeit erhoben werden und statistische Grundprinzipien wie eine repräsentative Stichprobe vernachlässigt werden. Die Sozialforscherin Danah Boyd betont: Mehr Daten bedeuten nicht zwangsläufig höhere Qualität; nicht alle Daten sind gleich wertvoll; die Fragen nach dem „Was“ und dem „Warum“ sind verschieden; Interpretationen verlangen Vorsicht; und technisch verfügbare Daten dürfen nicht automatisch als ethisch nutzbar gelten.

Ein Beispiel für Fehlinterpretationen ist die Dunbar-Zahl: Ein Forscher ermittelte, Menschen könnten nicht mehr als 150 Freundschaften pflegen. Diese Zahl wurde als technische Begrenzung in sozialen Netzwerken verwendet. Dabei wurde übersehen, dass als „Freunde“ bezeichnete Kontakte auf Facebook nicht unbedingt echte Freundschaften sind, sondern zunächst nur Kommunikationsbereitschaft ausdrücken.

Umstritten ist außerdem die Vorstellung, Big Data könne wissenschaftliche Theorien ersetzen. Chris Anderson beschrieb 2008, dass bei Echtzeitanalysen Korrelationen wichtiger werden könnten als kausale Erklärungen. Eine Korrelation ist ein statistischer Zusammenhang; sie beweist jedoch nicht, dass ein Faktor die Ursache des anderen ist. Erklärungen können sich erst später bestätigen oder als falsch erweisen.

Schließlich gilt Big Data als unscharfer und teilweise übermäßig beworbener Begriff. Er wird auch für Daten verwendet, die weder groß noch komplex oder schnelllebig sind und sich mit herkömmlichen Verfahren bearbeiten lassen. Nach Ansicht einiger Beobachter droht er dadurch zu einem inhaltsarmen Marketingbegriff zu werden und im sogenannten „Tal der Enttäuschungen“ des Hype-Zyklus stark an Bedeutung zu verlieren.

Weiterlesen

Daten Daten bezeichnet als Plural von Datum Fakten, Zeitpunkte oder kalendarische Zeitangaben. Als Pluralwort steht es für durch Beobachtungen, Messungen u. a. Datenstruktur In der Informatik und Softwaretechnik ist eine Datenstruktur ein Objekt, welches zur Speicherung und Organisation von Daten dient. Es handelt sich um eine … Vorratsdatenspeicherung Die Vorratsdatenspeicherung (englisch data retention oder retention of data) ist ein Instrument, das die Anbieter öffentlich zugänglicher elektronischer … Wettbewerbsvorteil Ein Wettbewerbsvorteil (englisch competitive advantage) ist in der Wettbewerbstheorie und der Wirtschaft der Wettbewerbsvorsprung eines Unternehmens … Industrie 4.0 Die erste industrielle Revolution bestand in der Mechanisierung mittels Wasser- und Dampfkraft; darauf folgte · die zweite industrielle Revolution, geprägt durch … Internet der Dinge Das Internet der Dinge (IdD) (auch: „Allesnetz“; englisch Internet of Things, Kurzform: IoT) ist ein Sammelbegriff für Technologien einer globalen … Werbung Werbung ist damit ein Instrument (wohl das bekannteste) der Kommunikationspolitik, vor allem der Kommunikationspolitik im Marketing und allgemein des Marketings … Kreditkarte Eine Kreditkarte dient der Bezahlung von Waren und Dienstleistungen und ist meist weltweit und online einsetzbar. Der Begriff ist eine im 20. Smart Home Smart Home ist ein Oberbegriff für technische Verfahren und Systeme zur Gebäudeautomation in Wohnräumen und -häusern, in deren Mittelpunkt eine Erhöhung von … Informationstechnik Informationstechnik (kurz IT) steht für die Technik zur Elektronischen Datenverarbeitung (EDV) und der hierzu verwendeten Hard- und Software-Infrastruktur. Marketing Der Begriff Marketing oder (deutsch) Absatzwirtschaft bezeichnet aus historischer Sicht den Unternehmensbereich, dessen Aufgabe (Funktion) es ist, … Prognose Ein wesentliches Merkmal der Entscheidungen in jedem Bereich ist ihre Zukunftsbezogenheit: · Dabei kommt es im Bereich sozialwissenschaftlicher Prognosen zu …