Wikipedia · einfach zusammengefasst · Stand
Data Masking
Data Masking unterscheidet sich von der Verschlüsselung von Daten dadurch, dass es keine 1:1-Abbildung zwischen Originaldaten und verfremdeten Daten geben muss.
Inhalt3 Abschnitte
Bedeutung und Ziel
Data Masking bezeichnet die Anonymisierung oder Verfremdung von Daten und ist eine Maßnahme des Datenschutzes. Gleichbedeutend werden auch Data Obfuscation, Data Sanitization und Data Scrambling verwendet.
Anders als bei der Verschlüsselung muss es keine 1:1-Abbildung zwischen Originaldaten und veränderten Daten geben. Die maskierten Daten bleiben meist lesbar. Maskiert werden können alle Datentypen, nicht nur personenbezogene Daten; der Begriff ist daher weiter als Anonymisierung und Pseudonymisierung von Personen- und Adressdaten.
Das Ziel ist Data Leakage Prevention, also die Verhinderung von Datenlecks. Datendiebstahl, Datenmissbrauch und andere Formen von Datenkriminalität sollen verhindert werden, indem die Datenbasis selbst verändert wird. Extern zugängliche Datenbanken, etwa für Test- oder Trainingssysteme, enthalten dann maskierte statt Original- oder Produktivdaten.
Methoden zur Datenverfremdung
Maskierung kann Texte, Namen, Zahlen, Datumswerte und Werte in Datenbanktabellen auf unterschiedliche Weise verändern:
- Eine Blacklist ersetzt festgelegte Originalwörter oder -Token nach dem Prinzip „Find & Replace“. Free text ersetzt Werte durch frei definierbare Zeichenketten aus Buchstaben, Zahlen und Sonderzeichen. Anagramme werden aus dem Inhalt des Originalwerts gebildet.
- Für realistisch wirkende Beispieldaten lassen sich technisch gültige Kreditkartennummern erzeugen, die dem Luhn-Algorithmus genügen, sowie zufällige Unternehmensnamen, Vor- und Nachnamen, vollständige Namen, E-Mail-Adressen und Telefon-, Fax- oder Mobilnummern. Beispiel-E-Mail-Adressen bestehen aus Name, „@“, Firmenname und einer Endung wie com oder de, etwa Michael.Mü[email protected].
- Einzelne Teile eines Wortes können mit einem Zeichen wie * überdeckt werden: entweder jedes x-te Zeichen oder die ersten und letzten x Zeichen.
- Numerische Werte können zufällig innerhalb von x % bis y % des Originalwerts liegen oder genau x % des Originalwerts betragen. Sie können außerdem im gleichen Verhältnis wie ein anderes Attribut verändert werden oder umgekehrt, also invers proportional.
- Beim Shuffle Values in Attribut werden Originalwerte zufällig neu auf Tabellenzeilen verteilt. Datumswerte können zufällig innerhalb von x bis y Tagen bezogen auf einen Referenzwert gewählt werden.
Einsatz für sichere Systeme
Maskierte Daten bleiben lesbar und behalten möglichst weitgehend Kontext und Informationsstruktur, obwohl sie nicht verschlüsselt sind. Deshalb eignen sie sich zur Befüllung von Test-, Demo- und Trainingssystemen mit sicherheitsunkritischen Daten, die aus Originaldaten abgeleitet wurden. Das Sicherheitsproblem wird dabei direkt an der Datenquelle behandelt.
Data Masking kann außerdem zur Einhaltung von Datenschutzregelungen eingesetzt werden. Genannt werden unter anderem HIPPA, HITECH, PHI, GLBA, PCI DSS, SOA, Dodd-Frank Wall Street Reform, Consumer Protection Act, SB 1386, European Union (EU) Data Protection Directive, PIPEDA, ISO 27000 series und USA Patriot Act. Unternehmen in betroffenen Ländern müssen selektiv bestimmte, meist personenbezogene Daten schützen. Dies kann durch Verschlüsselung oder durch Data-Masking-Maßnahmen erfolgen.