Wikipedia · einfach zusammengefasst · Stand
Soundex
Gleichklingende Wörter (Homophone) und ähnlichklingende Wörter (Homöophone) sollen dabei zu einer identischen Zeichenfolge kodiert werden. Soundex-Algorithmus.
Inhalt4 Abschnitte
Zweck und Aufbau von Soundex
Soundex ist ein phonetischer Algorithmus: Er ordnet Wörter und Phrasen nach ihrem Klang ein. Gleichklingende Wörter (Homophone) und ähnlichklingende Wörter (Homöophone) sollen dabei dieselbe Zeichenfolge erhalten. Entwickelt wurde das Verfahren von Robert C. Russell und Margaret King Odell zur Indizierung von Familiennamen im United States Census; es wurde 1918 als US-Patent 1,261,167 patentiert.
Ein Soundex-Code besteht aus dem ersten Buchstaben eines Wortes und drei Ziffern. Die Ziffern stehen für die Konsonanten nach dem ersten Buchstaben; ähnlich klingende Laute erhalten dieselbe Ziffer. Für „Wikipedia“ lautet ein Beispielcode W-213.
Grundregeln der Codierung
Es werden höchstens drei Ziffern ausgegeben. Würden mehr entstehen, wird nach der dritten Ziffer abgebrochen. Fehlen Ziffern, werden Nullen angehängt: „Lee“ wird L-000.
Die ursprünglichen Buchstabengruppen sind: 1 für B, F, P, V; 2 für C, G, J, K, Q, S, X, Z; 3 für D, T; 4 für L; 5 für M, N; 6 für R. Vokale A, E, I, O, U sowie H, W und Y werden außer als erstem Zeichen ignoriert. Für Deutsch können Ä, Ö und Ü ebenfalls ignoriert und ß wie S codiert werden.
Direkt aufeinanderfolgende Buchstaben mit demselben Code werden nur einmal ausgegeben. Daher wird „abfx“ zu A120: A bleibt als erster Buchstabe, B und F ergeben gemeinsam 1, X ergibt 2, anschließend ergänzt eine Null. Die ähnlich klingenden Namen „Robert“ und „Rupert“ erhalten beide R163.
Aussagekraft und Grenzen
Das Verfahren wird vor allem dafür kritisiert, stark auf Englisch ausgerichtet zu sein und nur eine grobe phonetische Analyse zu liefern. Trotzdem gilt der dargestellte Algorithmus als wohl am häufigsten verwendeter Algorithmus für phonetische Suche; dazu trug ein früh implementierter PL/SQL-Standardbefehl in Oracle bei. Für andere Sprachen wurden Varianten entwickelt, etwa das in SAP verfügbare Kölner Verfahren beziehungsweise die Kölner Phonetik für Deutsch.
Die grobe Analyse zeigt das Beispiel „Britney Spears“ und „bewährten Superzicke“: Britney → BRTN → B635 und bewährten → BRTN → B635; Spears → SPRS → S162 und Superzicke → SPRZCK → S16222 → S162. Nach Soundex gelten die beiden Begriffe damit als phonetisch identisch.
Anpassung für die deutsche Sprache
Für Deutsch werden die Buchstabencodes angepasst: 0 für a, e, i, o, u, ä, ö, ü, y, j, H; 1 für b, p, f, v, w; 2 für c, g, k, q, x, s, z, ß; 3 für d, t; 4 für l; 5 für m, n; 6 für r; 7 für ch.
Ä, Ö und Ü werden als Vokale zunächst durch Nullen ersetzt und später entfernt. ß erhält wie s die Ziffer 2. Das deutsche j wird wie das englische y behandelt und gehört deshalb zu Vokalen und Halbvokalen, während w als stimmhafter Gegenpart zu f oder v die Ziffer 1 erhält. Für die deutsche Buchstabenfolge „ch“, etwa in „ich“ oder „ach“, gibt es die zusätzliche Kategorie 7.
Ob die Beschränkung auf drei Ziffern für Deutsch angemessen ist, wäre noch zu untersuchen, weil deutsche Wörter tendenziell länger sind als englische.