Zum Inhalt springen
L

Wikipedia · einfach zusammengefasst · Stand

Han-Vereinheitlichung

Mit dem Begriff Han-Vereinheitlichung (englisch Han unification) wird in der Informatik die Vereinheitlichung der chinesischen Hanzi, japanischen Kanji und …

Inhalt6 Abschnitte
  1. 1. Grundidee und Bedeutung
  2. 2. Entwicklung bis Unicode
  3. 3. Regeln der Vereinheitlichung
  4. 4. Unterschiedliche Darstellung
  5. 5. Getrennte Varianten
  6. 6. Kritik und Variantenproblem

Grundidee und Bedeutung

Han-Vereinheitlichung bezeichnet in der Informatik die Zusammenführung verwandter Schriftzeichen aus mehreren ostasiatischen Schriftsystemen in einem gemeinsamen Zeichensatz. Gemeint sind vor allem chinesische Hanzi, japanische Kanji und koreanische Hanja, zusammen oft CJK genannt. Seltener wird auch die vietnamesische Chữ nôm einbezogen.

Der Begriff wird meistens im Zusammenhang mit Unicode verwendet. Unicode ist ein Standard, der Zeichen weltweit eindeutig codieren soll, damit Texte auf Computern gespeichert, übertragen und angezeigt werden können. Die Han-Vereinheitlichung ist dabei wichtig, weil viele Zeichen in China, Japan und Korea historisch miteinander verwandt sind und dieselbe Bedeutung haben können, aber je nach Schreibtradition unterschiedlich aussehen.

Entwicklung bis Unicode

Die Idee, mehrere Han-Schriften in einem Zeichensatz zusammenzuführen, gab es schon vor Unicode. Bereits 1980 existierte mit dem Chinese Character Code for Information Interchange (CCCII) ein Zeichensatz, der Kurzzeichen, Langzeichen und Kanji vereinigte.

Bei der Entwicklung des Unicode-Standards wurde diese Idee weiterverfolgt. Im Februar 1990 wurde eine spezielle Gruppe für die Han-Vereinheitlichung gegründet, das CJK-IRG. Kurz darauf wurde sie in IRG umbenannt. Als China die Entwicklung eines neuen Zeichensatzes namens GB 13000 ankündigte, einigten sich Unicode und China darauf, den Han-Zeichensatz gemeinsam zu entwickeln.

Regeln der Vereinheitlichung

Für die Han-Vereinheitlichung in Unicode ist die Ideographic Rapporteur Group (IRG) zuständig. Sie prüft Kodierungsvorschläge und entscheidet, welche Zeichen vereinigt werden können.

Dabei gelten strenge Regeln. Für die 20.902 Zeichen der ersten Unicode-Version wurde die source separation rule verwendet: Wenn zwei Ideogramme in einem älteren Zeichensatz getrennt waren, wurden sie auch in Unicode getrennt. Für später codierte CJK-Ideogramme wird diese Regel nicht mehr verwendet.

Außerdem werden Zeichen nicht vereinigt, wenn sie historisch und bedeutungsmäßig nicht verwandt sind. Ein Beispiel sind 土 („Erde“) und 士 („Krieger“): Sie sehen ähnlich aus, haben aber unterschiedliche Bedeutung und Herkunft.

Zur Prüfung werden Ideogramme in einzelne Striche zerlegt. Danach werden Strichzahl, Position der Striche, Struktur, Codierung in älteren Zeichensätzen und das Radikal bestimmt. Ein Radikal ist ein Grundbestandteil eines Zeichens, der oft bei der Einordnung in Wörterbüchern hilft. Nur wenn die relevanten Merkmale übereinstimmen, werden Zeichen vereinigt.

Unterschiedliche Darstellung

Viele vereinheitlichte Zeichen unterscheiden sich nur wegen verschiedener Schreibstile. Ein Zeichen kann also denselben Unicode-Codepunkt haben, aber je nach Schriftart oder Sprache unterschiedlich dargestellt werden.

Ein Beispiel ist das Radikal 辵, das als 辶 erscheint. In der Druckschrift kann es mit einem oder zwei oberen Punkten geschrieben werden; in Regel- und Handschrift besitzt es überall nur einen Punkt. Ähnlich ist es beim 示-Radikal: In klassischer Druckschrift, etwa Ming, wird es wie 示 geschrieben, in Hand- und Regelschrift dagegen wie 礻.

Solche Unterschiede hängen auch mit Schriftreformen zusammen. In der Volksrepublik China und in Japan wurde versucht, die Druckschrift stärker an die Handschrift anzupassen. In Korea geschah das nicht, in Taiwan nur begrenzt. Deshalb können vereinheitlichte Zeichen in chinesischen Kurzzeichen, chinesischen Langzeichen, japanischen Kanji und koreanischen Hanja unterschiedlich aussehen. Für die richtige Anzeige müssen passende Schriften installiert sein und der Browser die passende Schrift auswählen.

Getrennte Varianten

Trotz der Vereinheitlichung wurden einzelne Zeichenvarianten separat in Unicode aufgenommen. Das bedeutet: Manche Formen, die ähnlich aussehen oder historisch zusammenhängen, haben unterschiedliche Codepunkte.

Beispiele aus dem Artikel sind 高 und 髙, 紅 und 红, 丟 und 丢, 乗 und 乘, 侶 und 侣, 兌 und 兑, 內 und 内, 產 und 産, 稅 und 税, außerdem die Formen 亀, 龜 und 龟. Auch 別 und 别 sowie 両, 两 und 兩 werden getrennt aufgeführt.

Diese Beispiele zeigen, dass Unicode nicht einfach alle ähnlichen Zeichen zusammenlegt. Die Vereinheitlichung folgt Regeln und lässt bestimmte Varianten getrennt bestehen, wenn dies für Codierung, Bedeutung, ältere Zeichensätze oder Schreibtraditionen nötig ist.

Kritik und Variantenproblem

Die Han-Vereinheitlichung wird in Ostasien vor allem aus kulturellen, aber auch aus technischen Gründen kritisiert. Der Kritikabschnitt des Artikels ist als nicht hinreichend belegt markiert.

Ein Kernproblem ist die Unterscheidung zwischen Glyphe und Schriftzeichen. Eine Glyphe ist die sichtbare Form eines Zeichens; ein Schriftzeichen ist die abstrakte Einheit dahinter. Historisch gab es im Chinesischen und Japanischen keine exakte Trennung zwischen beidem. Unicode musste daher entscheiden, ob es diese Trennung systematisch einführt oder jede sichtbare Variation separat codiert. Eine vollständige Einzelcodierung hätte sehr viele Varianten semantisch gleicher Zeichen erzeugt.

Der heutige Unicode-Standard ist ein Kompromiss. Er verzichtet auf eine vollständige Vereinheitlichung nur nach Bedeutung. Praktisch sollte modernes Chinesisch, Japanisch und Koreanisch im selben Text ohne Schriftwechsel unterscheidbar bleiben. Laut Artikel können auch klassische Texte in Unicode 3.1 semantisch eindeutig abgebildet werden; historische Variationen, die für die Linguistik interessant sein können, sind dort aber nicht darstellbar.

Ein weiteres Problem war, dass man ohne Markup nicht verschiedene Varianten desselben Zeichens in einem Text angeben konnte. Das betrifft besonders Japanisch, etwa Ortsnamen und Personennamen mit alten Radikalen. Beim Ortsteil Gion 祇園 in Kyōto wird das erste Zeichen mit 示 geschrieben, obwohl andere Wörter mit 祇 das 礻-Radikal verwenden.

Unicode 3.2 reagierte darauf mit Variantenselektoren. Damit lassen sich bestimmte Zeichenvarianten genauer festlegen. Standardisierte Varianten und historische Formen wurden und werden außerdem in Erweiterungen ergänzt, darunter Erweiterung A in Unicode 3.0, Erweiterung B in Unicode 3.1, Erweiterung C in Unicode 5.2, Erweiterung D in Unicode 6.0, Erweiterung E in Unicode 8.0 und Erweiterung F in Unicode 10.0.

Weiterlesen