Wikipedia · einfach zusammengefasst · Stand
Buchstabenhäufigkeit
Die Buchstabenhäufigkeit (Graphemhäufigkeit) ist eine statistische Größe, die angibt, wie oft ein bestimmter Buchstabe in einem Text oder einer Sammlung von …
Inhalt5 Abschnitte
Grundbegriff und Bedeutung
Buchstabenhäufigkeit, auch Graphemhäufigkeit genannt, ist eine statistische Größe. Sie gibt an, wie oft ein bestimmter Buchstabe in einem Text oder in einer Sammlung von Texten, einem Korpus, vorkommt. Die Häufigkeit kann als absolute Anzahl oder relativ zur Gesamtzahl aller Buchstaben angegeben werden. Die Verteilung hängt von der jeweiligen Sprache und auch von der Textsorte ab. Frühere Annahmen wollten sie pauschal mit dem Zipfschen Gesetz erklären; die quantitative Linguistik berücksichtigt jedoch auch eine Reihe anderer Wahrscheinlichkeitsverteilungen.
Buchstabenhäufigkeiten werden unter anderem in der Kryptoanalyse, der Datenkompression, der Kodierung, beim Maschinenschreibunterricht, bei ergonomischen Tastaturbelegungen und bei Buchstabenspielen wie Boggle oder Scrabble verwendet. Bei einer Substitutionsverschlüsselung, etwa der Cäsarchiffre, werden die Zeichenhäufigkeiten eines Geheimtexts mit den erwarteten Häufigkeiten der vermuteten Klartextsprache verglichen. Der häufigste Geheimtextbuchstabe kann dabei beispielsweise dem häufigsten Klartextbuchstaben e entsprechen. Die Methode funktioniert bei längeren Texten besser, weil statistische Abweichungen von den erwarteten Häufigkeiten dann im Allgemeinen geringer werden.
Auch das Morse-Alphabet verwendet dieses Prinzip: Häufige Zeichen erhalten kurze Codes, zum Beispiel E = ·, seltene Zeichen längere Codes, zum Beispiel Q = – – · –. Für den Schreibunterricht sind häufige Buchstaben wie E und I besonders wichtig, weil sie ausreichend trainiert werden müssen, um eine hohe Anschlagszahl und Schreibsicherheit zu erreichen.
Buchstabenhäufigkeit in deutschsprachigen Texten
In der ersten Übersicht wurden die Umlaute ä, ö und ü wie ae, oe und ue gezählt; ß wurde als eigenständiges Zeichen behandelt. Die häufigsten Buchstaben sind E mit 17,40 %, N mit 9,78 %, I mit 7,55 %, S mit 7,27 % und R mit 7,00 %. Danach folgen A mit 6,51 %, T mit 6,15 %, D mit 5,08 %, H mit 4,76 % und U mit 4,35 %. Weitere Werte sind L 3,44 %, C 3,06 %, G 3,01 %, M 2,53 %, O 2,51 %, B 1,89 %, W 1,89 %, F 1,66 %, K 1,21 %, Z 1,13 %, P 0,79 %, V 0,67 %, ẞ 0,31 %, J 0,27 %, Y 0,04 %, X 0,03 % und Q 0,02 %.
Rechnerisch decken die fünf häufigsten Buchstaben ungefähr die Hälfte und die zehn häufigsten Buchstaben ungefähr drei Viertel aller Buchstaben in deutschsprachigen Texten ab. Bei einer Gleichverteilung von 27 Buchstaben hätte jeder Buchstabe eine relative Häufigkeit von 3,704 %.
Eine zweite Auswertung beruht auf 99.586 Buchstaben eines gemischten Briefkorpus aus den Jahren 1996–2004. Die Briefe stammten aus der Korrespondenz mit Ämtern, Freunden, Kollegen, Rundfunkanstalten und Verlagen; Briefkopf, Anrede und Grußformel wurden nicht berücksichtigt. In dieser Untersuchung wurden ä, ö und ü einzeln gezählt. E steht mit 16.040 Zeichen beziehungsweise 16,11 % an erster Stelle, gefolgt von N mit 10.288 beziehungsweise 10,33 % und I mit 9.011 beziehungsweise 9,05 %. Die folgenden Werte sind R 6.693 und 6,72 %, T 6.312 und 6,34 %, S 6.203 und 6,23 %, A 5.577 und 5,60 %, H 5.177 und 5,20 %, D 4.156 und 4,17 % sowie U 3.680 und 3,70 %. Die seltensten Zeichen der Auswertung sind Y mit 56 beziehungsweise 0,06 %, Q mit 73 beziehungsweise 0,07 % und X mit 112 beziehungsweise 0,11 %.
Die Ergebnisse hängen von der Textgrundlage und der Zählweise ab. Das Institut für Deutsche Sprache in Mannheim bietet Listen an, die auf einer Textstichprobe von knapp 180 Milliarden Zeichen aus dem Deutschen Referenzkorpus beruhen (Stand 2018). Eine Duden-Übersicht basiert auf dem Duden-Korpus, einer Volltextsammlung mit über 2 Milliarden Wortformen; in der überarbeiteten 27. Auflage des Rechtschreib-Duden wurde eine Grundlage von 4 Milliarden Wortformen verwendet (Stand Frühjahr 2017).
Anfangs- und Endbuchstaben
Die Häufigkeit von Anfangsbuchstaben beschreibt, wie oft ein Buchstabe als erster Buchstabe eines Wortes vorkommt. Sie hängt stark von der Textart ab. Im Fließtext sind D mit 14,2 %, S mit 10,8 %, E mit 07,8 %, I mit 07,1 % und W mit 06,8 % die fünf häufigsten Anfangsbuchstaben.
Bei Lexika ist die Verteilung anders: S steht mit 11,8 % an erster Stelle, gefolgt von K mit 07,3 %, A mit 07,1 %, P mit 07,0 % sowie B und M mit jeweils 05,7 %. D, E, I und W kommen dort im Vergleich zum Fließtext wesentlich seltener am Wortanfang vor.
Die Häufigkeit von Endbuchstaben gibt an, wie oft ein Buchstabe als letzter Buchstabe eines Wortes vorkommt. Als Beispiel wurde der Roman Effi Briest von Theodor Fontane ausgewertet. Die Textbasis umfasst alle 36 Kapitel mit insgesamt 572.849 Zeichen; ß wurde stets als ss gezählt. Die fünf häufigsten Endbuchstaben sind N mit 21,0 %, E mit 15,1 %, R mit 13,0 %, T mit 10,3 % und S mit 09,6 %.
Vergleich ausgewählter Sprachen
Die Buchstabenhäufigkeit unterscheidet sich deutlich zwischen Sprachen. Die Vergleichstabelle erfasst Deutsch, Englisch, Französisch, Spanisch, Esperanto, Italienisch, Schwedisch und Polnisch und bezieht sich auf Texte beziehungsweise Korpora in lateinischer Schrift.
Im Deutschen ist E mit 17,40 % besonders häufig, während O mit 2,51 % deutlich seltener vorkommt als in mehreren romanischen und slawischen Sprachen. In den Vergleichsdaten beträgt E beispielsweise 12,702 % im Englischen, 14,715 % im Französischen, 13,68 % im Spanischen, 8,99 % im Esperanto, 11,79 % im Italienischen, 9,9 % im Schwedischen und 6,9 % im Polnischen. A erreicht im Spanischen 12,53 %, im Esperanto 12,12 % und im Italienischen 11,74 %, gegenüber 6,51 % im Deutschen. O liegt im Spanischen bei 8,68 %, im Esperanto bei 8,78 % und im Italienischen bei 9,83 %.
Auch einzelne Buchstaben zeigen sprachspezifische Muster: T erreicht im Englischen 9,056 %, im Schwedischen 8,7 % und im Deutschen 6,15 %. R liegt im Deutschen bei 7,00 %, im Schwedischen bei 8,3 % und im Polnischen bei 3,5 %. Z ist im Polnischen mit 5,1 % deutlich häufiger als im Deutschen mit 1,13 %. Q kommt im Deutschen mit 0,02 %, im Englischen mit 0,095 % und im Französischen mit 1,362 % vor. Die Tabelle enthält außerdem sprachspezifische Zeichen und diakritische Buchstaben, etwa œ, ç, é, ą, ł, ń, ó, ŝ und ż; manche werden auf die Grundbuchstaben zurückgeführt, zum Beispiel à auf a oder ł auf l.
Die Angaben betreffen nur Sprachen mit lateinischer Schrift. Für Sprachen mit kyrillischer Schrift verweist der Artikel auf Darstellungen zum Russischen von Kempgen (1995) sowie auf eine Untersuchung von Grzybek und Kehlich (2005) zum Ukrainischen.
Weiterführende Auswertungen und Diagramme
Über die Häufigkeit einzelner Buchstaben hinaus können Buchstabenpaare und -tripel untersucht werden. Solche Folgen heißen Bigramme beziehungsweise Trigramme. Außerdem lassen sich Worthäufigkeiten und Grapheme erfassen. Grapheme sind Schrifteinheiten, die für eine systematische Lauteinheit, ein Phonem, stehen. Für die gesprochene Sprache sind entsprechende Untersuchungen der Laut- oder Phonemhäufigkeit möglich.
Die im Artikel genannten Darstellungen umfassen ein Diagramm der relativen Buchstabenhäufigkeit in deutschsprachigen Texten, ein Monogramm-Häufigkeitsgebirge für einzelne Buchstaben sowie Bigramm- und Trigramm-Häufigkeitsgebirge. Bei den Trigrammen sind ER_ und EN_ am häufigsten; der Unterstrich steht für ein Leerzeichen. Weitere 3D-Säulendiagramme zeigen die Häufigkeit der Vokalbuchstaben und der Konsonantenbuchstaben in serbokroatischen Texten.