Wikipedia · einfach zusammengefasst · Stand
Rechtschreibprüfung
Rechtschreibprüfung bezeichnet softwaregestützte Verfahren zur Korrektur von Rechtschreib- oder Tippfehlern in elektronisch vorliegenden Texten.
Inhalt5 Abschnitte
Grundidee und Einsatzbereiche
Rechtschreibprüfung bezeichnet softwaregestützte Verfahren zur Korrektur von Rechtschreib- oder Tippfehlern in elektronisch vorliegenden Texten. Sie soll fehlerhafte Schreibungen erkennen und die Überarbeitung erleichtern. Sprachliche Fehler werden entweder farblich markiert und können manuell mithilfe bestimmter Vorschläge verbessert werden oder werden bereits automatisch korrigiert; diese Funktion heißt Autokorrektur.
Rechtschreibprüfungen sind in klassischen Officeprogrammen, Textverarbeitungsprogrammen und elektronisch anzeigenden Schreibmaschinen eingesetzt worden. Heute finden sie sich außerdem unter anderem in Datenbanken, Webeditoren, E-Mail-Clients, Instant Messengern und Suchmaschinen. Mit zunehmender Rechenleistung können moderne Programme neben der Rechtschreibung häufig auch die Grammatik und die Worttrennung prüfen.
Frühere Verfahren mit Wortlisten
Bis in die 1990er Jahre wurde die Rechtschreibprüfung häufig mit einfachen Wortlisten durchgeführt. Das Programm verglich den geschriebenen Text mit den Einträgen einer Liste. Dafür waren keine komplexen Algorithmen nötig, die in der Anfangszeit des Computers zu viel Rechenzeit benötigt hätten.
Dieses Verfahren hatte mehrere Nachteile. Zusammengesetzte Wörter wurden grundsätzlich als Fehler erkannt, wenn sie nicht ebenfalls in der Wortliste standen. Auch Wörter mit Präfixen, Suffixen oder Partikeln mussten einzeln aufgenommen sein, damit sie nicht markiert wurden. Wegen des begrenzten Speichers mussten die Programme auswählen: Gängige Zusammensetzungen wurden berücksichtigt, seltene jedoch nicht. Umgekehrt wurden manche Komposita ohne Bindestrich fälschlicherweise als richtig eingestuft.
Orthografische Fehler und Korrekturvorschläge
Eine moderne Rechtschreibprüfung erkennt Buchstabenfolgen, auch Zeichenketten beziehungsweise englisch strings, die nicht zum Wortbestand der aktuellen Sprache gehören. Typische Fehler entstehen durch Auslassung, Ersetzung, Einfügung oder Vertauschung von Buchstaben. Beispiele für das Wort „Fehler“ sind „Feler“ (Auslassung), „Fehlet“ (Ersetzung), „Fehlwer“ (Einfügung) und „Fehelr“ (Vertauschung).
Solche Fehler lassen sich mit vergleichsweise einfachen Verfahren korrigieren. Wird eine Zeichenkette nicht im Wörterbuch gefunden, vergleicht das Programm sie mit den Wörterbucheinträgen. Als Korrekturvorschläge wählt es Wörter aus, die der fehlerhaften Zeichenkette möglichst ähnlich sind. Entscheidend ist die Editierdistanz, auch Levenshtein-Distanz genannt. Sie gibt an, wie viele Änderungen mindestens nötig sind, um das fehlerhafte Wort in den Korrekturvorschlag zu überführen. Die bevorzugte Distanz ist minimal.
Beim fehlerhaften Wort „Libe“ kommen im Lexikon „Liebe“ und „Leib“ infrage. Für „Liebe“ beträgt die Levenshtein-Distanz 1, also eine Auslassung; für „Leib“ beträgt sie 2, also zwei Vertauschungen. Deshalb ist „Liebe“ der erste Korrekturvorschlag.
Wenn die automatische Rechtschreibprüfung ein falsches Wort vorschlägt und dieses anschließend übernommen wird, spricht man vom Cupertino-Effekt.
Grammatikalische und semantische Fehler
Grammatikalische Fehler entstehen, wenn vorhandene Wörter in einer grammatikalisch falschen Form oder Verbindung verwendet werden. Ein Beispiel ist „Mach deinen Buch zu.“ Eine reine wortbezogene Rechtschreibprüfung kann diesen Fehler nicht erkennen, weil sowohl „deinen“ als auch „Buch“ als Wörter existieren. Eine grammatikalische Prüfung des Satzes kann ihn jedoch feststellen: Der Possessivartikel im Maskulinum („deinen“) wird auf das Neutrum („Buch“) angewendet.
Semantische Fehler betreffen Wörter, die zwar korrekt geschrieben sind und grammatikalisch verwendet werden können, aber im falschen Kontext stehen. Der Satz „Der Hammer frisst Gras.“ ist ein Beispiel dafür. Eine solche Bedeutungsebenen-Prüfung wird durch die Erkennung orthografischer und grammatikalischer Fehler nicht geleistet. Dafür wäre eine semantische Prüfung des Textes notwendig. Diese Funktionalität ist in herkömmlichen Textverarbeitungsprogrammen nicht enthalten.
Besonderheiten deutscher Komposita
Besondere Schwierigkeiten bereiten deutschen Rechtschreibprogrammen zusammengesetzte Wörter, also Komposita. Moderne Programme akzeptieren deshalb auch Zusammensetzungen, die nicht in Standardwörterbüchern verzeichnet sind. Dadurch soll die Zahl der Ausdrücke sinken, die zu Unrecht als fehlerhaft markiert werden. Ein Beispiel ist „Bildungsmisere“.
Dieses Vorgehen hat jedoch einen Nachteil: Teilweise werden auch semantisch unsinnige Zusammensetzungen nicht mehr als Fehler ausgewiesen. Im Artikel werden dafür „Fordergrund“ und „Hautnachrichten“ genannt. Die größere Toleranz gegenüber unbekannten Zusammensetzungen verringert somit zwar bestimmte Fehlmarkierungen, kann aber zugleich sinnlose Wortbildungen durchlassen.