Wikipedia · einfach zusammengefasst · Stand
Akustische Phonetik
Die Grundlagen der akustischen Phonetik stammen aus einem Teilbereich der Physik, der Akustik. Sprachlaute sind aus der Sicht der Physik Schallwellen, die …
Inhalt6 Abschnitte
Gegenstand und Bedeutung
Die akustische Phonetik ist ein Teilgebiet der Phonetik. Sie untersucht menschliche Sprachlaute als Schallschwingungen auf ihrem Weg vom Sprecher zum Hörer: nach der Artikulation durch den Sprecher und vor der Aufnahme des Signals durch das Ohr. Weil Sprachlaute physikalisch Schall sind, beschreibt man sie mit Größen der Akustik, besonders Frequenz und Amplitude.
Sie macht Sprachsignale messbar und sichtbar, etwa mit Oszillogrammen und Sonagrammen. Dadurch lassen sich Eigenschaften von Lauten genauer erfassen, Vokale über charakteristische Frequenzbereiche erkennen und Verfahren der Sprachanalyse sowie der Sprachsynthese unterstützen.
Entwicklung der Disziplin
Die Phonetik hat zwar über 2000 Jahre alte Anfänge, die akustische Phonetik ist jedoch eine vergleichsweise junge naturwissenschaftliche Teildisziplin. Voraussetzungen entstanden mit dem Aufstieg der Naturwissenschaften in der Neuzeit, weil sie Methoden und Ergebnisse der Akustik und Mathematik verwendet.
Gegen Ende des 18. Jahrhunderts versuchte Leonhard Euler mit der Schwingungslehre, akustische Eigenschaften von Vokalen zu beschreiben. Im 19. Jahrhundert ermöglichte der Phonograph von Thomas Alva Edison die Aufzeichnung und Wiedergabe von Schall. Jean-Pierre Rousselot gehörte zu den Pionieren wissenschaftlicher Sprachaufzeichnungen. Ludimar Hermann analysierte 1889 und 1890 mit mathematischen Prinzipien Stimm- und Lautkurven; auf ihn geht auch der Begriff Formant zurück.
Ab den 40er Jahren des 20. Jahrhunderts standen mit der Elektroakustik Geräte wie der Sonagraf zur visuellen Analyse bereit. Später rückten digitale Signalverarbeitung, automatische Spracherkennung und Sprachsynthese in den Vordergrund. Personal Computer und freie Software wie Praat machten phonetische Analysen wesentlich einfacher und preisgünstiger.
Schall und Frequenzanalyse
Sprachlaute sind Schallwellen. Sie entstehen im Kehlkopf, bewegen sich durch den Vokaltrakt – Rachen-, Mund- und Nasenraum – und werden durch die Luft vom Mund zum Ohr übertragen. Schallwellen bestehen aus Druck- und Dichteschwankungen. Bei 20 °C breiten sie sich in Luft mit 343 Metern pro Sekunde aus.
Die Frequenz ist die Anzahl der Schwingungen pro Sekunde; in der Praxis wird die Tonhöhe eines Tons mit seiner Frequenz gleichgesetzt. Die Amplitude gibt die Intensität des Schalls wieder, also Schalldruck beziehungsweise Lautstärke.
Sprachliche Laute gehören zu den Klängen. Im Unterschied zu Geräuschen sind Klänge periodische Schallschwingungen, sogenannte Sinoidalschwingungen. Sprachlaute sind aber keine reinen Töne, sondern zusammengesetzte Schwingungen. Man kann sie in einzelne Sinoidalschwingungen zerlegen und für jede Teilschwingung die Amplitude bestimmen. Das Ergebnis ist ein Schallspektrum. Dieses Verfahren heißt Frequenzanalyse oder Fourier-Analyse, nach Jean Baptiste Joseph Fourier.
Quelle, Filter und Sprachlautbildung
Bei der Erzeugung von Sprachlauten werden zwei Phasen unterschieden. Zuerst entsteht Rohschall. Bei stimmhaften Lauten, also Vokalen und stimmhaften Konsonanten, öffnen und schließen sich die vibrierenden Stimmlippen zyklisch. Dadurch entstehen Luftdruckschwankungen; dies heißt Stimmtonerzeugung. Bei stimmlosen Konsonanten entstehen Verwirbelungen an Engstellen auf dem Weg von der Glottis zum Mund- oder Nasenausgang, zum Beispiel an der Glottis oder bei fast geschlossenen Lippen. Dieser Rohschall wird als Rauschen bezeichnet.
Danach wird der Rohschall im Rachen- und Nasenraum moduliert. Maßgeblich ist die Stellung der Artikulationsorgane, etwa Kiefer, Zunge und Lippen. Beim Flüstern werden auch Vokale nur durch die Modulation des Spektrums eines hervorgepressten Luftstroms gebildet; die Stimmbänder spielen dabei keine Rolle.
Das Quelle-Filter-Modell beziehungsweise die Quellen-Filter-Theorie modelliert vor allem die Vokalartikulation. Johannes Müller brachte die Theorie 1848 auf. Eine Quelle, beispielsweise die Stimmlippen, erzeugt Rohschall. Im Ansatzrohr, dem Bereich zwischen Glottis und Lippen, wird dieser verändert: Das Ansatzrohr wirkt als Filter. Gunnar Fant entwickelte ein Modell, das den Zusammenhang zwischen den akustischen Eigenschaften eines Vokals und der Form des Vokaltrakts zeigt. Für Sprachanalyse und Sprachsynthese ist die Theorie grundlegend. Vokale lassen sich danach synthetisch erzeugen, indem ein Klangspektrum mit ungegliederter spektraler Hüllkurve durch eine Reihe von Bandpassfiltern geleitet wird.
Oszillogramm und Spektrogramm
Ein Oszillogramm stellt Schallschwingungen als Graphen entlang einer Zeitachse dar. Es gibt den tatsächlichen Schwingungsvorgang wieder, also die Schwingung der Luftteilchen während der Übertragung der Schallwellen. Daraus lassen sich unter anderem Frequenz und Amplitude ablesen. Oszillogramme geben Hinweise auf Silbenstruktur und Sprechmelodie und helfen, Töne, Klänge, Geräusche, Rauschen und Knall zu unterscheiden. Verschiedene Vokale wie [a] und [e] lassen sich darin jedoch kaum voneinander unterscheiden.
Für genauere Analysen wird die akustische Information mit mathematischen Verfahren wie der Fourier-Transformation in ein Spektrogramm oder Sonagramm umgewandelt. Es zeigt Zeit, Frequenz und Amplitude gleichzeitig: Die Zeit verläuft auf der x-Achse von links nach rechts, die Frequenz auf der y-Achse von unten nach oben. Grauschattierungen stehen für die Amplitude; je dunkler ein Bereich ist, desto größer ist sie.
Ein Schmalband-Spektrogramm macht relativ kleine Frequenzunterschiede gut erkennbar. Ein Breitbandspektrogramm löst die Zeit gut auf. Weitere Darstellungen, die Zeit und Frequenz gut auflösen sollen, sind Wavelets, Gabor-Spektren und auditive Spektren.
Formanten und Segmentierung
Formanten sind Frequenzbereiche, die durch die Resonanzeigenschaften des Artikulationsraums gegenüber anderen Frequenzbereichen besonders verstärkt werden. Im Sonagramm erscheinen sie als waagerechte, besonders dunkle Frequenzbänder und bilden dort die grafische Repräsentation des Vokalschalls. Vor allem F1 und F2 beschreiben die akustischen Eigenschaften von Vokalen; F3 und F4 tragen in geringerem Maß bei. Vereinfacht gilt: F0: 00080–0200 Hz, Stimme (Kehlkopf); F1: 00220–0780 Hz, Rachen; F2: 01200–2000 Hz, Lippenraum; F3: 02200–3000 Hz, Mundraum; F4: 03350–4150 Hz, Koronalraum.
Aufgezeichnete Sprachsignale lassen sich in einem Sonagramm nicht auf einen Blick eindeutig in einzelne Laute aufteilen. Erkennbare akustische Segmente entsprechen nicht zwangsläufig eindeutig den Lautsegmenten einer Lautschrift-Transkription. Durch die Kombination von Oszillogramm sowie Breitband- und Schmalbandsonagrammen ist aber eine weitergehende optische Segmentierung möglich.
Stimmhafte Abschnitte zeigen im Breitband klare vertikale Strichmuster, stimmlose Abschnitte eine unregelmäßige Struktur. Deren Frequenzlage erkennt man an der unregelmäßigen Schwärzung. Formantfrequenzen erscheinen im Breitbandsonagramm als geschwärzte Bänder; damit werden Vokale beschrieben. Frikative wie [s] und [f] sind als unregelmäßig strukturierte Schwärzung erkennbar. Übergänge zwischen Lauten, besonders zwischen Vokalen, heißen Transitionen, Formantverschiebungen oder Formantabbiegungen (englisch formant transitions).