Wikipedia · einfach zusammengefasst · Stand
Sprachdialogsystem
Mit einem Sprachdialogsystem (englisch Voice Portal), auch IVR-System (Interactive Voice Response), können Anrufer über das Telefon oder andere akustische …
Inhalt5 Abschnitte
Begriff und Funktionsweise
Ein Sprachdialogsystem, englisch Voice Portal und auch IVR-System (Interactive Voice Response) genannt, ermöglicht über das Telefon oder andere akustische Medien teil- oder vollautomatisierte Dialoge in natürlicher Sprache. Moderne, KI-basierte Systeme mit freierer natürlichsprachlicher Interaktion werden häufig als Voicebots bezeichnet.
In der Praxis umfasst IVR neben gesprochener Sprache auch Eingaben über das Mehrfrequenzwahlverfahren, also über die Telefontastatur. Typisch ist eine Auswahl wie: „Für den Verkauf drücken Sie die 1, für Service die 2.“ Über Tasten oder Spracherkennung greifen Anrufende auf das Hostsystem eines Unternehmens zu, um Informationen abzurufen oder Vorgänge auszuführen. Das System antwortet mit vorher aufgenommenen Sprachbausteinen oder computergenerierter Sprache und leitet durch den Dialog. Netzbasierte IVR-Systeme können für ein großes Anrufaufkommen ausgelegt werden.
Ein typischer natürlichsprachlicher Dialog ist die Frage nach dem Tageshoch und dem aktuellen Kurs einer bestimmten Aktie an einem bestimmten Handelsplatz. Das System erkennt die gewünschten Angaben, fragt die Daten ab und gibt beide Werte als gesprochene Antwort aus.
Technischer Aufbau und Entwicklung
Ein IVR-System kann mehrere miteinander verbundene Module enthalten:
• Die automatische Spracherkennung (Automated Speech Recognition, ASR) wandelt gesprochene Eingaben in maschinell verarbeitbare Informationen um. Grammatiken und Semantiken unterstützen dabei das Natural Language Understanding (NLU), also die Interpretation der Bedeutung einer Äußerung.
• Die Sprachsynthese (Text-to-Speech, TTS) verwandelt Text in eine computergenerierte Stimme.
• Ein Dialogablauf-Interpreter, beispielsweise ein VoiceXML-Browser, dient als Frontend und steuert den Gesprächsablauf.
• Die Geschäftslogik bildet das Backend und bindet den Dialog in Unternehmensprozesse ein.
• Datenbanken speichern die benötigten Informationen und stellen sie für Abfragen bereit.
• Schnittstellen verbinden das System mit IP-Netzwerken, Telefonnetzen, DECT-Anlagen oder Audioanschlüssen.
Außerdem gibt es biometrische Verfahren zur Sprecherauthentifizierung, bei denen die Stimme als Passwort dient. Solche Verfahren sind laut Artikel durch das Bundesamt für Sicherheit in der Informationstechnik (BSI) als sicher zertifiziert; der betreffende Teil des Artikels ist allerdings als nicht ausreichend belegt gekennzeichnet.
Seit den 2000er-Jahren entwickelten sich Sprachdialogsysteme von klassischen, menügesteuerten IVR-Lösungen hin zu natürlichsprachlichen Systemen. Verbesserte Spracherkennung und maschinelles Lernen ermöglichen flexiblere, kontextbezogene Dialoge und die Verarbeitung ganzer Sätze. Neuere große Sprachmodelle (Large Language Models) verbessern die Verarbeitung natürlicher Sprache zusätzlich und erlauben zunehmend freie Gespräche. Zugleich ist die Akzeptanz sprachbasierter Systeme in vielen Bereichen gestiegen.
Einsatzformen und Anwendungsgebiete
Sprachdialogsysteme sollen große Anrufmengen bewältigen, Kosten senken und Sprache als Ein- und Ausgabemedium neben Tastatur, Maus und Monitor nutzbar machen. Einsatzgebiete sind unter anderem mobile Einkäufe, Bankdienstleistungen, Versorgungsunternehmen, Reiseinformationen und Wetterberichte. Daten können dabei relativ anonym abgerufen werden. Als technische Gründe für die Ausbreitung nennt der Artikel die gestiegene CPU-Leistung und den Wechsel von proprietärem Code zum VoiceXML-Standard.
Technisch unterscheidet man reine Sprachdienste, die ausschließlich Sprache verwenden, und multimodale Anwendungen, die Sprachinteraktion mit weiteren Medien wie grafischen Oberflächen verbinden. Nach Nutzergruppen werden kommerzielle, innerbetriebliche und geräteintegrierte Sprachdienste unterschieden.
Kommerzielle Dienste richten sich etwa an Endkunden. Sie bieten telefonische Fahr- und Flugplanauskünfte, automatische Bestellungen und Reservierungen, Ticket-Hotlines, Katalogbestellungen, Telefonbanking, automatische Telefonvermittlung, die Vorqualifikation oder Autorisierung über Kundennummer und PIN, intelligente Wartefelder in Callcentern, Störungsansagen, Televoting und Gewinnspiele. Moderne Voicebots bearbeiten Kundenanfragen, vereinbaren Termine und unterstützen Serviceprozesse. Im Jahr 2009 lehnten deutsche Konsumenten solche Systeme häufig ab, weil sie nicht eingewiesen waren, die Funktionsweise nicht kannten oder sich durch Werbung gestört fühlten. Nach Darstellung des Artikels hat sich die Akzeptanz durch bessere Spracherkennung und KI inzwischen deutlich verbessert.
Innerbetriebliche Systeme können besonders wirksam sein, weil Beschäftigte eingewiesen werden und den Dienst regelmäßig verwenden. Sie können Prozesse beschleunigen und Eingabefehler durch weniger Medienbrüche verringern. Beispiele sind Warenannahme, Qualitätsprüfung, Laufprüfung, Produktendabnahme, Inventur, Anlageninspektion, prozessorientierte Ereignismeldung sowie Fern- und Vorortdiagnose. Heute werden sie außerdem zur Dokumentation, in Service- und Wartungsprozessen und zur Interaktion mit IT-Systemen eingesetzt.
Geräteintegrierte Systeme waren 2009 wegen des hohen Rechen- und Energiebedarfs guter Spracherkennung vor allem in Oberklassewagen, Computerspielen und spezieller Software zu finden. Leistungsfähigere Hardware und cloudbasierte Verarbeitung ermöglichten später eine weitere Verbreitung. Beispiele sind Freisprecheinrichtungen und Navigationssysteme im Auto, die Rufnummernwahl über Personennamen, Computerspiele, Anwendungssoftware für Menschen mit körperlichen Behinderungen und kooperative Maschinensteuerung. Auch die Zusammenarbeit von Menschen und Industrierobotern in Handwerksbetrieben wurde erforscht.
Vorteile, Grenzen und Gestaltung
Sprache ermöglicht eine direkte und natürliche Bedienung. Hände und Blick bleiben frei, was Ergonomie und Prozesszeit verbessern kann. Sprache ist unmittelbar zugänglich, sodass längere Schulungen für grafische Oberflächen entfallen können. Als Endgerät reichen häufig ein Telefon oder ein Headset mit gutem Mikrofon. Durch die weite Verbreitung von Mobiltelefonen lassen sich Softwareanwendungen auch unterwegs bedienen.
Sprecherunabhängige Erkennung kann verschiedene Personen verstehen, mehrsprachige Anwendungen ermöglichen und Dialekte bis zu einem gewissen Grad tolerieren. Informationen können direkt angefordert werden, ohne hierarchische Menüs oder lange Listen zu durchlaufen. Innerhalb eines klaren Kontexts lassen sich auch komplexe Sätze verarbeiten, beispielsweise die telefonische Reservierung eines Dienstwagens für die Strecke Stuttgart–Darmstadt am Donnerstag von 6 bis 22 Uhr. Weil die visuelle Aufmerksamkeit frei bleibt, können Dialoge teilweise nebenbei geführt werden.
Die Spracherkennung erreicht jedoch keine 100 Prozent. Große Vokabulare sind problematisch, weil sich viele Begriffe ähnlich anhören. Auch die menschliche Stimme variiert. Wiederkehrende Umweltgeräusche lassen sich heute gut filtern, menschliche Stimmen im Hintergrund bleiben dagegen schwierig. Lange Listen sind akustisch schwerer zu erfassen als visuell. Bei komplexen Anwendungen müssen Nutzende außerdem erst Navigation und Funktionen lernen; abgestufte Modi für Einsteiger und Fortgeschrittene können helfen.
Klassische Systeme „verstehen“ Sprache nicht wie Menschen, sondern gleichen gesprochene Wörter mit einer begrenzten Liste erwarteter Äußerungen ab. Entwickler müssen daher vorher annehmen, welche Fragen gestellt werden, und passende Frage-Antwort-Wege gestalten. Ein System kann etwa schrittweise nach Unternehmen, Unternehmensart, Restauranttyp und Ort fragen. Das kann hilfreich sein, bleibt aber hinter einer freien Texteingabe in einer Internetsuchmaschine zurück. Moderne Voicebots ermöglichen zunehmend freiere Dialoge ohne starre Menüs.
Ein nutzerfreundliches System sollte sich an Menschen anpassen. Wichtige Eigenschaften sind Adaptivität, implizite Bestätigung, Nachfragen bei Mehrdeutigkeit, Korrekturmöglichkeiten, der Umgang mit zusätzlichen Informationen und Verneinungen, Rückbezüge im Gespräch, die Interpretation von Umgangssprache, passende Sprachgenerierung, angemessenes Sozialverhalten sowie eine hohe Qualität von Erkennung und Synthese. Früher erschwerte das Fehlen umfassender Werkzeuge zur Dialogmodellierung die Entwicklung natürlicher Systeme; KI-basierte Verfahren und neue Werkzeuge haben die Lage teilweise verbessert.
Auswahlkriterien für den praktischen Einsatz
Der Einsatz von Sprachtechnologien in betrieblichen Anwendungen ist besonders sinnvoll, wenn Eigenschaften der Beschäftigten, der Tätigkeit oder der Arbeitsumgebung dafür sprechen.
Bei Beschäftigten kommen geringe Computererfahrung, eine Schreib- oder Leseschwäche oder die Verwendung von Fremdsprachen als Gründe infrage. Für Tätigkeiten eignet sich Sprache besonders, wenn Hände und Blick frei bleiben müssen, Eingaben leicht in Worte zu fassen sind, Mobilität erforderlich ist oder sich Aufgaben häufig wiederholen. Auch die Arbeitsumgebung kann entscheidend sein: Sprachbedienung bietet Vorteile, wenn die visuelle Wahrnehmung erschwert ist, kein Platz für Bildschirm und Tastatur besteht oder der ständige Wechsel zwischen der eigentlichen Tätigkeit und einem Computerarbeitsplatz unergonomisch beziehungsweise zeitaufwendig wäre.