Generationen der Sprach-KI
Die meisten automatisierten Telefonate sind schlecht. Neue Technologie verändert das.
Das alte Problem war nicht, dass der Telefonautomatisierung eine angenehme Stimme fehlte. Es fehlte ihr an ausreichend Verständnis, um ein echtes Gespräch am Laufen zu halten.
Ein Telefonat lässt sich immer leichter automatisieren
Jede Generation verlagert mehr Kontext in die Maschine.
IVR-Ära
Der Anrufer musste Maschinensprache sprechen.
Frühe KI
Systeme verstanden enge Bahnen und brachen dann auseinander.
Pipelines mit 3 Schritten
Der Stack wurde flexibel, doch jeder Schritt vertraute dem vorherigen.
ThunderPhone
Das System kann in einer Schleife hören, schlussfolgern und sich korrigieren.
Telefonmenüs
IVR-Ära
Der Anrufer musste Maschinensprache sprechen.
Automatisierung bedeutete Menüs, Tastenverzweigungen und Warteschlangen. Sie funktionierte, wenn der Anrufer den richtigen Weg bereits kannte.
Unbeholfener Moment
Die Absicht wird auf einen Tastendruck reduziert. Alles außerhalb des Menüs führt daher zu einer Weiterleitung oder Wiederholung.
Beispielanruf
IVR-Ära
Anrufer
"Ich muss den Termin von morgen verschieben."
System
"Für Abrechnung drücken Sie 1. Für Terminvereinbarungen drücken Sie 2. Für alle anderen Fragen drücken Sie 9."
Ergebnis
Der Anrufer rät, wartet und erklärt dasselbe noch einmal.
Wie das System denkt
3 StufenMenüansage
behobenEin festes Skript listet Optionen auf.
DTMF-Zweig
fragilEine Taste wird zur gesamten Absicht.
Warteschlange
fehlerhaftDer tatsächliche Kontext kommt erst bei einem Menschen an.
Individuelle Modelle
Frühe KI
Systeme verstanden enge Bahnen und brachen dann auseinander.
Teams trainierten akustische Modelle, Intent-Klassifikatoren und Slot-Extraktoren für spezifische Anrufabläufe. Nützlich, aber Änderungen waren teuer.
Unbeholfener Moment
Das System kann eine trainierte Absicht erkennen, lässt dann aber die zweite Anfrage fallen oder stellt eine starre Rückfrage.
Beispielanruf
Frühe KI
Anrufer
"Können Sie den Termin von morgen verschieben und meinen Ehepartner hinzufügen?"
System
"Ich kann Ihnen beim Verschieben helfen. Welches Datum möchten Sie?"
Ergebnis
Die Angabe zum Ehepartner geht verloren, weil sie nicht im trainierten Ablauf enthalten ist.
Wie das System denkt
3 StufenIndividuelles ASR
behobenAuf eine Domäne und eine Mischung von Akzenten abgestimmt.
Intent-Modell
fragilKlassifiziert die ähnlichste bekannte Anfrage.
Slot-Filling
fehlerhaftFehlende Felder lösen eine skriptgesteuerte Korrektur aus.
Stacks im Stil von Vapi / Retell / ElevenLabs
Pipelines mit 3 Schritten
Der Stack wurde flexibel, doch jeder Schritt vertraute dem vorherigen.
Ein gängiges modernes Muster verbindet Spracherkennung, ein LLM und Sprachsynthese zu einer Anrufschleife.
Unbeholfener Moment
Wenn das Transkript falsch ist oder der Anrufer unterbricht, beantwortet das LLM souverän den falschen Anruf.
Beispielanruf
Pipelines mit 3 Schritten
Anrufer
"Nein, ich miete die Wohnung."
System
"Hallo, Mieke — wie kann ich helfen?"
Ergebnis
Ein einziger Hörfehler wird zu einem gesprochenen Fehler.
Wie das System denkt
3 StufenSpracherkennung
fehlerhaftEin Transkript wird zur maßgeblichen Quelle.
LLM
fragilGeneriert aus Text, nicht aus dem Originalaudio.
Sprachsynthese
fehlerhaftGibt die Antwort souverän wieder.
Integrierte Sprach-KI
ThunderPhone
Das System kann in einer Schleife hören, schlussfolgern und sich korrigieren.
ThunderPhone koordiniert Audioverständnis, Modell-Routing, Sprecherwechsel und Antwortgenerierung als eine Architektur.
Was sich ändert
Mehrere Hörwege und audiobasiertes Schlussfolgern reduzieren Fehler einzelner Schritte, bevor sie den Anrufer erreichen.
Beispielanruf
ThunderPhone
Anrufer
"Nein, ich miete die Wohnung."
System
"Verstanden. Sie mieten Ihr Zuhause, daher überspringe ich Fragen zum Eigentum."
Ergebnis
Der Anruf kommt voran, ohne dass der Anrufer gegen das System kämpfen muss.
Wie das System denkt
4 StufenAudio-Stream
geprüftRoh-Audio bleibt für das Schlussfolgern verfügbar.
Redundantes Hören
geprüftSignale werden vor der Aktion verglichen.
Modell-Routing
geprüftSchnelle und tiefere Pfade arbeiten pro Gesprächszug zusammen.
Natürliche Antwort
geprüftDer Anrufer hört den korrigierten Kontext.
Was das bewirkt
Der Durchbruch ist nicht eine schönere Roboterstimme. Es ist eine Architektur, die das Gespräch auf Kurs hält.
Besseres Verstehen
Das System kann Signale vergleichen und Audiodaten analysieren, statt sich auf ein einzelnes Transkript zu verlassen.
Besseres Timing
Sprecherwechsel und der Umgang mit Unterbrechungen sind Teil des Gesprächsablaufs.
Besseres Routing
Schnelle Abläufe und tiefergehendes Schlussfolgern können je nach Bedarf des einzelnen Gesprächszugs ausgewählt werden.
Besseres Erlebnis
Anrufer verbringen weniger Zeit damit, die Automatisierung zu korrigieren, und mehr Zeit damit, die Aufgabe zu erledigen.