Generationen der Sprach-KI

Die meisten automatisierten Telefonate sind schlecht. Neue Technologie verändert das.

Das alte Problem war nicht, dass der Telefonautomatisierung eine angenehme Stimme fehlte. Es fehlte ihr an ausreichend Verständnis, um ein echtes Gespräch am Laufen zu halten.

Telefonmenüs

IVR-Ära

Der Anrufer musste Maschinensprache sprechen.

Automatisierung bedeutete Menüs, Tastenverzweigungen und Warteschlangen. Sie funktionierte, wenn der Anrufer den richtigen Weg bereits kannte.

Unbeholfener Moment

Die Absicht wird auf einen Tastendruck reduziert. Alles außerhalb des Menüs führt daher zu einer Weiterleitung oder Wiederholung.

Beispielanruf

IVR-Ära

Anrufer

"Ich muss den Termin von morgen verschieben."

System

"Für Abrechnung drücken Sie 1. Für Terminvereinbarungen drücken Sie 2. Für alle anderen Fragen drücken Sie 9."

Ergebnis

Der Anrufer rät, wartet und erklärt dasselbe noch einmal.

Wie das System denkt

3 Stufen

Menüansage

behoben

Ein festes Skript listet Optionen auf.

DTMF-Zweig

fragil

Eine Taste wird zur gesamten Absicht.

Warteschlange

fehlerhaft

Der tatsächliche Kontext kommt erst bei einem Menschen an.

Individuelle Modelle

Frühe KI

Systeme verstanden enge Bahnen und brachen dann auseinander.

Teams trainierten akustische Modelle, Intent-Klassifikatoren und Slot-Extraktoren für spezifische Anrufabläufe. Nützlich, aber Änderungen waren teuer.

Unbeholfener Moment

Das System kann eine trainierte Absicht erkennen, lässt dann aber die zweite Anfrage fallen oder stellt eine starre Rückfrage.

Beispielanruf

Frühe KI

Anrufer

"Können Sie den Termin von morgen verschieben und meinen Ehepartner hinzufügen?"

System

"Ich kann Ihnen beim Verschieben helfen. Welches Datum möchten Sie?"

Ergebnis

Die Angabe zum Ehepartner geht verloren, weil sie nicht im trainierten Ablauf enthalten ist.

Wie das System denkt

3 Stufen

Individuelles ASR

behoben

Auf eine Domäne und eine Mischung von Akzenten abgestimmt.

Intent-Modell

fragil

Klassifiziert die ähnlichste bekannte Anfrage.

Slot-Filling

fehlerhaft

Fehlende Felder lösen eine skriptgesteuerte Korrektur aus.

Stacks im Stil von Vapi / Retell / ElevenLabs

Pipelines mit 3 Schritten

Der Stack wurde flexibel, doch jeder Schritt vertraute dem vorherigen.

Ein gängiges modernes Muster verbindet Spracherkennung, ein LLM und Sprachsynthese zu einer Anrufschleife.

Unbeholfener Moment

Wenn das Transkript falsch ist oder der Anrufer unterbricht, beantwortet das LLM souverän den falschen Anruf.

Beispielanruf

Pipelines mit 3 Schritten

Anrufer

"Nein, ich miete die Wohnung."

System

"Hallo, Mieke — wie kann ich helfen?"

Ergebnis

Ein einziger Hörfehler wird zu einem gesprochenen Fehler.

Wie das System denkt

3 Stufen

Spracherkennung

fehlerhaft

Ein Transkript wird zur maßgeblichen Quelle.

LLM

fragil

Generiert aus Text, nicht aus dem Originalaudio.

Sprachsynthese

fehlerhaft

Gibt die Antwort souverän wieder.

Integrierte Sprach-KI

ThunderPhone

Das System kann in einer Schleife hören, schlussfolgern und sich korrigieren.

ThunderPhone koordiniert Audioverständnis, Modell-Routing, Sprecherwechsel und Antwortgenerierung als eine Architektur.

Was sich ändert

Mehrere Hörwege und audiobasiertes Schlussfolgern reduzieren Fehler einzelner Schritte, bevor sie den Anrufer erreichen.

Beispielanruf

ThunderPhone

Anrufer

"Nein, ich miete die Wohnung."

System

"Verstanden. Sie mieten Ihr Zuhause, daher überspringe ich Fragen zum Eigentum."

Ergebnis

Der Anruf kommt voran, ohne dass der Anrufer gegen das System kämpfen muss.

Wie das System denkt

4 Stufen

Audio-Stream

geprüft

Roh-Audio bleibt für das Schlussfolgern verfügbar.

Redundantes Hören

geprüft

Signale werden vor der Aktion verglichen.

Modell-Routing

geprüft

Schnelle und tiefere Pfade arbeiten pro Gesprächszug zusammen.

Natürliche Antwort

geprüft

Der Anrufer hört den korrigierten Kontext.

Was das bewirkt

Der Durchbruch ist nicht eine schönere Roboterstimme. Es ist eine Architektur, die das Gespräch auf Kurs hält.

Besseres Verstehen

Das System kann Signale vergleichen und Audiodaten analysieren, statt sich auf ein einzelnes Transkript zu verlassen.

Besseres Timing

Sprecherwechsel und der Umgang mit Unterbrechungen sind Teil des Gesprächsablaufs.

Besseres Routing

Schnelle Abläufe und tiefergehendes Schlussfolgern können je nach Bedarf des einzelnen Gesprächszugs ausgewählt werden.

Besseres Erlebnis

Anrufer verbringen weniger Zeit damit, die Automatisierung zu korrigieren, und mehr Zeit damit, die Aufgabe zu erledigen.