Générations d'IA vocale

La plupart des appels téléphoniques automatisés sont nuls. Une nouvelle technologie change la donne.

L'ancien problème n'était pas que l'automatisation téléphonique manquait d'une voix agréable. Elle manquait de compréhension pour maintenir une vraie conversation.

Arborescences téléphoniques

Ère des SVI

L'appelant devait parler comme une machine.

L'automatisation reposait sur des menus, des branches de clavier et des files d'attente. Elle fonctionnait lorsque l'appelant connaissait déjà le bon chemin.

Moment maladroit

L'intention est réduite à une touche, donc tout ce qui sort du menu devient un transfert ou une répétition.

Exemple d'appel

Ère des SVI

Appelant

"Je dois déplacer le rendez-vous de demain."

Système

"Pour la facturation, appuyez sur 1. Pour les rendez-vous, appuyez sur 2. Pour toute autre question, appuyez sur 9."

Résultat

L'appelant devine, attend et réexplique la même chose.

Comment le système raisonne

3 étapes

Prompt de menu

corrigé

Un script fixe énumère les options.

Branche DTMF

fragile

Une touche représente toute l'intention.

File d'attente

échoue

Le véritable contexte arrive avec un humain.

Modèles personnalisés

Première IA

Les systèmes comprenaient des cas très limités, puis s'effondraient.

Les équipes entraînaient des modèles acoustiques, des classificateurs d'intentions et des extracteurs de créneaux pour des flux d'appels spécifiques. Utile, mais coûteux à modifier.

Moment maladroit

Le système peut reconnaître une intention entraînée, puis ignorer la deuxième demande ou poser une question de suivi rigide.

Exemple d'appel

Première IA

Appelant

"Pouvez-vous déplacer le rendez-vous de demain et ajouter mon conjoint ?"

Système

"Je peux vous aider à reprogrammer le rendez-vous. Quelle date souhaitez-vous ?"

Résultat

L'information sur le conjoint est perdue, car elle ne figure pas dans le flux entraîné.

Comment le système raisonne

3 étapes

ASR personnalisé

corrigé

Ajusté pour un domaine et un ensemble d'accents.

Modèle d'intention

fragile

Classe la demande connue la plus proche.

Remplissage de créneaux

échoue

Les champs manquants déclenchent une correction scriptée.

Stacks de type Vapi / Retell / ElevenLabs

Pipelines en 3 étapes

Le stack est devenu flexible, mais chaque étape faisait confiance à la précédente.

Un schéma moderne courant relie la parole vers texte, un LLM et le texte vers parole dans une même boucle d'appel.

Moment maladroit

Lorsque la transcription est erronée ou que l'appelant interrompt, le LLM répond avec assurance à la mauvaise demande.

Exemple d'appel

Pipelines en 3 étapes

Appelant

"Non, je loue."

Système

"Bien compris, il s'agit d'une propriété de ranch. Est-ce exact ?"

Résultat

Une seule erreur d'écoute devient une erreur à l'oral.

Comment le système raisonne

3 étapes

Parole vers texte

échoue

Une transcription devient la source de référence.

LLM

fragile

Génère à partir du texte, et non de l'audio d'origine.

Texte vers parole

échoue

Énonce la réponse avec assurance.

IA vocale intégrée

ThunderPhone

Le système peut écouter, raisonner et se rétablir dans une même boucle.

ThunderPhone coordonne la compréhension audio, le routage des modèles, la gestion des tours de parole et la génération de réponses au sein d'une même architecture.

Ce qui change

Plusieurs voies d'écoute et un raisonnement tenant compte de l'audio réduisent les échecs en une seule étape avant qu'ils n'atteignent l'appelant.

Exemple d'appel

ThunderPhone

Appelant

"Non, je loue."

Système

"Bien compris. Vous louez votre logement, je vais donc ignorer les questions sur la propriété."

Résultat

L'appel progresse sans obliger l'appelant à se battre contre le système.

Comment le système raisonne

4 étapes

Flux audio

vérifie

L'audio brut reste disponible pour le raisonnement.

Écoute redondante

vérifie

Les signaux sont comparés avant toute action.

Routage des modèles

vérifie

Les parcours rapides et approfondis coopèrent à chaque tour.

Réponse naturelle

vérifie

L'appelant entend le contexte corrigé.

Ce que cela apporte

La percée n'est pas une voix de robot plus agréable. C'est une architecture qui maintient l'appel sur la bonne voie.

Meilleure écoute

Le système peut comparer des signaux et raisonner sur l'audio au lieu de se fier à une seule transcription.

Meilleur timing

La prise de parole et la gestion des interruptions font partie de la boucle conversationnelle.

Meilleur routage

Des parcours rapides et un raisonnement plus approfondi peuvent être sélectionnés selon les besoins de chaque tour de parole.

Meilleure expérience

Les appelants passent moins de temps à corriger l'automatisation et plus de temps à accomplir leur tâche.