Générations d'IA vocale
La plupart des appels téléphoniques automatisés sont nuls. Une nouvelle technologie change la donne.
L'ancien problème n'était pas que l'automatisation téléphonique manquait d'une voix agréable. Elle manquait de compréhension pour maintenir une vraie conversation.
Un appel téléphonique devient plus facile à automatiser
Chaque génération transfère davantage de contexte à la machine.
Ère des SVI
L'appelant devait parler comme une machine.
Première IA
Les systèmes comprenaient des cas très limités, puis s'effondraient.
Pipelines en 3 étapes
Le stack est devenu flexible, mais chaque étape faisait confiance à la précédente.
ThunderPhone
Le système peut écouter, raisonner et se rétablir dans une même boucle.
Arborescences téléphoniques
Ère des SVI
L'appelant devait parler comme une machine.
L'automatisation reposait sur des menus, des branches de clavier et des files d'attente. Elle fonctionnait lorsque l'appelant connaissait déjà le bon chemin.
Moment maladroit
L'intention est réduite à une touche, donc tout ce qui sort du menu devient un transfert ou une répétition.
Exemple d'appel
Ère des SVI
Appelant
"Je dois déplacer le rendez-vous de demain."
Système
"Pour la facturation, appuyez sur 1. Pour les rendez-vous, appuyez sur 2. Pour toute autre question, appuyez sur 9."
Résultat
L'appelant devine, attend et réexplique la même chose.
Comment le système raisonne
3 étapesPrompt de menu
corrigéUn script fixe énumère les options.
Branche DTMF
fragileUne touche représente toute l'intention.
File d'attente
échoueLe véritable contexte arrive avec un humain.
Modèles personnalisés
Première IA
Les systèmes comprenaient des cas très limités, puis s'effondraient.
Les équipes entraînaient des modèles acoustiques, des classificateurs d'intentions et des extracteurs de créneaux pour des flux d'appels spécifiques. Utile, mais coûteux à modifier.
Moment maladroit
Le système peut reconnaître une intention entraînée, puis ignorer la deuxième demande ou poser une question de suivi rigide.
Exemple d'appel
Première IA
Appelant
"Pouvez-vous déplacer le rendez-vous de demain et ajouter mon conjoint ?"
Système
"Je peux vous aider à reprogrammer le rendez-vous. Quelle date souhaitez-vous ?"
Résultat
L'information sur le conjoint est perdue, car elle ne figure pas dans le flux entraîné.
Comment le système raisonne
3 étapesASR personnalisé
corrigéAjusté pour un domaine et un ensemble d'accents.
Modèle d'intention
fragileClasse la demande connue la plus proche.
Remplissage de créneaux
échoueLes champs manquants déclenchent une correction scriptée.
Stacks de type Vapi / Retell / ElevenLabs
Pipelines en 3 étapes
Le stack est devenu flexible, mais chaque étape faisait confiance à la précédente.
Un schéma moderne courant relie la parole vers texte, un LLM et le texte vers parole dans une même boucle d'appel.
Moment maladroit
Lorsque la transcription est erronée ou que l'appelant interrompt, le LLM répond avec assurance à la mauvaise demande.
Exemple d'appel
Pipelines en 3 étapes
Appelant
"Non, je loue."
Système
"Bien compris, il s'agit d'une propriété de ranch. Est-ce exact ?"
Résultat
Une seule erreur d'écoute devient une erreur à l'oral.
Comment le système raisonne
3 étapesParole vers texte
échoueUne transcription devient la source de référence.
LLM
fragileGénère à partir du texte, et non de l'audio d'origine.
Texte vers parole
échoueÉnonce la réponse avec assurance.
IA vocale intégrée
ThunderPhone
Le système peut écouter, raisonner et se rétablir dans une même boucle.
ThunderPhone coordonne la compréhension audio, le routage des modèles, la gestion des tours de parole et la génération de réponses au sein d'une même architecture.
Ce qui change
Plusieurs voies d'écoute et un raisonnement tenant compte de l'audio réduisent les échecs en une seule étape avant qu'ils n'atteignent l'appelant.
Exemple d'appel
ThunderPhone
Appelant
"Non, je loue."
Système
"Bien compris. Vous louez votre logement, je vais donc ignorer les questions sur la propriété."
Résultat
L'appel progresse sans obliger l'appelant à se battre contre le système.
Comment le système raisonne
4 étapesFlux audio
vérifieL'audio brut reste disponible pour le raisonnement.
Écoute redondante
vérifieLes signaux sont comparés avant toute action.
Routage des modèles
vérifieLes parcours rapides et approfondis coopèrent à chaque tour.
Réponse naturelle
vérifieL'appelant entend le contexte corrigé.
Ce que cela apporte
La percée n'est pas une voix de robot plus agréable. C'est une architecture qui maintient l'appel sur la bonne voie.
Meilleure écoute
Le système peut comparer des signaux et raisonner sur l'audio au lieu de se fier à une seule transcription.
Meilleur timing
La prise de parole et la gestion des interruptions font partie de la boucle conversationnelle.
Meilleur routage
Des parcours rapides et un raisonnement plus approfondi peuvent être sélectionnés selon les besoins de chaque tour de parole.
Meilleure expérience
Les appelants passent moins de temps à corriger l'automatisation et plus de temps à accomplir leur tâche.