Technologie

Allez au-delà
du pipeline en 3 étapes.

La plupart des plateformes d’IA vocale reposent sur un pipeline en 3 étapes : un modèle de transcription, un LLM sans capacité de raisonnement et un moteur de synthèse vocale. Chaque étape constitue un point de défaillance unique. ThunderPhone réduit les erreurs en orchestrant simultanément de nombreux modèles.

L’appelant a dit : « Je loue. »
ASR A« Je loue. »
ASR B« Bonjour, Julot ! »
LLM audio« Je loue. »
Résultat consolidé : « Je loue »2 résultats sur 3 concordent

Multiplier les écoutes,
puis réconcilier les résultats.

ThunderPhone orchestre simultanément de nombreux modèles et leur permet de corriger mutuellement leurs erreurs.

L’appelant marmonne : « Je loue. »
Autres plateformespipeline en 3 étapes
Une seule écoute
STT « Julot »
Aucun filet de sécurité lorsque le modèle unique comprend mal
Répond rapidement

Un LLM rapide n’a accès qu’à la transcription.

Répond

« Bonjour, Julot ! Comment puis-je vous aider ? »

1 transcription + 1 LLM = mauvaise réponse
ThunderPhoneOrchestré
Trois modes d’écoute
« Je loue. »« Bonjour, Julot ! »« Je loue. »
Trois transcriptions et l’audio brut conservés comme éléments de preuve
Arbitre

Les LLM rapides et les LLM de raisonnement croisent leurs analyses : 2 voies sur 3 concordent.

Répond

« D’accord, vous êtes donc locataire. »

Interprète correctement les informations complexes du premier coup.

Storm bat des records aux tests d’intelligence de Big Bench Audio.

BBA mesure la capacité d’un modèle à comprendre des prompts vocaux et à répondre correctement à des questions difficiles. Notre configuration Storm la plus performante détient le record : 99,4 % sur notre jeu d’évaluation public.

0.6% taux d’erreur

· juillet 2026Jeu de données sur Hugging Face
ThunderPhoneStorm · Extra Intelligence0.6%
Qwen Audio 3.0Realtime Plus0.8%
Qwen3.5 OmniPlus Realtime1.3%
Step-Audio R1.1Realtime2.4%

Le résultat de ThunderPhone provient de notre jeu de données public d’évaluation, accessible ci-dessus ; les autres scores publics (classement Artificial Analysis) sont indiqués à titre de comparaison.

Vous ne devriez pas avoir à assembler une stack vocale à la main.

Les autres plateformes d’IA vocale, comme Vapi, Retell, Pipecat et LiveKit, vous imposent une multitude de choix de configuration pour faire fonctionner vos appels. Chez ThunderPhone, nous considérons que c’est à nous d’affiner les réglages — et que vous devriez en faire le moins possible pour obtenir des appels fluides.

Autres IA vocalesUne multitude de paramètres à régler
STTv4-largeSolution de secours STTLLMtemp 0.3LLM de repliTTSSolution de secours TTSVAD0.62Détection de fin de parole240 msSeuil d’interruption par l’appelant−38 dBFiltre des acquiescements verbauxInterruptionsDélai d’expiration du tour de parole800 msRéduction du bruitTampon de gigue60 msFréquence d’échantillonnage8 kHzSchéma des outilsStratégie de nouvelle tentative×3Stratégies de repli

ThunderPhone règle tout cela pour vous

ThunderPhoneTrois décisions
1
Choisissez une offre

Spark, Bolt ou Storm.

2
Choisissez une voix

Soigneusement sélectionnées et testées sur de vrais appels.

3
Rédigez votre prompt

Comportement, règles, outils — en langage naturel.

Trois décisions, et c’est tout. L’orchestration, les solutions de secours et les réglages sont intégrés d’office.

Nous sélectionnons les meilleurs modèles pour chaque tâche et les combinons. Les modèles de pointe d’OpenAI, d’Anthropic et de Google travaillent aux côtés de modèles open source — le tout orchestré pour offrir les meilleures performances au meilleur prix à chaque appel, sans que vous ayez à vous en soucier.

Un seul prompt,
pas de graphe de nœuds.

Les éditeurs de flux existent parce que les systèmes moins performants ne savent pas suivre des prompts complexes. Chaque étape de la conversation devient alors un nœud à créer et à maintenir manuellement. Storm sait suivre des instructions détaillées à partir d’un seul prompt : vous n’avez donc plus à vous soucier des nœuds ni de leurs connexions.

Plateformes de création de workflowsConfigurez chaque branche manuellement
Message d’accueil prompt · voix
Recueillir le numéro de téléphone prompt · validation
Confirmer le numéro de téléphone re-prompt ×2
enroll() outil · nouvelles tentatives
Transférer à un humain
Fallback global invalide ×2 · erreur

Six nœuds pour un seul parcours d’inscription — chacun avec ses propres prompts, outils et transitions, et son propre mécanisme de gestion des erreurs.

ThunderPhone StormDéfinissez le comportement une seule fois
Prompt de comportement

Accueillez l’appelant et recueillez son nom et son numéro de téléphone. Obtenez son consentement avant de l’inscrire — c’est obligatoire. S’il pose une question sur la facturation, suivez la politique de facturation ci-dessous. N’appelez enroll() qu’une fois tous les champs confirmés. Si l’appelant demande à parler à quelqu’un, transférez l’appel à un humain.

Logique conditionnelle complexeMécanismes de surveillance facultatifsItérations simplifiées

Un seul prompt à rédiger, tester et affiner — embranchements inclus.

En conditions réelles, les appels sont imprévisibles. ThunderPhone est prêt.

Paroles marmonnées, brouhaha ambiant, noms et numéros, mélange de langues : ThunderPhone est conçu pour gérer les situations qui mettent les autres systèmes en échec.

Élocution peu distincte

Croiser les signaux audio et textuels au lieu de se fier à une seule transcription.

Mauvaise qualité audio au téléphone

Des modèles de détection et de réduction du bruit nettoient le signal.

Conversations en arrière-plan

Repérer les conversations parallèles avant qu’elles ne fassent perdre le fil à l’agent vocal.

Noms et adresses

Recouper les noms propres, les épellations, les chiffres et les corrections.

Parole mêlant plusieurs langues

Assurer le routage via des parcours audio et vocaux multilingues lorsque nécessaire.

Prompts longs

Mobiliser des raisonnements plus robustes lorsque le comportement attendu ne peut se résumer à une seule règle.

Donner plus vite une mauvaise réponse n’améliore pas l’appel.

Une IA vocale doit répondre vite — mais sans justesse, elle ne fait que se tromper plus vite. Les LLM actuels ont besoin d’un instant de réflexion pour rester fiables. ThunderPhone trouve donc le juste équilibre entre latence et précision.

Spark~3sjusqu’à la première réponse
Bolt~2sjusqu’à la première réponse
Storm~2–3s~2 s avec acquiescements verbaux · ~3 s sans
Mesure

D’autres fournisseurs annoncent une latence de 500 ms dans des conditions idéales, mais atteignent généralement environ 2 s lors d’un appel réel. Nous mesurons notre latence en conditions réelles.

Résilience

Les fournisseurs d’IA subissent des pics de latence qui peuvent compromettre les appels. Lorsque cela se produit, la stack orchestrée de ThunderPhone bascule vers des options plus rapides.

La nouvelle génération de l’IA vocale est déjà là.

Les appels téléphoniques automatisés ont longtemps été synonymes de frustration… jusqu’à aujourd’hui. Chaque nouvelle vague technologique a amélioré l’expérience, sans jamais la rendre réellement fluide. ThunderPhone change la donne.

1990sGénération 1

SVI

« Appuyez sur 1 pour le service commercial, sur 2 pour l’assistance. » Ces menus se contentent d’assurer le routage.

2010sGénération 2

Bots fondés sur l’intention

Dites « service commercial » ou « facturation » et espérez que le parseur de slots comprenne.

2024Génération 3

IA en trois étapes

Transcrire, interroger un seul LLM rapide, puis restituer la réponse à l’oral — chaque étape dépend de la précédente.

2026 · aujourd’huiGénération 4

IA intégrée

L’audio, le texte, le raisonnement, les outils, les voix et les garde-fous réunis dans un seul système.

Conçu pour les appels qui mettent toutes les autres solutions en échec

Testez notre stack intégrée sur vos appels les plus difficiles.

Opérationnel en dix minutes. À partir de 2 ¢/min.