Technologie

Allez au-delà du pipeline en 3 étapes.

La plupart des plateformes d’IA vocale reposent sur un pipeline en 3 étapes : un modèle de transcription, un LLM qui ne réfléchit pas, un moteur de synthèse vocale. Chaque étape constitue un point de défaillance unique. ThunderPhone réduit les erreurs en orchestrant plusieurs modèles à la fois.

L’appelant a dit « Je loue. »
ASR A« Je loue. »
ASR B« Bonjour, Julot ! »
LLM audio« Je loue. »
Réconcilié « Je loue » 2 chemins sur 3 concordent
L’architecture intégrée

Écoutez-le de plusieurs façons, puis recoupez-les.

ThunderPhone orchestre plusieurs modèles à la fois, afin qu'ils corrigent les erreurs les uns des autres.

Autres IA vocales · pipeline en 3 étapes

Chaque étape fait confiance à la précédente.

Audio de l'appelant
« Je loue. » · marmonné
STT A
« Bonjour, Julot ! »
STT B
LLM audio
Aucune solution de secours lorsque le modèle unique entend mal
LLM
Un modèle rapide ne voit que la transcription.
→ répond « Bonjour, Julot ! Comment puis-je vous aider ? »
Les LLM rapides font des erreurs dans le suivi des instructions
TTS
La réponse est prononcée.
→ dit « Bonjour, Julot ! Comment puis-je vous aider ? » ✗
1 transcription + 1 LLM = mauvaise réponse
ThunderPhone · orchestré

De nombreux chemins, une réponse coordonnée.

Audio de l'appelant
« Je loue. » · marmonné
STT A
« Je loue. »
STT B
« Bonjour, Julot ! »
LLM audio
« Je loue. »
Trois transcriptions + audio brut conservés comme preuves
Couche de raisonnement
Les LLM rapides et de raisonnement évaluent les indices textuels et audio.
→ 2 chemins sur 3 concordent : « Je loue. »
Les LLM rapides et de raisonnement se recoupent avant de répondre
TTS
Des voix sélectionnées réduisent les hallucinations sur l'orthographe et les caractères alphanumériques.
→ « Compris — vous louez donc. » ✓
Saisit correctement les détails complexes dès la première fois.
Preuve de performance

Storm établit des records d'intelligence sur Big Bench Audio.

BBA teste la capacité d'un modèle à comprendre des prompts oraux et à répondre correctement à des questions difficiles. Notre configuration Storm la plus performante atteint 99,4 % sur notre jeu d'évaluation public — 0,6 % d'erreurs, soit 4× moins que le meilleur score public suivant.

Modèle
Taux d'erreur↓ plus bas est préférable
Score
ThunderPhone Storm · Extra Intelligence4× moins d'erreurs
0.6%
Step-Audio R1.1
2.4%
Grok Voice Think Fast
2.9%
Ultravox v0.7 Thinking
3.0%
GPT-Realtime-2 High
3.4%
Gemini 3.1 Flash Live High
3.4%
Consultez le jeu de données d'évaluation BBA-Storm sur Hugging Face

Le taux d'erreur correspond à 100 % moins le taux de réussite BBA. Le résultat de ThunderPhone provient de notre jeu de données d'évaluation public, lié ci-dessus ; les autres scores publics (classement Artificial Analysis) sont indiqués à titre de comparaison. BBA ne reflète pas entièrement les performances en appel téléphonique, mais reste un indicateur utile du raisonnement sur des prompts oraux.

Des choix assumés valent mieux que la configurabilité

Vous ne devriez pas avoir à assembler une stack vocale à la main.

D'autres plateformes d'IA vocale comme Vapi, Retell, Pipecat et LiveKit vous obligent à prendre de nombreuses décisions de configuration pour que vos appels fonctionnent. Chez ThunderPhone, nous pensons que les réglages sont notre travail et que vous devriez avoir à faire le moins de travail possible pour que vos appels se déroulent sans accroc.

Autres IA vocales · nombreux réglages à ajuster
STT LLM TTS Détection de fin de parole Réduction du bruit Interruptions Solutions de repli Schéma d'outil Latence VAD
ThunderPhone règle tout cela pour vous
ThunderPhone · trois décisions
1
Choisissez un niveau
Spark, Bolt ou Storm.
2
Choisissez une voix
Sélectionnée et testée sur de vrais appels.
3
Rédigez votre prompt
Comportement, règles, outils — en langage clair.
Trois décisions. C'est toute la configuration — l'orchestration, les solutions de repli et les réglages sont inclus d'emblée.
Nous sélectionnons les meilleurs modèles pour chaque tâche et les assemblons. Des modèles de pointe d'OpenAI, Anthropic et Google, associés à des modèles open source — orchestrés pour offrir les meilleures performances et le meilleur prix à chaque appel, pour que vous n'ayez pas à vous en soucier.
Un seul prompt, moins de graphes tentaculaires

Un prompt, pas un graphe de nœuds.

Les créateurs de flux existent parce que les systèmes moins performants ne peuvent pas suivre des prompts complexes. Chaque étape de conversation devient un nœud que vous devez créer et maintenir manuellement. Storm suit des instructions riches à partir d'un seul prompt, vous n'avez donc pas à vous soucier des nœuds et des connexions.

Plateformes de création de flux

Câblez chaque branche à la main.

Accueilprompt · voix
Recueillir le numéro de téléphoneprompt · validation
Confirmer le numéro de téléphonerelance du prompt ×2
enroll()outil · tentatives
Escaladervers un humain
Solution de replifourre-tout
invalide ×2erreur
Six nœuds pour un seul flux d'inscription — chacun avec ses propres prompts, outils, transitions et gestion des échecs.
ThunderPhone Storm

Décrivez le comportement une seule fois.

Prompt de comportement
Saluez l'appelant et recueillez son nom et son numéro de téléphone.
Confirmez son consentement avant de l'inscrire — c'est obligatoire.
S'il pose une question sur la facturation, suivez la politique de facturation ci-dessous.
Appelez enroll() uniquement une fois que chaque champ est confirmé.
Si l'appelant demande à parler à quelqu'un, transférez vers un humain.
Branchements complexes Contrôles optionnels Itération plus simple
Un seul prompt à rédiger, tester et faire évoluer — branchements inclus.
Pourquoi c’est important

Les appels en production sont complexes. ThunderPhone est prêt.

Parole marmonnée, conversations en arrière-plan, noms et numéros, langues mélangées — ThunderPhone est conçu pour les situations qui mettent les autres systèmes en échec.

Parole marmonnée

Comparez les signaux audio et textuels au lieu de vous fier à une seule transcription.

Mauvais son téléphonique

Des modèles d’identification et de réduction du bruit nettoient le signal.

Bruit de fond conversationnel

Identifiez les conversations parallèles avant qu’elles ne fassent dérailler l’agent.

Noms et adresses

Vérifiez les noms propres, les orthographes, les numéros et les corrections.

Parole multilingue

Orientez via des parcours audio et vocaux multilingues lorsque nécessaire.

Prompts longs

Utilisez des parcours de raisonnement plus puissants lorsque le comportement ne peut pas se résumer à une seule règle.

Latence, qualité et coût

Une réponse erronée plus rapide ne rend pas l’appel meilleur.

L’IA téléphonique doit répondre vite, mais la rapidité sans exactitude ne fait que produire rapidement des erreurs. Les LLM actuels ont besoin d’un moment pour réfléchir afin de rester fiables, alors ThunderPhone équilibre les deux selon le niveau.

Spark
~3s
jusqu’à la première réponse
Bolt
~2s
jusqu’à la première réponse
Storm
~2–3s
~2 s avec acquiescements verbaux · ~3 s sans
MesureD’autres fournisseurs annoncent une latence de 500 ms dans des conditions idéales, mais atteignent généralement environ 2 s lors d’un appel réel.Nous mesurons notre latence en conditions réelles.
RésilienceLes fournisseurs d’IA connaissent des pics de latence qui peuvent faire dérailler les appels.Le stack orchestré de ThunderPhone bascule vers des options plus rapides lorsque cela se produit.
Générations d'IA vocale

La prochaine génération d'IA vocale est là

Les appels téléphoniques automatisés ont longtemps été frustrants... jusqu'à présent. Chaque vague technologique a amélioré l'expérience, sans jamais la rendre vraiment fluide. ThunderPhone change cela.

1990s2010s20242026 · maintenant
Génération 1

SVI

Appuyez sur 1 pour les ventes, sur 2 pour l'assistance. Les menus ne font que du routage.

Génération 2

Bots d'intention

Dites « ventes » ou « facturation » et espérez que l'analyseur de slots le comprenne.

Génération 3

IA en trois étapes

Transcrire, interroger un LLM rapide, puis parler — chaque étape faisant confiance à la précédente.

Génération 4

IA intégrée

Audio, texte, raisonnement, outils, voix et garde-fous réunis dans un seul système.

Conçu pour les appels qui mettent tout le reste en échec

Découvrez le stack intégré
pour vos appels les plus difficiles.

En ligne en dix minutes. À partir de 2 centimes/min.