Tehnologie

Depășiți fluxul în 3 pași.

Majoritatea platformelor de AI vocal se bazează pe un flux în 3 pași: un model de transcriere, un LLM care nu gândește și un motor text-to-speech. Fiecare pas reprezintă un punct unic de eșec. ThunderPhone reduce greșelile orchestrând simultan mai multe modele.

Apelantul a spus „Sunt chiriaș.”
ASR A„Sunt chiriaș”
ASR B„Sunt Chiriac”
LLM audio„Sunt chiriaș”
Confirmat „Sunt chiriaș” 2 din 3 variante coincid
Arhitectura integrată

Aude în multe feluri, apoi le corelează.

ThunderPhone orchestrează simultan mai multe modele, permițându-le să își corecteze reciproc greșelile.

Alte platforme · proces în 3 pași

Fiecare pas se bazează pe cel anterior.

Audio apelant
„Sunt chiriaș.” · mormăit
STT A
„Sunt Chiriac”
STT B
LLM audio
Nicio alternativă când modelul unic aude greșit
LLM
Un model rapid vede doar transcrierea.
→ răspunde „Bună ziua, Chiriac — cu ce vă pot ajuta?”
LLM-urile rapide fac greșeli când urmează instrucțiuni
TTS
Răspunsul este redat vocal.
→ spune „Bună ziua, Chiriac — cu ce vă pot ajuta?” ✗
1 transcriere + 1 LLM = răspuns greșit
ThunderPhone · orchestrat

Multe căi, un singur răspuns coordonat.

Audio apelant
„Sunt chiriaș.” · mormăit
STT A
„Sunt chiriaș”
STT B
„Sunt Chiriac”
LLM audio
„Sunt chiriaș”
Trei transcrieri + audio brut păstrate ca dovezi
Strat de raționament
LLM-urile rapide și cele de raționament evaluează dovezile din text și audio.
→ 2 din 3 căi sunt de acord: „Sunt chiriaș”
LLM-urile de raționament și cele rapide verifică reciproc înainte de a răspunde
TTS
Vocile selectate reduc la minimum halucinațiile privind ortografierea și caracterele alfanumerice.
→ „Am înțeles — deci sunteți chiriaș.” ✓
Înțelege corect detaliile dificile din prima.
Dovadă de performanță

Storm stabilește recorduri de inteligență pe Big Bench Audio.

BBA testează dacă un model poate înțelege solicitări vocale și poate răspunde corect la întrebări dificile. Cea mai performantă configurație Storm a noastră atinge 99,4% pe setul nostru public de evaluare — 0,6% greșeli, de 4× mai puține decât următorul cel mai bun scor public.

Model
Rată de greșeli↓ mai mic este mai bine
Scor
ThunderPhone Storm · Extra Intelligencede 4× mai puține greșeli
0.6%
Step-Audio R1.1
2.4%
Grok Voice Think Fast
2.9%
Ultravox v0.7 Thinking
3.0%
GPT-Realtime-2 High
3.4%
Gemini 3.1 Flash Live High
3.4%
Vedeți setul de date de evaluare BBA-Storm pe Hugging Face

Rata de greșeli este 100% minus rata de succes BBA. Rezultatul ThunderPhone provine din setul nostru public de date de evaluare, indicat mai sus; alte scoruri publice (clasamentul Artificial Analysis) sunt afișate ca punct de referință. BBA nu surprinde complet performanța în apeluri telefonice, dar este un indicator util pentru raționamentul bazat pe solicitări vocale.

Soluțiile bine definite depășesc soluțiile configurabile

Nu ar trebui să fiți nevoit să asamblați manual o tehnologie vocală.

Alte platforme AI vocale, precum Vapi, Retell, Pipecat și LiveKit, vă obligă să luați numeroase decizii de configurare pentru ca apelurile dumneavoastră să funcționeze. La ThunderPhone, credem că ajustarea este responsabilitatea noastră și că dumneavoastră ar trebui să depuneți cât mai puțin efort pentru ca apelurile să funcționeze fără probleme.

Alte platforme AI vocale · multe setări de ajustat
STT LLM TTS Detectarea finalului de enunț Reducerea zgomotului Întreruperi Alternative de rezervă Schema instrumentelor Latență VAD
ThunderPhone ajustează toate acestea pentru dumneavoastră
ThunderPhone · trei decizii
1
Alegeți un nivel
Spark, Bolt sau Storm.
2
Alegeți o voce
Selectate și testate în apeluri reale.
3
Scrieți-vă promptul
Comportament, politici, instrumente — limbaj clar.
Trei decizii. Atât presupune configurarea — orchestrarea, alternativele de rezervă și ajustările sunt incluse.
Alegem cele mai bune modele pentru fiecare sarcină și le combinăm. Modele de vârf de la OpenAI, Anthropic și Google, alături de modele open-source — orchestrate pentru cea mai bună performanță și cel mai bun preț la fiecare apel, ca să nu trebuiască să vă faceți griji.
Un singur prompt, mai puțină aglomerare de grafuri

Un singur prompt, nu un graf de noduri.

Instrumentele de creare a fluxurilor există deoarece sistemele mai slabe nu pot urma prompturi complexe. Fiecare etapă a conversației devine un nod pe care trebuie să îl construiți și să îl întrețineți manual. Storm urmează instrucțiuni detaliate dintr-un singur prompt, astfel încât să nu vă faceți griji cu privire la noduri și conexiuni.

Platforme de creare a fluxurilor

Configurați manual fiecare ramură.

Salutprompt · voce
Colectați numărul de telefonprompt · validare
Confirmați numărul de telefonreformulare prompt ×2
enroll()instrument · reîncercări
Escaladațicătre un agent uman
Variantă de rezervăacoperire generală
invalid ×2eroare
Șase noduri pentru un singur flux de înscriere — fiecare cu propriile prompturi, instrumente, tranziții și gestionare a eșecurilor.
ThunderPhone Storm

Descrieți comportamentul o singură dată.

Prompt de comportament
Salutați apelantul și colectați-i numele și numărul de telefon.
Confirmați consimțământul înainte de înscriere — este obligatoriu.
Dacă întreabă despre facturare, urmați politica de facturare de mai jos.
Apelați enroll() numai după ce fiecare câmp este confirmat.
Dacă apelantul cere să vorbească cu o persoană, transferați-l către un agent uman.
Ramificare complexă Mecanisme de supraveghere opționale Iterații mai simple
Un singur prompt de redactat, testat și îmbunătățit — cu ramificare inclusă.
De ce contează

Apelurile reale sunt complicate. ThunderPhone este pregătit.

Vorbire mormăită, discuții pe fundal, nume și numere, limbi amestecate — ThunderPhone este construit pentru situațiile care blochează alte sisteme.

Vorbire neclară

Comparați semnalele audio și text în loc să vă bazați pe o singură transcriere.

Sunet telefonic de slabă calitate

Modelele de identificare și reducere a zgomotului curăță semnalul.

Conversații în fundal

Identificați conversațiile din fundal înainte ca acestea să afecteze agentul vocal.

Nume și adrese

Verificați numele proprii, ortografia, numerele și corecturile.

Vorbire în limbi mixte

Direcționați prin fluxuri audio și vocale multilingve atunci când este necesar.

Prompturi lungi

Folosiți trasee de raționament mai robuste atunci când comportamentul nu poate fi redus la o singură regulă.

Latență, calitate și cost

Un răspuns greșit mai rapid nu înseamnă un apel mai bun.

AI-ul pentru apeluri trebuie să răspundă rapid — însă viteza fără corectitudine livrează doar greșeli mai repede. LLM-urile actuale au nevoie de un moment pentru a gândi și a rămâne fiabile, astfel că ThunderPhone echilibrează cele două aspecte pentru fiecare nivel.

Spark
~3s
până la primul răspuns
Bolt
~2s
până la primul răspuns
Storm
~2–3s
~2s cu confirmări · ~3s fără
MăsurareAlți furnizori susțin că au o latență de 500 ms în condiții ideale, însă de obicei ajung la aproximativ 2 s într-un apel real.Ne măsurăm latența în condiții reale.
ReziliențăFurnizorii de AI se confruntă cu vârfuri de latență care pot deraia apelurile.Infrastructura orchestrată ThunderPhone comută la opțiuni mai rapide când se întâmplă acest lucru.
Generații de IA vocală

Următoarea generație de IA vocală este aici

Apelurile telefonice automatizate au fost experiențe frustrante... până acum. Fiecare val de tehnologie a îmbunătățit experiența, dar niciodată până la punctul în care aceasta să fie cu adevărat fluidă. ThunderPhone schimbă acest lucru.

1990s2010s20242026 · acum
Generația 1

IVR

Apăsați 1 pentru vânzări, apăsați 2 pentru asistență. Meniurile pot doar direcționa apelurile.

Generația 2

Boți de intenție

Spuneți „vânzări” sau „facturare” și sperați că parserul de sloturi le identifică.

Generația 3

IA în trei pași

Transcrie, consultă un LLM rapid, apoi vorbește — fiecare pas bazându-se pe cel anterior.

Generația 4

IA integrată

Audio, text, raționament, instrumente, voci și măsuri de protecție într-un singur sistem.

Creat pentru apelurile care dau peste cap orice altceva

Descoperiți stiva integrată
pentru cele mai dificile apeluri ale dumneavoastră.

Funcțional în zece minute. De la 2 cenți/min.