Tecnologia

Vai oltre
la pipeline in 3 fasi.

La maggior parte delle piattaforme di AI vocale si basa su una pipeline in 3 fasi: un modello di trascrizione, un LLM che non ragiona e un motore text-to-speech. Ognuna può, da sola, compromettere l’intera chiamata. ThunderPhone riduce gli errori orchestrando contemporaneamente molti modelli.

Il chiamante ha detto «Sono in affitto».
ASR A“Sono in affitto”
ASR B“Fitto”
LLM audio“Sono in affitto”
Risultato consolidato: «Sono in affitto»2 percorsi su 3 concordano

Ascolta in più modi,
poi fa convergere i risultati.

ThunderPhone orchestra più modelli contemporaneamente, così ciascuno può correggere gli errori degli altri.

Chi chiama dice “Sono in affitto” — biascicando le parole
Altre piattaformePipeline in 3 passaggi
Ascolta una volta
STT “Sono Fitto”
Nessun piano B quando l’unico modello capisce male
Risponde rapidamente

Un LLM veloce ha accesso solo alla trascrizione.

Parla

“Salve, signor Fitto — come posso aiutarla?”

1 trascrizione + 1 LLM = risposta sbagliata
ThunderPhoneOrchestrato
Ascolta in tre modi
“Sono in affitto”“Fitto”“Sono in affitto”
Tre trascrizioni + audio non elaborato conservati come prova
Riconcilia i risultati

Gli LLM veloci e gli LLM di ragionamento incrociano i risultati: 2 percorsi su 3 concordano.

Parla

“Capito — quindi è in affitto.”

Azzecca i dettagli più difficili al primo colpo.

Storm stabilisce nuovi record di intelligenza su Big Bench Audio.

BBA verifica se un modello è in grado di comprendere i prompt vocali e rispondere correttamente a domande difficili. La configurazione più potente di Storm detiene il record: 99,4% sul nostro set pubblico di valutazione.

0.6% tasso di errore

· Luglio 2026Dataset su Hugging Face
ThunderPhoneStorm · Extra Intelligence0.6%
Qwen Audio 3.0Realtime Plus0.8%
Qwen3.5 OmniPlus Realtime1.3%
Step-Audio R1.1Realtime2.4%

Il risultato di ThunderPhone proviene dal nostro dataset pubblico di valutazione, disponibile al link qui sopra; gli altri punteggi pubblici, tratti dalla classifica di Artificial Analysis, sono riportati come riferimento.

Non dovrebbe toccare a te assemblare a mano uno stack vocale.

Le altre piattaforme di AI vocale, come Vapi, Retell, Pipecat e LiveKit, ti impongono una lunga serie di scelte di configurazione solo per far funzionare le chiamate. Noi di ThunderPhone crediamo che la messa a punto sia compito nostro e che tu debba fare il meno possibile perché le tue chiamate funzionino senza intoppi.

Altre piattaforme di AI vocaleTanti parametri da regolare
STTv4-largeFallback STTLLMtemp 0.3Fallback LLMTTSFallback TTSVAD0.62Rilevamento di fine turno240 msSoglia di barge-in−38 dBFiltro backchannelGestione delle interruzioniTimeout del turno800 msRiduzione del rumoreJitter buffer60 msFrequenza di campionamento8 kHzSchema degli strumentiPolitica dei nuovi tentativi×3Strategie di fallback

ThunderPhone ottimizza tutto per te

ThunderPhoneTre decisioni
1
Scegli un livello

Spark, Bolt o Storm.

2
Scegli una voce

Voci selezionate con cura e testate su chiamate reali.

3
Scrivi il tuo prompt

Comportamento, politiche e strumenti — tutto in linguaggio naturale.

Tre decisioni. La configurazione è tutta qui: orchestrazione, fallback e ottimizzazione sono già inclusi.

Scegliamo i modelli migliori per ogni attività e li facciamo lavorare insieme. I modelli più avanzati di OpenAI, Anthropic e Google lavorano al fianco di modelli open source, orchestrati per offrire le migliori prestazioni al miglior prezzo per ogni chiamata. Così non devi pensarci tu.

Un solo prompt,
non un grafo di nodi.

I flow builder esistono perché i sistemi meno evoluti non riescono a seguire prompt complessi. Ogni passaggio della conversazione diventa un nodo da creare e mantenere manualmente. Storm segue istruzioni articolate partendo da un unico prompt, così non devi preoccuparti di nodi e collegamenti.

Piattaforme con flow builderCostruisci a mano ogni diramazione
Saluto iniziale prompt · voce
Raccogli il numero di telefono prompt · validazione
Conferma il numero di telefono nuovo prompt ×2
enroll() strumento · nuovi tentativi
Passa a un operatore umano
Nodo di fallback generale non valido ×2 · errore

Sei nodi per un solo flusso di iscrizione: ciascuno con prompt, strumenti, transizioni e gestione degli errori dedicati.

ThunderPhone StormDescrivi il comportamento una volta sola
Prompt di comportamento

Saluta chi chiama e raccogli il nome e il numero di telefono. Prima di procedere con l'iscrizione, assicurati di avere il consenso: è obbligatorio. Se chiede informazioni sulla fatturazione, segui la politica di fatturazione qui sotto. Esegui enroll() solo dopo aver confermato tutti i campi. Se chiede di parlare con una persona, trasferisci la chiamata a un operatore umano.

Ramificazioni complessewatchdog opzionaliIterazioni più semplici

Un solo prompt da scrivere, testare e perfezionare, diramazioni incluse.

Le chiamate reali sono piene di imprevisti. ThunderPhone è pronto.

Parole biascicate, voci in sottofondo, nomi e numeri, lingue che si mescolano: ThunderPhone è progettato per affrontare le situazioni che mandano in crisi gli altri sistemi.

Parlato poco chiaro

Confronta i segnali audio e testuali anziché affidarti a un’unica trascrizione.

Audio telefonico di scarsa qualità

I modelli di rilevamento e riduzione del rumore ripuliscono il segnale.

Conversazioni in sottofondo

Rileva le conversazioni in sottofondo prima che mandino fuori strada l’agente vocale.

Nomi e indirizzi

Verifica nomi propri, grafie, numeri e correzioni incrociando più riscontri.

Parlato in più lingue

Quando serve, instrada la chiamata attraverso percorsi audio e vocali multilingue.

Prompt lunghi

Attiva percorsi di ragionamento più solidi quando il comportamento non è riconducibile a un’unica regola.

Rispondere male più in fretta non migliora la chiamata.

L’AI vocale deve rispondere rapidamente, ma la velocità senza accuratezza significa solo sbagliare più in fretta. Gli LLM di oggi hanno bisogno di qualche istante per ragionare e restare affidabili: per questo ThunderPhone bilancia latenza e accuratezza.

Spark~3salla prima risposta
Bolt~2salla prima risposta
Storm~2–3s~2 s con conferme · ~3 s senza
Misurazione

Altri provider dichiarano una latenza di 500 ms in condizioni ideali, ma in una chiamata reale si attestano in genere intorno ai 2 s. Misuriamo la nostra latenza in condizioni reali.

Resilienza

I provider di IA possono avere picchi di latenza che mandano a monte le chiamate. Quando succede, lo stack orchestrato di ThunderPhone passa automaticamente a opzioni più rapide.

La nuova generazione dell’AI vocale è qui.

Le chiamate automatizzate sono sempre state frustranti… fino a oggi. Ogni evoluzione tecnologica ha migliorato l’esperienza, ma mai fino a renderla davvero fluida. Con ThunderPhone, tutto questo cambia.

1990sGenerazione 1

IVR

«Prema uno per le vendite, prema due per l’assistenza.» I menu sanno solo instradare le chiamate.

2010sGenerazione 2

Bot basati sugli intenti

Di’ «vendite» o «fatturazione» e spera che il parser degli slot lo riconosca.

2024Generazione 3

IA in tre passaggi

Trascrive, interroga un solo LLM veloce e poi parla: ogni passaggio si fida del precedente.

2026 · oggiGenerazione 4

IA integrata

Audio, testo, ragionamento, strumenti, voci e guardrail in un unico sistema.

Progettato per le chiamate che mettono in crisi tutto il resto

Metti alla prova il nostro stack integrato con le tue chiamate più difficili.

Attivo in 10 minuti. Da 2¢/min.