Tecnologia

Vai oltre la pipeline in 3 fasi.

La maggior parte delle piattaforme di IA vocale si basa su una pipeline in 3 fasi: un modello di trascrizione, un LLM che non ragiona, un motore di sintesi vocale. Ogni fase è un singolo punto di errore. ThunderPhone riduce gli errori orchestrando più modelli contemporaneamente.

Il chiamante ha detto “Sono in affitto.”
ASR A“Sono in affitto”
ASR B“Fitto”
LLM audio“Sono in affitto”
Riconciliato “Sono in affitto” 2 percorsi su 3 concordano
L'architettura integrata

Lo ascolta in molti modi, poi riconcilia.

ThunderPhone orchestra più modelli contemporaneamente, consentendo loro di correggere gli errori reciproci.

Altre piattaforme · pipeline in 3 passaggi

Ogni passaggio si fida del precedente.

Audio del chiamante
«Sono in affitto.» · borbottato
STT A
“Fitto”
STT B
LLM audio
Nessun backup quando il singolo modello capisce male
LLM
Un modello rapido vede solo la trascrizione.
→ risponde «Salve, signor Fitto — come posso aiutarla?»
Gli LLM veloci sbagliano nel seguire le istruzioni
TTS
La risposta viene ripetuta a voce.
→ dice «Salve, signor Fitto — come posso aiutarla?» ✗
1 trascrizione + 1 LLM = risposta sbagliata
ThunderPhone · orchestrato

Molti percorsi, un'unica risposta coordinata.

Audio del chiamante
«Sono in affitto.» · borbottato
STT A
“Sono in affitto”
STT B
“Fitto”
LLM audio
“Sono in affitto”
Tre trascrizioni + audio grezzo conservati come prove
Livello di ragionamento
LLM veloci e di ragionamento valutano le evidenze testuali e audio.
→ 2 percorsi su 3 concordano: «Sono in affitto»
Gli LLM di ragionamento e veloci si controllano a vicenda prima di rispondere
TTS
Voci selezionate riducono al minimo le allucinazioni su ortografia e caratteri alfanumerici.
→ “Capito — quindi è in affitto.” ✓
Azzecca i dettagli più complessi al primo colpo.
Prova delle prestazioni

Storm stabilisce record di intelligenza su Big Bench Audio.

BBA verifica se un modello riesce a comprendere richieste vocali e a rispondere correttamente a domande difficili. La nostra configurazione Storm più potente raggiunge il 99,4% sul nostro set di valutazione pubblico — 0,6% di errori, 4× meno del successivo miglior punteggio pubblico.

Modello
Tasso di errore↓ più basso è meglio
Punteggio
ThunderPhone Storm · Extra Intelligence4× meno errori
0.6%
Step-Audio R1.1
2.4%
Grok Voice Think Fast
2.9%
Ultravox v0.7 Thinking
3.0%
GPT-Realtime-2 High
3.4%
Gemini 3.1 Flash Live High
3.4%
Visualizza il dataset di valutazione BBA-Storm su Hugging Face

Il tasso di errore corrisponde al 100% meno il tasso di successo BBA. Il risultato di ThunderPhone proviene dal nostro dataset di valutazione pubblico, collegato sopra; gli altri punteggi pubblici (classifica Artificial Analysis) sono indicati a scopo orientativo. BBA non cattura completamente le prestazioni nelle chiamate telefoniche, ma è un segnale utile per il ragionamento su richieste vocali.

Un approccio deciso batte la configurabilità

Non dovresti dover assemblare uno stack vocale a mano.

Altre piattaforme di IA vocale come Vapi, Retell, Pipecat e LiveKit ti costringono a prendere numerose decisioni di configurazione per far funzionare le tue chiamate. In ThunderPhone crediamo che l'ottimizzazione sia il nostro lavoro e che tu debba fare il meno possibile per far funzionare le tue chiamate senza intoppi.

Altre piattaforme di IA vocale · molti parametri da regolare
STT LLM TTS Rilevamento della fine turno Riduzione del rumore Interruzioni Fallback Schema degli strumenti Latenza VAD
ThunderPhone regola tutto questo per te
ThunderPhone · tre decisioni
1
Scegli un livello
Spark, Bolt o Storm.
2
Scegli una voce
Selezionata e testata su chiamate reali.
3
Scrivi il tuo prompt
Comportamento, politiche, strumenti: linguaggio semplice.
Tre decisioni. Questa è la configurazione: orchestrazione, fallback e ottimizzazione sono già inclusi.
Scegliamo i modelli migliori per il lavoro e li combiniamo. Modelli di frontiera di OpenAI, Anthropic e Google, insieme a modelli open source, orchestrati per offrire le migliori prestazioni e il miglior prezzo in ogni chiamata, così non devi preoccupartene.
Un solo prompt, meno proliferazione di grafi

Un solo prompt, non un grafo di nodi.

I flow builder esistono perché i sistemi più deboli non riescono a seguire prompt complessi. Ogni fase della conversazione diventa un nodo che devi creare e gestire manualmente. Storm segue istruzioni dettagliate da un unico prompt, così non devi preoccuparti di nodi e collegamenti.

Piattaforme flow builder

Collega manualmente ogni ramificazione.

Salutoprompt · voce
Raccogli il numero di telefonoprompt · convalida
Conferma il numero di telefonoripeti il prompt ×2
enroll()strumento · tentativi
Escalationa un operatore umano
Alternativagenerico
non valido ×2errore
Sei nodi per un unico flusso di iscrizione, ciascuno con prompt, strumenti, transizioni e gestione degli errori propri.
ThunderPhone Storm

Descrivi il comportamento una sola volta.

Prompt di comportamento
Saluta il chiamante e raccogli nome e numero di telefono.
Conferma il consenso prima dell'iscrizione: è obbligatorio.
Se chiede informazioni sulla fatturazione, segui la politica di fatturazione qui sotto.
Chiama enroll() solo dopo aver confermato ogni campo.
Se il chiamante chiede di parlare con una persona, trasferisci a un operatore umano.
Ramificazioni complesse Watchdog opzionali Iterazioni più semplici
Un solo prompt da scrivere, testare e perfezionare, ramificazioni incluse.
Perché conta

Le chiamate in produzione sono caotiche. ThunderPhone è pronto.

Parlato poco chiaro, conversazioni in sottofondo, nomi e numeri, lingue miste: ThunderPhone è progettato per le situazioni che mandano in crisi gli altri sistemi.

Parlato poco chiaro

Confronta i segnali audio e testuali invece di fidarti di una sola trascrizione.

Audio telefonico scadente

I modelli di identificazione e riduzione del rumore puliscono il segnale.

Voci di sottofondo

Identifica le conversazioni di sottofondo prima che compromettano l'agente.

Nomi e indirizzi

Verifica nomi propri, ortografia, numeri e correzioni.

Parlato in più lingue

Instrada attraverso percorsi audio e vocali multilingue quando necessario.

Prompt lunghi

Usa percorsi di ragionamento più robusti quando il comportamento non può ridursi a una sola regola.

Latenza, qualità e costo

Una risposta sbagliata più rapida non rende migliore una chiamata.

L'IA telefonica deve rispondere rapidamente, ma la velocità senza correttezza porta solo errori più velocemente. Gli LLM di oggi hanno bisogno di un momento per ragionare e restare affidabili, quindi ThunderPhone bilancia i due aspetti per ogni livello.

Spark
~3s
alla prima risposta
Bolt
~2s
alla prima risposta
Storm
~2–3s
~2s con conferme · ~3s senza
MisurazioneAltri fornitori dichiarano una latenza di 500 ms in condizioni ideali, ma in genere arrivano a circa 2 s in una chiamata reale.Misuriamo la nostra latenza in condizioni reali.
ResilienzaI fornitori di IA registrano picchi di latenza che possono compromettere le chiamate.Lo stack orchestrato di ThunderPhone effettua il failover verso opzioni più rapide quando accade.
Generazioni di IA vocale

La nuova generazione di IA vocale è qui

Le chiamate telefoniche automatizzate sono state esperienze frustranti... fino a ora. Ogni ondata tecnologica ha migliorato l'esperienza, ma mai al punto da renderla davvero fluida. Con ThunderPhone, questo cambia.

1990s2010s20242026 · ora
Generazione 1

IVR

Premi uno per le vendite, premi due per l'assistenza. I menu possono solo instradare.

Generazione 2

Bot a intenti

Di' “vendite” o “fatturazione” e spera che il parser degli slot lo azzecchi.

Generazione 3

IA in tre passaggi

Trascrivi, interroga un LLM veloce, poi parla: ogni passaggio si fida del precedente.

Generazione 4

IA integrata

Audio, testo, ragionamento, strumenti, voci e guardrail in un unico sistema.

Progettato per le chiamate che mandano in crisi tutto il resto

Scopri lo stack integrato
nelle tue chiamate più difficili.

Operativo in dieci minuti. Da 2¢/min.