Generazioni di IA vocale
La maggior parte delle chiamate telefoniche automatizzate fa schifo. Le nuove tecnologie cambiano tutto.
Il vecchio problema non era che l'automazione telefonica non avesse una voce gradevole. Non capiva abbastanza da mantenere viva una conversazione reale.
Una chiamata telefonica diventa più facile da automatizzare
Ogni generazione trasferisce più contesto nella macchina.
Era IVR
Il chiamante doveva parlare come una macchina.
Primi sistemi di AI
I sistemi capivano percorsi ristretti, poi andavano in pezzi.
Pipeline in 3 fasi
Lo stack è diventato flessibile, ma ogni fase si fidava della precedente.
ThunderPhone
Il sistema può ascoltare, ragionare e recuperare in un unico ciclo.
Alberi telefonici
Era IVR
Il chiamante doveva parlare come una macchina.
Per automazione si intendevano menu, diramazioni da tastierino e code. Funzionava quando il chiamante conosceva già il percorso giusto.
Momento goffo
L'intento viene ridotto alla pressione di un tasto, quindi tutto ciò che è fuori dal menu diventa un trasferimento o una ripetizione.
Chiamata di esempio
Era IVR
Chiamante
"Devo spostare l'appuntamento di domani."
Sistema
"Per la fatturazione, prema 1. Per gli appuntamenti, prema 2. Per tutte le altre domande, prema 9."
Risultato
Il chiamante prova a indovinare, aspetta e spiega di nuovo la stessa cosa.
Come pensa il sistema
3 fasiPrompt del menu
correttoUn copione fisso elenca le opzioni.
Ramo DTMF
fragileUn tasto rappresenta l'intero intento.
Coda
si interrompeIl vero contesto arriva con una persona.
Modelli personalizzati
Primi sistemi di AI
I sistemi capivano percorsi ristretti, poi andavano in pezzi.
I team addestravano modelli acustici, classificatori di intenti ed estrattori di slot per flussi di chiamata specifici. Utili, ma costosi da modificare.
Momento goffo
Il sistema può cogliere un intento per cui è stato addestrato, poi ignorare la seconda richiesta o porre una domanda di follow-up rigida.
Chiamata di esempio
Primi sistemi di AI
Chiamante
"Può spostare l'appuntamento di domani e aggiungere il mio coniuge?"
Sistema
"Posso aiutarla a riprogrammare. Quale data preferisce?"
Risultato
Il dettaglio sul coniuge va perso perché non è previsto nel flusso addestrato.
Come pensa il sistema
3 fasiASR personalizzato
correttoOttimizzato per un settore e un mix di accenti.
Modello di intenti
fragileClassifica la richiesta nota più vicina.
Compilazione degli slot
si interrompeI campi mancanti attivano una correzione da copione.
Stack in stile Vapi / Retell / ElevenLabs
Pipeline in 3 fasi
Lo stack è diventato flessibile, ma ogni fase si fidava della precedente.
Un modello moderno diffuso collega la conversione da voce a testo, un LLM e la conversione da testo a voce in un unico ciclo di chiamata.
Momento goffo
Quando la trascrizione è errata o il chiamante interrompe, l'LLM fornisce con sicurezza una risposta sbagliata al chiamante.
Chiamata di esempio
Pipeline in 3 fasi
Chiamante
"No, sono in affitto."
Sistema
"Capito, è una proprietà con ranch. È corretto?"
Risultato
Un singolo errore di ascolto si trasforma in un errore nella risposta vocale.
Come pensa il sistema
3 fasiDa voce a testo
si interrompeUna trascrizione diventa la fonte di riferimento.
LLM
fragileGenera dal testo, non dall'audio originale.
Da testo a voce
si interrompeRipete la risposta con sicurezza.
IA vocale integrata
ThunderPhone
Il sistema può ascoltare, ragionare e recuperare in un unico ciclo.
ThunderPhone coordina comprensione dell'audio, instradamento dei modelli, gestione dei turni conversazionali e generazione delle risposte in un'unica architettura.
Cosa cambia
Molteplici percorsi di ascolto e un ragionamento che tiene conto dell'audio riducono gli errori in un singolo passaggio prima che raggiungano il chiamante.
Chiamata di esempio
ThunderPhone
Chiamante
"No, sono in affitto."
Sistema
"Capito. È in affitto, quindi salterò le domande sulla proprietà."
Risultato
La chiamata procede senza costringere il chiamante a lottare con il sistema.
Come pensa il sistema
4 fasiFlusso audio
verificaL'audio grezzo resta disponibile per il ragionamento.
Ascolto ridondante
verificaI segnali vengono confrontati prima di agire.
Instradamento dei modelli
verificaPercorsi rapidi e approfonditi collaborano a ogni turno.
Risposta naturale
verificaIl chiamante ascolta il contesto corretto.
Dove porta tutto questo
La svolta non è una voce robotica più gradevole. È un'architettura che mantiene la chiamata sulla giusta rotta.
Ascolto migliore
Il sistema può confrontare i segnali e ragionare sull'audio invece di fidarsi di una sola trascrizione.
Tempistica migliore
L'alternanza dei turni e la gestione delle interruzioni fanno parte del ciclo della conversazione.
Instradamento migliore
Percorsi rapidi e ragionamenti più approfonditi possono essere selezionati in base alle esigenze di ogni turno conversazionale.
Esperienza migliore
Chi chiama passa meno tempo a correggere l'automazione e più tempo a completare l'attività.