Generazioni di IA vocale

La maggior parte delle chiamate telefoniche automatizzate fa schifo. Le nuove tecnologie cambiano tutto.

Il vecchio problema non era che l'automazione telefonica non avesse una voce gradevole. Non capiva abbastanza da mantenere viva una conversazione reale.

Alberi telefonici

Era IVR

Il chiamante doveva parlare come una macchina.

Per automazione si intendevano menu, diramazioni da tastierino e code. Funzionava quando il chiamante conosceva già il percorso giusto.

Momento goffo

L'intento viene ridotto alla pressione di un tasto, quindi tutto ciò che è fuori dal menu diventa un trasferimento o una ripetizione.

Chiamata di esempio

Era IVR

Chiamante

"Devo spostare l'appuntamento di domani."

Sistema

"Per la fatturazione, prema 1. Per gli appuntamenti, prema 2. Per tutte le altre domande, prema 9."

Risultato

Il chiamante prova a indovinare, aspetta e spiega di nuovo la stessa cosa.

Come pensa il sistema

3 fasi

Prompt del menu

corretto

Un copione fisso elenca le opzioni.

Ramo DTMF

fragile

Un tasto rappresenta l'intero intento.

Coda

si interrompe

Il vero contesto arriva con una persona.

Modelli personalizzati

Primi sistemi di AI

I sistemi capivano percorsi ristretti, poi andavano in pezzi.

I team addestravano modelli acustici, classificatori di intenti ed estrattori di slot per flussi di chiamata specifici. Utili, ma costosi da modificare.

Momento goffo

Il sistema può cogliere un intento per cui è stato addestrato, poi ignorare la seconda richiesta o porre una domanda di follow-up rigida.

Chiamata di esempio

Primi sistemi di AI

Chiamante

"Può spostare l'appuntamento di domani e aggiungere il mio coniuge?"

Sistema

"Posso aiutarla a riprogrammare. Quale data preferisce?"

Risultato

Il dettaglio sul coniuge va perso perché non è previsto nel flusso addestrato.

Come pensa il sistema

3 fasi

ASR personalizzato

corretto

Ottimizzato per un settore e un mix di accenti.

Modello di intenti

fragile

Classifica la richiesta nota più vicina.

Compilazione degli slot

si interrompe

I campi mancanti attivano una correzione da copione.

Stack in stile Vapi / Retell / ElevenLabs

Pipeline in 3 fasi

Lo stack è diventato flessibile, ma ogni fase si fidava della precedente.

Un modello moderno diffuso collega la conversione da voce a testo, un LLM e la conversione da testo a voce in un unico ciclo di chiamata.

Momento goffo

Quando la trascrizione è errata o il chiamante interrompe, l'LLM fornisce con sicurezza una risposta sbagliata al chiamante.

Chiamata di esempio

Pipeline in 3 fasi

Chiamante

"No, sono in affitto."

Sistema

"Capito, è una proprietà con ranch. È corretto?"

Risultato

Un singolo errore di ascolto si trasforma in un errore nella risposta vocale.

Come pensa il sistema

3 fasi

Da voce a testo

si interrompe

Una trascrizione diventa la fonte di riferimento.

LLM

fragile

Genera dal testo, non dall'audio originale.

Da testo a voce

si interrompe

Ripete la risposta con sicurezza.

IA vocale integrata

ThunderPhone

Il sistema può ascoltare, ragionare e recuperare in un unico ciclo.

ThunderPhone coordina comprensione dell'audio, instradamento dei modelli, gestione dei turni conversazionali e generazione delle risposte in un'unica architettura.

Cosa cambia

Molteplici percorsi di ascolto e un ragionamento che tiene conto dell'audio riducono gli errori in un singolo passaggio prima che raggiungano il chiamante.

Chiamata di esempio

ThunderPhone

Chiamante

"No, sono in affitto."

Sistema

"Capito. È in affitto, quindi salterò le domande sulla proprietà."

Risultato

La chiamata procede senza costringere il chiamante a lottare con il sistema.

Come pensa il sistema

4 fasi

Flusso audio

verifica

L'audio grezzo resta disponibile per il ragionamento.

Ascolto ridondante

verifica

I segnali vengono confrontati prima di agire.

Instradamento dei modelli

verifica

Percorsi rapidi e approfonditi collaborano a ogni turno.

Risposta naturale

verifica

Il chiamante ascolta il contesto corretto.

Dove porta tutto questo

La svolta non è una voce robotica più gradevole. È un'architettura che mantiene la chiamata sulla giusta rotta.

Ascolto migliore

Il sistema può confrontare i segnali e ragionare sull'audio invece di fidarsi di una sola trascrizione.

Tempistica migliore

L'alternanza dei turni e la gestione delle interruzioni fanno parte del ciclo della conversazione.

Instradamento migliore

Percorsi rapidi e ragionamenti più approfonditi possono essere selezionati in base alle esigenze di ogni turno conversazionale.

Esperienza migliore

Chi chiama passa meno tempo a correggere l'automazione e più tempo a completare l'attività.