Generacje głosowej AI

Większość zautomatyzowanych rozmów telefonicznych jest kiepska. Nowa technologia to zmienia.

Stary problem nie polegał na tym, że automatyzacji telefonicznej brakowało przyjemnego głosu. Brakowało jej wystarczającego zrozumienia, by prowadzić prawdziwą rozmowę.

Drzewa telefoniczne

Era IVR

Rozmówca musiał mówić językiem maszyny.

Automatyzacja oznaczała menu, wybory z klawiatury i kolejki. Działała, gdy rozmówca już znał właściwą ścieżkę.

Niezręczny moment

Intencja zostaje sprowadzona do naciśnięcia przycisku, więc wszystko poza menu kończy się przekierowaniem lub powtórzeniem.

Przykładowa rozmowa

Era IVR

Rozmówca

"Muszę przełożyć jutrzejszą wizytę."

System

"W sprawach rozliczeń naciśnij 1. Aby umówić wizytę, naciśnij 2. W przypadku wszystkich pozostałych pytań naciśnij 9."

Rezultat

Rozmówca zgaduje, czeka i ponownie wyjaśnia to samo.

Jak myśli system

3 etapów

Komunikat menu

naprawione

Stały skrypt przedstawia dostępne opcje.

Gałąź DTMF

niestabilne

Jeden przycisk określa całą intencję.

Kolejka

awarie

Prawdziwy kontekst pojawia się dopiero przy rozmowie z człowiekiem.

Niestandardowe modele

Wczesna AI

Systemy rozumiały wąskie scenariusze, a potem się rozpadały.

Zespoły trenowały modele akustyczne, klasyfikatory intencji i ekstraktory pól dla konkretnych scenariuszy rozmów. Przydatne, ale kosztowne w zmianie.

Niezręczny moment

System potrafi rozpoznać jedną wytrenowaną intencję, a następnie pominąć drugą prośbę lub zadać sztywne pytanie uzupełniające.

Przykładowa rozmowa

Wczesna AI

Rozmówca

"Czy możesz przełożyć jutrzejszą wizytę i dodać mojego współmałżonka?"

System

"Mogę pomóc w przełożeniu wizyty. Jaki termin wybierasz?"

Rezultat

Informacja o współmałżonku zostaje pominięta, ponieważ nie ma jej w wytrenowanym scenariuszu.

Jak myśli system

3 etapów

Niestandardowy ASR

naprawione

Dostosowany do danej branży i różnych akcentów.

Model intencji

niestabilne

Klasyfikuje najbliższą znaną prośbę.

Wypełnianie pól

awarie

Brakujące pola uruchamiają skryptowane uzupełnienie.

Stosy w stylu Vapi / Retell / ElevenLabs

Procesy 3-etapowe

Stos stał się elastyczny, ale każdy etap ufał poprzedniemu.

Typowy nowoczesny wzorzec łączy rozpoznawanie mowy, LLM i syntezę mowy w jedną pętlę rozmowy.

Niezręczny moment

Gdy transkrypcja jest błędna lub rozmówca przerywa, LLM z przekonaniem odpowiada na niewłaściwe zgłoszenie.

Przykładowa rozmowa

Procesy 3-etapowe

Rozmówca

"Nie, „I rent the place.”"

System

"Rozumiem, to nieruchomość ranczerska. Czy tak?"

Rezultat

Pojedynczy błąd rozpoznania zamienia się w błąd w wypowiedzi.

Jak myśli system

3 etapów

Mowa na tekst

awarie

Jedna transkrypcja staje się źródłem prawdy.

LLM

niestabilne

Generuje na podstawie tekstu, a nie oryginalnego dźwięku.

Tekst na mowę

awarie

Pewnie wypowiada odpowiedź.

Zintegrowana głosowa AI

ThunderPhone

System może słuchać, rozumować i korygować się w jednej pętli.

ThunderPhone koordynuje rozumienie dźwięku, routing modeli, zmianę tur i generowanie odpowiedzi jako jedną architekturę.

Co się zmienia

Wiele ścieżek nasłuchiwania i rozumowanie uwzględniające dźwięk ograniczają błędy pojedynczego etapu, zanim dotrą do rozmówcy.

Przykładowa rozmowa

ThunderPhone

Rozmówca

"Nie, „I rent the place.”"

System

"Rozumiem. Wynajmujesz swój dom, więc pominę pytania o własność."

Rezultat

Rozmowa toczy się dalej, bez zmuszania rozmówcy do walki z systemem.

Jak myśli system

4 etapów

Strumień audio

kontrole

Surowy dźwięk pozostaje dostępny do rozumowania.

Nadmiarowe rozpoznawanie

kontrole

Sygnały są porównywane przed podjęciem działania.

Routing modeli

kontrole

Szybkie i bardziej zaawansowane ścieżki współpracują na zmianę.

Naturalna odpowiedź

kontrole

Rozmówca słyszy poprawiony kontekst.

Co to daje

Przełomem nie jest ładniejszy głos robota. Jest nim architektura, która utrzymuje rozmowę na właściwym torze.

Lepsze rozumienie

System może porównywać sygnały i analizować dźwięk, zamiast ufać jednemu transkryptowi.

Lepsze wyczucie czasu

Naprzemienność wypowiedzi i obsługa przerwań są częścią pętli rozmowy.

Lepsze przekierowywanie

Szybkie ścieżki i bardziej pogłębione rozumowanie można dobierać do potrzeb każdej wymiany.

Lepsze doświadczenie

Rozmówcy poświęcają mniej czasu na poprawianie automatyzacji, a więcej na wykonanie zadania.