Generace hlasové AI
Většina automatizovaných telefonátů je k ničemu. Nová technologie to mění.
Původním problémem nebylo, že telefonní automatizace postrádala příjemný hlas. Chyběla jí dostatečná schopnost porozumění, aby dokázala vést skutečný rozhovor.
Telefonát se automatizuje snáz
Každá generace přenáší do systému více kontextu.
Telefonní stromy
Éra IVR
Volající se musel přizpůsobit stroji.
Automatizace znamenala nabídky, větvení podle kláves a fronty. Fungovala, když volající už znal správnou cestu.
Nešikovný okamžik
Záměr se zúží na stisknutí tlačítka, takže vše mimo nabídku končí přepojením nebo opakováním.
Ukázkový hovor
Éra IVR
Volající
"Potřebuji přesunout zítřejší termín."
Systém
"Pro fakturaci stiskněte 1. Pro objednání termínu stiskněte 2. Pro všechny ostatní dotazy stiskněte 9."
Výsledek
Volající hádá, čeká a znovu vysvětluje totéž.
Jak systém uvažuje
3 fázíHlasová nabídka
opravenoPevný scénář vypisuje možnosti.
Větev DTMF
nestabilníJedno tlačítko představuje celý záměr.
Fronta
selháváSkutečný kontext přichází až s člověkem.
Vlastní modely
Počátky AI
Systémy rozuměly úzkým scénářům, pak se rozpadly.
Týmy trénovaly akustické modely, klasifikátory záměrů a extraktory parametrů pro konkrétní scénáře hovorů. Užitečné, ale nákladné na změny.
Nešikovný okamžik
Systém dokáže zachytit jeden naučený záměr, ale druhý požadavek pak přehlédne nebo se zeptá příliš strnule.
Ukázkový hovor
Počátky AI
Volající
"Můžete přesunout zítřejší termín a přidat i mého partnera?"
Systém
"Mohu vám pomoci termín přeobjednat. Jaké datum byste si přál(a)?"
Výsledek
Informace o partnerovi se ztratí, protože není součástí naučeného postupu.
Jak systém uvažuje
3 fázíVlastní ASR
opravenoVyladěné pro konkrétní obor a kombinaci přízvuků.
Model záměrů
nestabilníKlasifikuje nejbližší známý požadavek.
Doplňování parametrů
selháváChybějící údaje spouštějí předem napsané doplnění.
Sestavy typu Vapi / Retell / ElevenLabs
Třístupňové pipeline
Technologie se stala flexibilní, ale každý krok důvěřoval předchozímu.
Běžný moderní přístup propojuje převod řeči na text, LLM a převod textu na řeč do jedné smyčky hovoru.
Nešikovný okamžik
Když je přepis chybný nebo volající přeruší systém, LLM sebejistě odpoví na základě chybného pochopení hovoru.
Ukázkový hovor
Třístupňové pipeline
Volající
"Ne, ten byt mám v nájmu."
Systém
"Rozumím, jde o nemovitost typu ranč. Je to správně?"
Výsledek
Jediná chyba při rozpoznání se změní v chybu ve vyslovené odpovědi.
Jak systém uvažuje
3 fázíPřevod řeči na text
selháváJeden přepis se stává jediným zdrojem pravdy.
LLM
nestabilníGeneruje z textu, ne z původního zvuku.
Převod textu na řeč
selháváSebejistě sdělí odpověď.
Integrovaná hlasová AI
ThunderPhone
Systém dokáže naslouchat, uvažovat a zotavit se v jedné smyčce.
ThunderPhone koordinuje porozumění zvuku, směrování modelů, střídání tahů a generování odpovědí v jedné architektuře.
Co se mění
Více cest naslouchání a uvažování pracující se zvukem snižují selhání v jednotlivých krocích dříve, než se dostanou k volajícímu.
Ukázkový hovor
ThunderPhone
Volající
"Ne, ten byt mám v nájmu."
Systém
"Rozumím. Bydlíte v pronájmu, takže přeskočím otázky na vlastnictví."
Výsledek
Hovor pokračuje bez toho, aby volající musel bojovat se systémem.
Jak systém uvažuje
4 fázíZvukový stream
v pořádkuPůvodní zvuk zůstává k dispozici pro uvažování.
Redundantní rozpoznávání
v pořádkuSignály se před akcí porovnávají.
Směrování modelů
v pořádkuRychlé i hlubší cesty spolupracují v každém tahu.
Přirozená odpověď
v pořádkuVolající slyší opravený kontext.
Co to přináší
Průlomem není hezčí robotický hlas. Je jím architektura, která udrží hovor ve správném směru.
Lepší porozumění zvuku
Systém dokáže porovnávat signály a vyhodnocovat zvuk místo toho, aby důvěřoval jedinému přepisu.
Lepší načasování
Střídání v hovoru a práce s přerušováním jsou součástí konverzačního cyklu.
Lepší směrování
Rychlé postupy i hlubší uvažování lze volit podle potřeb každé repliky.
Lepší zkušenost
Volající tráví méně času opravováním automatizace a více času dokončením úkolu.