Generasjoner av stemme-AI
De fleste automatiserte telefonsamtaler er elendige. Ny teknologi endrer det.
Det gamle problemet var ikke at telefonautomatisering manglet en behagelig stemme. Den manglet nok forståelse til å holde en ekte samtale i gang.
En telefonsamtale blir enklere å automatisere
Hver generasjon flytter mer kontekst inn i maskinen.
Telefonstrukturer
IVR-æraen
Innringeren måtte snakke maskinspråk.
Automatisering betydde menyer, tastevalg og køer. Det fungerte når innringeren allerede kjente riktig vei.
Klumsete øyeblikk
Hensikten presses inn i et tastetrykk, så alt utenfor menyen blir en viderekobling eller en gjentakelse.
Eksempelsamtale
IVR-æraen
Innringer
"Jeg må flytte morgendagens avtale."
System
"For fakturering, tast 1. For timebestilling, tast 2. For alle andre spørsmål, tast 9."
Resultat
Innringeren gjetter, venter og forklarer det samme på nytt.
Slik tenker systemet
3 stadierMenyvalg
løstEt fast manus lister opp alternativene.
DTMF-gren
skjørÉn tast blir hele hensikten.
Kø
feilerDen egentlige konteksten kommer først med et menneske.
Tilpassede modeller
Tidlig KI
Systemene forsto smale spor, og falt deretter fra hverandre.
Team trente akustiske modeller, hensiktsklassifiserere og feltuttrekkere for bestemte samtaleflyter. Nyttig, men kostbart å endre.
Klumsete øyeblikk
Systemet kan fange opp én trent hensikt, men mister deretter den andre forespørselen eller stiller et rigid oppfølgingsspørsmål.
Eksempelsamtale
Tidlig KI
Innringer
"Kan du flytte morgendagens avtale og legge til ektefellen min?"
System
"Jeg kan hjelpe med å flytte avtalen. Hvilken dato ønsker du?"
Resultat
Opplysningen om ektefellen går tapt fordi den ikke finnes i det trente flyten.
Slik tenker systemet
3 stadierTilpasset ASR
løstTilpasset et domene og en blanding av aksenter.
Hensiktsmodell
skjørKlassifiserer den nærmeste kjente forespørselen.
Feltutfylling
feilerManglende felt utløser skriptet korrigering.
Stakker i stil med Vapi / Retell / ElevenLabs
3-trinns pipelines
Stacken ble fleksibel, men hvert trinn stolte på det forrige.
Et vanlig moderne mønster kobler tale-til-tekst, en LLM og tekst-til-tale i én samtalesløyfe.
Klumsete øyeblikk
Når transkripsjonen er feil eller innringeren avbryter, svarer LLM-en selvsikkert på feil henvendelse.
Eksempelsamtale
3-trinns pipelines
Innringer
"Nei, jeg leier stedet."
System
"Skjønner, det er en ranch-eiendom. Stemmer det?"
Resultat
En enkelt feiloppfatning blir til en muntlig feil.
Slik tenker systemet
3 stadierTale til tekst
feilerÉn transkripsjon blir den eneste sannhetskilden.
LLM
skjørGenererer fra tekst, ikke fra den opprinnelige lyden.
Tekst til tale
feilerSier svaret tilbake med selvtillit.
Integrert stemme-AI
ThunderPhone
Systemet kan høre, resonnere og gjenopprette i én sløyfe.
ThunderPhone samordner lydforståelse, modellruting, turveksling og svarproduksjon i én arkitektur.
Hva som endres
Flere lyttebaner og lydbevisst resonnering reduserer feil i enkelttrinn før de når innringeren.
Eksempelsamtale
ThunderPhone
Innringer
"Nei, jeg leier stedet."
System
"Skjønner. Du leier boligen din, så jeg hopper over spørsmål om eierskap."
Resultat
Samtalen går videre uten at innringeren må kjempe mot systemet.
Slik tenker systemet
4 stadierLydstrøm
bestårRålyd forblir tilgjengelig for resonnering.
Redundant lytting
bestårSignaler sammenlignes før handling.
Modellruting
bestårRaske og dypere baner samarbeider i hver tur.
Naturlig svar
bestårInnringeren hører den korrigerte konteksten.
Hva dette betyr
Gjennombruddet er ikke en penere robotstemme. Det er en arkitektur som holder samtalen på sporet.
Bedre lytting
Systemet kan sammenligne signaler og resonnere over lyd i stedet for å stole på én transkripsjon.
Bedre timing
Turtaking og håndtering av avbrytelser er en del av samtalesløyfen.
Bedre ruting
Raske veier og dypere resonnering kan velges ut fra behovene i hver replikkveksling.
Bedre opplevelse
Innringere bruker mindre tid på å rette opp automasjonen og mer tid på å fullføre oppgaven.