Generasjoner av stemme-AI

De fleste automatiserte telefonsamtaler er elendige. Ny teknologi endrer det.

Det gamle problemet var ikke at telefonautomatisering manglet en behagelig stemme. Den manglet nok forståelse til å holde en ekte samtale i gang.

Telefonstrukturer

IVR-æraen

Innringeren måtte snakke maskinspråk.

Automatisering betydde menyer, tastevalg og køer. Det fungerte når innringeren allerede kjente riktig vei.

Klumsete øyeblikk

Hensikten presses inn i et tastetrykk, så alt utenfor menyen blir en viderekobling eller en gjentakelse.

Eksempelsamtale

IVR-æraen

Innringer

"Jeg må flytte morgendagens avtale."

System

"For fakturering, tast 1. For timebestilling, tast 2. For alle andre spørsmål, tast 9."

Resultat

Innringeren gjetter, venter og forklarer det samme på nytt.

Slik tenker systemet

3 stadier

Menyvalg

løst

Et fast manus lister opp alternativene.

DTMF-gren

skjør

Én tast blir hele hensikten.

feiler

Den egentlige konteksten kommer først med et menneske.

Tilpassede modeller

Tidlig KI

Systemene forsto smale spor, og falt deretter fra hverandre.

Team trente akustiske modeller, hensiktsklassifiserere og feltuttrekkere for bestemte samtaleflyter. Nyttig, men kostbart å endre.

Klumsete øyeblikk

Systemet kan fange opp én trent hensikt, men mister deretter den andre forespørselen eller stiller et rigid oppfølgingsspørsmål.

Eksempelsamtale

Tidlig KI

Innringer

"Kan du flytte morgendagens avtale og legge til ektefellen min?"

System

"Jeg kan hjelpe med å flytte avtalen. Hvilken dato ønsker du?"

Resultat

Opplysningen om ektefellen går tapt fordi den ikke finnes i det trente flyten.

Slik tenker systemet

3 stadier

Tilpasset ASR

løst

Tilpasset et domene og en blanding av aksenter.

Hensiktsmodell

skjør

Klassifiserer den nærmeste kjente forespørselen.

Feltutfylling

feiler

Manglende felt utløser skriptet korrigering.

Stakker i stil med Vapi / Retell / ElevenLabs

3-trinns pipelines

Stacken ble fleksibel, men hvert trinn stolte på det forrige.

Et vanlig moderne mønster kobler tale-til-tekst, en LLM og tekst-til-tale i én samtalesløyfe.

Klumsete øyeblikk

Når transkripsjonen er feil eller innringeren avbryter, svarer LLM-en selvsikkert på feil henvendelse.

Eksempelsamtale

3-trinns pipelines

Innringer

"Nei, jeg leier stedet."

System

"Skjønner, det er en ranch-eiendom. Stemmer det?"

Resultat

En enkelt feiloppfatning blir til en muntlig feil.

Slik tenker systemet

3 stadier

Tale til tekst

feiler

Én transkripsjon blir den eneste sannhetskilden.

LLM

skjør

Genererer fra tekst, ikke fra den opprinnelige lyden.

Tekst til tale

feiler

Sier svaret tilbake med selvtillit.

Integrert stemme-AI

ThunderPhone

Systemet kan høre, resonnere og gjenopprette i én sløyfe.

ThunderPhone samordner lydforståelse, modellruting, turveksling og svarproduksjon i én arkitektur.

Hva som endres

Flere lyttebaner og lydbevisst resonnering reduserer feil i enkelttrinn før de når innringeren.

Eksempelsamtale

ThunderPhone

Innringer

"Nei, jeg leier stedet."

System

"Skjønner. Du leier boligen din, så jeg hopper over spørsmål om eierskap."

Resultat

Samtalen går videre uten at innringeren må kjempe mot systemet.

Slik tenker systemet

4 stadier

Lydstrøm

består

Rålyd forblir tilgjengelig for resonnering.

Redundant lytting

består

Signaler sammenlignes før handling.

Modellruting

består

Raske og dypere baner samarbeider i hver tur.

Naturlig svar

består

Innringeren hører den korrigerte konteksten.

Hva dette betyr

Gjennombruddet er ikke en penere robotstemme. Det er en arkitektur som holder samtalen på sporet.

Bedre lytting

Systemet kan sammenligne signaler og resonnere over lyd i stedet for å stole på én transkripsjon.

Bedre timing

Turtaking og håndtering av avbrytelser er en del av samtalesløyfen.

Bedre ruting

Raske veier og dypere resonnering kan velges ut fra behovene i hver replikkveksling.

Bedre opplevelse

Innringere bruker mindre tid på å rette opp automasjonen og mer tid på å fullføre oppgaven.