De fleste automatiserte telefonsamtaler suger. Ny teknologi endrer på det.
Problemet med tradisjonell telefonautomatisering var ikke at den manglet en behagelig stemme. Den manglet forståelsen som skulle til for å holde en ekte samtale i gang.
Telefonsamtalen blir enklere å automatisere.
For hver generasjon håndterer systemet mer av konteksten.
Innringeren måtte snakke maskinens språk.
Automatisering besto av menyer, tastevalg og køer. Det fungerte så lenge innringeren allerede visste hvilke valg som var riktige.
Hele behovet reduseres til ett tastetrykk. Alt som ikke finnes i menyen, ender derfor med viderekobling eller at innringeren må gjenta seg.
Resultat · Innringeren må gjette, vente og forklare det samme på nytt.
Systemene forsto avgrensede samtaleløp – og falt sammen utenfor dem.
Utviklingsteam trente opp akustiske modeller, intensjonsklassifikatorer og feltuttrekkere for bestemte samtaleflyter. Løsningene var nyttige, men kostbare å endre.
Systemet kan fange opp én type henvendelse det er trent på, men overser den andre forespørselen eller stiller et fastlåst oppfølgingsspørsmål.
Resultat · Opplysningen om ektefellen går tapt fordi den ikke er en del av flyten systemet er trent på.
Teknologistakken ble mer fleksibel, men hvert trinn stolte på det forrige.
Et vanlig moderne oppsett kobler tale-til-tekst, en LLM og tekst-til-tale i én samtalesløyfe.
Når transkripsjonen er feil, eller innringeren avbryter, gir LLM-en et selvsikkert svar på feil grunnlag.
Resultat · Én feil i lydtolkningen blir til en feil som leses opp.
Systemet kan høre, resonnere og rette opp feil i én sløyfe.
ThunderPhone koordinerer lydforståelse, modellruting, turtaking og svargenerering i én samlet arkitektur.
Flere parallelle lyttebaner og resonnering basert på selve lyden reduserer feil i enkelttrinn før de når innringeren.
Resultat · Samtalen går videre uten at innringeren må kjempe mot systemet.
Gjennombruddet er ikke en robotstemme som låter bedre. Det er arkitekturen som holder samtalen på rett spor.
Bedre taleforståelse
Systemet kan sammenligne signaler og resonnere ut fra lyd i stedet for å stole på én enkelt transkripsjon.
Bedre timing
Turtaking og håndtering av avbrytelser er en del av samtalesløyfen.
Bedre ruting
For hver replikk kan systemet velge mellom raske behandlingsløp og grundigere resonnering ut fra hva som trengs.
Bedre opplevelse
De som ringer, bruker mindre tid på å rette opp i automatiseringen og mer tid på å få løst oppgaven.