Generationer av röst-AI
De flesta automatiserade telefonsamtal är usla. Ny teknik förändrar det.
Det gamla problemet var inte att telefonautomation saknade en behaglig röst. Den saknade tillräcklig förståelse för att hålla ett riktigt samtal igång.
Ett telefonsamtal blir enklare att automatisera
Varje generation flyttar mer kontext in i maskinen.
Telefonträd
IVR-eran
Uppringaren var tvungen att prata maskinspråk.
Automation innebar menyer, knappvalsgrenar och köer. Det fungerade när uppringaren redan visste rätt väg.
Klumligt ögonblick
Avsikten komprimeras till ett knapptryck, så allt utanför menyn blir en vidarekoppling eller en upprepning.
Exempelsamtal
IVR-eran
Uppringare
"Jag behöver flytta morgondagens bokning."
System
"För fakturering, tryck 1. För bokning, tryck 2. För alla andra frågor, tryck 9."
Resultat
Uppringaren gissar, väntar och förklarar samma sak igen.
Så tänker systemet
3 stegMenyuppmaning
åtgärdadeEtt fast manus listar alternativen.
DTMF-gren
instabilaEn knapp blir hela avsikten.
Kö
avbrottDet verkliga sammanhanget kommer först med en människa.
Anpassade modeller
Tidig AI
Systemen förstod smala spår och föll sedan isär.
Team tränade akustiska modeller, avsiktsklassificerare och fältextraherare för specifika samtalsflöden. Användbart, men dyrt att ändra.
Klumligt ögonblick
Systemet kan fånga en tränad avsikt, men tappar sedan den andra förfrågan eller ställer en stel följdfråga.
Exempelsamtal
Tidig AI
Uppringare
"Kan du flytta morgondagens bokning och lägga till min partner?"
System
"Jag kan hjälpa dig att boka om. Vilket datum vill du ha?"
Resultat
Uppgiften om partnern går förlorad eftersom den inte finns i det tränade flödet.
Så tänker systemet
3 stegAnpassad ASR
åtgärdadeAnpassad för en viss domän och blandning av dialekter.
Avsiktsmodell
instabilaKlassificerar den närmaste kända förfrågan.
Fältifyllnad
avbrottSaknade fält utlöser skriptad korrigering.
Stackar i stil med Vapi / Retell / ElevenLabs
Pipelines i tre steg
Stacken blev flexibel, men varje steg litade på det föregående.
Ett vanligt modernt upplägg kopplar ihop tal-till-text, en LLM och text-till-tal i ett enda samtalsflöde.
Klumligt ögonblick
När transkriberingen är fel eller uppringaren avbryter svarar LLM:en självsäkert på fel samtal.
Exempelsamtal
Pipelines i tre steg
Uppringare
"Nej, jag hyr bostaden."
System
"Jag förstår, det är en ranchfastighet. Stämmer det?"
Resultat
Ett enda hörfel blir till ett fel i det som sägs.
Så tänker systemet
3 stegTal till text
avbrottEn enda transkribering blir den enda sanningskällan.
LLM
instabilaGenererar från text, inte från originalljudet.
Text till tal
avbrottSäger svaret med självförtroende.
Integrerad röst-AI
ThunderPhone
Systemet kan höra, resonera och återhämta sig i en och samma loop.
ThunderPhone samordnar ljudförståelse, modellroutning, turordning och svarsgenerering i en och samma arkitektur.
Vad som förändras
Flera lyssningsvägar och ljudmedvetet resonemang minskar fel i enskilda steg innan de når uppringaren.
Exempelsamtal
ThunderPhone
Uppringare
"Nej, jag hyr bostaden."
System
"Jag förstår. Du hyr din bostad, så jag hoppar över frågor om ägande."
Resultat
Samtalet går framåt utan att uppringaren behöver kämpa mot systemet.
Så tänker systemet
4 stegLjudström
kontrollerRåljudet är tillgängligt för att systemet ska kunna resonera.
Parallell lyssning
kontrollerSignaler jämförs innan något görs.
Modellroutning
kontrollerSnabba och djupare vägar samverkar tur för tur.
Naturligt svar
kontrollerUppringaren får höra det korrigerade sammanhanget.
Vad det leder till
Genombrottet är inte en snyggare robotröst. Det är en arkitektur som håller samtalet på rätt spår.
Bättre hörsel
Systemet kan jämföra signaler och resonera utifrån ljudet i stället för att lita på en enda transkription.
Bättre tajming
Turtagning och hantering av avbrott är en del av samtalsflödet.
Bättre dirigering
Snabba vägar och djupare resonemang kan väljas utifrån behoven i varje samtalstur.
Bättre upplevelse
Uppringare lägger mindre tid på att rätta automatiseringen och mer tid på att slutföra uppgiften.