De flesta automatiserade telefonsamtal är usla. Ny teknik ändrar på det.
Problemet med äldre telefonautomation var inte avsaknaden av en behaglig röst. Det var att förståelsen inte räckte till för att hålla ett riktigt samtal igång.
Ett telefonsamtal blir allt enklare att automatisera.
För varje generation kan maskinen hantera mer av kontexten.
Den som ringde tvingades prata på maskinens villkor.
02Tidig AISystemen förstod bara smala, förutbestämda flöden – sedan föll allt.
03Pipelines i 3 stegStacken blev flexibel, men varje steg litade blint på det föregående.
04ThunderPhoneSystemet kan lyssna, resonera och rätta till fel i en och samma loop.
Den som ringde tvingades prata på maskinens villkor.
Automatisering innebar menyer, knappval och köer. Det fungerade när den som ringde redan visste rätt väg genom systemet.
Den som ringer måste koka ned sin avsikt till ett enda knapptryck. Allt som inte finns i menyn leder därför till vidarekoppling eller till att allt måste tas om.
Resultat · Den som ringer måste gissa, vänta och förklara samma sak igen.
Systemen förstod bara smala, förutbestämda flöden – sedan föll allt.
Team tränade akustiska modeller, avsiktsklassificerare och fältextraktorer för specifika samtalsflöden. Användbart, men dyrt att ändra.
Systemet kan identifiera en avsikt som det tränats för, men missar sedan den andra begäran eller ställer en stelbent följdfråga.
Resultat · Uppgiften om partnern går förlorad eftersom flödet inte har tränats för den.
Stacken blev flexibel, men varje steg litade blint på det föregående.
Ett vanligt modernt upplägg kopplar ihop tal till text, en LLM och text till tal i en enda samtalsloop.
När transkriberingen är fel eller den som ringer avbryter ger LLM:en tvärsäkert fel svar.
Resultat · Ett enda hörfel blir ett fel i det talade svaret.
Systemet kan lyssna, resonera och rätta till fel i en och samma loop.
ThunderPhone samordnar ljudförståelse, modellrouting, turtagning och svarsgenerering i en sammanhållen arkitektur.
Flera lyssningsspår och resonemang som utgår från själva ljudet gör att färre fel i enskilda steg når den som ringer.
Resultat · Samtalet går framåt utan att den som ringer behöver kämpa mot systemet.
Genombrottet ligger inte i en behagligare robotröst, utan i en arkitektur som håller samtalet på rätt spår.
Bättre hörförmåga
Systemet kan jämföra signaler och resonera utifrån ljudet i stället för att förlita sig på en enda transkribering.
Bättre tajming
Turtagning och hantering av avbrott ingår i själva samtalsloopen.
Bättre dirigering
För varje replik kan systemet välja snabbspår eller djupare resonemang utifrån vad som behövs.
Bättre upplevelse
Den som ringer lägger mindre tid på att korrigera automatiken och mer på att slutföra sitt ärende.