Lielākā daļa automatizēto zvanu ir briesmīgi. Jaunā tehnoloģija to maina.
Līdzšinējo zvanu automatizācijas risinājumu problēma nebija patīkamas balss trūkums. Tiem trūka pietiekamas izpratnes, lai uzturētu pilnvērtīgu sarunu.
Tālruņa sarunu kļūst arvien vieglāk automatizēt.
Ar katru paaudzi arvien vairāk konteksta nonāk sistēmas pārziņā.
Zvanītājam bija jārunā sistēmas valodā.
02MI pirmsākumiSistēmas tika galā tikai ar šauri definētiem scenārijiem — ārpus tiem tās apjuka.
033 posmu apstrādes ķēdesArhitektūra kļuva elastīgāka, taču katrs posms paļāvās uz iepriekšējo.
04ThunderPhoneSistēma spēj sadzirdēt, spriest un izlabot kļūdu vienā ciklā.
Zvanītājam bija jārunā sistēmas valodā.
Automatizācija nozīmēja izvēlnes, izvēles ar tālruņa taustiņiem un gaidīšanas rindas. Tā darbojās, ja zvanītājs jau zināja pareizo ceļu.
Zvanītāja nolūks jāietilpina vienas pogas nospiedienā, tāpēc jebkas ārpus izvēlnes beidzas ar pāradresāciju vai atkārtotu skaidrošanu.
Rezultāts · Zvanītājs mēģina uzminēt pareizo izvēli, gaida un pēc tam visu skaidro no jauna.
Sistēmas tika galā tikai ar šauri definētiem scenārijiem — ārpus tiem tās apjuka.
Komandas apmācīja akustiskos modeļus, nolūku klasifikatorus un parametru izgūšanas modeļus konkrētiem zvanu scenārijiem. Risinājums bija noderīgs, taču izmaiņas tajā izmaksāja dārgi.
Sistēma atpazīst vienu no apmācībā iekļautajiem nolūkiem, bet otru pieprasījumu palaiž garām vai uzdod stingri iepriekš noteiktu papildjautājumu.
Rezultāts · Sistēma pazaudē informāciju par dzīvesbiedru, jo apmācībā izmantotajā sarunas scenārijā tā nav paredzēta.
Arhitektūra kļuva elastīgāka, taču katrs posms paļāvās uz iepriekšējo.
Mūsdienās ierasta pieeja vienā zvana ciklā savieno runas pārvēršanu tekstā, LLM un teksta pārvēršanu runā.
Ja transkripcija ir kļūdaina vai zvanītājs sāk runāt pa vidu, LLM pārliecinoši sniedz nepareizu atbildi.
Rezultāts · Viena runas atpazīšanas kļūda pārtop kļūdainā balss atbildē.
Sistēma spēj sadzirdēt, spriest un izlabot kļūdu vienā ciklā.
ThunderPhone vienotā arhitektūrā koordinē audio satura izpratni, modeļu maršrutēšanu, sarunas plūsmas vadību un atbilžu ģenerēšanu.
Vairāki paralēli audio uztveres ceļi un spriešana, kas ņem vērā audio signālu, samazina iespēju, ka viena posma kļūme nonāks līdz zvanītājam.
Rezultāts · Saruna turpinās, un zvanītājam nav jācīnās ar sistēmu.
Izrāviens nav patīkamāka robota balss. Tas slēpjas arhitektūrā, kas neļauj sarunai novirzīties no kursa.
Precīzāka runas uztvere
Sistēma var salīdzināt signālus un izdarīt secinājumus no audio, nevis paļauties uz vienu transkripciju.
Labāks sarunas ritms
Runātāju maiņa un pārtraukšanas apstrāde ir daļa no sarunas cikla.
Efektīvāka maršrutēšana
Katrai sarunas replikai var izvēlēties vajadzībām atbilstošu pieeju — ātro apstrādes ceļu vai padziļinātu spriešanu.
Labāka pieredze
Zvanītāji mazāk laika velta automatizētās sistēmas pārpratumu labošanai un vairāk — sava uzdevuma paveikšanai.