Mūsu pirmie iespaidi par GPT-Live-1 API balss aģentiem
OpenAI pirms divām dienām API pievienoja GPT-Live-1 — savu jauno pilndupleksa balss modeli. Mēs izstrādājam un ražošanā uzturam AI tālruņa balss aģentus, tāpēc piesaistījām to reālam tālruņa numuram un piezvanījām tam. Daudz.
Mēs to testējām ar aptuveni 13 000 tokenu garu potenciālo klientu kvalificēšanas skriptu no viena mūsu apdrošināšanas klienta, kurā bija obligātas burtiski jāizrunājamas rindas, stingri atkārtošanas noteikumi un sazaroti papildu jautājumi. Vienas garas dienas laikā veicām duci reālu tālruņa zvanu, aptuveni 25 simulētas intervijas un neformatētu testu kopu.
Šie ir mūsu pirmie iespaidi — ar transkripcijām un audio. Drīzumā sekos padziļināts apraksts.
Transkripcijas ir no mūsu testa zvaniem, ko pārrakstījis GPT-Live. Esam mainījuši vārdus un identificējošus formulējumus, saīsinājuši sarunas un apvienojuši sadalītus fragmentus. Laika atzīmes sekundēs no zvana sākuma ir no oriģināliem.
Dabiskums ir izcils
GPT-Live-1 ir dabiskāk skanošais sarunu partneris, ko esam pieslēguši tālruņa līnijai. Tas ir īsts solis uz priekšu.
Tas klausās un runā vienā nepārtrauktā audio plūsmā, bez atsevišķiem transkribēšanas un sintezēšanas posmiem. Lielākā daļa sarunas mehānikas vienkārši darbojas. Zvanītāji pirmo audio dzirdēja aptuveni 1,3 sekundes pēc tam, kad bija beiguši runāt (mediāna), vai aptuveni pēc 0,7 sekundēm bez tālruņa savienojuma posma. Mēs nepievienojām ne balss aktivitātes noteikšanu, ne gājienu maiņas loģiku. Tas eleganti tiek galā ar pārtraukumiem, rada dabiskas īsas apstiprinošas reakcijas ("Mm-hmm") un runā raitā, cilvēkam līdzīgā tempā.
Ja tam dod mērķus, nevis nolasāmas rindas, tas pielāgo jautājumus sarunai un mierīgi pieņem labojumus:
Tas nezaudēja savaldību ne labojumu, ne pārtraukumu, ne gadījumos, kad zvanītāji zvana vidū mainīja savas atbildes. Ja dabiskums būtu vienīgais uzdevums, šis raksts beigtos šeit. Diemžēl ar to viss nebeidzas.
Tas ne vienmēr uzticami ievēro norādījumus
GPT-Live-1 ne vienmēr uzticami ievēro norādījumus attiecībā uz uzvedību, kas ir svarīga skriptētam tālruņa zvanam.
Vairāk nekā vienu reizi tas uz skaidru "jā" atbildēja tā, it kā atbilde būtu bijusi "nē", uzdodot jautājumu vēlreiz vai turpinot sarunu tā, it kā zvanītājs būtu atteicies.
Visbiežākā kļūme bija norādījumu uztveršana pārāk burtiski. Mūsu uzvednē bija teikts: ja zvanītājs saka, ka sistēmā norādītais mājokļa statuss ir nepareizs, pajautājiet, vai viņš ir īpašnieks, īrē mājokli vai dzīvo pie vecākiem. Zvanītājs teica: "nē, tagad tas pieder man", kas jau atbild uz šo jautājumu. Modelis tomēr nolasīja izvēlni:
Daļa agrīno dīvainību bija mūsu uzvednes vaina, taču burtiskā pieeja saglabājās visos uzvedņu variantos, ko izmēģinājām. Jebkura atbilde, ko nebijām skaidri paredzējuši, tika apstrādāta mehāniski, nevis saprātīgi.
Dažkārt tas arī skaļi domā, kad izjūt spiedienu:
Skaitļi un burtciparu virknes ir riskantas
Vārdu rakstībai, adresēm, dzimšanas datumiem un ID numuriem jābūt precīziem. Tieši šeit GPT-Live-1 runā ir visvairāk problēmu.
Mēs dzirdējām, kā tas burtciparu virknēs izlaiž un aizstāj rakstzīmes. Šeit tas nolasa izdomātu pieteikuma numuru; ieraksti nav mainīti, izņemot klusuma apgriešanu. Angļu valodā tā transkripcija bija pareiza, taču audio pievienoja "Y":
Krievu valodā bija vēl sliktāk: gan audio, gan transkripcijā "Q" pārtapa par "X".
Tā pati problēma radās ar datumiem. Zvanītājs nosauca dzimšanas datumu ar cipariem, ko modelis vēlāk atkārtoja kā skaitli:
Tas arī reizēm izrunā zvanītājam paredzētu rindu:
Akcenti citās valodās
Mēs testējam jaunus balss modeļus visās 47 valodās, ko atbalsta mūsu produkts. GPT-Live-1 krievu valoda bija raita, taču ar izteiktu amerikāņu akcentu (savukārt TTS balsis, ko izmantojam produkcijā, parasti skan kā dzimtās valodas runātāji):
Mēs izmēģinājām arī lugandu. Pirmajā zvanā tas tā vietā atbildēja svahili valodā. Otrajā tas runāja lugandiešu valodā — dabiskāk, nekā gaidījām no vispārīga modeļa, taču atkal ar izteiktu amerikāņu akcentu. Mēs neesam testējuši katru valodu, bet sagaidām, ka akcenta tendence, visticamāk, ir vispārīga. Angļu valodā strādājošam balss aģentam tas nav svarīgi, taču lietošanas scenārijiem citās valodās tas ir diezgan būtisks ierobežojums.
Daži API ierobežojumi, kurus vērts zināt
Pamatojoties uz šonedēļ konstatēto, reālam balss aģentam ir svarīgi daži API ierobežojumi:
- Norādījumi pēc sesijas sākuma nav maināmi, un to limits ir 16 384 marķieri.
- Izvades audio nekad nepārstāj straumēt — tiek straumēts arī klusums — tādēļ lietošanas scenārijos, kuros nepieciešams segmentēt dialoga gājienus, "audio apstājās" nevar izmantot kā gājiena beigu signālu.
- Tas ir pieejams tikai jaunajā
v1/live/sessionsgalapunktā, un mūsu pārbaudes laikā tas vēl nebija pieejams Azure.
Mūsu līdzšinējais iespaids
Produkcijas tālruņa balss aģentiem ir jāskan dabiski un konsekventi jāievēro scenāriji. GPT-Live-1 ir lielisks pirmajā aspektā, taču otrajā tam ir dažas nopietnas problēmas. Laikam ejot, mēs veiksim vairāk testu un turpināsim ziņot par saviem secinājumiem.