Naši prvi vtisi o API-ju GPT-Live-1 za glasovne agente
OpenAI je pred dvema dnevoma v API izdal GPT-Live-1, svoj novi polnodupleksni glasovni model. Gradimo in upravljamo produkcijske AI telefonske agente, zato smo ga povezali z resnično telefonsko številko in ga poklicali. Velikokrat.
Preizkusili smo ga s približno 13.000-žetonskim skriptom za kvalifikacijo toplih potencialnih strank pri eni od naših zavarovalniških strank, z obveznimi dobesednimi vrsticami, strogimi pravili ponavljanja in nadaljnjimi vprašanji glede na odgovor. V enem dolgem dnevu smo opravili ducat resničnih telefonskih klicev, približno 25 simuliranih intervjujev in sklop nestrukturiranih preizkusov.
To so naši prvi vtisi, s prepisi in zvokom. Kmalu sledi podrobnejši zapis.
Prepisi izhajajo iz naših testnih klicev, kot jih je prepisal GPT-Live. Spremenili smo imena in prepoznavno besedilo, skrajšali izmenjave ter združili razdeljene odlomke. Časovni žigi v sekundah od začetka klica so iz izvirnikov.
Naravnost je izjemna
GPT-Live-1 je najbolj naravno zveneč sogovornik, kar smo jih postavili na telefonsko linijo. To je resničen korak naprej.
Posluša in govori v enem neprekinjenem zvočnem toku, brez ločenih faz prepisovanja in sinteze. Večina pogovorne mehanike preprosto deluje. Klicatelji so njegov prvi zvok slišali približno 1,3 sekunde po tem, ko so nehali govoriti (mediana), oziroma okoli 0,7 sekunde brez telefonske povezave. Nismo dodali zaznavanja glasovne aktivnosti ali logike izmenjave govornih potez. Prekinitve obravnava tekoče, ustvarja naravne potrditvene odzive ("Mhm") in govori v živahnem, človeškem tempu.
Ko dobi cilje namesto vrstic za branje, vprašanja prilagodi pogovoru in popravke sprejme brez težav:
Ob popravkih, prekinitvah ali klicateljih, ki so sredi klica spremenili odgovor, ni nikoli izgubil zbranosti. Če bi bila naravnost celotna naloga, bi se ta objava končala tukaj. Žal pa je stvar nekoliko bolj zapletena.
Navodil ne upošteva zanesljivo
GPT-Live-1 ne upošteva zanesljivo navodil pri vedenjih, ki so pomembna za skriptirani telefonski klic.
Več kot enkrat je na jasen »da« odgovoril, kot da bi bil odgovor »ne«, ter vprašanje znova zastavil ali nadaljeval, kot da je klicatelj zavrnil.
Najbolj dosledna napaka je bila preveč dobesedno upoštevanje navodil. Naš poziv je določal: če klicatelj pove, da je zabeleženi stanovanjski status napačen, vprašajte, ali je lastnik, najemnik ali živi pri starših. Klicatelj je rekel »ne, zdaj sem lastnik«, kar že odgovori na to vprašanje. Model je kljub temu prebral celoten seznam:
Nekatere zgodnje nenavadnosti so bile posledica našega poziva, vendar se je dobesednost ohranila pri vseh različicah poziva, ki smo jih preizkusili. Vsak odgovor, ki ga nismo izrecno navedli, je obravnaval mehansko namesto smiselno.
Včasih tudi na glas razmišlja, ko je pod pritiskom:
Številke in alfanumerični nizi so tvegani
Črkovanje, naslovi, datumi rojstva in identifikacijske številke morajo biti natančni. Prav pri tem ima govor GPT-Live-1 največ težav.
Slišali smo, da izpušča in zamenjuje znake v alfanumeričnih nizih. Tukaj prebere izmišljeno številko zahtevka; posnetki so nedotaknjeni, razen obrezane tišine. V angleščini je bil prepis pravilen, vendar je zvok dodal »Y«:
V ruščini je bilo še slabše: »Q« se je v zvoku in prepisa spremenil v »X«.
Datumi so povzročali enako težavo. Klicatelj je datum rojstva podal kot števke, model pa ga je pozneje prebral kot število:
Občasno izreče tudi vrstico, ki bi jo moral izreči klicatelj:
Naglasi v drugih jezikih
Nove glasovne modele preizkušamo v vseh 47 jezikih, ki jih podpira naš izdelek. Ruščina GPT-Live-1 je bila tekoča, vendar je imela močan ameriški naglas (medtem ko glasovi TTS, ki jih uporabljamo v produkciji, običajno zvenijo kot materni govorci):
Preizkusili smo tudi lugandščino. Pri prvem klicu je namesto tega odgovoril v svahiliju. Pri drugem je govoril lugandščino, bolj naravno, kot smo pričakovali od splošnonamenskega modela, vendar znova z močnim ameriškim naglasom. Nismo preizkusili vseh jezikov, vendar pričakujemo, da se ta vzorec naglasov verjetno posplošuje. To ni pomembno za agenta, ki deluje samo v angleščini, je pa precej pomemben zadržek za primere uporabe v drugih jezikih.
Nekaj omejitev API-ja, ki jih je dobro poznati
Glede na to, kar smo ugotovili ta teden, je za resničnega agenta pomembnih nekaj omejitev API-ja:
- Navodil po začetku seje ni mogoče spreminjati, njihova omejitev pa je 16.384 žetonov.
- Izhodni zvok se nikoli ne neha pretakati — pretaka se tudi tišina — zato »zvok se je ustavil« ne more služiti kot signal za konec izmenjave pri primerih uporabe, kjer je treba izmenjave razmejiti.
- Dosegljiv je samo prek nove končne točke
v1/live/sessions, ob našem preverjanju pa še ni bil na voljo v Azure.
Naš dosedanji vtis
Produkcijski telefonski agenti morajo zveneti naravno in dosledno slediti scenarijem. GPT-Live-1 je pri prvem odličen, pri drugem pa ima nekaj resnih težav. Sčasoma bomo izvedli še več preizkusov in še naprej poročali o svojih ugotovitvah.