Meie esimesed muljed GPT-Live-1 API-st häälagentide jaoks
OpenAI lisas kaks päeva tagasi API-sse oma uue täisdupleksse häälemudeli GPT-Live-1. Me ehitame ja käitame tootmiskeskkonnas AI-telefonihäälagente, seega panime selle päris telefoninumbrile ja helistasime sellele. Palju.
Testisime seda ühe meie kindlustusvaldkonna kliendi umbes 13 000 tokeni pikkuse soojade kontaktide kvalifitseerimise skriptiga, mis sisaldas kohustuslikke sõna-sõnalisi ridu, rangeid ettelugemise reegleid ja hargnevaid järelküsimusi. Ühe pika päeva jooksul tegime kümmekond päris telefonikõnet, umbes 25 simuleeritud intervjuud ja hulga struktureerimata teste.
Need on meie esimesed muljed koos transkriptsioonide ja heliga. Põhjalikum ülevaade tuleb peagi.
Transkriptsioonid pärinevad meie testkõnedest ja need on transkribeerinud GPT-Live. Oleme muutnud nimesid ja tuvastatavat sõnastust, kärpinud vestlusi ning ühendanud poolitatud katkendeid. Ajatemplid sekundites kõne algusest pärinevad originaalidest.
Loomulikkus on erakordne
GPT-Live-1 on kõige loomulikuma kõlaga vestluspartner, kelle oleme telefoniliinile pannud. See on tõeline samm edasi.
See kuulab ja räägib ühe pideva audiovoo kaudu, ilma eraldi transkribeerimise ja sünteesi etappideta. Enamik vestluse toimemehhanisme lihtsalt töötab. Helistajad kuulsid selle esimest heli keskmiselt umbes 1,3 sekundit pärast rääkimise lõpetamist või umbes 0,7 sekundi pärast ilma telefonikõne osata. Me ei lisanud hääleaktiivsuse tuvastust ega kõnevoorude haldamise loogikat. See käsitleb katkestusi sujuvalt, annab loomulikke kuulamissignaale ("Mm-hmm") ja räägib tempokalt ning inimlikult.
Kui anda sellele ette loetavate ridade asemel eesmärgid, kohandab see küsimused vestlusega ja võtab parandusi rahulikult:
See ei kaotanud kordagi rahu paranduste, katkestuste ega keset kõnet vastuseid muutvate helistajate tõttu. Kui loomulikkus oleks kogu töö, lõppeks see postitus siin. Kahjuks on asi keerulisem.
See ei järgi juhiseid usaldusväärselt
GPT-Live-1 ei järgi skriptitud telefonikõne jaoks olulistes käitumisviisides juhiseid usaldusväärselt.
Rohkem kui korra reageeris see selgele "jah"-vastusele, nagu oleks vastus olnud "ei", küsides küsimuse uuesti või liikudes edasi, justkui oleks helistaja keeldunud.
Kõige järjepidevam probleem oli juhiste liiga sõnasõnaline tõlgendamine. Meie prompt ütles: kui helistaja ütleb, et süsteemis olev eluaseme staatus on vale, küsi, kas ta omab kodu, üürib seda või elab vanematega. Helistaja ütles "ei, ma oman seda nüüd", mis vastab sellele küsimusele juba ära. Mudel luges menüü siiski ette:
Osa varasest veidrusest oli meie prompti süü, kuid sõnasõnalisus püsis kõigis proovitud prompti variantides. Kõiki vastuseid, mida me polnud eraldi välja kirjutanud, käsitleti mõistliku lähenemise asemel mehaaniliselt.
Mõnikord mõtleb see surve all ka valjusti:
Numbrid ja tähtnumbrilised koodid on riskantsed
Nimed, aadressid, sünnikuupäevad ja isikukoodid peavad olema täpsed. Just siin on GPT-Live-1 kõnes kõige rohkem probleeme.
Kuulsime, kuidas see jättis tähtnumbrilistes stringides märke välja ja asendas neid. Siin loeb see ette väljamõeldud kahjunõude numbri; klippe pole peale vaikuse kärpimise muudetud. Ingliskeelses transkriptsioonis oli kõik õige, kuid helis lisandus „Y”:
Vene keeles oli see hullem: „Q” muutus nii helis kui ka transkriptsioonis „X”-iks.
Sama probleem tekkis kuupäevadega. Helistaja ütles sünnikuupäeva numbritena, mille mudel hiljem arvuna ette luges:
Samuti ütleb see aeg-ajalt välja rea, mis kuulub helistajale:
Aktsendid teistes keeltes
Testime uusi häälemudeleid kõigis 47 keeles, mida meie toode toetab. GPT-Live-1 vene keel oli ladus, kuid tugeva Ameerika aktsendiga (samas kui tootmises kasutatavad TTS-hääled kõlavad tavaliselt emakeelsetena):
Proovisime ka luganda keelt. Esimeses kõnes vastas see hoopis suahiili keeles. Teises kõnes rääkis see luganda keelt — üldmudeli kohta loomulikumalt, kui ootasime — kuid taas tugeva Ameerika aktsendiga. Me pole testinud kõiki keeli, kuid eeldame, et aktsendimuster kehtib tõenäoliselt üldisemalt. Ainult inglise keeles töötava häälagendi puhul pole see oluline, kuid teiste keelte kasutusjuhtude jaoks on see üsna märkimisväärne mööndus.
Mõned API piirangud, mida tasub teada
Selle nädala leidude põhjal on päris häälagendi jaoks olulised mõned API piirangud:
- Juhiseid ei saa pärast seansi algust muuta ning nende ülempiir on 16 384 tokenit.
- Väljundheli voogesitus ei peatu kunagi — voogedastatakse ka vaikust — seega ei saa „heli peatus” kasutada vooru lõpu signaalina kasutusjuhtudes, kus on vaja voorusid eristada.
- See on saadaval ainult uue
v1/live/sessionslõpp-punkti kaudu ning meie kontrollimise ajal polnud see veel Azure'is saadaval.
Meie senine mulje
Tootmiskeskkonna telefoni-häälagendid peavad kõlama loomulikult ja järgima skripte järjepidevalt. GPT-Live-1 on esimeses suurepärane, kuid teisega on tal mõningaid tõsiseid probleeme. Teeme aja jooksul veel teste ja jagame oma leide edasi.