Ensivaikutelmamme GPT-Live-1 API:sta puheagentteja varten
OpenAI julkaisi uuden full-duplex-puhemallinsa GPT-Live-1:n APIin kaksi päivää sitten. Rakennamme ja pyöritämme tuotannossa AI-puhelinagentteja, joten liitimme sen oikeaan puhelinnumeroon ja soitimme sille. Paljon.
Testasimme sitä erään vakuutusasiakkaamme noin 13 000 tokenin lämpimän liidin kvalifiointiskriptillä, jossa oli pakollisia sanasta sanaan lausuttavia rivejä, tiukat takaisinlukusäännöt ja haarautuvia jatkokysymyksiä. Yhden pitkän päivän aikana teimme tusinan verran oikeita puheluita, noin 25 simuloitua haastattelua ja erän jäsentymättömiä testejä.
Tässä ovat ensivaikutelmamme, litteraatteineen ja ääninäytteineen. Syvällisempi kirjoitus on tulossa pian.
Litteraatit ovat testipuheluistamme GPT-Liven litteroimina. Olemme muuttaneet nimet ja tunnistettavat sanamuodot, lyhentäneet keskusteluja ja yhdistäneet katkenneita osia. Aikaleimat sekunteina puhelun alusta ovat alkuperäisistä tallenteista.
Luontevuus on poikkeuksellista
GPT-Live-1 on luonnollisimman kuuloinen keskustelija, jonka olemme kytkeneet puhelinlinjaan. Se on todellinen harppaus eteenpäin.
Se kuuntelee ja puhuu yhdessä jatkuvassa äänivirrassa ilman erillisiä litterointi- ja synteesivaiheita. Suurin osa keskustelun mekaniikasta toimii yksinkertaisesti. Soittajat kuulivat sen ensimmäisen äänen mediaanina noin 1,3 sekuntia sen jälkeen, kun he lopettivat puhumisen, tai noin 0,7 sekunnissa ilman puheluyhteyden viivettä. Emme lisänneet puheaktiivisuuden tunnistusta tai vuoronvaihtologiikkaa. Se käsittelee keskeytykset sulavasti, tuottaa luonnollisia kuuntelun merkkejä ("Mm-hmm") ja puhuu reippaalla, ihmismäisellä tahdilla.
Kun sille annetaan tavoitteet luettavien repliikkien sijaan, se sovittaa kysymyksensä keskusteluun ja ottaa korjaukset luontevasti vastaan:
Se ei menettänyt malttiaan korjausten, keskeytysten tai kesken puhelun muuttuvien vastausten aikana. Jos luontevuus olisi koko työ, tämä kirjoitus päättyisi tähän. Valitettavasti kyse on muustakin.
Se ei noudata ohjeita luotettavasti
GPT-Live-1 ei noudata luotettavasti ohjeita niissä toimintatavoissa, joilla on merkitystä skriptatussa puhelussa.
Useammin kuin kerran se reagoi selvään "kyllä"-vastaukseen kuin vastaus olisi ollut "ei": se kysyi kysymyksen uudelleen tai siirtyi eteenpäin ikään kuin soittaja olisi kieltäytynyt.
Johdonmukaisin epäonnistuminen oli ohjeiden liian kirjaimellinen tulkinta. Kehotteessamme sanottiin: jos soittaja kertoo, että tiedoissa oleva asumistilanne on väärä, kysy omistaako hän asuntonsa, vuokraako hän sen vai asuuko hän vanhempiensa luona. Soittaja sanoi "ei, omistan sen nyt", mikä vastaa kysymykseen jo itsessään. Malli luki vaihtoehdot silti:
Osa varhaisista oudoista tilanteista johtui kehotteestamme, mutta kirjaimellisuus säilyi kaikissa kokeilemissamme kehoteversioissa. Kaikkia vastauksia, joita emme olleet erikseen määritelleet, käsiteltiin mekaanisesti järkevän tulkinnan sijaan.
Se myös joskus ajattelee ääneen paineen alla:
Numerot ja aakkosnumeeriset merkkijonot ovat riskialttiita
Kirjoitusasujen, osoitteiden, syntymäaikojen ja tunnistenumeroiden on oltava täsmällisiä. Juuri näissä GPT-Live-1:n puheessa on eniten ongelmia.
Huomasimme sen jättävän merkkejä pois ja korvaavan niitä aakkosnumeerisissa merkkijonoissa. Tässä se lukee keksityn vahinkonumeron; äänileikkeisiin ei ole tehty muita muutoksia kuin hiljaisuuden trimmaus. Englanniksi sen transkriptio oli oikein, mutta ääneen tuli ylimääräinen "Y":
Venäjäksi tilanne oli pahempi: "Q" muuttui "X":ksi sekä äänessä että sen transkriptiossa.
Päivämäärät aiheuttivat saman ongelman. Soittaja antoi syntymäajan numeroina, jonka malli myöhemmin luki takaisin lukuna:
Se myös toisinaan sanoo repliikin, joka kuuluu soittajalle:
Aksentit muissa kielissä
Testaamme uusia puhemalleja kaikilla tuotteemme tukemilla 47 kielellä. GPT-Live-1:n venäjä oli sujuvaa, mutta siinä oli vahva amerikanenglannin aksentti (kun taas tuotannossa käyttämämme TTS-äänet kuulostavat yleensä natiivipuhujilta):
Kokeilimme myös lugandaa. Ensimmäisessä puhelussa se vastasi sen sijaan swahiliksi. Toisessa se puhui lugandaa, luonnollisemmin kuin odotimme yleismallilta, mutta jälleen vahvalla amerikanenglannin aksentilla. Emme ole testanneet jokaista kieltä, mutta odotamme aksenttikaavan todennäköisesti yleistyvän. Englanninkieliselle puheagentille tällä ei ole merkitystä, mutta muunkielisissä käyttötapauksissa se on varsin merkittävä rajoite.
Muutama huomionarvoinen API-rajoitus
Tämän viikon havaintojemme perusteella muutama API-rajoitus on tärkeä aidolle agentille:
- Ohjeet ovat muuttumattomia istunnon alkamisen jälkeen, ja niiden enimmäispituus on 16 384 tokenia.
- Lähtevä ääni ei koskaan lakkaa suoratoistumasta — myös hiljaisuus suoratoistetaan — joten "ääni pysähtyi" ei voi toimia vuoron päättymissignaalina käyttötapauksissa, joissa vuorot on segmentoitava.
- Se on käytettävissä vain uuden
v1/live/sessions-päätepisteen kautta, eikä se ollut vielä saatavilla Azuressa, kun tarkistimme asian.
Tähänastinen vaikutelmamme
Tuotantokäyttöön tarkoitettujen puheagenttien on kuulostettava luonnollisilta ja noudatettava käsikirjoituksia johdonmukaisesti. GPT-Live-1 on hämmästyttävä ensimmäisessä, mutta jälkimmäisessä sillä on vakavia ongelmia. Jatkamme testejä ajan mittaan ja kerromme havainnoistamme myös jatkossa.