Első benyomásaink a GPT-Live-1 hangalapú AI-ügynökökhöz készült API-járól
Az OpenAI két napja tette elérhetővé az API-ban a GPT-Live-1-et, új, teljes duplex hangmodelljét. Éles környezetben építünk és üzemeltetünk AI telefonos ügynököket, ezért egy valódi telefonszámra kötöttük, és felhívtuk. Sokszor.
Egy biztosítási ügyfelünktől származó, körülbelül 13 000 tokenes, meleg leadek minősítésére szolgáló szkripttel teszteltük, amely kötelezően szó szerint felolvasandó sorokat, szigorú visszaolvasási szabályokat és elágazó utánkövető kérdéseket tartalmazott. Egy hosszú nap alatt tucatnyi valódi telefonhívást, körülbelül 25 szimulált interjút és strukturálatlan tesztek egy csoportját futtattuk le.
Ezek az első benyomásaink, átiratokkal és hanganyaggal. Hamarosan részletesebb beszámolóval is jelentkezünk.
Az átiratok a teszthívásainkból származnak, a GPT-Live átírásában. Megváltoztattuk a neveket és az azonosításra alkalmas megfogalmazásokat, rövidítettük a párbeszédeket, és összevontuk a szétválasztott töredékeket. Az időbélyegek a hívás kezdetétől számított másodpercekben értendők, és az eredeti felvételekből származnak.
Kivételesen természetes
A GPT-Live-1 a legtermészetesebben hangzó társalgó rendszer, amelyet valaha telefonvonalra tettünk. Ez valódi előrelépés.
Egyetlen folyamatos hangfolyamon hallgat és beszél, külön átírási és beszédszintézis-szakaszok nélkül. A beszélgetés mechanikájának nagy része egyszerűen működik. A hívók átlagosan körülbelül 1,3 másodperccel azután hallották az első hangját, hogy abbahagyták a beszédet, illetve telefonos kapcsolat nélkül körülbelül 0,7 másodperc után. Nem adtunk hozzá sem hangtevékenység-észlelést, sem beszédváltási logikát. Elegánsan kezeli a félbeszakításokat, természetes visszajelzéseket ad („Mm-hmm”), és lendületes, emberhez hasonló tempóban beszél.
Amikor felolvasandó sorok helyett célokat kap, a kérdéseket a beszélgetéshez igazítja, és gördülékenyen kezeli a helyesbítéseket:
A helyesbítések, félbeszakítások vagy a válaszukat hívás közben megváltoztató hívók során egyszer sem veszítette el a nyugalmát. Ha a természetesség lenne az egész feladat, ez a bejegyzés itt véget is érne. Sajnos azonban ennél többről van szó.
Nem követi megbízhatóan az utasításokat
A GPT-Live-1 nem követi megbízhatóan azokat az utasításokat, amelyek fontosak egy szkriptelt telefonhívás során.
Többször is úgy reagált egy egyértelmű „igen”-re, mintha a válasz „nem” lett volna: újra feltette a kérdést, vagy úgy lépett tovább, mintha a hívó elutasította volna azt.
A legkövetkezetesebb hiba az volt, hogy túlságosan szó szerint vette az utasításokat. A promptunk szerint: ha a hívó azt mondja, hogy a nyilvántartásban szereplő lakhatási státusz hibás, kérdezze meg, hogy saját tulajdonú ingatlanban él-e, bérel-e, vagy a szüleivel lakik. Egy hívó azt mondta: „nem, most már az enyém”, ami már meg is válaszolja ezt a kérdést. A modell ennek ellenére felolvasta a lehetőségeket:
Néhány korai furcsaság a mi promptunk hibája volt, de ez a szó szerinti értelmezés minden általunk kipróbált promptváltozatban megmaradt. Minden olyan választ, amelyet nem írtunk le előre, inkább gépiesen, mint józanul kezelt.
Néha nyomás alatt hangosan gondolkodik is:
A számok és alfanumerikus karakterek kockázatosak
A betűzéseknek, címeknek, születési dátumoknak és azonosítószámoknak pontosnak kell lenniük. A GPT-Live-1 beszédében ezen a területen tapasztaltuk a legtöbb problémát.
Alfanumerikus karakterláncokban karaktereket hagyott ki és cserélt fel. Itt egy kitalált kárszámot olvas fel; a klipeken a csend levágásán kívül semmit sem módosítottunk. Angolul az átirata helyes volt, de a hang egy „Y”-t is hozzáadott:
Oroszul még rosszabb volt: a „Q” mind a hangban, mind az átiratában „X”-szé vált.
A dátumoknál is ugyanez a probléma jelentkezett. Egy hívó számjegyekkel adta meg a születési dátumát, amelyet a modell később számként olvasott vissza:
Időnként olyan mondatot is kimond, amely a hívóhoz tartozik:
Akcentusok más nyelveken
Az új hangmodelleket a termékünk által támogatott mind a 47 nyelven teszteljük. A GPT-Live-1 orosz nyelve folyékony volt, de erős amerikai akcentussal beszélt (miközben az éles környezetben használt TTS-hangjaink jellemzően anyanyelvinek hangzanak):
A lugandát is kipróbáltuk. Az első hívásnál ehelyett szuahéliül válaszolt. A másodiknál lugandául beszélt, természetesebben, mint amit egy általános modelltől vártunk, de ismét erős amerikai akcentussal. Nem teszteltünk minden nyelvet, de várakozásaink szerint az akcentus mintázata valószínűleg általánosítható. Ez nem számít egy kizárólag angol nyelvű ügynök esetében, más nyelveket használó felhasználási eseteknél azonban meglehetősen jelentős fenntartás.
Néhány fontos API-korlátozás
Az ezen a héten feltárt eredményeink alapján néhány API-korlátozás fontos egy valódi ügynök számára:
- Az utasítások a munkamenet indulása után nem módosíthatók, és legfeljebb 16 384 token hosszúak lehetnek.
- A kimeneti hang streamelése sosem áll le — a csend is streamelve van — ezért a „hang leállt” nem használható körvége-jelzésként olyan felhasználási esetekben, amelyeknél a körök szegmentálására van szükség.
- Csak az új
v1/live/sessionsvégponton keresztül érhető el, és az ellenőrzésünkkor még nem volt elérhető Azure-on.
Eddigi benyomásunk
Az éles telefonos AI-ügynököknek természetesen kell hangzaniuk, és következetesen kell követniük a szkripteket. A GPT-Live-1 az előbbiben lenyűgöző, az utóbbival azonban komoly problémái vannak. Az idő múlásával további teszteket végzünk, és továbbra is beszámolunk az eredményeinkről.