Naše první dojmy z rozhraní API GPT-Live-1 pro hlasové agenty
OpenAI před dvěma dny zpřístupnilo v API GPT-Live-1, svůj nový plně duplexní hlasový model. V produkci vytváříme a provozujeme AI telefonní agenty, takže jsme ho nasadili na skutečné telefonní číslo a zavolali mu. Hodněkrát.
Testovali jsme ho s kvalifikačním scénářem pro potenciální zájemce o rozsahu přibližně 13 000 tokenů od jednoho z našich klientů v pojišťovnictví, který obsahoval povinné doslovné formulace, přísná pravidla pro opakované potvrzení a navazující otázky podle větvení. Během jednoho dlouhého dne jsme uskutečnili tucet skutečných telefonních hovorů, přibližně 25 simulovaných rozhovorů a sérii nestrukturovaných testů.
Toto jsou naše první dojmy, včetně přepisů a zvuku. Podrobnější rozbor brzy zveřejníme.
Přepisy pocházejí z našich testovacích hovorů a byly přepsány službou GPT-Live. Změnili jsme jména a identifikační formulace, zkrátili výměny a spojili rozdělené úryvky. Časové údaje v sekundách od začátku hovoru odpovídají originálům.
Přirozenost je výjimečná
GPT-Live-1 je nejpřirozeněji znějící konverzační model, jaký jsme kdy nasadili na telefonní lince. Je to skutečný krok vpřed.
Poslouchá a mluví v jednom nepřetržitém zvukovém proudu, bez oddělených fází přepisu a syntézy. Většina mechanismů konverzace prostě funguje. Volající uslyšeli jeho první zvuk v mediánu přibližně 1,3 sekundy poté, co domluvili, nebo zhruba za 0,7 sekundy bez telefonního spojení. Nepřidávali jsme žádnou detekci hlasové aktivity ani logiku střídání mluvčích. Přerušení zvládá plynule, vytváří přirozené průběžné reakce („Mm-hmm“) a mluví svižným tempem podobným lidskému.
Když dostane cíle místo vět, které má přečíst, přizpůsobí otázky konverzaci a opravy přijímá bez zaváhání:
Ani při opravách, přerušeních nebo změnách odpovědí volajících uprostřed hovoru neztratil klid. Kdyby přirozenost byla celou náplní práce, tento článek by tady skončil. Bohužel je to složitější.
Nedodržuje spolehlivě pokyny
GPT-Live-1 nedodržuje spolehlivě pokyny u chování, které je pro scénář telefonního hovoru důležité.
Vícekrát reagoval na jasné „ano“, jako kdyby odpověď zněla „ne“ — zopakoval otázku nebo pokračoval, jako by volající odmítl.
Nejčastěji selhával tím, že pokyny bral příliš doslovně. Náš prompt říkal: pokud volající uvede, že evidovaný stav bydlení není správně, zeptejte se, zda vlastní bydlení, bydlí v nájmu, nebo žije s rodiči. Volající řekl „ne, teď ho vlastním“, čímž na tuto otázku už odpověděl. Model přesto přečetl celou nabídku:
Za částí počátečních podivností stál náš prompt, ale doslovnost přetrvala u každé varianty promptu, kterou jsme zkoušeli. S jakoukoli odpovědí, kterou jsme výslovně nepopsali, zacházel mechanicky namísto rozumně.
Pod tlakem také někdy přemýšlí nahlas:
Čísla a alfanumerické údaje jsou rizikové
Hláskování, adresy, data narození a identifikační čísla musí být přesné. Právě zde má řeč GPT-Live-1 nejvíce problémů.
Slyšeli jsme, jak v alfanumerických řetězcích vynechává a zaměňuje znaky. Zde čte vymyšlené číslo pojistné události; nahrávky jsou kromě oříznutí ticha neupravené. V angličtině byl přepis správný, ale do zvuku přidala „Y“:
V ruštině to bylo horší: „Q“ se ve zvuku i v přepisu změnilo na „X“.
Stejný problém způsobovala i data. Volající uvedl datum narození jako číslice, které model později přečetl jako číslo:
Občas také pronese větu, která patří volajícímu:
Přízvuky v dalších jazycích
Nové hlasové modely testujeme ve všech 47 jazycích, které náš produkt podporuje. Ruština GPT-Live-1 byla plynulá, ale měla silný americký přízvuk (zatímco hlasy TTS, které používáme v produkci, obvykle znějí jako od rodilých mluvčích):
Vyzkoušeli jsme také lugandu. Při prvním hovoru místo ní odpověděla svahilsky. Při druhém mluvila lugandou, přirozeněji, než jsme od obecného modelu očekávali, ale opět se silným americkým přízvukem. Neotestovali jsme každý jazyk, ale očekáváme, že se tento vzorec přízvuku pravděpodobně opakuje obecně. Pro agenta pouze v angličtině to není důležité, pro případy použití v jiných jazycích je to však poměrně zásadní omezení.
Několik omezení API, která stojí za to znát
Podle toho, co jsme tento týden zjistili, jsou pro skutečného agenta důležitá některá omezení API:
- Pokyny po zahájení relace nelze změnit a jsou omezené na 16 384 tokenů.
- Výstupní zvuk nikdy nepřestává streamovat — streamuje se i ticho — takže „zvuk se zastavil“ nelze použít jako signál konce tahu v případech použití, které potřebují rozdělovat tahy.
- Je dostupné pouze prostřednictvím nového endpointu
v1/live/sessionsa při naší kontrole ještě nebylo k dispozici v Azure.
Náš dosavadní dojem
Produkční telefonní agenti musí znít přirozeně a důsledně dodržovat scénáře. GPT-Live-1 je v prvním ohledu úžasný, ve druhém má však několik vážných problémů. Postupem času budeme provádět další testy a nadále informovat o našich zjištěních.