Наши први утисци о GPT-Live-1 API-ју за гласовне агенте
OpenAI је пре два дана објавио GPT-Live-1, свој нови full-duplex гласовни модел, у API-ју. Ми градимо и покрећемо AI телефонске агенте у продукцији, па смо га поставили на прави број телефона и позвали га. Много пута.
Тестирали смо га са скриптом за квалификацију заинтересованих потенцијалних клијената од око 13.000 токена, коју нам је дао један од клијената из осигурања, са обавезним дословним реченицама, строгим правилима поновног читања и гранањем додатних питања. Током једног дугог дана обавили смо десетак стварних телефонских позива, око 25 симулираних интервјуа и серију неструктурисаних тестова.
Ово су наши први утисци, уз транскрипте и аудио. Детаљнији текст стиже ускоро.
Транскрипти су из наших тестних позива, а транскрибовао их је GPT-Live. Променили смо имена и формулације које би могле да открију идентитет, скратили размене и спојили раздвојене фрагменте. Временске ознаке, у секундама од почетка позива, преузете су из оригинала.
Природност је изузетна
GPT-Live-1 је најприроднији саговорник који смо поставили на телефонску линију. То је прави корак напред.
Слуша и говори преко једног непрекидног аудио тока, без засебних фаза транскрипције и синтезе. Већина механике разговора једноставно функционише. Позиваоци су чули његов први аудио око 1,3 секунде након што би престали да говоре (медијана), односно око 0,7 секунди без телефонске везе. Нисмо додавали детекцију гласовне активности нити логику смењивања у разговору. Добро подноси прекидања, производи природне потврдне реакције („Мхм“) и говори брзим темпом налик људском.
Када добије циљеве уместо реченица које треба да прочита, прилагођава питања разговору и без проблема прихвата исправке:
Ниједном није изгубио присебност током исправки, прекидања или када би позиваоци мењали одговоре усред позива. Да је природност цео посао, овај текст би се овде завршио. Нажалост, ту има још тога.
Не прати поуздано упутства
GPT-Live-1 не прати поуздано упутства за понашања која су важна у скриптираном телефонском позиву.
Више пута је на јасно „да“ одговорио као да је одговор био „не“, поново постављајући питање или настављајући даље као да је позивалац одбио.
Најдоследнији неуспех био је сувише дословно тумачење упутстава. Наш упит је гласио: ако позивалац каже да је забележени стамбени статус нетачан, питајте да ли поседује дом, изнајмљује га или живи са родитељима. Позивалац је рекао „не, сада га поседујем“, што већ одговара на то питање. Модел је ипак прочитао цео избор:
Неке ране необичности биле су грешка у нашем упиту, али дословност је остала присутна у свакој варијанти упита коју смо испробали. Са сваким одговором који нисмо изричито навели поступао је механички, уместо разумно.
Понекад и размишља наглас када је под притиском:
Бројеви и алфанумерички знакови су ризични
Словкања, адресе, датуми рођења и идентификациони бројеви морају бити тачни. Управо ту говор GPT-Live-1 има највише проблема.
Чули смо како изоставља и замењује знакове у алфанумеричким низовима. Овде чита измишљени број захтева; снимци су нетакнути, осим што је скраћена тишина. На енглеском је његов транскрипт био тачан, али је у звук додао слово „Y“:
На руском је било горе: „Q“ је постало „X“ и у звуку и у транскрипту.
Датуми су изазвали исти проблем. Позивалац је навео датум рођења као цифре, које је модел касније прочитао као број:
Такође повремено изговори реплику која припада позиваоцу:
Акценти у другим језицима
Тестирамо нове гласовне моделе на свих 47 језика које наш производ подржава. Руски језик модела GPT-Live-1 био је течан, али са израженим америчким акцентом (док TTS гласови које користимо у продукцији обично звуче као изворни говорници):
Испробали смо и луганда језик. У првом позиву је уместо тога одговорио на свахилију. У другом је говорио луганда језик, природније него што смо очекивали од модела опште намене, али поново са израженим америчким акцентом. Нисмо тестирали сваки језик, али очекујемо да се образац акцента вероватно понавља и у другим језицима. То није важно за агента који говори само енглески, али је прилично значајно ограничење за случајеве употребе на другим језицима.
Неколико ограничења API-ја која вреди знати
На основу онога што смо открили ове недеље, неколико ограничења API-ја је важно за стварног агента:
- Упутства се не могу мењати након почетка сесије и ограничена су на 16.384 токена.
- Излазни звук никада не престаје да се стримује — стримује се и тишина — па се „звук је престао“ не може користити као сигнал за крај реда у случајевима употребе којима је потребно сегментирање редова.
- Доступан је само преко новог
v1/live/sessionsкрајњег чвора, а још није био доступан на Azure-у када смо проверили.
Наш утисак до сада
Продукциони телефонски агенти морају звучати природно и доследно пратити скрипте. GPT-Live-1 је изванредан у првом, али има неке озбиљне проблеме с другим. Наставићемо да спроводимо додатна тестирања и извештавамо о својим налазима.