Първите ни впечатления от API-то GPT-Live-1 за гласови агенти
OpenAI пусна GPT-Live-1, новия си пълнодуплексен гласов модел, в API преди два дни. Ние изграждаме и поддържаме AI телефонни агенти в продукционна среда, затова го свързахме с реален телефонен номер и му се обадихме. Много пъти.
Тествахме го с около 13 000-токенов сценарий за квалифициране на потенциални клиенти от един от нашите застрахователни клиенти, със задължителни реплики дума по дума, строги правила за повторение и разклоняващи се допълнителни въпроси. В рамките на един дълъг ден проведохме дузина реални телефонни разговори, около 25 симулирани интервюта и серия неструктурирани тестове.
Това са първите ни впечатления, с транскрипции и аудио. Очаквайте скоро и по-подробен материал.
Транскрипциите са от нашите тестови разговори, транскрибирани от GPT-Live. Променихме имена и разпознаваеми формулировки, съкратихме размени и обединихме разделени фрагменти. Времевите отметки, в секунди от началото на разговора, са от оригиналите.
Естествеността е изключителна
GPT-Live-1 е най-естествено звучащият събеседник, който сме пускали по телефонна линия. Това е истинска крачка напред.
Той слуша и говори в един непрекъснат аудиопоток, без отделни етапи за транскрипция и синтез. Повечето механики на разговора просто работят. Обаждащите се чуваха първия му звук приблизително 1,3 секунди след като спрат да говорят (медиана), или около 0,7 секунди без телефонната връзка. Не добавихме разпознаване на гласова активност или логика за редуване на репликите. Той се справя плавно с прекъсванията, създава естествени сигнали за слушане („Мм-хм“) и говори с бързо, човешко темпо.
Когато получи цели вместо реплики за прочитане, той адаптира въпросите към разговора и приема корекциите спокойно:
Той нито веднъж не изгуби самообладание при корекции, прекъсвания или когато обаждащите се променяха отговорите си по средата на разговора. Ако естествеността беше цялата задача, тази публикация щеше да приключи тук. За съжаление, има и още нещо.
Не следва надеждно инструкциите
GPT-Live-1 не следва надеждно инструкциите за поведенията, които са важни при разговор по сценарий.
Неведнъж той отговори на ясно „да“, сякаш отговорът е бил „не“ — задаваше въпроса отново или продължаваше, сякаш обаждащият се е отказал.
Най-постоянният проблем беше, че приемаше инструкциите твърде буквално. Нашият промпт гласи: ако обаждащият се каже, че записаният статус на жилището е грешен, попитайте дали притежава жилище, наема жилище или живее с родителите си. Обаждащ се каза „не, сега го притежавам“, което вече отговаря на този въпрос. Моделът въпреки това прочете цялото меню:
Част от ранните странности бяха по вина на нашия промпт, но буквалността се запази при всеки вариант на промпта, който опитахме. Всеки отговор, който не бяхме описали изрично, се обработваше механично вместо разумно.
Понякога той и мисли на глас под напрежение:
Числата и буквено-цифровите комбинации са рискови
Изписванията, адресите, датите на раждане и идентификационните номера трябва да са точни. Именно тук речта на GPT-Live-1 има най-много проблеми.
Чухме го да пропуска и заменя знаци в буквено-цифрови низове. Тук той прочита измислен номер на претенция; записите не са променяни, освен че е изрязана тишината. На английски транскрипцията му беше вярна, но в аудиото беше добавено „Y“:
На руски беше по-зле: „Q“ се превърна в „X“ както в аудиото, така и в транскрипцията му.
Датите предизвикаха същия проблем. Обаждащият се даде дата на раждане като цифри, която моделът по-късно прочете като число:
Понякога той изговаря и реплика, която принадлежи на обаждащия се:
Акценти на други езици
Тестваме нови гласови модели на всички 47 езика, които продуктът ни поддържа. Руският на GPT-Live-1 беше гладък, но със силен американски акцент (докато TTS гласовете, които използваме в продукционна среда, обикновено звучат като носители на езика):
Пробвахме и луганда. При първото обаждане той отговори на суахили. При второто говореше на луганда, по-естествено, отколкото очаквахме от модел с общо предназначение, но отново със силен американски акцент. Не сме тествали всеки език, но очакваме тази закономерност с акцентите вероятно да важи по-общо. Това няма значение за агент само на английски, но е доста съществено ограничение за случаи на употреба на други езици.
Няколко ограничения на API, които е добре да знаете
Според това, което открихме тази седмица, няколко ограничения на API са важни за реален агент:
- Инструкциите не могат да се променят след началото на сесията и са ограничени до 16 384 токена.
- Изходящият аудиопоток никога не спира да се предава — предава се и тишина — така че „аудиото е спряло“ не може да се използва като сигнал за край на ход в случаи на употреба, при които ходовете трябва да се разделят.
- Достъпен е само чрез новия endpoint
v1/live/sessions, а когато проверихме, все още не беше наличен в Azure.
Впечатленията ни досега
Гласовите агенти в продукционна среда трябва да звучат естествено и последователно да следват сценарии. GPT-Live-1 е впечатляващ в първото, но има някои сериозни проблеми с второто. С времето ще провеждаме още тестове и ще продължим да споделяме резултатите си.