Наши первые впечатления от API GPT-Live-1 для голосовых агентов
Два дня назад OpenAI выпустила в API GPT-Live-1 — свою новую полнодуплексную голосовую модель. Мы создаём и запускаем ИИ-телефонных агентов в продакшене, поэтому подключили её к настоящему номеру телефона и позвонили. Много раз.
Мы протестировали её на сценарии квалификации тёплых лидов примерно на 13 000 токенов от одного из наших страховых клиентов: с обязательными дословными репликами, строгими правилами повторного подтверждения и ветвящимися уточняющими вопросами. За один долгий день мы провели дюжину реальных телефонных звонков, около 25 смоделированных интервью и серию неструктурированных тестов.
Вот наши первые впечатления — с расшифровками и аудио. Более подробный разбор выйдет совсем скоро.
Расшифровки взяты из наших тестовых звонков и подготовлены GPT-Live. Мы изменили имена и формулировки, по которым можно идентифицировать людей, сократили диалоги и объединили разделённые фрагменты. Метки времени в секундах от начала звонка взяты из оригиналов.
Естественность впечатляет
GPT-Live-1 — самый естественно звучащий собеседник из всех, кого мы подключали к телефонной линии. Это настоящий шаг вперёд.
Она слушает и говорит в одном непрерывном аудиопотоке, без отдельных этапов расшифровки и синтеза речи. Большинство механик разговора просто работают. Звонящие слышали её первую реплику примерно через 1,3 секунды после того, как заканчивали говорить, по медиане, или примерно через 0,7 секунды без телефонного сегмента. Мы не добавляли ни определения голосовой активности, ни логики передачи хода разговора. Она спокойно обрабатывает перебивания, естественно подаёт сигналы внимания («Мгм») и говорит в быстром, человеческом темпе.
Когда ей задают цели, а не готовые реплики, она подстраивает вопросы под разговор и спокойно принимает исправления:
Она ни разу не теряла самообладания при исправлениях, перебиваниях или когда звонящие меняли ответы по ходу разговора. Если бы естественность была единственной задачей, на этом пост можно было бы закончить. К сожалению, всё сложнее.
Она не всегда надёжно следует инструкциям
GPT-Live-1 не всегда надёжно следует инструкциям в поведении, важном для телефонного звонка по сценарию.
Не раз она отвечала на чёткое «да» так, будто услышала «нет»: повторно задавала вопрос или переходила дальше, словно звонящий отказался.
Самым стабильным сбоем стало слишком буквальное следование инструкциям. В нашем промпте было указано: если звонящий говорит, что указанный в системе статус жилья неверен, спросить, владеет ли он жильём, арендует его или живёт с родителями. Звонящий сказал: «Нет, теперь я владею им», — а это уже отвечает на вопрос. Но модель всё равно зачитала меню:
Часть ранних странностей была связана с нашим промптом, но буквальность сохранялась во всех вариантах промптов, которые мы пробовали. Любой ответ, который мы не прописали явно, обрабатывался механически, а не разумно.
Иногда она также начинает размышлять вслух под давлением:
Числа и буквенно-цифровые коды — зона риска
Написание слов, адреса, даты рождения и идентификационные номера должны быть точными. Именно здесь речь GPT-Live-1 вызывает больше всего проблем.
Мы слышали, как модель пропускает и подменяет символы в буквенно-цифровых строках. Здесь она зачитывает выдуманный номер страхового случая; записи не редактировались, кроме удаления тишины. В английском её расшифровка была верной, но в аудио появилась буква «Y»:
На русском было хуже: буква «Q» превратилась в «X» и в аудио, и в расшифровке.
С датами возникла та же проблема. Звонящий назвал дату рождения цифрами, а модель позже повторила её как число:
Кроме того, иногда она произносит реплику, которая принадлежит звонящему:
Акценты в других языках
Мы тестируем новые голосовые модели на всех 47 языках, которые поддерживает наш продукт. Русский у GPT-Live-1 был беглым, но с сильным американским акцентом, тогда как голоса TTS, которые мы используем в продакшене, обычно звучат как носители языка:
Мы также попробовали луганда. Во время первого звонка модель ответила на суахили. Во время второго она говорила на луганда — естественнее, чем мы ожидали от универсальной модели, — но снова с сильным американским акцентом. Мы не тестировали каждый язык, но предполагаем, что эта закономерность с акцентами, вероятно, распространяется и на другие языки. Для голосового агента только на английском это не имеет значения, но для сценариев на других языках это довольно существенное ограничение.
Несколько важных ограничений API
По результатам этой недели для реального агента важны несколько ограничений API:
- Инструкции нельзя изменить после начала сессии, а их объём ограничен 16 384 токенами.
- Исходящее аудио никогда не перестаёт передаваться в потоке — передаётся и тишина, — поэтому сигнал «аудио остановилось» нельзя использовать для определения конца реплики в сценариях, где нужно разделять реплики.
- Доступ к модели возможен только через новый эндпоинт
v1/live/sessions, и на момент нашей проверки она ещё не была доступна в Azure.
Наше впечатление на данный момент
Телефонные агенты для продакшена должны звучать естественно и последовательно следовать сценариям. GPT-Live-1 превосходно справляется с первым, но со вторым у неё есть серьёзные проблемы. Со временем мы проведём больше тестов и продолжим публиковать наши выводы.