Наші перші враження від API GPT-Live-1 для голосових агентів
Два дні тому OpenAI випустила в API GPT-Live-1 — свою нову повнодуплексну голосову модель. Ми створюємо й запускаємо ШІ-телефонних агентів у продакшні, тож підключили її до реального номера телефону й зателефонували. Багато разів.
Ми протестували її за сценарієм кваліфікації теплих лідів приблизно на 13 000 токенів від одного з наших страхових клієнтів: з обов’язковими дослівними репліками, суворими правилами повторного підтвердження та розгалуженими уточнювальними питаннями. За один довгий день ми провели десяток реальних телефонних дзвінків, близько 25 симульованих інтерв’ю та серію неструктурованих тестів.
Ось наші перші враження, зі стенограмами та аудіо. Незабаром опублікуємо докладніший матеріал.
Стенограми взято з наших тестових дзвінків у розшифровці GPT-Live. Ми змінили імена та формулювання, що дозволяють ідентифікувати людей, скоротили окремі репліки й об’єднали розділені фрагменти. Позначки часу в секундах від початку дзвінка взято з оригіналів.
Природність виняткова
GPT-Live-1 — найприродніший співрозмовник, якого ми запускали на телефонній лінії. Це справжній крок уперед.
Він слухає та говорить в одному безперервному аудіопотоці, без окремих етапів транскрибування й синтезу. Більшість механік розмови просто працює. Абоненти чули перший звук від нього приблизно через 1,3 секунди після завершення своєї репліки (медіана), або приблизно через 0,7 секунди без телефонного сегмента. Ми не додавали жодного виявлення голосової активності чи логіки визначення черги мовлення. Він плавно обробляє перебивання, природно подає сигнали слухання («Мгм») і говорить у жвавому, схожому на людський темпі.
Якщо дати йому цілі замість готових реплік, він підлаштовує запитання під розмову й спокійно сприймає виправлення:
Він жодного разу не втрачав самовладання через виправлення, перебивання чи зміну відповідей абонентами посеред дзвінка. Якби природність була єдиним завданням, цей допис закінчився б тут. На жаль, усе дещо складніше.
Він ненадійно дотримується інструкцій
GPT-Live-1 ненадійно виконує інструкції щодо поведінки, важливої для телефонного дзвінка за сценарієм.
Не один раз він реагував на чітке «так» так, ніби відповідь була «ні»: повторно ставив запитання або рухався далі так, наче абонент відмовився.
Найстабільніший збій полягав у надто буквальному сприйнятті інструкцій. У нашому промпті було сказано: якщо абонент каже, що статус житла у записі неправильний, запитайте, чи він володіє житлом, орендує його або живе з батьками. Абонент сказав: «ні, тепер я ним володію», — і це вже відповідь на те запитання. Однак модель усе одно зачитала перелік:
Частково ранні дивні реакції були наслідком нашого промпту, але надмірна буквальність зберігалася в усіх варіантах промпту, які ми пробували. Будь-яку відповідь, яку ми не прописали явно, він обробляв механічно, а не розсудливо.
Іноді він також міркує вголос під тиском:
Числа та буквено-цифрові коди ризиковані
Написання, адреси, дати народження та ідентифікаційні номери мають бути точними. Саме тут мовлення GPT-Live-1 має найбільше проблем.
Ми чули, як модель пропускає та підміняє символи в буквено-цифрових рядках. Тут вона читає вигаданий номер звернення; кліпи не редагували, окрім обрізання тиші. Англійською її транскрипт був правильним, але в аудіо додалася «Y»:
Російською було гірше: «Q» перетворилася на «X» і в аудіо, і в транскрипті моделі.
Дати спричинили ту саму проблему. Абонент назвав дату народження цифрами, яку модель згодом повторила як число:
Також вона час від часу промовляє репліку, яка належить абоненту:
Акценти іншими мовами
Ми тестуємо нові голосові моделі всіма 47 мовами, які підтримує наш продукт. Російська GPT-Live-1 була вільною, але з виразним американським акцентом (тоді як голоси TTS, які ми використовуємо в продакшні, зазвичай звучать як носії мови):
Ми також спробували луґанду. Під час першого дзвінка модель натомість відповіла суахілі. Під час другого вона говорила луґандою — природніше, ніж ми очікували від універсальної моделі, — але знову з виразним американським акцентом. Ми не протестували всі мови, але очікуємо, що ця закономірність з акцентом, імовірно, узагальнюється. Для агента, що працює лише англійською, це не має значення, але для сценаріїв іншими мовами це доволі суттєве застереження.
Кілька важливих обмежень API
На основі того, що ми виявили цього тижня, для реального агента важливі кілька обмежень API:
- Інструкції незмінні після початку сесії та обмежені 16 384 токенами.
- Вихідне аудіо ніколи не припиняє передаватися потоком — тиша також передається потоком, — тому сигнал «аудіо зупинилося» не можна використовувати як сигнал завершення репліки для сценаріїв, де потрібно сегментувати репліки.
- Модель доступна лише через новий ендпоїнт
v1/live/sessions, і на Azure її ще не було, коли ми перевіряли.
Наше враження наразі
Голосові агенти для продакшну мають звучати природно та послідовно дотримуватися сценаріїв. GPT-Live-1 чудово справляється з першим, але має серйозні проблеми з другим. З часом ми проводитимемо більше тестів і продовжуватимемо ділитися результатами.