Більшість автоматизованих дзвінків — просто жах. Нова технологія це змінює.
Головною проблемою старої телефонної автоматизації було не те, наскільки приємно звучав голос. Вона просто не розуміла співрозмовника достатньо добре, щоб підтримувати живу розмову.
Телефонну розмову дедалі простіше автоматизувати.
З кожним поколінням система опрацьовує дедалі більше контексту.
Абонент мав говорити мовою машини.
Автоматизація означала меню, розгалуження за кнопками та черги. Це працювало, якщо клієнт уже знав, який шлях обрати.
Інтент доводиться зводити до натискання однієї кнопки, тож будь-який запит поза меню закінчується переадресацією або повторним поясненням.
Результат · Клієнт навмання обирає варіант, чекає, а потім знову пояснює те саме.
Системи розуміли лише вузьке коло запитів — і губилися за його межами.
Команди навчали акустичні моделі, класифікатори інтентів і модулі виділення слотів для конкретних сценаріїв дзвінків. Рішення були дієвими, але кожна зміна коштувала дорого.
Система розпізнає один закладений у неї інтент, а другий запит губить або ставить уточнювальне запитання за жорстким сценарієм.
Результат · Інформація про дружину губиться, бо її не передбачено сценарієм, на якому навчали систему.
Стек став гнучкішим, але кожен етап покладався на результат попереднього.
Типова сучасна схема з’єднує розпізнавання мовлення, LLM і синтез мовлення в єдиний цикл дзвінка.
Якщо транскрипція помилкова або абонент перебиває, LLM упевнено дає хибну відповідь.
Результат · Одна помилка розпізнавання — і система озвучує хибну відповідь.
Система чує, аналізує й виправляє помилки за один цикл.
ThunderPhone координує аналіз аудіо, маршрутизацію моделей, чергування реплік і генерацію відповідей у межах єдиної архітектури.
Кілька паралельних шляхів розпізнавання й аналіз з урахуванням аудіо зменшують кількість збоїв на окремих етапах ще до того, як їхні наслідки почує абонент.
Результат · Розмова рухається далі, а абонентові не доводиться боротися із системою.
Прорив не в приємнішому голосі робота, а в архітектурі, що тримає розмову в потрібному руслі.
Точніше сприйняття мовлення
Система може зіставляти сигнали й робити висновки безпосередньо з аудіо, а не покладатися на одну транскрипцію.
Природніший ритм
Чергування реплік і обробка перебивань закладені безпосередньо в цикл діалогу.
Гнучкіша маршрутизація
На кожному кроці діалогу система може обрати швидкий маршрут або глибший аналіз — залежно від потреби.
Зручніша взаємодія
Абоненти витрачають менше часу на виправлення помилок системи й більше — на вирішення свого питання.