Большинство автоматических звонков никуда не годится. Новая технология меняет ситуацию.
Проблема была не в том, насколько приятно звучал голос. Старым системам автоматизации звонков не хватало понимания, чтобы поддерживать живой разговор.
Телефонный звонок всё проще автоматизировать.
С каждым поколением система берёт на себя всё больше контекста.
Звонящему приходилось говорить на языке машины.
02Первые системы с ИИСистемы справлялись только с узкими сценариями — и рассыпались за их пределами.
03Пайплайны из 3 этаповСтек стал гибче, но каждый этап безоговорочно полагался на результат предыдущего.
04ThunderPhoneСистема слышит, рассуждает и сама исправляет ошибки за один цикл.
Звонящему приходилось говорить на языке машины.
Автоматизация сводилась к меню, веткам кнопочного набора и очередям. Она работала, если звонящий уже знал, какой путь выбрать.
Интент сводится к нажатию одной кнопки, поэтому всё, чего нет в меню, заканчивается переводом звонка или повторным объяснением.
Результат · Звонящий выбирает наугад, ждёт и снова объясняет одно и то же.
Системы справлялись только с узкими сценариями — и рассыпались за их пределами.
Команды обучали акустические модели, классификаторы интентов и экстракторы слотов под конкретные сценарии звонков. Это работало, но дорабатывать такие системы было дорого.
Система распознаёт один из заложенных интентов, но второй запрос упускает или задаёт жёстко заданный уточняющий вопрос.
Результат · Система упускает информацию о супруге, потому что её нет в обученном сценарии.
Стек стал гибче, но каждый этап безоговорочно полагался на результат предыдущего.
В современных системах часто используют схему, где распознавание речи, LLM и синтез речи замкнуты в единый цикл звонка.
Когда в расшифровке ошибка или звонящий перебивает, LLM уверенно отвечает совсем не на то.
Результат · Одна ошибка распознавания — и система уже произносит неверный ответ.
Система слышит, рассуждает и сама исправляет ошибки за один цикл.
ThunderPhone объединяет анализ аудио, маршрутизацию моделей, управление ходом диалога и генерацию ответов в единую архитектуру.
Несколько каналов распознавания и анализ исходного аудио снижают риск того, что ошибка на одном этапе дойдёт до звонящего.
Результат · Разговор продолжается, и звонящему не приходится подстраиваться под систему.
Прорыв не в том, что робот заговорил приятнее, а в архитектуре, которая удерживает разговор в нужном русле.
Точнее распознавание
Система сопоставляет разные сигналы и анализирует аудио, а не полагается на одну расшифровку.
Естественнее ритм разговора
Система понимает, когда говорить и как реагировать на перебивания: это часть самого диалогового цикла.
Гибче маршрутизация
Для каждой реплики система выбирает быстрый маршрут или более глубокий анализ — в зависимости от задачи.
Удобнее для звонящих
Звонящие тратят меньше времени на исправление ошибок автоматизации и больше — на решение своей задачи.