Представляем ThunderPhone
Обновление, август 2026 г.: Это наше первоначальное объявление о запуске от марта 2026 года, сохранённое для истории. Некоторые детали — особенно тарифы и голосовые опции — с тех пор изменились; актуальную информацию смотрите в разделе текущие тарифы. И ожидание окончено: читайте объявление о запуске v2!
Сегодня мы с гордостью объявляем о публичном запуске ThunderPhone, который упрощает автоматизацию телефонных звонков с помощью AI. Благодаря полностью иной интегрированной архитектуре по сравнению с другими платформами телефонного AI, ThunderPhone обеспечивает гораздо более высокую производительность, более низкую стоимость и меньше сложностей с интеграциями. ThunderPhone поддерживает входящие и исходящие звонки на десятках языков и соответствует требованиям HIPAA и GDPR.
Преимущество интеграции
Другие платформы телефонного AI ограничивают производительность своих систем, навязывая им структуру из 3 этапов:
- Одна модель расшифровки, которая преобразует голос пользователя в текст.
- Одна LLM, которая обрабатывает текст пользователя и формирует ответ.
- Одна модель TTS, которая преобразует текст ответа обратно в аудио.
Большинство из них также перекладывают инженерную работу на пользователей, заставляя их выбирать модели, которые они хотят использовать, а также параметры конфигурации, такие как шумоподавление и отзывчивость.
Мы выбрали другой подход: мы настроили, на наш взгляд, наилучший возможный стек из доступных сегодня моделей и подготовили его к использованию без сложной настройки. Наша система одновременно использует множество моделей, интеллектуально распределяя между ними работу в зависимости от хода разговора. Это включает:
- Объединение нескольких моделей расшифровки: одни работают быстрее, другие точнее, что позволяет сбалансировать скорость и точность и компенсировать ошибки друг друга.
- Объединение LLM с аудиовходом, которые могут уступать в общем интеллекте, но лучше понимают аудио, с LLM, работающими только с текстом, которые могут ошибаться из-за неточных расшифровок, но часто оказываются умнее.
- Объединение быстрых, но не слишком умных LLM, которые могут быстро генерировать ответы, с гораздо более умными, но медленными LLM, способными работать в фоновом режиме и следить за тем, чтобы AI выполнял свой промпт и правильно отвечал на слова пользователя.
- Объединение коммерческих моделей от ведущих поставщиков, включая OpenAI и Google, которые предлагают самый высокий доступный сегодня интеллект, с широким набором моделей с открытым исходным кодом, которые часто обеспечивают более высокую скорость при меньшей стоимости.
- Одновременное использование нескольких моделей для классификации и устранения фонового шума, посторонних разговоров и других отвлекающих звуков, которые иначе могут сорвать разговор.
Эти и другие компоненты по-разному оркестрируются в трёх уровнях сервиса — Spark, Bolt и Storm: Spark оптимизирован для стоимости, Bolt — для скорости, а Storm — для интеллекта, при этом недостатки каждого уровня сведены к минимуму. Все три системы обладают общими преимуществами, включая невероятно точное понимание слов пользователей даже при наличии имён собственных и особенностей написания.
Мы считаем, что эта тесно интегрированная архитектура обеспечивает нашей системе гораздо более высокую производительность при меньшей стоимости, чем жёсткий подход из 3 этапов, предлагаемый другими поставщиками. В соответствии с теорией модульности Клея Кристенсена, AI для голоса всё ещё находится на ранней стадии развития, и максимизация производительности с помощью интегрированной архитектуры по-прежнему ценнее, чем максимизация настраиваемости с помощью модульной архитектуры.
Оптимизированные решения
Что касается настраиваемости, мы против неё. Большинство современных платформ для голосового ИИ заставляют пользователей пробираться через бесконечное количество вариантов — от выбора конкретных моделей до сверхдетальных параметров, например скорости, с которой ИИ перебивает пользователя.
По нашему мнению, оптимизировать эти решения за кулисами — НАША задача, чтобы пользователи ThunderPhone могли сосредоточиться на том, что у них получается лучше всего, и не беспокоиться о детальной настройке голосового ИИ. Мы видим себя своего рода Squarespace, который помогает пользователям легко настраивать телефонных агентов с максимально возможной производительностью современных моделей — не пошевелив и пальцем.
Простота использования
ThunderPhone также невероятно прост в использовании — как при настройке нового телефонного агента, так и при миграции с другой платформы или собственной системы. Чтобы настроить телефонного агента в ThunderPhone, достаточно:
- Решить, хотите ли вы использовать Spark, Bolt или Storm.
- Выбрать голос.
- Передать нам свой промпт. Мультипромптные агенты не нужны. Если ваш промпт слишком сложен для Spark или Bolt, перейдите на Storm — он справляется даже со сложными сценариями с помощью одного промпта.
- Подключить интеграции с программным обеспечением (любую конечную точку или нативную интеграцию с n8n) с помощью невероятно простого мастера.
- Подключить VoIP с помощью невероятно простого мастера.
Обычно всё это занимает 10 минут или меньше.
ThunderPhone соответствует требованиям HIPAA и GDPR, а по запросу мы подпишем и предоставим соглашения BAA и DPA.
Наша история
Мы — команда выпускников Лаборатории ИИ Стэнфорда и Y Combinator, работающая над голосовым ИИ с 2024 года. Изначально мы сосредоточились на Flux Interpreting, который переводит телефонные разговоры между языками. Но когда клиенты снова и снова просили нас автоматизировать телефонные звонки для их бизнеса, а не просто переводить их, мы переключили внимание на то, что теперь стало ThunderPhone.
Проблема существующих платформ
Сначала мы начали создавать голосовых агентов для клиентов на платформах телефонного ИИ других компаний. Мы протестировали практически все представленные на рынке платформы телефонного ИИ, но, к сожалению, обнаружили в них недостатки, особенно когда речь шла о следующем:
- Понимание аудио: Ограничение в виде единственной модели распознавания речи, преобразующей аудио пользователя в текст, означало, что ИИ часто «ослышивался», особенно в случае имён собственных, редких слов и написаний.
- Выполнение инструкций: Один быстрый LLM, выполняющий всю «умственную работу» во время звонка, часто приводил к тому, что ИИ с трудом точно выполнял инструкции и начинал действовать непредсказуемо.
- Сложные интеграции: Платформы, которые мы пробовали, крайне затрудняли подключение внешнего ПО: обычно приходилось вручную вводить объёмные JSON-конфигурации для вызовов инструментов и многократно бороться с ними, почти не получая обратной связи, пока они внезапно не начинали работать.
- Цена: Существующие платформы обычно стоили очень дорого: как правило, 10 центов за минуту или больше при посредственном качестве работы.
Создание собственного стека
Когда мы заключили контракт на внедрение сценария звонков для продаж для корпоративного клиента, нам пришлось создать собственный специализированный стек, чтобы удовлетворить его потребности. Этот сценарий был требовательным: в отличие от поддержки клиентов, где звонящие во многом зависят от компании, потенциальные клиенты быстро кладут трубку.
Чтобы закрыть сделку, а не потерять потенциального клиента, качество звонка должно быть безупречным. Это означало необходимость уверенно работать с большим количеством имён собственных и написаний, включая имена и адреса, которые стандартным моделям распознавания речи сложно определить правильно. Чтобы идеально реализовать этот сценарий, мы создали то, что теперь называется ThunderPhone.
По пути мы продолжали знакомиться с людьми из сообщества голосового ИИ Сан-Франциско, которые создавали компании с голосовыми агентами для конкретных отраслей — ветеринаров, дальнобойщиков и других. Удивительно, но большинство из них придерживалось одного мнения: существующие платформы достаточно хороши для демо, но не для продакшена.
Поразительно, но многие, если не большинство наших друзей из компаний в сфере отраслевого голосового ИИ, на самом деле «собирали собственные» стеки... Для нас это не имело смысла — это всё равно что веб-стартапам в 90-х приходилось бы размещать собственные веб-серверы на сервере в шкафу.
С этим пониманием мы осознали, что пришло время превратить нашу систему телефонного ИИ в платформу, которой сможет пользоваться любой.
Компании в сфере отраслевого голосового ИИ и консультанты должны иметь возможность сосредоточиться на потребностях своего целевого рынка, используя отраслевую экспертизу — а не на сложной разработке базовых технологий ИИ и телефонии! Именно это мы сегодня запускаем вместе с ThunderPhone.
Это был долгий путь! Приносим извинения всем, кто зарегистрировался у нас с прошлого апреля и всё ещё ждёт доступа: то, что мы считали коротким рывком к финишу, превратилось в многомесячную одиссею по объединению доступных сегодня моделей в максимально надёжную систему.
Но теперь мы наконец запустились — попробуйте и расскажите, что думаете!
Хотя мы устранили основные проблемы, в системе наверняка ещё остаются ошибки. Если вы обнаружите какие-либо неполадки, напишите по email alex@thunderphone.com, и я позабочусь, чтобы их исправили для вас как можно скорее. Также сообщайте о любых пожеланиях по функциям, и мы постараемся реализовать их для вас настолько быстро, насколько сможем.
А если у вас есть более индивидуальные потребности, например поддержка специализированного внедрения и интеграции, соответствие требованиям помимо стандартных HIPAA и GDPR, SLA или запросы на индивидуальные функции, мы будем рады обсудить корпоративное соглашение. Напишите на alex@thunderphone.com, и мы обсудим ваши потребности и то, сможем ли помочь.
И в более широком смысле: наше обязательство перед вами состоит в том, что НАША задача — сделать так, чтобы ThunderPhone работал «из коробки» и требовал от вас минимум усилий, а также обрабатывал звонки вашей компании настолько безупречно, насколько это возможно с современным ИИ, в рамках выбранного вами тарифа — Spark, Bolt или Storm. Попробуйте нас, и мы с радостью покажем, на что способен ThunderPhone.
Расскажите, что вы думаете, и спасибо за поддержку!