Przedstawiamy ThunderPhone
Aktualizacja, sierpień 2026: To nasze oryginalne ogłoszenie premiery z marca 2026 roku, zachowane dla potomności. Od tego czasu niektóre szczegóły — zwłaszcza ceny i opcje głosowe — uległy zmianie; aktualne informacje znajdziesz w obecnym cenniku. A oczekiwanie dobiegło końca: przeczytaj ogłoszenie premiery v2!
Dziś z dumą ogłaszamy publiczną premierę ThunderPhone, która ułatwia automatyzację rozmów telefonicznych za pomocą AI. Dzięki całkowicie odmiennej, zintegrowanej architekturze niż w innych platformach AI do obsługi telefonicznej ThunderPhone osiąga znacznie wyższą wydajność, niższe koszty i mniej problemów z integracjami. ThunderPhone obsługuje połączenia przychodzące i wychodzące w dziesiątkach języków oraz jest zgodny z HIPAA i RODO.
Przewaga integracji
Inne platformy AI do obsługi telefonicznej ograniczają wydajność swoich systemów, narzucając im trzystopniową strukturę:
- Jeden model transkrypcji, który zamienia głos użytkownika na tekst.
- Jeden LLM, który przetwarza tekst użytkownika i generuje odpowiedź.
- Jeden model TTS, który zamienia tekst odpowiedzi z powrotem na dźwięk.
Większość z nich przerzuca również pracę inżynieryjną na swoich użytkowników, zmuszając ich do wyboru modeli, których chcą używać, a także opcji konfiguracji, takich jak parametry odszumiania i responsywności.
Przyjęliśmy inne podejście: skonfigurowaliśmy, naszym zdaniem, najlepszy możliwy stos z dzisiejszych modeli i przygotowaliśmy go do użycia bez złożonego wysiłku konfiguracyjnego. Nasz system korzysta jednocześnie z wielu modeli, inteligentnie przełączając między nimi w zależności od przebiegu rozmowy. Obejmuje to:
- Łączenie wielu modeli transkrypcji — jednych szybszych, innych dokładniejszych — aby równoważyć szybkość z dokładnością i kompensować wzajemne błędy.
- Łączenie LLM-ów z wejściem audio, które mogą mieć niższą ogólną inteligencję, ale lepiej rozumieć dźwięk, z LLM-ami obsługującymi wyłącznie tekst, które mogą popełniać błędy z powodu niedokładnych transkrypcji, lecz często są inteligentniejsze.
- Łączenie szybkich, lecz mniej inteligentnych LLM-ów, które mogą generować błyskawiczne odpowiedzi, ze znacznie inteligentniejszymi, ale wolniejszymi LLM-ami, które mogą działać w tle i pilnować, aby AI stosowała się do swojego promptu oraz poprawnie reagowała na to, co mówi użytkownik.
- Łączenie komercyjnych modeli od czołowych dostawców, w tym OpenAI i Google, które oferują najwyższą dostępną dziś inteligencję, z szerokim wyborem modeli open source, które często zapewniają lepszą szybkość przy niższym koszcie.
- Jednoczesne wykorzystywanie wielu modeli do klasyfikowania i eliminowania szumów tła, rozmów prowadzonych obok oraz innych rozpraszających dźwięków, które w przeciwnym razie mogłyby wykoleić rozmowę.
Te komponenty i kolejne są orkiestracyjnie łączone na różne sposoby w naszych trzech poziomach usługi: Spark, Bolt i Storm — optymalizując Spark pod kątem kosztu, Bolt pod kątem szybkości, a Storm pod kątem inteligencji, przy jednoczesnym maksymalnym ograniczaniu wad każdego z nich. Wszystkie trzy systemy mają wspólne zalety, takie jak niezwykle dokładne rozumienie tego, co mówią użytkownicy, nawet w przypadku nazw własnych i literowania.
Uważamy, że ta ściśle zintegrowana architektura zapewnia naszemu systemowi znacznie wyższą wydajność przy niższym koszcie niż sztywne, trzystopniowe podejście oferowane przez innych dostawców. Zgodnie z teorią modułowości Claya Christensena AI głosowa jest wciąż na wczesnym etapie rozwoju i nadal bardziej wartościowe jest maksymalizowanie wydajności dzięki zintegrowanej architekturze niż maksymalizowanie możliwości dostosowania dzięki architekturze modułowej.
Zoptymalizowane decyzje
A jeśli chodzi o możliwość dostosowania, jesteśmy jej przeciwni! Większość dzisiejszych platform AI do obsługi telefonicznej zmusza użytkowników do poruszania się po niekończących się wyborach — od dokładnie używanych modeli po ultradokładne parametry, takie jak szybkość, z jaką AI przerywa użytkownikowi.
Naszym zdaniem to NASZA praca, aby optymalizować te wybory za kulisami, tak aby użytkownicy ThunderPhone mogli skupić się na tym, w czym są dobrzy, i nie martwili się szczegółową konfiguracją głosowej AI. Postrzegamy siebie jako swego rodzaju Squarespace, ułatwiając naszym użytkownikom konfigurację agentów telefonicznych z absolutnie najwyższą wydajnością możliwą przy dzisiejszych modelach, bez kiwnięcia palcem.
Łatwość użycia
ThunderPhone jest również niezwykle łatwy w użyciu, niezależnie od tego, czy konfigurujesz nowego agenta telefonicznego, czy migrujesz z innej platformy lub własnego stosu technologicznego. Aby skonfigurować agenta telefonicznego w ThunderPhone, wystarczy:
- Zdecydować, czy chcesz użyć Spark, Bolt czy Storm.
- Wybrać głos.
- Przekazać nam swój prompt. Nie potrzebujesz agentów z wieloma promptami! Jeśli Twój prompt jest zbyt skomplikowany dla Spark lub Bolt, przejdź na Storm, który obsługuje nawet złożone przypadki użycia za pomocą jednego promptu.
- Połączyć integracje oprogramowania (dowolny endpoint lub natywną integrację n8n) za pomocą niezwykle łatwego w użyciu przewodnika.
- Połączyć swoje VoIP za pomocą niezwykle łatwego w użyciu przewodnika.
Zwykle zajmuje to 10 minut lub mniej.
ThunderPhone jest zgodny z HIPAA i RODO, a na żądanie podpiszemy i dostarczymy umowy BAA oraz DPA.
Nasza historia
Jesteśmy zespołem absolwentów Stanford AI Lab i Y Combinator, który pracuje nad głosową AI od 2024 roku. Początkowo skupialiśmy się na Flux Interpreting, które tłumaczy rozmowy telefoniczne między językami. Jednak gdy klienci wielokrotnie prosili nas o automatyzację połączeń telefonicznych dla swoich firm, a nie tylko ich tłumaczenie, zmieniliśmy kierunek i skupiliśmy się na tym, co dziś jest ThunderPhone.
Problem z istniejącymi platformami
Na początku tworzyliśmy agentów telefonicznych dla klientów na platformach AI do obsługi połączeń innych firm. Przetestowaliśmy praktycznie każdą platformę AI do obsługi połączeń dostępną na rynku, ale niestety uznaliśmy je za niewystarczające, zwłaszcza pod względem:
- Rozumienia dźwięku: Ograniczenie do jednego modelu transkrypcji, który zamienia dźwięk użytkownika na tekst, sprawiało, że AI często „źle słyszała” użytkownika, szczególnie w przypadku nazw własnych, rzadkich słów i pisowni.
- Stosowania się do instrukcji: Jeden szybki LLM wykonujący faktyczną „pracę umysłową” podczas rozmowy sprawiał, że AI często miały trudności z poprawnym wykonywaniem instrukcji i schodziły na manowce.
- Trudnych integracji: Platformy, które testowaliśmy, bardzo utrudniały łączenie z zewnętrznym oprogramowaniem. Zazwyczaj zmuszały nas do wpisywania rozbudowanych konfiguracji JSON dla wywołań narzędzi i wielokrotnego zmagania się z nimi, niemal bez żadnej informacji zwrotnej, aż nagle zaczynały działać.
- Ceny: Istniejące platformy zazwyczaj kosztowały fortunę: zwykle 10 centów za minutę lub więcej za przeciętną jakość.
Budowanie własnego stosu technologicznego
Gdy podpisaliśmy umowę na wdrożenie przypadku użycia rozmów sprzedażowych dla klienta korporacyjnego, musieliśmy stworzyć własny, dostosowany stos technologiczny, aby spełnić jego potrzeby. Ten przypadek użycia był wymagający: w przeciwieństwie do obsługi klienta, gdzie rozmówcy są w dużej mierze zdani na firmę, rozmówcy sprzedażowi szybko się rozłączają.
Jakość rozmowy musi być doskonała, aby sfinalizować sprzedaż zamiast stracić potencjalnego klienta. Oznaczało to obsługę dużej liczby nazw własnych i zapisów, w tym imion, nazwisk oraz adresów, z którymi standardowe modele transkrypcji mają trudności. Aby perfekcyjnie obsłużyć ten przypadek użycia, stworzyliśmy to, co dziś jest ThunderPhone.
Po drodze stale poznawaliśmy osoby ze społeczności głosowej AI w San Francisco, które budowały branżowe firmy oferujące agentów telefonicznych — dla weterynarzy, kierowców ciężarówek i nie tylko. Co zaskakujące, większość z nich miała tę samą opinię: istniejące platformy były wystarczająco dobre do demonstracji, ale nie do środowiska produkcyjnego.
Zaskakująco wiele, jeśli nie większość, naszych znajomych z branżowych firm zajmujących się głosową AI faktycznie „budowało własne” stosy technologiczne... Nie miało to dla nas sensu — to właściwie odpowiednik sytuacji, w której startupy internetowe w latach 90. musiały hostować własne serwery WWW na serwerze w szafie.
Dzięki temu spostrzeżeniu zrozumieliśmy, że nadszedł czas, aby przekształcić nasz system AI do obsługi połączeń w platformę, z której może korzystać każdy.
Branżowe firmy tworzące agentów głosowych AI oraz konsultanci powinni móc skupiać się na potrzebach swojej grupy docelowej, wykorzystując specjalistyczną wiedzę branżową — a nie na złożonym projektowaniu technologii AI i telefonicznej, która za tym stoi! Właśnie to uruchamiamy dziś wraz z ThunderPhone.
To była długa droga! Przepraszamy wszystkich, którzy zarejestrowali się u nas od ubiegłego kwietnia i wciąż czekają na dostęp: to, co miało być szybkim sprintem kończącym pracę, okazało się wielomiesięczną odyseją polegającą na ustalaniu, jak połączyć dostępne dziś modele w system tak niezawodny, jak to możliwe.
Ale wreszcie działamy — wypróbujcie ThunderPhone i zobaczcie, co o nim sądzicie!
Choć rozwiązaliśmy już najważniejsze problemy, w systemie z pewnością nadal mogą występować błędy. Jeśli znajdziesz jakiekolwiek problemy, napisz na alex@thunderphone.com, a dopilnuję, aby zostały jak najszybciej naprawione. Daj nam również znać, jeśli masz propozycje funkcji, a postaramy się wdrożyć je tak szybko, jak tylko możemy.
Jeśli masz bardziej niestandardowe potrzeby, takie jak wsparcie przy niestandardowym wdrożeniu i integracji, zgodność wykraczającą poza standardowe HIPAA i RODO, umowy SLA lub niestandardowe propozycje funkcji, chętnie porozmawiamy o umowie dla przedsiębiorstwa. Skontaktuj się z nami pod adresem alex@thunderphone.com, a omówimy Twoje potrzeby i to, czy możemy pomóc.
A bardziej ogólnie: zobowiązujemy się, że to NASZĄ rolą jest dopilnowanie, aby ThunderPhone działał od razu, przy minimalnym wysiłku z Twojej strony, i obsługiwał połączenia Twojej firmy tak doskonale, jak jest to możliwe przy dzisiejszej AI, w granicach wybranego przez Ciebie poziomu cenowego: Spark, Bolt lub Storm. Wypróbuj nas, a z radością pokażemy Ci, co potrafi ThunderPhone.
Daj nam znać, co sądzisz, i dziękujemy za wsparcie!