Technologia

Nie poprzestawaj
na 3-etapowym schemacie.

Większość platform głosowej AI działa według 3-etapowego schematu: model do transkrypcji, model LLM bez funkcji rozumowania i silnik zamiany tekstu na mowę. Wystarczy błąd na jednym z etapów, by zawiódł cały system. ThunderPhone ogranicza błędy, koordynując pracę wielu modeli jednocześnie.

Rozmówca powiedział: “I rent”.
ASR A“I rent”
ASR B“I’m Brent”
Audio LLM“I rent”
Uzgodniony wynik: “I rent”2 z 3 ścieżek wskazują ten sam wynik

Wysłuchaj wielu wersji,
potem je uzgodnij.

ThunderPhone koordynuje pracę wielu modeli naraz, dzięki czemu mogą wzajemnie korygować swoje błędy.

Rozmówca mówi niewyraźnie: “I rent.”
Inne platformy3-etapowy proces
Słyszy raz
STT “I’m Brent”
Brak planu B, gdy jedyny model błędnie rozpozna wypowiedź rozmówcy
Odpowiada błyskawicznie

Szybki model LLM ma dostęp tylko do transkrypcji.

Mówi

„Cześć, Brent — jak mogę pomóc?”

1 transkrypcja + 1 LLM = błędna odpowiedź
ThunderPhoneOrkiestracja
Słyszy na trzy sposoby
“I rent”“I’m Brent”“I rent”
Trzy transkrypcje i surowe nagranie zostają zachowane jako materiał dowodowy
Uzgadnia wynik

Szybkie modele LLM i modele rozumujące wzajemnie weryfikują wynik: 2 z 3 ścieżek dają ten sam wynik.

Mówi

„Rozumiem — czyli wynajmujesz.”

Trudne szczegóły rozpoznaje poprawnie już za pierwszym razem.

Storm bije rekordy w benchmarku inteligencji Big Bench Audio.

BBA sprawdza, czy model rozumie prompty przekazywane głosowo i potrafi poprawnie odpowiadać na trudne pytania. Rekord należy do naszej najmocniejszej konfiguracji Storm: 99,4% w naszym publicznie dostępnym zestawie ewaluacyjnym.

0.6% wskaźnik błędów

· Lipiec 2026Zbiór danych na Hugging Face
ThunderPhoneStorm · Extra Intelligence0.6%
Qwen Audio 3.0Realtime Plus0.8%
Qwen3.5 OmniPlus Realtime1.3%
Step-Audio R1.1Realtime2.4%

Wynik ThunderPhone pochodzi z naszego publicznego zbioru danych ewaluacyjnych, do którego link znajduje się powyżej; pozostałe publiczne wyniki (ranking Artificial Analysis) podajemy dla porównania.

Stack głosowy nie powinien wymagać ręcznego składania.

Inne platformy głosowej AI, takie jak Vapi, Retell, Pipecat i LiveKit, zmuszają cię do podejmowania wielu decyzji konfiguracyjnych, zanim połączenia zaczną działać. W ThunderPhone uważamy, że strojenie systemu to nasze zadanie, a po twojej stronie powinno zostać jak najmniej pracy potrzebnej do tego, by rozmowy przebiegały płynnie.

Inne platformy AI do obsługi głosowejWiele parametrów do ręcznego dostrojenia
STTv4-largeMechanizm awaryjny STTLLMtemp 0.3Zapasowy LLMTTSMechanizm awaryjny TTSVAD0.62Wykrywanie końca wypowiedzi240 msPróg wejścia w słowo−38 dBFiltr reakcji słuchaczaPrzerywanie wypowiedziLimit czasu na odpowiedź800 msOdszumianieBufor jittera60 msCzęstotliwość próbkowania8 kHzSchemat narzędziPolityka ponownych prób×3Ścieżki awaryjne

ThunderPhone dostraja to wszystko za Ciebie

ThunderPhoneTrzy decyzje
1
Wybierz plan

Spark, Bolt lub Storm.

2
Wybierz głos

Starannie wyselekcjonowane i przetestowane podczas prawdziwych rozmów.

3
Napisz prompt

Zachowanie, zasady i narzędzia — opisane prostym językiem.

Trzy decyzje. I gotowe — orkiestracja, mechanizmy awaryjne i strojenie są już wbudowane.

Dobieramy najlepsze modele do każdego zadania i łączymy je w spójną całość. Najbardziej zaawansowane modele OpenAI, Anthropic i Google współpracują z modelami open source — orkiestrujemy je tak, by każde połączenie zapewniało najlepszą wydajność i cenę. Ty nie musisz się tym zajmować.

Jeden prompt
zamiast grafu węzłów.

Kreatory przepływów powstały, ponieważ słabsze systemy nie radzą sobie ze złożonymi promptami. Każdy etap rozmowy staje się węzłem, który trzeba ręcznie zbudować i utrzymywać. Storm realizuje rozbudowane instrukcje z jednego promptu, więc nie musisz zaprzątać sobie głowy węzłami ani krawędziami.

Platformy do budowania przepływówRęcznie skonfiguruj każdą gałąź
Powitanie prompt · głos
Zbierz numer telefonu prompt · walidacja
Potwierdź numer telefonu ponowienie pytania ×2
enroll() narzędzie · ponowne próby
Przekaż konsultantowi
Uniwersalna ścieżka awaryjna nieprawidłowa odpowiedź ×2 · błąd

Sześć węzłów dla jednego procesu rejestracji — każdy z własnymi promptami, narzędziami, przejściami i obsługą błędów.

ThunderPhone StormOpisz sposób działania tylko raz
Prompt definiujący zachowanie

Przywitaj rozmówcę i poproś o imię oraz numer telefonu. Przed zapisaniem upewnij się, że wyraził zgodę — to wymagane. Jeśli zapyta o rozliczenia, postępuj zgodnie z poniższymi zasadami rozliczeń. Wywołaj enroll() tylko raz, dopiero po potwierdzeniu wszystkich danych. Jeśli rozmówca poprosi o rozmowę z człowiekiem, przekaż połączenie konsultantowi.

Złożone rozgałęzieniaOpcjonalne mechanizmy nadzoruŁatwiejsze wprowadzanie zmian

Piszesz, testujesz i udoskonalasz jeden prompt — rozgałęzienia są już w nim uwzględnione.

Rozmowy w realnych warunkach bywają chaotyczne. ThunderPhone jest na to gotowy.

Niewyraźna mowa, gwar w tle, imiona i liczby, mieszanie języków — ThunderPhone powstał z myślą o sytuacjach, w których inne systemy zawodzą.

Niewyraźna mowa

Porównuj sygnały audio i tekstowe, zamiast polegać na pojedynczej transkrypcji.

Słaba jakość dźwięku w rozmowach telefonicznych

Modele wykrywania i redukcji szumów oczyszczają sygnał.

Rozmowy w tle

Wykrywaj poboczne rozmowy, zanim zakłócą pracę agenta.

Imiona, nazwiska i adresy

Weryfikuj nazwy własne, pisownię, liczby i poprawki.

Wypowiedzi łączące języki

W razie potrzeby korzystaj z wielojęzycznych ścieżek przetwarzania dźwięku i głosu.

Długie prompty

Stosuj bardziej zaawansowane ścieżki rozumowania, gdy zachowania nie da się sprowadzić do jednej reguły.

Szybciej nie znaczy lepiej, gdy odpowiedź jest błędna.

Głosowa AI musi odpowiadać szybko — ale sama szybkość bez poprawności oznacza tylko szybsze błędy. Dzisiejsze modele LLM potrzebują chwili na namysł, by działać niezawodnie, dlatego ThunderPhone zachowuje równowagę między czasem reakcji a trafnością.

Spark~3sdo pierwszej odpowiedzi
Bolt~2sdo pierwszej odpowiedzi
Storm~2–3s~2 s z potwierdzeniami · ~3 s bez nich
Pomiar

Inni dostawcy deklarują opóźnienie na poziomie 500 ms w idealnych warunkach, choć w rzeczywistej rozmowie zwykle jest to około 2 s. Mierzymy opóźnienia w rzeczywistych warunkach.

Odporność

U dostawców AI zdarzają się skoki opóźnień, które mogą całkowicie zakłócić przebieg rozmowy. Dzięki orkiestracji stos technologiczny ThunderPhone awaryjnie przełącza się wtedy na szybsze rozwiązania.

Nowa generacja głosowej AI już tu jest.

Automatyczne rozmowy telefoniczne były źródłem frustracji… aż do teraz. Każda kolejna generacja technologii coś poprawiała, ale nigdy na tyle, by rozmowa była naprawdę płynna. ThunderPhone to zmienia.

1990sGeneracja 1

IVR

„Aby połączyć się z działem sprzedaży, wybierz 1. Aby skontaktować się z pomocą techniczną, wybierz 2”. Takie menu potrafi tylko przekierowywać połączenia.

2010sGeneracja 2

Boty rozpoznające intencje

Powiedz „sprzedaż” albo „rozliczenia” — i licz, że parser slotów to wychwyci.

2024Generacja 3

AI w trzech krokach

Najpierw transkrypcja, potem zapytanie do jednego szybkiego LLM, a na końcu synteza mowy — każdy etap zakłada, że wynik poprzedniego jest poprawny.

2026 · terazGeneracja 4

Zintegrowana AI

Dźwięk, tekst, rozumowanie, narzędzia, głosy i zabezpieczenia — połączone w jeden system.

Do rozmów, z którymi inne systemy sobie nie radzą

Przetestuj nasz zintegrowany system na swoich najtrudniejszych rozmowach.

Start w 10 minut. Od 2 centów za minutę.