Technologia

Wyjdź poza 3-etapowy proces.

Większość platform głosowej AI opiera się na 3-etapowym procesie: jednym modelu transkrypcji, jednym LLM-ie bez rozumowania i jednym silniku zamiany tekstu na mowę. Każdy etap to pojedynczy punkt awarii. ThunderPhone ogranicza błędy, orkiestrując wiele modeli jednocześnie.

Rozmówca powiedział „I rent.”
ASR A„I rent”
ASR B„I'm Brent”
Audio LLM„I rent”
Ustalono: „I rent” 2 z 3 ścieżek się zgadzają
Zintegrowana architektura

Usłysz to na wiele sposobów, a potem uzgodnij.

ThunderPhone koordynuje wiele modeli jednocześnie, pozwalając im wzajemnie korygować swoje błędy.

Inne platformy · proces 3-etapowy

Każdy krok ufa poprzedniemu.

Nagranie rozmówcy
„I rent.” · niewyraźnie
STT A
„I'm Brent”
STT B
Audio LLM
Gdy pojedynczy model źle usłyszy, nie ma zabezpieczenia
LLM
Szybki model widzi tylko transkrypcję.
→ odpowiada: „Cześć, Brent — jak mogę pomóc?”
Szybkie LLM-y popełniają błędy podczas stosowania się do instrukcji
TTS
Odpowiedź jest odczytywana na głos.
→ mówi: „Cześć, Brent — jak mogę pomóc?” ✗
1 transkrypcja + 1 LLM = błędna odpowiedź
ThunderPhone · orkiestracja

Wiele ścieżek, jedna skoordynowana odpowiedź.

Nagranie rozmówcy
„I rent.” · niewyraźnie
STT A
„I rent”
STT B
„I'm Brent”
Audio LLM
„I rent”
Trzy transkrypcje + surowe nagranie audio zachowane jako dowód
Warstwa rozumowania
Szybkie i rozumujące LLM-y analizują dowody tekstowe i dźwiękowe.
→ 2 z 3 ścieżek są zgodne: „I rent”
Modele rozumujące i szybkie LLM-y sprawdzają się wzajemnie przed odpowiedzią
TTS
Starannie dobrane głosy minimalizują halucynacje w zapisie liter i znaków alfanumerycznych.
→ „Rozumiem — więc „I rent”.” ✓
Za pierwszym razem poprawnie rozpoznaje trudne szczegóły.
Potwierdzona wydajność

Storm ustanawia rekordy inteligencji w Big Bench Audio.

BBA sprawdza, czy model potrafi zrozumieć wypowiadane polecenia i poprawnie odpowiadać na trudne pytania. Nasza najsilniejsza konfiguracja Storm osiąga 99,4% w naszym publicznym zestawie ewaluacyjnym — 0,6% błędów, 4× mniej niż kolejny najlepszy publicznie dostępny wynik.

Model
Wskaźnik błędów↓ mniej znaczy lepiej
Wynik
ThunderPhone Storm · Extra Intelligence4× mniej błędów
0.6%
Step-Audio R1.1
2.4%
Grok Voice Think Fast
2.9%
Ultravox v0.7 Thinking
3.0%
GPT-Realtime-2 High
3.4%
Gemini 3.1 Flash Live High
3.4%
Zobacz zbiór danych ewaluacyjnych BBA-Storm na Hugging Face

Wskaźnik błędów to 100% minus wskaźnik sukcesu BBA. Wynik ThunderPhone pochodzi z naszego publicznego zbioru danych ewaluacyjnych, do którego link znajduje się powyżej; pozostałe publiczne wyniki (ranking Artificial Analysis) podano orientacyjnie. BBA nie odzwierciedla w pełni skuteczności w rozmowach telefonicznych, ale jest użytecznym wskaźnikiem zdolności rozumowania na podstawie wypowiadanych poleceń.

Ukierunkowane rozwiązanie wygrywa z konfigurowalnością

Nie powinno być konieczne składanie stosu głosowego ręcznie.

Inne platformy głosowej AI, takie jak Vapi, Retell, Pipecat i LiveKit, zmuszają Cię do podejmowania wielu decyzji konfiguracyjnych, aby Twoje połączenia działały. W ThunderPhone wierzymy, że dostrajanie to nasze zadanie i że aby Twoje połączenia działały płynnie, powinieneś wykonać jak najmniej pracy.

Inne platformy głosowej AI · wiele ustawień do dostrojenia
STT LLM TTS Wykrywanie końca wypowiedzi Usuwanie szumów Przerywanie wypowiedzi Rozwiązania awaryjne Schemat narzędzi Opóźnienie VAD
ThunderPhone dostraja to wszystko za Ciebie
ThunderPhone · trzy decyzje
1
Wybierz poziom
Spark, Bolt lub Storm.
2
Wybierz głos
Starannie wybrane, przetestowane na prawdziwych rozmowach.
3
Napisz swój prompt
Zachowanie, polityka, narzędzia — prostym językiem.
Trzy decyzje. To cała konfiguracja — orkiestracja, rozwiązania awaryjne i dostrajanie są wbudowane.
Wybieramy najlepsze modele do danego zadania i łączymy je ze sobą. Najnowocześniejsze modele od OpenAI, Anthropic i Google działają wraz z modelami open source — są orkiestrujemy je pod kątem najlepszej wydajności i ceny w każdym połączeniu, więc nie musisz się tym martwić.
Jeden prompt, mniej rozrastających się grafów

Jeden prompt, a nie graf węzłów.

Narzędzia do budowania przepływów istnieją, ponieważ słabsze systemy nie potrafią realizować złożonych promptów. Każdy krok rozmowy staje się węzłem, który musisz ręcznie zbudować i utrzymywać. Storm realizuje rozbudowane instrukcje z jednego promptu, więc nie musisz martwić się węzłami i połączeniami.

Platformy do budowania przepływów

Ręcznie połącz każdą gałąź.

Powitanieprompt · głos
Zbierz numer telefonuprompt · walidacja
Potwierdź numer telefonuponowny prompt ×2
enroll()narzędzie · ponowne próby
Przekaż dalejdo konsultanta
Alternatywaobsługa pozostałych przypadków
nieprawidłowe ×2błąd
Sześć węzłów dla jednego procesu zapisu — każdy z własnymi promptami, narzędziami, przejściami i obsługą błędów.
ThunderPhone Storm

Opisz zachowanie tylko raz.

Prompt zachowania
Przywitaj rozmówcę i zbierz jego imię i nazwisko oraz numer telefonu.
Potwierdź zgodę przed zapisaniem — to wymagane.
Jeśli zapyta o rozliczenia, postępuj zgodnie z poniższą polityką rozliczeń.
Wywołaj enroll() dopiero po potwierdzeniu każdego pola.
Jeśli rozmówca poprosi o kontakt z człowiekiem, przekaż rozmowę konsultantowi.
Złożone rozgałęzienia Opcjonalne mechanizmy nadzoru Łatwiejsze iteracje
Jeden prompt do napisania, przetestowania i iteracji — z uwzględnieniem rozgałęzień.
Dlaczego to ważne

Rzeczywiste rozmowy bywają chaotyczne. ThunderPhone jest na to gotowy.

Niewyraźna mowa, rozmowy w tle, nazwy i liczby, mieszane języki — ThunderPhone stworzono z myślą o sytuacjach, które paraliżują inne systemy.

Niewyraźna mowa

Porównuj sygnały audio i tekstowe, zamiast ufać jednej transkrypcji.

Słaba jakość dźwięku w rozmowie

Modele wykrywania i redukcji szumów oczyszczają sygnał.

Rozmowy w tle

Wykrywaj rozmowy w tle, zanim zakłócą działanie agenta.

Nazwy i adresy

Weryfikuj nazwy własne, pisownię, liczby i korekty.

Mowa w różnych językach

W razie potrzeby kieruj rozmowy przez wielojęzyczne ścieżki audio i głosowe.

Długie prompty

Korzystaj z bardziej zaawansowanych ścieżek rozumowania, gdy zachowania nie da się sprowadzić do jednej reguły.

Opóźnienie, jakość i koszt

Szybsza błędna odpowiedź nie oznacza lepszej rozmowy.

AI do rozmów telefonicznych musi odpowiadać szybko — ale szybkość bez poprawności oznacza tylko szybkie błędy. Dzisiejsze LLM-y potrzebują chwili na przemyślenie odpowiedzi, aby zachować niezawodność, dlatego ThunderPhone równoważy te dwa aspekty na każdym poziomie.

Spark
~3s
do pierwszej odpowiedzi
Bolt
~2s
do pierwszej odpowiedzi
Storm
~2–3s
~2 s z potwierdzeniami · ~3 s bez potwierdzeń
PomiarInni dostawcy deklarują opóźnienie 500 ms w idealnych warunkach, ale podczas rzeczywistej rozmowy zazwyczaj osiągają około 2 s.Mierzymy nasze opóźnienia w rzeczywistych warunkach.
OdpornośćDostawcy AI doświadczają skoków opóźnień, które mogą zakłócić rozmowy.Orkiestrowany stos ThunderPhone przełącza się na szybsze opcje, gdy tak się dzieje.
Generacje głosowej AI

Nadchodzi kolejna generacja głosowej AI

Zautomatyzowane rozmowy telefoniczne były frustrującym doświadczeniem... aż do teraz. Każda fala technologii poprawiała to doświadczenie, ale nigdy na tyle, by było ono naprawdę płynne. ThunderPhone to zmienia.

1990s2010s20242026 · teraz
Generacja 1

IVR

Naciśnij jeden, aby połączyć się ze sprzedażą, naciśnij dwa, aby uzyskać wsparcie. Menu potrafi tylko przekierowywać.

Generacja 2

Boty intencji

Powiedz „sprzedaż” lub „rozliczenia” i miej nadzieję, że parser intencji to wychwyci.

Generacja 3

Trzystopniowa AI

Transkrypcja, jedno szybkie zapytanie do LLM, a potem odpowiedź głosowa — każdy krok ufa poprzedniemu.

Generacja 4

Zintegrowana AI

Audio, tekst, rozumowanie, narzędzia, głosy i mechanizmy ochronne jako jeden system.

Stworzony do rozmów, które zawodzą wszystkie inne rozwiązania

Zobacz zintegrowany stos
w swoich najtrudniejszych rozmowach.

Uruchomienie w dziesięć minut. Od 2¢/min.