Teknik

Gå bortom 3-stegspipelinen.

De flesta plattformar för röst-AI bygger på en 3-stegspipeline: en transkriberingsmodell, en LLM utan resonemangsförmåga och en talsyntesmotor. Varje steg är en enda felpunkt. ThunderPhone minskar misstag genom att samordna många modeller samtidigt.

Uppringaren sa “Jag hyr.”
ASR A“Jag hyr”
ASR B“Jag heter Jahir”
Ljud-LLM“Jag hyr”
Stämde av “Jag hyr” 2 av 3 vägar är överens
Den integrerade arkitekturen

Hör det på många sätt och stäm av.

ThunderPhone orkestrerar många modeller samtidigt och låter dem rätta varandras misstag.

Andra plattformar · 3-stegspipeline

Varje steg litar på det föregående.

Uppringarens ljud
”Jag hyr.” · mumlat
STT A
“Jag heter Jahir”
STT B
Ljud-LLM
Ingen reserv när den enda modellen hör fel
LLM
En snabb modell ser endast transkriptionen.
→ svarar ”Hej, Jahir — hur kan jag hjälpa till?”
Snabba LLM:er gör misstag när de följer instruktioner
TTS
Svaret läses upp.
→ säger ”Hej, Jahir — hur kan jag hjälpa till?” ✗
1 transkribering + 1 LLM = fel svar
ThunderPhone · orkestrerad

Många vägar, ett samordnat svar.

Uppringarens ljud
”Jag hyr.” · mumlat
STT A
“Jag hyr”
STT B
“Jag heter Jahir”
Ljud-LLM
“Jag hyr”
Tre transkriptioner + råljud sparas som bevis
Resoneringslager
Snabba och resonerande LLM:er väger text- och ljudbevis.
→ 2 av 3 vägar är överens: ”Jag hyr”
Resonerande och snabba LLM:er kontrollerar varandra innan de svarar
TTS
Utvalda röster minimerar hallucinationer kring stavningar och alfanumeriska tecken.
→ ”Jag förstår — du hyr.” ✓
Får svåra detaljer rätt direkt.
Bevis på prestanda

Storm sätter intelligensrekord på Big Bench Audio.

BBA testar om en modell kan förstå talade uppmaningar och svara rätt på svåra frågor. Vår starkaste Storm-konfiguration når 99,4 % på vårt offentliga utvärderingsset — 0,6 % misstag, 4× färre än nästa bästa offentliga resultat.

Modell
Felfrekvens↓ lägre är bättre
Poäng
ThunderPhone Storm · Extra Intelligence4× färre misstag
0.6%
Step-Audio R1.1
2.4%
Grok Voice Think Fast
2.9%
Ultravox v0.7 Thinking
3.0%
GPT-Realtime-2 High
3.4%
Gemini 3.1 Flash Live High
3.4%
Visa BBA-Storm-utvärderingsdatasetet på Hugging Face

Felfrekvensen är 100 % minus BBA-framgångsgraden. ThunderPhones resultat kommer från vårt offentliga utvärderingsdataset, som länkas ovan; andra offentliga poäng (Artificial Analysis rankinglista) visas som referens. BBA fångar inte fullt ut prestanda i telefonsamtal, men är en användbar signal för resonemang kring talade uppmaningar.

Färdigtänkt slår konfigurerbart

Du ska inte behöva sätta ihop en röststack för hand.

Andra AI-röstplattformar som Vapi, Retell, Pipecat och LiveKit tvingar dig att fatta omfattande konfigurationsbeslut för att få dina samtal att fungera. På ThunderPhone anser vi att finjustering är vårt jobb och att du ska behöva göra så lite arbete som möjligt för att få dina samtal att fungera smidigt.

Andra AI-röstplattformar · många reglage att justera
STT LLM TTS Slutpunktsdetektering Brusreducering Avbrott Reservlösningar Verktygsschema Fördröjning VAD
ThunderPhone finjusterar allt detta åt dig
ThunderPhone · tre beslut
1
Välj en nivå
Spark, Bolt eller Storm.
2
Välj en röst
Noggrant utvalda, testade i riktiga samtal.
3
Skriv din prompt
Beteende, policy, verktyg — klarspråk.
Tre beslut. Det är allt som krävs — orkestrering, reservlösningar och finjustering ingår från början.
Vi väljer de bästa modellerna för jobbet och kopplar ihop dem. Frontlinjemodeller från OpenAI, Anthropic och Google arbetar tillsammans med modeller med öppen källkod — orkestrerade för bästa prestanda och pris i varje samtal, så att du slipper tänka på det.
En enda prompt, mindre grafröra

En prompt, inte en graf av noder.

Flödesbyggare finns eftersom svagare system inte kan följa komplexa prompter. Varje steg i samtalet blir en nod som du måste bygga och underhålla manuellt. Storm följer detaljerade instruktioner från en enda prompt, så du slipper oroa dig för noder och kanter.

Plattformar för flödesbyggande

Koppla ihop varje gren manuellt.

Hälsningprompt · röst
Samla in telefonnummerprompt · validering
Bekräfta telefonnummerfråga igen ×2
enroll()verktyg · återförsök
Eskaleratill människa
Reservalternativfånga allt
ogiltigt ×2fel
Sex noder för ett registreringsflöde — var och en med egna prompter, verktyg, övergångar och felhantering.
ThunderPhone Storm

Beskriv beteendet en gång.

Beteendeprompt
Hälsa uppringaren välkommen och samla in deras namn och telefonnummer.
Bekräfta samtycke innan du registrerar dem — obligatoriskt.
Om de frågar om fakturering följer du faktureringspolicyn nedan.
Anropa enroll() först när alla fält är bekräftade.
Om uppringaren ber att få prata med en person, koppla till en människa.
Komplex förgrening Valfria övervakare Enklare iteration
En prompt att skriva, testa och iterera på — med förgreningar inkluderade.
Varför det är viktigt

Verkliga samtal är röriga. ThunderPhone är redo.

Otydligt tal, bakgrundssnack, namn och siffror, blandade språk — ThunderPhone är byggt för situationerna som får andra system att fallera.

Sluddrigt tal

Jämför ljud- och textsignaler i stället för att lita på en enda transkribering.

Dåligt telefonljud

Modeller för brusidentifiering och brusreducering rensar signalen.

Bakgrundsprat

Identifiera sidokonversationer innan de stör röstagenten.

Namn och adresser

Dubbelkontrollera egennamn, stavningar, siffror och korrigeringar.

Blandat språk i tal

Växla till flerspråkiga ljud- och röstflöden vid behov.

Långa promptar

Använd starkare resonemangsvägar när beteendet inte kan reduceras till en regel.

Latens, kvalitet och kostnad

Ett snabbare felaktigt svar ger inte ett bättre samtal.

AI för telefonsamtal måste svara snabbt — men hastighet utan korrekthet leder bara till snabba misstag. Dagens LLM:er behöver ett ögonblick för att tänka för att vara tillförlitliga, så ThunderPhone balanserar de två för varje nivå.

Spark
~3s
till första svar
Bolt
~2s
till första svar
Storm
~2–3s
~2s med bekräftelser · ~3s utan
MätningAndra leverantörer hävdar 500 ms latens under ideala förhållanden, men hamnar vanligtvis runt 2 s i ett verkligt samtal.Vi mäter vår latens under verkliga förhållanden.
MotståndskraftAI-leverantörer upplever latensspikar som kan spåra ur samtal.ThunderPhones samordnade teknikstack växlar över till snabbare alternativ när detta händer.
Generationer av röst-AI

Nästa generation av röst-AI är här

Automatiserade telefonsamtal har varit frustrerande upplevelser ... fram till nu. Varje teknikvåg har förbättrat upplevelsen, men aldrig så att den blivit riktigt smidig. Det förändras med ThunderPhone.

1990s2010s20242026 · nu
Generation 1

IVR

Tryck ett för försäljning, tryck två för support. Menyer kan bara koppla vidare.

Generation 2

Avsiktsbotar

Säg ”försäljning” eller ”fakturering” och hoppas att slot-parsern uppfattar det.

Generation 3

AI i tre steg

Transkribera, fråga en snabb LLM och tala sedan — varje steg litar på det föregående.

Generation 4

Integrerad AI

Ljud, text, resonemang, verktyg, röster och skyddsräcken i ett system.

Byggd för samtalen som får allt annat att brista

Se den integrerade teknikstacken
i dina svåraste samtal.

Live på tio minuter. Från 2 ¢/min.