Teknik

Ta dig bortom
3-stegspipelinen.

De flesta plattformar för röst-AI bygger på en pipeline i 3 steg: en transkriptionsmodell, en LLM som inte resonerar och en text-till-tal-motor. Varje enskilt steg kan få hela kedjan att fallera. ThunderPhone minskar antalet fel genom att samordna många modeller samtidigt.

Inringaren sa ”Jag hyr.”
ASR A”Jag hyr”
ASR B”Jahir”
Ljud-LLM”Jag hyr”
Sammanvägd tolkning: ”Jag hyr”2 av 3 spår är överens

Flera modeller lyssnar.
Resultaten vägs samman.

ThunderPhone samordnar flera modeller parallellt och låter dem rätta varandras misstag.

Den som ringer mumlar: ”Jag hyr.”
Andra plattformarPipeline i 3 steg
Lyssnar en gång
STT ”Jahir”
Ingen reservlösning när den enda modellen hör fel
Svarar snabbt

En snabb LLM-modell ser bara transkriptionen.

Talar

”Hej, Jahir — hur kan jag hjälpa till?”

1 transkribering + 1 LLM = fel svar
ThunderPhoneOrkestrerad
Lyssnar på tre sätt
”Jag hyr””Jahir””Jag hyr”
Tre transkriptioner + råljud sparas som underlag
Stämmer av

Snabba och resonerande LLM-modeller dubbelkollar: 2 av 3 vägar är överens.

Talar

”Okej, du hyr alltså.”

Får de svåra detaljerna rätt direkt.

Storm sätter intelligensrekord i Big Bench Audio.

BBA testar om en modell kan förstå talade promptar och besvara svåra frågor korrekt. Vår starkaste konfiguration av Storm har rekordet: 99,4 % på vårt publika utvärderingsdataset.

0.6% felfrekvens

· Juli 2026Dataset på Hugging Face
ThunderPhoneStorm · Extra Intelligence0.6%
Qwen Audio 3.0Realtime Plus0.8%
Qwen3.5 OmniPlus Realtime1.3%
Step-Audio R1.1Realtime2.4%

ThunderPhones resultat kommer från vårt offentliga utvärderingsdataset, som länkas ovan. Övriga offentliga resultat (topplistan hos Artificial Analysis) visas som referens.

Du ska inte behöva sätta ihop en teknikstack för röst-AI för hand.

Med andra plattformar för röst-AI, som Vapi, Retell, Pipecat och LiveKit, tvingas du göra mängder av konfigurationsval för att få samtalen att fungera. På ThunderPhone är finjusteringen vårt jobb. Du ska behöva göra så lite som möjligt för att få samtalen att flyta på.

Andra plattformar för röst-AIMånga inställningar att finjustera
STTv4-largeSTT-reservlösningLLMtemp 0.3LLM-reservlösningTTSTTS-reservlösningVAD0.62Detektering av talslut240 msAvbrottströskel−38 dBFilter för lyssnarsignalerAvbrottTimeout för turtagning800 msBrusreduceringJitterbuffert60 msSamplingsfrekvens8 kHzVerktygsschemaPolicy för återförsök×3Reservlösningar

ThunderPhone finjusterar allt åt dig

ThunderPhoneTre beslut
1
Välj nivå

Spark, Bolt eller Storm.

2
Välj en röst

Noggrant utvalda och testade i riktiga samtal.

3
Skriv din prompt

Beteende, policy och verktyg – i klartext.

Tre val. Det är hela konfigurationen – orkestrering, reservlösningar och finjustering ingår från start.

Vi väljer de bästa modellerna för uppgiften och får dem att fungera tillsammans. De mest avancerade modellerna från OpenAI, Anthropic och Google arbetar sida vid sida med modeller med öppen källkod – orkestrerade för bästa prestanda och pris i varje samtal, så att du slipper tänka på det.

En enda prompt –
inte en graf med noder.

Flödesbyggare finns för att svagare system inte kan följa komplexa promptar. Varje steg i samtalet blir en nod som du måste bygga och underhålla manuellt. Storm följer avancerade instruktioner i en enda prompt, så du slipper tänka på noder och kopplingar.

Plattformar med flödesbyggareKoppla varje gren manuellt
Hälsning prompt · röst
Samla in telefonnummer prompt · validering
Bekräfta telefonnummer fråga igen ×2
enroll() verktyg · nya försök
Eskalera till en människa
Fallback för alla övriga fall ogiltig ×2 · fel

Sex noder för ett enda registreringsflöde – var och en med egna promptar, verktyg, övergångar och felhantering.

ThunderPhone StormBeskriv beteendet en gång
Beteendeprompt

Hälsa på personen som ringer och samla in personens namn och telefonnummer. Bekräfta samtycket innan du registrerar personen – obligatoriskt. Om personen har frågor om fakturering följer du faktureringspolicyn nedan. Anropa enroll() endast en gång, och först när alla fält har bekräftats. Om personen ber att få prata med någon, koppla vidare till en människa.

Komplexa förgreningarValfria övervakningsfunktionerEnklare att iterera

En enda prompt att skriva, testa och finslipa – förgreningarna ingår.

Verkliga samtal är röriga. ThunderPhone är redo.

Otydligt tal, bakgrundsprat, namn och nummer, språk som blandas – ThunderPhone är byggt för situationer där andra system går bet.

Otydligt tal

Jämför ljud- och textsignaler i stället för att lita på en enda transkribering.

Dåligt telefonljud

Modeller för brusdetektering och brusreducering rensar upp signalen.

Prat i bakgrunden

Upptäck sidokonversationer innan de får röstagenten att tappa tråden.

Namn och adresser

Stäm av egennamn, stavningar, nummer och rättelser mot varandra.

Flerspråkigt tal

Använd flerspråkig dirigering via ljud- och röstflöden vid behov.

Långa promptar

Använd robustare resonemangskedjor när ett beteende inte går att reducera till en enda regel.

Ett snabbare felsvar ger inget bättre samtal.

Röst-AI måste svara snabbt – men snabbhet utan korrekta svar innebär bara att misstagen kommer snabbare. Dagens LLM:er behöver en stund att tänka för att ge tillförlitliga svar, så ThunderPhone balanserar svarstid och träffsäkerhet.

Spark~3still första svar
Bolt~2still första svar
Storm~2–3s~2 s med bekräftelser · ~3 s utan
Mätning

Andra leverantörer uppger 500 ms latens under idealiska förhållanden, men ligger i regel på omkring 2 s i ett verkligt samtal. Vi mäter vår latens under verkliga förhållanden.

Robusthet

AI-leverantörer drabbas av latenstoppar som kan få samtal att spåra ur. ThunderPhone använder en orkestrerad stack som växlar över till snabbare alternativ när det händer.

Nästa generation av röst-AI är här.

Automatiserade telefonsamtal har länge varit frustrerande … fram till nu. För varje ny teknikgeneration har upplevelsen blivit bättre, men aldrig riktigt smidig. ThunderPhone ändrar på det.

1990sGeneration 1

IVR

”Tryck ett för försäljning, tryck två för support.” Menyer kan bara koppla samtalet vidare.

2010sGeneration 2

Intentbotar

Säg ”försäljning” eller ”fakturering” och hoppas att slotparsern lyckas tolka det.

2024Generation 3

AI i tre steg

Transkribera, fråga en snabb LLM och svara sedan med röst – varje steg förlitar sig på det föregående.

2026 · nuGeneration 4

Integrerad AI

Ljud, text, resonemang, verktyg, röster och skyddsmekanismer – samlat i ett enda system.

För samtalen som får allt annat att gå bet

Testa vår integrerade stack i dina svåraste samtal.

I gång på tio minuter. Från 2 cent/minut.