Teknologi

Legg 3-trinnsprosessen
bak deg.

De fleste plattformer for stemme-AI baserer seg på en 3-trinnsprosess: én transkripsjonsmodell, én LLM uten resonnering og én tekst-til-tale-motor. Hvert trinn kan alene få hele kjeden til å svikte. ThunderPhone reduserer feil ved å samkjøre mange modeller samtidig.

Innringeren sa “I rent.”
ASR A“I rent”
ASR B“I’m Brent”
Lyd-LLM“I rent”
Avstemt resultat: “I rent”2 av 3 spor er enige

Tolk lyden på flere måter,
og avstem resultatene.

ThunderPhone samkjører mange modeller samtidig og lar dem rette opp hverandres feil.

Innringeren mumler “I rent.”
Andre plattformer3-trinnsprosess
Hører én gang
STT “I’m Brent”
Ingen reserve når den eneste modellen hører feil
Svarer raskt

En rask LLM ser bare transkripsjonen.

Snakker

“Hi, Brent — how can I help?”

1 transkripsjon + 1 LLM = feil svar
ThunderPhoneOrkestrert
Hører på tre måter
“I rent”“I’m Brent”“I rent”
Tre transkripsjoner + rålyd beholdes som bevisgrunnlag
Sammenstiller

Raske og resonnerende LLM-er kryssjekker: 2 av 3 spor er enige.

Snakker

“Got it — so you rent.”

Får krevende detaljer riktig på første forsøk.

Storm setter intelligensrekorder på Big Bench Audio.

BBA tester om en modell kan forstå muntlige prompter og svare riktig på vanskelige spørsmål. Vår sterkeste Storm-konfigurasjon har rekorden: 99,4 % på det offentlig tilgjengelige evalueringssettet vårt.

0.6% feilrate

· Juli 2026Datasett på Hugging Face
ThunderPhoneStorm · Extra Intelligence0.6%
Qwen Audio 3.0Realtime Plus0.8%
Qwen3.5 OmniPlus Realtime1.3%
Step-Audio R1.1Realtime2.4%

ThunderPhones resultat er hentet fra vårt offentlig tilgjengelige evalueringsdatasett, som er lenket til ovenfor. Andre offentlige resultater fra Artificial Analysis-resultattavlen er tatt med til sammenligning.

Du skal slippe å sette sammen en teknologistakk for stemme-AI for hånd.

Andre plattformer for stemme-AI, som Vapi, Retell, Pipecat og LiveKit, tvinger deg til å konfigurere en lang rekke detaljer før samtalene fungerer. Hos ThunderPhone mener vi at finjusteringen er vår jobb, og at du skal gjøre minst mulig for å få samtalene til å gå knirkefritt.

Andre plattformer for stemme-AIMange innstillinger å finjustere
STTv4-largeSTT-reserveløsningLLMtemp 0.3LLM-reserveløsningTTSTTS-reserveløsningVAD0.62Deteksjon av taleslutt240 msAvbrytelsesterskel−38 dBFilter for lytterresponserAvbrytelserTidsavbrudd for samtaletur800 msStøyreduksjonJitterbuffer60 msSamplingsfrekvens8 kHzVerktøyskjemaRegler for nye forsøk×3Reserveløsninger

ThunderPhone finjusterer alt dette for deg

ThunderPhoneTre valg
1
Velg nivå

Spark, Bolt eller Storm.

2
Velg en stemme

Håndplukket og testet i ekte samtaler.

3
Skriv prompten din

Atferd, retningslinjer og verktøy – skrevet med vanlige ord.

Tre valg. Det er alt som skal til – orkestrering, reserveløsninger og finjustering er innebygd fra start.

Vi velger de beste modellene for oppgaven og kobler dem sømløst sammen. De mest avanserte modellene fra OpenAI, Anthropic og Google jobber side om side med modeller med åpen kildekode – orkestrert for best mulig ytelse og pris i hver samtale, så du slipper å tenke på det.

Én prompt,
ikke en graf med noder.

Verktøy for å bygge samtaleflyter finnes fordi svakere systemer ikke klarer å følge komplekse prompter. Hvert trinn i samtalen blir en node du må opprette og vedlikeholde manuelt. Storm følger detaljerte instruksjoner i én enkelt prompt, så du slipper å forholde deg til noder og koblinger.

Plattformer med flytbyggerKoble opp hver forgrening manuelt
Velkomsthilsen prompt · stemme
Hent inn telefonnummer prompt · validering
Bekreft telefonnummer ny prompt ×2
enroll() verktøy · nye forsøk
Sett over til et menneske
Generell fallback ugyldig ×2 · feil

Seks noder for én registreringsflyt – hver med egne prompter, verktøy, overganger og feilhåndtering.

ThunderPhone StormBeskriv ønsket atferd én gang
Atferdsprompt

Hils på innringeren, og hent inn navn og telefonnummer. Bekreft samtykke før registrering – obligatorisk. Hvis innringeren spør om fakturering, følger du retningslinjene for fakturering nedenfor. Kall enroll() bare én gang, og først når alle feltene er bekreftet. Hvis innringeren ber om å få snakke med noen, sett samtalen over til et menneske.

Kompleks forgreningValgfrie overvåkingsmekanismerEnklere å videreutvikle

Én prompt å skrive, teste og finjustere – forgreninger inkludert.

Samtaler i produksjon er uforutsigbare. ThunderPhone er klar.

Mumling, bakgrunnsprat, navn og tall, flere språk om hverandre – ThunderPhone er bygget for situasjonene som får andre systemer til å svikte.

Utydelig tale

Sammenhold lyd- og tekstsignaler i stedet for å stole på én transkripsjon.

Dårlig lyd på telefonen

Modeller for støygjenkjenning og støyreduksjon renser lydsignalet.

Prat i bakgrunnen

Oppdag sidesamtaler før de får stemmeagenten ut av kurs.

Navn og adresser

Kryssjekk egennavn, stavemåter, tall og korrigeringer.

Tale på flere språk

Send samtalen gjennom flerspråklige lyd- og taleløp ved behov.

Lange prompter

Bruk mer robuste resonneringsløp når stemmeagentens atferd ikke kan kokes ned til én regel.

Et feil svar gjør ikke samtalen bedre bare fordi det kommer raskere.

Stemme-AI må svare raskt – men høy fart uten riktige svar gjør bare at feilene kommer raskere. Dagens LLM-er trenger et øyeblikk til å tenke for å gi pålitelige svar. Derfor balanserer ThunderPhone responstid og treffsikkerhet.

Spark~3stil første svar
Bolt~2stil første svar
Storm~2–3s~2 s med bekreftelser · ~3 s uten
Måling

Andre leverandører hevder å ha 500 ms responstid under ideelle forhold, men ligger som regel på rundt 2 s i en reell samtale. Vi måler responstiden under reelle forhold.

Robusthet

Topper i responstiden hos KI-leverandører kan få samtaler til å spore av. Den orkestrerte teknologistakken til ThunderPhone bytter automatisk til raskere alternativer når dette skjer.

Neste generasjon stemme-AI er her.

Automatiserte telefonsamtaler har vært frustrerende … frem til nå. Hvert teknologiske fremskritt har gjort opplevelsen bedre, men aldri gjort den helt sømløs. Det endrer ThunderPhone på.

1990sGenerasjon 1

IVR

«Trykk én for salg, trykk to for support.» Menyene kan ikke gjøre annet enn å rute samtalen.

2010sGenerasjon 2

Intensjonsbaserte boter

Si «salg» eller «fakturering», og håp at slot-parseren oppfatter det.

2024Generasjon 3

KI i tre trinn

Transkriber, spør én rask LLM, og svar deretter med tale – hvert trinn forutsetter at det forrige traff.

2026 · Generasjon 4

Integrert KI

Lyd, tekst, resonnering, verktøy, stemmer og sikkerhetsmekanismer i ett samlet system.

Bygget for samtalene som får alle andre løsninger til å svikte

Prøv den integrerte teknologistakken vår på de mest krevende samtalene dine.

I drift på ti minutter. Fra 2 cent/min.