De fleste plattformer for stemme-AI baserer seg på en 3-trinnsprosess: én transkripsjonsmodell, én LLM uten resonnering og én tekst-til-tale-motor. Hvert trinn kan alene få hele kjeden til å svikte. ThunderPhone reduserer feil ved å samkjøre mange modeller samtidig.
ThunderPhone samkjører mange modeller samtidig og lar dem rette opp hverandres feil.
En rask LLM ser bare transkripsjonen.
“Hi, Brent — how can I help?”
Raske og resonnerende LLM-er kryssjekker: 2 av 3 spor er enige.
“Got it — so you rent.”
BBA tester om en modell kan forstå muntlige prompter og svare riktig på vanskelige spørsmål. Vår sterkeste Storm-konfigurasjon har rekorden: 99,4 % på det offentlig tilgjengelige evalueringssettet vårt.
0.6% feilrate
ThunderPhones resultat er hentet fra vårt offentlig tilgjengelige evalueringsdatasett, som er lenket til ovenfor. Andre offentlige resultater fra Artificial Analysis-resultattavlen er tatt med til sammenligning.
Andre plattformer for stemme-AI, som Vapi, Retell, Pipecat og LiveKit, tvinger deg til å konfigurere en lang rekke detaljer før samtalene fungerer. Hos ThunderPhone mener vi at finjusteringen er vår jobb, og at du skal gjøre minst mulig for å få samtalene til å gå knirkefritt.
ThunderPhone finjusterer alt dette for deg
Spark, Bolt eller Storm.
Håndplukket og testet i ekte samtaler.
Atferd, retningslinjer og verktøy – skrevet med vanlige ord.
Tre valg. Det er alt som skal til – orkestrering, reserveløsninger og finjustering er innebygd fra start.
Vi velger de beste modellene for oppgaven og kobler dem sømløst sammen. De mest avanserte modellene fra OpenAI, Anthropic og Google jobber side om side med modeller med åpen kildekode – orkestrert for best mulig ytelse og pris i hver samtale, så du slipper å tenke på det.
Verktøy for å bygge samtaleflyter finnes fordi svakere systemer ikke klarer å følge komplekse prompter. Hvert trinn i samtalen blir en node du må opprette og vedlikeholde manuelt. Storm følger detaljerte instruksjoner i én enkelt prompt, så du slipper å forholde deg til noder og koblinger.
Seks noder for én registreringsflyt – hver med egne prompter, verktøy, overganger og feilhåndtering.
Hils på innringeren, og hent inn navn og telefonnummer. Bekreft samtykke før registrering – obligatorisk. Hvis innringeren spør om fakturering, følger du retningslinjene for fakturering nedenfor. Kall enroll() bare én gang, og først når alle feltene er bekreftet. Hvis innringeren ber om å få snakke med noen, sett samtalen over til et menneske.
Én prompt å skrive, teste og finjustere – forgreninger inkludert.
Mumling, bakgrunnsprat, navn og tall, flere språk om hverandre – ThunderPhone er bygget for situasjonene som får andre systemer til å svikte.
Sammenhold lyd- og tekstsignaler i stedet for å stole på én transkripsjon.
Modeller for støygjenkjenning og støyreduksjon renser lydsignalet.
Oppdag sidesamtaler før de får stemmeagenten ut av kurs.
Kryssjekk egennavn, stavemåter, tall og korrigeringer.
Send samtalen gjennom flerspråklige lyd- og taleløp ved behov.
Bruk mer robuste resonneringsløp når stemmeagentens atferd ikke kan kokes ned til én regel.
Stemme-AI må svare raskt – men høy fart uten riktige svar gjør bare at feilene kommer raskere. Dagens LLM-er trenger et øyeblikk til å tenke for å gi pålitelige svar. Derfor balanserer ThunderPhone responstid og treffsikkerhet.
Andre leverandører hevder å ha 500 ms responstid under ideelle forhold, men ligger som regel på rundt 2 s i en reell samtale. Vi måler responstiden under reelle forhold.
Topper i responstiden hos KI-leverandører kan få samtaler til å spore av. Den orkestrerte teknologistakken til ThunderPhone bytter automatisk til raskere alternativer når dette skjer.
Automatiserte telefonsamtaler har vært frustrerende … frem til nå. Hvert teknologiske fremskritt har gjort opplevelsen bedre, men aldri gjort den helt sømløs. Det endrer ThunderPhone på.
«Trykk én for salg, trykk to for support.» Menyene kan ikke gjøre annet enn å rute samtalen.
Si «salg» eller «fakturering», og håp at slot-parseren oppfatter det.
Transkriber, spør én rask LLM, og svar deretter med tale – hvert trinn forutsetter at det forrige traff.
Lyd, tekst, resonnering, verktøy, stemmer og sikkerhetsmekanismer i ett samlet system.
I drift på ti minutter. Fra 2 cent/min.