De flesta plattformar för röst-AI bygger på en pipeline i 3 steg: en transkriptionsmodell, en LLM som inte resonerar och en text-till-tal-motor. Varje enskilt steg kan få hela kedjan att fallera. ThunderPhone minskar antalet fel genom att samordna många modeller samtidigt.
ThunderPhone samordnar flera modeller parallellt och låter dem rätta varandras misstag.
En snabb LLM-modell ser bara transkriptionen.
”Hej, Jahir — hur kan jag hjälpa till?”
Snabba och resonerande LLM-modeller dubbelkollar: 2 av 3 vägar är överens.
”Okej, du hyr alltså.”
BBA testar om en modell kan förstå talade promptar och besvara svåra frågor korrekt. Vår starkaste konfiguration av Storm har rekordet: 99,4 % på vårt publika utvärderingsdataset.
0.6% felfrekvens
ThunderPhones resultat kommer från vårt offentliga utvärderingsdataset, som länkas ovan. Övriga offentliga resultat (topplistan hos Artificial Analysis) visas som referens.
Med andra plattformar för röst-AI, som Vapi, Retell, Pipecat och LiveKit, tvingas du göra mängder av konfigurationsval för att få samtalen att fungera. På ThunderPhone är finjusteringen vårt jobb. Du ska behöva göra så lite som möjligt för att få samtalen att flyta på.
ThunderPhone finjusterar allt åt dig
Spark, Bolt eller Storm.
Noggrant utvalda och testade i riktiga samtal.
Beteende, policy och verktyg – i klartext.
Tre val. Det är hela konfigurationen – orkestrering, reservlösningar och finjustering ingår från start.
Vi väljer de bästa modellerna för uppgiften och får dem att fungera tillsammans. De mest avancerade modellerna från OpenAI, Anthropic och Google arbetar sida vid sida med modeller med öppen källkod – orkestrerade för bästa prestanda och pris i varje samtal, så att du slipper tänka på det.
Flödesbyggare finns för att svagare system inte kan följa komplexa promptar. Varje steg i samtalet blir en nod som du måste bygga och underhålla manuellt. Storm följer avancerade instruktioner i en enda prompt, så du slipper tänka på noder och kopplingar.
Sex noder för ett enda registreringsflöde – var och en med egna promptar, verktyg, övergångar och felhantering.
Hälsa på personen som ringer och samla in personens namn och telefonnummer. Bekräfta samtycket innan du registrerar personen – obligatoriskt. Om personen har frågor om fakturering följer du faktureringspolicyn nedan. Anropa enroll() endast en gång, och först när alla fält har bekräftats. Om personen ber att få prata med någon, koppla vidare till en människa.
En enda prompt att skriva, testa och finslipa – förgreningarna ingår.
Otydligt tal, bakgrundsprat, namn och nummer, språk som blandas – ThunderPhone är byggt för situationer där andra system går bet.
Jämför ljud- och textsignaler i stället för att lita på en enda transkribering.
Modeller för brusdetektering och brusreducering rensar upp signalen.
Upptäck sidokonversationer innan de får röstagenten att tappa tråden.
Stäm av egennamn, stavningar, nummer och rättelser mot varandra.
Använd flerspråkig dirigering via ljud- och röstflöden vid behov.
Använd robustare resonemangskedjor när ett beteende inte går att reducera till en enda regel.
Röst-AI måste svara snabbt – men snabbhet utan korrekta svar innebär bara att misstagen kommer snabbare. Dagens LLM:er behöver en stund att tänka för att ge tillförlitliga svar, så ThunderPhone balanserar svarstid och träffsäkerhet.
Andra leverantörer uppger 500 ms latens under idealiska förhållanden, men ligger i regel på omkring 2 s i ett verkligt samtal. Vi mäter vår latens under verkliga förhållanden.
AI-leverantörer drabbas av latenstoppar som kan få samtal att spåra ur. ThunderPhone använder en orkestrerad stack som växlar över till snabbare alternativ när det händer.
Automatiserade telefonsamtal har länge varit frustrerande … fram till nu. För varje ny teknikgeneration har upplevelsen blivit bättre, men aldrig riktigt smidig. ThunderPhone ändrar på det.
”Tryck ett för försäljning, tryck två för support.” Menyer kan bara koppla samtalet vidare.
Säg ”försäljning” eller ”fakturering” och hoppas att slotparsern lyckas tolka det.
Transkribera, fråga en snabb LLM och svara sedan med röst – varje steg förlitar sig på det föregående.
Ljud, text, resonemang, verktyg, röster och skyddsmekanismer – samlat i ett enda system.