Většina platforem pro hlasovou AI spoléhá na tříkrokovou pipeline: jeden model pro přepis, jeden LLM bez schopnosti uvažovat a jeden engine pro převod textu na řeč. Každý krok představuje jediný bod selhání. ThunderPhone omezuje chyby tím, že koordinuje celou řadu modelů najednou.
ThunderPhone koordinuje řadu modelů najednou, takže si navzájem opravují chyby.
Rychlý model LLM má k dispozici pouze přepis.
„Dobrý den, Brente — jak vám mohu pomoci?“
Rychlé modely LLM a modely LLM s pokročilým uvažováním se navzájem kontrolují: 2 ze 3 cest se shodnou.
„Rozumím — takže bydlíte v nájmu.“
BBA ověřuje, zda model rozumí mluveným promptům a dokáže správně odpovídat na náročné otázky. Rekord drží naše nejsilnější konfigurace Storm: 99,4 % na naší veřejné evaluační sadě.
0.6% chybovost
Výsledek ThunderPhone vychází z našeho veřejného evaluačního datasetu, na který odkazujeme výše. Ostatní veřejná skóre z žebříčku Artificial Analysis uvádíme pro srovnání.
Jiné platformy pro hlasovou AI, jako jsou Vapi, Retell, Pipecat a LiveKit, vás nutí rozhodovat o celé řadě detailů konfigurace, než hovory vůbec zprovozníte. V ThunderPhone věříme, že ladění je na nás. Vy byste měli udělat jen naprosté minimum, aby vaše hovory fungovaly bez zádrhelů.
Tohle všechno za vás vyladí ThunderPhone
Spark, Bolt nebo Storm.
Pečlivě vybrané a otestované v reálných hovorech.
Chování, pravidla i nástroje — popsané běžným jazykem.
Tři rozhodnutí. A nastavení je hotové — orchestrace, záložní řešení i ladění jsou už součástí produktu.
Pro každý úkol vybíráme ty nejlepší modely a propojujeme je do jednoho celku. Špičkové modely od OpenAI, Anthropic a Googlu doplňují open-source modely — vše řídíme tak, aby každý hovor nabídl nejlepší výkon i cenu a vy se o nic nemuseli starat.
Nástroje pro tvorbu konverzačních toků vznikly proto, že slabší systémy nezvládají složité prompty. Každý krok konverzace se v nich mění na uzel, který musíte ručně vytvořit a udržovat. Storm se řídí podrobnými instrukcemi zadanými v jediném promptu, takže uzly ani hrany nemusíte řešit.
Šest uzlů pro jediný registrační proces — každý má vlastní prompty, nástroje, přechody i ošetření chyb.
Přivítejte volajícího a zjistěte jeho jméno a telefonní číslo. Před registrací si vyžádejte souhlas — je povinný. Pokud se zeptá na fakturaci, postupujte podle níže uvedených pravidel pro fakturaci. Nástroj enroll() spusťte až po potvrzení všech údajů a pouze jednou. Pokud volající požádá o spojení s člověkem, přepojte ho na živého operátora.
Napíšete, otestujete a postupně vyladíte jediný prompt — včetně větvení.
Mumlání, hlasy v pozadí, jména a čísla, střídání jazyků — ThunderPhone je navržený pro situace, ve kterých jiné systémy selhávají.
Porovnávejte signály z audia a textu, místo abyste se spoléhali na jediný přepis.
Modely pro detekci a potlačení šumu čistí signál.
Rozpoznejte vedlejší konverzace dřív, než agenta vykolejí.
Vlastní jména, hláskování, čísla i opravy vždy ověřujte podle více signálů.
Směrujte hovor podle potřeby přes vícejazyčné zpracování audia a hlasu.
Když chování nelze zredukovat na jediné pravidlo, zapojte pokročilejší postupy uvažování.
Hlasová AI musí odpovídat rychle — rychlost bez přesnosti ale znamená jen rychlejší chyby. Dnešní modely LLM potřebují chvíli na rozmyšlenou, aby fungovaly spolehlivě. ThunderPhone proto vyvažuje latenci a přesnost.
Ostatní poskytovatelé uvádějí za ideálních podmínek latenci 500 ms, ale obvykle dosahují při skutečném hovoru zhruba 2 s. Latenci měříme v reálných podmínkách.
Poskytovatelé AI se potýkají s náhlými nárůsty latence, které mohou narušit průběh hovoru. Orchestrovaný stack ThunderPhone v takové situaci přepne na rychlejší řešení.
Automatizované telefonní hovory dosud přinášely hlavně frustraci… Každý další technologický posun sice přinesl zlepšení, nikdy ale ne takové, aby celý hovor probíhal opravdu hladce. ThunderPhone to mění.
„Pro obchod stiskněte jedničku, pro podporu dvojku.“ Taková menu umějí hovory jen přesměrovat.
Řekněte „obchod“ nebo „fakturace“ a doufejte, že to parser slotů správně zachytí.
Nejdřív přepis, potom odpověď z jednoho rychlého LLM a nakonec převod na řeč — každý krok spoléhá na výsledek toho předchozího.
Zvuk, text, uvažování, nástroje, hlasy a ochranné mechanismy v jediném systému.
V ostrém provozu za deset minut. Od 2 centů za minutu.