ज़्यादातर वॉइस AI प्लेटफ़ॉर्म 3-स्टेप पाइपलाइन पर चलते हैं: एक ट्रांसक्रिप्शन मॉडल, एक ऐसा LLM जो रीजनिंग नहीं करता, और एक टेक्स्ट-टू-स्पीच इंजन। हर स्टेप अपने आप में सिंगल पॉइंट ऑफ़ फेल्योर है। ThunderPhone कई मॉडलों को एक साथ तालमेल में चलाकर गलतियाँ कम करता है।
ThunderPhone कई मॉडल एक साथ तालमेल में चलाता है, ताकि वे एक-दूसरे की गलतियाँ सुधार सकें।
तेज़ LLM को सिर्फ़ ट्रांसक्रिप्ट दिखता है।
“नमस्ते, Brent — बताइए, मैं आपकी कैसे मदद करूँ?”
तेज़ LLM और रीजनिंग LLM क्रॉस-चेक करते हैं: 3 में से 2 रास्ते एक ही नतीजे पर पहुँचते हैं।
“ठीक है — तो आप किरायेदार हैं।”
BBA यह परखता है कि कोई मॉडल बोलकर दिए गए प्रॉम्प्ट समझ सकता है और मुश्किल सवालों के सही जवाब दे सकता है या नहीं। हमारे सबसे सक्षम Storm कॉन्फ़िगरेशन के नाम यह रिकॉर्ड है: हमारे पब्लिक इवैल्यूएशन सेट पर 99.4%।
0.6% गलती की दर
ThunderPhone का नतीजा ऊपर लिंक किए गए हमारे सार्वजनिक इवैल्यूएशन डेटासेट से है; अन्य सार्वजनिक स्कोर (Artificial Analysis लीडरबोर्ड) संदर्भ के लिए दिए गए हैं।
Vapi, Retell, Pipecat और LiveKit जैसे दूसरे वॉइस AI प्लेटफ़ॉर्म पर अपनी कॉल्स चलाने के लिए आपको कॉन्फ़िगरेशन से जुड़े ढेरों फ़ैसले लेने पड़ते हैं। ThunderPhone में हम मानते हैं कि ट्यूनिंग हमारा काम है और आपकी कॉल्स सहजता से चलें, इसके लिए आपको कम-से-कम मेहनत करनी पड़े।
इन सभी सेटिंग्स को ThunderPhone आपके लिए ट्यून करता है
Spark, Bolt या Storm।
चुनिंदा वॉइस, असली कॉल्स पर टेस्ट की हुई।
व्यवहार, पॉलिसी और टूल्स — सब कुछ आसान भाषा में।
बस तीन फैसले। सेटअप इतना ही है — ऑर्केस्ट्रेशन, फ़ॉलबैक और ट्यूनिंग पहले से बिल्ट-इन हैं।
हम हर काम के लिए सबसे सही मॉडल चुनकर उन्हें एक साथ जोड़ते हैं। OpenAI, Anthropic और Google के सबसे उन्नत मॉडल, ओपन-सोर्स मॉडल्स के साथ मिलकर काम करते हैं — हर कॉल पर बेहतरीन प्रदर्शन और कीमत के लिए इन सबका ऑर्केस्ट्रेशन हम करते हैं, ताकि आपको इसकी चिंता न करनी पड़े।
फ़्लो बिल्डर्स की ज़रूरत इसलिए पड़ती है क्योंकि कमज़ोर सिस्टम जटिल प्रॉम्प्ट पर नहीं चल पाते। बातचीत का हर स्टेप एक नोड बन जाता है, जिसे आपको मैन्युअली बनाना और मेंटेन करना पड़ता है। Storm एक ही प्रॉम्प्ट में दिए गए विस्तृत निर्देशों पर चलता है, इसलिए आपको नोड्स और एजेज़ की चिंता नहीं करनी पड़ती।
सिर्फ़ एक एनरोलमेंट फ़्लो के लिए छह नोड्स—हर नोड के लिए अलग प्रॉम्प्ट, टूल्स, ट्रांज़िशन और फ़ेल्यर हैंडलिंग।
कॉलर का अभिवादन करें और उनका नाम और फ़ोन नंबर लें। एनरोल करने से पहले सहमति की पुष्टि करना अनिवार्य है। अगर वे बिलिंग के बारे में पूछें, तो नीचे दी गई बिलिंग पॉलिसी का पालन करें। सभी फ़ील्ड की पुष्टि होने के बाद ही enroll() को कॉल करें, और सिर्फ़ एक बार। अगर कॉलर किसी व्यक्ति से बात करना चाहें, तो कॉल किसी इंसान को ट्रांसफ़र करें।
सिर्फ़ एक प्रॉम्प्ट लिखें, टेस्ट करें और इटरेट करें—ब्रांचिंग भी शामिल है।
बुदबुदाकर बोलना, बैकग्राउंड की बातचीत, नाम और नंबर, मिली-जुली भाषाएँ—ThunderPhone उन हालात के लिए बना है, जहाँ दूसरे सिस्टम नाकाम हो जाते हैं।
सिर्फ़ एक ट्रांसक्रिप्ट पर भरोसा करने के बजाय ऑडियो और टेक्स्ट सिग्नल की तुलना करें।
नॉइज़ की पहचान और उसे कम करने वाले मॉडल सिग्नल साफ़ कर देते हैं।
बैकग्राउंड में चल रही बातचीत को पहचानें, इससे पहले कि वह AI फ़ोन एजेंट को भटका दे।
प्रॉपर नाउन, उनकी स्पेलिंग, नंबर और सुधार—सबको क्रॉस-चेक करें।
ज़रूरत पड़ने पर कॉल को मल्टीलिंगुअल ऑडियो और वॉइस पाथ से रूट करें।
जब किसी व्यवहार को एक नियम में समेटना संभव न हो, तो ज़्यादा मज़बूत रीजनिंग पाथ अपनाएँ।
वॉइस AI को जल्दी जवाब देना होता है—लेकिन जवाब सही न हो, तो तेज़ी सिर्फ़ गलतियाँ करने की रफ़्तार बढ़ाती है। आज के LLMs को भरोसेमंद जवाब देने के लिए सोचने का थोड़ा समय चाहिए, इसलिए ThunderPhone लेटेंसी और सटीकता के बीच संतुलन बनाता है।
दूसरे वेंडर आदर्श परिस्थितियों में 500ms लेटेंसी का दावा करते हैं, लेकिन असल कॉल में आम तौर पर करीब 2 सेकंड लगते हैं। हम अपनी लेटेंसी असल परिस्थितियों में मापते हैं।
AI वेंडर्स में आने वाले लेटेंसी स्पाइक्स कॉल बिगाड़ सकते हैं। ऐसा होने पर ThunderPhone का ऑर्केस्ट्रेटेड स्टैक अपने-आप तेज़ विकल्पों पर स्विच हो जाता है।
ऑटोमेटेड फ़ोन कॉल्स का अनुभव झुंझलाहट भरा रहा है… अब तक। टेक्नोलॉजी के हर नए दौर में यह बेहतर हुआ, लेकिन कभी इतना नहीं कि कॉल का अनुभव वाकई सहज हो जाए। ThunderPhone के साथ यह बदल रहा है।
“सेल्स के लिए एक दबाएँ, सपोर्ट के लिए दो।” मेन्यू बस कॉल रूट कर सकते हैं।
“सेल्स” या “बिलिंग” कहिए और उम्मीद कीजिए कि स्लॉट पार्सर इसे पकड़ ले।
पहले ट्रांसक्राइब, फिर एक तेज़ LLM से पूछें, उसके बाद बोलें—हर स्टेप पिछले स्टेप पर भरोसा करता है।
ऑडियो, टेक्स्ट, रीजनिंग, टूल्स, आवाज़ें और गार्डरेल्स—सब एक ही सिस्टम में।
10 मिनट में लाइव। 2¢/मिनट से शुरू।