टेक्नोलॉजी

3-स्टेप पाइपलाइन से
आगे बढ़ें

ज़्यादातर वॉइस AI प्लेटफ़ॉर्म 3-स्टेप पाइपलाइन पर चलते हैं: एक ट्रांसक्रिप्शन मॉडल, एक ऐसा LLM जो रीजनिंग नहीं करता, और एक टेक्स्ट-टू-स्पीच इंजन। हर स्टेप अपने आप में सिंगल पॉइंट ऑफ़ फेल्योर है। ThunderPhone कई मॉडलों को एक साथ तालमेल में चलाकर गलतियाँ कम करता है।

कॉलर ने कहा “I rent”
ASR A“I rent”
ASR B“I’m Brent”
ऑडियो LLM“I rent”
मिलान से तय हुआ “I rent”3 में से 2 पाथ के जवाब एक जैसे

कई तरह से सुनें,
फिर एक नतीजे पर पहुँचें।

ThunderPhone कई मॉडल एक साथ तालमेल में चलाता है, ताकि वे एक-दूसरे की गलतियाँ सुधार सकें।

कॉलर बुदबुदाकर कहता है, “I rent.”
दूसरे प्लेटफ़ॉर्म3-स्टेप पाइपलाइन
एक बार सुनता है
STT “I’m Brent”
इकलौता मॉडल गलत सुन ले, तो कोई बैकअप नहीं
तुरंत जवाब

तेज़ LLM को सिर्फ़ ट्रांसक्रिप्ट दिखता है।

बोलता है

“नमस्ते, Brent — बताइए, मैं आपकी कैसे मदद करूँ?”

1 ट्रांसक्रिप्ट + 1 LLM = गलत जवाब
ThunderPhoneऑर्केस्ट्रेटेड
तीन तरीकों से सुनता है
“I rent”“I’m Brent”“I rent”
सबूत के तौर पर तीन ट्रांसक्रिप्ट और रॉ ऑडियो सुरक्षित रखे जाते हैं
मिलान करता है

तेज़ LLM और रीजनिंग LLM क्रॉस-चेक करते हैं: 3 में से 2 रास्ते एक ही नतीजे पर पहुँचते हैं।

बोलता है

“ठीक है — तो आप किरायेदार हैं।”

पेचीदा जानकारी भी पहली बार में सही पकड़ता है।

Storm ने Big Bench Audio पर इंटेलिजेंस के नए रिकॉर्ड कायम किए हैं।

BBA यह परखता है कि कोई मॉडल बोलकर दिए गए प्रॉम्प्ट समझ सकता है और मुश्किल सवालों के सही जवाब दे सकता है या नहीं। हमारे सबसे सक्षम Storm कॉन्फ़िगरेशन के नाम यह रिकॉर्ड है: हमारे पब्लिक इवैल्यूएशन सेट पर 99.4%।

0.6% गलती की दर

· जुलाई 2026Hugging Face पर डेटासेट
ThunderPhoneStorm · Extra Intelligence0.6%
Qwen Audio 3.0Realtime Plus0.8%
Qwen3.5 OmniPlus Realtime1.3%
Step-Audio R1.1Realtime2.4%

ThunderPhone का नतीजा ऊपर लिंक किए गए हमारे सार्वजनिक इवैल्यूएशन डेटासेट से है; अन्य सार्वजनिक स्कोर (Artificial Analysis लीडरबोर्ड) संदर्भ के लिए दिए गए हैं।

वॉइस स्टैक का हर हिस्सा खुद जोड़ने की ज़रूरत नहीं होनी चाहिए।

Vapi, Retell, Pipecat और LiveKit जैसे दूसरे वॉइस AI प्लेटफ़ॉर्म पर अपनी कॉल्स चलाने के लिए आपको कॉन्फ़िगरेशन से जुड़े ढेरों फ़ैसले लेने पड़ते हैं। ThunderPhone में हम मानते हैं कि ट्यूनिंग हमारा काम है और आपकी कॉल्स सहजता से चलें, इसके लिए आपको कम-से-कम मेहनत करनी पड़े।

अन्य वॉइस AI प्लेटफ़ॉर्मट्यून करने के लिए ढेरों सेटिंग्स
STTv4-largeSTT फ़ॉलबैकLLMtemp 0.3LLM फ़ॉलबैकTTSTTS फ़ॉलबैकVAD0.62एंडपॉइंटिंग240 msबार्ज-इन थ्रेशोल्ड−38 dBबैकचैनल फ़िल्टरइंटरप्शनटर्न टाइमआउट800 msडीनॉइज़िंगजिटर बफ़र60 msसैंपल रेट8 kHzटूल स्कीमारीट्राई पॉलिसी×3फ़ॉलबैक

इन सभी सेटिंग्स को ThunderPhone आपके लिए ट्यून करता है

ThunderPhoneतीन फ़ैसले
1
टियर चुनें

Spark, Bolt या Storm।

2
वॉइस चुनें

चुनिंदा वॉइस, असली कॉल्स पर टेस्ट की हुई।

3
अपना प्रॉम्प्ट लिखें

व्यवहार, पॉलिसी और टूल्स — सब कुछ आसान भाषा में।

बस तीन फैसले। सेटअप इतना ही है — ऑर्केस्ट्रेशन, फ़ॉलबैक और ट्यूनिंग पहले से बिल्ट-इन हैं।

हम हर काम के लिए सबसे सही मॉडल चुनकर उन्हें एक साथ जोड़ते हैं। OpenAI, Anthropic और Google के सबसे उन्नत मॉडल, ओपन-सोर्स मॉडल्स के साथ मिलकर काम करते हैं — हर कॉल पर बेहतरीन प्रदर्शन और कीमत के लिए इन सबका ऑर्केस्ट्रेशन हम करते हैं, ताकि आपको इसकी चिंता न करनी पड़े।

एक प्रॉम्प्ट,
नोड्स का ग्राफ़ नहीं।

फ़्लो बिल्डर्स की ज़रूरत इसलिए पड़ती है क्योंकि कमज़ोर सिस्टम जटिल प्रॉम्प्ट पर नहीं चल पाते। बातचीत का हर स्टेप एक नोड बन जाता है, जिसे आपको मैन्युअली बनाना और मेंटेन करना पड़ता है। Storm एक ही प्रॉम्प्ट में दिए गए विस्तृत निर्देशों पर चलता है, इसलिए आपको नोड्स और एजेज़ की चिंता नहीं करनी पड़ती।

फ़्लो-बिल्डर प्लेटफ़ॉर्महर ब्रांच मैन्युअली जोड़ें
ग्रीटिंग प्रॉम्प्ट · वॉइस
फ़ोन नंबर लें प्रॉम्प्ट · वैलिडेशन
फ़ोन नंबर की पुष्टि करें री-प्रॉम्प्ट ×2
enroll() टूल · रीट्राई
इंसानी एजेंट तक एस्केलेट करें
बाकी सभी स्थितियों के लिए फ़ॉलबैक इनवैलिड ×2 · एरर

सिर्फ़ एक एनरोलमेंट फ़्लो के लिए छह नोड्स—हर नोड के लिए अलग प्रॉम्प्ट, टूल्स, ट्रांज़िशन और फ़ेल्यर हैंडलिंग।

ThunderPhone Stormएजेंट को क्या करना है, बस एक बार बताएं
व्यवहार प्रॉम्प्ट

कॉलर का अभिवादन करें और उनका नाम और फ़ोन नंबर लें। एनरोल करने से पहले सहमति की पुष्टि करना अनिवार्य है। अगर वे बिलिंग के बारे में पूछें, तो नीचे दी गई बिलिंग पॉलिसी का पालन करें। सभी फ़ील्ड की पुष्टि होने के बाद ही enroll() को कॉल करें, और सिर्फ़ एक बार। अगर कॉलर किसी व्यक्ति से बात करना चाहें, तो कॉल किसी इंसान को ट्रांसफ़र करें

जटिल ब्रांचिंगऑप्शनल वॉचडॉग्सआसान इटरेशन

सिर्फ़ एक प्रॉम्प्ट लिखें, टेस्ट करें और इटरेट करें—ब्रांचिंग भी शामिल है।

प्रोडक्शन में कॉल्स उलझी होती हैं। ThunderPhone तैयार है

बुदबुदाकर बोलना, बैकग्राउंड की बातचीत, नाम और नंबर, मिली-जुली भाषाएँ—ThunderPhone उन हालात के लिए बना है, जहाँ दूसरे सिस्टम नाकाम हो जाते हैं।

अस्पष्ट बोली

सिर्फ़ एक ट्रांसक्रिप्ट पर भरोसा करने के बजाय ऑडियो और टेक्स्ट सिग्नल की तुलना करें।

खराब फ़ोन ऑडियो

नॉइज़ की पहचान और उसे कम करने वाले मॉडल सिग्नल साफ़ कर देते हैं।

बैकग्राउंड की बातचीत

बैकग्राउंड में चल रही बातचीत को पहचानें, इससे पहले कि वह AI फ़ोन एजेंट को भटका दे।

नाम और पते

प्रॉपर नाउन, उनकी स्पेलिंग, नंबर और सुधार—सबको क्रॉस-चेक करें।

मिली-जुली भाषाओं वाली स्पीच

ज़रूरत पड़ने पर कॉल को मल्टीलिंगुअल ऑडियो और वॉइस पाथ से रूट करें।

लंबे प्रॉम्प्ट

जब किसी व्यवहार को एक नियम में समेटना संभव न हो, तो ज़्यादा मज़बूत रीजनिंग पाथ अपनाएँ।

गलत जवाब जल्दी मिले, तो कॉल बेहतर नहीं हो जाती।

वॉइस AI को जल्दी जवाब देना होता है—लेकिन जवाब सही न हो, तो तेज़ी सिर्फ़ गलतियाँ करने की रफ़्तार बढ़ाती है। आज के LLMs को भरोसेमंद जवाब देने के लिए सोचने का थोड़ा समय चाहिए, इसलिए ThunderPhone लेटेंसी और सटीकता के बीच संतुलन बनाता है।

Spark~3sपहले जवाब तक
Bolt~2sपहले जवाब तक
Storm~2–3s~2 सेकंड एकनॉलेजमेंट के साथ · ~3 सेकंड बिना एकनॉलेजमेंट के
मेज़रमेंट

दूसरे वेंडर आदर्श परिस्थितियों में 500ms लेटेंसी का दावा करते हैं, लेकिन असल कॉल में आम तौर पर करीब 2 सेकंड लगते हैं। हम अपनी लेटेंसी असल परिस्थितियों में मापते हैं।

रेज़िलिएंस

AI वेंडर्स में आने वाले लेटेंसी स्पाइक्स कॉल बिगाड़ सकते हैं। ऐसा होने पर ThunderPhone का ऑर्केस्ट्रेटेड स्टैक अपने-आप तेज़ विकल्पों पर स्विच हो जाता है

वॉइस AI की अगली पीढ़ी आ चुकी है

ऑटोमेटेड फ़ोन कॉल्स का अनुभव झुंझलाहट भरा रहा है… अब तक। टेक्नोलॉजी के हर नए दौर में यह बेहतर हुआ, लेकिन कभी इतना नहीं कि कॉल का अनुभव वाकई सहज हो जाए। ThunderPhone के साथ यह बदल रहा है।

1990sजनरेशन 1

IVR

“सेल्स के लिए एक दबाएँ, सपोर्ट के लिए दो।” मेन्यू बस कॉल रूट कर सकते हैं।

2010sजनरेशन 2

इंटेंट बॉट्स

“सेल्स” या “बिलिंग” कहिए और उम्मीद कीजिए कि स्लॉट पार्सर इसे पकड़ ले।

2024जनरेशन 3

थ्री-स्टेप AI

पहले ट्रांसक्राइब, फिर एक तेज़ LLM से पूछें, उसके बाद बोलें—हर स्टेप पिछले स्टेप पर भरोसा करता है।

2026 · अबजनरेशन 4

इंटीग्रेटेड AI

ऑडियो, टेक्स्ट, रीजनिंग, टूल्स, आवाज़ें और गार्डरेल्स—सब एक ही सिस्टम में।

उन कॉल्स के लिए बना है, जिनके आगे बाकी सब नाकाम हो जाते हैं

अपनी सबसे मुश्किल कॉल्स पर हमारा इंटीग्रेटेड स्टैक आज़माएँ।

10 मिनट में लाइव। 2¢/मिनट से शुरू।