बहुतेक व्हॉइस AI प्लॅटफॉर्म 3-टप्प्यांच्या पाइपलाइनवर चालतात: एक ट्रान्सक्रिप्शन मॉडेल, एक नॉन-रीझनिंग LLM आणि एक टेक्स्ट-टू-स्पीच इंजिन. यापैकी कोणत्याही एका टप्प्यात चूक झाली, तरी संपूर्ण कॉल बिघडू शकतो. ThunderPhone एकाच वेळी अनेक मॉडेल्सचा समन्वय साधून चुका कमी करते.
ThunderPhone एकाच वेळी अनेक मॉडेल्सचा समन्वय साधते, त्यामुळे प्रत्येक मॉडेलला इतरांच्या चुका दुरुस्त करता येतात.
वेगवान LLM फक्त ट्रान्सक्रिप्ट पाहतो.
“Hi, Brent — how can I help?”
वेगवान + विचारक्षम LLMs परस्पर पडताळणी करतात: 3 पैकी 2 मार्गांचे एकमत होते.
“Got it — so you rent.”
BBA एखादे मॉडेल बोलून दिलेले prompt समजू शकते का आणि कठीण प्रश्नांची अचूक उत्तरे देऊ शकते का, हे तपासते. आमच्या सर्वात सक्षम Storm कॉन्फिगरेशनच्या नावावर हा विक्रम आहे: आमच्या सार्वजनिक इव्हॅल्युएशन सेटवर 99.4%.
0.6% चुकांचे प्रमाण
वर लिंक केलेल्या आमच्या सार्वजनिक मूल्यमापन डेटासेटमध्ये ThunderPhone ने मिळवलेला निकाल दिला आहे; इतर सार्वजनिक स्कोअर (Artificial Analysis लीडरबोर्ड) संदर्भासाठी दिले आहेत.
Vapi, Retell, Pipecat आणि LiveKitसारख्या इतर व्हॉइस AI प्लॅटफॉर्मवर कॉल्स सुरू करण्यासाठी कॉन्फिगरेशनबाबतचे अनेक निर्णय तुम्हालाच घ्यावे लागतात. ThunderPhone वापरताना मात्र ट्यूनिंगची जबाबदारी आमची आहे; तुमचे कॉल्स सुरळीत चालण्यासाठी तुम्हाला शक्य तितके कमी काम करावे लागावे, हीच आमची भूमिका आहे.
हे सगळं ThunderPhone तुमच्यासाठी ट्यून करतं
Spark, Bolt किंवा Storm.
निवडक आवाज, प्रत्यक्ष कॉल्सवर तपासलेले.
वर्तन, धोरणं, टूल्स — साध्या भाषेत.
फक्त तीन गोष्टी ठरवा. एवढाच सेटअप — ऑर्केस्ट्रेशन, फॉलबॅक आणि ट्यूनिंग आधीपासूनच अंगभूत आहेत.
प्रत्येक कामासाठी सर्वात योग्य मॉडेल्स निवडून आम्ही ती एकत्र वापरतो. OpenAI, Anthropic आणि Google ची अत्याधुनिक मॉडेल्स ओपन-सोर्स मॉडेल्ससोबत काम करतात — प्रत्येक कॉलसाठी कामगिरी आणि किंमत यांचा सर्वोत्तम मेळ साधण्यासाठी आम्ही या सगळ्यांचं ऑर्केस्ट्रेशन करतो, त्यामुळे तुम्हाला त्याची चिंता करावी लागत नाही.
कमकुवत सिस्टिम्सना गुंतागुंतीच्या prompt मधील सूचना पाळता येत नाहीत, म्हणून फ्लो बिल्डर्सची गरज पडते. संभाषणातील प्रत्येक टप्पा एका नोडमध्ये बदलतो; तो नोड तुम्हालाच हाताने तयार करून सांभाळावा लागतो. Storm ला एकाच prompt मधील सविस्तर सूचना पाळता येतात, त्यामुळे नोड्स आणि एजेसची चिंता तुम्हाला करावी लागत नाही.
नोंदणीच्या एकाच फ्लोसाठी सहा नोड्स—प्रत्येकाचे स्वतंत्र prompt, टूल, ट्रान्झिशन आणि काही बिघडल्यास ते हाताळण्याची व्यवस्था.
कॉलरचं स्वागत करा आणि त्यांचं नाव व फोन नंबर नोंदवा. नोंदणी करण्यापूर्वी त्यांच्या संमतीची खात्री करा — हे बंधनकारक आहे. त्यांनी बिलिंगबद्दल विचारल्यास, खाली दिलेलं बिलिंग धोरण पाळा. प्रत्येक फील्डची खात्री झाल्यानंतरच enroll() ला एकदाच कॉल करा. कॉलरने एखाद्या व्यक्तीशी बोलण्याची विनंती केल्यास, मानवी प्रतिनिधीकडे ट्रान्सफर करा.
एकच prompt लिहा, तपासा आणि सुधारत राहा—ब्रँचिंग त्यातच.
अस्पष्ट बोलणे, पार्श्वभूमीतील गप्पांचा आवाज, नावे आणि आकडे, भाषांची सरमिसळ—इतर सिस्टिम्स जिथे अपयशी ठरतात, अशा परिस्थिती हाताळण्यासाठीच ThunderPhone तयार केले आहे.
एका ट्रान्सक्रिप्टवरच विसंबून न राहता ऑडिओ आणि टेक्स्ट सिग्नल्सची तुलना करा.
नॉइज ओळखून तो कमी करणारी मॉडेल्स सिग्नल स्वच्छ करतात.
पार्श्वभूमीतील बोलणं एजंटला भरकटवण्याआधीच ओळखा.
विशेषनामं, स्पेलिंग, क्रमांक आणि दुरुस्त्या पुन्हा पडताळा.
गरजेनुसार कॉल बहुभाषिक ऑडिओ आणि व्हॉइस पाथ्समधून रूट करा.
एजंटचं वर्तन एका नियमात बसवता येत नसेल, तर अधिक सक्षम विचारपद्धती वापरा.
व्हॉइस AI ने झटपट उत्तर द्यायला हवे—पण अचूकता नसेल, तर चुका अधिक वेगाने होतात, एवढेच. विश्वासार्ह राहण्यासाठी आजच्या LLMना विचार करायला थोडा वेळ लागतो. म्हणून ThunderPhone लेटन्सी आणि अचूकता यांचा समतोल साधते.
इतर व्हेंडर्स आदर्श परिस्थितीत 500 मिलीसेकंद लेटन्सीचा दावा करतात; पण प्रत्यक्ष कॉलमध्ये ती साधारण 2 सेकंद असते. आम्ही आमची लेटन्सी प्रत्यक्ष वापरातील परिस्थितीत मोजतो.
AI व्हेंडर्सच्या सेवांमध्ये लेटन्सी अचानक वाढू शकते; त्यामुळे कॉल विस्कळीत होऊ शकतात. अशा वेळी ThunderPhone चा समन्वित स्टॅक आपोआप अधिक वेगवान पर्यायावर स्विच होतो.
ऑटोमेटेड फोन कॉल्सचा अनुभव आजवर त्रासदायकच होता… पण आता नाही. तंत्रज्ञानाच्या प्रत्येक नव्या लाटेसोबत हा अनुभव सुधारत गेला, पण खऱ्या अर्थाने कधीच सुरळीत झाला नाही. ThunderPhone हे समीकरण बदलते.
“सेल्ससाठी 1 दाबा, सपोर्टसाठी 2 दाबा.” अशा मेन्यूचे काम फक्त कॉल रूट करण्यापुरतेच असते.
“सेल्स” किंवा “बिलिंग” म्हणा—आणि स्लॉट पार्सर ते अचूक ओळखेल, अशी आशा करा.
ऑडिओ ट्रान्स्क्राइब करा, एका वेगवान LLM ला विचारा, मग उत्तर बोलून दाखवा—प्रत्येक टप्प्यात आधीचा टप्पा बरोबर असल्याचे गृहीत धरले जाते.
ऑडिओ, मजकूर, रीझनिंग, टूल्स, आवाज आणि गार्डरेल्स—सगळे एका एकसंध सिस्टिममध्ये.
10 मिनिटांत लाइव्ह व्हा. दर मिनिटाला 2¢ पासून.