ThunderPhone ची घोषणा
अपडेट, ऑगस्ट 2026: ही मार्च 2026 मधील आमची मूळ लाँच घोषणा आहे, जी भविष्यासाठी जतन करून ठेवली आहे. त्यानंतर काही तपशील — विशेषतः किंमत आणि आवाजाचे पर्याय — बदलले आहेत; आज लागू असलेल्या माहितीसाठी सध्याची किंमत पहा. आणि प्रतीक्षा संपली आहे: v2 लाँच घोषणा वाचा!
आज, AI च्या मदतीने फोन कॉल्स स्वयंचलित करणे सोपे करणाऱ्या ThunderPhone च्या सार्वजनिक लाँचची घोषणा करताना आम्हाला अभिमान वाटतो. इतर फोन AI प्लॅटफॉर्मपेक्षा पूर्णपणे वेगळ्या एकात्मिक आर्किटेक्चरमुळे, ThunderPhone अधिक उच्च कार्यक्षमता, कमी खर्च आणि एकत्रीकरणातील कमी त्रास साध्य करू शकते. ThunderPhone डझनभर भाषांमध्ये इनबाउंड आणि आउटबाउंड कॉल्सना समर्थन देते आणि HIPAA व GDPR अनुरूप आहे.
एकात्मिकतेचा फायदा
इतर फोन AI प्लॅटफॉर्म त्यांच्या सिस्टीमवर 3-टप्प्यांची रचना लादून त्यांच्या सिस्टीमची कार्यक्षमता मर्यादित करतात:
- एक ट्रान्सक्रिप्शन मॉडेल, जे वापरकर्त्याचा आवाज मजकुरात रूपांतरित करते.
- एक LLM, जे वापरकर्त्याच्या मजकुरावर प्रक्रिया करते आणि प्रतिसाद देते.
- एक TTS मॉडेल, जे प्रतिसादाचा मजकूर पुन्हा ऑडिओमध्ये रूपांतरित करते.
त्यांपैकी बहुतेक प्लॅटफॉर्म वापरकर्त्यांना कोणती मॉडेल्स वापरायची हे निवडण्यास भाग पाडून, तसेच डिनॉइजिंग आणि प्रतिसादक्षमतेचे पॅरामीटर्स यांसारखे कॉन्फिगरेशन पर्याय निवडण्यास भाग पाडून, अभियांत्रिकीचे कामही वापरकर्त्यांवर ढकलतात.
आम्ही वेगळा दृष्टिकोन स्वीकारला आहे: आज उपलब्ध असलेल्या मॉडेल्ससह आमच्या मते सर्वोत्तम शक्य स्टॅक कॉन्फिगर केला आहे आणि क्लिष्ट कॉन्फिगरेशनच्या प्रयत्नांशिवाय वापरण्यासाठी तयार केला आहे. आमची सिस्टीम एकाच वेळी अनेक मॉडेल्स वापरते आणि संभाषणाच्या प्रवाहानुसार त्यांच्यामध्ये बुद्धिमानपणे रूटिंग करते. यामध्ये समाविष्ट आहे:
- वेग आणि अचूकता यांचा समतोल साधण्यासाठी आणि एकमेकांच्या चुका भरून काढण्यासाठी अनेक ट्रान्सक्रिप्शन मॉडेल्स एकत्र करणे; यांपैकी काही अधिक वेगवान, तर काही अधिक अचूक असतात.
- कमी सर्वसाधारण बुद्धिमत्ता पण अधिक चांगले ऑडिओ आकलन असू शकणारी ऑडिओ-इनपुट LLMs, आणि चुकीच्या ट्रान्सक्रिप्टमुळे चुका होऊ शकणारी पण अनेकदा अधिक बुद्धिमान असणारी फक्त-मजकूर LLMs, एकत्र करणे.
- जलद प्रतिसाद तयार करू शकणारी वेगवान पण कमी बुद्धिमान LLMs, आणि पार्श्वभूमीत चालून AI त्याच्या prompt चे पालन करत आहे व वापरकर्ता जे म्हणतो त्याला योग्य प्रतिसाद देत आहे याची खात्री करू शकणारी अधिक बुद्धिमान पण धीमी LLMs, एकत्र करणे.
- आज उपलब्ध असलेली सर्वोच्च बुद्धिमत्ता देणारी OpenAI आणि Google यांसह आघाडीच्या प्रदात्यांची व्यावसायिक मॉडेल्स, आणि कमी खर्चात अनेकदा अधिक वेग देणारी विविध ओपन-सोर्स मॉडेल्स, एकत्र करणे.
- पार्श्वभूमीतील आवाज, बाजूची संभाषणे आणि संभाषण भरकटवू शकणारे इतर विचलित करणारे आवाज वर्गीकृत करून दूर करण्यासाठी एकाच वेळी अनेक मॉडेल्स वापरणे.
हे घटक आणि आणखी बरेच काही आमच्या तीन सेवा स्तरांमध्ये — Spark, Bolt, आणि Storm — वेगवेगळ्या प्रकारे संयोजित केले जाते: Spark खर्चासाठी, Bolt वेगासाठी आणि Storm बुद्धिमत्तेसाठी अनुकूलित केले जाते, तसेच प्रत्येकाचे तोटे शक्य तितके कमी केले जातात. तिन्ही सिस्टीममध्ये व्यक्तिनामे आणि स्पेलिंग असले तरी वापरकर्ते काय म्हणतात याचे अविश्वसनीयपणे अचूक आकलन यांसारखे फायदे सामायिक आहेत.
आमच्या मते, हे घट्टपणे एकत्रित केलेले आर्किटेक्चर इतर विक्रेत्यांनी देऊ केलेल्या कठोर 3-टप्प्यांच्या दृष्टिकोनापेक्षा कमी खर्चात आमच्या सिस्टीमला खूपच अधिक कार्यक्षमता देते. क्ले क्रिस्टेन्सन यांच्या मॉड्युलॅरिटी सिद्धांतानुसार, व्हॉइस AI अजूनही सुरुवातीच्या टप्प्यात आहे आणि मॉड्युलर आर्किटेक्चरसह सानुकूलनक्षमता वाढवण्यापेक्षा एकात्मिक आर्किटेक्चरसह कार्यक्षमता कमाल करणे अजूनही अधिक मौल्यवान आहे.
अनुकूलित निर्णय
आणि सानुकूलनक्षमतेबाबत, आम्ही तिच्या विरोधात आहोत! आजचे बहुतेक फोन AI प्लॅटफॉर्म वापरकर्त्यांना असंख्य पर्यायांमधून मार्ग काढण्यास भाग पाडतात—वापरल्या जाणाऱ्या नेमक्या मॉडेल्सपासून ते AI वापरकर्त्याला किती लवकर मध्येच थांबवतो यांसारख्या अतिशय तपशीलवार पॅरामीटर्सपर्यंत.
आमच्या मते, हे पर्याय पडद्यामागे अनुकूलित करणे हे आमचेच काम आहे, जेणेकरून ThunderPhone चे वापरकर्ते त्यांना ज्या गोष्टी उत्तम जमतात त्यावर लक्ष केंद्रित करू शकतील आणि तपशीलवार व्हॉइस AI कॉन्फिगरेशनची काळजी करावी लागणार नाही. आम्ही स्वतःला एक प्रकारचे Squarespace मानतो, जे आमच्या वापरकर्त्यांना आजच्या मॉडेल्ससह शक्य तितक्या सर्वोच्च कार्यक्षमतेने फोन एजंट सेट अप करणे अगदी सहज बनवते.
वापरण्याची सुलभता
ThunderPhone वापरण्यासही अत्यंत सोपे आहे, मग तुम्ही नवीन फोन एजंट सेट अप करत असाल किंवा वेगळ्या प्लॅटफॉर्मवरून अथवा कस्टम स्टॅकमधून स्थलांतर करत असाल. ThunderPhone वर फोन एजंट सेट अप करण्यासाठी तुम्हाला फक्त हे करावे लागेल:
- तुम्हाला Spark, Bolt किंवा Storm यापैकी कोणता वापरायचा आहे ते ठरवा.
- एक आवाज निवडा.
- आम्हाला तुमचा prompt द्या. मल्टी-prompt एजंटची गरज नाही! तुमचा prompt Spark किंवा Bolt साठी खूप गुंतागुंतीचा असेल, तर Storm वर अपग्रेड करा, जो एका prompt सह जटिल वापर-प्रकरणेही हाताळू शकतो.
- अत्यंत सोप्या विझार्डद्वारे सॉफ्टवेअर इंटिग्रेशन्स जोडा (कोणताही endpoint किंवा नेटिव्ह n8n इंटिग्रेशन).
- अत्यंत सोप्या विझार्डद्वारे तुमचे VoIP जोडा.
हे सर्व सामान्यतः 10 मिनिटे किंवा त्याहून कमी वेळात होते.
ThunderPhone HIPAA आणि GDPR अनुरूप आहे, आणि विनंती केल्यावर आम्ही BAA आणि DPA वर स्वाक्षरी करून प्रदान करू.
आमची कहाणी
आम्ही Stanford AI Lab आणि Y Combinator चे माजी सदस्य असलेली एक टीम आहोत आणि 2024 पासून व्हॉइस AI वर काम करत आहोत. सुरुवातीला आमचा भर Flux Interpreting वर होता, जे फोन कॉलचे भाषांदरम्यान भाषांतर करते. पण ग्राहकांनी केवळ कॉलचे भाषांतर करण्याऐवजी त्यांच्या व्यवसायांसाठी फोन कॉल स्वयंचलित करण्याची वारंवार विनंती केल्यानंतर, आम्ही आमचा भर आता ThunderPhone म्हणून ओळखल्या जाणाऱ्या उत्पादनाकडे वळवला.
विद्यमान प्लॅटफॉर्म्समधील समस्या
सुरुवातीला, आम्ही इतर कंपन्यांच्या फोन AI प्लॅटफॉर्म्सवर ग्राहकांसाठी फोन एजंट तयार करायला सुरुवात केली. आम्ही बाजारातील जवळपास प्रत्येक फोन AI प्लॅटफॉर्मची चाचणी घेतली, पण दुर्दैवाने ते अपुरे वाटले, विशेषतः पुढील बाबतीत:
- ऑडिओ समजून घेणे: वापरकर्त्याच्या ऑडिओचे मजकुरात रूपांतर करण्यासाठी फक्त एकच ट्रान्सक्रिप्शन मॉडेल असण्याच्या मर्यादेमुळे AI अनेकदा वापरकर्त्याचे म्हणणे “चुकीचे ऐकत” असे, विशेषतः व्यक्तिनामे, दुर्मिळ शब्द आणि शब्दलेखनाच्या बाबतीत.
- सूचनांचे पालन: कॉलमागील प्रत्यक्ष “बौद्धिक काम” करणारे एकच वेगवान LLM असल्यामुळे AI ना अनेकदा सूचनांचे योग्य पालन करण्यात अडचण येई आणि ते भरकटत असत.
- कठीण इंटिग्रेशन्स: आम्ही वापरून पाहिलेल्या प्लॅटफॉर्म्समुळे बाह्य सॉफ्टवेअरशी जोडणी करणे खूप अवघड होते; सामान्यतः टूल कॉल्ससाठी विस्तृत JSON कॉन्फिगरेशन्स टाइप करावी लागत आणि ती अचानक काम करेपर्यंत फारसा अभिप्राय न मिळता त्यांच्याशी वारंवार झुंजावे लागत असे.
- किंमत: विद्यमान प्लॅटफॉर्म्सची किंमत सामान्यतः खूपच जास्त होती: मध्यम दर्जाच्या कामगिरीसाठीही सहसा प्रति मिनिट 10 सेंट किंवा अधिक.
आमचा स्वतःचा स्टॅक तयार करणे
एका एंटरप्राइझ ग्राहकासाठी विक्री कॉलचा वापरप्रकार अंमलात आणण्याचा करार केल्यानंतर, त्यांच्या गरजा पूर्ण करण्यासाठी आम्हाला आमचा स्वतःचा सानुकूल स्टॅक तयार करावा लागला. हा वापरप्रकार मागणीचा होता: ग्राहक सहाय्यापेक्षा वेगळे, जिथे कॉल करणारे बहुतांशी व्यवसायाच्या मर्जीवर असतात, विक्रीसाठी कॉल करणारे पटकन कॉल कट करतात.
लीड गमावण्याऐवजी विक्री पूर्ण करण्यासाठी कॉलची गुणवत्ता उत्कृष्ट असणे आवश्यक आहे. याचा अर्थ नावे आणि पत्त्यांसह अनेक व्यक्तिनामे व शब्दलेखन हाताळणे, जे मानक ट्रान्सक्रिप्शन मॉडेल्सना अचूक ओळखणे कठीण जाते. हा वापरप्रकार उत्तम प्रकारे हाताळण्यासाठी आम्ही आजचे ThunderPhone तयार केले.
या प्रवासात, आम्हाला San Francisco मधील व्हॉइस AI समुदायात पशुवैद्य, ट्रक चालक आणि इतरांसाठी विशिष्ट क्षेत्रातील फोन एजंट कंपन्या उभारत असलेले लोक भेटत राहिले. आश्चर्याची गोष्ट म्हणजे, त्यांच्यापैकी बहुतेकांचे मत एकच होते: विद्यमान प्लॅटफॉर्म्स डेमोसाठी पुरेसे चांगले होते, पण उत्पादनासाठी नाहीत.
धक्कादायक म्हणजे, विशिष्ट क्षेत्रातील व्हॉइस AI कंपन्यांमधील आमचे अनेक, कदाचित बहुतेक मित्र प्रत्यक्षात स्वतःचे स्टॅक “तयार करत” होते... हे आम्हाला अजिबात पटत नव्हते — हे म्हणजे 90 च्या दशकातील वेब स्टार्टअप्सना त्यांच्या कपाटातील सर्व्हरवर स्वतःचे वेब सर्व्हर होस्ट करावे लागण्यासारखेच आहे.
या जाणिवेमुळे आम्हाला कळले की आमची फोन AI प्रणाली अशी प्लॅटफॉर्म बनवण्याची वेळ आली आहे, जी कोणीही वापरू शकेल.
विशिष्ट क्षेत्रातील व्हॉइस AI कंपन्या आणि सल्लागारांनी त्यांच्या उद्योगविशिष्ट कौशल्याच्या आधारे लक्ष्यित बाजाराच्या गरजा पूर्ण करण्यावर लक्ष केंद्रित करता यायला हवे — मूळ AI आणि फोन तंत्रज्ञानाचे गुंतागुंतीचे अभियांत्रिकी करण्यावर नाही! ThunderPhone सोबत आम्ही आज हेच सादर करत आहोत.
इथपर्यंत पोहोचण्यासाठी बराच मोठा प्रवास झाला आहे! गेल्या एप्रिलपासून आमच्याकडे नोंदणी करूनही अजून प्रवेशाची वाट पाहत असलेल्या प्रत्येकाची माफी: काम पूर्ण करण्यासाठीचा झटपट टप्पा वाटलेली गोष्ट, आज उपलब्ध असलेल्या मॉडेल्सना शक्य तितकी मजबूत प्रणाली बनवण्यासाठी कसे एकत्र विणायचे हे शोधण्याच्या अनेक महिन्यांच्या प्रवासात बदलली.
पण आता आम्ही अखेर लाइव्ह आहोत — वापरून पाहा आणि तुम्हाला काय वाटते ते सांगा!
आम्ही मोठ्या अडचणी दूर केल्या असल्या, तरी प्रणालीमध्ये अजूनही काही बग असण्याची शक्यता आहे. तुम्हाला काही समस्या आढळल्यास, कृपया alex@thunderphone.com वर ईमेल करा; ती तुमच्यासाठी शक्य तितक्या लवकर दुरुस्त केली जाईल याची मी खात्री करेन. तुमच्या काही फीचर विनंत्याही असतील तर मला कळवा; त्या शक्य तितक्या लवकर पूर्ण करण्याचाही आम्ही प्रयत्न करू.
आणि तुमच्या अधिक सानुकूल गरजा असतील, जसे की सानुकूल अंमलबजावणी व इंटिग्रेशन सहाय्य, नियमित HIPAA आणि GDPR च्या पलीकडील अनुपालन, SLA आणि सानुकूल फीचर विनंत्या, तर आम्हाला एंटरप्राइझ कराराबद्दल चर्चा करण्यास आनंद होईल. alex@thunderphone.com वर संपर्क करा; आम्ही तुमच्या गरजा आणि आम्ही मदत करू शकतो का याबद्दल बोलू.
आणि अधिक व्यापकपणे सांगायचे तर: तुमच्याकडून कमीतकमी प्रयत्न घेऊन ThunderPhone सुरुवातीपासूनच कार्यरत राहील आणि तुम्ही निवडलेल्या किंमत स्तराच्या मर्यादेत — Spark, Bolt किंवा Storm — आजच्या AI सह शक्य तितक्या उत्तम प्रकारे तुमच्या व्यवसायाचे कॉल हाताळेल, याची खात्री करणे हे आमचे काम आहे. आम्हाला एक संधी द्या; ThunderPhone काय करू शकते हे तुम्हाला दाखवण्यासाठी आम्ही उत्सुक आहोत.
तुम्हाला काय वाटते ते आम्हाला कळवा, आणि तुमच्या पाठिंब्यासाठी धन्यवाद!