वॉइस AI की पीढ़ियाँ
ज़्यादातर ऑटोमेटेड फोन कॉल्स बहुत खराब होती हैं। नई टेक्नोलॉजी इसे बदलती है।
पुरानी समस्या यह नहीं थी कि फोन ऑटोमेशन में सुखद आवाज़ की कमी थी। उसमें वास्तविक बातचीत को आगे बढ़ाते रहने के लिए पर्याप्त समझ की कमी थी।
फोन कॉल को ऑटोमेट करना आसान होता जाता है
हर पीढ़ी मशीन में अधिक संदर्भ लाती है।
फोन ट्री
IVR युग
कॉलर को मशीन की भाषा बोलनी पड़ती थी।
ऑटोमेशन का मतलब मेन्यू, कीपैड ब्रांच और क्यू था। यह तब काम करता था जब कॉलर को पहले से सही रास्ता पता हो।
अटपटा पल
इंटेंट एक बटन दबाने तक सीमित हो जाता है, इसलिए मेन्यू से बाहर की हर चीज़ ट्रांसफ़र या दोहराव बन जाती है।
नमूना कॉल
IVR युग
कॉलर
"मुझे कल की अपॉइंटमेंट बदलनी है।"
सिस्टम
"बिलिंग के लिए, 1 दबाएँ। शेड्यूलिंग के लिए, 2 दबाएँ। अन्य सभी सवालों के लिए, 9 दबाएँ।"
नतीजा
कॉलर अनुमान लगाता है, इंतज़ार करता है और वही बात फिर से समझाता है।
सिस्टम कैसे सोचता है
3 चरणमेन्यू प्रॉम्प्ट
ठीक किया गयाएक तय स्क्रिप्ट विकल्पों की सूची देती है।
DTMF ब्रांच
नाज़ुकएक बटन पूरा इंटेंट बन जाता है।
क्यू
विफलवास्तविक संदर्भ किसी इंसान के साथ आता है।
कस्टम मॉडल
प्रारंभिक AI
सिस्टम सीमित दायरे को समझते थे, फिर बिखर जाते थे।
टीमों ने विशिष्ट कॉल फ्लो के लिए अकॉस्टिक मॉडल, इंटेंट क्लासिफ़ायर और स्लॉट एक्सट्रैक्टर प्रशिक्षित किए। उपयोगी, लेकिन बदलना महंगा था।
अटपटा पल
सिस्टम एक प्रशिक्षित इंटेंट को समझ सकता है, फिर दूसरा अनुरोध छोड़ देता है या एक कठोर फॉलो-अप पूछता है।
नमूना कॉल
प्रारंभिक AI
कॉलर
"क्या आप कल की अपॉइंटमेंट बदल सकते हैं और मेरे जीवनसाथी को जोड़ सकते हैं?"
सिस्टम
"मैं रीशेड्यूल करने में मदद कर सकता हूँ। आप कौन-सी तारीख चाहेंगे?"
नतीजा
जीवनसाथी की जानकारी खो जाती है क्योंकि वह प्रशिक्षित फ्लो में नहीं है।
सिस्टम कैसे सोचता है
3 चरणकस्टम ASR
ठीक किया गयाकिसी डोमेन और एक्सेंट के मिश्रण के लिए ट्यून किया गया।
इंटेंट मॉडल
नाज़ुकसबसे निकट के ज्ञात अनुरोध को वर्गीकृत करता है।
स्लॉट फिलिंग
विफलगुम फ़ील्ड स्क्रिप्टेड सुधार को ट्रिगर करती हैं।
Vapi / Retell / ElevenLabs-शैली के स्टैक
3-चरणीय पाइपलाइन
स्टैक लचीला हो गया, लेकिन हर चरण ने पिछले चरण पर भरोसा किया।
एक आम आधुनिक पैटर्न स्पीच-टू-टेक्स्ट, LLM और टेक्स्ट-टू-स्पीच को एक कॉल लूप में जोड़ता है।
अटपटा पल
जब ट्रांसक्रिप्ट गलत होता है या कॉलर बीच में बोलता है, तो LLM आत्मविश्वास से गलत कॉल का जवाब देता है।
नमूना कॉल
3-चरणीय पाइपलाइन
कॉलर
"नहीं, मैं जगह किराए पर लेता हूँ।"
सिस्टम
"समझ गया, यह रैंच की प्रॉपर्टी है। क्या यह सही है?"
नतीजा
सुनने की एक गलती बोलने की गलती बन जाती है।
सिस्टम कैसे सोचता है
3 चरणस्पीच से टेक्स्ट
विफलएक ट्रांसक्रिप्ट ही सत्य का स्रोत बन जाता है।
LLM
नाज़ुकमूल ऑडियो से नहीं, टेक्स्ट से जनरेट करता है।
टेक्स्ट से स्पीच
विफलआत्मविश्वास के साथ जवाब वापस बोलता है।
इंटीग्रेटेड वॉइस AI
ThunderPhone
सिस्टम एक ही लूप में सुन सकता है, रीजन कर सकता है और संभल सकता है।
ThunderPhone ऑडियो समझ, मॉडल रूटिंग, टर्न-टेकिंग और जवाब जनरेशन को एक ही आर्किटेक्चर के रूप में समन्वित करता है।
क्या बदलता है
सुनने के कई रास्ते और ऑडियो-अवेयर रीजनिंग, एकल-चरण की विफलताओं को कॉलर तक पहुंचने से पहले कम करते हैं।
नमूना कॉल
ThunderPhone
कॉलर
"नहीं, मैं जगह किराए पर लेता हूँ।"
सिस्टम
"समझ गया। आप अपना घर किराए पर लेते हैं, इसलिए मैं मालिकाना हक से जुड़े सवाल छोड़ दूंगा।"
नतीजा
कॉलर को सिस्टम से जूझे बिना कॉल आगे बढ़ती है।
सिस्टम कैसे सोचता है
4 चरणऑडियो स्ट्रीम
सत्यापितरीजनिंग के लिए रॉ ऑडियो उपलब्ध रहता है।
रिडंडेंट हियरिंग
सत्यापितकार्रवाई से पहले संकेतों की तुलना की जाती है।
मॉडल रूटिंग
सत्यापिततेज और गहरे पथ हर टर्न में मिलकर काम करते हैं।
स्वाभाविक जवाब
सत्यापितकॉलर सुधरा हुआ संदर्भ सुनता है।
यह कहाँ पहुँचता है
बड़ी सफलता कोई अधिक सुंदर रोबोटिक आवाज़ नहीं है। यह ऐसी आर्किटेक्चर है जो कॉल को सही दिशा में बनाए रखती है।
बेहतर सुनना
सिस्टम केवल एक ट्रांसक्रिप्ट पर भरोसा करने के बजाय संकेतों की तुलना कर सकता है और ऑडियो पर रीजनिंग कर सकता है।
बेहतर टाइमिंग
बारी लेने और बीच में टोकने का प्रबंधन बातचीत के लूप का हिस्सा हैं।
बेहतर रूटिंग
हर टर्न की ज़रूरतों के अनुसार तेज़ पथ और गहरी रीजनिंग चुनी जा सकती है।
बेहतर अनुभव
कॉल करने वाले ऑटोमेशन को सुधारने में कम समय और काम पूरा करने में ज़्यादा समय लगाते हैं।