वॉइस AI की पीढ़ियाँ

ज़्यादातर ऑटोमेटेड फोन कॉल्स बहुत खराब होती हैं। नई टेक्नोलॉजी इसे बदलती है।

पुरानी समस्या यह नहीं थी कि फोन ऑटोमेशन में सुखद आवाज़ की कमी थी। उसमें वास्तविक बातचीत को आगे बढ़ाते रहने के लिए पर्याप्त समझ की कमी थी।

फोन ट्री

IVR युग

कॉलर को मशीन की भाषा बोलनी पड़ती थी।

ऑटोमेशन का मतलब मेन्यू, कीपैड ब्रांच और क्यू था। यह तब काम करता था जब कॉलर को पहले से सही रास्ता पता हो।

अटपटा पल

इंटेंट एक बटन दबाने तक सीमित हो जाता है, इसलिए मेन्यू से बाहर की हर चीज़ ट्रांसफ़र या दोहराव बन जाती है।

नमूना कॉल

IVR युग

कॉलर

"मुझे कल की अपॉइंटमेंट बदलनी है।"

सिस्टम

"बिलिंग के लिए, 1 दबाएँ। शेड्यूलिंग के लिए, 2 दबाएँ। अन्य सभी सवालों के लिए, 9 दबाएँ।"

नतीजा

कॉलर अनुमान लगाता है, इंतज़ार करता है और वही बात फिर से समझाता है।

सिस्टम कैसे सोचता है

3 चरण

मेन्यू प्रॉम्प्ट

ठीक किया गया

एक तय स्क्रिप्ट विकल्पों की सूची देती है।

DTMF ब्रांच

नाज़ुक

एक बटन पूरा इंटेंट बन जाता है।

क्यू

विफल

वास्तविक संदर्भ किसी इंसान के साथ आता है।

कस्टम मॉडल

प्रारंभिक AI

सिस्टम सीमित दायरे को समझते थे, फिर बिखर जाते थे।

टीमों ने विशिष्ट कॉल फ्लो के लिए अकॉस्टिक मॉडल, इंटेंट क्लासिफ़ायर और स्लॉट एक्सट्रैक्टर प्रशिक्षित किए। उपयोगी, लेकिन बदलना महंगा था।

अटपटा पल

सिस्टम एक प्रशिक्षित इंटेंट को समझ सकता है, फिर दूसरा अनुरोध छोड़ देता है या एक कठोर फॉलो-अप पूछता है।

नमूना कॉल

प्रारंभिक AI

कॉलर

"क्या आप कल की अपॉइंटमेंट बदल सकते हैं और मेरे जीवनसाथी को जोड़ सकते हैं?"

सिस्टम

"मैं रीशेड्यूल करने में मदद कर सकता हूँ। आप कौन-सी तारीख चाहेंगे?"

नतीजा

जीवनसाथी की जानकारी खो जाती है क्योंकि वह प्रशिक्षित फ्लो में नहीं है।

सिस्टम कैसे सोचता है

3 चरण

कस्टम ASR

ठीक किया गया

किसी डोमेन और एक्सेंट के मिश्रण के लिए ट्यून किया गया।

इंटेंट मॉडल

नाज़ुक

सबसे निकट के ज्ञात अनुरोध को वर्गीकृत करता है।

स्लॉट फिलिंग

विफल

गुम फ़ील्ड स्क्रिप्टेड सुधार को ट्रिगर करती हैं।

Vapi / Retell / ElevenLabs-शैली के स्टैक

3-चरणीय पाइपलाइन

स्टैक लचीला हो गया, लेकिन हर चरण ने पिछले चरण पर भरोसा किया।

एक आम आधुनिक पैटर्न स्पीच-टू-टेक्स्ट, LLM और टेक्स्ट-टू-स्पीच को एक कॉल लूप में जोड़ता है।

अटपटा पल

जब ट्रांसक्रिप्ट गलत होता है या कॉलर बीच में बोलता है, तो LLM आत्मविश्वास से गलत कॉल का जवाब देता है।

नमूना कॉल

3-चरणीय पाइपलाइन

कॉलर

"नहीं, मैं जगह किराए पर लेता हूँ।"

सिस्टम

"समझ गया, यह रैंच की प्रॉपर्टी है। क्या यह सही है?"

नतीजा

सुनने की एक गलती बोलने की गलती बन जाती है।

सिस्टम कैसे सोचता है

3 चरण

स्पीच से टेक्स्ट

विफल

एक ट्रांसक्रिप्ट ही सत्य का स्रोत बन जाता है।

LLM

नाज़ुक

मूल ऑडियो से नहीं, टेक्स्ट से जनरेट करता है।

टेक्स्ट से स्पीच

विफल

आत्मविश्वास के साथ जवाब वापस बोलता है।

इंटीग्रेटेड वॉइस AI

ThunderPhone

सिस्टम एक ही लूप में सुन सकता है, रीजन कर सकता है और संभल सकता है।

ThunderPhone ऑडियो समझ, मॉडल रूटिंग, टर्न-टेकिंग और जवाब जनरेशन को एक ही आर्किटेक्चर के रूप में समन्वित करता है।

क्या बदलता है

सुनने के कई रास्ते और ऑडियो-अवेयर रीजनिंग, एकल-चरण की विफलताओं को कॉलर तक पहुंचने से पहले कम करते हैं।

नमूना कॉल

ThunderPhone

कॉलर

"नहीं, मैं जगह किराए पर लेता हूँ।"

सिस्टम

"समझ गया। आप अपना घर किराए पर लेते हैं, इसलिए मैं मालिकाना हक से जुड़े सवाल छोड़ दूंगा।"

नतीजा

कॉलर को सिस्टम से जूझे बिना कॉल आगे बढ़ती है।

सिस्टम कैसे सोचता है

4 चरण

ऑडियो स्ट्रीम

सत्यापित

रीजनिंग के लिए रॉ ऑडियो उपलब्ध रहता है।

रिडंडेंट हियरिंग

सत्यापित

कार्रवाई से पहले संकेतों की तुलना की जाती है।

मॉडल रूटिंग

सत्यापित

तेज और गहरे पथ हर टर्न में मिलकर काम करते हैं।

स्वाभाविक जवाब

सत्यापित

कॉलर सुधरा हुआ संदर्भ सुनता है।

यह कहाँ पहुँचता है

बड़ी सफलता कोई अधिक सुंदर रोबोटिक आवाज़ नहीं है। यह ऐसी आर्किटेक्चर है जो कॉल को सही दिशा में बनाए रखती है।

बेहतर सुनना

सिस्टम केवल एक ट्रांसक्रिप्ट पर भरोसा करने के बजाय संकेतों की तुलना कर सकता है और ऑडियो पर रीजनिंग कर सकता है।

बेहतर टाइमिंग

बारी लेने और बीच में टोकने का प्रबंधन बातचीत के लूप का हिस्सा हैं।

बेहतर रूटिंग

हर टर्न की ज़रूरतों के अनुसार तेज़ पथ और गहरी रीजनिंग चुनी जा सकती है।

बेहतर अनुभव

कॉल करने वाले ऑटोमेशन को सुधारने में कम समय और काम पूरा करने में ज़्यादा समय लगाते हैं।