व्हॉइस AI च्या पिढ्या

बहुतेक स्वयंचलित फोन कॉल फारच खराब असतात. नवीन तंत्रज्ञान ते बदलते.

जुनी समस्या अशी नव्हती की फोन ऑटोमेशनकडे आनंददायी आवाज नव्हता. खरी संभाषणे पुढे चालू ठेवण्यासाठी त्यात पुरेशी समज नव्हती.

फोन ट्री

IVR युग

कॉलरला मशीनची भाषा बोलावी लागत होती.

ऑटोमेशन म्हणजे मेन्यू, कीपॅड शाखा आणि रांगा. कॉलरला आधीच योग्य मार्ग माहीत असेल तेव्हा ते काम करत होते.

अडखळलेला क्षण

हेतू बटण दाबण्यापुरता मर्यादित होतो, त्यामुळे मेन्यूबाहेरची कोणतीही गोष्ट ट्रान्सफर किंवा पुनरावृत्ती बनते.

नमुना कॉल

IVR युग

कॉल करणारी व्यक्ती

"मला उद्याची अपॉइंटमेंट बदलायची आहे."

सिस्टम

"बिलिंगसाठी 1 दाबा. शेड्युलिंगसाठी 2 दाबा. इतर सर्व प्रश्नांसाठी 9 दाबा."

निकाल

कॉलर अंदाज बांधतो, थांबतो आणि तीच गोष्ट पुन्हा समजावतो.

सिस्टीम कशी विचार करते

3 टप्पे

मेन्यू prompt

निश्चित

निश्चित स्क्रिप्ट पर्यायांची यादी देते.

DTMF शाखा

नाजूक

एक बटण संपूर्ण हेतू ठरवते.

रांग

अयशस्वी

खरा संदर्भ माणसाकडे गेल्यावर मिळतो.

कस्टम मॉडेल्स

प्रारंभीचे AI

सिस्टम्सना मर्यादित गोष्टी समजत होत्या, मग त्या कोलमडत होत्या.

टीम्सनी विशिष्ट कॉल फ्लोसाठी अॅकूस्टिक मॉडेल्स, हेतू वर्गीकरण करणारी मॉडेल्स आणि स्लॉट एक्स्ट्रॅक्टर्स प्रशिक्षित केले. उपयुक्त, पण बदलणे महागडे.

अडखळलेला क्षण

सिस्टम एक प्रशिक्षित हेतू ओळखू शकते, पण नंतर दुसरी विनंती सोडून देते किंवा कठोर फॉलो-अप विचारते.

नमुना कॉल

प्रारंभीचे AI

कॉल करणारी व्यक्ती

"तुम्ही उद्याची अपॉइंटमेंट बदलू शकता आणि माझ्या जोडीदारालाही जोडू शकता का?"

सिस्टम

"मी रीशेड्यूल करण्यात मदत करू शकतो. तुम्हाला कोणती तारीख हवी आहे?"

निकाल

जोडीदाराची माहिती प्रशिक्षित फ्लोमध्ये नसल्यामुळे हरवते.

सिस्टीम कशी विचार करते

3 टप्पे

कस्टम ASR

निश्चित

एका विशिष्ट डोमेन आणि उच्चारांच्या मिश्रणासाठी ट्यून केलेले.

हेतू मॉडेल

नाजूक

सर्वात जवळच्या ज्ञात विनंतीचे वर्गीकरण करते.

स्लॉट भरणे

अयशस्वी

गहाळ फील्डमुळे स्क्रिप्टेड दुरुस्ती सुरू होते.

Vapi / Retell / ElevenLabs-शैलीचे स्टॅक्स

3-टप्प्यांच्या पाइपलाइन्स

स्टॅक लवचिक झाला, पण प्रत्येक टप्प्याने मागील टप्प्यावर विश्वास ठेवला.

एक सामान्य आधुनिक पॅटर्न स्पीच-टू-टेक्स्ट, LLM आणि टेक्स्ट-टू-स्पीच यांना एका कॉल लूपमध्ये जोडतो.

अडखळलेला क्षण

ट्रान्स्क्रिप्ट चुकीचे असेल किंवा कॉलरने मध्येच व्यत्यय आणला, तर LLM चुकीच्या समजुतीला आत्मविश्वासाने उत्तर देते.

नमुना कॉल

3-टप्प्यांच्या पाइपलाइन्स

कॉल करणारी व्यक्ती

"नाही, मी ही जागा भाड्याने घेतो."

सिस्टम

"समजले, ही रँच मालमत्ता आहे. ते बरोबर आहे का?"

निकाल

ऐकण्यातली एक चूक बोलण्यातल्या चुकीत बदलते.

सिस्टीम कशी विचार करते

3 टप्पे

स्पीच टू टेक्स्ट

अयशस्वी

एकच ट्रान्स्क्रिप्ट सत्याचा एकमेव स्रोत बनते.

LLM

नाजूक

मूळ ऑडिओवरून नाही, तर मजकुरावरून तयार करते.

टेक्स्ट टू स्पीच

अयशस्वी

उत्तर आत्मविश्वासाने परत सांगते.

एकात्मिक व्हॉइस AI

ThunderPhone

सिस्टीम एका लूपमध्ये ऐकू, तर्क करू आणि सावरू शकते.

ThunderPhone ऑडिओ समज, मॉडेल राउटिंग, संवादातील पाळी घेणे आणि प्रतिसाद निर्मिती यांचे एका आर्किटेक्चरमध्ये समन्वयन करते.

काय बदलते

कॉलरपर्यंत पोहोचण्यापूर्वी अनेक ऐकण्याचे मार्ग आणि ऑडिओ-जाणिवेचे तर्क एकाच टप्प्यातील त्रुटी कमी करतात.

नमुना कॉल

ThunderPhone

कॉल करणारी व्यक्ती

"नाही, मी ही जागा भाड्याने घेतो."

सिस्टम

"समजले. तुम्ही तुमचे घर भाड्याने घेतले आहे, त्यामुळे मी मालकीसंबंधी प्रश्न वगळेन."

निकाल

कॉलरला सिस्टीमशी झगडावे न लागता कॉल पुढे सरकतो.

सिस्टीम कशी विचार करते

4 टप्पे

ऑडिओ स्ट्रीम

तपासण्या

तर्कासाठी कच्चा ऑडिओ उपलब्ध राहतो.

पुनरावृत्त श्रवण

तपासण्या

कृतीपूर्वी संकेतांची तुलना केली जाते.

मॉडेल राउटिंग

तपासण्या

वेगवान आणि सखोल मार्ग प्रत्येक टर्नमध्ये एकत्र काम करतात.

नैसर्गिक प्रतिसाद

तपासण्या

कॉलरला दुरुस्त केलेला संदर्भ ऐकू येतो.

याचा परिणाम कुठे दिसतो

मोठी झेप अधिक गोड रोबोटिक आवाजात नाही. ती कॉल योग्य मार्गावर ठेवणाऱ्या आर्किटेक्चरमध्ये आहे.

उत्तम ऐकण्याची क्षमता

एकाच ट्रान्स्क्रिप्टवर विश्वास ठेवण्याऐवजी सिस्टम सिग्नल्सची तुलना करू शकते आणि ऑडिओवर तर्क करू शकते.

उत्तम वेळेचे नियोजन

बोलण्याची पाळी घेणे आणि व्यत्यय हाताळणे हे संभाषणाच्या लूपचा भाग आहेत.

उत्तम राउटिंग

प्रत्येक फेरीच्या गरजेनुसार जलद मार्ग आणि सखोल तर्क निवडता येतात.

उत्तम अनुभव

कॉल करणारे लोक ऑटोमेशन दुरुस्त करण्यात कमी वेळ आणि काम पूर्ण करण्यात अधिक वेळ घालवतात.