वॉइस एजेंट्स के लिए GPT-Live-1 API पर हमारी पहली राय
OpenAI ने दो दिन पहले अपना नया फुल-डुप्लेक्स वॉइस मॉडल, GPT-Live-1, API में रिलीज़ किया। हम प्रोडक्शन में AI फोन एजेंट बनाते और चलाते हैं, इसलिए हमने इसे एक असली फोन नंबर पर लगाया और इसे कॉल किया। बहुत बार।
हमने अपने एक इंश्योरेंस ग्राहक की ~13,000-टोकन वॉर्म-लीड क्वालिफिकेशन स्क्रिप्ट के साथ इसका परीक्षण किया, जिसमें अनिवार्य शब्दशः लाइनें, सख्त रीड-बैक नियम और ब्रांचिंग फॉलो-अप थे। एक लंबे दिन में, हमने एक दर्जन असली फोन कॉल, लगभग 25 सिम्युलेटेड इंटरव्यू और अनस्ट्रक्चर्ड टेस्ट का एक बैच चलाया।
ट्रांसक्रिप्ट और ऑडियो के साथ ये हमारी शुरुआती राय हैं। जल्द ही एक अधिक विस्तृत लेख आ रहा है।
ट्रांसक्रिप्ट हमारी टेस्ट कॉल से हैं, जिन्हें GPT-Live ने ट्रांसक्राइब किया है। हमने नाम और पहचान बताने वाले शब्द बदले हैं, बातचीत के हिस्से छोटे किए हैं और अलग-अलग फ्रैगमेंट को मिला दिया है। कॉल शुरू होने के बाद सेकंड में दिए गए टाइमस्टैम्प मूल रिकॉर्डिंग से हैं।
स्वाभाविकता असाधारण है
GPT-Live-1 सबसे स्वाभाविक आवाज़ वाला संवादकर्ता है जिसे हमने कभी फोन लाइन पर लगाया है। यह वास्तव में एक बड़ा कदम आगे है।
यह अलग ट्रांसक्रिप्शन और सिंथेसिस स्टेज के बिना, एक ही लगातार ऑडियो स्ट्रीम पर सुनता और बोलता है। बातचीत की अधिकांश मैकेनिक्स बस काम करती हैं। कॉलर के बोलना बंद करने के लगभग 1.3 सेकंड बाद उन्होंने इसका पहला ऑडियो सुना (मीडियन), या फोन लेग के बिना लगभग 0.7 सेकंड में। हमने कोई वॉइस-एक्टिविटी डिटेक्शन या टर्न-टेकिंग लॉजिक नहीं जोड़ा। यह बीच में टोकने को सहजता से संभालता है, स्वाभाविक बैकचैनल ("Mm-hmm") देता है और तेज़, इंसानों जैसी गति से बोलता है।
जब इसे पढ़ने के लिए लाइनें देने के बजाय लक्ष्य दिए जाते हैं, तो यह सवालों को बातचीत के हिसाब से ढालता है और सुधारों को सहजता से स्वीकार करता है:
सुधारों, बीच में टोकने या कॉलर के कॉल के दौरान जवाब बदलने पर भी इसने कभी संयम नहीं खोया। अगर स्वाभाविकता ही पूरा काम होती, तो यह पोस्ट यहीं खत्म हो जाती। दुर्भाग्य से, मामला इतना भर नहीं है।
यह निर्देशों का भरोसेमंद तरीके से पालन नहीं करता
GPT-Live-1 स्क्रिप्टेड फोन कॉल के लिए महत्वपूर्ण व्यवहारों पर निर्देशों का भरोसेमंद तरीके से पालन नहीं करता।
एक से अधिक बार, इसने स्पष्ट "yes" का जवाब ऐसे दिया जैसे उत्तर "no" था, फिर से सवाल पूछा या ऐसे आगे बढ़ गया जैसे कॉलर ने मना कर दिया हो।
सबसे लगातार दिखने वाली विफलता निर्देशों को बहुत शाब्दिक रूप से लेना थी। हमारे प्रॉम्प्ट में कहा गया था: अगर कॉलर कहता है कि रिकॉर्ड में दर्ज हाउसिंग स्टेटस गलत है, तो पूछें कि क्या वे मालिक हैं, किराए पर रहते हैं या अपने माता-पिता के साथ रहते हैं। एक कॉलर ने कहा, "no, I own it now," जो उस सवाल का जवाब पहले ही देता है। फिर भी मॉडल ने पूरा मेन्यू पढ़ दिया:
शुरुआती कुछ अजीब व्यवहार हमारे प्रॉम्प्ट की गलती थे, लेकिन हमने जो भी प्रॉम्प्ट वेरिएंट आज़माए, उनमें यह शाब्दिकता बनी रही। जिस जवाब को हमने स्पष्ट रूप से नहीं लिखा था, उसे यह समझदारी से नहीं बल्कि यांत्रिक ढंग से संभालता था।
दबाव में यह कभी-कभी ज़ोर से सोचने भी लगता है:
संख्याएँ और अल्फ़ान्यूमेरिक जोखिम भरे हैं
स्पेलिंग, पते, जन्मतिथियाँ और ID नंबर बिल्कुल सटीक होने चाहिए। GPT-Live-1 के स्पीच में सबसे ज़्यादा समस्याएँ यहीं आती हैं।
हमने इसे अल्फ़ान्यूमेरिक स्ट्रिंग्स में कैरेक्टर हटाते और बदलते सुना। यहाँ यह एक काल्पनिक क्लेम नंबर पढ़ता है; साइलेंस ट्रिम करने के अलावा क्लिप्स में कोई बदलाव नहीं किया गया है। अंग्रेज़ी में इसका ट्रांसक्रिप्ट सही था, लेकिन ऑडियो में एक "Y" जुड़ गया:
रूसी में यह और भी खराब था: ऑडियो और उसके ट्रांसक्रिप्ट, दोनों में "Q", "X" बन गया।
तारीखों में भी यही समस्या आई। एक कॉलर ने जन्मतिथि अंकों के रूप में बताई, जिसे मॉडल ने बाद में एक संख्या की तरह दोबारा पढ़ा:
यह कभी-कभी कॉलर की लाइन भी बोल देता है:
अन्य भाषाओं में एक्सेंट
हम अपने प्रोडक्ट द्वारा समर्थित 47 भाषाओं में नए वॉइस मॉडल टेस्ट करते हैं। GPT-Live-1 की रूसी फ़्लूएंट थी, लेकिन उसमें बहुत गहरा अमेरिकी एक्सेंट था (जबकि प्रोडक्शन में चलाए जाने वाले हमारे TTS वॉइस आमतौर पर नेटिव जैसे लगते हैं):
हमने लुगांडा भी आज़माया। पहली कॉल में इसने बजाय इसके स्वाहिली में जवाब दिया। दूसरी कॉल में इसने लुगांडा बोली, जो एक जनरल मॉडल से हमारी उम्मीद से ज़्यादा प्राकृतिक थी, लेकिन फिर भी बहुत गहरे अमेरिकी एक्सेंट के साथ। हमने हर भाषा टेस्ट नहीं की है, लेकिन हमें लगता है कि एक्सेंट का यह पैटर्न शायद सामान्य रूप से लागू होता है। केवल अंग्रेज़ी वाले एजेंट के लिए यह मायने नहीं रखता, लेकिन अन्य भाषाओं के यूज़ केस के लिए यह काफी महत्वपूर्ण चेतावनी है।
जानने लायक कुछ API सीमाएँ
इस सप्ताह हमें जो मिला, उसके आधार पर एक वास्तविक एजेंट के लिए कुछ API सीमाएँ मायने रखती हैं:
- सेशन शुरू होने के बाद इंस्ट्रक्शंस बदले नहीं जा सकते, और उनकी सीमा 16,384 टोकन है।
- आउटपुट ऑडियो की स्ट्रीमिंग कभी नहीं रुकती — साइलेंस भी स्ट्रीम होता है — इसलिए जिन यूज़ केस में टर्न को सेगमेंट करना ज़रूरी है, उनमें "ऑडियो रुक गया" को टर्न-एंड सिग्नल के रूप में इस्तेमाल नहीं किया जा सकता।
- यह केवल नए
v1/live/sessionsएंडपॉइंट के ज़रिए उपलब्ध है, और जब हमने जाँचा तब यह Azure पर अभी उपलब्ध नहीं था।
अब तक हमारी राय
प्रोडक्शन फ़ोन एजेंट्स को प्राकृतिक सुनाई देना चाहिए और स्क्रिप्ट्स का लगातार पालन करना चाहिए। GPT-Live-1 पहले मामले में शानदार है, लेकिन दूसरे मामले में इसकी कुछ गंभीर समस्याएँ हैं। समय के साथ हम और टेस्ट चलाएँगे और अपनी निष्कर्षों की रिपोर्ट देते रहेंगे।