व्हॉइस एजंट्ससाठी GPT-Live-1 API बद्दल आमचे पहिले अनुभव
OpenAI ने दोन दिवसांपूर्वी त्याचे नवीन पूर्ण-डुप्लेक्स व्हॉइस मॉेल GPT-Live-1 API मध्ये रिलीज केले. आम्ही उत्पादन वातावरणात AI फोन एजंट तयार करतो आणि चालवतो, म्हणून आम्ही ते एका खऱ्या फोन नंबरवर लावले आणि त्याला फोन केला. खूप वेळा.
आम्ही आमच्या एका विमा ग्राहकाच्या सुमारे 13,000-टोकनच्या वॉर्म-लीड पात्रता स्क्रिप्टसह त्याची चाचणी केली. त्यात शब्दशः बोलणे बंधनकारक असलेल्या ओळी, काटेकोर पुनरुच्चार नियम आणि शाखांनुसार पुढील प्रश्न होते. एका दीर्घ दिवसात आम्ही डझनभर खरे फोन कॉल, सुमारे 25 सिम्युलेटेड मुलाखती आणि असंरचित चाचण्यांचा एक बॅच घेतला.
ट्रान्सक्रिप्ट आणि ऑडिओसह आमची ही पहिली निरीक्षणे आहेत. अधिक सविस्तर लेख लवकरच येत आहे.
ट्रान्सक्रिप्ट आमच्या चाचणी कॉलमधून आहेत आणि GPT-Live ने त्यांचे ट्रान्सक्रिप्शन केले आहे. आम्ही नावे आणि ओळख पटवणारी शब्दरचना बदलली आहे, संवाद लहान केले आहेत आणि विभागलेले तुकडे एकत्र केले आहेत. कॉल सुरू झाल्यापासून सेकंदांतील टाइमस्टॅम्प मूळ रेकॉर्डिंगमधील आहेत.
नैसर्गिकपणा अपवादात्मक आहे
GPT-Live-1 हा आम्ही फोन लाईनवर वापरलेला सर्वात नैसर्गिक वाटणारा संभाषणकर्ता आहे. ही खरोखरच मोठी झेप आहे.
वेगळ्या ट्रान्सक्रिप्शन आणि सिंथेसिस टप्प्यांशिवाय, तो एका सततच्या ऑडिओ स्ट्रीमवर ऐकतो आणि बोलतो. संभाषणातील बहुतांश यंत्रणा सहजपणे काम करतात. कॉलरने बोलणे थांबवल्यानंतर त्यांचा पहिला ऑडिओ मध्यक 1.3 सेकंदांत ऐकू आला, किंवा फोन कनेक्शन वगळल्यास सुमारे 0.7 सेकंदांत. आम्ही कोणतेही व्हॉइस-अॅक्टिव्हिटी डिटेक्शन किंवा टर्न-टेकिंग लॉजिक जोडले नाही. तो व्यत्यय सहजतेने हाताळतो, नैसर्गिक प्रतिसादसूचक ध्वनी ("हं-हं") देतो आणि चपळ, माणसासारख्या गतीने बोलतो.
वाचून दाखवायच्या ओळींऐवजी उद्दिष्टे दिली असता, तो प्रश्न संभाषणानुसार जुळवतो आणि दुरुस्त्या सहज स्वीकारतो:
दुरुस्त्या, व्यत्यय किंवा कॉलरने कॉलच्या मधोमध उत्तरे बदलली तरी त्याने कधीही संयम गमावला नाही. नैसर्गिकपणाच संपूर्ण काम असते, तर हा लेख इथेच संपला असता. दुर्दैवाने, गोष्ट तेवढ्यापुरती मर्यादित नाही.
तो सूचना विश्वासार्हपणे पाळत नाही
स्क्रिप्टेड फोन कॉलसाठी महत्त्वाच्या असलेल्या वर्तनांबाबत GPT-Live-1 सूचना विश्वासार्हपणे पाळत नाही.
एकापेक्षा जास्त वेळा, त्याने स्पष्ट "हो" ला उत्तर "नाही" असल्याप्रमाणे प्रतिसाद दिला, प्रश्न पुन्हा विचारला किंवा कॉलरने नकार दिल्यासारखे पुढे गेला.
सूचनांचा अतिशय शब्दशः अर्थ घेणे ही सर्वात सातत्यपूर्ण त्रुटी होती. आमच्या prompt मध्ये म्हटले होते: कॉलरने नोंदवरील निवासस्थिती चुकीची असल्याचे सांगितल्यास, ते स्वतःचे घर मालकीचे आहे, भाड्याने घेतलेले आहे की पालकांसोबत राहतात हे विचारा. एका कॉलरने "नाही, आता ते माझे आहे" असे सांगितले, ज्यामुळे त्या प्रश्नाचे उत्तर आधीच मिळते. तरीही मॉडेलने मेनू वाचून दाखवला:
सुरुवातीचा काही विचित्रपणा आमच्या prompt मुळे होता, पण आम्ही वापरलेल्या प्रत्येक prompt प्रकारात हा शब्दशःपणा कायम राहिला. आम्ही स्पष्टपणे नमूद न केलेले कोणतेही उत्तर समजूतदारपणे हाताळण्याऐवजी यांत्रिक पद्धतीने हाताळले गेले.
दबावाखाली तो कधीकधी मोठ्याने विचारही करतो:
अंक आणि अल्फान्यूमेरिक स्ट्रिंग्ज धोकादायक असतात
स्पेलिंग्ज, पत्ते, जन्मतारखा आणि ID क्रमांक अचूक असणे आवश्यक असते. इथेच GPT-Live-1 च्या बोलण्यात सर्वाधिक समस्या दिसतात.
अल्फान्यूमेरिक स्ट्रिंग्जमध्ये अक्षरे गाळणे आणि बदलणे आम्ही ऐकले. येथे ते एक काल्पनिक क्लेम क्रमांक वाचते; शांतता ट्रिम करण्याव्यतिरिक्त क्लिप्समध्ये कोणताही बदल केलेला नाही. इंग्रजीमध्ये, त्याचे ट्रान्स्क्रिप्ट बरोबर होते, पण ऑडिओमध्ये अतिरिक्त "Y" आला:
रशियनमध्ये ते आणखी वाईट होते: ऑडिओ आणि ट्रान्स्क्रिप्ट दोन्हीमध्ये "Q" चे "X" झाले.
तारखांमुळेही तीच समस्या निर्माण झाली. एका कॉलरने जन्मतारीख अंकांच्या स्वरूपात दिली, जी मॉडेलने नंतर एक संख्या म्हणून पुन्हा वाचली:
कधीकधी ते कॉलरची असलेली ओळही बोलते:
इतर भाषांमधील उच्चार
आमचे उत्पादन ज्या 47 भाषांना समर्थन देते, त्या सर्व भाषांमध्ये आम्ही नवीन व्हॉइस मॉडेल्सची चाचणी करतो. GPT-Live-1 चे रशियन प्रवाही होते, पण त्यात ठळक अमेरिकन उच्चार होता (उत्पादनात आम्ही वापरत असलेले TTS व्हॉइसेस सामान्यतः स्थानिकांसारखे वाटतात):
आम्ही लुगांडा देखील वापरून पाहिले. पहिल्या कॉलमध्ये, त्याने त्याऐवजी स्वाहिलीमध्ये उत्तर दिले. दुसऱ्या कॉलमध्ये, त्याने लुगांडामध्ये बोलले—सामान्य मॉडेलकडून अपेक्षेपेक्षा अधिक नैसर्गिकपणे—पण पुन्हा ठळक अमेरिकन उच्चारासह. आम्ही प्रत्येक भाषेची चाचणी केलेली नाही, पण हा उच्चारांचा पॅटर्न बहुधा सर्वत्र लागू होईल अशी आमची अपेक्षा आहे. केवळ इंग्रजीतील एजंटसाठी हे महत्त्वाचे नाही, पण इतर भाषांमधील वापराच्या बाबतीत ही बरीच महत्त्वाची मर्यादा आहे.
जाणून घेण्यासारख्या काही API मर्यादा
या आठवड्यात आम्हाला जे आढळले त्यानुसार, खऱ्या एजंटसाठी काही API मर्यादा महत्त्वाच्या आहेत:
- सेशन सुरू झाल्यानंतर सूचना बदलता येत नाहीत, आणि त्यांची मर्यादा 16,384 टोकन्स इतकी आहे.
- आउटपुट ऑडिओचे स्ट्रीमिंग कधीच थांबत नाही — शांततेचेही स्ट्रीमिंग होते — त्यामुळे टर्न्सचे विभाजन आवश्यक असलेल्या वापरांमध्ये "ऑडिओ थांबला" हा टर्न-एंड सिग्नल म्हणून वापरता येत नाही.
- ते केवळ नवीन
v1/live/sessionsएंडपॉइंटद्वारे उपलब्ध आहे, आणि आम्ही तपासले तेव्हा ते Azure वर अजून उपलब्ध नव्हते.
आतापर्यंतचा आमचा निष्कर्ष
उत्पादनातील फोन एजंटना नैसर्गिक वाटले पाहिजे आणि स्क्रिप्ट्सचे सातत्याने पालन करता आले पाहिजे. GPT-Live-1 पहिल्या बाबतीत अप्रतिम आहे, पण दुसऱ्या बाबतीत त्यात काही गंभीर समस्या आहेत. वेळोवेळी आम्ही आणखी चाचण्या करत राहू आणि आमचे निष्कर्ष नोंदवत राहू.