ThunderPhone 2.0 आता लाइव्ह आहे.स्वतःच सुरू करा, 2¢/मिनिटपासून.घोषणा वाचा
सर्व लेख

व्हॉइस एजंट्ससाठी GPT-Live-1 API बद्दल आमचे पहिले अनुभव

१२ सप्टेंबर, २०२६Alex Kolchinski

OpenAI ने दोन दिवसांपूर्वी त्याचे नवीन पूर्ण-डुप्लेक्स व्हॉइस मॉेल GPT-Live-1 API मध्ये रिलीज केले. आम्ही उत्पादन वातावरणात AI फोन एजंट तयार करतो आणि चालवतो, म्हणून आम्ही ते एका खऱ्या फोन नंबरवर लावले आणि त्याला फोन केला. खूप वेळा.

आम्ही आमच्या एका विमा ग्राहकाच्या सुमारे 13,000-टोकनच्या वॉर्म-लीड पात्रता स्क्रिप्टसह त्याची चाचणी केली. त्यात शब्दशः बोलणे बंधनकारक असलेल्या ओळी, काटेकोर पुनरुच्चार नियम आणि शाखांनुसार पुढील प्रश्न होते. एका दीर्घ दिवसात आम्ही डझनभर खरे फोन कॉल, सुमारे 25 सिम्युलेटेड मुलाखती आणि असंरचित चाचण्यांचा एक बॅच घेतला.

ट्रान्सक्रिप्ट आणि ऑडिओसह आमची ही पहिली निरीक्षणे आहेत. अधिक सविस्तर लेख लवकरच येत आहे.

ट्रान्सक्रिप्ट आमच्या चाचणी कॉलमधून आहेत आणि GPT-Live ने त्यांचे ट्रान्सक्रिप्शन केले आहे. आम्ही नावे आणि ओळख पटवणारी शब्दरचना बदलली आहे, संवाद लहान केले आहेत आणि विभागलेले तुकडे एकत्र केले आहेत. कॉल सुरू झाल्यापासून सेकंदांतील टाइमस्टॅम्प मूळ रेकॉर्डिंगमधील आहेत.

नैसर्गिकपणा अपवादात्मक आहे

GPT-Live-1 हा आम्ही फोन लाईनवर वापरलेला सर्वात नैसर्गिक वाटणारा संभाषणकर्ता आहे. ही खरोखरच मोठी झेप आहे.

वेगळ्या ट्रान्सक्रिप्शन आणि सिंथेसिस टप्प्यांशिवाय, तो एका सततच्या ऑडिओ स्ट्रीमवर ऐकतो आणि बोलतो. संभाषणातील बहुतांश यंत्रणा सहजपणे काम करतात. कॉलरने बोलणे थांबवल्यानंतर त्यांचा पहिला ऑडिओ मध्यक 1.3 सेकंदांत ऐकू आला, किंवा फोन कनेक्शन वगळल्यास सुमारे 0.7 सेकंदांत. आम्ही कोणतेही व्हॉइस-अॅक्टिव्हिटी डिटेक्शन किंवा टर्न-टेकिंग लॉजिक जोडले नाही. तो व्यत्यय सहजतेने हाताळतो, नैसर्गिक प्रतिसादसूचक ध्वनी ("हं-हं") देतो आणि चपळ, माणसासारख्या गतीने बोलतो.

वाचून दाखवायच्या ओळींऐवजी उद्दिष्टे दिली असता, तो प्रश्न संभाषणानुसार जुळवतो आणि दुरुस्त्या सहज स्वीकारतो:

Caller · 47.0Um, no, it's nine twenty, uh, seventy
Agent · 49.9Thanks for clarifying. So, September twentieth, nineteen seventy, right?
Caller · 56.5Yeah
Agent · 56.7Thanks. Pulling that up. Are you still renting your home?
Caller · 64.5Uh, not anymore now. I uh own my home now
Agent · 67.4Thanks, so you own your home. Is that a house, a condo, or a mobile home?

दुरुस्त्या, व्यत्यय किंवा कॉलरने कॉलच्या मधोमध उत्तरे बदलली तरी त्याने कधीही संयम गमावला नाही. नैसर्गिकपणाच संपूर्ण काम असते, तर हा लेख इथेच संपला असता. दुर्दैवाने, गोष्ट तेवढ्यापुरती मर्यादित नाही.

तो सूचना विश्वासार्हपणे पाळत नाही

स्क्रिप्टेड फोन कॉलसाठी महत्त्वाच्या असलेल्या वर्तनांबाबत GPT-Live-1 सूचना विश्वासार्हपणे पाळत नाही.

एकापेक्षा जास्त वेळा, त्याने स्पष्ट "हो" ला उत्तर "नाही" असल्याप्रमाणे प्रतिसाद दिला, प्रश्न पुन्हा विचारला किंवा कॉलरने नकार दिल्यासारखे पुढे गेला.

सूचनांचा अतिशय शब्दशः अर्थ घेणे ही सर्वात सातत्यपूर्ण त्रुटी होती. आमच्या prompt मध्ये म्हटले होते: कॉलरने नोंदवरील निवासस्थिती चुकीची असल्याचे सांगितल्यास, ते स्वतःचे घर मालकीचे आहे, भाड्याने घेतलेले आहे की पालकांसोबत राहतात हे विचारा. एका कॉलरने "नाही, आता ते माझे आहे" असे सांगितले, ज्यामुळे त्या प्रश्नाचे उत्तर आधीच मिळते. तरीही मॉडेलने मेनू वाचून दाखवला:

Agent · 70.0...you listed as renting your home. Is that still correct?
Caller · 75.1Um, no, I own it now
Agent · 76.6Now, do you own your home, rent your home, live with your parents, or have some other housing situation?

सुरुवातीचा काही विचित्रपणा आमच्या prompt मुळे होता, पण आम्ही वापरलेल्या प्रत्येक prompt प्रकारात हा शब्दशःपणा कायम राहिला. आम्ही स्पष्टपणे नमूद न केलेले कोणतेही उत्तर समजूतदारपणे हाताळण्याऐवजी यांत्रिक पद्धतीने हाताळले गेले.

दबावाखाली तो कधीकधी मोठ्याने विचारही करतो:

Agent · 96.3Thanks. One moment.
Agent · 98.0Hmm. Handling this one carefully.
Agent · 101.4I'll acknowledge it and move on.
Agent · 107.1Thanks. And just to confirm, you're married, right?

अंक आणि अल्फान्यूमेरिक स्ट्रिंग्ज धोकादायक असतात

स्पेलिंग्ज, पत्ते, जन्मतारखा आणि ID क्रमांक अचूक असणे आवश्यक असते. इथेच GPT-Live-1 च्या बोलण्यात सर्वाधिक समस्या दिसतात.

अल्फान्यूमेरिक स्ट्रिंग्जमध्ये अक्षरे गाळणे आणि बदलणे आम्ही ऐकले. येथे ते एक काल्पनिक क्लेम क्रमांक वाचते; शांतता ट्रिम करण्याव्यतिरिक्त क्लिप्समध्ये कोणताही बदल केलेला नाही. इंग्रजीमध्ये, त्याचे ट्रान्स्क्रिप्ट बरोबर होते, पण ऑडिओमध्ये अतिरिक्त "Y" आला:

Told to say8KD2 - QX7B - M4V9
Actually said8KD2 - QXY7B - M4V9
extra "Y"
GPT-Live-1 · इंग्रजीक्लेम क्रमांक पुन्हा वाचणे, अपरिवर्तित आउटपुट
0:00 / 0:08

रशियनमध्ये ते आणखी वाईट होते: ऑडिओ आणि ट्रान्स्क्रिप्ट दोन्हीमध्ये "Q" चे "X" झाले.

Told to say8KD2 - QX7B - M4V9
Actually saidвосемь кэй дэ два, тире, икс икс семь бэ, тире, эм четыре вэ девять
Which is8KD2 - XX7B - M4V9
"Q" became "X"
GPT-Live-1 · रशियनतोच कोड, रशियनमध्ये वाचलेला
0:00 / 0:08

तारखांमुळेही तीच समस्या निर्माण झाली. एका कॉलरने जन्मतारीख अंकांच्या स्वरूपात दिली, जी मॉडेलने नंतर एक संख्या म्हणून पुन्हा वाचली:

Caller · 159.7Uh five five ninety five
Caller · 192.8Wait, what did you get uh, Roberto's birthday as
Agent · 197.2So that's fifty-five ninety-five?
Caller · 203.6Oh what are you talking about
Caller · 210.2I don't know what you mean by fifty five ninety five, that's not a birthday

कधीकधी ते कॉलरची असलेली ओळही बोलते:

Agent · 74.7Do you currently have car insurance?
Agent · 78.5Do you currently I do.
Caller · 79.4I do

इतर भाषांमधील उच्चार

आमचे उत्पादन ज्या 47 भाषांना समर्थन देते, त्या सर्व भाषांमध्ये आम्ही नवीन व्हॉइस मॉडेल्सची चाचणी करतो. GPT-Live-1 चे रशियन प्रवाही होते, पण त्यात ठळक अमेरिकन उच्चार होता (उत्पादनात आम्ही वापरत असलेले TTS व्हॉइसेस सामान्यतः स्थानिकांसारखे वाटतात):

Здравствуйте! Меня зовут Катя, я виртуальный агент вашей автостраховой. Лицензированный специалист скоро подключится, а пока, не против ли вы, если я задам пару вопросов, чтобы ускорить оформление полиса?
GPT-Live-1 · रशियन अभिवादनकात्या कॉलची सुरुवात करते
0:00 / 0:13

आम्ही लुगांडा देखील वापरून पाहिले. पहिल्या कॉलमध्ये, त्याने त्याऐवजी स्वाहिलीमध्ये उत्तर दिले. दुसऱ्या कॉलमध्ये, त्याने लुगांडामध्ये बोलले—सामान्य मॉडेलकडून अपेक्षेपेक्षा अधिक नैसर्गिकपणे—पण पुन्हा ठळक अमेरिकन उच्चारासह. आम्ही प्रत्येक भाषेची चाचणी केलेली नाही, पण हा उच्चारांचा पॅटर्न बहुधा सर्वत्र लागू होईल अशी आमची अपेक्षा आहे. केवळ इंग्रजीतील एजंटसाठी हे महत्त्वाचे नाही, पण इतर भाषांमधील वापराच्या बाबतीत ही बरीच महत्त्वाची मर्यादा आहे.

जाणून घेण्यासारख्या काही API मर्यादा

या आठवड्यात आम्हाला जे आढळले त्यानुसार, खऱ्या एजंटसाठी काही API मर्यादा महत्त्वाच्या आहेत:

  • सेशन सुरू झाल्यानंतर सूचना बदलता येत नाहीत, आणि त्यांची मर्यादा 16,384 टोकन्स इतकी आहे.
  • आउटपुट ऑडिओचे स्ट्रीमिंग कधीच थांबत नाही — शांततेचेही स्ट्रीमिंग होते — त्यामुळे टर्न्सचे विभाजन आवश्यक असलेल्या वापरांमध्ये "ऑडिओ थांबला" हा टर्न-एंड सिग्नल म्हणून वापरता येत नाही.
  • ते केवळ नवीन v1/live/sessions एंडपॉइंटद्वारे उपलब्ध आहे, आणि आम्ही तपासले तेव्हा ते Azure वर अजून उपलब्ध नव्हते.

आतापर्यंतचा आमचा निष्कर्ष

उत्पादनातील फोन एजंटना नैसर्गिक वाटले पाहिजे आणि स्क्रिप्ट्सचे सातत्याने पालन करता आले पाहिजे. GPT-Live-1 पहिल्या बाबतीत अप्रतिम आहे, पण दुसऱ्या बाबतीत त्यात काही गंभीर समस्या आहेत. वेळोवेळी आम्ही आणखी चाचण्या करत राहू आणि आमचे निष्कर्ष नोंदवत राहू.