વૉઇસ એજન્ટ્સ માટે GPT-Live-1 API વિશેની અમારી પ્રથમ છાપ
OpenAIએ બે દિવસ પહેલાં તેનું નવું ફુલ-ડુપ્લેક્સ વૉઇસ મોડલ GPT-Live-1 APIમાં રિલીઝ કર્યું. અમે પ્રોડક્શનમાં AI ફોન એજન્ટ્સ બનાવીએ છીએ અને ચલાવીએ છીએ, તેથી અમે તેને એક વાસ્તવિક ફોન નંબર પર મૂક્યું અને તેને ફોન કર્યો. ઘણી વાર.
અમે અમારા એક વીમા ગ્રાહકની આશરે 13,000-ટોકન વૉર્મ-લીડ ક્વૉલિફિકેશન સ્ક્રિપ્ટ સાથે તેનું પરીક્ષણ કર્યું, જેમાં શબ્દશઃ બોલવી ફરજિયાત હોય તેવી લાઇનો, કડક પુનરાવર્તન નિયમો અને શાખાવાર ફૉલો-અપ્સ હતા. એક લાંબા દિવસ દરમિયાન, અમે એક ડઝન વાસ્તવિક ફોન કૉલ્સ, આશરે 25 સિમ્યુલેટેડ ઇન્ટરવ્યુ અને અસંરચિત પરીક્ષણોનો એક બૅચ ચલાવ્યો.
ટ્રાન્સક્રિપ્ટ્સ અને ઑડિયો સાથે આ અમારી પ્રથમ છાપ છે. વધુ ઊંડાણપૂર્વકનું લખાણ ટૂંક સમયમાં આવી રહ્યું છે.
ટ્રાન્સક્રિપ્ટ્સ અમારા ટેસ્ટ કૉલ્સમાંથી છે, જેમને GPT-Live દ્વારા ટ્રાન્સક્રાઇબ કરવામાં આવ્યા હતા. અમે નામો અને ઓળખાણ દર્શાવતા શબ્દપ્રયોગો બદલ્યા છે, વાતચીતના ભાગો ટૂંકાવ્યા છે અને વિભાજિત અંશો જોડ્યા છે. કૉલની શરૂઆતથી સેકન્ડમાં આપેલા ટાઇમસ્ટૅમ્પ્સ મૂળ રેકોર્ડિંગ્સના છે.
સ્વાભાવિકતા અસાધારણ છે
GPT-Live-1 એ સૌથી સ્વાભાવિક લાગતો સંવાદક છે જેને અમે ક્યારેય ફોન લાઇન પર મૂક્યો છે. આ ખરેખર એક મોટું પગલું આગળ છે.
તે અલગ ટ્રાન્સક્રિપ્શન અને સિન્થેસિસ તબક્કાઓ વિના, એક જ સતત ઑડિયો સ્ટ્રીમ પર સાંભળે છે અને બોલે છે. સંવાદની મોટાભાગની પ્રક્રિયા બસ કામ કરે છે. કૉલર્સે બોલવાનું બંધ કર્યા પછી તેનો પ્રથમ ઑડિયો મધ્યક 1.3 સેકન્ડમાં સાંભળ્યો, અથવા ફોન લેગ વિના આશરે 0.7 સેકન્ડમાં. અમે કોઈ વૉઇસ-એક્ટિવિટી ડિટેક્શન કે વારો લેવાની લૉજિક ઉમેર્યા નહોતા. તે વિક્ષેપોને સહજતાથી સંભાળે છે, સ્વાભાવિક પ્રતિસાદી ધ્વનિઓ ("હં-હં") આપે છે અને ઝડપી, માનવી જેવી ગતિએ બોલે છે.
વાંચવા માટેની નિશ્ચિત લાઇનોને બદલે લક્ષ્યો આપતાં, તે પ્રશ્નોને વાતચીત અનુસાર ગોઠવે છે અને સુધારાઓને સરળતાથી સ્વીકારે છે:
સુધારાઓ, વિક્ષેપો કે કૉલર્સ કૉલની વચ્ચે જવાબ બદલે ત્યારે પણ તેણે ક્યારેય સંયમ ગુમાવ્યો નહીં. જો સ્વાભાવિકતા જ આખું કામ હોત, તો આ પોસ્ટ અહીં પૂરી થઈ જાત. દુર્ભાગ્યે, વાત એટલી પૂરતી નથી.
તે સૂચનાઓનું વિશ્વસનીય રીતે પાલન કરતું નથી
GPT-Live-1 સ્ક્રિપ્ટેડ ફોન કૉલ માટે મહત્વપૂર્ણ વર્તણૂકો સંબંધિત સૂચનાઓનું વિશ્વસનીય રીતે પાલન કરતું નથી.
એકથી વધુ વખત, તેણે સ્પષ્ટ "હા"નો જવાબ જાણે "ના" મળ્યો હોય તેમ આપ્યો, પ્રશ્ન ફરી પૂછ્યો અથવા જાણે કૉલરે ઇનકાર કર્યો હોય તેમ આગળ વધ્યું.
સૌથી સતત નિષ્ફળતા એ હતી કે તે સૂચનાઓને અત્યંત શાબ્દિક રીતે લેતું હતું. અમારા promptમાં લખ્યું હતું: જો કૉલર કહે કે રેકોર્ડમાં રહેલી રહેઠાણની સ્થિતિ ખોટી છે, તો પૂછો કે તેઓ પોતાનું ઘર ધરાવે છે, ભાડે રહે છે કે માતા-પિતા સાથે રહે છે. એક કૉલરે કહ્યું, "ના, હવે હું તેનો માલિક છું," જે પહેલેથી જ એ પ્રશ્નનો જવાબ આપે છે. છતાં મોડલે વિકલ્પોની યાદી વાંચી સંભળાવી:
શરૂઆતની કેટલીક વિચિત્રતાઓ અમારા promptની ભૂલ હતી, પરંતુ અમે અજમાવેલા દરેક prompt વેરિઅન્ટમાં આ શાબ્દિકતા યથાવત રહી. જે જવાબ અમે સ્પષ્ટ રીતે લખી ન આપ્યો હોય, તેને સમજદારીથી નહીં પરંતુ યાંત્રિક રીતે સંભાળવામાં આવ્યો.
દબાણ હેઠળ તે ક્યારેક ઊંચા અવાજે વિચારતું પણ હોય છે:
સંખ્યાઓ અને અલ્ફાન્યુમેરિક્સ જોખમી છે
જોડણીઓ, સરનામાં, જન્મતારીખો અને ID નંબરો ચોક્કસ હોવા જરૂરી છે. GPT-Live-1ના ભાષણમાં સૌથી વધુ સમસ્યાઓ અહીં જોવા મળે છે.
અમે તેને અલ્ફાન્યુમેરિક સ્ટ્રિંગ્સમાં અક્ષરો છોડતા અને બદલી નાખતા સાંભળ્યું. અહીં તે એક બનાવટી ક્લેઇમ નંબર વાંચે છે; મૌન દૂર કરવા સિવાય ક્લિપ્સમાં કોઈ ફેરફાર કરવામાં આવ્યો નથી. અંગ્રેજીમાં, તેનું ટ્રાન્સક્રિપ્ટ સાચું હતું, પરંતુ ઑડિયોમાં એક "Y" ઉમેરાયો હતો:
રશિયનમાં તે વધુ ખરાબ હતું: ઑડિયો અને તેના ટ્રાન્સક્રિપ્ટ બંનેમાં "Q" "X" બની ગયું.
તારીખોમાં પણ એ જ સમસ્યા આવી. એક કૉલરે જન્મતારીખ અંકો તરીકે આપી, જેને મોડેલે પછી સંખ્યા તરીકે ફરી વાંચી:
ક્યારેક તે કૉલરની લાઇન પણ બોલી જાય છે:
અન્ય ભાષાઓમાં ઉચ્ચારો
અમે અમારા પ્રોડક્ટ દ્વારા સપોર્ટ થતી 47 ભાષાઓમાં નવા વૉઇસ મોડેલ્સનું પરીક્ષણ કરીએ છીએ. GPT-Live-1નું રશિયન પ્રવાહી હતું, પરંતુ તેમાં ઘેરો અમેરિકન ઉચ્ચાર હતો (જ્યારે પ્રોડક્શનમાં અમે ચલાવતા TTS વૉઇસ સામાન્ય રીતે મૂળ ભાષી જેવા સંભળાય છે):
અમે લુગાંડા પણ અજમાવી. પહેલા કૉલમાં, તેણે તેના બદલે સ્વાહિલીમાં જવાબ આપ્યો. બીજા કૉલમાં, તેણે લુગાંડા બોલી—સામાન્ય મોડેલ પાસેથી અમારી અપેક્ષા કરતાં વધુ સ્વાભાવિક રીતે—પરંતુ ફરીથી ઘેરા અમેરિકન ઉચ્ચાર સાથે. અમે દરેક ભાષાનું પરીક્ષણ કર્યું નથી, પરંતુ અમને લાગે છે કે ઉચ્ચારનો આ પેટર્ન કદાચ સામાન્ય રીતે લાગુ પડે છે. માત્ર અંગ્રેજી વૉઇસ એજન્ટ માટે તેનો ફરક પડતો નથી, પરંતુ અન્ય ભાષાઓના ઉપયોગકેસ માટે આ એક નોંધપાત્ર મર્યાદા છે.
જાણવી યોગ્ય કેટલીક API મર્યાદાઓ
આ અઠવાડિયે અમને જે મળ્યું તેના આધારે, વાસ્તવિક એજન્ટ માટે કેટલીક API મર્યાદાઓ મહત્વની છે:
- સેશન શરૂ થયા પછી સૂચનાઓ અપરિવર્તનીય રહે છે, અને તેની મર્યાદા 16,384 ટોકન્સ છે.
- આઉટપુટ ઑડિયો સ્ટ્રીમ થવાનું ક્યારેય બંધ થતું નથી — મૌન પણ સ્ટ્રીમ થાય છે — તેથી ટર્નને વિભાજિત કરવાની જરૂર હોય તેવા ઉપયોગકેસ માટે "ઑડિયો બંધ થયું" ને ટર્ન-એન્ડ સિગ્નલ તરીકે વાપરી શકાય નહીં.
- તે ફક્ત નવા
v1/live/sessionsએન્ડપૉઇન્ટ દ્વારા ઉપલબ્ધ છે, અને અમે તપાસ્યું ત્યારે તે હજી Azure પર ઉપલબ્ધ નહોતું.
અત્યાર સુધીની અમારી છાપ
પ્રોડક્શન ફોન એજન્ટ્સે સ્વાભાવિક સંભળાવું જોઈએ અને સ્ક્રિપ્ટ્સનું સતત પાલન કરવું જોઈએ. GPT-Live-1 પહેલાના મામલે અદ્ભુત છે, પરંતુ બીજાના મામલે તેમાં કેટલીક ગંભીર સમસ્યાઓ છે. સમય જતાં અમે વધુ પરીક્ષણો ચલાવીશું અને અમારા તારણો રજૂ કરતા રહીશું.