ThunderPhone 2.0 હવે લાઇવ છે.સેલ્ફ-સર્વ, 2¢/મિનિટથી.જાહેરાત વાંચો
બધી પોસ્ટ્સ

વૉઇસ એજન્ટ્સ માટે GPT-Live-1 API વિશેની અમારી પ્રથમ છાપ

12 સપ્ટેમ્બર, 2026Alex Kolchinski

OpenAIએ બે દિવસ પહેલાં તેનું નવું ફુલ-ડુપ્લેક્સ વૉઇસ મોડલ GPT-Live-1 APIમાં રિલીઝ કર્યું. અમે પ્રોડક્શનમાં AI ફોન એજન્ટ્સ બનાવીએ છીએ અને ચલાવીએ છીએ, તેથી અમે તેને એક વાસ્તવિક ફોન નંબર પર મૂક્યું અને તેને ફોન કર્યો. ઘણી વાર.

અમે અમારા એક વીમા ગ્રાહકની આશરે 13,000-ટોકન વૉર્મ-લીડ ક્વૉલિફિકેશન સ્ક્રિપ્ટ સાથે તેનું પરીક્ષણ કર્યું, જેમાં શબ્દશઃ બોલવી ફરજિયાત હોય તેવી લાઇનો, કડક પુનરાવર્તન નિયમો અને શાખાવાર ફૉલો-અપ્સ હતા. એક લાંબા દિવસ દરમિયાન, અમે એક ડઝન વાસ્તવિક ફોન કૉલ્સ, આશરે 25 સિમ્યુલેટેડ ઇન્ટરવ્યુ અને અસંરચિત પરીક્ષણોનો એક બૅચ ચલાવ્યો.

ટ્રાન્સક્રિપ્ટ્સ અને ઑડિયો સાથે આ અમારી પ્રથમ છાપ છે. વધુ ઊંડાણપૂર્વકનું લખાણ ટૂંક સમયમાં આવી રહ્યું છે.

ટ્રાન્સક્રિપ્ટ્સ અમારા ટેસ્ટ કૉલ્સમાંથી છે, જેમને GPT-Live દ્વારા ટ્રાન્સક્રાઇબ કરવામાં આવ્યા હતા. અમે નામો અને ઓળખાણ દર્શાવતા શબ્દપ્રયોગો બદલ્યા છે, વાતચીતના ભાગો ટૂંકાવ્યા છે અને વિભાજિત અંશો જોડ્યા છે. કૉલની શરૂઆતથી સેકન્ડમાં આપેલા ટાઇમસ્ટૅમ્પ્સ મૂળ રેકોર્ડિંગ્સના છે.

સ્વાભાવિકતા અસાધારણ છે

GPT-Live-1 એ સૌથી સ્વાભાવિક લાગતો સંવાદક છે જેને અમે ક્યારેય ફોન લાઇન પર મૂક્યો છે. આ ખરેખર એક મોટું પગલું આગળ છે.

તે અલગ ટ્રાન્સક્રિપ્શન અને સિન્થેસિસ તબક્કાઓ વિના, એક જ સતત ઑડિયો સ્ટ્રીમ પર સાંભળે છે અને બોલે છે. સંવાદની મોટાભાગની પ્રક્રિયા બસ કામ કરે છે. કૉલર્સે બોલવાનું બંધ કર્યા પછી તેનો પ્રથમ ઑડિયો મધ્યક 1.3 સેકન્ડમાં સાંભળ્યો, અથવા ફોન લેગ વિના આશરે 0.7 સેકન્ડમાં. અમે કોઈ વૉઇસ-એક્ટિવિટી ડિટેક્શન કે વારો લેવાની લૉજિક ઉમેર્યા નહોતા. તે વિક્ષેપોને સહજતાથી સંભાળે છે, સ્વાભાવિક પ્રતિસાદી ધ્વનિઓ ("હં-હં") આપે છે અને ઝડપી, માનવી જેવી ગતિએ બોલે છે.

વાંચવા માટેની નિશ્ચિત લાઇનોને બદલે લક્ષ્યો આપતાં, તે પ્રશ્નોને વાતચીત અનુસાર ગોઠવે છે અને સુધારાઓને સરળતાથી સ્વીકારે છે:

Caller · 47.0Um, no, it's nine twenty, uh, seventy
Agent · 49.9Thanks for clarifying. So, September twentieth, nineteen seventy, right?
Caller · 56.5Yeah
Agent · 56.7Thanks. Pulling that up. Are you still renting your home?
Caller · 64.5Uh, not anymore now. I uh own my home now
Agent · 67.4Thanks, so you own your home. Is that a house, a condo, or a mobile home?

સુધારાઓ, વિક્ષેપો કે કૉલર્સ કૉલની વચ્ચે જવાબ બદલે ત્યારે પણ તેણે ક્યારેય સંયમ ગુમાવ્યો નહીં. જો સ્વાભાવિકતા જ આખું કામ હોત, તો આ પોસ્ટ અહીં પૂરી થઈ જાત. દુર્ભાગ્યે, વાત એટલી પૂરતી નથી.

તે સૂચનાઓનું વિશ્વસનીય રીતે પાલન કરતું નથી

GPT-Live-1 સ્ક્રિપ્ટેડ ફોન કૉલ માટે મહત્વપૂર્ણ વર્તણૂકો સંબંધિત સૂચનાઓનું વિશ્વસનીય રીતે પાલન કરતું નથી.

એકથી વધુ વખત, તેણે સ્પષ્ટ "હા"નો જવાબ જાણે "ના" મળ્યો હોય તેમ આપ્યો, પ્રશ્ન ફરી પૂછ્યો અથવા જાણે કૉલરે ઇનકાર કર્યો હોય તેમ આગળ વધ્યું.

સૌથી સતત નિષ્ફળતા એ હતી કે તે સૂચનાઓને અત્યંત શાબ્દિક રીતે લેતું હતું. અમારા promptમાં લખ્યું હતું: જો કૉલર કહે કે રેકોર્ડમાં રહેલી રહેઠાણની સ્થિતિ ખોટી છે, તો પૂછો કે તેઓ પોતાનું ઘર ધરાવે છે, ભાડે રહે છે કે માતા-પિતા સાથે રહે છે. એક કૉલરે કહ્યું, "ના, હવે હું તેનો માલિક છું," જે પહેલેથી જ એ પ્રશ્નનો જવાબ આપે છે. છતાં મોડલે વિકલ્પોની યાદી વાંચી સંભળાવી:

Agent · 70.0...you listed as renting your home. Is that still correct?
Caller · 75.1Um, no, I own it now
Agent · 76.6Now, do you own your home, rent your home, live with your parents, or have some other housing situation?

શરૂઆતની કેટલીક વિચિત્રતાઓ અમારા promptની ભૂલ હતી, પરંતુ અમે અજમાવેલા દરેક prompt વેરિઅન્ટમાં આ શાબ્દિકતા યથાવત રહી. જે જવાબ અમે સ્પષ્ટ રીતે લખી ન આપ્યો હોય, તેને સમજદારીથી નહીં પરંતુ યાંત્રિક રીતે સંભાળવામાં આવ્યો.

દબાણ હેઠળ તે ક્યારેક ઊંચા અવાજે વિચારતું પણ હોય છે:

Agent · 96.3Thanks. One moment.
Agent · 98.0Hmm. Handling this one carefully.
Agent · 101.4I'll acknowledge it and move on.
Agent · 107.1Thanks. And just to confirm, you're married, right?

સંખ્યાઓ અને અલ્ફાન્યુમેરિક્સ જોખમી છે

જોડણીઓ, સરનામાં, જન્મતારીખો અને ID નંબરો ચોક્કસ હોવા જરૂરી છે. GPT-Live-1ના ભાષણમાં સૌથી વધુ સમસ્યાઓ અહીં જોવા મળે છે.

અમે તેને અલ્ફાન્યુમેરિક સ્ટ્રિંગ્સમાં અક્ષરો છોડતા અને બદલી નાખતા સાંભળ્યું. અહીં તે એક બનાવટી ક્લેઇમ નંબર વાંચે છે; મૌન દૂર કરવા સિવાય ક્લિપ્સમાં કોઈ ફેરફાર કરવામાં આવ્યો નથી. અંગ્રેજીમાં, તેનું ટ્રાન્સક્રિપ્ટ સાચું હતું, પરંતુ ઑડિયોમાં એક "Y" ઉમેરાયો હતો:

Told to say8KD2 - QX7B - M4V9
Actually said8KD2 - QXY7B - M4V9
extra "Y"
GPT-Live-1 · અંગ્રેજીક્લેઇમ નંબરનું પુનરાવર્તન, અસ્પૃશ્ય આઉટપુટ
0:00 / 0:08

રશિયનમાં તે વધુ ખરાબ હતું: ઑડિયો અને તેના ટ્રાન્સક્રિપ્ટ બંનેમાં "Q" "X" બની ગયું.

Told to say8KD2 - QX7B - M4V9
Actually saidвосемь кэй дэ два, тире, икс икс семь бэ, тире, эм четыре вэ девять
Which is8KD2 - XX7B - M4V9
"Q" became "X"
GPT-Live-1 · રશિયનએ જ કોડ, રશિયનમાં વાંચેલો
0:00 / 0:08

તારીખોમાં પણ એ જ સમસ્યા આવી. એક કૉલરે જન્મતારીખ અંકો તરીકે આપી, જેને મોડેલે પછી સંખ્યા તરીકે ફરી વાંચી:

Caller · 159.7Uh five five ninety five
Caller · 192.8Wait, what did you get uh, Roberto's birthday as
Agent · 197.2So that's fifty-five ninety-five?
Caller · 203.6Oh what are you talking about
Caller · 210.2I don't know what you mean by fifty five ninety five, that's not a birthday

ક્યારેક તે કૉલરની લાઇન પણ બોલી જાય છે:

Agent · 74.7Do you currently have car insurance?
Agent · 78.5Do you currently I do.
Caller · 79.4I do

અન્ય ભાષાઓમાં ઉચ્ચારો

અમે અમારા પ્રોડક્ટ દ્વારા સપોર્ટ થતી 47 ભાષાઓમાં નવા વૉઇસ મોડેલ્સનું પરીક્ષણ કરીએ છીએ. GPT-Live-1નું રશિયન પ્રવાહી હતું, પરંતુ તેમાં ઘેરો અમેરિકન ઉચ્ચાર હતો (જ્યારે પ્રોડક્શનમાં અમે ચલાવતા TTS વૉઇસ સામાન્ય રીતે મૂળ ભાષી જેવા સંભળાય છે):

Здравствуйте! Меня зовут Катя, я виртуальный агент вашей автостраховой. Лицензированный специалист скоро подключится, а пока, не против ли вы, если я задам пару вопросов, чтобы ускорить оформление полиса?
GPT-Live-1 · રશિયન અભિવાદનકાત્યા કૉલ શરૂ કરે છે
0:00 / 0:13

અમે લુગાંડા પણ અજમાવી. પહેલા કૉલમાં, તેણે તેના બદલે સ્વાહિલીમાં જવાબ આપ્યો. બીજા કૉલમાં, તેણે લુગાંડા બોલી—સામાન્ય મોડેલ પાસેથી અમારી અપેક્ષા કરતાં વધુ સ્વાભાવિક રીતે—પરંતુ ફરીથી ઘેરા અમેરિકન ઉચ્ચાર સાથે. અમે દરેક ભાષાનું પરીક્ષણ કર્યું નથી, પરંતુ અમને લાગે છે કે ઉચ્ચારનો આ પેટર્ન કદાચ સામાન્ય રીતે લાગુ પડે છે. માત્ર અંગ્રેજી વૉઇસ એજન્ટ માટે તેનો ફરક પડતો નથી, પરંતુ અન્ય ભાષાઓના ઉપયોગકેસ માટે આ એક નોંધપાત્ર મર્યાદા છે.

જાણવી યોગ્ય કેટલીક API મર્યાદાઓ

આ અઠવાડિયે અમને જે મળ્યું તેના આધારે, વાસ્તવિક એજન્ટ માટે કેટલીક API મર્યાદાઓ મહત્વની છે:

  • સેશન શરૂ થયા પછી સૂચનાઓ અપરિવર્તનીય રહે છે, અને તેની મર્યાદા 16,384 ટોકન્સ છે.
  • આઉટપુટ ઑડિયો સ્ટ્રીમ થવાનું ક્યારેય બંધ થતું નથી — મૌન પણ સ્ટ્રીમ થાય છે — તેથી ટર્નને વિભાજિત કરવાની જરૂર હોય તેવા ઉપયોગકેસ માટે "ઑડિયો બંધ થયું" ને ટર્ન-એન્ડ સિગ્નલ તરીકે વાપરી શકાય નહીં.
  • તે ફક્ત નવા v1/live/sessions એન્ડપૉઇન્ટ દ્વારા ઉપલબ્ધ છે, અને અમે તપાસ્યું ત્યારે તે હજી Azure પર ઉપલબ્ધ નહોતું.

અત્યાર સુધીની અમારી છાપ

પ્રોડક્શન ફોન એજન્ટ્સે સ્વાભાવિક સંભળાવું જોઈએ અને સ્ક્રિપ્ટ્સનું સતત પાલન કરવું જોઈએ. GPT-Live-1 પહેલાના મામલે અદ્ભુત છે, પરંતુ બીજાના મામલે તેમાં કેટલીક ગંભીર સમસ્યાઓ છે. સમય જતાં અમે વધુ પરીક્ષણો ચલાવીશું અને અમારા તારણો રજૂ કરતા રહીશું.