വോയ്സ് ഏജന്റുകൾക്കായുള്ള GPT-Live-1 API-യെക്കുറിച്ചുള്ള ഞങ്ങളുടെ ആദ്യ അനുഭവങ്ങൾ
OpenAI രണ്ട് ദിവസം മുമ്പ് അതിന്റെ പുതിയ ഫുൾ-ഡ്യൂപ്ലെക്സ് വോയ്സ് മോഡലായ GPT-Live-1 API-യിലേക്ക് പുറത്തിറക്കി. ഞങ്ങൾ പ്രൊഡക്ഷനിൽ AI ഫോൺ ഏജന്റുകളെ നിർമ്മിക്കുകയും പ്രവർത്തിപ്പിക്കുകയും ചെയ്യുന്നു, അതിനാൽ ഇത് ഒരു യഥാർത്ഥ ഫോൺ നമ്പറിൽ സജ്ജമാക്കി വിളിച്ചു. ഒരുപാട് തവണ.
ഞങ്ങളുടെ ഒരു ഇൻഷുറൻസ് ഉപഭോക്താവിന്റെ ഏകദേശം 13,000-ടോക്കൺ വോം-ലീഡ് യോഗ്യതാ സ്ക്രിപ്റ്റ് ഉപയോഗിച്ചാണ് ഞങ്ങൾ ഇത് പരീക്ഷിച്ചത്; അതിൽ വാക്കിന് വാക്ക് പറയേണ്ട വരികൾ, കർശനമായ വീണ്ടും വായിച്ചുറപ്പിക്കൽ നിയമങ്ങൾ, ശാഖകളായി വിഭജിക്കുന്ന തുടർചോദ്യങ്ങൾ എന്നിവയുണ്ടായിരുന്നു. ഒരു നീണ്ട ദിവസത്തിനിടെ, ഞങ്ങൾ ഒരു ഡസൻ യഥാർത്ഥ ഫോൺ കോളുകളും ഏകദേശം 25 സിമുലേറ്റഡ് അഭിമുഖങ്ങളും ഘടനയില്ലാത്ത പരീക്ഷണങ്ങളുടെ ഒരു ബാച്ചും നടത്തി.
ട്രാൻസ്ക്രിപ്റ്റുകളും ഓഡിയോയും സഹിതമുള്ള ഞങ്ങളുടെ ആദ്യ അനുഭവങ്ങളാണിവ. കൂടുതൽ വിശദമായ കുറിപ്പ് ഉടൻ വരും.
GPT-Live ട്രാൻസ്ക്രൈബ് ചെയ്ത ഞങ്ങളുടെ ടെസ്റ്റ് കോളുകളിൽ നിന്നുള്ളതാണ് ട്രാൻസ്ക്രിപ്റ്റുകൾ. പേരുകളും തിരിച്ചറിയാൻ കഴിയുന്ന പദപ്രയോഗങ്ങളും ഞങ്ങൾ മാറ്റി, സംഭാഷണഭാഗങ്ങൾ ചുരുക്കി, വേർപെട്ട ശകലങ്ങൾ ഒന്നിച്ചു ചേർത്തു. കോളിന്റെ തുടക്കം മുതലുള്ള സെക്കൻഡുകളിലെ ടൈംസ്റ്റാമ്പുകൾ ഒറിജിനലുകളിൽ നിന്നുള്ളതാണ്.
സ്വാഭാവികത അസാധാരണമാണ്
ഒരു ഫോൺ ലൈനിൽ ഞങ്ങൾ ഉപയോഗിച്ചിട്ടുള്ളതിൽ ഏറ്റവും സ്വാഭാവികമായി സംഭാഷണം നടത്തുന്ന മോഡലാണ് GPT-Live-1. ഇത് യഥാർത്ഥ മുന്നേറ്റമാണ്.
വേർതിരിച്ച ട്രാൻസ്ക്രിപ്ഷൻ, സിന്തസിസ് ഘട്ടങ്ങളില്ലാതെ, ഒരൊറ്റ തുടർച്ചയായ ഓഡിയോ സ്ട്രീമിലാണ് ഇത് കേൾക്കുകയും സംസാരിക്കുകയും ചെയ്യുന്നത്. സംഭാഷണത്തിന്റെ ഭൂരിഭാഗം മെക്കാനിക്സും ലളിതമായി പ്രവർത്തിക്കുന്നു. വിളിക്കുന്നവർ സംസാരിച്ച് നിർത്തിയതിന് ശേഷം ശരാശരി 1.3 സെക്കൻഡിനുള്ളിൽ അതിന്റെ ആദ്യ ഓഡിയോ കേട്ടു, അല്ലെങ്കിൽ ഫോൺ ലെഗ് ഇല്ലാതെ ഏകദേശം 0.7 സെക്കൻഡിൽ. ഞങ്ങൾ വോയ്സ്-ആക്റ്റിവിറ്റി ഡിറ്റക്ഷനോ ടേൺ-ടേക്കിംഗ് ലൊജിക്കോ ചേർത്തില്ല. തടസ്സപ്പെടുത്തലുകൾ ഇത് ഭംഗിയായി കൈകാര്യം ചെയ്യുന്നു, സ്വാഭാവിക ബാക്ക്ചാനലുകൾ ("Mm-hmm") സൃഷ്ടിക്കുന്നു, മനുഷ്യസദൃശമായ വേഗതയിൽ സംസാരിക്കുന്നു.
വായിക്കേണ്ട വരികൾക്കു പകരം ലക്ഷ്യങ്ങൾ നൽകിയാൽ, സംഭാഷണത്തിനനുസരിച്ച് ചോദ്യങ്ങൾ പൊരുത്തപ്പെടുത്തുകയും തിരുത്തലുകൾ അനായാസം സ്വീകരിക്കുകയും ചെയ്യുന്നു:
തിരുത്തലുകൾ, തടസ്സപ്പെടുത്തലുകൾ, അല്ലെങ്കിൽ കോൾ മധ്യേ ഉത്തരം മാറ്റുന്ന വിളിക്കുന്നവർ എന്നിവയിലൊന്നിലും ഇതിന് സംയമനം നഷ്ടമായില്ല. സ്വാഭാവികത മാത്രമായിരുന്നു മുഴുവൻ ജോലി എങ്കിൽ, ഈ കുറിപ്പ് ഇവിടെ അവസാനിക്കുമായിരുന്നു. നിർഭാഗ്യവശാൽ, അതിലേറെ കാര്യങ്ങളുണ്ട്.
ഇത് നിർദ്ദേശങ്ങൾ വിശ്വസനീയമായി പാലിക്കുന്നില്ല
സ്ക്രിപ്റ്റ് ചെയ്ത ഫോൺ കോളിന് പ്രധാനമായ പെരുമാറ്റങ്ങളുമായി ബന്ധപ്പെട്ട നിർദ്ദേശങ്ങൾ GPT-Live-1 വിശ്വസനീയമായി പാലിക്കുന്നില്ല.
വ്യക്തമായ "yes" എന്ന മറുപടിയെ "no" എന്ന് പറഞ്ഞതുപോലെ ഇത് ഒന്നിലധികം തവണ കൈകാര്യം ചെയ്തു; ചോദ്യം വീണ്ടും ചോദിക്കുകയോ, വിളിക്കുന്നയാൾ നിരസിച്ചതുപോലെ അടുത്തതിലേക്ക് നീങ്ങുകയോ ചെയ്തു.
നിർദ്ദേശങ്ങളെ അത്യന്തം അക്ഷരാർത്ഥത്തിൽ എടുക്കുന്നതായിരുന്നു ഏറ്റവും സ്ഥിരമായ പരാജയം. ഫയലിലുള്ള താമസനില തെറ്റാണെന്ന് വിളിക്കുന്നയാൾ പറഞ്ഞാൽ, അവർ സ്വന്തം വീടാണോ, വാടകയ്ക്കാണോ, അല്ലെങ്കിൽ മാതാപിതാക്കൾക്കൊപ്പമാണോ താമസിക്കുന്നത് എന്ന് ചോദിക്കണമെന്ന് ഞങ്ങളുടെ prompt-ൽ പറഞ്ഞിരുന്നു. ഒരു വിളിക്കുന്നയാൾ "no, I own it now" എന്ന് പറഞ്ഞു; അത് ആ ചോദ്യത്തിന് ഇതിനകം മറുപടി നൽകുന്നതാണ്. എന്നിട്ടും മോഡൽ മെനു വായിച്ചു:
തുടക്കത്തിലെ ചില വിചിത്രതകൾ ഞങ്ങളുടെ prompt-ന്റെ പിഴവായിരുന്നു, എന്നാൽ ഞങ്ങൾ പരീക്ഷിച്ച എല്ലാ prompt വകഭേദങ്ങളിലും ഈ അക്ഷരാർത്ഥത നിലനിന്നു. ഞങ്ങൾ വ്യക്തമായി എഴുതാത്ത ഏത് മറുപടിയും വിവേകപൂർവമല്ലാതെ യാന്ത്രികമായാണ് കൈകാര്യം ചെയ്തത്.
സമ്മർദ്ദത്തിലാകുമ്പോൾ ഇത് ചിലപ്പോൾ ഉറക്കെ ചിന്തിക്കുകയും ചെയ്യുന്നു:
സംഖ്യകളും അക്ഷര-സംഖ്യാ കോഡുകളും അപകടസാധ്യതയുള്ളവയാണ്
സ്പെല്ലിംഗുകൾ, വിലാസങ്ങൾ, ജനനത്തീയതികൾ, ഐഡി നമ്പറുകൾ എന്നിവ കൃത്യമായിരിക്കണം. GPT-Live-1-ന്റെ സംഭാഷണത്തിൽ ഏറ്റവും കൂടുതൽ പ്രശ്നങ്ങൾ ഉണ്ടാകുന്നത് ഇവിടെയാണ്.
അക്ഷര-സംഖ്യാ സ്ട്രിങ്ങുകളിൽ അക്ഷരങ്ങൾ ഒഴിവാക്കുന്നതും പകരംവെക്കുന്നതും ഞങ്ങൾ കേട്ടു. ഇവിടെ അത് ഒരു സാങ്കൽപ്പിക ക്ലെയിം നമ്പർ വായിക്കുന്നു; നിശ്ശബ്ദത ട്രിം ചെയ്തതൊഴിച്ചാൽ ക്ലിപ്പുകളിൽ മാറ്റമൊന്നുമില്ല. ഇംഗ്ലീഷിൽ, അതിന്റെ ട്രാൻസ്ക്രിപ്റ്റ് ശരിയായിരുന്നു, പക്ഷേ ഓഡിയോയിൽ ഒരു "Y" അധികമായി ചേർന്നു:
റഷ്യനിൽ ഇത് കൂടുതൽ മോശമായിരുന്നു: ഓഡിയോയിലും അതിന്റെ ട്രാൻസ്ക്രിപ്റ്റിലും "Q" ഒരു "X" ആയി മാറി.
തീയതികളും ഇതേ പ്രശ്നത്തിന് കാരണമായി. ഒരു വിളിച്ചയാൾ ജനനത്തീയതി അക്കങ്ങളായി പറഞ്ഞു, പിന്നീട് മോഡൽ അത് ഒരു സംഖ്യയായി ആവർത്തിച്ചുവായിച്ചു:
ഇടയ്ക്കിടെ വിളിച്ചയാളുടേതായ ഒരു വരിയും ഇത് സംസാരിക്കുന്നു:
മറ്റ് ഭാഷകളിലെ ഉച്ചാരണശൈലികൾ
ഞങ്ങളുടെ ഉൽപ്പന്നം പിന്തുണയ്ക്കുന്ന 47 ഭാഷകളിലുടനീളം ഞങ്ങൾ പുതിയ വോയ്സ് മോഡലുകൾ പരീക്ഷിക്കുന്നു. GPT-Live-1-ന്റെ റഷ്യൻ ഒഴുക്കുള്ളതായിരുന്നു, പക്ഷേ അതിന് ശക്തമായ അമേരിക്കൻ ഉച്ചാരണശൈലി ഉണ്ടായിരുന്നു (അതേസമയം, പ്രൊഡക്ഷനിൽ ഞങ്ങൾ ഉപയോഗിക്കുന്ന TTS വോയ്സുകൾ സാധാരണയായി പ്രാദേശിക ഭാഷക്കാരുടേതുപോലെ കേൾക്കും):
ഞങ്ങൾ ലുഗാണ്ടയും പരീക്ഷിച്ചു. ആദ്യ കോളിൽ, അത് പകരം സ്വാഹിലിയിൽ മറുപടി നൽകി. രണ്ടാമത്തെ കോളിൽ, ഒരു പൊതുവായ മോഡലിൽ നിന്ന് പ്രതീക്ഷിച്ചതിലും സ്വാഭാവികമായി അത് ലുഗാണ്ട സംസാരിച്ചു, എന്നാൽ വീണ്ടും ശക്തമായ അമേരിക്കൻ ഉച്ചാരണശൈലിയോടെ. എല്ലാ ഭാഷകളും ഞങ്ങൾ പരീക്ഷിച്ചിട്ടില്ല, പക്ഷേ ഈ ഉച്ചാരണശൈലിയുടെ പാറ്റേൺ പൊതുവെ ബാധകമാകുമെന്നാണ് ഞങ്ങൾ കരുതുന്നത്. ഇംഗ്ലീഷ് മാത്രമുള്ള ഒരു ഏജന്റിന് അത് പ്രശ്നമല്ല, എന്നാൽ മറ്റ് ഭാഷകളിലെ ഉപയോഗസാഹചര്യങ്ങൾക്ക് ഇത് വളരെ പ്രധാനപ്പെട്ട ഒരു മുന്നറിയിപ്പാണ്.
അറിയേണ്ട ചില API പരിമിതികൾ
ഈ ആഴ്ച ഞങ്ങൾ കണ്ടെത്തിയതിന്റെ അടിസ്ഥാനത്തിൽ, യഥാർത്ഥ ഏജന്റിന് ചില API പരിമിതികൾ പ്രധാനമാണ്:
- സെഷൻ ആരംഭിച്ചതിന് ശേഷം നിർദ്ദേശങ്ങൾ മാറ്റാനാകില്ല, കൂടാതെ അവ 16,384 ടോക്കണുകളായി പരിമിതപ്പെടുത്തിയിരിക്കുന്നു.
- ഔട്ട്പുട്ട് ഓഡിയോ സ്ട്രീമിംഗ് ഒരിക്കലും നിർത്തുന്നില്ല — നിശ്ശബ്ദതയും സ്ട്രീം ചെയ്യപ്പെടുന്നു — അതിനാൽ ടേണുകൾ വിഭജിക്കേണ്ട ഉപയോഗസാഹചര്യങ്ങളിൽ ടേൺ അവസാന സൂചനയായി "ഓഡിയോ നിർത്തി" ഉപയോഗിക്കാനാവില്ല.
- പുതിയ
v1/live/sessionsഎൻഡ്പോയിന്റിലൂടെ മാത്രമാണ് ഇതിൽ എത്തിച്ചേരാനാകുന്നത്, ഞങ്ങൾ പരിശോധിച്ചപ്പോൾ ഇത് Azure-ൽ ലഭ്യമായിരുന്നില്ല.
ഇതുവരെയുള്ള ഞങ്ങളുടെ ധാരണ
പ്രൊഡക്ഷൻ ഫോൺ ഏജന്റുകൾ സ്വാഭാവികമായി കേൾക്കുകയും സ്ക്രിപ്റ്റുകൾ സ്ഥിരതയോടെ പിന്തുടരുകയും വേണം. ആദ്യ കാര്യത്തിൽ GPT-Live-1 അത്ഭുതകരമാണ്, എന്നാൽ രണ്ടാമത്തെ കാര്യത്തിൽ അതിന് ചില ഗുരുതര പ്രശ്നങ്ങളുണ്ട്. സമയം കഴിയുന്നതിനനുസരിച്ച് ഞങ്ങൾ കൂടുതൽ പരിശോധനകൾ നടത്തുകയും ഞങ്ങളുടെ കണ്ടെത്തലുകൾ റിപ്പോർട്ട് ചെയ്യുന്നത് തുടരുകയും ചെയ്യും.