குரல் ஏஜென்ட்களுக்கான GPT-Live-1 API பற்றிய எங்களின் முதல் அனுபவங்கள்
OpenAI தனது புதிய முழு-டூப்ளெக்ஸ் குரல் மாடலான GPT-Live-1-ஐ இரண்டு நாட்களுக்கு முன்பு API-யில் வெளியிட்டது. நாங்கள் தயாரிப்பு சூழலில் AI தொலைபேசி ஏஜென்ட்களை உருவாக்கி இயக்குகிறோம்; அதனால் இதை ஒரு உண்மையான தொலைபேசி எண்ணில் இணைத்து அழைத்தோம். நிறைய முறை.
எங்கள் காப்பீட்டு வாடிக்கையாளர்களில் ஒருவரின் சுமார் 13,000-token கொண்ட வார்ம்-லீட் தகுதிப்படுத்தல் ஸ்கிரிப்ட்டைப் பயன்படுத்தி இதைச் சோதித்தோம்; அதில் கட்டாயமாக வார்த்தைக்கு வார்த்தை சொல்ல வேண்டிய வரிகள், கடுமையான மீள்படிப்பு விதிகள் மற்றும் கிளைபடும் தொடர்கேள்விகள் இருந்தன. ஒரு நீண்ட நாளில், ஒரு டஜன் உண்மையான தொலைபேசி அழைப்புகள், சுமார் 25 சிமுலேட் செய்யப்பட்ட நேர்காணல்கள் மற்றும் கட்டமைப்பற்ற சோதனைகளின் ஒரு தொகுப்பை நடத்தினோம்.
உரையாடல் பதிவுகள் மற்றும் ஆடியோவுடன் எங்கள் முதல் அனுபவங்கள் இவை. மேலும் விரிவான பதிவு விரைவில் வருகிறது.
உரையாடல் பதிவுகள், GPT-Live எழுத்தாக்கிய எங்கள் சோதனை அழைப்புகளிலிருந்து எடுக்கப்பட்டவை. பெயர்களையும் அடையாளம் காணக்கூடிய சொற்களையும் மாற்றியுள்ளோம், பரிமாற்றங்களைச் சுருக்கியுள்ளோம், பிரிந்த துண்டுகளை இணைத்துள்ளோம். அழைப்பு தொடங்கியதிலிருந்து வினாடிகளில் உள்ள நேரக்குறிப்புகள் மூலப் பதிவுகளிலிருந்து எடுக்கப்பட்டவை.
இயல்புத்தன்மை விதிவிலக்கானது
நாங்கள் தொலைபேசி இணைப்பில் பயன்படுத்தியவற்றில், GPT-Live-1 தான் மிக இயல்பாக ஒலிக்கும் உரையாடுபவர். இது உண்மையான ஒரு முன்னேற்றம்.
தனித்தனி எழுத்தாக்கம் மற்றும் ஒலித் தொகுப்பு நிலைகள் இல்லாமல், இது ஒரே தொடர்ச்சியான ஆடியோ ஸ்ட்ரீமில் கேட்டு பேசுகிறது. உரையாடலின் பெரும்பாலான இயக்கவியல் இயல்பாகவே செயல்படுகிறது. அழைப்பாளர்கள் பேசுவதை நிறுத்திய பிறகு சராசரியாக 1.3 வினாடிகளில் அதன் முதல் ஆடியோவைக் கேட்டனர்; தொலைபேசி இணைப்பு இல்லாமல் அது சுமார் 0.7 வினாடிகள். குரல் செயல்பாட்டுக் கண்டறிதலையோ முறைமாற்றத் தர்க்கத்தையோ நாங்கள் சேர்க்கவில்லை. இது இடையூறுகளைச் சீராகக் கையாள்கிறது, இயல்பான இடைஒலிகளை ("Mm-hmm") உருவாக்குகிறது, மேலும் வேகமான, மனிதரைப் போன்ற வேகத்தில் பேசுகிறது.
வாசிக்க வேண்டிய வரிகளுக்குப் பதிலாக இலக்குகள் வழங்கப்படும்போது, உரையாடலுக்கு ஏற்றவாறு கேள்விகளை அமைக்கிறது மற்றும் திருத்தங்களை இயல்பாக ஏற்றுக்கொள்கிறது:
திருத்தங்கள், இடையூறுகள் அல்லது அழைப்பின் நடுவில் பதில்களை மாற்றும் அழைப்பாளர்கள் என எதிலும் இது ஒருபோதும் தன்னடக்கத்தை இழக்கவில்லை. இயல்புத்தன்மை மட்டுமே முழுப் பணியாக இருந்திருந்தால், இந்தப் பதிவு இங்கேயே முடிந்திருக்கும். துரதிர்ஷ்டவசமாக, இதைவிட இதில் அதிகம் உள்ளது.
இது வழிமுறைகளை நம்பகமாகப் பின்பற்றுவதில்லை
ஸ்கிரிப்ட் செய்யப்பட்ட தொலைபேசி அழைப்புக்கு முக்கியமான நடத்தைகளில் GPT-Live-1 வழிமுறைகளை நம்பகமாகப் பின்பற்றுவதில்லை.
ஒன்றுக்கு மேற்பட்ட முறை, தெளிவான "ஆம்" பதிலுக்கு அது "இல்லை" என்று பதில் வந்தது போலப் பதிலளித்து, கேள்வியை மீண்டும் கேட்டது அல்லது அழைப்பாளர் மறுத்தது போல அடுத்த கட்டத்துக்குச் சென்றது.
வழிமுறைகளை அளவுக்கு மீறி நேரடியான பொருளில் எடுத்துக்கொள்வதே மிகவும் தொடர்ந்து ஏற்பட்ட தோல்வி. எங்கள் prompt-ல் இவ்வாறு இருந்தது: கோப்பில் உள்ள வீட்டு நிலை தவறு என்று அழைப்பாளர் சொன்னால், அவர்கள் சொந்தமாக வைத்திருக்கிறார்களா, வாடகைக்கு இருக்கிறார்களா, அல்லது பெற்றோருடன் வசிக்கிறார்களா என்று கேட்கவும். ஒரு அழைப்பாளர் "இல்லை, இப்போது அது எனக்குச் சொந்தம்" என்றார்; அதுவே அந்தக் கேள்விக்கான பதில். இருந்தும் மாடல் பட்டியலை வாசித்தது:
ஆரம்பகால வினோதங்களில் சில எங்கள் prompt-ன் தவறால் ஏற்பட்டவை; ஆனால் நாங்கள் முயற்சித்த ஒவ்வொரு prompt மாறுபாட்டிலும் இந்த நேரடிப்பொருள் பற்றிக்கொண்ட தன்மை தொடர்ந்தது. நாங்கள் வெளிப்படையாக எழுதாத எந்தப் பதிலும் விவேகமாக அல்லாமல் இயந்திரத்தனமாகக் கையாளப்பட்டது.
அழுத்தத்தில் இது சில நேரங்களில் சத்தமாகச் சிந்திக்கவும் செய்கிறது:
எண்களும் எழுத்தெண் குறியீடுகளும் ஆபத்தானவை
எழுத்துப்பிழைகள், முகவரிகள், பிறந்த தேதிகள் மற்றும் அடையாள எண்கள் துல்லியமாக இருக்க வேண்டும். GPT-Live-1-ன் பேச்சில் அதிக சிக்கல்கள் இருப்பது இங்குதான்.
எழுத்தெண் சரங்களில் எழுத்துகள் விடுபடுவதையும் மாற்றப்படுவதையும் நாங்கள் கேட்டோம். இங்கே அது உருவாக்கப்பட்ட ஒரு க்ளெய்ம் எண்ணை வாசிக்கிறது; அமைதியான பகுதிகளை வெட்டியதைத் தவிர கிளிப்புகள் மாற்றப்படவில்லை. ஆங்கிலத்தில், அதன் டிரான்ஸ்கிரிப்ட் சரியாக இருந்தது, ஆனால் ஆடியோவில் ஒரு "Y" சேர்க்கப்பட்டது:
ரஷ்ய மொழியில் நிலைமை இன்னும் மோசமாக இருந்தது: ஆடியோவிலும் அதன் டிரான்ஸ்கிரிப்ட்டிலும் "Q" என்பது "X" ஆக மாறியது.
தேதிகளிலும் இதே சிக்கல் ஏற்பட்டது. ஒரு அழைப்பாளர் பிறந்த தேதியை இலக்கங்களாகக் கூறினார்; பின்னர் மாடல் அதை ஒரு எண்ணாக மீண்டும் வாசித்தது:
சில சமயங்களில், அழைப்பாளருக்குச் சொந்தமான ஒரு வரியையும் அது பேசுகிறது:
பிற மொழிகளில் உச்சரிப்புகள்
எங்கள் தயாரிப்பு ஆதரிக்கும் 47 மொழிகளிலும் புதிய குரல் மாடல்களை நாங்கள் சோதிக்கிறோம். GPT-Live-1-ன் ரஷ்ய மொழி சரளமாக இருந்தது, ஆனால் அதில் வலுவான அமெரிக்க உச்சரிப்பு இருந்தது (நாங்கள் தயாரிப்பில் இயக்கும் TTS குரல்கள் பொதுவாக தாய்மொழி பேசுபவர்களைப் போல ஒலிக்கும்):
லுகாண்டா மொழியையும் நாங்கள் முயற்சித்தோம். முதல் அழைப்பில், அதற்குப் பதிலாக அது சுவாஹிலி மொழியில் பதிலளித்தது. இரண்டாவது அழைப்பில், அது லுகாண்டா மொழியில் பேசினது; ஒரு பொதுவான மாடலிடமிருந்து எதிர்பார்த்ததைவிட இயல்பாக இருந்தது, ஆனால் மீண்டும் வலுவான அமெரிக்க உச்சரிப்புடன் இருந்தது. எல்லா மொழிகளையும் நாங்கள் சோதிக்கவில்லை, ஆனால் இந்த உச்சரிப்பு முறை பெரும்பாலும் எல்லா மொழிகளுக்கும் பொருந்தும் என எதிர்பார்க்கிறோம். ஆங்கிலம் மட்டும் பேசும் ஏஜென்ட்டுக்கு இது முக்கியமல்ல, ஆனால் பிற மொழிகளிலான பயன்பாடுகளுக்கு இது மிகவும் குறிப்பிடத்தக்க ஒரு வரம்பாகும்.
தெரிந்துகொள்ள வேண்டிய சில API கட்டுப்பாடுகள்
இந்த வாரம் நாங்கள் கண்டறிந்தவற்றின் அடிப்படையில், உண்மையான ஏஜென்ட்டுக்கு சில API கட்டுப்பாடுகள் முக்கியமானவை:
- அமர்வு தொடங்கிய பிறகு வழிமுறைகளை மாற்ற முடியாது, மேலும் அவை 16,384 டோக்கன்களாக வரையறுக்கப்பட்டுள்ளன.
- வெளியீட்டு ஆடியோ ஸ்ட்ரீமிங் ஒருபோதும் நிற்காது — அமைதியும் ஸ்ட்ரீம் செய்யப்படுகிறது — எனவே டர்ன்களைப் பிரிக்க வேண்டிய பயன்பாடுகளுக்கு "ஆடியோ நிறுத்தப்பட்டது" என்பதை டர்ன் முடிவு சமிக்ஞையாகப் பயன்படுத்த முடியாது.
- புதிய
v1/live/sessionsஎண்ட்பாயிண்ட் மூலமாக மட்டுமே இதை அணுக முடியும்; நாங்கள் சரிபார்த்தபோது இது இன்னும் Azure-ல் கிடைக்கவில்லை.
இதுவரை எங்கள் கருத்து
தயாரிப்பு சூழலில் உள்ள தொலைபேசி ஏஜென்ட்கள் இயல்பாக ஒலிக்க வேண்டும் மற்றும் ஸ்கிரிப்ட்களைத் தொடர்ந்து ஒரே மாதிரியாகப் பின்பற்ற வேண்டும். GPT-Live-1 முதலில் கூறியதில் அற்புதமாக உள்ளது, ஆனால் இரண்டாவதில் சில தீவிரமான சிக்கல்கள் உள்ளன. காலப்போக்கில் மேலும் சோதனைகளை நடத்தி, எங்கள் கண்டறிதல்களைத் தொடர்ந்து பகிர்வோம்.