ভয়েস এজেন্টের জন্য GPT-Live-1 API সম্পর্কে আমাদের প্রথম ধারণা
OpenAI দুই দিন আগে API-তে তাদের নতুন ফুল-ডুপ্লেক্স ভয়েস মডেল GPT-Live-1 প্রকাশ করেছে। আমরা প্রোডাকশনে AI ফোন এজেন্ট তৈরি ও পরিচালনা করি, তাই এটিকে একটি আসল ফোন নম্বরে চালু করে কল করেছি। অনেকবার।
আমরা আমাদের এক বীমা গ্রাহকের ~13,000-টোকেনের ওয়ার্ম-লিড কোয়ালিফিকেশন স্ক্রিপ্ট দিয়ে এটি পরীক্ষা করেছি, যেখানে হুবহু বলার বাধ্যতামূলক লাইন, কঠোর পুনরাবৃত্তি-নিশ্চিতকরণ নিয়ম এবং শাখাভিত্তিক ফলো-আপ ছিল। এক দীর্ঘ দিনে আমরা এক ডজন আসল ফোন কল, প্রায় 25টি সিমুলেটেড সাক্ষাৎকার এবং কিছু অসংগঠিত পরীক্ষার একটি ব্যাচ চালিয়েছি।
ট্রান্সক্রিপ্ট ও অডিওসহ এটাই আমাদের প্রথম ধারণা। খুব শিগগিরই আরও বিস্তারিত লেখা আসছে।
ট্রান্সক্রিপ্টগুলো আমাদের পরীক্ষামূলক কল থেকে নেওয়া, যা GPT-Live ট্রান্সক্রাইব করেছে। আমরা নাম ও শনাক্তকারী শব্দচয়ন বদলেছি, কথোপকথনের অংশ সংক্ষিপ্ত করেছি এবং ভাঙা অংশ একত্র করেছি। কল শুরুর পর থেকে সেকেন্ডে দেওয়া টাইমস্ট্যাম্পগুলো মূল রেকর্ডিং থেকে নেওয়া।
স্বাভাবিকতা অসাধারণ
ফোন লাইনে আমরা যে কথোপকথনকারীকে ব্যবহার করেছি, GPT-Live-1 তার মধ্যে সবচেয়ে স্বাভাবিক-শোনানো। এটি সত্যিই বড় এক অগ্রগতি।
এটি আলাদা ট্রান্সক্রিপশন ও সংশ্লেষণ ধাপ ছাড়াই একটি অবিচ্ছিন্ন অডিও স্ট্রিমে শোনে ও কথা বলে। কথোপকথনের বেশিরভাগ প্রক্রিয়াই স্বয়ংক্রিয়ভাবে কাজ করে। কলাররা কথা বলা বন্ধ করার পর এর প্রথম অডিও শুনেছেন মধ্যমা হিসেবে প্রায় 1.3 সেকেন্ডে, বা ফোন লেগ ছাড়া প্রায় 0.7 সেকেন্ডে। আমরা কোনো ভয়েস-অ্যাক্টিভিটি ডিটেকশন বা পালা-বদলের লজিক যোগ করিনি। এটি বাধা সুনিপুণভাবে সামলায়, স্বাভাবিক ব্যাকচ্যানেল ("Mm-hmm") দেয় এবং দ্রুত, মানুষের মতো গতিতে কথা বলে।
পড়ে শোনানোর লাইন নয়, লক্ষ্য দেওয়া হলে এটি কথোপকথনের সঙ্গে প্রশ্ন মানিয়ে নেয় এবং সংশোধন সহজভাবে গ্রহণ করে:
সংশোধন, বাধা বা কলার কলের মাঝখানে উত্তর বদলালেও এটি কখনও স্থিরতা হারায়নি। স্বাভাবিকতাই যদি পুরো কাজ হতো, এই পোস্ট এখানেই শেষ হতো। দুর্ভাগ্যবশত, বিষয়টি এর চেয়ে বেশি জটিল।
এটি নির্ভরযোগ্যভাবে নির্দেশনা অনুসরণ করে না
স্ক্রিপ্টভিত্তিক ফোন কলের জন্য গুরুত্বপূর্ণ আচরণগুলোতে GPT-Live-1 নির্ভরযোগ্যভাবে নির্দেশনা অনুসরণ করে না।
একাধিকবার এটি স্পষ্ট "yes"-এর জবাব এমনভাবে দিয়েছে যেন উত্তরটি "no" ছিল—প্রশ্নটি আবার করেছে বা কলার প্রত্যাখ্যান করেছেন ধরে নিয়ে এগিয়ে গেছে।
সবচেয়ে ধারাবাহিক ব্যর্থতা ছিল নির্দেশনাকে অতিরিক্ত আক্ষরিকভাবে নেওয়া। আমাদের prompt-এ বলা ছিল: কলার যদি বলেন যে নথিতে থাকা আবাসন-অবস্থা ভুল, তাহলে জিজ্ঞাসা করতে হবে তিনি নিজের বাড়ির মালিক, ভাড়াটে, নাকি বাবা-মায়ের সঙ্গে থাকেন। এক কলার বলেছিলেন, "no, I own it now," যা প্রশ্নটির উত্তর আগেই দিয়ে দেয়। তবু মডেলটি পুরো বিকল্পতালিকা পড়ে শোনায়:
শুরুর দিকের কিছু অদ্ভুততা আমাদের prompt-এর দোষ ছিল, কিন্তু আমরা চেষ্টা করা প্রতিটি prompt ভ্যারিয়েন্টেই এই আক্ষরিকতা বজায় ছিল। যে উত্তর আমরা স্পষ্টভাবে লিখে দিইনি, সেটিই যুক্তিসঙ্গতভাবে নয়, যান্ত্রিকভাবে সামলানো হয়েছে।
চাপের মধ্যে এটি কখনও কখনও জোরে জোরে ভাবেও:
সংখ্যা ও আলফানিউমেরিক ঝুঁকিপূর্ণ
বানান, ঠিকানা, জন্মতারিখ এবং আইডি নম্বর একদম নির্ভুল হতে হয়। এখানেই GPT-Live-1-এর কথ্য আউটপুটে সবচেয়ে বেশি সমস্যা দেখা যায়।
আমরা এটিকে আলফানিউমেরিক স্ট্রিংয়ে অক্ষর বাদ দিতে ও বদলে দিতে শুনেছি। এখানে এটি একটি কাল্পনিক ক্লেইম নম্বর পড়ছে; নীরব অংশ ছাঁটা ছাড়া ক্লিপগুলো অপরিবর্তিত। ইংরেজিতে এর ট্রান্সক্রিপ্ট সঠিক ছিল, কিন্তু অডিওতে একটি "Y" যোগ হয়েছিল:
রুশ ভাষায় এটি আরও খারাপ ছিল: অডিও এবং এর ট্রান্সক্রিপ্ট—দুটিতেই "Q" বদলে "X" হয়ে গিয়েছিল।
তারিখেও একই সমস্যা হয়েছিল। একজন কলার জন্মতারিখটি অঙ্ক হিসেবে দিয়েছিলেন, যা মডেল পরে একটি সংখ্যা হিসেবে আবার পড়ে:
এটি মাঝেমধ্যে কলারের বলার কথা এমন একটি লাইনও বলে ফেলে:
অন্যান্য ভাষায় উচ্চারণ
আমাদের পণ্য যে 47টি ভাষা সমর্থন করে, সেগুলোতে আমরা নতুন ভয়েস মডেল পরীক্ষা করি। GPT-Live-1-এর রুশ ভাষা সাবলীল ছিল, তবে এতে প্রবল আমেরিকান উচ্চারণ ছিল (অন্যদিকে, আমরা প্রোডাকশনে যে TTS ভয়েসগুলো চালাই সেগুলো সাধারণত স্থানীয় ভাষাভাষীর মতো শোনায়):
আমরা লুগান্ডাও চেষ্টা করেছি। প্রথম কলে এটি তার বদলে সোয়াহিলিতে উত্তর দিয়েছিল। দ্বিতীয় কলে এটি লুগান্ডায় কথা বলেছিল—একটি সাধারণ মডেলের কাছ থেকে আমাদের প্রত্যাশার চেয়ে বেশি স্বাভাবিকভাবে—তবে আবারও প্রবল আমেরিকান উচ্চারণে। আমরা প্রতিটি ভাষা পরীক্ষা করিনি, কিন্তু আমাদের ধারণা উচ্চারণের এই ধরনটি সম্ভবত সব ক্ষেত্রেই প্রযোজ্য। শুধু ইংরেজির জন্য ব্যবহৃত এজেন্টে এটি গুরুত্বপূর্ণ নয়, কিন্তু অন্যান্য ভাষার ব্যবহারের ক্ষেত্রে এটি বেশ বড় একটি সতর্কতা।
জানার মতো কয়েকটি API সীমাবদ্ধতা
এই সপ্তাহে আমরা যা পেয়েছি, তার ভিত্তিতে বাস্তব এজেন্টের জন্য কয়েকটি API সীমাবদ্ধতা গুরুত্বপূর্ণ:
- সেশন শুরু হওয়ার পর নির্দেশনা অপরিবর্তনীয়, এবং সর্বোচ্চ 16,384 টোকেনে সীমাবদ্ধ।
- আউটপুট অডিও স্ট্রিম হওয়া কখনও বন্ধ হয় না — নীরবতাও স্ট্রিম হয় — তাই যেসব ব্যবহারের ক্ষেত্রে পালা আলাদা করতে হয়, সেখানে "অডিও বন্ধ হয়েছে" পালা শেষের সংকেত হিসেবে ব্যবহার করা যায় না।
- এটি শুধু নতুন
v1/live/sessionsএন্ডপয়েন্টের মাধ্যমে পাওয়া যায়, এবং আমরা পরীক্ষা করার সময় এটি এখনও Azure-এ উপলভ্য ছিল না।
এখন পর্যন্ত আমাদের ধারণা
প্রোডাকশন ফোন এজেন্টকে স্বাভাবিক শোনাতে হয় এবং ধারাবাহিকভাবে স্ক্রিপ্ট অনুসরণ করতে হয়। GPT-Live-1 প্রথম বিষয়টিতে অসাধারণ, কিন্তু দ্বিতীয়টিতে এর কিছু গুরুতর সমস্যা আছে। সময়ের সঙ্গে আমরা আরও পরীক্ষা চালাব এবং আমাদের পর্যবেক্ষণ জানাতে থাকব।