ভয়েস AI-এর প্রজন্মগুলো

বেশিরভাগ স্বয়ংক্রিয় ফোনকল বাজে। নতুন প্রযুক্তি তা বদলে দেয়।

পুরোনো সমস্যাটি ছিল না যে ফোন অটোমেশনে মনোরম কণ্ঠের অভাব ছিল। বাস্তব কথোপকথন চালিয়ে নেওয়ার মতো যথেষ্ট বোঝাপড়ার অভাব ছিল।

ফোন ট্রি

IVR যুগ

কলারকে মেশিনের ভাষায় কথা বলতে হতো।

অটোমেশন বলতে মেনু, কীপ্যাড শাখা এবং কিউ বোঝাত। কলার সঠিক পথ আগে থেকেই জানলে এটি কাজ করত।

অস্বস্তিকর মুহূর্ত

উদ্দেশ্য একটি বাটন চাপে সীমাবদ্ধ হয়ে যায়, তাই মেনুর বাইরের যেকোনো বিষয় ট্রান্সফার বা পুনরাবৃত্তিতে পরিণত হয়।

নমুনা কল

IVR যুগ

কলকারী

"আমার আগামীকালের অ্যাপয়েন্টমেন্টটি বদলাতে হবে।"

সিস্টেম

"বিলিংয়ের জন্য 1 চাপুন। সময়সূচির জন্য 2 চাপুন। অন্য সব প্রশ্নের জন্য 9 চাপুন।"

ফলাফল

কলার অনুমান করেন, অপেক্ষা করেন এবং একই কথা আবার ব্যাখ্যা করেন।

সিস্টেম কীভাবে চিন্তা করে

3টি ধাপ

মেনু প্রম্পট

নির্ধারিত

একটি নির্দিষ্ট স্ক্রিপ্টে বিকল্পগুলোর তালিকা থাকে।

DTMF শাখা

ভঙ্গুর

একটি বাটনই পুরো উদ্দেশ্য হয়ে যায়।

কিউ

ব্যর্থ

আসল প্রেক্ষাপট একজন মানুষের কাছে পৌঁছায়।

কাস্টম মডেল

প্রারম্ভিক AI

সিস্টেমগুলো সীমিত পরিসর বুঝত, তারপর ভেঙে পড়ত।

নির্দিষ্ট কল ফ্লোর জন্য টিমগুলো অ্যাকুস্টিক মডেল, ইনটেন্ট ক্লাসিফায়ার এবং স্লট এক্সট্র্যাক্টর প্রশিক্ষণ দিত। উপকারী, কিন্তু পরিবর্তন করা ব্যয়বহুল।

অস্বস্তিকর মুহূর্ত

সিস্টেম একটি প্রশিক্ষিত উদ্দেশ্য ধরতে পারে, তারপর দ্বিতীয় অনুরোধটি বাদ দেয় বা অনমনীয় ফলো-আপ প্রশ্ন করে।

নমুনা কল

প্রারম্ভিক AI

কলকারী

"আপনি কি আগামীকালের অ্যাপয়েন্টমেন্টটি বদলে আমার জীবনসঙ্গীকেও যোগ করতে পারবেন?"

সিস্টেম

"আমি পুনর্নির্ধারণে সাহায্য করতে পারি। আপনি কোন তারিখ চান?"

ফলাফল

প্রশিক্ষিত ফ্লোতে না থাকায় জীবনসঙ্গীর তথ্যটি হারিয়ে যায়।

সিস্টেম কীভাবে চিন্তা করে

3টি ধাপ

কাস্টম ASR

নির্ধারিত

একটি ডোমেইন ও উচ্চারণের মিশ্রণের জন্য টিউন করা।

ইনটেন্ট মডেল

ভঙ্গুর

সবচেয়ে কাছাকাছি পরিচিত অনুরোধটি শ্রেণিবদ্ধ করে।

স্লট ফিলিং

ব্যর্থ

অনুপস্থিত তথ্য স্ক্রিপ্টেড সংশোধন চালু করে।

Vapi / Retell / ElevenLabs-ধাঁচের স্ট্যাক

3-ধাপের পাইপলাইন

স্ট্যাক আরও নমনীয় হয়েছে, কিন্তু প্রতিটি ধাপ আগের ধাপকে বিশ্বাস করেছে।

একটি প্রচলিত আধুনিক প্যাটার্ন স্পিচ-টু-টেক্সট, একটি LLM এবং টেক্সট-টু-স্পিচকে একটি কল লুপে যুক্ত করে।

অস্বস্তিকর মুহূর্ত

ট্রান্সক্রিপ্ট ভুল হলে বা কলকারী বাধা দিলে, LLM আত্মবিশ্বাসের সঙ্গে ভুল কলের উত্তর দেয়।

নমুনা কল

3-ধাপের পাইপলাইন

কলকারী

"না, আমি জায়গাটা ভাড়া নিই।"

সিস্টেম

"বুঝেছি, এটি একটি খামারবাড়ির সম্পত্তি। ঠিক তো?"

ফলাফল

একটি শোনার ভুলই মুখে বলা ভুলে পরিণত হয়।

সিস্টেম কীভাবে চিন্তা করে

3টি ধাপ

স্পিচ টু টেক্সট

ব্যর্থ

একটি ট্রান্সক্রিপ্টই তথ্যের একমাত্র নির্ভরযোগ্য উৎস হয়ে ওঠে।

LLM

ভঙ্গুর

মূল অডিও থেকে নয়, টেক্সট থেকে তৈরি করে।

টেক্সট টু স্পিচ

ব্যর্থ

আত্মবিশ্বাসের সঙ্গে উত্তরটি আবার বলে।

সমন্বিত ভয়েস AI

ThunderPhone

সিস্টেম একটি লুপেই শুনতে, যুক্তি করতে এবং পুনরুদ্ধার করতে পারে।

ThunderPhone অডিও বোঝা, মডেল রাউটিং, পালা নেওয়া এবং প্রতিক্রিয়া তৈরি করাকে একটি একক আর্কিটেকচার হিসেবে সমন্বয় করে।

যা বদলায়

একাধিক শ্রবণ পথ এবং অডিও-সচেতন যুক্তি একধাপের ব্যর্থতাগুলো কলকারীর কাছে পৌঁছানোর আগেই কমায়।

নমুনা কল

ThunderPhone

কলকারী

"না, আমি জায়গাটা ভাড়া নিই।"

সিস্টেম

"বুঝেছি। আপনি আপনার বাড়ি ভাড়া নেন, তাই আমি মালিকানা-সংক্রান্ত প্রশ্নগুলো এড়িয়ে যাব।"

ফলাফল

কলকারীকে সিস্টেমের সঙ্গে লড়াই করতে না করিয়েই কল এগিয়ে যায়।

সিস্টেম কীভাবে চিন্তা করে

4টি ধাপ

অডিও স্ট্রিম

যাচাইকৃত

যুক্তি করার জন্য মূল অডিও উপলভ্য থাকে।

সমান্তরাল শ্রবণ

যাচাইকৃত

কাজ করার আগে সংকেতগুলো তুলনা করা হয়।

মডেল রাউটিং

যাচাইকৃত

দ্রুত ও গভীরতর পথগুলো পালা করে একসঙ্গে কাজ করে।

স্বাভাবিক প্রতিক্রিয়া

যাচাইকৃত

কলকারী সংশোধিত প্রেক্ষাপট শোনেন।

এর ফলাফল

অগ্রগতি আরও সুন্দর রোবট কণ্ঠস্বর নয়। এটি এমন আর্কিটেকচার, যা কলকে সঠিক পথে রাখে।

আরও ভালো শোনা

একটি ট্রান্সক্রিপ্টের ওপর নির্ভর না করে সিস্টেমটি সংকেত তুলনা করতে এবং অডিও বিশ্লেষণ করতে পারে।

আরও ভালো সময়নিয়ন্ত্রণ

পালা নেওয়া এবং বাধা সামলানো কথোপকথনের চক্রের অংশ।

আরও ভালো রাউটিং

প্রতিটি কথোপকথনের পালার প্রয়োজন অনুযায়ী দ্রুত পথ ও গভীর বিশ্লেষণ বেছে নেওয়া যায়।

আরও ভালো অভিজ্ঞতা

কলকারীরা অটোমেশন সংশোধনে কম সময় এবং কাজ সম্পন্ন করতে বেশি সময় ব্যয় করেন।