বেশিরভাগ ভয়েস AI প্ল্যাটফর্ম 3-ধাপের একটি পাইপলাইনের ওপর নির্ভর করে: একটি ট্রান্সক্রিপশন মডেল, চিন্তা করে না এমন একটি LLM এবং একটি টেক্সট-টু-স্পিচ ইঞ্জিন। প্রতিটি ধাপই একা পুরো প্রক্রিয়াকে ব্যর্থ করে দিতে পারে। একসঙ্গে অনেক মডেলের কাজ সমন্বয় করে ThunderPhone ভুল কমায়।
ThunderPhone একই সঙ্গে অনেক মডেলের কাজ সমন্বয় করে, যাতে একটির ভুল অন্যটি শুধরে দিতে পারে।
দ্রুত LLM শুধু ট্রান্সক্রিপ্টই দেখে।
“Hi, Brent — how can I help?”
দ্রুত ও রিজনিং LLM ফল মিলিয়ে দেখে: 3টি পথের মধ্যে 2টির ফল মেলে।
“Got it — so you rent.”
BBA যাচাই করে, কোনো মডেল ভয়েসে দেওয়া prompt বুঝে কঠিন প্রশ্নের সঠিক উত্তর দিতে পারে কি না। রেকর্ডটি আমাদের সবচেয়ে শক্তিশালী Storm কনফিগারেশনের দখলে—আমাদের পাবলিক ইভ্যালুয়েশন সেটে এর স্কোর 99.4%।
0.6% ভুলের হার
ThunderPhone-এর ফলাফলটি এসেছে ওপরে লিঙ্ক করা আমাদের উন্মুক্ত মূল্যায়ন ডেটাসেট থেকে; তুলনার সুবিধার জন্য অন্যান্য প্রকাশ্য স্কোরও (Artificial Analysis লিডারবোর্ড) দেওয়া হয়েছে।
Vapi, Retell, Pipecat ও LiveKit-এর মতো অন্য ভয়েস AI প্ল্যাটফর্মে কল চালু করতে কনফিগারেশনের বিস্তর সিদ্ধান্ত আপনাকেই নিতে হয়। ThunderPhone-এ আমরা মনে করি, টিউনিং আমাদের কাজ—কল নির্বিঘ্নে চালাতে আপনাকে যতটা সম্ভব কম কাজই করতে হবে।
ThunderPhone আপনার হয়ে সবকিছু টিউন করে দেয়
Spark, Bolt অথবা Storm।
বাছাই করা, বাস্তব কলে পরীক্ষিত।
আচরণ, নীতিমালা, টুল—সবই সহজ ভাষায়।
মাত্র তিনটি সিদ্ধান্তেই সেটআপ শেষ—অর্কেস্ট্রেশন, ফলব্যাক ও টিউনিং সবই আগে থেকে বিল্ট-ইন।
কাজের ধরন অনুযায়ী আমরা সেরা মডেলগুলো বেছে নিয়ে একসঙ্গে কাজে লাগাই। OpenAI, Anthropic ও Google-এর ফ্রন্টিয়ার মডেলের পাশাপাশি কাজ করে ওপেন-সোর্স মডেলও—প্রতিটি কলে সেরা পারফরম্যান্স ও মূল্য নিশ্চিত করতে সবকিছু নিখুঁতভাবে অর্কেস্ট্রেট করা হয়, তাই এসব নিয়ে আপনাকে ভাবতে হয় না।
দুর্বল সিস্টেম জটিল prompt অনুসরণ করতে পারে না বলেই ফ্লো বিল্ডারের প্রয়োজন হয়। কথোপকথনের প্রতিটি ধাপ হয়ে যায় আলাদা নোড; প্রতিটিই আপনাকে ম্যানুয়ালি তৈরি ও রক্ষণাবেক্ষণ করতে হয়। Storm একটি prompt থেকেই বিস্তারিত নির্দেশনা মেনে চলে, তাই নোড ও এজ নিয়ে আপনাকে ভাবতে হয় না।
একটি এনরোলমেন্ট ফ্লোর জন্য 6টি নোড—প্রতিটিরই আলাদা prompt, টুল, ট্রানজিশন ও ব্যর্থতা সামলানোর ব্যবস্থা।
কলারকে শুভেচ্ছা জানিয়ে তাঁর নাম ও ফোন নম্বর সংগ্রহ করুন। নিবন্ধনের আগে তাঁর সম্মতি নিশ্চিত করুন—এটি আবশ্যক। বিলিং নিয়ে প্রশ্ন করলে নিচের বিলিং নীতিমালা অনুসরণ করুন। সব ফিল্ড নিশ্চিত হওয়ার পরই এবং মাত্র একবার enroll() কল করুন। কলার কোনো মানুষের সঙ্গে কথা বলতে চাইলে তাঁকে মানব এজেন্টের কাছে ট্রান্সফার করুন।
লেখা, পরীক্ষা ও বারবার পরিমার্জনের জন্য একটিই prompt—শাখা তৈরিও এতে অন্তর্ভুক্ত।
অস্পষ্ট উচ্চারণ, পেছনের কথাবার্তা, নাম ও নম্বর, ভাষার মিশ্রণ—যেসব পরিস্থিতিতে অন্য সিস্টেম ব্যর্থ হয়, ThunderPhone তৈরি ঠিক সেগুলো সামলাতেই।
অডিও ও টেক্সট সিগন্যাল মিলিয়ে দেখুন—শুধু একটি ট্রান্সক্রিপ্টের ওপর ভরসা করবেন না।
নয়েজ শনাক্ত ও কমানোর মডেল সিগন্যাল পরিষ্কার করে।
পাশের কথাবার্তা এজেন্টকে বিভ্রান্ত করার আগেই শনাক্ত করুন।
নাম, বানান, সংখ্যা ও সংশোধন একাধিক উৎসে মিলিয়ে যাচাই করুন।
প্রয়োজনে বহুভাষিক অডিও ও ভয়েস পাথ ধরে রাউট করুন।
যখন আচরণকে একটি নিয়মে বাঁধা যায় না, তখন আরও শক্তিশালী যুক্তি বিশ্লেষণ ব্যবহার করুন।
ফোন AI-কে দ্রুত উত্তর দিতে হয়—কিন্তু উত্তর সঠিক না হলে ভুলটাই শুধু আরও দ্রুত হয়। আজকের LLM-গুলোকে নির্ভরযোগ্য উত্তর দিতে একটু সময় নিয়ে ভাবতে হয়, তাই ThunderPhone ল্যাটেন্সি ও নির্ভুলতার মধ্যে ভারসাম্য রাখে।
অন্য ভেন্ডররা আদর্শ পরিস্থিতিতে 500 মিলিসেকেন্ড ল্যাটেন্সির দাবি করে, কিন্তু সাধারণত বাস্তব কলে প্রায় 2 সেকেন্ড লাগে। আমরা বাস্তব পরিস্থিতিতে ল্যাটেন্সি মাপি।
AI ভেন্ডরদের ল্যাটেন্সি হঠাৎ বেড়ে গেলে কল ব্যাহত হতে পারে। এমন হলে ThunderPhone-এর অর্কেস্ট্রেটেড স্ট্যাক স্বয়ংক্রিয়ভাবে আরও দ্রুত বিকল্পে স্যুইচ করে।
অটোমেটেড ফোন কল এত দিন মানেই ছিল বিরক্তি… এখন আর নয়। প্রযুক্তি এগোনোর প্রতিটি ধাপে অভিজ্ঞতা উন্নত হয়েছে ঠিকই, কিন্তু কখনোই সত্যিকার অর্থে নির্বিঘ্ন হয়ে ওঠেনি। ThunderPhone এবার সেটাই বদলে দিচ্ছে।
“সেলসের জন্য 1 চাপুন, সাপোর্টের জন্য 2 চাপুন।” মেনুর কাজ কেবল কল রাউট করা।
“সেলস” বা “বিলিং” বলুন—তারপর আশা করুন, স্লট পার্সার তা ঠিকমতো ধরতে পারবে।
ট্রান্সক্রাইব করুন, একটি দ্রুত LLM-কে জিজ্ঞেস করুন, তারপর উত্তরটি বলুন—প্রতিটি ধাপই আগের ধাপের ফলকে নির্ভুল ধরে নিয়ে এগোয়।
অডিও, টেক্সট, রিজনিং, টুল, ভয়েস ও গার্ডরেল—সব মিলিয়ে একটি সমন্বিত সিস্টেম।
10 মিনিটেই লাইভ। মিনিটে 2¢ থেকে।