التقنية

تجاوز
مسار المعالجة المكوّن من 3 مراحل.

تعتمد معظم منصات الذكاء الاصطناعي الصوتي على مسار معالجة مكوّن من 3 مراحل: نموذج واحد لتحويل الكلام إلى نص، ونموذج لغوي كبير واحد بلا قدرة على التفكير، ومحرك واحد لتحويل النص إلى كلام. وكل مرحلة تشكّل نقطة فشل منفردة. يقلّل ThunderPhone الأخطاء عبر تنسيق عمل العديد من النماذج في آن واحد.

قال المتصل: «أنا مُستأجِر».
ASR A«أنا مُستأجِر»
ASR B«أنا مُستشار»
نموذج لغوي صوتي كبير«أنا مُستأجِر»
النتيجة بعد التوفيق: «أنا مُستأجِر»يتفق مساران من أصل 3

اسمعه بأكثر من طريقة،
ثم وفّق بين النتائج.

ينسّق ThunderPhone عمل عدة نماذج في آن واحد، ويتيح لها تصحيح أخطاء بعضها بعضًا.

يقول المتصل: «أنا مُستأجِر» — بصوت غير واضح
منصات أخرىمسار من 3 خطوات
يستمع مرة واحدة
تحويل الكلام إلى نص: «أنا مُستشار»
لا توجد آلية احتياطية إذا أخطأ النموذج الوحيد في السماع
إجابات سريعة

لا يرى النموذج اللغوي الكبير السريع سوى النص المفرغ.

يتحدث

«مرحبًا، أيها المستشار — كيف يمكنني مساعدتك؟»

1 نص مفرغ + 1 نموذج لغوي كبير = إجابة خاطئة
ThunderPhoneتنسيق موحّد
يستمع بثلاث طرق
«أنا مُستأجِر»«أنا مُستشار»«أنا مُستأجِر»
الاحتفاظ بثلاثة نصوص مفرغة والتسجيل الصوتي الخام كأدلة
يوحّد النتائج

تتحقق النماذج اللغوية الكبيرة السريعة والقادرة على الاستدلال من النتائج: النتيجة نفسها في 2 من أصل 3 مسارات.

يتحدث

«فهمت — إذًا أنت مُستأجِر».

يضبط أصعب التفاصيل من المحاولة الأولى.

يسجّل Storm أرقامًا قياسية في اختبارات الذكاء على Big Bench Audio.

يختبر BBA قدرة النموذج على فهم الموجّهات المنطوقة وتقديم إجابات صحيحة عن الأسئلة الصعبة. ويحمل أقوى إعداد Storm لدينا الرقم القياسي: 99.4% ضمن مجموعة التقييم التي نتيحها للعامة.

0.6% معدل الأخطاء

· يوليو 2026مجموعة البيانات على Hugging Face
ThunderPhoneStorm · Extra Intelligence0.6%
Qwen Audio 3.0Realtime Plus0.8%
Qwen3.5 OmniPlus Realtime1.3%
Step-Audio R1.1Realtime2.4%

نتيجة ThunderPhone مستمدة من مجموعة بيانات التقييم العامة الخاصة بنا، والمتاحة عبر الرابط أعلاه؛ أما النتائج العامة الأخرى (لوحة صدارة Artificial Analysis) فأُدرجت للمقارنة الاسترشادية.

ليس عليك أن تجمع منظومة صوتية يدويًا.

تفرض عليك منصات أخرى للذكاء الاصطناعي الصوتي، مثل Vapi وRetell وPipecat وLiveKit، اتخاذ قرارات كثيرة بشأن الإعدادات قبل أن تتمكن من تشغيل مكالماتك. نحن في ThunderPhone نؤمن بأن الضبط مهمتنا، وأنك يجب ألا تضطر إلى بذل أكثر من الحد الأدنى من الجهد كي تسير مكالماتك بسلاسة.

منصات الذكاء الاصطناعي الصوتي الأخرىإعدادات كثيرة تحتاج إلى الضبط
STTv4-largeبديل STT الاحتياطينموذج لغوي كبيرtemp 0.3نموذج لغوي كبير احتياطيتحويل النص إلى كلامبديل TTS الاحتياطيVAD0.62تحديد نهاية الكلام240 msعتبة المقاطعة−38 dBمرشّح إشارات الإصغاءالمقاطعاتمهلة الدور800 msإزالة الضوضاءمخزن مؤقت لتفاوت التأخير60 msمعدّل أخذ العينات8 kHzمخطط الأدواتسياسة إعادة المحاولة×3البدائل الاحتياطية

ThunderPhone يضبط كل ذلك نيابةً عنك

ThunderPhoneثلاثة قرارات
1
اختر مستوى

Spark أو Bolt أو Storm.

2
اختر صوتًا

أصوات منتقاة ومختبرة في مكالمات حقيقية.

3
اكتب الموجّه

السلوك والسياسات والأدوات، بلغة واضحة.

ثلاثة قرارات فقط، وينتهي الإعداد. التنسيق والبدائل الاحتياطية والضبط كلها مدمجة.

نختار أفضل النماذج لكل مهمة وننسّق عملها معًا. نماذج رائدة من OpenAI وAnthropic وGoogle تعمل جنبًا إلى جنب مع نماذج مفتوحة المصدر، ضمن منظومة مضبوطة لتقديم أفضل أداء وسعر في كل مكالمة، من دون أن تشغل بالك بالتفاصيل.

موجّه واحد،
لا مخطط من العُقد.

ظهرت أدوات بناء التدفقات لأن الأنظمة الأضعف لا تستطيع اتباع الموجّهات المعقدة. فتتحول كل خطوة في المحادثة إلى عقدة عليك إنشاؤها وصيانتها يدويًا. أما Storm، فينفّذ تعليمات مفصّلة تضعها في موجّه واحد، فلا داعي لأن تشغل بالك بالعُقد والحواف.

منصات بناء التدفقاتاربط كل فرع يدويًا
التحية موجّه · صوت
جمع رقم الهاتف موجّه · تحقق
تأكيد رقم الهاتف إعادة طرح الموجّه ×2
enroll() أداة · إعادة المحاولة
تصعيد المكالمة إلى موظف
مسار احتياطي شامل غير صالح ×2 · خطأ

ست عُقد لتدفق تسجيل واحد — لكل منها موجّهاتها وأدواتها وانتقالاتها وآلية معالجة الإخفاقات الخاصة بها.

ThunderPhone Stormصِف السلوك مرة واحدة
موجّه السلوك

رحّب بالمتصل واجمع اسمه ورقم هاتفه. تأكّد من موافقته قبل تسجيله، فهذا إلزامي. إذا سأل عن الفوترة، فاتبع سياسة الفوترة أدناه. لا تستدعِ enroll() إلا مرة واحدة، وبعد تأكيد جميع الحقول. إذا طلب المتصل التحدث إلى شخص، حوّل المكالمة إلى موظف.

تفرعات معقدةآليات مراقبة اختياريةتعديل أسهل

موجّه واحد تكتبه وتختبره وتحسّنه — ويشمل التفرعات أيضًا.

المكالمات الفعلية مليئة بالتعقيدات. ThunderPhone جاهز لها.

تمتمات، وأحاديث في الخلفية، وأسماء وأرقام، وتداخل بين اللغات — صُمّم ThunderPhone للتعامل مع المواقف التي تفشل فيها الأنظمة الأخرى.

الكلام غير الواضح

قارن الإشارات الصوتية بالنصية بدل الاعتماد على نص مفرغ واحد.

ضعف جودة صوت المكالمات

تنقّي نماذج اكتشاف الضوضاء والحد منها الإشارة الصوتية.

أحاديث الخلفية

ارصد الأحاديث الجانبية قبل أن تربك الوكيل الصوتي.

الأسماء والعناوين

تحقّق بأكثر من طريقة من أسماء الأعلام وطرق كتابتها والأرقام والتصحيحات.

الكلام متعدد اللغات

مرّر المكالمة عبر مسارات متعددة اللغات لمعالجة الصوت وإخراج الكلام عند الحاجة.

الموجّهات الطويلة

اعتمد مسارات استدلال أقوى عندما لا يمكن اختزال السلوك في قاعدة واحدة.

إجابة خاطئة أسرع لا تعني مكالمة أفضل.

يجب أن يردّ الذكاء الاصطناعي الصوتي بسرعة في المكالمات — لكن السرعة من دون دقة لا تعني سوى أخطاء سريعة. تحتاج النماذج اللغوية الكبيرة اليوم إلى لحظة للتفكير كي تحافظ على موثوقيتها، لذلك يوازن ThunderPhone بين زمن الاستجابة والدقة.

Spark~3sحتى أول استجابة
Bolt~2sحتى أول استجابة
Storm~2–3s~2 ثانية مع الإقرار · ~3 ثوانٍ من دونه
القياس

يدّعي مزوّدون آخرون تحقيق زمن استجابة قدره 500 مللي ثانية في الظروف المثالية، لكنه يبلغ عادةً نحو 2 ثانية في مكالمة فعلية. نقيس زمن استجابتنا في ظروف فعلية.

المرونة التشغيلية

يشهد مزوّدو الذكاء الاصطناعي ارتفاعات مفاجئة في زمن الاستجابة قد تعرقل المكالمات. تنتقل منظومة ThunderPhone المنسّقة تلقائيًا إلى خيارات أسرع حين يحدث ذلك.

الجيل القادم من الذكاء الاصطناعي الصوتي وصل.

لطالما كانت المكالمات الهاتفية الآلية مصدرًا للإحباط… حتى الآن. ومع كل موجة تقنية، تحسّنت التجربة، لكنها لم تصل قط إلى سلاسة حقيقية. ThunderPhone يغيّر ذلك.

1990sالجيل 1

الرد الصوتي التفاعلي

«اضغط 1 للمبيعات، واضغط 2 للدعم». لا تفعل القوائم أكثر من توجيه المكالمات.

2010sالجيل 2

روبوتات فهم النية

قل «المبيعات» أو «الفوترة»، على أمل أن يفهم محلّل الخانات ما تقصده.

2024الجيل 3

ذكاء اصطناعي بثلاث خطوات

حوّل الكلام إلى نص، ومرّره إلى نموذج لغوي كبير واحد سريع الاستجابة، ثم انطق الرد — وكل خطوة تفترض أن نتيجة سابقتها صحيحة.

2026 · الآنالجيل 4

ذكاء اصطناعي متكامل

الصوت والنص والاستدلال والأدوات والأصوات وضوابط الأمان، كلها في منظومة واحدة.

مصمم للمكالمات التي تفشل معها كل الحلول الأخرى

جرّب منظومتنا المتكاملة مع أصعب مكالماتك.

انطلق خلال 10 دقائق. ابتداءً من 2 سنت لكل دقيقة.