التقنية

تجاوز مسار المعالجة ذي الخطوات الثلاث.

تعتمد معظم منصات الذكاء الاصطناعي الصوتي على مسار معالجة من 3 خطوات: نموذج واحد لتفريغ الصوت، ونموذج لغوي كبير واحد لا يفكر، ومحرك واحد لتحويل النص إلى كلام. كل خطوة تمثل نقطة فشل واحدة. يقلل ThunderPhone الأخطاء عبر تنسيق نماذج كثيرة في الوقت نفسه.

قال المتصل «أنا مُستأجِر».
ASR A“أنا مُستأجِر”
ASR B“أنا مُستشار”
نموذج لغة كبير للصوت“أنا مُستأجِر”
تمت المطابقة مع «أنا مُستشار» يتفق مساران من أصل 3
البنية المتكاملة

استمع إليه بطرق متعددة، ثم وفّق بينها.

ينسّق ThunderPhone بين نماذج متعددة في الوقت نفسه، ما يتيح لها تصحيح أخطاء بعضها بعضًا.

منصات أخرى · مسار من 3 خطوات

كل خطوة تثق بالسابقة.

صوت المتصل
«أنا مُستأجِر». · تمتمة
STT A
“أنا مُستشار”
STT B
نموذج لغة كبير للصوت
لا توجد آلية احتياطية عندما يسيء النموذج الوحيد الفهم
LLM
نموذج سريع لا يرى سوى النص المفرغ.
→ يردّ: «مرحبًا يا مستشار — كيف يمكنني مساعدتك؟»
ترتكب نماذج اللغة الكبيرة السريعة أخطاءً في اتباع التعليمات
TTS
تُعاد الإجابة بصوت مسموع.
→ ينطق: «مرحبًا يا مستشار — كيف يمكنني مساعدتك؟» ✗
نص مفرغ واحد + نموذج لغة كبير واحد = إجابة خاطئة
ThunderPhone · مُنسّق

مسارات متعددة، وإجابة واحدة منسّقة.

صوت المتصل
«أنا مُستأجِر». · تمتمة
STT A
“أنا مُستأجِر”
STT B
“أنا مُستشار”
نموذج لغة كبير للصوت
“أنا مُستأجِر”
ثلاثة نصوص مفرغة + صوت خام محفوظة كأدلة
طبقة الاستدلال
تقيّم نماذج اللغة الكبيرة السريعة والمفكّرة أدلة النص والصوت.
→ يتفق مساران من أصل 3: «أنا مُستأجِر»
تتحقق نماذج اللغة الكبيرة المفكّرة والسريعة من بعضها قبل الإجابة
TTS
تقلل الأصوات المنتقاة الهلوسة في التهجئة والمحارف الأبجدية الرقمية.
→ «فهمت — إذًا أنت مُستأجِر.» ✓
يُدقّق التفاصيل الصعبة من المرة الأولى.
دليل الأداء

يسجل Storm أرقامًا قياسية في الذكاء على Big Bench Audio.

يختبر BBA ما إذا كان النموذج يستطيع فهم الموجّهات المنطوقة والإجابة عن الأسئلة الصعبة بشكل صحيح. يصل أقوى إعداد لدينا من Storm إلى 99.4% في مجموعة التقييم العامة الخاصة بنا — أخطاء بنسبة 0.6%، أي أقل بـ4× من ثاني أفضل نتيجة عامة.

النموذج
معدل الأخطاء↓ الأقل أفضل
النتيجة
ThunderPhone Storm · Extra Intelligenceأخطاء أقل بـ4×
0.6%
Step-Audio R1.1
2.4%
Grok Voice Think Fast
2.9%
Ultravox v0.7 Thinking
3.0%
GPT-Realtime-2 High
3.4%
Gemini 3.1 Flash Live High
3.4%
اعرض مجموعة بيانات تقييم BBA-Storm على Hugging Face

معدل الأخطاء هو 100% ناقص معدل نجاح BBA. تأتي نتيجة ThunderPhone من مجموعة بيانات التقييم العامة الخاصة بنا، المرتبطة أعلاه؛ أما الدرجات العامة الأخرى (لوحة صدارة Artificial Analysis) فهي مدرجة للاستئناس. لا يلتقط BBA أداء المكالمات الهاتفية بالكامل، لكنه مؤشر مفيد على الاستدلال عبر الموجّهات المنطوقة.

النهج الحاسم أفضل من قابلية التهيئة

لا ينبغي أن تضطر إلى تجميع منظومة صوتية يدويًا.

تجبرك منصات الذكاء الاصطناعي الصوتي الأخرى مثل Vapi وRetell وPipecat وLiveKit على اتخاذ قرارات تهيئة كثيرة حتى تعمل مكالماتك. في ThunderPhone، نؤمن بأن الضبط هو مهمتنا، وأنه ينبغي أن تبذل أقل قدر ممكن من العمل لتعمل مكالماتك بسلاسة.

منصات الذكاء الاصطناعي الصوتي الأخرى · إعدادات كثيرة للضبط
تحويل الكلام إلى نص LLM TTS تحديد نهاية الكلام إزالة الضوضاء المقاطعات البدائل الاحتياطية مخطط الأدوات زمن الاستجابة اكتشاف نشاط الصوت
يضبط ThunderPhone كل هذا من أجلك
ThunderPhone · ثلاثة قرارات
1
اختر مستوى
Spark أو Bolt أو Storm.
2
اختر صوتًا
منتقاة ومختبرة على مكالمات حقيقية.
3
اكتب موجّهك
السلوك والسياسات والأدوات — بلغة بسيطة.
ثلاثة قرارات. هذا هو الإعداد — التنسيق والبدائل الاحتياطية والضبط مدمجة وجاهزة.
نختار أفضل النماذج للمهمة ونربطها معًا. نماذج رائدة من OpenAI وAnthropic وGoogle تعمل إلى جانب نماذج مفتوحة المصدر — تُنسَّق لتحقيق أفضل أداء وسعر في كل مكالمة، كي لا تقلق بشأن ذلك.
موجّه واحد، وفوضى أقل في الرسم البياني

موجّه واحد، وليس رسمًا بيانيًا من العُقد.

توجد أدوات بناء التدفقات لأن الأنظمة الأضعف لا تستطيع اتباع الموجّهات المعقدة. تتحول كل خطوة في المحادثة إلى عُقدة يجب عليك بناؤها وصيانتها يدويًا. يتبع Storm تعليمات غنية من موجّه واحد، لذلك لا داعي للقلق بشأن العُقد والوصلات.

منصات بناء التدفقات

صِل كل تفرع يدويًا.

ترحيبموجّه · صوت
اجمع رقم الهاتفموجّه · تحقق
أكّد رقم الهاتفإعادة التوجيه ×2
enroll()أداة · محاولات إعادة
صعّدإلى موظف بشري
بديل احتياطيشامل
غير صالح ×2خطأ
ست عُقد لتدفق تسجيل واحد — لكل منها موجّهاتها وأدواتها وانتقالاتها ومعالجة إخفاقاتها الخاصة.
ThunderPhone Storm

صِف السلوك مرة واحدة.

موجّه السلوك
رحّب بالمتصل واجمع اسمه ورقم هاتفه.
أكّد الموافقة قبل التسجيل — هذا مطلوب.
إذا سأل المتصل عن الفوترة، فاتبع سياسة الفوترة أدناه.
استدعِ enroll() فقط بعد تأكيد كل حقل.
إذا طلب المتصل شخصًا، حوّله إلى موظف بشري.
تفرعات معقدة مراقبات اختيارية تكرار أسهل
موجّه واحد للكتابة والاختبار والتكرار — مع التفرعات.
لماذا يهم ذلك

مكالمات الإنتاج مليئة بالتعقيدات. ThunderPhone جاهز.

كلام غير واضح، وضوضاء في الخلفية، أسماء وأرقام، ولغات مختلطة — صُمم ThunderPhone للحالات التي تُعطّل الأنظمة الأخرى.

كلام غير واضح

قارن بين إشارات الصوت والنص بدلاً من الوثوق بنص مفرغ واحد.

صوت هاتف رديء

تنظف نماذج تحديد الضوضاء وتقليلها الإشارة.

أحاديث في الخلفية

تعرّف على الأحاديث الجانبية قبل أن تعرقل الوكيل.

الأسماء والعناوين

تحقق من الأسماء العلم والتهجئات والأرقام والتصحيحات.

كلام متعدد اللغات

وجّه المكالمة عبر مسارات صوتية ومتعددة اللغات عند الحاجة.

موجّهات طويلة

استخدم مسارات استدلال أقوى عندما لا يمكن اختزال السلوك في قاعدة واحدة.

زمن الاستجابة والجودة والتكلفة

الإجابة الخاطئة الأسرع لا تجعل المكالمة أفضل.

يجب أن يجيب الذكاء الاصطناعي الهاتفي بسرعة، لكن السرعة من دون دقة لا تؤدي إلا إلى أخطاء سريعة. تحتاج النماذج اللغوية الكبيرة اليوم إلى لحظة للتفكير كي تظل موثوقة، لذلك يوازن ThunderPhone بين الأمرين لكل مستوى.

Spark
~3s
حتى أول استجابة
Bolt
~2s
حتى أول استجابة
Storm
~2–3s
~2 ث مع الإقرارات · ~3 ث بدونها
القياسيدّعي مزودون آخرون زمن استجابة قدره 500 مللي ثانية في ظروف مثالية، لكنهم يصلون عادةً إلى نحو 2 ث في مكالمة حقيقية.نقيس زمن استجابتنا في ظروف حقيقية.
المرونةيشهد مزودو الذكاء الاصطناعي ارتفاعات مفاجئة في زمن الاستجابة قد تعرقل المكالمات.تتحول منظومة ThunderPhone المنسقة تلقائياً إلى خيارات أسرع عند حدوث ذلك.
أجيال الذكاء الاصطناعي الصوتي

الجيل التالي من الذكاء الاصطناعي الصوتي هنا

كانت المكالمات الهاتفية المؤتمتة تجارب محبطة... حتى الآن. حسّنت كل موجة من التقنية التجربة، لكن لم تصل بها يومًا إلى مستوى السلاسة الحقيقية. يتغير ذلك مع ThunderPhone.

1990s2010s20242026 · الآن
الجيل 1

الاستجابة الصوتية التفاعلية

اضغط واحدًا للمبيعات، واضغط اثنين للدعم. لا تستطيع القوائم إلا التوجيه.

الجيل 2

روبوتات النوايا

قل «المبيعات» أو «الفوترة» وتأمل أن يلتقط محلّل الخانات ذلك.

الجيل 3

ذكاء اصطناعي بثلاث خطوات

فرّغ الصوت إلى نص، واسأل نموذجًا لغويًا كبيرًا سريعًا واحدًا، ثم تكلّم — كل خطوة تثق بالسابقة.

الجيل 4

ذكاء اصطناعي متكامل

الصوت، والنص، والاستدلال، والأدوات، والأصوات، وضوابط الحماية في منظومة واحدة.

مصممة للمكالمات التي تعجز عنها كل الحلول الأخرى

شاهد المنظومة المتكاملة
في أصعب مكالماتك.

جاهزة للعمل خلال عشر دقائق. ابتداءً من 2¢/دقيقة.