דורות של בינה מלאכותית קולית
רוב שיחות הטלפון האוטומטיות גרועות. טכנולוגיה חדשה משנה זאת.
הבעיה הישנה לא הייתה שלאוטומציית שיחות חסר קול נעים. היא לא הבינה מספיק כדי לנהל שיחה אמיתית.
קל יותר להפוך שיחת טלפון לאוטומטית
כל דור מעביר יותר הקשר אל המכונה.
עצי ניתוב שיחות
עידן ה-IVR
המתקשר נאלץ לדבר בשפת המכונה.
אוטומציה פירושה תפריטים, ענפים במקשי הטלפון ותורים. היא עבדה כשהמתקשר כבר ידע את הנתיב הנכון.
רגע מגושם
הכוונה מצטמצמת ללחיצה על כפתור, כך שכל דבר שמחוץ לתפריט הופך להעברה או לחזרה על הדברים.
שיחה לדוגמה
עידן ה-IVR
מתקשר
"אני צריך לדחות את הפגישה של מחר."
מערכת
"לחיוב, לחצו 1. לקביעת פגישות, לחצו 2. לכל שאלה אחרת, לחצו 9."
תוצאה
המתקשר מנחש, ממתין ומסביר שוב את אותו הדבר.
כך המערכת חושבת
3 שלביםהנחיית תפריט
תוקןתסריט קבוע מציג אפשרויות.
ענף DTMF
שבירכפתור אחד הופך לכוונה כולה.
תור
נכשלההקשר האמיתי מגיע עם נציג אנושי.
מודלים מותאמים
בינה מלאכותית מוקדמת
המערכות הבינו מסלולים צרים, ואז קרסו.
צוותים אימנו מודלים אקוסטיים, מסווגי כוונות ומחלצי שדות עבור תהליכי שיחה ספציפיים. שימושי, אך יקר לשינוי.
רגע מגושם
המערכת יכולה לזהות כוונה אחת שאומנה, ואז להחמיץ את הבקשה השנייה או לשאול שאלת המשך נוקשה.
שיחה לדוגמה
בינה מלאכותית מוקדמת
מתקשר
"אפשר לדחות את הפגישה של מחר ולהוסיף את בן או בת הזוג שלי?"
מערכת
"אני יכול לעזור בקביעת מועד חדש. איזה תאריך תרצו?"
תוצאה
פרט בן או בת הזוג אובד כי הוא אינו נמצא בתהליך שאומן.
כך המערכת חושבת
3 שלביםASR מותאם
תוקןמותאם לתחום ולשילוב של מבטאים.
מודל כוונות
שבירמסווג את הבקשה המוכרת הקרובה ביותר.
מילוי שדות
נכשלשדות חסרים מפעילים תיקון מתוסרט.
מערכים בסגנון Vapi / Retell / ElevenLabs
צינורות עבודה ב-3 שלבים
המערך נעשה גמיש, אך כל שלב סמך על קודמו.
דפוס מודרני נפוץ מחבר דיבור לטקסט, LLM וטקסט לדיבור ללולאת שיחה אחת.
רגע מגושם
כשהתמלול שגוי או שהמתקשר קוטע, ה-LLM נותן בביטחון מענה שגוי.
שיחה לדוגמה
צינורות עבודה ב-3 שלבים
מתקשר
"לא, אני שוכר את המקום."
מערכת
"הבנתי, מדובר בנכס חווה. נכון?"
תוצאה
טעות שמיעה אחת הופכת לטעות בדיבור.
כך המערכת חושבת
3 שלביםדיבור לטקסט
נכשלתמלול יחיד הופך למקור האמת.
LLM
שביריוצר מטקסט, ולא מהאודיו המקורי.
טקסט לדיבור
נכשלמשמיע את התשובה בביטחון.
בינה מלאכותית קולית משולבת
ThunderPhone
המערכת יכולה לשמוע, להסיק ולהתאושש בלולאה אחת.
ThunderPhone מתאמת הבנת אודיו, ניתוב מודלים, ניהול תורות ויצירת תגובות בארכיטקטורה אחת.
מה משתנה
מסלולי האזנה מרובים והסקה מודעת-אודיו מפחיתים כשלים חד-שלביים לפני שהם מגיעים למתקשר.
שיחה לדוגמה
ThunderPhone
מתקשר
"לא, אני שוכר את המקום."
מערכת
"הבנתי. אתם שוכרים את הבית שלכם, לכן אדלג על שאלות לגבי בעלות."
תוצאה
השיחה מתקדמת בלי שהמתקשר יצטרך להיאבק במערכת.
כך המערכת חושבת
4 שלביםזרם אודיו
תקיןהאודיו הגולמי נשאר זמין להסקה.
האזנה מקבילה
תקיןהאותות מושווים לפני ביצוע פעולה.
ניתוב מודלים
תקיןמסלולים מהירים ומעמיקים משתפים פעולה בכל תור.
תגובה טבעית
תקיןהמתקשר שומע את ההקשר המתוקן.
לאן זה מוביל
פריצת הדרך אינה קול רובוטי יפה יותר. זו ארכיטקטורה ששומרת על השיחה במסלול.
שמיעה טובה יותר
המערכת יכולה להשוות בין אותות ולהסיק מסקנות מהשמע, במקום לסמוך על תמלול יחיד.
תזמון טוב יותר
חלוקת תורות וטיפול בהפרעות הם חלק מלולאת השיחה.
ניתוב טוב יותר
ניתן לבחור מסלולים מהירים והסקה מעמיקה יותר בהתאם לצרכים של כל תור בשיחה.
חוויה טובה יותר
מתקשרים מקדישים פחות זמן לתיקון האוטומציה ויותר זמן להשלמת המשימה.