דורות של בינה מלאכותית קולית

רוב שיחות הטלפון האוטומטיות גרועות. טכנולוגיה חדשה משנה זאת.

הבעיה הישנה לא הייתה שלאוטומציית שיחות חסר קול נעים. היא לא הבינה מספיק כדי לנהל שיחה אמיתית.

עצי ניתוב שיחות

עידן ה-IVR

המתקשר נאלץ לדבר בשפת המכונה.

אוטומציה פירושה תפריטים, ענפים במקשי הטלפון ותורים. היא עבדה כשהמתקשר כבר ידע את הנתיב הנכון.

רגע מגושם

הכוונה מצטמצמת ללחיצה על כפתור, כך שכל דבר שמחוץ לתפריט הופך להעברה או לחזרה על הדברים.

שיחה לדוגמה

עידן ה-IVR

מתקשר

"אני צריך לדחות את הפגישה של מחר."

מערכת

"לחיוב, לחצו 1. לקביעת פגישות, לחצו 2. לכל שאלה אחרת, לחצו 9."

תוצאה

המתקשר מנחש, ממתין ומסביר שוב את אותו הדבר.

כך המערכת חושבת

3 שלבים

הנחיית תפריט

תוקן

תסריט קבוע מציג אפשרויות.

ענף DTMF

שביר

כפתור אחד הופך לכוונה כולה.

תור

נכשל

ההקשר האמיתי מגיע עם נציג אנושי.

מודלים מותאמים

בינה מלאכותית מוקדמת

המערכות הבינו מסלולים צרים, ואז קרסו.

צוותים אימנו מודלים אקוסטיים, מסווגי כוונות ומחלצי שדות עבור תהליכי שיחה ספציפיים. שימושי, אך יקר לשינוי.

רגע מגושם

המערכת יכולה לזהות כוונה אחת שאומנה, ואז להחמיץ את הבקשה השנייה או לשאול שאלת המשך נוקשה.

שיחה לדוגמה

בינה מלאכותית מוקדמת

מתקשר

"אפשר לדחות את הפגישה של מחר ולהוסיף את בן או בת הזוג שלי?"

מערכת

"אני יכול לעזור בקביעת מועד חדש. איזה תאריך תרצו?"

תוצאה

פרט בן או בת הזוג אובד כי הוא אינו נמצא בתהליך שאומן.

כך המערכת חושבת

3 שלבים

ASR מותאם

תוקן

מותאם לתחום ולשילוב של מבטאים.

מודל כוונות

שביר

מסווג את הבקשה המוכרת הקרובה ביותר.

מילוי שדות

נכשל

שדות חסרים מפעילים תיקון מתוסרט.

מערכים בסגנון Vapi / Retell / ElevenLabs

צינורות עבודה ב-3 שלבים

המערך נעשה גמיש, אך כל שלב סמך על קודמו.

דפוס מודרני נפוץ מחבר דיבור לטקסט, LLM וטקסט לדיבור ללולאת שיחה אחת.

רגע מגושם

כשהתמלול שגוי או שהמתקשר קוטע, ה-LLM נותן בביטחון מענה שגוי.

שיחה לדוגמה

צינורות עבודה ב-3 שלבים

מתקשר

"לא, אני שוכר את המקום."

מערכת

"הבנתי, מדובר בנכס חווה. נכון?"

תוצאה

טעות שמיעה אחת הופכת לטעות בדיבור.

כך המערכת חושבת

3 שלבים

דיבור לטקסט

נכשל

תמלול יחיד הופך למקור האמת.

LLM

שביר

יוצר מטקסט, ולא מהאודיו המקורי.

טקסט לדיבור

נכשל

משמיע את התשובה בביטחון.

בינה מלאכותית קולית משולבת

ThunderPhone

המערכת יכולה לשמוע, להסיק ולהתאושש בלולאה אחת.

ThunderPhone מתאמת הבנת אודיו, ניתוב מודלים, ניהול תורות ויצירת תגובות בארכיטקטורה אחת.

מה משתנה

מסלולי האזנה מרובים והסקה מודעת-אודיו מפחיתים כשלים חד-שלביים לפני שהם מגיעים למתקשר.

שיחה לדוגמה

ThunderPhone

מתקשר

"לא, אני שוכר את המקום."

מערכת

"הבנתי. אתם שוכרים את הבית שלכם, לכן אדלג על שאלות לגבי בעלות."

תוצאה

השיחה מתקדמת בלי שהמתקשר יצטרך להיאבק במערכת.

כך המערכת חושבת

4 שלבים

זרם אודיו

תקין

האודיו הגולמי נשאר זמין להסקה.

האזנה מקבילה

תקין

האותות מושווים לפני ביצוע פעולה.

ניתוב מודלים

תקין

מסלולים מהירים ומעמיקים משתפים פעולה בכל תור.

תגובה טבעית

תקין

המתקשר שומע את ההקשר המתוקן.

לאן זה מוביל

פריצת הדרך אינה קול רובוטי יפה יותר. זו ארכיטקטורה ששומרת על השיחה במסלול.

שמיעה טובה יותר

המערכת יכולה להשוות בין אותות ולהסיק מסקנות מהשמע, במקום לסמוך על תמלול יחיד.

תזמון טוב יותר

חלוקת תורות וטיפול בהפרעות הם חלק מלולאת השיחה.

ניתוב טוב יותר

ניתן לבחור מסלולים מהירים והסקה מעמיקה יותר בהתאם לצרכים של כל תור בשיחה.

חוויה טובה יותר

מתקשרים מקדישים פחות זמן לתיקון האוטומציה ויותר זמן להשלמת המשימה.