הרשמים הראשונים שלנו מ-API של GPT-Live-1 עבור סוכנים קוליים
OpenAI השיקה לפני יומיים את GPT-Live-1, מודל הקול החדש שלה בדופלקס מלא, ב-API. אנחנו בונים ומפעילים סוכני טלפון מבוססי AI בייצור, אז חיברנו אותו למספר טלפון אמיתי והתקשרנו אליו. הרבה.
בדקנו אותו עם תסריט בן כ-13,000 אסימונים לסינון לידים חמים של אחד מלקוחות הביטוח שלנו, עם שורות שחובה לומר מילה במילה, כללי הקראה חוזרת מחמירים ושאלות המשך מסתעפות. במהלך יום ארוך אחד, ביצענו תריסר שיחות טלפון אמיתיות, כ-25 ראיונות מדומים ואצווה של בדיקות לא מובְנות.
אלה ההתרשמויות הראשונות שלנו, עם תמלילים ואודיו. סקירה מעמיקה יותר תגיע בקרוב.
התמלילים הם משיחות הבדיקה שלנו, כפי שתומללו על ידי GPT-Live. שינינו שמות וניסוחים מזהים, קיצרנו חילופי דברים ואיחדנו קטעים מפוצלים. חותמות הזמן, בשניות מתחילת השיחה, נלקחו מהמקור.
הטבעיות יוצאת דופן
GPT-Live-1 הוא איש השיחה שנשמע הכי טבעי שהעלינו על קו טלפון. זו התקדמות אמיתית.
הוא מקשיב ומדבר על גבי זרם אודיו רציף אחד, ללא שלבים נפרדים של תמלול וסינתוז. רוב מנגנוני השיחה פשוט עובדים. המתקשרים שמעו את האודיו הראשון שלו כ-1.3 שניות לאחר שהפסיקו לדבר בממוצע החציוני, או כ-0.7 שניות ללא מקטע הטלפון. לא הוספנו זיהוי פעילות קולית או לוגיקת ניהול תורות. הוא מטפל בהפרעות בחן, מפיק תגובות הקשבה טבעיות ("ממ-הם"), ומדבר בקצב זריז ואנושי.
כשנותנים לו מטרות במקום שורות להקראה, הוא מתאים את השאלות לשיחה ומקבל תיקונים בטבעיות:
הוא מעולם לא איבד את קור הרוח מול תיקונים, הפרעות או מתקשרים ששינו את תשובותיהם באמצע השיחה. אם טבעיות הייתה כל המשימה, הפוסט הזה היה מסתיים כאן. למרבה הצער, יש בזה יותר מזה.
הוא לא מציית להנחיות באופן עקבי
GPT-Live-1 לא מציית להנחיות באופן עקבי בהתנהגויות החשובות לשיחת טלפון מתוסרטת.
יותר מפעם אחת, הוא הגיב ל"כן" ברור כאילו התשובה הייתה "לא", ושאל שוב את השאלה או המשיך הלאה כאילו המתקשר סירב.
הכשל העקבי ביותר היה נטייה לקחת הנחיות באופן מילולי מדי. הפרומפט שלנו אמר: אם המתקשר אומר שסטטוס המגורים הרשום שגוי, שאלו אם הוא בעלים, שוכר או גר עם הוריו. מתקשר אמר "לא, אני בעלים עכשיו", מה שכבר עונה על השאלה. המודל בכל זאת הקריא את התפריט:
חלק מהמוזרויות המוקדמות היו באשמת הפרומפט שלנו, אבל המילוליות נשארה בכל וריאציית פרומפט שניסינו. כל תשובה שלא פירטנו במפורש טופלה באופן מכני במקום בהיגיון.
לפעמים הוא גם חושב בקול תחת לחץ:
מספרים ורצפים אלפאנומריים הם מסוכנים
איותים, כתובות, תאריכי לידה ומספרי מזהה חייבים להיות מדויקים. כאן הדיבור של GPT-Live-1 נתקל בהכי הרבה בעיות.
שמענו אותו משמיט ומחליף תווים ברצפים אלפאנומריים. כאן הוא מקריא מספר תביעה מומצא; הקטעים לא עברו שינוי מלבד קיצוץ של שקט. באנגלית, התמלול שלו היה נכון אבל באודיו נוספה האות "Y":
ברוסית זה היה גרוע יותר: ה-"Q" הפכה ל-"X" גם באודיו וגם בתמלול שלו.
תאריכים גרמו לאותה בעיה. מתקשר מסר תאריך לידה כספרות, שהמודל הקריא לאחר מכן כמספר:
הוא גם אומר מדי פעם שורה ששייכת למתקשר:
מבטאים בשפות אחרות
אנחנו בודקים מודלי קול חדשים בכל 47 השפות שהמוצר שלנו תומך בהן. הרוסית של GPT-Live-1 הייתה שוטפת, אך עם מבטא אמריקאי כבד (בעוד שקולות ה-TTS שאנחנו מפעילים בייצור נשמעים בדרך כלל כשפת אם):
ניסינו גם לוגנדה. בשיחה הראשונה, הוא ענה במקום זאת בסווהילית. בשנייה, הוא דיבר לוגנדה, באופן טבעי יותר מכפי שציפינו ממודל כללי, אבל שוב עם מבטא אמריקאי כבד. לא בדקנו כל שפה, אבל אנחנו מצפים שדפוס המבטא כנראה חוזר על עצמו. זה לא משנה לסוכן שפועל באנגלית בלבד, אבל זו הסתייגות משמעותית למדי עבור מקרי שימוש בשפות אחרות.
כמה מגבלות API שכדאי להכיר
לפי מה שמצאנו השבוע, כמה מגבלות API חשובות עבור סוכן אמיתי:
- ההנחיות אינן ניתנות לשינוי לאחר תחילת הסשן, והן מוגבלות ל-16,384 טוקנים.
- הזרמת האודיו בפלט לעולם אינה נפסקת — גם שקט מוזרם — ולכן אי אפשר להשתמש ב-"האודיו נפסק" כאות לסיום תור במקרי שימוש שצריכים לפלח תורים.
- הוא זמין רק דרך נקודת הקצה החדשה
v1/live/sessions, ועדיין לא היה זמין ב-Azure כשבדקנו.
ההתרשמות שלנו עד כה
סוכני טלפון בייצור חייבים להישמע טבעיים ולפעול בעקביות לפי תסריטים. GPT-Live-1 מצטיין באופן מדהים בראשון, אבל יש לו כמה בעיות רציניות בשני. נריץ בדיקות נוספות עם הזמן ונמשיך לדווח על הממצאים שלנו.