ThunderPhone 2.0 באוויר.בשירות עצמי, החל מ-2¢/דקה.קראו את הודעת ההשקה
כל הפוסטים

הרשמים הראשונים שלנו מ-API של GPT-Live-1 עבור סוכנים קוליים

12 בספטמבר 2026Alex Kolchinski

OpenAI השיקה לפני יומיים את GPT-Live-1, מודל הקול החדש שלה בדופלקס מלא, ב-API. אנחנו בונים ומפעילים סוכני טלפון מבוססי AI בייצור, אז חיברנו אותו למספר טלפון אמיתי והתקשרנו אליו. הרבה.

בדקנו אותו עם תסריט בן כ-13,000 אסימונים לסינון לידים חמים של אחד מלקוחות הביטוח שלנו, עם שורות שחובה לומר מילה במילה, כללי הקראה חוזרת מחמירים ושאלות המשך מסתעפות. במהלך יום ארוך אחד, ביצענו תריסר שיחות טלפון אמיתיות, כ-25 ראיונות מדומים ואצווה של בדיקות לא מובְנות.

אלה ההתרשמויות הראשונות שלנו, עם תמלילים ואודיו. סקירה מעמיקה יותר תגיע בקרוב.

התמלילים הם משיחות הבדיקה שלנו, כפי שתומללו על ידי GPT-Live. שינינו שמות וניסוחים מזהים, קיצרנו חילופי דברים ואיחדנו קטעים מפוצלים. חותמות הזמן, בשניות מתחילת השיחה, נלקחו מהמקור.

הטבעיות יוצאת דופן

GPT-Live-1 הוא איש השיחה שנשמע הכי טבעי שהעלינו על קו טלפון. זו התקדמות אמיתית.

הוא מקשיב ומדבר על גבי זרם אודיו רציף אחד, ללא שלבים נפרדים של תמלול וסינתוז. רוב מנגנוני השיחה פשוט עובדים. המתקשרים שמעו את האודיו הראשון שלו כ-1.3 שניות לאחר שהפסיקו לדבר בממוצע החציוני, או כ-0.7 שניות ללא מקטע הטלפון. לא הוספנו זיהוי פעילות קולית או לוגיקת ניהול תורות. הוא מטפל בהפרעות בחן, מפיק תגובות הקשבה טבעיות ("ממ-הם"), ומדבר בקצב זריז ואנושי.

כשנותנים לו מטרות במקום שורות להקראה, הוא מתאים את השאלות לשיחה ומקבל תיקונים בטבעיות:

Caller · 47.0Um, no, it's nine twenty, uh, seventy
Agent · 49.9Thanks for clarifying. So, September twentieth, nineteen seventy, right?
Caller · 56.5Yeah
Agent · 56.7Thanks. Pulling that up. Are you still renting your home?
Caller · 64.5Uh, not anymore now. I uh own my home now
Agent · 67.4Thanks, so you own your home. Is that a house, a condo, or a mobile home?

הוא מעולם לא איבד את קור הרוח מול תיקונים, הפרעות או מתקשרים ששינו את תשובותיהם באמצע השיחה. אם טבעיות הייתה כל המשימה, הפוסט הזה היה מסתיים כאן. למרבה הצער, יש בזה יותר מזה.

הוא לא מציית להנחיות באופן עקבי

GPT-Live-1 לא מציית להנחיות באופן עקבי בהתנהגויות החשובות לשיחת טלפון מתוסרטת.

יותר מפעם אחת, הוא הגיב ל"כן" ברור כאילו התשובה הייתה "לא", ושאל שוב את השאלה או המשיך הלאה כאילו המתקשר סירב.

הכשל העקבי ביותר היה נטייה לקחת הנחיות באופן מילולי מדי. הפרומפט שלנו אמר: אם המתקשר אומר שסטטוס המגורים הרשום שגוי, שאלו אם הוא בעלים, שוכר או גר עם הוריו. מתקשר אמר "לא, אני בעלים עכשיו", מה שכבר עונה על השאלה. המודל בכל זאת הקריא את התפריט:

Agent · 70.0...you listed as renting your home. Is that still correct?
Caller · 75.1Um, no, I own it now
Agent · 76.6Now, do you own your home, rent your home, live with your parents, or have some other housing situation?

חלק מהמוזרויות המוקדמות היו באשמת הפרומפט שלנו, אבל המילוליות נשארה בכל וריאציית פרומפט שניסינו. כל תשובה שלא פירטנו במפורש טופלה באופן מכני במקום בהיגיון.

לפעמים הוא גם חושב בקול תחת לחץ:

Agent · 96.3Thanks. One moment.
Agent · 98.0Hmm. Handling this one carefully.
Agent · 101.4I'll acknowledge it and move on.
Agent · 107.1Thanks. And just to confirm, you're married, right?

מספרים ורצפים אלפאנומריים הם מסוכנים

איותים, כתובות, תאריכי לידה ומספרי מזהה חייבים להיות מדויקים. כאן הדיבור של GPT-Live-1 נתקל בהכי הרבה בעיות.

שמענו אותו משמיט ומחליף תווים ברצפים אלפאנומריים. כאן הוא מקריא מספר תביעה מומצא; הקטעים לא עברו שינוי מלבד קיצוץ של שקט. באנגלית, התמלול שלו היה נכון אבל באודיו נוספה האות "Y":

Told to say8KD2 - QX7B - M4V9
Actually said8KD2 - QXY7B - M4V9
extra "Y"
GPT-Live-1 · אנגליתהקראה חוזרת של מספר תביעה, פלט ללא שינוי
0:00 / 0:08

ברוסית זה היה גרוע יותר: ה-"Q" הפכה ל-"X" גם באודיו וגם בתמלול שלו.

Told to say8KD2 - QX7B - M4V9
Actually saidвосемь кэй дэ два, тире, икс икс семь бэ, тире, эм четыре вэ девять
Which is8KD2 - XX7B - M4V9
"Q" became "X"
GPT-Live-1 · רוסיתאותו קוד, מוקרא ברוסית
0:00 / 0:08

תאריכים גרמו לאותה בעיה. מתקשר מסר תאריך לידה כספרות, שהמודל הקריא לאחר מכן כמספר:

Caller · 159.7Uh five five ninety five
Caller · 192.8Wait, what did you get uh, Roberto's birthday as
Agent · 197.2So that's fifty-five ninety-five?
Caller · 203.6Oh what are you talking about
Caller · 210.2I don't know what you mean by fifty five ninety five, that's not a birthday

הוא גם אומר מדי פעם שורה ששייכת למתקשר:

Agent · 74.7Do you currently have car insurance?
Agent · 78.5Do you currently I do.
Caller · 79.4I do

מבטאים בשפות אחרות

אנחנו בודקים מודלי קול חדשים בכל 47 השפות שהמוצר שלנו תומך בהן. הרוסית של GPT-Live-1 הייתה שוטפת, אך עם מבטא אמריקאי כבד (בעוד שקולות ה-TTS שאנחנו מפעילים בייצור נשמעים בדרך כלל כשפת אם):

Здравствуйте! Меня зовут Катя, я виртуальный агент вашей автостраховой. Лицензированный специалист скоро подключится, а пока, не против ли вы, если я задам пару вопросов, чтобы ускорить оформление полиса?
GPT-Live-1 · ברכה ברוסיתקטיה פותחת את השיחה
0:00 / 0:13

ניסינו גם לוגנדה. בשיחה הראשונה, הוא ענה במקום זאת בסווהילית. בשנייה, הוא דיבר לוגנדה, באופן טבעי יותר מכפי שציפינו ממודל כללי, אבל שוב עם מבטא אמריקאי כבד. לא בדקנו כל שפה, אבל אנחנו מצפים שדפוס המבטא כנראה חוזר על עצמו. זה לא משנה לסוכן שפועל באנגלית בלבד, אבל זו הסתייגות משמעותית למדי עבור מקרי שימוש בשפות אחרות.

כמה מגבלות API שכדאי להכיר

לפי מה שמצאנו השבוע, כמה מגבלות API חשובות עבור סוכן אמיתי:

  • ההנחיות אינן ניתנות לשינוי לאחר תחילת הסשן, והן מוגבלות ל-16,384 טוקנים.
  • הזרמת האודיו בפלט לעולם אינה נפסקת — גם שקט מוזרם — ולכן אי אפשר להשתמש ב-"האודיו נפסק" כאות לסיום תור במקרי שימוש שצריכים לפלח תורים.
  • הוא זמין רק דרך נקודת הקצה החדשה v1/live/sessions, ועדיין לא היה זמין ב-Azure כשבדקנו.

ההתרשמות שלנו עד כה

סוכני טלפון בייצור חייבים להישמע טבעיים ולפעול בעקביות לפי תסריטים. GPT-Live-1 מצטיין באופן מדהים בראשון, אבל יש לו כמה בעיות רציניות בשני. נריץ בדיקות נוספות עם הזמן ונמשיך לדווח על הממצאים שלנו.