Το ThunderPhone 2.0 είναι εδώ.Ξεκινήστε μόνοι σας, από 2¢/λεπτό.Διαβάστε την ανακοίνωση
Όλα τα άρθρα

Οι πρώτες εντυπώσεις μας από το API GPT-Live-1 για φωνητικούς πράκτορες

12 Σεπτεμβρίου 2026Alex Kolchinski

Η OpenAI διέθεσε μέσω API το GPT-Live-1, το νέο αμφίδρομο φωνητικό μοντέλο της, πριν από δύο ημέρες. Δημιουργούμε και λειτουργούμε AI τηλεφωνικούς πράκτορες σε περιβάλλον παραγωγής, οπότε το συνδέσαμε με έναν πραγματικό τηλεφωνικό αριθμό και το καλέσαμε. Πολύ.

Το δοκιμάσαμε με ένα σενάριο προεπιλογής υποψήφιων πελατών περίπου 13.000 token από έναν πελάτη μας στον ασφαλιστικό κλάδο, με υποχρεωτικές ακριβείς διατυπώσεις, αυστηρούς κανόνες επανάληψης για επιβεβαίωση και διακλαδωτές ερωτήσεις συνέχειας. Σε μία μεγάλη ημέρα, πραγματοποιήσαμε δώδεκα πραγματικές τηλεφωνικές κλήσεις, περίπου 25 προσομοιωμένες συνεντεύξεις και μια σειρά μη δομημένων δοκιμών.

Αυτές είναι οι πρώτες εντυπώσεις μας, με απομαγνητοφωνήσεις και ήχο. Μια αναλυτικότερη παρουσίαση θα ακολουθήσει σύντομα.

Οι απομαγνητοφωνήσεις προέρχονται από τις δοκιμαστικές κλήσεις μας, όπως απομαγνητοφωνήθηκαν από το GPT-Live. Έχουμε αλλάξει ονόματα και αναγνωριστικές διατυπώσεις, έχουμε περικόψει συνομιλίες και έχουμε ενώσει τμήματα που είχαν διαχωριστεί. Οι χρονικές σημάνσεις, σε δευτερόλεπτα από την έναρξη της κλήσης, προέρχονται από τα πρωτότυπα.

Η φυσικότητα είναι εξαιρετική

Το GPT-Live-1 είναι ο πιο φυσικός συνομιλητής που έχουμε βάλει ποτέ σε τηλεφωνική γραμμή. Πρόκειται για ένα πραγματικό βήμα προόδου.

Ακούει και μιλά σε μία συνεχή ροή ήχου, χωρίς ξεχωριστά στάδια απομαγνητοφώνησης και σύνθεσης. Οι περισσότεροι μηχανισμοί της συνομιλίας απλώς λειτουργούν. Οι καλούντες άκουγαν τον πρώτο του ήχο περίπου 1,3 δευτερόλεπτα αφού σταματούσαν να μιλούν (διάμεσος χρόνος), ή περίπου 0,7 δευτερόλεπτα χωρίς το τηλεφωνικό σκέλος. Δεν προσθέσαμε ανίχνευση φωνητικής δραστηριότητας ή λογική εναλλαγής σειράς ομιλίας. Διαχειρίζεται τις διακοπές με άνεση, παράγει φυσικές σύντομες επιβεβαιώσεις («Μμμ-χμ») και μιλά με γρήγορο, ανθρώπινο ρυθμό.

Όταν του δίνονται στόχοι αντί για ατάκες προς ανάγνωση, προσαρμόζει τις ερωτήσεις στη συνομιλία και δέχεται διορθώσεις χωρίς να χάνει τον ειρμό:

Caller · 47.0Um, no, it's nine twenty, uh, seventy
Agent · 49.9Thanks for clarifying. So, September twentieth, nineteen seventy, right?
Caller · 56.5Yeah
Agent · 56.7Thanks. Pulling that up. Are you still renting your home?
Caller · 64.5Uh, not anymore now. I uh own my home now
Agent · 67.4Thanks, so you own your home. Is that a house, a condo, or a mobile home?

Δεν έχασε ποτέ την ψυχραιμία του με διορθώσεις, διακοπές ή καλούντες που άλλαζαν τις απαντήσεις τους στη μέση της κλήσης. Αν η φυσικότητα ήταν όλη η δουλειά, αυτή η ανάρτηση θα τελείωνε εδώ. Δυστυχώς, δεν είναι τόσο απλό.

Δεν ακολουθεί αξιόπιστα τις οδηγίες

Το GPT-Live-1 δεν ακολουθεί αξιόπιστα οδηγίες στις συμπεριφορές που έχουν σημασία για μια τηλεφωνική κλήση με σενάριο.

Περισσότερες από μία φορές, απάντησε σε ένα ξεκάθαρο «ναι» σαν η απάντηση να ήταν «όχι», επαναλαμβάνοντας την ερώτηση ή προχωρώντας σαν ο καλών να είχε αρνηθεί.

Η πιο σταθερή αποτυχία ήταν ότι ερμήνευε τις οδηγίες υπερβολικά κυριολεκτικά. Το prompt μας έλεγε: αν ο καλών πει ότι η καταχωρισμένη κατάσταση στέγασης είναι λανθασμένη, ρωτήστε αν έχει ιδιόκτητη κατοικία, νοικιάζει ή μένει με τους γονείς του. Ένας καλών είπε «όχι, τώρα μου ανήκει», κάτι που ήδη απαντά στην ερώτηση. Το μοντέλο απήγγειλε το μενού ούτως ή άλλως:

Agent · 70.0...you listed as renting your home. Is that still correct?
Caller · 75.1Um, no, I own it now
Agent · 76.6Now, do you own your home, rent your home, live with your parents, or have some other housing situation?

Κάποιες πρώιμες παραξενιές οφείλονταν στο prompt μας, όμως η κυριολεξία παρέμεινε σε κάθε παραλλαγή prompt που δοκιμάσαμε. Κάθε απάντηση που δεν είχαμε διατυπώσει ρητά αντιμετωπιζόταν μηχανικά αντί με κοινή λογική.

Μερικές φορές επίσης σκέφτεται δυνατά υπό πίεση:

Agent · 96.3Thanks. One moment.
Agent · 98.0Hmm. Handling this one carefully.
Agent · 101.4I'll acknowledge it and move on.
Agent · 107.1Thanks. And just to confirm, you're married, right?

Οι αριθμοί και οι αλφαριθμητικοί χαρακτήρες ενέχουν κινδύνους

Οι ορθογραφίες, οι διευθύνσεις, οι ημερομηνίες γέννησης και οι αριθμοί ταυτότητας πρέπει να είναι ακριβείς. Σε αυτό το σημείο η ομιλία του GPT-Live-1 παρουσιάζει τα περισσότερα προβλήματα.

Ακούσαμε να παραλείπει και να αντικαθιστά χαρακτήρες σε αλφαριθμητικές συμβολοσειρές. Εδώ διαβάζει έναν επινοημένο αριθμό αίτησης· τα αποσπάσματα δεν έχουν υποστεί καμία επεξεργασία, πέρα από την αφαίρεση της σιωπής. Στα αγγλικά, η απομαγνητοφώνησή του ήταν σωστή, αλλά στον ήχο προστέθηκε ένα «Y»:

Told to say8KD2 - QX7B - M4V9
Actually said8KD2 - QXY7B - M4V9
extra "Y"
GPT-Live-1 · EnglishΕπανάληψη αριθμού αίτησης, μη επεξεργασμένη έξοδος
0:00 / 0:08

Στα ρωσικά ήταν χειρότερο: το «Q» έγινε «X» τόσο στον ήχο όσο και στην απομαγνητοφώνησή του.

Told to say8KD2 - QX7B - M4V9
Actually saidвосемь кэй дэ два, тире, икс икс семь бэ, тире, эм четыре вэ девять
Which is8KD2 - XX7B - M4V9
"Q" became "X"
GPT-Live-1 · RussianΟ ίδιος κωδικός, διαβασμένος στα ρωσικά
0:00 / 0:08

Οι ημερομηνίες προκάλεσαν το ίδιο πρόβλημα. Ένας καλών έδωσε μια ημερομηνία γέννησης ως ψηφία, την οποία το μοντέλο αργότερα διάβασε ως αριθμό:

Caller · 159.7Uh five five ninety five
Caller · 192.8Wait, what did you get uh, Roberto's birthday as
Agent · 197.2So that's fifty-five ninety-five?
Caller · 203.6Oh what are you talking about
Caller · 210.2I don't know what you mean by fifty five ninety five, that's not a birthday

Επίσης, περιστασιακά εκφωνεί μια ατάκα που ανήκει στον καλούντα:

Agent · 74.7Do you currently have car insurance?
Agent · 78.5Do you currently I do.
Caller · 79.4I do

Προφορές σε άλλες γλώσσες

Δοκιμάζουμε νέα μοντέλα φωνής στις 47 γλώσσες που υποστηρίζει το προϊόν μας. Τα ρωσικά του GPT-Live-1 ήταν άνετα, αλλά είχαν έντονη αμερικανική προφορά, ενώ οι φωνές TTS που χρησιμοποιούμε στην παραγωγή συνήθως ακούγονται σαν μητρικές:

Здравствуйте! Меня зовут Катя, я виртуальный агент вашей автостраховой. Лицензированный специалист скоро подключится, а пока, не против ли вы, если я задам пару вопросов, чтобы ускорить оформление полиса?
GPT-Live-1 · Russian greetingΗ Katya ξεκινά την κλήση
0:00 / 0:13

Δοκιμάσαμε επίσης τα Λουγκάντα. Στην πρώτη κλήση, απάντησε στα Σουαχίλι. Στη δεύτερη, μίλησε Λουγκάντα, πιο φυσικά απ’ όσο περιμέναμε από ένα γενικό μοντέλο, αλλά και πάλι με έντονη αμερικανική προφορά. Δεν έχουμε δοκιμάσει κάθε γλώσσα, αλλά αναμένουμε ότι το μοτίβο της προφοράς πιθανότατα γενικεύεται. Αυτό δεν έχει σημασία για έναν πράκτορα που λειτουργεί μόνο στα αγγλικά, αλλά αποτελεί αρκετά σημαντική επιφύλαξη για περιπτώσεις χρήσης σε άλλες γλώσσες.

Μερικοί περιορισμοί του API που αξίζει να γνωρίζετε

Με βάση όσα διαπιστώσαμε αυτή την εβδομάδα, μερικοί περιορισμοί του API έχουν σημασία για έναν πραγματικό πράκτορα:

  • Οι οδηγίες δεν αλλάζουν μετά την έναρξη της συνεδρίας και περιορίζονται σε 16.384 tokens.
  • Η ροή του εξερχόμενου ήχου δεν σταματά ποτέ — μεταδίδεται και η σιωπή — επομένως το «η ροή ήχου σταμάτησε» δεν μπορεί να χρησιμοποιηθεί ως σήμα λήξης σειράς για περιπτώσεις χρήσης που χρειάζονται τμηματοποίηση των σειρών.
  • Είναι προσβάσιμο μόνο μέσω του νέου endpoint v1/live/sessions και δεν ήταν ακόμη διαθέσιμο στο Azure όταν το ελέγξαμε.

Η μέχρι τώρα εντύπωσή μας

Οι τηλεφωνικοί πράκτορες παραγωγής πρέπει να ακούγονται φυσικοί και να ακολουθούν με συνέπεια τα σενάρια. Το GPT-Live-1 είναι εντυπωσιακό στο πρώτο, αλλά έχει ορισμένα σοβαρά προβλήματα στο δεύτερο. Θα πραγματοποιούμε περισσότερες δοκιμές με την πάροδο του χρόνου και θα συνεχίσουμε να αναφέρουμε τα ευρήματά μας.