ThunderPhone 2.0 è arrivato.Parti in autonomia, da 2¢/min.Leggi l’annuncio
Tutti gli articoli

Le nostre prime impressioni sull'API GPT-Live-1 per agenti vocali

12 settembre 2026Alex Kolchinski

OpenAI ha reso disponibile tramite API GPT-Live-1, il suo nuovo modello vocale full-duplex, due giorni fa. Noi sviluppiamo e gestiamo agenti telefonici IA in produzione, quindi lo abbiamo collegato a un numero di telefono reale e lo abbiamo chiamato. Molte volte.

Lo abbiamo testato con un copione di qualificazione di contatti caldi da circa 13.000 token di uno dei nostri clienti assicurativi, con battute obbligatorie da pronunciare parola per parola, rigide regole di rilettura e follow-up condizionali. In una lunga giornata, abbiamo effettuato una dozzina di chiamate reali, circa 25 colloqui simulati e una serie di test non strutturati.

Queste sono le nostre prime impressioni, con trascrizioni e audio. Un'analisi più approfondita arriverà a breve.

Le trascrizioni provengono dalle nostre chiamate di test, trascritte da GPT-Live. Abbiamo modificato nomi e formulazioni identificative, accorciato gli scambi e unito frammenti separati. I timestamp, in secondi dall'inizio della chiamata, sono quelli originali.

La naturalezza è eccezionale

GPT-Live-1 è l'interlocutore dal suono più naturale che abbiamo mai messo su una linea telefonica. È un vero passo avanti.

Ascolta e parla su un unico flusso audio continuo, senza fasi separate di trascrizione e sintesi. La maggior parte delle dinamiche conversazionali funziona semplicemente. I chiamanti hanno sentito il suo primo audio circa 1,3 secondi dopo aver smesso di parlare (mediana), oppure circa 0,7 secondi senza il collegamento telefonico. Non abbiamo aggiunto alcun rilevamento dell'attività vocale né logica di alternanza dei turni. Gestisce le interruzioni con naturalezza, produce segnali di ascolto naturali ("Mh-mh") e parla a un ritmo sostenuto e umano.

Quando riceve obiettivi anziché battute da leggere, adatta le domande alla conversazione e accoglie le correzioni senza problemi:

Caller · 47.0Um, no, it's nine twenty, uh, seventy
Agent · 49.9Thanks for clarifying. So, September twentieth, nineteen seventy, right?
Caller · 56.5Yeah
Agent · 56.7Thanks. Pulling that up. Are you still renting your home?
Caller · 64.5Uh, not anymore now. I uh own my home now
Agent · 67.4Thanks, so you own your home. Is that a house, a condo, or a mobile home?

Non ha mai perso la calma di fronte a correzioni, interruzioni o chiamanti che cambiavano risposta a metà chiamata. Se la naturalezza fosse l'intero lavoro, questo post finirebbe qui. Purtroppo, c'è molto di più.

Non segue le istruzioni in modo affidabile

GPT-Live-1 non segue in modo affidabile le istruzioni sui comportamenti che contano in una chiamata telefonica basata su copione.

Più di una volta, ha risposto a un chiaro "sì" come se la risposta fosse stata "no", ripetendo la domanda o proseguendo come se il chiamante avesse rifiutato.

Il problema più costante è stato prendere le istruzioni troppo alla lettera. Il nostro prompt diceva: se il chiamante afferma che la situazione abitativa registrata non è corretta, chiedi se possiede una casa, è in affitto o vive con i genitori. Un chiamante ha detto "no, ora ne possiedo una", rispondendo già a quella domanda. Il modello ha comunque letto il menu:

Agent · 70.0...you listed as renting your home. Is that still correct?
Caller · 75.1Um, no, I own it now
Agent · 76.6Now, do you own your home, rent your home, live with your parents, or have some other housing situation?

Alcune stranezze iniziali erano colpa del nostro prompt, ma l'interpretazione letterale è rimasta invariata in ogni variante di prompt che abbiamo provato. Qualsiasi risposta che non avessimo previsto esplicitamente veniva gestita in modo meccanico anziché sensato.

A volte ragiona anche ad alta voce quando è sotto pressione:

Agent · 96.3Thanks. One moment.
Agent · 98.0Hmm. Handling this one carefully.
Agent · 101.4I'll acknowledge it and move on.
Agent · 107.1Thanks. And just to confirm, you're married, right?

I numeri e gli alfanumerici sono rischiosi

Le ortografie, gli indirizzi, le date di nascita e i numeri di identificazione devono essere esatti. È qui che il parlato di GPT-Live-1 presenta più problemi.

Abbiamo visto che ometteva e sostituiva caratteri nelle stringhe alfanumeriche. Qui legge un numero di richiesta inventato; le clip non sono state modificate, a parte il taglio dei silenzi. In inglese, la trascrizione era corretta ma l'audio aggiungeva una "Y":

Told to say8KD2 - QX7B - M4V9
Actually said8KD2 - QXY7B - M4V9
extra "Y"
GPT-Live-1 · IngleseRilettura del numero di richiesta, output non modificato
0:00 / 0:08

In russo era peggio: la "Q" diventava una "X" sia nell'audio sia nella trascrizione.

Told to say8KD2 - QX7B - M4V9
Actually saidвосемь кэй дэ два, тире, икс икс семь бэ, тире, эм четыре вэ девять
Which is8KD2 - XX7B - M4V9
"Q" became "X"
GPT-Live-1 · RussoLo stesso codice, letto in russo
0:00 / 0:08

Le date causavano lo stesso problema. Un chiamante ha fornito una data di nascita come cifre, che il modello in seguito ha riletto come un numero:

Caller · 159.7Uh five five ninety five
Caller · 192.8Wait, what did you get uh, Roberto's birthday as
Agent · 197.2So that's fifty-five ninety-five?
Caller · 203.6Oh what are you talking about
Caller · 210.2I don't know what you mean by fifty five ninety five, that's not a birthday

A volte pronuncia anche una battuta che appartiene al chiamante:

Agent · 74.7Do you currently have car insurance?
Agent · 78.5Do you currently I do.
Caller · 79.4I do

Accenti in altre lingue

Testiamo i nuovi modelli vocali nelle 47 lingue supportate dal nostro prodotto. Il russo di GPT-Live-1 era fluente ma aveva un marcato accento americano, mentre le voci TTS che usiamo in produzione suonano normalmente native:

Здравствуйте! Меня зовут Катя, я виртуальный агент вашей автостраховой. Лицензированный специалист скоро подключится, а пока, не против ли вы, если я задам пару вопросов, чтобы ускорить оформление полиса?
GPT-Live-1 · Saluto in russoKatya apre la chiamata
0:00 / 0:13

Abbiamo provato anche il luganda. Alla prima chiamata, ha risposto invece in swahili. Alla seconda, parlava luganda, in modo più naturale di quanto ci aspettassimo da un modello generalista, ma di nuovo con un marcato accento americano. Non abbiamo testato ogni lingua, ma ci aspettiamo che questo schema di accenti sia probabilmente generalizzabile. Non è importante per un agente solo in inglese, ma è un limite piuttosto significativo per i casi d'uso in altre lingue.

Alcuni vincoli dell'API da conoscere

In base a ciò che abbiamo riscontrato questa settimana, alcuni vincoli dell'API contano per un agente reale:

  • Le istruzioni sono immutabili dopo l'avvio della sessione e limitate a 16.384 token.
  • L'audio in output non smette mai di essere trasmesso in streaming — viene trasmesso anche il silenzio — quindi "audio interrotto" non può essere usato come segnale di fine turno nei casi d'uso che devono segmentare i turni.
  • È raggiungibile solo tramite il nuovo endpoint v1/live/sessions e, quando abbiamo verificato, non era ancora disponibile su Azure.

La nostra impressione finora

Gli agenti telefonici in produzione devono suonare naturali e seguire i copioni con costanza. GPT-Live-1 è straordinario nel primo aspetto, ma presenta alcuni seri problemi nel secondo. Continueremo a eseguire altri test nel tempo e a condividere ciò che scopriremo.