ThunderPhone 2.0 is live.Direct zelf aan de slag, vanaf 2 cent/min.Lees de aankondiging
Alle artikelen

Onze eerste indrukken van de GPT-Live-1 API voor spraakagenten

12 september 2026Alex Kolchinski

OpenAI bracht GPT-Live-1, zijn nieuwe full-duplex spraakmodel, twee dagen geleden uit voor de API. Wij bouwen en draaien AI-telefoonagenten in productie, dus we hebben het op een echt telefoonnummer gezet en gebeld. Heel vaak.

We testten het met een script van ~13.000 tokens voor de kwalificatie van warme leads van een van onze verzekeringsklanten, met verplichte letterlijke zinnen, strikte regels voor het herhalen en vertakkende vervolgvragen. In één lange dag voerden we een dozijn echte telefoongesprekken, ongeveer 25 gesimuleerde interviews en een reeks ongestructureerde tests uit.

Dit zijn onze eerste indrukken, met transcripties en audio. Een uitgebreidere analyse volgt binnenkort.

De transcripties komen uit onze testgesprekken, zoals getranscribeerd door GPT-Live. We hebben namen en identificerende formuleringen aangepast, uitwisselingen ingekort en opgesplitste fragmenten samengevoegd. De tijdstempels, in seconden vanaf het begin van het gesprek, komen uit de originelen.

De natuurlijkheid is uitzonderlijk

GPT-Live-1 is de natuurlijkst klinkende gesprekspartner die we ooit op een telefoonlijn hebben gezet. Het is een echte stap vooruit.

Het luistert en spreekt via één doorlopende audiostream, zonder afzonderlijke transcriptie- en synthesefasen. De meeste gespreksmechanismen werken gewoon. Bellers hoorden de eerste audio ongeveer 1,3 seconde nadat ze waren uitgepraat (mediaan), of rond 0,7 seconde zonder het telefoongedeelte. We hebben geen detectie van spraakactiviteit of logica voor beurtwisseling toegevoegd. Het gaat soepel om met onderbrekingen, produceert natuurlijke luistersignalen ("Mm-hmm") en spreekt in een vlot, menselijk tempo.

Wanneer je het doelen geeft in plaats van voor te lezen zinnen, past het vragen aan het gesprek aan en verwerkt het correcties moeiteloos:

Caller · 47.0Um, no, it's nine twenty, uh, seventy
Agent · 49.9Thanks for clarifying. So, September twentieth, nineteen seventy, right?
Caller · 56.5Yeah
Agent · 56.7Thanks. Pulling that up. Are you still renting your home?
Caller · 64.5Uh, not anymore now. I uh own my home now
Agent · 67.4Thanks, so you own your home. Is that a house, a condo, or a mobile home?

Het verloor nooit zijn kalmte bij correcties, onderbrekingen of bellers die midden in het gesprek hun antwoord veranderden. Als natuurlijkheid de hele taak was, zou deze post hier eindigen. Helaas komt er meer bij kijken.

Het volgt instructies niet betrouwbaar op

GPT-Live-1 volgt instructies niet betrouwbaar op bij gedrag dat belangrijk is voor een gescript telefoongesprek.

Meer dan eens reageerde het op een duidelijk "ja" alsof het antwoord "nee" was geweest, door de vraag opnieuw te stellen of verder te gaan alsof de beller had afgewezen.

De meest consistente fout was dat het instructies te letterlijk nam. Onze prompt zei: als de beller aangeeft dat de geregistreerde woonsituatie onjuist is, vraag dan of diegene een woning bezit, huurt of bij de ouders woont. Een beller zei: "nee, ik bezit het nu", wat die vraag al beantwoordt. Toch las het model het menu voor:

Agent · 70.0...you listed as renting your home. Is that still correct?
Caller · 75.1Um, no, I own it now
Agent · 76.6Now, do you own your home, rent your home, live with your parents, or have some other housing situation?

Een deel van de vroege vreemdheid lag aan onze prompt, maar het letterlijke gedrag bleef bestaan in elke promptvariant die we probeerden. Elk antwoord dat we niet expliciet hadden uitgeschreven, werd mechanisch behandeld in plaats van verstandig.

Soms denkt het onder druk ook hardop:

Agent · 96.3Thanks. One moment.
Agent · 98.0Hmm. Handling this one carefully.
Agent · 101.4I'll acknowledge it and move on.
Agent · 107.1Thanks. And just to confirm, you're married, right?

Nummers en alfanumerieke reeksen zijn riskant

Spellingen, adressen, geboortedata en identificatienummers moeten exact kloppen. Hier heeft de spraak van GPT-Live-1 de meeste problemen mee.

We hoorden het tekens weglaten en vervangen in alfanumerieke reeksen. Hier leest het een verzonnen schadenummer voor; de clips zijn, afgezien van het weghalen van stiltes, ongewijzigd. In het Engels was het transcript correct, maar de audio voegde een "Y" toe:

Told to say8KD2 - QX7B - M4V9
Actually said8KD2 - QXY7B - M4V9
extra "Y"
GPT-Live-1 · EngelsSchadenummer herhaald, ongewijzigde uitvoer
0:00 / 0:08

In het Russisch was het erger: de "Q" werd zowel in de audio als in het transcript een "X".

Told to say8KD2 - QX7B - M4V9
Actually saidвосемь кэй дэ два, тире, икс икс семь бэ, тире, эм четыре вэ девять
Which is8KD2 - XX7B - M4V9
"Q" became "X"
GPT-Live-1 · RussischDezelfde code, voorgelezen in het Russisch
0:00 / 0:08

Datums veroorzaakten hetzelfde probleem. Een beller gaf een geboortedatum als cijfers door, die het model later als een getal voorlas:

Caller · 159.7Uh five five ninety five
Caller · 192.8Wait, what did you get uh, Roberto's birthday as
Agent · 197.2So that's fifty-five ninety-five?
Caller · 203.6Oh what are you talking about
Caller · 210.2I don't know what you mean by fifty five ninety five, that's not a birthday

Het spreekt ook af en toe een zin uit die bij de beller hoort:

Agent · 74.7Do you currently have car insurance?
Agent · 78.5Do you currently I do.
Caller · 79.4I do

Accenten in andere talen

We testen nieuwe spraakmodellen in de 47 talen die ons product ondersteunt. Het Russisch van GPT-Live-1 was vloeiend, maar had een zwaar Amerikaans accent (terwijl de TTS-stemmen die we in productie gebruiken doorgaans als moedertaalsprekers klinken):

Здравствуйте! Меня зовут Катя, я виртуальный агент вашей автостраховой. Лицензированный специалист скоро подключится, а пока, не против ли вы, если я задам пару вопросов, чтобы ускорить оформление полиса?
GPT-Live-1 · Russische begroetingKatja opent het gesprek
0:00 / 0:13

We probeerden ook Luganda. Tijdens het eerste gesprek antwoordde het in plaats daarvan in het Swahili. Tijdens het tweede sprak het Luganda, natuurlijker dan we van een algemeen model hadden verwacht, maar opnieuw met een zwaar Amerikaans accent. We hebben niet elke taal getest, maar we verwachten dat dit accentpatroon waarschijnlijk breder geldt. Voor een uitsluitend Engelstalige agent maakt dat niet uit, maar voor toepassingen in andere talen is het een behoorlijk belangrijke kanttekening.

Enkele API-beperkingen die je moet kennen

Op basis van wat we deze week hebben gevonden, zijn enkele API-beperkingen belangrijk voor een echte spraakagent:

  • Instructies zijn onveranderlijk nadat de sessie is gestart, en beperkt tot 16.384 tokens.
  • De uitvoeraudio stopt nooit met streamen — ook stilte wordt gestreamd — dus "audio gestopt" kan niet worden gebruikt als signaal voor het einde van een beurt bij toepassingen die beurten moeten segmenteren.
  • Het is alleen bereikbaar via het nieuwe v1/live/sessions-endpoint, en was nog niet beschikbaar op Azure toen we dit controleerden.

Onze indruk tot nu toe

Telefoonagenten in productie moeten natuurlijk klinken en scripts consequent volgen. GPT-Live-1 is geweldig in het eerste, maar heeft enkele ernstige problemen met het tweede. We zullen in de loop der tijd meer tests uitvoeren en onze bevindingen blijven delen.