Våre førsteinntrykk av GPT-Live-1 API-et for stemmeagenter
OpenAI lanserte GPT-Live-1, den nye full-dupleks-stemmemodellen sin, i API-et for to dager siden. Vi bygger og drifter AI-stemmeagenter i produksjon, så vi koblet den til et ekte telefonnummer og ringte den. Mye.
Vi testet den med et kvalifiseringsskript på rundt 13 000 tokener for varme leads fra en av forsikringskundene våre, med obligatoriske ordrette replikker, strenge regler for gjentakelse og forgrenede oppfølgingsspørsmål. I løpet av én lang dag gjennomførte vi et dusin ekte telefonsamtaler, rundt 25 simulerte intervjuer og en serie ustrukturerte tester.
Dette er førsteinntrykkene våre, med transkripsjoner og lyd. En grundigere gjennomgang kommer snart.
Transkripsjonene er fra testsamtalene våre, slik de ble transkribert av GPT-Live. Vi har endret navn og identifiserende formuleringer, forkortet samtaleutvekslinger og slått sammen oppdelte fragmenter. Tidsstemplene, i sekunder fra starten av samtalen, er fra originalene.
Naturligheten er eksepsjonell
GPT-Live-1 er den mest naturlig klingende samtalepartneren vi har hatt på en telefonlinje. Det er et reelt steg fremover.
Den lytter og snakker i én kontinuerlig lydstrøm, uten separate stadier for transkripsjon og syntese. Det meste av samtalemekanikken fungerer bare. Innringere hørte den første lyden omtrent 1,3 sekunder etter at de sluttet å snakke (median), eller rundt 0,7 sekunder uten telefonleddet. Vi la ikke til noen logikk for taledeteksjon eller turtaking. Den håndterer avbrytelser elegant, gir naturlige lytterresponser («Mhm») og snakker i et raskt, menneskelignende tempo.
Når den får mål i stedet for replikker å lese, tilpasser den spørsmålene til samtalen og håndterer korrigeringer uten problemer:
Den mistet aldri fatningen ved korrigeringer, avbrytelser eller når innringere endret svarene sine midt i samtalen. Hvis naturlighet var hele jobben, ville dette innlegget sluttet her. Dessverre er det mer enn det.
Den følger ikke instruksjoner pålitelig
GPT-Live-1 følger ikke instruksjoner pålitelig i atferden som betyr noe for en skriptet telefonsamtale.
Flere ganger svarte den på et tydelig «ja» som om svaret hadde vært «nei», ved å stille spørsmålet på nytt eller gå videre som om innringeren hadde avslått.
Den mest konsekvente feilen var at den tok instruksjoner for bokstavelig. Prompten vår sa: Hvis innringeren sier at boligstatusen i systemet er feil, spør om de eier, leier eller bor hos foreldrene sine. En innringer sa «nei, jeg eier den nå», som allerede besvarer det spørsmålet. Modellen leste likevel opp menyen:
Noe av den tidlige merkeligheten skyldtes prompten vår, men bokstaveligheten holdt seg på tvers av alle promptvariantene vi prøvde. Ethvert svar vi ikke hadde spesifisert, ble håndtert mekanisk i stedet for fornuftig.
Den tenker også noen ganger høyt under press:
Tall og alfanumeriske tegn er risikable
Stavinger, adresser, fødselsdatoer og ID-numre må være nøyaktige. Det er her talen til GPT-Live-1 har flest problemer.
Vi hørte den utelate og erstatte tegn i alfanumeriske strenger. Her leser den opp et oppdiktet skadenummer; klippene er urørte bortsett fra at stillhet er trimmet. På engelsk var transkripsjonen riktig, men lyden la til en «Y»:
På russisk var det verre: «Q» ble til en «X» både i lyden og i transkripsjonen.
Datoer førte til det samme problemet. En innringer oppga en fødselsdato som sifre, som modellen senere leste tilbake som et tall:
Den sier også av og til en replikk som tilhører innringeren:
Aksenter på andre språk
Vi tester nye stemmemodeller på tvers av de 47 språkene produktet vårt støtter. Russisken til GPT-Live-1 var flytende, men hadde en tydelig amerikansk aksent (mens TTS-stemmene vi kjører i produksjon, vanligvis høres ut som morsmålsbrukere):
Vi prøvde også luganda. I den første samtalen svarte den på swahili i stedet. I den andre snakket den luganda, mer naturlig enn vi forventet av en generell modell, men igjen med en tydelig amerikansk aksent. Vi har ikke testet alle språkene, men vi forventer at aksentmønsteret sannsynligvis gjelder generelt. Det spiller ingen rolle for en agent som kun snakker engelsk, men er et ganske betydelig forbehold for bruksområder på andre språk.
Noen API-begrensninger det er verdt å kjenne til
Basert på det vi fant denne uken, er noen API-begrensninger viktige for en ekte agent:
- Instruksjoner kan ikke endres etter at økten har startet, og er begrenset til 16 384 tokener.
- Utgangslyden slutter aldri å strømme — også stillhet strømmes — så «lyden stoppet» kan ikke brukes som et signal for turavslutning i bruksområder som må segmentere turer.
- Den er bare tilgjengelig gjennom det nye endepunktet
v1/live/sessions, og var ennå ikke tilgjengelig på Azure da vi sjekket.
Vårt inntrykk så langt
Telefonagenter i produksjon må høres naturlige ut og følge manus konsekvent. GPT-Live-1 er fantastisk på det første, men har noen alvorlige problemer med det andre. Vi kommer til å kjøre flere tester etter hvert og fortsette å rapportere funnene våre.