Våra första intryck av GPT-Live-1 API för röstagent
OpenAI släppte GPT-Live-1, sin nya full-duplex-röstmodell, i API:t för två dagar sedan. Vi utvecklar och driver AI-telefonagenter i produktion, så vi kopplade den till ett riktigt telefonnummer och ringde upp den. Många gånger.
Vi testade den med ett kvalificeringsskript på cirka 13 000 token för varma leads från en av våra försäkringskunder, med obligatoriska repliker som måste läsas ordagrant, strikta regler för återläsning och förgrenade följdfrågor. Under en lång dag genomförde vi ett dussin riktiga telefonsamtal, omkring 25 simulerade intervjuer och en omgång ostrukturerade tester.
Här är våra första intryck, med transkriptioner och ljud. En mer djupgående genomgång kommer inom kort.
Transkriptionerna kommer från våra testsamtal och har transkriberats av GPT-Live. Vi har ändrat namn och identifierande formuleringar, kortat ned utbyten och slagit ihop uppdelade fragment. Tidsstämplarna, i sekunder från samtalets början, kommer från originalen.
Naturligheten är enastående
GPT-Live-1 är den mest naturligt låtande samtalspartner vi har satt på en telefonlinje. Det är ett verkligt steg framåt.
Den lyssnar och talar i en och samma kontinuerliga ljudström, utan separata steg för transkribering och talsyntes. Det mesta i samtalsmekaniken fungerar bara. Uppringare hörde dess första ljud ungefär 1,3 sekunder efter att de slutat prata (median), eller omkring 0,7 sekunder utan telefonledet. Vi lade inte till någon logik för röstaktivitetsdetektering eller turordning. Den hanterar avbrott smidigt, ger naturliga lyssnarsignaler ("Mm-hmm") och talar i ett raskt, mänskligt tempo.
När den får mål i stället för repliker att läsa anpassar den frågorna till samtalet och hanterar rättelser utan problem:
Den tappade aldrig fattningen vid rättelser, avbrott eller när uppringare ändrade sina svar mitt i samtalet. Om naturlighet vore hela jobbet skulle det här inlägget sluta här. Tyvärr är det mer än så.
Den följer inte instruktioner på ett tillförlitligt sätt
GPT-Live-1 följer inte instruktioner på ett tillförlitligt sätt när det gäller beteendena som spelar roll i ett skriptat telefonsamtal.
Mer än en gång svarade den på ett tydligt "ja" som om svaret hade varit "nej", genom att ställa frågan igen eller gå vidare som om uppringaren hade tackat nej.
Det mest konsekventa felet var att den tog instruktioner för bokstavligt. Vår prompt sa: om uppringaren säger att boendestatusen i registret är fel, fråga om personen äger, hyr eller bor med sina föräldrar. En uppringare sa "nej, jag äger det nu", vilket redan besvarar den frågan. Modellen läste ändå upp menyn:
En del tidig märklighet berodde på vår prompt, men bokstavligheten kvarstod i varje promptvariant vi provade. Alla svar vi inte hade specificerat hanterades mekaniskt i stället för förnuftigt.
Den tänker också ibland högt under press:
Siffror och alfanumeriska tecken är riskfyllda
Stavningar, adresser, födelsedatum och ID-nummer måste vara exakta. Det är här GPT-Live-1 har flest problem med talet.
Vi hörde den utelämna och ersätta tecken i alfanumeriska strängar. Här läser den upp ett påhittat skadeärendenummer; klippen är orörda förutom att tystnad har klippts bort. På engelska var transkriptionen korrekt, men ljudet lade till ett "Y":
På ryska var det värre: "Q" blev ett "X" både i ljudet och i transkriptionen.
Datum orsakade samma problem. En uppringare angav ett födelsedatum som siffror, som modellen senare läste tillbaka som ett tal:
Den säger också ibland en replik som tillhör uppringaren:
Accenter på andra språk
Vi testar nya röstmodeller på de 47 språk som vår produkt stöder. GPT-Live-1:s ryska var flytande men hade en tydlig amerikansk accent (medan TTS-rösterna vi använder i produktion vanligtvis låter som modersmålstalare):
Vi testade även luganda. Vid det första samtalet svarade den på swahili i stället. Vid det andra talade den luganda, mer naturligt än vi hade väntat oss av en generell modell, men återigen med en tydlig amerikansk accent. Vi har inte testat alla språk, men vi förväntar oss att accentmönstret sannolikt gäller mer generellt. Det spelar ingen roll för en röstagent som bara använder engelska, men är en ganska betydande begränsning för användningsfall på andra språk.
Några API-begränsningar som är bra att känna till
Utifrån det vi hittade den här veckan är några API-begränsningar viktiga för en riktig agent:
- Instruktioner kan inte ändras efter att sessionen har startat, och är begränsade till 16 384 token.
- Utgående ljud slutar aldrig strömmas — även tystnad strömmas — så "ljudet stoppade" kan inte användas som signal för att en tur är slut i användningsfall där turer måste segmenteras.
- Den kan bara nås via den nya slutpunkten
v1/live/sessions, och var ännu inte tillgänglig på Azure när vi kontrollerade.
Vårt intryck hittills
Telefonagenter i produktion måste låta naturliga och följa manus konsekvent. GPT-Live-1 är fantastisk på det förstnämnda, men har några allvarliga problem med det senare. Vi kommer att köra fler tester med tiden och fortsätta rapportera våra resultat.