ThunderPhone 2.0 ya está disponible.Empieza por tu cuenta desde 2¢/min.Lee el anuncio
Todas las publicaciones

Nuestras primeras impresiones de la API GPT-Live-1 para agentes de voz

12 de septiembre de 2026Alex Kolchinski

OpenAI lanzó GPT-Live-1, su nuevo modelo de voz full-duplex, en la API hace dos días. Creamos y operamos agentes telefónicos de IA en producción, así que lo conectamos a un número de teléfono real y lo llamamos. Mucho.

Lo probamos con un script de calificación de prospectos interesados de unos 13,000 tokens de uno de nuestros clientes de seguros, con líneas obligatorias que debían decirse textualmente, reglas estrictas de repetición y seguimientos condicionales. Durante un día largo, realizamos una docena de llamadas telefónicas reales, unas 25 entrevistas simuladas y un lote de pruebas no estructuradas.

Estas son nuestras primeras impresiones, con transcripciones y audio. En breve publicaremos un análisis más detallado.

Las transcripciones provienen de nuestras llamadas de prueba, tal como las transcribió GPT-Live. Cambiamos nombres y redacción identificable, recortamos intercambios y unimos fragmentos separados. Las marcas de tiempo, en segundos desde el inicio de la llamada, son de los originales.

La naturalidad es excepcional

GPT-Live-1 es el interlocutor más natural que hemos puesto en una línea telefónica. Es un verdadero avance.

Escucha y habla en un flujo de audio continuo, sin etapas separadas de transcripción y síntesis. La mayoría de los mecanismos conversacionales simplemente funcionan. Quienes llaman escucharon su primer audio alrededor de 1.3 segundos después de dejar de hablar (mediana), o cerca de 0.7 segundos sin el tramo telefónico. No agregamos detección de actividad de voz ni lógica de toma de turnos. Maneja las interrupciones con naturalidad, produce señales de escucha naturales ("Mmm-hmm") y habla a un ritmo ágil, parecido al humano.

Cuando recibe objetivos en lugar de líneas para leer, adapta las preguntas a la conversación y acepta las correcciones sin problemas:

Caller · 47.0Um, no, it's nine twenty, uh, seventy
Agent · 49.9Thanks for clarifying. So, September twentieth, nineteen seventy, right?
Caller · 56.5Yeah
Agent · 56.7Thanks. Pulling that up. Are you still renting your home?
Caller · 64.5Uh, not anymore now. I uh own my home now
Agent · 67.4Thanks, so you own your home. Is that a house, a condo, or a mobile home?

Nunca perdió la compostura ante correcciones, interrupciones o personas que cambiaban sus respuestas durante la llamada. Si la naturalidad fuera todo el trabajo, esta publicación terminaría aquí. Por desgracia, hay más que considerar.

No sigue las instrucciones de forma confiable

GPT-Live-1 no sigue las instrucciones de forma confiable en los comportamientos que importan para una llamada telefónica con guion.

Más de una vez, respondió a un "sí" claro como si la respuesta hubiera sido "no", volviendo a hacer la pregunta o avanzando como si quien llamaba hubiera rechazado.

La falla más consistente fue tomar las instrucciones demasiado literalmente. Nuestro prompt decía: si quien llama indica que el estado de vivienda registrado es incorrecto, pregunte si es propietario, renta o vive con sus padres. Una persona dijo "no, ahora soy propietario", lo que ya responde esa pregunta. Aun así, el modelo leyó el menú:

Agent · 70.0...you listed as renting your home. Is that still correct?
Caller · 75.1Um, no, I own it now
Agent · 76.6Now, do you own your home, rent your home, live with your parents, or have some other housing situation?

Parte de las rarezas iniciales fue culpa de nuestro prompt, pero ese literalismo se mantuvo en todas las variantes de prompt que probamos. Cualquier respuesta que no hubiéramos especificado se manejaba de forma mecánica en lugar de sensata.

También a veces piensa en voz alta bajo presión:

Agent · 96.3Thanks. One moment.
Agent · 98.0Hmm. Handling this one carefully.
Agent · 101.4I'll acknowledge it and move on.
Agent · 107.1Thanks. And just to confirm, you're married, right?

Los números y los caracteres alfanuméricos son riesgosos

Las grafías, direcciones, fechas de nacimiento y números de identificación deben ser exactos. Aquí es donde la voz de GPT-Live-1 tiene más problemas.

Escuchamos que omitía y sustituía caracteres en cadenas alfanuméricas. Aquí lee un número de reclamación inventado; los clips no tienen modificaciones aparte de recortar el silencio. En inglés, su transcripción fue correcta, pero el audio agregó una "Y":

Told to say8KD2 - QX7B - M4V9
Actually said8KD2 - QXY7B - M4V9
extra "Y"
GPT-Live-1 · InglésRepetición del número de reclamación, salida sin modificar
0:00 / 0:08

En ruso fue peor: la "Q" se convirtió en una "X" tanto en el audio como en su transcripción.

Told to say8KD2 - QX7B - M4V9
Actually saidвосемь кэй дэ два, тире, икс икс семь бэ, тире, эм четыре вэ девять
Which is8KD2 - XX7B - M4V9
"Q" became "X"
GPT-Live-1 · RusoEl mismo código, leído en ruso
0:00 / 0:08

Las fechas causaron el mismo problema. Una persona que llamó dio una fecha de nacimiento como dígitos, que el modelo luego repitió como un número:

Caller · 159.7Uh five five ninety five
Caller · 192.8Wait, what did you get uh, Roberto's birthday as
Agent · 197.2So that's fifty-five ninety-five?
Caller · 203.6Oh what are you talking about
Caller · 210.2I don't know what you mean by fifty five ninety five, that's not a birthday

También, ocasionalmente dice una línea que le corresponde a quien llama:

Agent · 74.7Do you currently have car insurance?
Agent · 78.5Do you currently I do.
Caller · 79.4I do

Acentos en otros idiomas

Probamos nuevos modelos de voz en los 47 idiomas que admite nuestro producto. El ruso de GPT-Live-1 fue fluido, pero tenía un marcado acento estadounidense (mientras que las voces de TTS que usamos en producción normalmente suenan nativas):

Здравствуйте! Меня зовут Катя, я виртуальный агент вашей автостраховой. Лицензированный специалист скоро подключится, а пока, не против ли вы, если я задам пару вопросов, чтобы ускорить оформление полиса?
GPT-Live-1 · Saludo en rusoKatya inicia la llamada
0:00 / 0:13

También probamos luganda. En la primera llamada, respondió en suajili. En la segunda, habló luganda, de forma más natural de lo que esperábamos de un modelo generalista, pero de nuevo con un marcado acento estadounidense. No hemos probado todos los idiomas, pero esperamos que el patrón de acento probablemente se generalice. Eso no importa para un agente que solo habla inglés, pero es una advertencia bastante importante para casos de uso en otros idiomas.

Algunas limitaciones de la API que conviene conocer

Según lo que encontramos esta semana, algunas limitaciones de la API son importantes para un agente real:

  • Las instrucciones son inmutables después de que inicia la sesión, y tienen un límite de 16,384 tokens.
  • El audio de salida nunca deja de transmitirse —también se transmite el silencio—, por lo que "audio detenido" no puede usarse como señal de final de turno en casos de uso que necesitan segmentar turnos.
  • Solo se puede acceder a través del nuevo endpoint v1/live/sessions, y todavía no estaba disponible en Azure cuando lo verificamos.

Nuestra impresión hasta ahora

Los agentes telefónicos de producción deben sonar naturales y seguir los guiones de forma consistente. GPT-Live-1 es increíble en lo primero, pero tiene algunos problemas serios con lo segundo. Realizaremos más pruebas con el tiempo y seguiremos informando nuestros hallazgos.