Nuestras primeras impresiones de la API GPT-Live-1 para agentes de voz
OpenAI lanzó GPT-Live-1, su nuevo modelo de voz full-duplex, en la API hace dos días. Creamos y operamos agentes telefónicos de IA en producción, así que lo conectamos a un número de teléfono real y lo llamamos. Mucho.
Lo probamos con un script de calificación de prospectos interesados de unos 13,000 tokens de uno de nuestros clientes de seguros, con líneas obligatorias que debían decirse textualmente, reglas estrictas de repetición y seguimientos condicionales. Durante un día largo, realizamos una docena de llamadas telefónicas reales, unas 25 entrevistas simuladas y un lote de pruebas no estructuradas.
Estas son nuestras primeras impresiones, con transcripciones y audio. En breve publicaremos un análisis más detallado.
Las transcripciones provienen de nuestras llamadas de prueba, tal como las transcribió GPT-Live. Cambiamos nombres y redacción identificable, recortamos intercambios y unimos fragmentos separados. Las marcas de tiempo, en segundos desde el inicio de la llamada, son de los originales.
La naturalidad es excepcional
GPT-Live-1 es el interlocutor más natural que hemos puesto en una línea telefónica. Es un verdadero avance.
Escucha y habla en un flujo de audio continuo, sin etapas separadas de transcripción y síntesis. La mayoría de los mecanismos conversacionales simplemente funcionan. Quienes llaman escucharon su primer audio alrededor de 1.3 segundos después de dejar de hablar (mediana), o cerca de 0.7 segundos sin el tramo telefónico. No agregamos detección de actividad de voz ni lógica de toma de turnos. Maneja las interrupciones con naturalidad, produce señales de escucha naturales ("Mmm-hmm") y habla a un ritmo ágil, parecido al humano.
Cuando recibe objetivos en lugar de líneas para leer, adapta las preguntas a la conversación y acepta las correcciones sin problemas:
Nunca perdió la compostura ante correcciones, interrupciones o personas que cambiaban sus respuestas durante la llamada. Si la naturalidad fuera todo el trabajo, esta publicación terminaría aquí. Por desgracia, hay más que considerar.
No sigue las instrucciones de forma confiable
GPT-Live-1 no sigue las instrucciones de forma confiable en los comportamientos que importan para una llamada telefónica con guion.
Más de una vez, respondió a un "sí" claro como si la respuesta hubiera sido "no", volviendo a hacer la pregunta o avanzando como si quien llamaba hubiera rechazado.
La falla más consistente fue tomar las instrucciones demasiado literalmente. Nuestro prompt decía: si quien llama indica que el estado de vivienda registrado es incorrecto, pregunte si es propietario, renta o vive con sus padres. Una persona dijo "no, ahora soy propietario", lo que ya responde esa pregunta. Aun así, el modelo leyó el menú:
Parte de las rarezas iniciales fue culpa de nuestro prompt, pero ese literalismo se mantuvo en todas las variantes de prompt que probamos. Cualquier respuesta que no hubiéramos especificado se manejaba de forma mecánica en lugar de sensata.
También a veces piensa en voz alta bajo presión:
Los números y los caracteres alfanuméricos son riesgosos
Las grafías, direcciones, fechas de nacimiento y números de identificación deben ser exactos. Aquí es donde la voz de GPT-Live-1 tiene más problemas.
Escuchamos que omitía y sustituía caracteres en cadenas alfanuméricas. Aquí lee un número de reclamación inventado; los clips no tienen modificaciones aparte de recortar el silencio. En inglés, su transcripción fue correcta, pero el audio agregó una "Y":
En ruso fue peor: la "Q" se convirtió en una "X" tanto en el audio como en su transcripción.
Las fechas causaron el mismo problema. Una persona que llamó dio una fecha de nacimiento como dígitos, que el modelo luego repitió como un número:
También, ocasionalmente dice una línea que le corresponde a quien llama:
Acentos en otros idiomas
Probamos nuevos modelos de voz en los 47 idiomas que admite nuestro producto. El ruso de GPT-Live-1 fue fluido, pero tenía un marcado acento estadounidense (mientras que las voces de TTS que usamos en producción normalmente suenan nativas):
También probamos luganda. En la primera llamada, respondió en suajili. En la segunda, habló luganda, de forma más natural de lo que esperábamos de un modelo generalista, pero de nuevo con un marcado acento estadounidense. No hemos probado todos los idiomas, pero esperamos que el patrón de acento probablemente se generalice. Eso no importa para un agente que solo habla inglés, pero es una advertencia bastante importante para casos de uso en otros idiomas.
Algunas limitaciones de la API que conviene conocer
Según lo que encontramos esta semana, algunas limitaciones de la API son importantes para un agente real:
- Las instrucciones son inmutables después de que inicia la sesión, y tienen un límite de 16,384 tokens.
- El audio de salida nunca deja de transmitirse —también se transmite el silencio—, por lo que "audio detenido" no puede usarse como señal de final de turno en casos de uso que necesitan segmentar turnos.
- Solo se puede acceder a través del nuevo endpoint
v1/live/sessions, y todavía no estaba disponible en Azure cuando lo verificamos.
Nuestra impresión hasta ahora
Los agentes telefónicos de producción deben sonar naturales y seguir los guiones de forma consistente. GPT-Live-1 es increíble en lo primero, pero tiene algunos problemas serios con lo segundo. Realizaremos más pruebas con el tiempo y seguiremos informando nuestros hallazgos.