ThunderPhone 2.0 já está no ar.Comece por conta própria, a partir de 2¢/min.Leia o anúncio
Todos os posts

Nossas primeiras impressões sobre a API GPT-Live-1 para agentes de voz

12 de setembro de 2026Alex Kolchinski

A OpenAI disponibilizou o GPT-Live-1, seu novo modelo de voz full-duplex, na API há dois dias. Nós criamos e operamos agentes de IA por telefone em produção, então colocamos o modelo em um número de telefone real e ligamos para ele. Muitas vezes.

Nós o testamos com um script de qualificação de leads quentes de cerca de 13.000 tokens de um de nossos clientes de seguros, com falas obrigatórias que precisavam ser reproduzidas literalmente, regras rígidas de repetição e acompanhamentos condicionais. Ao longo de um dia intenso, fizemos uma dúzia de chamadas telefônicas reais, cerca de 25 entrevistas simuladas e um lote de testes não estruturados.

Estas são nossas primeiras impressões, com transcrições e áudio. Em breve, publicaremos uma análise mais aprofundada.

As transcrições são das nossas chamadas de teste, conforme transcritas pelo GPT-Live. Alteramos nomes e termos identificáveis, cortamos trechos de conversas e unimos fragmentos separados. Os registros de tempo, em segundos desde o início da chamada, são dos originais.

A naturalidade é excepcional

O GPT-Live-1 é o interlocutor mais natural que já colocamos em uma linha telefônica. É um avanço real.

Ele escuta e fala em um único fluxo contínuo de áudio, sem etapas separadas de transcrição e síntese. A maior parte da mecânica da conversa simplesmente funciona. Quem liga ouviu o primeiro áudio cerca de 1,3 segundo depois de parar de falar, na mediana, ou por volta de 0,7 segundo sem o trecho telefônico. Não adicionamos detecção de atividade de voz nem lógica de tomada de turno. Ele lida bem com interrupções, produz sinais de escuta naturais ("Uhum") e fala em um ritmo ágil, parecido com o de uma pessoa.

Quando recebe objetivos em vez de falas para ler, ele adapta as perguntas à conversa e aceita correções sem perder o ritmo:

Caller · 47.0Um, no, it's nine twenty, uh, seventy
Agent · 49.9Thanks for clarifying. So, September twentieth, nineteen seventy, right?
Caller · 56.5Yeah
Agent · 56.7Thanks. Pulling that up. Are you still renting your home?
Caller · 64.5Uh, not anymore now. I uh own my home now
Agent · 67.4Thanks, so you own your home. Is that a house, a condo, or a mobile home?

Ele nunca perdeu a compostura diante de correções, interrupções ou de quem liga mudando suas respostas no meio da chamada. Se a naturalidade fosse o trabalho inteiro, este post terminaria aqui. Infelizmente, há mais do que isso.

Ele não segue instruções de forma confiável

O GPT-Live-1 não segue instruções de forma confiável nos comportamentos que importam para uma chamada telefônica com roteiro.

Mais de uma vez, ele respondeu a um "sim" claro como se a resposta tivesse sido "não", repetindo a pergunta ou seguindo adiante como se quem liga tivesse recusado.

A falha mais consistente foi levar as instruções ao pé da letra. Nosso prompt dizia: se quem liga disser que a situação de moradia registrada está errada, pergunte se ela possui, aluga ou mora com os pais. Uma pessoa disse "não, agora é minha", o que já responde à pergunta. Mesmo assim, o modelo leu o menu:

Agent · 70.0...you listed as renting your home. Is that still correct?
Caller · 75.1Um, no, I own it now
Agent · 76.6Now, do you own your home, rent your home, live with your parents, or have some other housing situation?

Algumas estranhezas iniciais foram culpa do nosso prompt, mas o literalismo se manteve em todas as variações de prompt que testamos. Qualquer resposta que não tivéssemos explicitado era tratada de forma mecânica, em vez de sensata.

Às vezes, ele também pensa em voz alta sob pressão:

Agent · 96.3Thanks. One moment.
Agent · 98.0Hmm. Handling this one carefully.
Agent · 101.4I'll acknowledge it and move on.
Agent · 107.1Thanks. And just to confirm, you're married, right?

Números e alfanuméricos são arriscados

Grafias, endereços, datas de nascimento e números de identificação precisam estar exatos. É nesse ponto que a fala do GPT-Live-1 apresenta mais problemas.

Ouvimos o modelo omitir e substituir caracteres em sequências alfanuméricas. Aqui, ele lê um número de sinistro inventado; os clipes não foram alterados, exceto pelo corte de silêncios. Em inglês, a transcrição estava correta, mas o áudio acrescentou um "Y":

Told to say8KD2 - QX7B - M4V9
Actually said8KD2 - QXY7B - M4V9
extra "Y"
GPT-Live-1 · InglêsRepetição do número do sinistro, saída sem alterações
0:00 / 0:08

Em russo, foi pior: o "Q" virou um "X" tanto no áudio quanto na transcrição.

Told to say8KD2 - QX7B - M4V9
Actually saidвосемь кэй дэ два, тире, икс икс семь бэ, тире, эм четыре вэ девять
Which is8KD2 - XX7B - M4V9
"Q" became "X"
GPT-Live-1 · RussoMesmo código, lido em russo
0:00 / 0:08

Datas causaram o mesmo problema. Quem ligou informou uma data de nascimento em dígitos, que o modelo depois leu de volta como um número:

Caller · 159.7Uh five five ninety five
Caller · 192.8Wait, what did you get uh, Roberto's birthday as
Agent · 197.2So that's fifty-five ninety-five?
Caller · 203.6Oh what are you talking about
Caller · 210.2I don't know what you mean by fifty five ninety five, that's not a birthday

Ele também ocasionalmente fala uma linha que pertence a quem liga:

Agent · 74.7Do you currently have car insurance?
Agent · 78.5Do you currently I do.
Caller · 79.4I do

Sotaques em outros idiomas

Testamos novos modelos de voz nos 47 idiomas compatíveis com nosso produto. O russo do GPT-Live-1 era fluente, mas tinha um forte sotaque americano (enquanto as vozes de TTS que usamos em produção normalmente soam nativas):

Здравствуйте! Меня зовут Катя, я виртуальный агент вашей автостраховой. Лицензированный специалист скоро подключится, а пока, не против ли вы, если я задам пару вопросов, чтобы ускорить оформление полиса?
GPT-Live-1 · Saudação em russoKatya inicia a chamada
0:00 / 0:13

Também testamos luganda. Na primeira chamada, ele respondeu em suaíli. Na segunda, falou luganda, de forma mais natural do que esperávamos de um modelo generalista, mas novamente com um forte sotaque americano. Não testamos todos os idiomas, mas esperamos que o padrão de sotaque provavelmente se repita. Isso não importa para um agente apenas em inglês, mas é uma ressalva bastante significativa para casos de uso em outros idiomas.

Algumas limitações da API que vale conhecer

Com base no que encontramos esta semana, algumas limitações da API são importantes para um agente real:

  • As instruções são imutáveis após o início da sessão e têm limite de 16.384 tokens.
  • O áudio de saída nunca para de ser transmitido — até o silêncio é transmitido — portanto, "áudio interrompido" não pode ser usado como sinal de fim de turno em casos de uso que precisam segmentar turnos.
  • Ele só pode ser acessado pelo novo endpoint v1/live/sessions e ainda não estava disponível no Azure quando verificamos.

Nossa impressão até agora

Agentes telefônicos em produção precisam soar naturais e seguir roteiros de forma consistente. O GPT-Live-1 é incrível no primeiro ponto, mas apresenta alguns problemas sérios no segundo. Continuaremos realizando mais testes ao longo do tempo e relatando nossas descobertas.