Tecnologia

Vá além do pipeline de 3 etapas.

A maioria das plataformas de IA de voz depende de um pipeline de 3 etapas: um modelo de transcrição, um LLM sem capacidade de raciocínio e um mecanismo de conversão de texto em fala. Cada etapa é um ponto único de falha. O ThunderPhone reduz erros ao orquestrar vários modelos ao mesmo tempo.

Quem liga disse “Alugo.”
ASR A“Alugo”
ASR B“Hugo”
LLM de áudio“Alugo”
Interpretado como “Hugo” 2 de 3 caminhos concordam
A arquitetura integrada

Ouça de várias formas e depois reconcilie.

O ThunderPhone orquestra vários modelos ao mesmo tempo, permitindo que corrijam os erros uns dos outros.

Outras plataformas · pipeline de 3 etapas

Cada etapa confia na anterior.

Áudio de quem liga
“Alugo.” · resmungado
STT A
“Hugo”
STT B
LLM de áudio
Sem alternativa quando o único modelo ouve errado
LLM
Um modelo rápido vê apenas a transcrição.
→ responde “Olá, Hugo — como posso ajudar?”
LLMs rápidos cometem erros ao seguir instruções
TTS
A resposta é dita em voz alta.
→ diz “Olá, Hugo — como posso ajudar?” ✗
1 transcrição + 1 LLM = resposta errada
ThunderPhone · orquestrado

Muitos caminhos, uma resposta coordenada.

Áudio de quem liga
“Alugo.” · resmungado
STT A
“Alugo”
STT B
“Hugo”
LLM de áudio
“Alugo”
Três transcrições + áudio bruto mantidos como evidência
Camada de raciocínio
LLMs rápidos + de raciocínio avaliam evidências de texto e áudio.
→ 2 de 3 caminhos concordam: “Alugo”
LLMs de raciocínio + rápidos verificam um ao outro antes de responder
TTS
Vozes selecionadas minimizam alucinações em grafias e caracteres alfanuméricos.
→ “Entendi — então você disse «Alugo».” ✓
Acerta os detalhes difíceis logo na primeira vez.
Prova de desempenho

Storm estabelece recordes de inteligência no Big Bench Audio.

O BBA testa se um modelo consegue entender comandos falados e responder corretamente a perguntas difíceis. Nossa configuração Storm mais avançada alcança 99,4% em nosso conjunto público de avaliação — 0,6% de erros, 4× menos que a próxima melhor pontuação pública.

Modelo
Taxa de erros↓ menor é melhor
Pontuação
ThunderPhone Storm · Extra Intelligence4× menos erros
0.6%
Step-Audio R1.1
2.4%
Grok Voice Think Fast
2.9%
Ultravox v0.7 Thinking
3.0%
GPT-Realtime-2 High
3.4%
Gemini 3.1 Flash Live High
3.4%
Veja o conjunto de dados de avaliação BBA-Storm no Hugging Face

A taxa de erros é 100% menos a taxa de sucesso no BBA. O resultado do ThunderPhone vem do nosso conjunto de dados público de avaliação, com link acima; outras pontuações públicas (ranking da Artificial Analysis) estão listadas para referência. O BBA não captura totalmente o desempenho em chamadas telefônicas, mas é um sinal útil para o raciocínio sobre comandos falados.

Ter opinião supera ser configurável

Você não deveria precisar montar um stack de voz à mão.

Outras plataformas de IA de voz, como Vapi, Retell, Pipecat e LiveKit, obrigam você a tomar muitas decisões de configuração para fazer suas chamadas funcionarem. No ThunderPhone, acreditamos que o ajuste é nosso trabalho e que você deveria precisar fazer o mínimo possível para que suas chamadas funcionem sem problemas.

Outras plataformas de IA de voz · muitos controles para ajustar
STT LLM TTS Detecção de fim de fala Redução de ruído Interrupções Alternativas Esquema de ferramentas Latência VAD
O ThunderPhone ajusta tudo isso para você
ThunderPhone · três decisões
1
Escolha um nível
Spark, Bolt ou Storm.
2
Escolha uma voz
Selecionadas e testadas em ligações reais.
3
Escreva seu prompt
Comportamento, política, ferramentas — linguagem simples.
Três decisões. Essa é a configuração — orquestração, alternativas e ajustes já vêm incluídos.
Escolhemos os melhores modelos para cada tarefa e os integramos. Modelos de ponta da OpenAI, Anthropic e Google, trabalhando ao lado de modelos de código aberto — orquestrados para o melhor desempenho e preço em cada chamada, para que você não precise se preocupar com isso.
Um único prompt, menos complexidade em grafos

Um único prompt, não um grafo de nós.

Criadores de fluxos existem porque sistemas mais fracos não conseguem seguir prompts complexos. Cada etapa da conversa vira um nó que você precisa criar e manter manualmente. O Storm segue instruções detalhadas a partir de um único prompt, para que você não precise se preocupar com nós e conexões.

Plataformas de criação de fluxos

Conecte cada ramificação manualmente.

Saudaçãoprompt · voz
Coletar telefoneprompt · validação
Confirmar telefonesolicitar novamente ×2
enroll()ferramenta · novas tentativas
Escalarpara humano
Alternativagenérico
inválido ×2erro
Seis nós para um único fluxo de inscrição — cada um com seus próprios prompts, ferramentas, transições e tratamento de falhas.
ThunderPhone Storm

Descreva o comportamento uma vez.

Prompt de comportamento
Cumprimente quem liga e colete o nome e o telefone.
Confirme o consentimento antes de inscrever — obrigatório.
Se perguntarem sobre cobrança, siga a política de cobrança abaixo.
Acione enroll() somente depois que todos os campos forem confirmados.
Se quem liga pedir para falar com uma pessoa, transfira para um humano.
Ramificação complexa Watchdogs opcionais Iteração mais fácil
Um único prompt para escrever, testar e iterar — com ramificações incluídas.
Por que isso importa

Ligações em produção são imprevisíveis. O ThunderPhone está pronto.

Fala enrolada, conversa ao fundo, nomes e números, idiomas misturados — o ThunderPhone foi criado para as situações que quebram outros sistemas.

Fala enrolada

Compare sinais de áudio e texto em vez de confiar em uma única transcrição.

Áudio telefônico ruim

Modelos de identificação e redução de ruído limpam o sinal.

Conversas ao fundo

Identifique conversas paralelas antes que elas desviem o agente.

Nomes e endereços

Verifique nomes próprios, grafias, números e correções.

Fala em idiomas mistos

Encaminhe por fluxos multilíngues de áudio e voz quando necessário.

Prompts longos

Use caminhos de raciocínio mais robustos quando o comportamento não puder ser reduzido a uma regra.

Latência, qualidade e custo

Uma resposta errada mais rápida não melhora a ligação.

A IA para telefone precisa responder rápido — mas velocidade sem precisão só entrega erros mais depressa. Os LLMs atuais precisam de um momento para pensar e continuar confiáveis, então o ThunderPhone equilibra os dois em cada nível.

Spark
~3s
até a primeira resposta
Bolt
~2s
até a primeira resposta
Storm
~2–3s
~2s com sinais de escuta · ~3s sem eles
MediçãoOutros fornecedores afirmam ter latência de 500 ms em condições ideais, mas normalmente chegam a cerca de 2 s em uma ligação real.Medimos nossa latência em condições reais.
ResiliênciaFornecedores de IA enfrentam picos de latência que podem comprometer ligações.O stack orquestrado do ThunderPhone faz failover para opções mais rápidas quando isso acontece.
Gerações de IA de voz

A próxima geração de IA de voz chegou

Chamadas telefônicas automatizadas têm sido experiências frustrantes... até agora. Cada onda de tecnologia melhorou a experiência, mas nunca a ponto de ela ser realmente fluida. Isso muda com o ThunderPhone.

1990s2010s20242026 · agora
Geração 1

URA

Pressione um para vendas, pressione dois para suporte. Menus só podem encaminhar.

Geração 2

Bots de intenção

Diga “vendas” ou “cobrança” e torça para que o analisador de slots entenda.

Geração 3

IA em três etapas

Transcreva, consulte um LLM rápido e depois fale — cada etapa confiando na anterior.

Geração 4

IA integrada

Áudio, texto, raciocínio, ferramentas, vozes e proteções como um só sistema.

Feito para as ligações que quebram todo o resto

Veja a stack integrada
em suas ligações mais desafiadoras.

No ar em dez minutos. A partir de 2 centavos/min.