Tecnología

Ve más allá de la plataforma de 3 pasos.

La mayoría de las plataformas de IA de voz dependen de una plataforma de 3 pasos: un modelo de transcripción, un LLM que no razona y un motor de texto a voz. Cada paso es un único punto de falla. ThunderPhone reduce los errores al orquestar varios modelos a la vez.

Quien llama dijo “Rento.”
ASR A“Rento”
ASR B“Soy Renzo”
LLM de audio“Rento”
Conciliado “Rento” 2 de 3 rutas coinciden
La arquitectura integrada

Escúchalo de muchas formas y luego concílialas.

ThunderPhone orquesta muchos modelos a la vez, permitiéndoles corregir los errores de los demás.

Otras plataformas · proceso de 3 pasos

Cada paso confía en el anterior.

Audio de quien llama
«Rento». · murmurado
STT A
“Soy Renzo”
STT B
LLM de audio
Sin respaldo cuando el único modelo escucha mal
LLM
Un modelo rápido solo ve la transcripción.
→ responde «Hola, Renzo — ¿cómo puedo ayudarle?»
Los LLM rápidos cometen errores al seguir instrucciones
TTS
La respuesta se dice en voz alta.
→ dice «Hola, Renzo — ¿cómo puedo ayudarle?» ✗
1 transcripción + 1 LLM = respuesta incorrecta
ThunderPhone · orquestado

Muchas rutas, una respuesta coordinada.

Audio de quien llama
«Rento». · murmurado
STT A
“Rento”
STT B
“Soy Renzo”
LLM de audio
“Rento”
Se conservan tres transcripciones y el audio original como evidencia
Capa de razonamiento
Los LLM rápidos y de razonamiento sopesan la evidencia de texto y audio.
→ 2 de 3 rutas coinciden: «Rento»
Los LLM de razonamiento y rápidos se verifican entre sí antes de responder
TTS
Las voces seleccionadas minimizan las alucinaciones en ortografía y caracteres alfanuméricos.
→ “Entendido; entonces renta.” ✓
Capta correctamente los detalles complejos desde la primera vez.
Prueba de rendimiento

Storm establece récords de inteligencia en Big Bench Audio.

BBA prueba si un modelo puede entender prompts hablados y responder correctamente preguntas difíciles. Nuestra configuración Storm más potente alcanza un 99.4% en nuestro conjunto público de evaluación: 0.6% de errores, 4× menos que la siguiente mejor puntuación pública.

Modelo
Tasa de errores↓ más bajo es mejor
Puntuación
ThunderPhone Storm · Extra Intelligence4× menos errores
0.6%
Step-Audio R1.1
2.4%
Grok Voice Think Fast
2.9%
Ultravox v0.7 Thinking
3.0%
GPT-Realtime-2 High
3.4%
Gemini 3.1 Flash Live High
3.4%
Consulta el dataset de evaluación BBA-Storm en Hugging Face

La tasa de errores es 100% menos la tasa de éxito de BBA. El resultado de ThunderPhone proviene de nuestro dataset público de evaluación, enlazado arriba; otras puntuaciones públicas (clasificación de Artificial Analysis) se incluyen como referencia. BBA no captura por completo el rendimiento en llamadas telefónicas, pero es una señal útil para el razonamiento sobre prompts hablados.

Un enfoque definido supera a lo configurable

No deberías tener que crear una plataforma de voz a mano.

Otras plataformas de IA de voz como Vapi, Retell, Pipecat y LiveKit te obligan a tomar muchas decisiones de configuración para que tus llamadas funcionen. En ThunderPhone, creemos que los ajustes son nuestro trabajo y que deberías tener que hacer el menor trabajo posible para que tus llamadas funcionen sin problemas.

Otras plataformas de IA de voz · muchos controles que ajustar
STT LLM TTS Detección de finalización Eliminación de ruido Interrupciones Alternativas Esquema de herramientas Latencia VAD
ThunderPhone ajusta todo esto por ti
ThunderPhone · tres decisiones
1
Elige un nivel
Spark, Bolt o Storm.
2
Elige una voz
Seleccionada y probada en llamadas reales.
3
Escribe tu prompt
Comportamiento, políticas, herramientas: lenguaje sencillo.
Tres decisiones. Eso es todo lo necesario: la orquestación, las alternativas y los ajustes vienen incluidos.
Elegimos los mejores modelos para cada tarea y los integramos. Modelos de vanguardia de OpenAI, Anthropic y Google, junto con modelos de código abierto, orquestados para ofrecer el mejor rendimiento y precio en cada llamada, para que no tengas que preocuparte por ello.
Un solo prompt, menos proliferación de grafos

Un prompt, no un grafo de nodos.

Las plataformas de creación de flujos existen porque los sistemas menos capaces no pueden seguir prompts complejos. Cada paso de la conversación se convierte en un nodo que debes crear y mantener manualmente. Storm sigue instrucciones detalladas desde un solo prompt, para que no tengas que preocuparte por nodos y conexiones.

Plataformas de creación de flujos

Conecta manualmente cada rama.

Saludoprompt · voz
Recopilar teléfonoprompt · validación
Confirmar teléfonovolver a preguntar ×2
enroll()herramienta · reintentos
Escalara una persona
Alternativacomodín
no válido ×2error
Seis nodos para un flujo de inscripción, cada uno con sus propios prompts, herramientas, transiciones y manejo de fallos.
ThunderPhone Storm

Describe el comportamiento una sola vez.

Prompt de comportamiento
Saluda a quien llama y recopila su nombre y teléfono.
Confirma el consentimiento antes de inscribirle; es obligatorio.
Si pregunta sobre facturación, sigue la política de facturación a continuación.
Llama a enroll() solo cuando todos los campos estén confirmados.
Si quien llama pide hablar con una persona, transfiere a un humano.
Ramificación compleja Monitores opcionales Iteración más sencilla
Un prompt para escribir, probar e iterar, con ramificaciones incluidas.
Por qué importa

Las llamadas en producción son complejas. ThunderPhone está listo.

Habla entrecortada, conversaciones de fondo, nombres y números, idiomas mezclados: ThunderPhone está diseñado para las situaciones que hacen fallar a otros sistemas.

Habla poco clara

Compara señales de audio y texto en lugar de confiar en una sola transcripción.

Audio telefónico deficiente

Los modelos de identificación y reducción de ruido limpian la señal.

Charlas de fondo

Identifica conversaciones de fondo antes de que desvíen al agente.

Nombres y direcciones

Verifica nombres propios, ortografía, números y correcciones.

Habla en varios idiomas

Enruta mediante rutas de audio y voz multilingües cuando sea necesario.

Prompts largos

Usa rutas de razonamiento más potentes cuando el comportamiento no puede reducirse a una sola regla.

Latencia, calidad y costo

Una respuesta incorrecta más rápida no mejora la llamada.

La IA telefónica debe responder rápido, pero la velocidad sin precisión solo genera errores rápidamente. Los LLM actuales necesitan un momento para razonar y mantenerse confiables, por lo que ThunderPhone equilibra ambos aspectos según el nivel.

Spark
~3s
hasta la primera respuesta
Bolt
~2s
hasta la primera respuesta
Storm
~2–3s
~2 s con confirmaciones · ~3 s sin confirmaciones
MediciónOtros proveedores afirman tener una latencia de 500 ms en condiciones ideales, pero normalmente alcanzan alrededor de 2 s en una llamada real.Medimos nuestra latencia en condiciones reales.
ResilienciaLos proveedores de IA experimentan picos de latencia que pueden desviar las llamadas.La plataforma orquestada de ThunderPhone cambia a opciones más rápidas cuando esto ocurre.
Generaciones de IA de voz

La próxima generación de IA de voz está aquí

Las llamadas telefónicas automatizadas han sido experiencias frustrantes... hasta ahora. Cada ola de tecnología ha mejorado la experiencia, pero nunca hasta lograr una experiencia realmente fluida. Eso cambia con ThunderPhone.

1990s2010s20242026 · ahora
Generación 1

IVR

Presiona uno para ventas, presiona dos para soporte. Los menús solo pueden dirigir.

Generación 2

Bots de intención

Di “ventas” o “facturación” y espera que el analizador de campos lo capte.

Generación 3

IA de tres pasos

Transcribe, consulta un LLM rápido y luego habla; cada paso confía en el anterior.

Generación 4

IA integrada

Audio, texto, razonamiento, herramientas, voces y límites de seguridad como un solo sistema.

Creado para las llamadas que arruinan todo lo demás

Conoce la plataforma integral
en tus llamadas más difíciles.

En funcionamiento en diez minutos. Desde 2¢/min.