Technologie

Gehen Sie über die 3-Stufen-Pipeline hinaus.

Die meisten Sprach-KI-Plattformen setzen auf eine 3-Stufen-Pipeline: ein Transkriptionsmodell, ein nicht denkendes LLM und eine Text-zu-Sprache-Engine. Jeder Schritt ist ein einzelner Fehlerpunkt. ThunderPhone reduziert Fehler, indem es viele Modelle gleichzeitig orchestriert.

Anrufer sagte „Ich miete.“
ASR A„Ich miete“
ASR B„Mieke“
Audio-LLM„Ich miete“
Abgeglichen „Ich miete“ 2 von 3 Pfaden stimmen überein
Die integrierte Architektur

Auf viele Arten hören, dann abgleichen.

ThunderPhone orchestriert viele Modelle gleichzeitig, damit sie die Fehler der anderen korrigieren können.

Andere Plattformen · 3-stufige Pipeline

Jeder Schritt vertraut dem vorherigen.

Anruferaudio
„Ich miete.“ · genuschelt
STT A
„Mieke“
STT B
Audio-LLM
Kein Backup, wenn das einzelne Modell etwas falsch versteht
LLM
Ein schnelles Modell sieht nur das Transkript.
→ antwortet „Hallo, Mieke — wie kann ich helfen?“
Schnelle LLMs machen Fehler beim Befolgen von Anweisungen
TTS
Die Antwort wird vorgelesen.
→ sagt „Hallo, Mieke — wie kann ich helfen?“ ✗
1 Transkript + 1 LLM = falsche Antwort
ThunderPhone · orchestriert

Viele Pfade, eine koordinierte Antwort.

Anruferaudio
„Ich miete.“ · genuschelt
STT A
„Ich miete“
STT B
„Mieke“
Audio-LLM
„Ich miete“
Drei Transkripte + Roh-Audio als Nachweis gespeichert
Schlussfolgerungsebene
Schnelle und denkende LLMs bewerten Text- und Audiohinweise.
→ 2 von 3 Pfaden stimmen überein: „Ich miete“
Denkende und schnelle LLMs prüfen sich vor der Antwort gegenseitig
TTS
Ausgewählte Stimmen minimieren Halluzinationen bei Schreibweisen und alphanumerischen Zeichenfolgen.
→ „Verstanden — Sie mieten also.“ ✓
Erfasst selbst anspruchsvolle Details beim ersten Mal korrekt.
Leistungsnachweis

Storm stellt Intelligenzrekorde bei Big Bench Audio auf.

BBA testet, ob ein Modell gesprochene Eingaben verstehen und schwierige Fragen korrekt beantworten kann. Unsere stärkste Storm-Konfiguration erreicht 99,4 % in unserem öffentlichen Evaluierungsdatensatz — 0,6 % Fehler, 4× weniger als der nächstbeste öffentliche Wert.

Modell
Fehlerquote↓ niedriger ist besser
Punktzahl
ThunderPhone Storm · Extra Intelligence4× weniger Fehler
0.6%
Step-Audio R1.1
2.4%
Grok Voice Think Fast
2.9%
Ultravox v0.7 Thinking
3.0%
GPT-Realtime-2 High
3.4%
Gemini 3.1 Flash Live High
3.4%
Den BBA-Storm-Evaluierungsdatensatz auf Hugging Face ansehen

Die Fehlerquote entspricht 100 % minus der BBA-Erfolgsquote. Das Ergebnis von ThunderPhone stammt aus unserem öffentlichen Evaluierungsdatensatz, der oben verlinkt ist; andere öffentliche Werte (Artificial Analysis Leaderboard) sind zur Orientierung aufgeführt. BBA erfasst die Leistung bei Telefonaten nicht vollständig, ist aber ein nützliches Signal für das Schlussfolgern anhand gesprochener Eingaben.

Vorgegeben schlägt konfigurierbar

Sie sollten keinen Sprach-Stack von Hand zusammenstellen müssen.

Andere Sprach-KI-Plattformen wie Vapi, Retell, Pipecat und LiveKit zwingen Sie zu umfangreichen Konfigurationsentscheidungen, damit Ihre Anrufe funktionieren. Bei ThunderPhone sind wir überzeugt: Abstimmung ist unsere Aufgabe, und Sie sollten so wenig Arbeit wie möglich investieren müssen, damit Ihre Anrufe reibungslos funktionieren.

Andere Sprach-KI-Plattformen · viele Stellschrauben
STT LLM TTS Endpunkterkennung Rauschunterdrückung Unterbrechungen Fallbacks Werkzeug-Schema Latenz VAD
ThunderPhone stimmt all das für Sie ab
ThunderPhone · drei Entscheidungen
1
Tarif auswählen
Spark, Bolt oder Storm.
2
Stimme auswählen
Kuratierte Stimmen, in echten Anrufen getestet.
3
Verfassen Sie Ihren Prompt
Verhalten, Richtlinien, Tools — in klarer Sprache.
Drei Entscheidungen. Das ist die Einrichtung — Orchestrierung, Fallbacks und Abstimmung sind integriert.
Wir wählen die besten Modelle für die Aufgabe aus und verbinden sie miteinander. Spitzenmodelle von OpenAI, Anthropic und Google arbeiten mit Open-Source-Modellen zusammen — orchestriert für die beste Leistung und den besten Preis bei jedem Anruf, sodass Sie sich nicht darum kümmern müssen.
Ein Prompt, weniger Graphen-Wildwuchs

Ein Prompt, kein Graph aus Knoten.

Flow-Builder gibt es, weil schwächere Systeme komplexen Prompts nicht folgen können. Jeder Gesprächsschritt wird zu einem Knoten, den Sie manuell erstellen und pflegen müssen. Storm befolgt umfassende Anweisungen aus einem einzigen Prompt, sodass Sie sich nicht um Knoten und Kanten kümmern müssen.

Flow-Builder-Plattformen

Jeden Zweig manuell verdrahten.

BegrüßungPrompt · Stimme
Telefonnummer erfassenPrompt · Validierung
Telefonnummer bestätigenerneuter Prompt ×2
enroll()Tool · Wiederholungsversuche
Eskalierenan einen Menschen
AusweichoptionAuffangregel
ungültig ×2Fehler
Sechs Knoten für einen Anmeldeablauf — jeder mit eigenen Prompts, Tools, Übergängen und Fehlerbehandlung.
ThunderPhone Storm

Beschreiben Sie das Verhalten einmal.

Verhaltens-Prompt
Begrüßen Sie den Anrufer und erfassen Sie seinen Namen und seine Telefonnummer.
Bestätigen Sie die Einwilligung vor der Anmeldung — erforderlich.
Wenn nach der Abrechnung gefragt wird, folgen Sie der untenstehenden Abrechnungsrichtlinie.
Rufen Sie enroll() erst auf, wenn jedes Feld bestätigt ist.
Wenn der Anrufer nach einer Person fragt, leiten Sie an einen Menschen weiter.
Komplexe Verzweigungen Optionale Watchdogs Einfachere Iteration
Ein Prompt zum Schreiben, Testen und Iterieren — inklusive Verzweigungen.
Warum das wichtig ist

Echte Anrufe sind unübersichtlich. ThunderPhone ist bereit.

Genuschelte Sprache, Hintergrundgespräche, Namen und Zahlen, gemischte Sprachen — ThunderPhone ist für Situationen entwickelt, an denen andere Systeme scheitern.

Undeutliche Sprache

Vergleichen Sie Audio- und Textsignale, statt einer einzelnen Transkription zu vertrauen.

Schlechte Telefonqualität

Modelle zur Geräuscherkennung und -reduzierung bereinigen das Signal.

Hintergrundgespräche

Erkennen Sie Nebengespräche, bevor sie den Sprachagenten aus der Bahn werfen.

Namen & Adressen

Prüfen Sie Eigennamen, Schreibweisen, Zahlen und Korrekturen gegeneinander.

Mehrsprachige Sprache

Leiten Sie bei Bedarf über mehrsprachige Audio- und Sprachpfade weiter.

Lange Prompts

Nutzen Sie stärkere Schlussfolgerungspfade, wenn sich Verhalten nicht auf eine Regel reduzieren lässt.

Latenz, Qualität & Kosten

Eine schnellere falsche Antwort macht keinen besseren Anruf.

Sprach-KI muss schnell antworten — doch Geschwindigkeit ohne Korrektheit liefert nur schnelle Fehler. Die heutigen LLMs brauchen einen Moment zum Denken, um zuverlässig zu bleiben. Deshalb balanciert ThunderPhone beides je Tarifstufe aus.

Spark
~3s
bis zur ersten Antwort
Bolt
~2s
bis zur ersten Antwort
Storm
~2–3s
~2 s mit Bestätigungen · ~3 s ohne
MessungAndere Anbieter behaupten eine Latenz von 500 ms unter Idealbedingungen, liegen bei einem echten Anruf aber meist bei rund 2 s.Wir messen unsere Latenz unter realen Bedingungen.
AusfallsicherheitKI-Anbieter erleben Latenzspitzen, die Anrufe aus der Bahn werfen können.Der orchestrierte Stack von ThunderPhone wechselt zu schnelleren Optionen, wenn das passiert.
Generationen der Sprach-KI

Die nächste Generation der Sprach-KI ist da

Automatisierte Telefonate waren frustrierende Erlebnisse ... bis jetzt. Jede Technologiewelle hat das Erlebnis verbessert, aber nie so weit, dass es wirklich reibungslos war. Das ändert sich mit ThunderPhone.

1990s2010s20242026 · jetzt
Generation 1

IVR

Drücken Sie die Eins für den Vertrieb, die Zwei für den Support. Menüs können nur weiterleiten.

Generation 2

Intent-Bots

Sagen Sie „Vertrieb“ oder „Abrechnung“ und hoffen Sie, dass der Slot-Parser es erkennt.

Generation 3

Dreistufige KI

Transkribieren, ein schnelles LLM fragen, dann sprechen – jeder Schritt vertraut dem vorherigen.

Generation 4

Integrierte KI

Audio, Text, Schlussfolgern, Tools, Stimmen und Leitplanken in einem System.

Entwickelt für die Anrufe, an denen alles andere scheitert

Erleben Sie den integrierten Stack
bei Ihren anspruchsvollsten Anrufen.

Live in zehn Minuten. Ab 2 ¢/Min.