Technologie

Sprach-KI
jenseits der 3-stufigen Pipeline.

Die meisten Sprach-KI-Plattformen setzen auf eine 3-stufige Pipeline: ein Transkriptionsmodell, ein LLM ohne Reasoning und eine Text-to-Speech-Engine. Jeder Schritt ist ein Single Point of Failure. ThunderPhone reduziert Fehler, indem es viele Modelle gleichzeitig orchestriert.

Der Anrufer sagte: „Ich miete.“
ASR A„Ich miete“
ASR B„Mieke“
Audio-LLM„Ich miete“
Abgleich ergibt „Ich miete“2 von 3 Pfaden stimmen überein

Mehrfach hinhören,
dann abgleichen.

ThunderPhone orchestriert zahlreiche Modelle parallel und lässt sie die Fehler der jeweils anderen korrigieren.

Anrufer sagt genuschelt: „Ich miete.“
Andere Plattformen3-stufige Pipeline
Hört einmal hin
STT „Mieke“
Kein Sicherheitsnetz, wenn das einzige Modell sich verhört
Antwortet schnell

Ein schnelles LLM sieht nur das Transkript.

Spricht

„Hallo, Mieke — wie kann ich helfen?“

1 Transkript + 1 LLM = falsche Antwort
ThunderPhoneOrchestriert
Hört auf drei Arten hin
„Ich miete“„Mieke“„Ich miete“
Drei Transkripte + Roh-Audio bleiben als Belege erhalten
Gleicht ab

Schnelle LLMs und Reasoning-LLMs gleichen ihre Ergebnisse ab: 2 von 3 Pfaden stimmen überein.

Spricht

„Verstanden — Sie mieten also.“

Versteht selbst knifflige Details auf Anhieb richtig.

Storm stellt bei Big Bench Audio Intelligenzrekorde auf.

BBA testet, ob ein Modell gesprochene Prompts versteht und schwierige Fragen richtig beantwortet. Unsere stärkste Storm-Konfiguration hält den Rekord – mit 99,4 % auf unserem öffentlichen Evaluationsset.

0.6% Fehlerquote

· Juli 2026Datensatz auf Hugging Face
ThunderPhoneStorm · Extra Intelligence0.6%
Qwen Audio 3.0Realtime Plus0.8%
Qwen3.5 OmniPlus Realtime1.3%
Step-Audio R1.1Realtime2.4%

Das Ergebnis von ThunderPhone stammt aus unserem oben verlinkten öffentlichen Evaluationsdatensatz; weitere öffentlich verfügbare Werte aus dem Leaderboard von Artificial Analysis dienen zur Orientierung.

Sie sollten Ihren Sprach-KI-Stack nicht von Hand zusammenbauen müssen.

Bei anderen Sprach-KI-Plattformen wie Vapi, Retell, Pipecat und LiveKit müssen Sie zahlreiche Entscheidungen zur Konfiguration treffen, bevor Ihre Telefonate überhaupt funktionieren. Wir bei ThunderPhone sind überzeugt: Tuning ist unser Job – und Ihr Aufwand sollte so gering wie möglich sein, damit Ihre Telefonate reibungslos laufen.

Andere Sprach-KI-PlattformenViele Stellschrauben
STTv4-largeSTT-FallbackLLMtemp 0.3LLM-FallbackTTSTTS-FallbackVAD0.62Endpointing240 msBarge-in-Schwelle−38 dBBackchannel-FilterUnterbrechungenTurn-Timeout800 msRauschunterdrückungJitter-Puffer60 msAbtastrate8 kHzTool-SchemaWiederholungslogik×3Fallbacks

ThunderPhone übernimmt das gesamte Tuning für Sie

ThunderPhoneDrei Entscheidungen
1
Tarif auswählen

Spark, Bolt oder Storm.

2
Stimme auswählen

Sorgfältig ausgewählt und in echten Anrufen getestet.

3
Prompt formulieren

Verhalten, Richtlinien und Tools – in Klartext.

Drei Entscheidungen. Mehr braucht es für die Einrichtung nicht – Orchestrierung, Fallbacks und Tuning sind bereits integriert.

Wir wählen die besten Modelle für die jeweilige Aufgabe aus und kombinieren sie. Spitzenmodelle von OpenAI, Anthropic und Google arbeiten dabei mit Open-Source-Modellen zusammen – bei jedem Anruf optimal auf Leistung und Preis abgestimmt, ohne dass Sie sich darum kümmern müssen.

Ein Prompt,
kein Graph aus Knoten.

Flow-Builder gibt es, weil schwächere Systeme komplexen Prompts nicht folgen können. Jeder Gesprächsschritt wird zu einem Knoten, den Sie manuell anlegen und pflegen müssen. Storm setzt detaillierte Anweisungen aus einem einzigen Prompt um, sodass Sie sich um Knoten und Kanten keine Gedanken machen müssen.

Flow-Builder-PlattformenJede Verzweigung manuell verdrahten
Begrüßung Prompt · Stimme
Telefonnummer erfassen Prompt · Validierung
Telefonnummer bestätigen erneuter Prompt ×2
enroll() Tool · Wiederholungsversuche
An einen Menschen weiterleiten
Allgemeiner Fallback ungültig ×2 · Fehler

Sechs Knoten für einen einzigen Anmeldeprozess – jeder mit eigenen Prompts, Tools, Übergängen und eigener Fehlerbehandlung.

ThunderPhone StormVerhalten nur einmal beschreiben
Verhaltens-Prompt

Begrüßen Sie den Anrufer und erfassen Sie seinen Namen und seine Telefonnummer. Lassen Sie sich vor der Anmeldung die Einwilligung bestätigen – zwingend erforderlich. Bei Fragen zur Abrechnung halten Sie sich an die folgende Abrechnungsrichtlinie. Rufen Sie enroll() erst auf, wenn alle Angaben bestätigt sind. Wenn der Anrufer mit einer Person sprechen möchte, leiten Sie ihn an einen Menschen weiter.

Komplexe VerzweigungenOptionale WatchdogsEinfacher iterieren

Ein Prompt, den Sie schreiben, testen und iterativ optimieren – alle Verzweigungen inklusive.

Im echten Einsatz sind Telefonate chaotisch. ThunderPhone ist darauf vorbereitet.

Undeutliche Aussprache, Stimmengewirr im Hintergrund, Namen und Zahlen, mehrere Sprachen im selben Gespräch – ThunderPhone wurde für genau die Situationen entwickelt, in denen andere Systeme scheitern.

Undeutliche Aussprache

Gleichen Sie Audio- und Textsignale miteinander ab, statt sich auf nur ein Transkript zu verlassen.

Schlechte Audioqualität am Telefon

Modelle zur Erkennung und Reduzierung von Störgeräuschen bereinigen das Signal.

Nebengespräche

Erkennen Sie Nebengespräche, bevor sie den Sprachagenten aus dem Takt bringen.

Namen & Adressen

Gleichen Sie Eigennamen, Schreibweisen, Zahlen und Korrekturen systematisch ab.

Sprachmix im Gespräch

Leiten Sie das Gespräch bei Bedarf über mehrsprachige Audio- und Sprachpfade.

Lange Prompts

Nutzen Sie leistungsfähigere Reasoning-Pfade, wenn sich Verhalten nicht mit einer einzigen Regel abbilden lässt.

Eine falsche Antwort macht das Telefonat nicht besser, nur weil sie schneller kommt.

Sprach-KI muss am Telefon schnell reagieren – doch wenn die Antwort falsch ist, führt mehr Tempo nur schneller zum Fehler. Aktuelle LLMs brauchen einen Moment zum Nachdenken, um zuverlässig zu arbeiten. Deshalb bringt ThunderPhone Latenz und Genauigkeit ins Gleichgewicht.

Spark~3sbis zur ersten Antwort
Bolt~2sbis zur ersten Antwort
Storm~2–3s~2 s mit Bestätigungen · ~3 s ohne
Messung

Andere Anbieter werben unter Idealbedingungen mit 500 ms Latenz, brauchen in echten Telefongesprächen jedoch meist rund 2 s. Wir messen unsere Latenz unter realen Bedingungen.

Ausfallsicherheit

Bei KI-Anbietern treten Latenzspitzen auf, die den Gesprächsverlauf erheblich stören können. Der orchestrierte Stack von ThunderPhone schaltet in solchen Fällen auf schnellere Alternativen um.

Die nächste Generation der Sprach-KI ist da.

Automatisierte Telefonate waren bislang vor allem eines: frustrierend. Jede neue Generation hat das Erlebnis verbessert – wirklich reibungslos wurde es trotzdem nie. Mit ThunderPhone ändert sich das.

1990sGeneration 1

IVR

„Drücken Sie die Eins für den Vertrieb, die Zwei für den Support.“ Menüs können Anrufe nur weiterleiten.

2010sGeneration 2

Intent-Bots

Sagen Sie „Vertrieb“ oder „Abrechnung“ – und hoffen Sie, dass der Slot-Parser die Angabe richtig zuordnet.

2024Generation 3

Dreistufige KI

Transkribieren, ein schnelles LLM befragen, dann sprechen – und bei jedem Schritt auf den vorherigen vertrauen.

2026 · heuteGeneration 4

Integrierte KI

Audio, Text, Reasoning, Tools, Stimmen und Schutzmechanismen in einem System.

Für Anrufe entwickelt, an denen alles andere scheitert

Stellen Sie unseren integrierten Stack bei Ihren anspruchsvollsten Anrufen auf die Probe.

In zehn Minuten live. Ab 2 ¢/Min.