ThunderPhone 2.0 ist live.Direkt im Self-Service – ab 2 ¢/Min..Ankündigung lesen
Alle Beiträge

Unsere ersten Eindrücke von der GPT-Live-1-API für Sprachagenten

12. September 2026Alex Kolchinski

OpenAI hat GPT-Live-1, sein neues Full-Duplex-Sprachmodell, vor zwei Tagen für die API veröffentlicht. Wir entwickeln und betreiben KI-Telefonagenten in der Produktion, also haben wir es an eine echte Telefonnummer angeschlossen und angerufen. Oft.

Wir haben es mit einem etwa 13.000 Token langen Qualifizierungsskript für warme Leads eines unserer Versicherungskunden getestet – mit vorgeschriebenen wörtlichen Formulierungen, strikten Regeln zum Wiederholen und verzweigten Nachfragen. An einem langen Tag führten wir ein Dutzend echte Telefonate, etwa 25 simulierte Interviews und eine Reihe unstrukturierter Tests durch.

Das sind unsere ersten Eindrücke – mit Transkripten und Audio. Eine ausführlichere Analyse folgt in Kürze.

Die Transkripte stammen aus unseren Testanrufen und wurden von GPT-Live transkribiert. Wir haben Namen und identifizierende Formulierungen geändert, Gesprächsausschnitte gekürzt und getrennte Fragmente zusammengeführt. Die Zeitstempel in Sekunden ab Anrufbeginn stammen aus den Originalen.

Die Natürlichkeit ist außergewöhnlich

GPT-Live-1 ist der natürlichste Gesprächspartner, den wir bisher an eine Telefonleitung angeschlossen haben. Das ist ein echter Fortschritt.

Es hört zu und spricht über einen durchgehenden Audiostream, ohne getrennte Transkriptions- und Syntheseschritte. Die meisten Gesprächsmechaniken funktionieren einfach. Anrufer hörten die erste Audioausgabe im Median etwa 1,3 Sekunden, nachdem sie aufgehört hatten zu sprechen, beziehungsweise rund 0,7 Sekunden ohne die Telefonverbindung. Wir haben weder Spracherkennung noch Logik für Sprecherwechsel ergänzt. Es geht souverän mit Unterbrechungen um, erzeugt natürliche Rückmeldungen wie „Mm-hmm“ und spricht in einem zügigen, menschlich wirkenden Tempo.

Wenn man ihm Ziele statt abzulesender Formulierungen gibt, passt es Fragen an das Gespräch an und nimmt Korrekturen gelassen auf:

Caller · 47.0Um, no, it's nine twenty, uh, seventy
Agent · 49.9Thanks for clarifying. So, September twentieth, nineteen seventy, right?
Caller · 56.5Yeah
Agent · 56.7Thanks. Pulling that up. Are you still renting your home?
Caller · 64.5Uh, not anymore now. I uh own my home now
Agent · 67.4Thanks, so you own your home. Is that a house, a condo, or a mobile home?

Bei Korrekturen, Unterbrechungen oder wenn Anrufer ihre Antworten mitten im Gespräch änderten, verlor es nie die Fassung. Wäre Natürlichkeit die ganze Aufgabe, würde dieser Beitrag hier enden. Leider gehört mehr dazu.

Es befolgt Anweisungen nicht zuverlässig

GPT-Live-1 befolgt Anweisungen bei den Verhaltensweisen, die für ein skriptbasiertes Telefonat entscheidend sind, nicht zuverlässig.

Mehr als einmal reagierte es auf ein eindeutiges „Ja“, als wäre die Antwort „Nein“ gewesen, stellte die Frage erneut oder machte weiter, als hätte der Anrufer abgelehnt.

Der beständigste Fehler war, Anweisungen zu wörtlich zu nehmen. Unser Prompt lautete: Wenn der Anrufer sagt, dass der hinterlegte Wohnstatus falsch ist, fragen Sie, ob er Eigentümer ist, mietet oder bei seinen Eltern wohnt. Ein Anrufer sagte: „Nein, ich besitze es jetzt“, womit diese Frage bereits beantwortet war. Das Modell las trotzdem das Menü vor:

Agent · 70.0...you listed as renting your home. Is that still correct?
Caller · 75.1Um, no, I own it now
Agent · 76.6Now, do you own your home, rent your home, live with your parents, or have some other housing situation?

Einige frühe Merkwürdigkeiten gingen auf unser Prompt zurück, doch die Wörtlichkeit blieb bei jeder Prompt-Variante bestehen, die wir ausprobierten. Jede Antwort, die wir nicht ausdrücklich vorgegeben hatten, wurde mechanisch statt sinnvoll behandelt.

Unter Druck denkt es manchmal auch laut nach:

Agent · 96.3Thanks. One moment.
Agent · 98.0Hmm. Handling this one carefully.
Agent · 101.4I'll acknowledge it and move on.
Agent · 107.1Thanks. And just to confirm, you're married, right?

Zahlen und alphanumerische Zeichen sind riskant

Schreibweisen, Adressen, Geburtsdaten und ID-Nummern müssen exakt sein. Genau hier hat GPT-Live-1 die meisten Probleme bei der Sprachausgabe.

Wir haben erlebt, dass Zeichen in alphanumerischen Zeichenfolgen ausgelassen oder ersetzt wurden. Hier liest es eine erfundene Schadennummer vor; die Clips sind abgesehen vom Kürzen von Stille unverändert. Auf Englisch war das Transkript korrekt, aber im Audio wurde ein „Y“ hinzugefügt:

Told to say8KD2 - QX7B - M4V9
Actually said8KD2 - QXY7B - M4V9
extra "Y"
GPT-Live-1 · EnglischWiederholung der Schadennummer, unveränderte Ausgabe
0:00 / 0:08

Auf Russisch war es schlimmer: Das „Q“ wurde sowohl im Audio als auch im Transkript zu einem „X“.

Told to say8KD2 - QX7B - M4V9
Actually saidвосемь кэй дэ два, тире, икс икс семь бэ, тире, эм четыре вэ девять
Which is8KD2 - XX7B - M4V9
"Q" became "X"
GPT-Live-1 · RussischDerselbe Code, auf Russisch vorgelesen
0:00 / 0:08

Bei Datumsangaben trat dasselbe Problem auf. Ein Anrufer nannte ein Geburtsdatum als Ziffern, das das Modell später als Zahl vorlas:

Caller · 159.7Uh five five ninety five
Caller · 192.8Wait, what did you get uh, Roberto's birthday as
Agent · 197.2So that's fifty-five ninety-five?
Caller · 203.6Oh what are you talking about
Caller · 210.2I don't know what you mean by fifty five ninety five, that's not a birthday

Gelegentlich spricht es auch eine Zeile, die zum Anrufer gehört:

Agent · 74.7Do you currently have car insurance?
Agent · 78.5Do you currently I do.
Caller · 79.4I do

Akzente in anderen Sprachen

Wir testen neue Sprachmodelle in allen 47 Sprachen, die unser Produkt unterstützt. Das Russische von GPT-Live-1 war flüssig, hatte jedoch einen starken amerikanischen Akzent, während die TTS-Stimmen, die wir in der Produktion einsetzen, normalerweise muttersprachlich klingen:

Здравствуйте! Меня зовут Катя, я виртуальный агент вашей автостраховой. Лицензированный специалист скоро подключится, а пока, не против ли вы, если я задам пару вопросов, чтобы ускорить оформление полиса?
GPT-Live-1 · Russische BegrüßungKatja eröffnet das Gespräch
0:00 / 0:13

Wir haben auch Luganda ausprobiert. Beim ersten Anruf antwortete es stattdessen auf Swahili. Beim zweiten sprach es Luganda, natürlicher als wir es von einem allgemeinen Modell erwartet hatten, aber erneut mit einem starken amerikanischen Akzent. Wir haben nicht jede Sprache getestet, erwarten jedoch, dass sich dieses Akzentmuster wahrscheinlich verallgemeinern lässt. Für einen ausschließlich englischsprachigen Agenten spielt das keine Rolle, für Anwendungsfälle in anderen Sprachen ist es jedoch ein ziemlich bedeutender Vorbehalt.

Einige wichtige API-Einschränkungen

Basierend auf unseren Erkenntnissen dieser Woche sind für einen echten Agenten einige API-Einschränkungen relevant:

  • Anweisungen sind nach Beginn der Sitzung unveränderlich und auf 16.384 Token begrenzt.
  • Die Ausgabe-Audiodaten werden nie nicht mehr gestreamt — auch Stille wird gestreamt — daher kann „Audio gestoppt“ nicht als Signal für das Ende eines Sprecherturns bei Anwendungsfällen dienen, die Sprecherturns segmentieren müssen.
  • Es ist nur über den neuen Endpunkt v1/live/sessions erreichbar und war zum Zeitpunkt unserer Prüfung noch nicht auf Azure verfügbar.

Unser bisheriger Eindruck

Telefonagenten für den Produktionseinsatz müssen natürlich klingen und Skripte zuverlässig befolgen. GPT-Live-1 ist beim Ersteren beeindruckend, hat beim Letzteren jedoch einige schwerwiegende Probleme. Wir werden im Laufe der Zeit weitere Tests durchführen und weiterhin über unsere Erkenntnisse berichten.