Megérkezett a ThunderPhone 2.0.Önkiszolgáló használat már 2 cent/perctől.Olvassa el a bejelentést
Összes bejegyzés

Első benyomásaink a GPT-Live-1 hangalapú AI-ügynökökhöz készült API-járól

2026. szeptember 12.Alex Kolchinski

Az OpenAI két napja tette elérhetővé az API-ban a GPT-Live-1-et, új, teljes duplex hangmodelljét. Éles környezetben építünk és üzemeltetünk AI telefonos ügynököket, ezért egy valódi telefonszámra kötöttük, és felhívtuk. Sokszor.

Egy biztosítási ügyfelünktől származó, körülbelül 13 000 tokenes, meleg leadek minősítésére szolgáló szkripttel teszteltük, amely kötelezően szó szerint felolvasandó sorokat, szigorú visszaolvasási szabályokat és elágazó utánkövető kérdéseket tartalmazott. Egy hosszú nap alatt tucatnyi valódi telefonhívást, körülbelül 25 szimulált interjút és strukturálatlan tesztek egy csoportját futtattuk le.

Ezek az első benyomásaink, átiratokkal és hanganyaggal. Hamarosan részletesebb beszámolóval is jelentkezünk.

Az átiratok a teszthívásainkból származnak, a GPT-Live átírásában. Megváltoztattuk a neveket és az azonosításra alkalmas megfogalmazásokat, rövidítettük a párbeszédeket, és összevontuk a szétválasztott töredékeket. Az időbélyegek a hívás kezdetétől számított másodpercekben értendők, és az eredeti felvételekből származnak.

Kivételesen természetes

A GPT-Live-1 a legtermészetesebben hangzó társalgó rendszer, amelyet valaha telefonvonalra tettünk. Ez valódi előrelépés.

Egyetlen folyamatos hangfolyamon hallgat és beszél, külön átírási és beszédszintézis-szakaszok nélkül. A beszélgetés mechanikájának nagy része egyszerűen működik. A hívók átlagosan körülbelül 1,3 másodperccel azután hallották az első hangját, hogy abbahagyták a beszédet, illetve telefonos kapcsolat nélkül körülbelül 0,7 másodperc után. Nem adtunk hozzá sem hangtevékenység-észlelést, sem beszédváltási logikát. Elegánsan kezeli a félbeszakításokat, természetes visszajelzéseket ad („Mm-hmm”), és lendületes, emberhez hasonló tempóban beszél.

Amikor felolvasandó sorok helyett célokat kap, a kérdéseket a beszélgetéshez igazítja, és gördülékenyen kezeli a helyesbítéseket:

Caller · 47.0Um, no, it's nine twenty, uh, seventy
Agent · 49.9Thanks for clarifying. So, September twentieth, nineteen seventy, right?
Caller · 56.5Yeah
Agent · 56.7Thanks. Pulling that up. Are you still renting your home?
Caller · 64.5Uh, not anymore now. I uh own my home now
Agent · 67.4Thanks, so you own your home. Is that a house, a condo, or a mobile home?

A helyesbítések, félbeszakítások vagy a válaszukat hívás közben megváltoztató hívók során egyszer sem veszítette el a nyugalmát. Ha a természetesség lenne az egész feladat, ez a bejegyzés itt véget is érne. Sajnos azonban ennél többről van szó.

Nem követi megbízhatóan az utasításokat

A GPT-Live-1 nem követi megbízhatóan azokat az utasításokat, amelyek fontosak egy szkriptelt telefonhívás során.

Többször is úgy reagált egy egyértelmű „igen”-re, mintha a válasz „nem” lett volna: újra feltette a kérdést, vagy úgy lépett tovább, mintha a hívó elutasította volna azt.

A legkövetkezetesebb hiba az volt, hogy túlságosan szó szerint vette az utasításokat. A promptunk szerint: ha a hívó azt mondja, hogy a nyilvántartásban szereplő lakhatási státusz hibás, kérdezze meg, hogy saját tulajdonú ingatlanban él-e, bérel-e, vagy a szüleivel lakik. Egy hívó azt mondta: „nem, most már az enyém”, ami már meg is válaszolja ezt a kérdést. A modell ennek ellenére felolvasta a lehetőségeket:

Agent · 70.0...you listed as renting your home. Is that still correct?
Caller · 75.1Um, no, I own it now
Agent · 76.6Now, do you own your home, rent your home, live with your parents, or have some other housing situation?

Néhány korai furcsaság a mi promptunk hibája volt, de ez a szó szerinti értelmezés minden általunk kipróbált promptváltozatban megmaradt. Minden olyan választ, amelyet nem írtunk le előre, inkább gépiesen, mint józanul kezelt.

Néha nyomás alatt hangosan gondolkodik is:

Agent · 96.3Thanks. One moment.
Agent · 98.0Hmm. Handling this one carefully.
Agent · 101.4I'll acknowledge it and move on.
Agent · 107.1Thanks. And just to confirm, you're married, right?

A számok és alfanumerikus karakterek kockázatosak

A betűzéseknek, címeknek, születési dátumoknak és azonosítószámoknak pontosnak kell lenniük. A GPT-Live-1 beszédében ezen a területen tapasztaltuk a legtöbb problémát.

Alfanumerikus karakterláncokban karaktereket hagyott ki és cserélt fel. Itt egy kitalált kárszámot olvas fel; a klipeken a csend levágásán kívül semmit sem módosítottunk. Angolul az átirata helyes volt, de a hang egy „Y”-t is hozzáadott:

Told to say8KD2 - QX7B - M4V9
Actually said8KD2 - QXY7B - M4V9
extra "Y"
GPT-Live-1 · EnglishKárszám visszaolvasása, módosítatlan kimenet
0:00 / 0:08

Oroszul még rosszabb volt: a „Q” mind a hangban, mind az átiratában „X”-szé vált.

Told to say8KD2 - QX7B - M4V9
Actually saidвосемь кэй дэ два, тире, икс икс семь бэ, тире, эм четыре вэ девять
Which is8KD2 - XX7B - M4V9
"Q" became "X"
GPT-Live-1 · RussianUgyanaz a kód, oroszul felolvasva
0:00 / 0:08

A dátumoknál is ugyanez a probléma jelentkezett. Egy hívó számjegyekkel adta meg a születési dátumát, amelyet a modell később számként olvasott vissza:

Caller · 159.7Uh five five ninety five
Caller · 192.8Wait, what did you get uh, Roberto's birthday as
Agent · 197.2So that's fifty-five ninety-five?
Caller · 203.6Oh what are you talking about
Caller · 210.2I don't know what you mean by fifty five ninety five, that's not a birthday

Időnként olyan mondatot is kimond, amely a hívóhoz tartozik:

Agent · 74.7Do you currently have car insurance?
Agent · 78.5Do you currently I do.
Caller · 79.4I do

Akcentusok más nyelveken

Az új hangmodelleket a termékünk által támogatott mind a 47 nyelven teszteljük. A GPT-Live-1 orosz nyelve folyékony volt, de erős amerikai akcentussal beszélt (miközben az éles környezetben használt TTS-hangjaink jellemzően anyanyelvinek hangzanak):

Здравствуйте! Меня зовут Катя, я виртуальный агент вашей автостраховой. Лицензированный специалист скоро подключится, а пока, не против ли вы, если я задам пару вопросов, чтобы ускорить оформление полиса?
GPT-Live-1 · Russian greetingKatya megnyitja a hívást
0:00 / 0:13

A lugandát is kipróbáltuk. Az első hívásnál ehelyett szuahéliül válaszolt. A másodiknál lugandául beszélt, természetesebben, mint amit egy általános modelltől vártunk, de ismét erős amerikai akcentussal. Nem teszteltünk minden nyelvet, de várakozásaink szerint az akcentus mintázata valószínűleg általánosítható. Ez nem számít egy kizárólag angol nyelvű ügynök esetében, más nyelveket használó felhasználási eseteknél azonban meglehetősen jelentős fenntartás.

Néhány fontos API-korlátozás

Az ezen a héten feltárt eredményeink alapján néhány API-korlátozás fontos egy valódi ügynök számára:

  • Az utasítások a munkamenet indulása után nem módosíthatók, és legfeljebb 16 384 token hosszúak lehetnek.
  • A kimeneti hang streamelése sosem áll le — a csend is streamelve van — ezért a „hang leállt” nem használható körvége-jelzésként olyan felhasználási esetekben, amelyeknél a körök szegmentálására van szükség.
  • Csak az új v1/live/sessions végponton keresztül érhető el, és az ellenőrzésünkkor még nem volt elérhető Azure-on.

Eddigi benyomásunk

Az éles telefonos AI-ügynököknek természetesen kell hangzaniuk, és következetesen kell követniük a szkripteket. A GPT-Live-1 az előbbiben lenyűgöző, az utóbbival azonban komoly problémái vannak. Az idő múlásával további teszteket végzünk, és továbbra is beszámolunk az eredményeinkről.