వాయిస్ ఏజెంట్ల కోసం GPT-Live-1 APIపై మా తొలి అభిప్రాయాలు
OpenAI తన కొత్త ఫుల్-డుప్లెక్స్ వాయిస్ మోడల్ GPT-Live-1ను రెండు రోజుల క్రితం APIకి విడుదల చేసింది. మేము ప్రొడక్షన్లో AI ఫోన్ ఏజెంట్లను నిర్మించి నిర్వహిస్తున్నాము కాబట్టి, దాన్ని ఒక నిజమైన ఫోన్ నంబర్పై ఉంచి కాల్ చేశాము. చాలా సార్లు.
మా ఇన్సూరెన్స్ కస్టమర్లలో ఒకరి నుంచి వచ్చిన సుమారు 13,000-టోకెన్ల వార్మ్-లీడ్ అర్హత స్క్రిప్ట్తో దీన్ని పరీక్షించాము. ఇందులో పదేపదే తప్పక చెప్పాల్సిన లైన్లు, కఠినమైన తిరిగి చదివి నిర్ధారించే నియమాలు, శాఖలుగా విడిపోయే ఫాలో-అప్లు ఉన్నాయి. ఒక సుదీర్ఘ రోజు వ్యవధిలో, మేము డజను నిజమైన ఫోన్ కాల్లు, దాదాపు 25 సిమ్యులేటెడ్ ఇంటర్వ్యూలు, అలాగే నిర్మాణం లేని పరీక్షల బ్యాచ్ నిర్వహించాము.
ట్రాన్స్క్రిప్ట్లు మరియు ఆడియోతో కూడిన మా తొలి అభిప్రాయాలు ఇవి. మరింత లోతైన వివరాలు త్వరలో వస్తాయి.
ట్రాన్స్క్రిప్ట్లు మా టెస్ట్ కాల్లవి, వీటిని GPT-Live ట్రాన్స్క్రైబ్ చేసింది. మేము పేర్లు, గుర్తింపు తెలిపే పదబంధాలను మార్చాము, సంభాషణలను కుదించాము, విడిపోయిన భాగాలను కలిపాము. కాల్ ప్రారంభం నుంచి సెకన్లలో ఉన్న టైమ్స్టాంప్లు అసలైన వాటివే.
సహజత్వం అసాధారణంగా ఉంది
ఫోన్ లైన్పై మేము ఉంచిన వాటిలో GPT-Live-1 అత్యంత సహజంగా వినిపించే సంభాషణకర్త. ఇది నిజమైన ముందడుగు.
వేర్వేరు ట్రాన్స్క్రిప్షన్, సింథసిస్ దశలు లేకుండా, ఇది ఒకే నిరంతర ఆడియో స్ట్రీమ్లో వింటుంది మరియు మాట్లాడుతుంది. సంభాషణలోని చాలా యాంత్రిక అంశాలు సరిగ్గా పనిచేస్తాయి. కాలర్ మాట్లాడటం ఆపిన తర్వాత, దాని మొదటి ఆడియోను కాలర్లు సగటున 1.3 సెకన్లలో విన్నారు, లేదా ఫోన్ లెగ్ లేకుండా దాదాపు 0.7 సెకన్లలో. మేము ఎలాంటి వాయిస్-యాక్టివిటీ డిటెక్షన్ లేదా టర్న్-టేకింగ్ లాజిక్ జోడించలేదు. ఇది అంతరాయాలను సునాయాసంగా నిర్వహిస్తుంది, సహజమైన ప్రతిస్పందన ధ్వనులను ("మ్-హ్మ్") ఉత్పత్తి చేస్తుంది, అలాగే చురుకైన, మనిషిలాంటి వేగంతో మాట్లాడుతుంది.
చదవాల్సిన లైన్లకంటే లక్ష్యాలను ఇచ్చినప్పుడు, ఇది ప్రశ్నలను సంభాషణకు అనుగుణంగా మలుస్తుంది మరియు సవరణలను సులభంగా స్వీకరిస్తుంది:
సవరణలు, అంతరాయాలు లేదా కాల్ మధ్యలో కాలర్లు తమ సమాధానాలను మార్చినప్పటికీ ఇది ఎప్పుడూ సమతుల్యత కోల్పోలేదు. సహజత్వమే మొత్తం పని అయితే, ఈ పోస్ట్ ఇక్కడితో ముగిసేది. దురదృష్టవశాత్తూ, విషయం అంతకంటే ఎక్కువగా ఉంది.
ఇది సూచనలను విశ్వసనీయంగా అనుసరించదు
స్క్రిప్ట్ చేసిన ఫోన్ కాల్కు ముఖ్యమైన ప్రవర్తనల విషయంలో GPT-Live-1 సూచనలను విశ్వసనీయంగా అనుసరించదు.
ఒకటి కంటే ఎక్కువసార్లు, స్పష్టమైన "అవును" సమాధానాన్ని "కాదు" అన్నట్లుగా పరిగణించి, ప్రశ్నను మళ్లీ అడిగింది లేదా కాలర్ తిరస్కరించినట్లుగా తదుపరి దశకు వెళ్లింది.
సూచనలను అతిగా అక్షరాలా తీసుకోవడమే అత్యంత స్థిరమైన వైఫల్యం. మా prompt ఇలా చెప్పింది: ఫైల్లోని నివాస స్థితి తప్పు అని కాలర్ చెబితే, వారు ఇల్లు కలిగి ఉన్నారా, అద్దెకు ఉంటున్నారా, లేదా తల్లిదండ్రులతో ఉంటున్నారా అని అడగాలి. ఒక కాలర్ "కాదు, ఇప్పుడు అది నాదే" అన్నారు, అది ఆ ప్రశ్నకు ఇప్పటికే సమాధానం ఇస్తుంది. అయినప్పటికీ మోడల్ మెనూను చదివింది:
ప్రారంభంలో కనిపించిన కొన్ని విచిత్రతలకు మా prompt కారణమే, కానీ మేము ప్రయత్నించిన ప్రతి prompt వేరియంట్లోనూ ఈ అక్షరార్థ ధోరణి కొనసాగింది. మేము స్పష్టంగా పేర్కొనని ఏ సమాధానాన్నైనా ఇది సమంజసంగా కాకుండా యాంత్రికంగా నిర్వహించింది.
ఒత్తిడిలో ఉన్నప్పుడు ఇది కొన్నిసార్లు తన ఆలోచనలను బిగ్గరగా చెబుతుంది కూడా:
సంఖ్యలు మరియు ఆల్ఫాన్యూమరిక్లు ప్రమాదకరం
స్పెల్లింగ్లు, చిరునామాలు, జన్మ తేదీలు, మరియు ID నంబర్లు కచ్చితంగా ఉండాలి. GPT-Live-1 ప్రసంగంలో అత్యధిక సమస్యలు ఇక్కడే ఉన్నాయి.
ఆల్ఫాన్యూమరిక్ స్ట్రింగ్లలో అక్షరాలను వదిలివేయడం, ప్రత్యామ్నాయం చేయడం మేము విన్నాం. ఇక్కడ అది కల్పిత క్లెయిమ్ నంబర్ను చదువుతుంది; నిశ్శబ్దాన్ని కత్తిరించడం మినహా క్లిప్లను మార్చలేదు. ఇంగ్లీష్లో, దాని ట్రాన్స్క్రిప్ట్ సరైనదే కానీ ఆడియోలో ఒక "Y" అదనంగా వచ్చింది:
రష్యన్లో ఇది మరింత చెడ్డగా ఉంది: ఆడియోలోనూ దాని ట్రాన్స్క్రిప్ట్లోనూ "Q" ఒక "X"గా మారింది.
తేదీలతోనూ ఇదే సమస్య వచ్చింది. ఒక కాలర్ జన్మ తేదీని అంకెలుగా చెప్పగా, మోడల్ దాన్ని తర్వాత ఒక సంఖ్యగా తిరిగి చదివింది:
అలాగే, అప్పుడప్పుడు కాలర్కు చెందిన ఒక లైన్ను కూడా అది పలుకుతుంది:
ఇతర భాషల్లో యాసలు
మా ఉత్పత్తి మద్దతిచ్చే 47 భాషల్లో కొత్త వాయిస్ మోడల్లను మేము పరీక్షిస్తాం. GPT-Live-1 రష్యన్ అనర్గళంగా ఉంది, కానీ గాఢమైన అమెరికన్ యాసతో ఉంది (మేము ప్రొడక్షన్లో నడిపే TTS వాయిస్లు సాధారణంగా స్థానికుల్లా వినిపిస్తాయి):
మేము లుగాండాను కూడా ప్రయత్నించాం. మొదటి కాల్లో, అది బదులుగా స్వాహిలీలో సమాధానమిచ్చింది. రెండో కాల్లో అది లుగాండా మాట్లాడింది—సాధారణ మోడల్ నుండి మేము ఊహించిన దానికంటే సహజంగా—కానీ మళ్లీ గాఢమైన అమెరికన్ యాసతో. మేము ప్రతి భాషను పరీక్షించలేదు, కానీ యాస సరళి బహుశా సాధారణంగా వర్తిస్తుందని భావిస్తున్నాం. ఇంగ్లీష్-మాత్రమే ఉపయోగించే ఏజెంట్కు ఇది ముఖ్యంకాదు, కానీ ఇతర భాషల వినియోగ సందర్భాలకు ఇది చాలా ముఖ్యమైన పరిమితి.
తెలుసుకోవాల్సిన కొన్ని API పరిమితులు
ఈ వారం మేము కనుగొన్న దాని ఆధారంగా, నిజమైన ఏజెంట్కు కొన్ని API పరిమితులు ముఖ్యమైనవి:
- సెషన్ ప్రారంభమైన తర్వాత సూచనలు మార్చలేము, మరియు వాటికి 16,384 టోకెన్ల పరిమితి ఉంది.
- అవుట్పుట్ ఆడియో స్ట్రీమింగ్ ఎప్పటికీ ఆగదు — నిశ్శబ్దం కూడా స్ట్రీమ్ అవుతుంది — కాబట్టి టర్న్లను విభజించాల్సిన వినియోగ సందర్భాల్లో "audio stopped"ను టర్న్ ముగింపు సంకేతంగా ఉపయోగించలేరు.
- కొత్త
v1/live/sessionsఎండ్పాయింట్ ద్వారా మాత్రమే దీన్ని చేరుకోవచ్చు, మరియు మేము పరిశీలించినప్పుడు ఇది ఇంకా Azureలో అందుబాటులో లేదు.
ఇప్పటివరకు మా అభిప్రాయం
ప్రొడక్షన్ ఫోన్ ఏజెంట్లు సహజంగా వినిపించాలి మరియు స్క్రిప్ట్లను స్థిరంగా అనుసరించాలి. GPT-Live-1 మొదటి విషయంలో అద్భుతంగా ఉంది, కానీ రెండో విషయంలో కొన్ని తీవ్రమైన సమస్యలు ఉన్నాయి. కాలం గడిచే కొద్దీ మేము మరిన్ని పరీక్షలు నిర్వహించి, మా పరిశీలనలను తెలియజేస్తూనే ఉంటాం.