ਵੌਇਸ ਏਜੰਟਾਂ ਲਈ GPT-Live-1 API ਬਾਰੇ ਸਾਡੇ ਪਹਿਲੇ ਪ੍ਰਭਾਵ
OpenAI ਨੇ ਦੋ ਦਿਨ ਪਹਿਲਾਂ ਆਪਣਾ ਨਵਾਂ ਫੁੱਲ-ਡੁਪਲੈਕਸ ਵੌਇਸ ਮਾਡਲ GPT-Live-1 API ਲਈ ਜਾਰੀ ਕੀਤਾ। ਅਸੀਂ ਪ੍ਰੋਡਕਸ਼ਨ ਵਿੱਚ AI ਫੋਨ ਏਜੰਟ ਬਣਾਉਂਦੇ ਅਤੇ ਚਲਾਉਂਦੇ ਹਾਂ, ਇਸ ਲਈ ਅਸੀਂ ਇਸਨੂੰ ਇੱਕ ਅਸਲੀ ਫੋਨ ਨੰਬਰ ਨਾਲ ਜੋੜਿਆ ਅਤੇ ਇਸਨੂੰ ਕਾਲ ਕੀਤੀ। ਕਾਫ਼ੀ ਵਾਰ।
ਅਸੀਂ ਇਸਨੂੰ ਆਪਣੇ ਇੱਕ ਇੰਸ਼ੋਰੈਂਸ ਗਾਹਕ ਦੀ ਲਗਭਗ 13,000-ਟੋਕਨ ਵਾਰਮ-ਲੀਡ ਕੁਆਲੀਫਿਕੇਸ਼ਨ ਸਕ੍ਰਿਪਟ ਨਾਲ ਟੈਸਟ ਕੀਤਾ, ਜਿਸ ਵਿੱਚ ਲਾਜ਼ਮੀ ਤੌਰ 'ਤੇ ਜਿਉਂ ਦਾ ਤਿਉਂ ਬੋਲੀਆਂ ਜਾਣ ਵਾਲੀਆਂ ਲਾਈਨਾਂ, ਸਖ਼ਤ ਦੁਹਰਾਕੇ ਪੁਸ਼ਟੀ ਕਰਨ ਦੇ ਨਿਯਮ ਅਤੇ ਸ਼ਾਖਾਵਾਰ ਫਾਲੋ-ਅੱਪ ਸਨ। ਇੱਕ ਲੰਮੇ ਦਿਨ ਦੌਰਾਨ, ਅਸੀਂ ਇੱਕ ਦਰਜਨ ਅਸਲੀ ਫੋਨ ਕਾਲਾਂ, ਲਗਭਗ 25 ਸਿਮੂਲੇਟ ਕੀਤੇ ਇੰਟਰਵਿਊ ਅਤੇ ਗੈਰ-ਸੰਰਚਿਤ ਟੈਸਟਾਂ ਦਾ ਇੱਕ ਬੈਚ ਚਲਾਇਆ।
ਟ੍ਰਾਂਸਕ੍ਰਿਪਟਾਂ ਅਤੇ ਆਡੀਓ ਸਮੇਤ ਇਹ ਸਾਡੇ ਪਹਿਲੇ ਪ੍ਰਭਾਵ ਹਨ। ਇੱਕ ਹੋਰ ਡੂੰਘੀ ਲਿਖਤ ਜਲਦੀ ਆ ਰਹੀ ਹੈ।
ਟ੍ਰਾਂਸਕ੍ਰਿਪਟਾਂ ਸਾਡੀਆਂ ਟੈਸਟ ਕਾਲਾਂ ਦੀਆਂ ਹਨ, ਜਿਨ੍ਹਾਂ ਨੂੰ GPT-Live ਨੇ ਲਿਪੀਬੱਧ ਕੀਤਾ ਹੈ। ਅਸੀਂ ਨਾਮ ਅਤੇ ਪਛਾਣ ਕਰਨ ਵਾਲੀ ਸ਼ਬਦਾਵਲੀ ਬਦਲੀ ਹੈ, ਗੱਲਬਾਤਾਂ ਨੂੰ ਛੋਟਾ ਕੀਤਾ ਹੈ ਅਤੇ ਵੰਡੇ ਹੋਏ ਟੁਕੜਿਆਂ ਨੂੰ ਜੋੜਿਆ ਹੈ। ਕਾਲ ਸ਼ੁਰੂ ਹੋਣ ਤੋਂ ਸਕਿੰਟਾਂ ਵਿੱਚ ਦਿੱਤੇ ਟਾਈਮਸਟੈਂਪ ਅਸਲ ਰਿਕਾਰਡਾਂ ਤੋਂ ਹਨ।
ਕੁਦਰਤੀਪਣ ਬੇਮਿਸਾਲ ਹੈ
GPT-Live-1 ਸਭ ਤੋਂ ਕੁਦਰਤੀ ਆਵਾਜ਼ ਵਾਲਾ ਗੱਲਬਾਤੀ ਹੈ ਜਿਸਨੂੰ ਅਸੀਂ ਕਿਸੇ ਫੋਨ ਲਾਈਨ 'ਤੇ ਲਗਾਇਆ ਹੈ। ਇਹ ਸੱਚਮੁੱਚ ਇੱਕ ਵੱਡੀ ਤਰੱਕੀ ਹੈ।
ਇਹ ਵੱਖਰੇ ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ ਅਤੇ ਸਿੰਥੇਸਿਸ ਪੜਾਵਾਂ ਤੋਂ ਬਿਨਾਂ, ਇੱਕ ਲਗਾਤਾਰ ਆਡੀਓ ਸਟ੍ਰੀਮ 'ਤੇ ਸੁਣਦਾ ਅਤੇ ਬੋਲਦਾ ਹੈ। ਗੱਲਬਾਤ ਦੀਆਂ ਜ਼ਿਆਦਾਤਰ ਬਾਰੀਕੀਆਂ ਬਸ ਕੰਮ ਕਰਦੀਆਂ ਹਨ। ਕਾਲ ਕਰਨ ਵਾਲਿਆਂ ਨੇ ਬੋਲਣਾ ਬੰਦ ਕਰਨ ਤੋਂ ਲਗਭਗ 1.3 ਸਕਿੰਟ ਬਾਅਦ ਇਸਦੀ ਪਹਿਲੀ ਆਡੀਓ ਸੁਣੀ (ਮੱਧਮਾਨ), ਜਾਂ ਫੋਨ ਲੈਗ ਤੋਂ ਬਿਨਾਂ ਲਗਭਗ 0.7 ਸਕਿੰਟ ਵਿੱਚ। ਅਸੀਂ ਕੋਈ ਆਵਾਜ਼-ਸਰਗਰਮੀ ਪਛਾਣ ਜਾਂ ਵਾਰੀ-ਲੈਣ ਦੀ ਲਾਜਿਕ ਨਹੀਂ ਜੋੜੀ। ਇਹ ਰੁਕਾਵਟਾਂ ਨੂੰ ਸੁਚੱਜੇ ਢੰਗ ਨਾਲ ਸੰਭਾਲਦਾ ਹੈ, ਕੁਦਰਤੀ ਸਹਿਮਤੀ ਸੰਕੇਤ ("Mm-hmm") ਦਿੰਦਾ ਹੈ ਅਤੇ ਤੇਜ਼, ਮਨੁੱਖੀ ਰਫ਼ਤਾਰ ਨਾਲ ਬੋਲਦਾ ਹੈ।
ਪੜ੍ਹਨ ਲਈ ਲਾਈਨਾਂ ਦੀ ਬਜਾਏ ਟੀਚੇ ਦਿੱਤੇ ਜਾਣ 'ਤੇ, ਇਹ ਸਵਾਲਾਂ ਨੂੰ ਗੱਲਬਾਤ ਅਨੁਸਾਰ ਢਾਲਦਾ ਹੈ ਅਤੇ ਸੁਧਾਰਾਂ ਨੂੰ ਆਸਾਨੀ ਨਾਲ ਸਵੀਕਾਰ ਕਰਦਾ ਹੈ:
ਸੁਧਾਰਾਂ, ਰੁਕਾਵਟਾਂ ਜਾਂ ਕਾਲ ਕਰਨ ਵਾਲਿਆਂ ਵੱਲੋਂ ਕਾਲ ਦੌਰਾਨ ਹੀ ਆਪਣੇ ਜਵਾਬ ਬਦਲਣ 'ਤੇ ਵੀ ਇਸਨੇ ਕਦੇ ਸੰਤੁਲਨ ਨਹੀਂ ਗੁਆਇਆ। ਜੇ ਕੁਦਰਤੀਪਣ ਹੀ ਪੂਰਾ ਕੰਮ ਹੁੰਦਾ, ਤਾਂ ਇਹ ਪੋਸਟ ਇੱਥੇ ਖ਼ਤਮ ਹੋ ਜਾਂਦੀ। ਬਦਕਿਸਮਤੀ ਨਾਲ, ਗੱਲ ਸਿਰਫ਼ ਇੰਨੀ ਹੀ ਨਹੀਂ ਹੈ।
ਇਹ ਹਦਾਇਤਾਂ ਦੀ ਭਰੋਸੇਯੋਗ ਤਰੀਕੇ ਨਾਲ ਪਾਲਣਾ ਨਹੀਂ ਕਰਦਾ
GPT-Live-1 ਸਕ੍ਰਿਪਟ ਵਾਲੀ ਫੋਨ ਕਾਲ ਲਈ ਮਹੱਤਵਪੂਰਨ ਵਿਹਾਰਾਂ ਬਾਰੇ ਹਦਾਇਤਾਂ ਦੀ ਭਰੋਸੇਯੋਗ ਤਰੀਕੇ ਨਾਲ ਪਾਲਣਾ ਨਹੀਂ ਕਰਦਾ।
ਇੱਕ ਤੋਂ ਵੱਧ ਵਾਰ, ਇਸਨੇ ਸਪੱਸ਼ਟ "yes" ਦਾ ਜਵਾਬ ਇੰਝ ਦਿੱਤਾ ਜਿਵੇਂ ਜਵਾਬ "no" ਹੋਵੇ, ਸਵਾਲ ਮੁੜ ਪੁੱਛਿਆ ਜਾਂ ਅੱਗੇ ਇੰਝ ਵਧ ਗਿਆ ਜਿਵੇਂ ਕਾਲ ਕਰਨ ਵਾਲੇ ਨੇ ਇਨਕਾਰ ਕਰ ਦਿੱਤਾ ਹੋਵੇ।
ਸਭ ਤੋਂ ਲਗਾਤਾਰ ਨਾਕਾਮੀ ਹਦਾਇਤਾਂ ਨੂੰ ਬਹੁਤ ਸ਼ਾਬਦਿਕ ਤੌਰ 'ਤੇ ਲੈਣਾ ਸੀ। ਸਾਡੇ prompt ਵਿੱਚ ਲਿਖਿਆ ਸੀ: ਜੇ ਕਾਲ ਕਰਨ ਵਾਲਾ ਕਹੇ ਕਿ ਫਾਈਲ ਵਿੱਚ ਦਰਜ ਰਿਹਾਇਸ਼ੀ ਸਥਿਤੀ ਗਲਤ ਹੈ, ਤਾਂ ਪੁੱਛੋ ਕਿ ਕੀ ਉਹ ਆਪਣੇ ਘਰ ਦੇ ਮਾਲਕ ਹਨ, ਕਿਰਾਏ 'ਤੇ ਰਹਿੰਦੇ ਹਨ ਜਾਂ ਆਪਣੇ ਮਾਪਿਆਂ ਨਾਲ ਰਹਿੰਦੇ ਹਨ। ਇੱਕ ਕਾਲ ਕਰਨ ਵਾਲੇ ਨੇ ਕਿਹਾ "no, I own it now," ਜੋ ਪਹਿਲਾਂ ਹੀ ਉਸ ਸਵਾਲ ਦਾ ਜਵਾਬ ਹੈ। ਮਾਡਲ ਨੇ ਫਿਰ ਵੀ ਵਿਕਲਪਾਂ ਦੀ ਸੂਚੀ ਪੜ੍ਹ ਦਿੱਤੀ:
ਸ਼ੁਰੂਆਤੀ ਕੁਝ ਅਜੀਬਪਣ ਸਾਡੇ prompt ਦੀ ਗਲਤੀ ਸੀ, ਪਰ ਅਸੀਂ ਜਿੰਨੇ ਵੀ prompt ਰੂਪ ਅਜ਼ਮਾਏ, ਹਰ ਇੱਕ ਵਿੱਚ ਇਹ ਸ਼ਾਬਦਿਕਤਾ ਬਣੀ ਰਹੀ। ਜਿਸ ਜਵਾਬ ਨੂੰ ਅਸੀਂ ਸਪੱਸ਼ਟ ਤੌਰ 'ਤੇ ਨਹੀਂ ਲਿਖਿਆ ਸੀ, ਉਸਨੂੰ ਸਮਝਦਾਰੀ ਨਾਲ ਨਹੀਂ, ਸਗੋਂ ਮਸ਼ੀਨੀ ਢੰਗ ਨਾਲ ਸੰਭਾਲਿਆ ਗਿਆ।
ਦਬਾਅ ਵਿੱਚ ਇਹ ਕਈ ਵਾਰ ਉੱਚੀ ਆਵਾਜ਼ ਵਿੱਚ ਸੋਚਦਾ ਵੀ ਹੈ:
ਨੰਬਰ ਅਤੇ ਅੱਖਰ-ਅੰਕ ਜੋੜ ਖਤਰਨਾਕ ਹਨ
ਸਪੈਲਿੰਗਾਂ, ਪਤੇ, ਜਨਮ-ਤਾਰੀਖਾਂ ਅਤੇ ID ਨੰਬਰ ਬਿਲਕੁਲ ਸਹੀ ਹੋਣੇ ਲਾਜ਼ਮੀ ਹਨ। ਇੱਥੇ ਹੀ GPT-Live-1 ਦੀ ਬੋਲੀ ਵਿੱਚ ਸਭ ਤੋਂ ਵੱਧ ਸਮੱਸਿਆਵਾਂ ਆਉਂਦੀਆਂ ਹਨ।
ਅਸੀਂ ਇਸਨੂੰ ਅੱਖਰ-ਅੰਕ ਵਾਲੀਆਂ ਸਤਰਾਂ ਵਿੱਚ ਅੱਖਰ ਛੱਡਦੇ ਅਤੇ ਬਦਲਦੇ ਸੁਣਿਆ। ਇੱਥੇ ਇਹ ਇੱਕ ਬਣਾਇਆ ਹੋਇਆ ਕਲੇਮ ਨੰਬਰ ਪੜ੍ਹਦਾ ਹੈ; ਚੁੱਪੀ ਕੱਟਣ ਤੋਂ ਇਲਾਵਾ ਕਲਿੱਪਾਂ ਨੂੰ ਛੇੜਿਆ ਨਹੀਂ ਗਿਆ। ਅੰਗਰੇਜ਼ੀ ਵਿੱਚ ਇਸਦਾ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਸਹੀ ਸੀ, ਪਰ ਆਡੀਓ ਵਿੱਚ ਇੱਕ "Y" ਵਾਧੂ ਆ ਗਿਆ:
ਰੂਸੀ ਵਿੱਚ ਇਹ ਹੋਰ ਵੀ ਮਾੜਾ ਸੀ: ਆਡੀਓ ਅਤੇ ਇਸਦੇ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ, ਦੋਵਾਂ ਵਿੱਚ "Q" "X" ਬਣ ਗਿਆ।
ਤਾਰੀਖਾਂ ਨੇ ਵੀ ਇਹੀ ਸਮੱਸਿਆ ਪੈਦਾ ਕੀਤੀ। ਇੱਕ ਕਾਲਰ ਨੇ ਜਨਮ-ਤਾਰੀਖ ਅੰਕਾਂ ਵਜੋਂ ਦਿੱਤੀ, ਜਿਸਨੂੰ ਮਾਡਲ ਨੇ ਬਾਅਦ ਵਿੱਚ ਇੱਕ ਨੰਬਰ ਵਜੋਂ ਦੁਹਰਾਇਆ:
ਇਹ ਕਦੇ-ਕਦਾਈਂ ਕਾਲਰ ਦੀ ਇੱਕ ਲਾਈਨ ਵੀ ਬੋਲ ਦਿੰਦਾ ਹੈ:
ਹੋਰ ਭਾਸ਼ਾਵਾਂ ਵਿੱਚ ਲਹਿਜ਼ੇ
ਅਸੀਂ ਆਪਣੇ ਉਤਪਾਦ ਵੱਲੋਂ ਸਮਰਥਿਤ 47 ਭਾਸ਼ਾਵਾਂ ਵਿੱਚ ਨਵੇਂ ਵੌਇਸ ਮਾਡਲਾਂ ਦੀ ਜਾਂਚ ਕਰਦੇ ਹਾਂ। GPT-Live-1 ਦੀ ਰੂਸੀ ਧਾਰਾਪ੍ਰਵਾਹ ਸੀ, ਪਰ ਇਸ ਵਿੱਚ ਗੂੜ੍ਹਾ ਅਮਰੀਕੀ ਲਹਿਜ਼ਾ ਸੀ (ਜਦਕਿ ਪ੍ਰੋਡਕਸ਼ਨ ਵਿੱਚ ਚਲਾਈਆਂ ਜਾਣ ਵਾਲੀਆਂ TTS ਆਵਾਜ਼ਾਂ ਆਮ ਤੌਰ 'ਤੇ ਮੂਲ ਬੋਲਣ ਵਾਲਿਆਂ ਵਰਗੀਆਂ ਲੱਗਦੀਆਂ ਹਨ):
ਅਸੀਂ ਲੁਗਾਂਡਾ ਵੀ ਅਜ਼ਮਾਇਆ। ਪਹਿਲੀ ਕਾਲ ਵਿੱਚ, ਇਸ ਨੇ ਇਸ ਦੀ ਬਜਾਏ ਸਵਾਹਿਲੀ ਵਿੱਚ ਜਵਾਬ ਦਿੱਤਾ। ਦੂਜੀ ਵਿੱਚ, ਇਸ ਨੇ ਲੁਗਾਂਡਾ ਬੋਲੀ—ਇੱਕ ਆਮ ਮਾਡਲ ਤੋਂ ਸਾਡੀ ਉਮੀਦ ਨਾਲੋਂ ਵੱਧ ਸੁਭਾਵਿਕ ਢੰਗ ਨਾਲ—ਪਰ ਫਿਰ ਵੀ ਗੂੜ੍ਹੇ ਅਮਰੀਕੀ ਲਹਿਜ਼ੇ ਨਾਲ। ਅਸੀਂ ਹਰ ਭਾਸ਼ਾ ਦੀ ਜਾਂਚ ਨਹੀਂ ਕੀਤੀ, ਪਰ ਸਾਨੂੰ ਉਮੀਦ ਹੈ ਕਿ ਲਹਿਜ਼ੇ ਦਾ ਇਹ ਪੈਟਰਨ ਸ਼ਾਇਦ ਆਮ ਤੌਰ 'ਤੇ ਲਾਗੂ ਹੁੰਦਾ ਹੈ। ਸਿਰਫ਼ ਅੰਗਰੇਜ਼ੀ ਵਾਲੇ ਏਜੰਟ ਲਈ ਇਹ ਮਹੱਤਵਪੂਰਨ ਨਹੀਂ, ਪਰ ਹੋਰ ਭਾਸ਼ਾਵਾਂ ਵਾਲੇ ਵਰਤੋਂ ਦੇ ਮਾਮਲਿਆਂ ਲਈ ਇਹ ਕਾਫ਼ੀ ਵੱਡੀ ਸੀਮਾ ਹੈ।
ਜਾਣਨ ਯੋਗ ਕੁਝ API ਸੀਮਾਵਾਂ
ਇਸ ਹਫ਼ਤੇ ਸਾਨੂੰ ਜੋ ਮਿਲਿਆ, ਉਸ ਦੇ ਆਧਾਰ 'ਤੇ, ਅਸਲ ਏਜੰਟ ਲਈ ਕੁਝ API ਸੀਮਾਵਾਂ ਮਹੱਤਵ ਰੱਖਦੀਆਂ ਹਨ:
- ਸੈਸ਼ਨ ਸ਼ੁਰੂ ਹੋਣ ਤੋਂ ਬਾਅਦ ਹਦਾਇਤਾਂ ਬਦਲੀਆਂ ਨਹੀਂ ਜਾ ਸਕਦੀਆਂ, ਅਤੇ ਇਹ 16,384 ਟੋਕਨਾਂ ਤੱਕ ਸੀਮਿਤ ਹਨ।
- ਆਉਟਪੁੱਟ ਆਡੀਓ ਦੀ ਸਟ੍ਰੀਮਿੰਗ ਕਦੇ ਨਹੀਂ ਰੁਕਦੀ — ਚੁੱਪੀ ਵੀ ਸਟ੍ਰੀਮ ਹੁੰਦੀ ਹੈ — ਇਸ ਲਈ ਜਿਨ੍ਹਾਂ ਵਰਤੋਂ ਦੇ ਮਾਮਲਿਆਂ ਵਿੱਚ ਵਾਰੀਆਂ ਨੂੰ ਵੰਡਣਾ ਲੋੜੀਂਦਾ ਹੈ, ਉੱਥੇ "ਆਡੀਓ ਰੁਕ ਗਈ" ਨੂੰ ਵਾਰੀ-ਖ਼ਤਮ ਹੋਣ ਦੇ ਸੰਕੇਤ ਵਜੋਂ ਨਹੀਂ ਵਰਤਿਆ ਜਾ ਸਕਦਾ।
- ਇਹ ਸਿਰਫ਼ ਨਵੇਂ
v1/live/sessionsਐਂਡਪੁਆਇੰਟ ਰਾਹੀਂ ਪਹੁੰਚਯੋਗ ਹੈ, ਅਤੇ ਜਦੋਂ ਅਸੀਂ ਜਾਂਚਿਆ ਤਾਂ ਇਹ ਹਾਲੇ Azure 'ਤੇ ਉਪਲਬਧ ਨਹੀਂ ਸੀ।
ਹੁਣ ਤੱਕ ਸਾਡਾ ਪ੍ਰਭਾਵ
ਪ੍ਰੋਡਕਸ਼ਨ ਫ਼ੋਨ ਏਜੰਟਾਂ ਨੂੰ ਸੁਭਾਵਿਕ ਸੁਣਾਈ ਦੇਣਾ ਅਤੇ ਸਕ੍ਰਿਪਟਾਂ ਦੀ ਲਗਾਤਾਰ ਪਾਲਣਾ ਕਰਨੀ ਹੁੰਦੀ ਹੈ। GPT-Live-1 ਪਹਿਲੇ ਮਾਮਲੇ ਵਿੱਚ ਸ਼ਾਨਦਾਰ ਹੈ, ਪਰ ਦੂਜੇ ਨਾਲ ਇਸਦੀਆਂ ਕੁਝ ਗੰਭੀਰ ਸਮੱਸਿਆਵਾਂ ਹਨ। ਸਮਾਂ ਬੀਤਣ ਨਾਲ ਅਸੀਂ ਹੋਰ ਟੈਸਟ ਕਰਾਂਗੇ ਅਤੇ ਆਪਣੀਆਂ ਖੋਜਾਂ ਸਾਂਝੀਆਂ ਕਰਦੇ ਰਹਾਂਗੇ।