ಧ್ವನಿ ಏಜೆಂಟ್ಗಳಿಗಾಗಿ GPT-Live-1 API ಕುರಿತು ನಮ್ಮ ಮೊದಲ ಅನಿಸಿಕೆಗಳು
OpenAI ಎರಡು ದಿನಗಳ ಹಿಂದೆ ತನ್ನ ಹೊಸ ಫುಲ್-ಡ್ಯುಪ್ಲೆಕ್ಸ್ ವಾಯ್ಸ್ ಮಾಡೆಲ್ ಆದ GPT-Live-1 ಅನ್ನು APIಗೆ ಬಿಡುಗಡೆ ಮಾಡಿತು. ನಾವು ಪ್ರೊಡಕ್ಷನ್ನಲ್ಲಿ AI ಫೋನ್ ಏಜೆಂಟ್ಗಳನ್ನು ನಿರ್ಮಿಸಿ ನಡೆಸುತ್ತೇವೆ, ಆದ್ದರಿಂದ ಅದನ್ನು ನೈಜ ಫೋನ್ ಸಂಖ್ಯೆಗೆ ಜೋಡಿಸಿ ಕರೆ ಮಾಡಿದೆವು. ಸಾಕಷ್ಟು ಬಾರಿ.
ನಮ್ಮ ವಿಮಾ ಗ್ರಾಹಕರೊಬ್ಬರ ~13,000-ಟೋಕನ್ ವಾರ್ಮ್-ಲೀಡ್ ಅರ್ಹತಾ ಸ್ಕ್ರಿಪ್ಟ್ನೊಂದಿಗೆ ನಾವು ಇದನ್ನು ಪರೀಕ್ಷಿಸಿದೆವು; ಅದರಲ್ಲಿ ಕಡ್ಡಾಯವಾಗಿ ಪದಶಃ ಹೇಳಬೇಕಾದ ಸಾಲುಗಳು, ಕಟ್ಟುನಿಟ್ಟಾದ ಮರುಓದುವ ನಿಯಮಗಳು ಮತ್ತು ಶಾಖೆಗೊಳ್ಳುವ ಅನುಸರಣಾ ಪ್ರಶ್ನೆಗಳಿದ್ದವು. ಒಂದು ದೀರ್ಘ ದಿನದಲ್ಲಿ, ನಾವು ಹನ್ನೆರಡು ನೈಜ ಫೋನ್ ಕರೆಗಳು, ಸುಮಾರು 25 ಸಿಮ್ಯುಲೇಟೆಡ್ ಸಂದರ್ಶನಗಳು ಮತ್ತು ಅಸಂರಚಿತ ಪರೀಕ್ಷೆಗಳ ಒಂದು ಬ್ಯಾಚ್ ನಡೆಸಿದೆವು.
ಟ್ರಾನ್ಸ್ಕ್ರಿಪ್ಟ್ಗಳು ಮತ್ತು ಆಡಿಯೊ ಸಹಿತ ನಮ್ಮ ಮೊದಲ ಅನಿಸಿಕೆಗಳು ಇವು. ಇನ್ನಷ್ಟು ವಿವರವಾದ ಬರಹ ಶೀಘ್ರದಲ್ಲೇ ಬರುತ್ತದೆ.
ಟ್ರಾನ್ಸ್ಕ್ರಿಪ್ಟ್ಗಳು ನಮ್ಮ ಪರೀಕ್ಷಾ ಕರೆಗಳಿಂದ ಬಂದವು; ಅವನ್ನು GPT-Live ಟ್ರಾನ್ಸ್ಕ್ರೈಬ್ ಮಾಡಿದೆ. ನಾವು ಹೆಸರುಗಳು ಮತ್ತು ಗುರುತಿಸಬಹುದಾದ ಪದಬಳಕೆಯನ್ನು ಬದಲಿಸಿದ್ದೇವೆ, ವಿನಿಮಯಗಳನ್ನು ಸಂಕ್ಷಿಪ್ತಗೊಳಿಸಿದ್ದೇವೆ ಮತ್ತು ವಿಭಜಿತ ತುಣುಕುಗಳನ್ನು ಒಗ್ಗೂಡಿಸಿದ್ದೇವೆ. ಕರೆ ಆರಂಭದಿಂದ ಸೆಕೆಂಡುಗಳಲ್ಲಿರುವ ಸಮಯಚಿಹ್ನೆಗಳು ಮೂಲ ದಾಖಲೆಗಳಿಂದ ಬಂದಿವೆ.
ಸಹಜತೆ ಅಸಾಧಾರಣವಾಗಿದೆ
ನಾವು ಫೋನ್ ಲೈನ್ಗೆ ಹಾಕಿದ ಸಂಭಾಷಣಾಕಾರರಲ್ಲಿ GPT-Live-1 ಅತ್ಯಂತ ಸಹಜವಾಗಿ ಕೇಳಿಸುತ್ತದೆ. ಇದು ನಿಜವಾದ ಮುನ್ನಡೆ.
ಪ್ರತ್ಯೇಕ ಟ್ರಾನ್ಸ್ಕ್ರಿಪ್ಷನ್ ಮತ್ತು ಸಿಂಥೆಸಿಸ್ ಹಂತಗಳಿಲ್ಲದೆ, ಇದು ಒಂದೇ ನಿರಂತರ ಆಡಿಯೊ ಸ್ಟ್ರೀಮ್ನಲ್ಲಿ ಕೇಳುತ್ತದೆ ಮತ್ತು ಮಾತನಾಡುತ್ತದೆ. ಸಂಭಾಷಣೆಯ ಬಹುತೇಕ ಯಾಂತ್ರಿಕತೆ ಸರಾಗವಾಗಿ ಕೆಲಸ ಮಾಡುತ್ತದೆ. ಕರೆಮಾಡುವವರು ಮಾತನಾಡುವುದನ್ನು ನಿಲ್ಲಿಸಿದ ಸುಮಾರು 1.3 ಸೆಕೆಂಡುಗಳ ನಂತರ ಅದರ ಮೊದಲ ಆಡಿಯೊವನ್ನು ಕೇಳಿದರು (ಮಧ್ಯಕ), ಅಥವಾ ಫೋನ್ ಲೆಗ್ ಇಲ್ಲದೆ ಸುಮಾರು 0.7 ಸೆಕೆಂಡುಗಳಲ್ಲಿ. ನಾವು ಯಾವುದೇ ವಾಯ್ಸ್-ಆಕ್ಟಿವಿಟಿ ಡಿಟೆಕ್ಷನ್ ಅಥವಾ ಟರ್ನ್-ಟೇಕಿಂಗ್ ಲಾಜಿಕ್ ಸೇರಿಸಲಿಲ್ಲ. ಇದು ಅಡ್ಡಿಪಡಿಸುವಿಕೆಗಳನ್ನು ಸೊಗಸಾಗಿ ನಿಭಾಯಿಸುತ್ತದೆ, ಸಹಜ ಬ್ಯಾಕ್ಚಾನೆಲ್ಗಳನ್ನು ("ಹ್ಞೂಂ") ನೀಡುತ್ತದೆ ಮತ್ತು ಚುರುಕಾದ, ಮನುಷ್ಯನಂತಿರುವ ವೇಗದಲ್ಲಿ ಮಾತನಾಡುತ್ತದೆ.
ಓದಬೇಕಾದ ಸಾಲುಗಳಿಗಿಂತ ಗುರಿಗಳನ್ನು ನೀಡಿದಾಗ, ಇದು ಪ್ರಶ್ನೆಗಳನ್ನು ಸಂಭಾಷಣೆಗೆ ಹೊಂದಿಸುತ್ತದೆ ಮತ್ತು ತಿದ್ದುಪಡಿಗಳನ್ನು ಸಹಜವಾಗಿ ಸ್ವೀಕರಿಸುತ್ತದೆ:
ತಿದ್ದುಪಡಿಗಳು, ಅಡ್ಡಿಪಡಿಸುವಿಕೆಗಳು ಅಥವಾ ಕರೆಮಾಡುವವರು ಕರೆ ಮಧ್ಯದಲ್ಲಿ ಉತ್ತರ ಬದಲಿಸಿದ ಸಂದರ್ಭಗಳಲ್ಲಿಯೂ ಅದು ಎಂದಿಗೂ ಸ್ಥೈರ್ಯ ಕಳೆದುಕೊಳ್ಳಲಿಲ್ಲ. ಸಹಜತೆಯೇ ಸಂಪೂರ್ಣ ಕೆಲಸವಾಗಿದ್ದರೆ, ಈ ಲೇಖನ ಇಲ್ಲಿಯೇ ಮುಗಿಯುತ್ತಿತ್ತು. ದುರದೃಷ್ಟವಶಾತ್, ಇದರಲ್ಲಿ ಇದಕ್ಕಿಂತ ಹೆಚ್ಚಿದೆ.
ಇದು ಸೂಚನೆಗಳನ್ನು ವಿಶ್ವಾಸಾರ್ಹವಾಗಿ ಅನುಸರಿಸುವುದಿಲ್ಲ
ಸ್ಕ್ರಿಪ್ಟೆಡ್ ಫೋನ್ ಕರೆಗೆ ಮುಖ್ಯವಾದ ವರ್ತನೆಗಳ ವಿಷಯದಲ್ಲಿ GPT-Live-1 ಸೂಚನೆಗಳನ್ನು ವಿಶ್ವಾಸಾರ್ಹವಾಗಿ ಅನುಸರಿಸುವುದಿಲ್ಲ.
ಒಂದಕ್ಕಿಂತ ಹೆಚ್ಚು ಬಾರಿ, ಸ್ಪಷ್ಟವಾದ "ಹೌದು" ಉತ್ತರಕ್ಕೆ ಅದು "ಇಲ್ಲ" ಎಂದಂತೆ ಪ್ರತಿಕ್ರಿಯಿಸಿತು; ಪ್ರಶ್ನೆಯನ್ನು ಮತ್ತೆ ಕೇಳಿತು ಅಥವಾ ಕರೆಮಾಡುವವರು ನಿರಾಕರಿಸಿದಂತೆ ಮುಂದುವರಿಯಿತು.
ಅತ್ಯಂತ ಸ್ಥಿರವಾದ ವೈಫಲ್ಯವೆಂದರೆ ಸೂಚನೆಗಳನ್ನು ತುಂಬಾ ಅಕ್ಷರಶಃ ತೆಗೆದುಕೊಳ್ಳುವುದು. ನಮ್ಮ prompt ಹೀಗೆ ಹೇಳಿತ್ತು: ಫೈಲ್ನಲ್ಲಿರುವ ವಸತಿ ಸ್ಥಿತಿ ತಪ್ಪಾಗಿದೆ ಎಂದು ಕರೆಮಾಡುವವರು ಹೇಳಿದರೆ, ಅವರು ಸ್ವಂತ ಮನೆ ಹೊಂದಿದ್ದಾರೆಯೇ, ಬಾಡಿಗೆಗಿದ್ದಾರೆಯೇ ಅಥವಾ ಪೋಷಕರೊಂದಿಗೆ ವಾಸಿಸುತ್ತಾರೆಯೇ ಎಂದು ಕೇಳಿ. ಒಬ್ಬ ಕರೆಮಾಡುವವರು "ಇಲ್ಲ, ಈಗ ಅದು ನನ್ನದೇ" ಎಂದರು; ಇದು ಈಗಾಗಲೇ ಆ ಪ್ರಶ್ನೆಗೆ ಉತ್ತರಿಸುತ್ತದೆ. ಆದರೂ ಮಾಡೆಲ್ ಮೆನುವನ್ನು ಓದಿತು:
ಆರಂಭದ ಕೆಲವು ವಿಚಿತ್ರತೆಗಳಿಗೆ ನಮ್ಮ prompt ಕಾರಣವಾಗಿತ್ತು, ಆದರೆ ನಾವು ಪ್ರಯತ್ನಿಸಿದ ಪ್ರತಿಯೊಂದು prompt ರೂಪಾಂತರದಲ್ಲೂ ಈ ಅಕ್ಷರಶಃ ಅನುಸರಣೆ ಮುಂದುವರಿಯಿತು. ನಾವು ಸ್ಪಷ್ಟವಾಗಿ ಬರೆಯದ ಯಾವುದೇ ಉತ್ತರವನ್ನು ಅದು ವಿವೇಕಪೂರ್ವಕವಾಗಿ ಅಲ್ಲದೆ ಯಾಂತ್ರಿಕವಾಗಿ ನಿರ್ವಹಿಸಿತು.
ಒತ್ತಡದಲ್ಲಿರುವಾಗ ಅದು ಕೆಲವೊಮ್ಮೆ ಗಟ್ಟಿಯಾಗಿ ಯೋಚಿಸುತ್ತದೆ:
ಸಂಖ್ಯೆಗಳು ಮತ್ತು ಅಕ್ಷರಸಂಖ್ಯಾ ಸಂಕೇತಗಳು ಅಪಾಯಕಾರಿ
ಕಾಗುಣಿತಗಳು, ವಿಳಾಸಗಳು, ಜನ್ಮ ದಿನಾಂಕಗಳು ಮತ್ತು ಗುರುತಿನ ಸಂಖ್ಯೆಗಳು ನಿಖರವಾಗಿರಬೇಕು. ಇಲ್ಲಿಯೇ GPT-Live-1 ನ ಮಾತಿನಲ್ಲಿ ಹೆಚ್ಚು ಸಮಸ್ಯೆಗಳಿವೆ.
ಅಕ್ಷರಸಂಖ್ಯಾ ಸರಣಿಗಳಲ್ಲಿ ಅದು ಅಕ್ಷರಗಳನ್ನು ಕೈಬಿಡುವುದು ಮತ್ತು ಬದಲಾಯಿಸುವುದನ್ನು ನಾವು ಕೇಳಿದ್ದೇವೆ. ಇಲ್ಲಿ ಅದು ಕಾಲ್ಪನಿಕ ಕ್ಲೈಮ್ ಸಂಖ್ಯೆಯನ್ನು ಓದುತ್ತದೆ; ಮೌನವನ್ನು ಕತ್ತರಿಸಿರುವುದನ್ನು ಹೊರತುಪಡಿಸಿ ಕ್ಲಿಪ್ಗಳನ್ನು ಬದಲಾಯಿಸಲಾಗಿಲ್ಲ. ಇಂಗ್ಲಿಷ್ನಲ್ಲಿ ಅದರ ಟ್ರಾನ್ಸ್ಕ್ರಿಪ್ಟ್ ಸರಿಯಾಗಿತ್ತು, ಆದರೆ ಆಡಿಯೊದಲ್ಲಿ ಹೆಚ್ಚುವರಿಯಾಗಿ "Y" ಸೇರಿತ್ತು:
ರಷ್ಯನ್ನಲ್ಲಿ ಇದು ಇನ್ನೂ ಕೆಟ್ಟದಾಗಿತ್ತು: ಆಡಿಯೊ ಮತ್ತು ಅದರ ಟ್ರಾನ್ಸ್ಕ್ರಿಪ್ಟ್ ಎರಡರಲ್ಲೂ "Q" "X" ಆಗಿ ಬದಲಾಯಿತು.
ದಿನಾಂಕಗಳೂ ಇದೇ ಸಮಸ್ಯೆಯನ್ನು ಉಂಟುಮಾಡಿದವು. ಒಬ್ಬ ಕರೆಮಾಡುವವರು ಜನ್ಮ ದಿನಾಂಕವನ್ನು ಅಂಕಿಗಳ ರೂಪದಲ್ಲಿ ತಿಳಿಸಿದರು, ಆದರೆ ಮಾದರಿಯು ನಂತರ ಅದನ್ನು ಸಂಖ್ಯೆಯಾಗಿ ಮರುಓದಿತು:
ಅಲ್ಲದೆ, ಕೆಲವೊಮ್ಮೆ ಅದು ಕರೆಮಾಡುವವರಿಗೆ ಸೇರಬೇಕಾದ ಸಾಲನ್ನೂ ಮಾತನಾಡುತ್ತದೆ:
ಇತರ ಭಾಷೆಗಳಲ್ಲಿನ ಉಚ್ಚಾರಣೆಗಳು
ನಮ್ಮ ಉತ್ಪನ್ನವು ಬೆಂಬಲಿಸುವ 47 ಭಾಷೆಗಳಲ್ಲಿ ಹೊಸ ಧ್ವನಿ ಮಾದರಿಗಳನ್ನು ನಾವು ಪರೀಕ್ಷಿಸುತ್ತೇವೆ. GPT-Live-1 ನ ರಷ್ಯನ್ ನಿರರ್ಗಳವಾಗಿತ್ತು, ಆದರೆ ಅದರಲ್ಲಿ ಗಾಢ ಅಮೆರಿಕನ್ ಉಚ್ಚಾರಣೆಯಿತ್ತು (ಆದರೆ ಉತ್ಪಾದನೆಯಲ್ಲಿ ನಾವು ಬಳಸುವ TTS ಧ್ವನಿಗಳು ಸಾಮಾನ್ಯವಾಗಿ ಸ್ಥಳೀಯರ ಧ್ವನಿಯಂತಿರುತ್ತವೆ):
ನಾವು ಲುಗಾಂಡಾವನ್ನೂ ಪ್ರಯತ್ನಿಸಿದ್ದೇವೆ. ಮೊದಲ ಕರೆಯಲ್ಲಿ, ಅದು ಬದಲಿಗೆ ಸ್ವಾಹಿಲಿಯಲ್ಲಿ ಉತ್ತರಿಸಿತು. ಎರಡನೇ ಕರೆಯಲ್ಲಿ, ಅದು ಲುಗಾಂಡಾ ಮಾತನಾಡಿತು—ಸಾಮಾನ್ಯ ಮಾದರಿಯಿಂದ ನಾವು ನಿರೀಕ್ಷಿಸಿದ್ದಕ್ಕಿಂತ ಸಹಜವಾಗಿ—ಆದರೆ ಮತ್ತೆ ಗಾಢ ಅಮೆರಿಕನ್ ಉಚ್ಚಾರಣೆಯೊಂದಿಗೆ. ನಾವು ಪ್ರತಿಯೊಂದು ಭಾಷೆಯನ್ನೂ ಪರೀಕ್ಷಿಸಿಲ್ಲ, ಆದರೆ ಉಚ್ಚಾರಣೆಯ ಈ ಮಾದರಿ ಬಹುಶಃ ಸಾಮಾನ್ಯವಾಗಿ ಅನ್ವಯಿಸುತ್ತದೆ ಎಂದು ನಾವು ನಿರೀಕ್ಷಿಸುತ್ತೇವೆ. ಇಂಗ್ಲಿಷ್-ಮಾತ್ರದ ಏಜೆಂಟ್ಗೆ ಅದು ಮುಖ್ಯವಲ್ಲ, ಆದರೆ ಇತರ ಭಾಷೆಗಳ ಬಳಕೆಯ ಸಂದರ್ಭಗಳಿಗೆ ಇದು ಸಾಕಷ್ಟು ಮಹತ್ವದ ಎಚ್ಚರಿಕೆಯಾಗಿದೆ.
ತಿಳಿದುಕೊಳ್ಳಬೇಕಾದ ಕೆಲವು API ಮಿತಿಗಳು
ಈ ವಾರ ನಾವು ಕಂಡುಕೊಂಡದ್ದರ ಆಧಾರದ ಮೇಲೆ, ನೈಜ ಏಜೆಂಟ್ಗೆ ಕೆಲವು API ಮಿತಿಗಳು ಮುಖ್ಯವಾಗಿವೆ:
- ಸೆಷನ್ ಆರಂಭವಾದ ನಂತರ ಸೂಚನೆಗಳನ್ನು ಬದಲಾಯಿಸಲಾಗುವುದಿಲ್ಲ, ಮತ್ತು ಅವು 16,384 ಟೋಕನ್ಗಳಿಗೆ ಸೀಮಿತವಾಗಿವೆ.
- ಔಟ್ಪುಟ್ ಆಡಿಯೊ ಸ್ಟ್ರೀಮಿಂಗ್ ಎಂದಿಗೂ ನಿಲ್ಲುವುದಿಲ್ಲ — ಮೌನವೂ ಸ್ಟ್ರೀಮ್ ಆಗುತ್ತದೆ — ಆದ್ದರಿಂದ ತಿರುವುಗಳನ್ನು ವಿಭಾಗಿಸಬೇಕಾದ ಬಳಕೆಯ ಸಂದರ್ಭಗಳಲ್ಲಿ "ಆಡಿಯೊ ನಿಂತಿದೆ" ಎಂಬುದನ್ನು ತಿರುವಿನ ಅಂತ್ಯದ ಸಂಕೇತವಾಗಿ ಬಳಸಲಾಗುವುದಿಲ್ಲ.
- ಇದು ಹೊಸ
v1/live/sessionsಎಂಡ್ಪಾಯಿಂಟ್ ಮೂಲಕ ಮಾತ್ರ ಲಭ್ಯವಿದೆ, ಮತ್ತು ನಾವು ಪರಿಶೀಲಿಸಿದಾಗ ಅದು ಇನ್ನೂ Azure ನಲ್ಲಿ ಲಭ್ಯವಿರಲಿಲ್ಲ.
ಇದುವರೆಗಿನ ನಮ್ಮ ಅಭಿಪ್ರಾಯ
ಉತ್ಪಾದನಾ ಫೋನ್ ಏಜೆಂಟ್ಗಳು ಸಹಜವಾಗಿ ಧ್ವನಿಸಬೇಕು ಮತ್ತು ಸ್ಕ್ರಿಪ್ಟ್ಗಳನ್ನು ನಿರಂತರವಾಗಿ ಅನುಸರಿಸಬೇಕು. GPT-Live-1 ಮೊದಲನೆಯದರಲ್ಲಿ ಅದ್ಭುತವಾಗಿದೆ, ಆದರೆ ಎರಡನೆಯದರಲ್ಲಿ ಕೆಲವು ಗಂಭೀರ ಸಮಸ್ಯೆಗಳಿವೆ. ಸಮಯ ಕಳೆದಂತೆ ನಾವು ಇನ್ನಷ್ಟು ಪರೀಕ್ಷೆಗಳನ್ನು ನಡೆಸುತ್ತೇವೆ ಮತ್ತು ನಮ್ಮ ಕಂಡುಹಿಡಿಕೆಗಳನ್ನು ವರದಿ ಮಾಡುತ್ತಲೇ ಇರುತ್ತೇವೆ.