Ấn tượng đầu tiên của chúng tôi về API GPT-Live-1 dành cho tác nhân AI giọng nói
OpenAI đã phát hành GPT-Live-1, mô hình giọng nói song công hoàn toàn mới của họ, trên API cách đây hai ngày. Chúng tôi xây dựng và vận hành tác nhân AI qua điện thoại trong môi trường production, nên đã gắn nó vào một số điện thoại thật và gọi thử. Rất nhiều lần.
Chúng tôi đã thử nghiệm với một kịch bản sàng lọc khách hàng tiềm năng khoảng 13.000 token của một khách hàng bảo hiểm, bao gồm các câu bắt buộc phải đọc nguyên văn, quy tắc đọc lại nghiêm ngặt và các câu hỏi tiếp nối theo nhánh. Trong một ngày dài, chúng tôi thực hiện 12 cuộc gọi điện thoại thật, khoảng 25 cuộc phỏng vấn mô phỏng và một loạt thử nghiệm không cấu trúc.
Đây là những ấn tượng đầu tiên của chúng tôi, kèm bản chép lời và âm thanh. Một bài phân tích sâu hơn sẽ sớm được đăng.
Bản chép lời lấy từ các cuộc gọi thử nghiệm của chúng tôi, được GPT-Live phiên âm. Chúng tôi đã thay đổi tên và cách diễn đạt có thể nhận diện danh tính, lược bớt các lượt trao đổi và gộp các đoạn bị tách. Dấu thời gian, tính bằng giây từ đầu cuộc gọi, lấy từ bản gốc.
Độ tự nhiên vượt trội
GPT-Live-1 là người đối thoại có giọng nói tự nhiên nhất mà chúng tôi từng đưa lên đường dây điện thoại. Đây là một bước tiến thực sự.
Nó lắng nghe và nói trên một luồng âm thanh liên tục, không có các giai đoạn phiên âm và tổng hợp riêng biệt. Hầu hết cơ chế hội thoại đều hoạt động trơn tru. Người gọi nghe được âm thanh đầu tiên của nó khoảng 1,3 giây sau khi ngừng nói (trung vị), hoặc khoảng 0,7 giây nếu không tính chặng điện thoại. Chúng tôi không thêm phát hiện hoạt động giọng nói hay logic phân lượt nào. Nó xử lý ngắt lời một cách mượt mà, tạo phản hồi đệm tự nhiên ("Mm-hmm") và nói với nhịp nhanh, giống con người.
Khi được đưa mục tiêu thay vì câu thoại phải đọc, nó điều chỉnh câu hỏi theo cuộc trò chuyện và tiếp nhận sửa đổi một cách tự nhiên:
Nó không hề mất bình tĩnh trước các sửa đổi, ngắt lời hay người gọi thay đổi câu trả lời giữa cuộc gọi. Nếu độ tự nhiên là toàn bộ công việc, bài viết này đã có thể kết thúc tại đây. Đáng tiếc là còn nhiều điều hơn thế.
Nó không tuân thủ chỉ dẫn một cách đáng tin cậy
GPT-Live-1 không tuân thủ chỉ dẫn một cách đáng tin cậy ở những hành vi quan trọng đối với một cuộc gọi điện thoại theo kịch bản.
Nhiều hơn một lần, nó phản hồi với một câu "có" rõ ràng như thể câu trả lời là "không", hỏi lại câu hỏi hoặc chuyển tiếp như thể người gọi đã từ chối.
Lỗi nhất quán nhất là hiểu chỉ dẫn quá theo nghĩa đen. Prompt của chúng tôi nói: nếu người gọi cho biết tình trạng nhà ở trong hồ sơ là sai, hãy hỏi họ sở hữu nhà, thuê nhà hay sống cùng cha mẹ. Một người gọi nói "không, giờ tôi sở hữu rồi", vốn đã trả lời câu hỏi đó. Dù vậy, mô hình vẫn đọc toàn bộ lựa chọn:
Một số điểm kỳ lạ ban đầu là lỗi từ prompt của chúng tôi, nhưng tính quá sát mặt chữ này vẫn xuất hiện ở mọi biến thể prompt mà chúng tôi thử. Bất kỳ câu trả lời nào chúng tôi chưa nêu rõ đều được xử lý máy móc thay vì hợp lý.
Đôi khi nó cũng suy nghĩ thành tiếng khi chịu áp lực:
Số và ký tự chữ-số tiềm ẩn rủi ro
Cách viết, địa chỉ, ngày sinh và số ID phải chính xác tuyệt đối. Đây là điểm mà phần giọng nói của GPT-Live-1 gặp nhiều vấn đề nhất.
Chúng tôi nghe thấy nó bỏ sót và thay thế ký tự trong các chuỗi chữ-số. Ở đây, nó đọc một số hồ sơ khiếu nại giả; các đoạn âm thanh không được chỉnh sửa ngoài việc cắt khoảng lặng. Trong tiếng Anh, bản chép lời của nó đúng nhưng âm thanh lại thêm một chữ "Y":
Trong tiếng Nga còn tệ hơn: chữ "Q" trở thành chữ "X" cả trong âm thanh lẫn bản chép lời.
Ngày tháng cũng gặp vấn đề tương tự. Một người gọi cung cấp ngày sinh dưới dạng chữ số, nhưng sau đó mô hình lại đọc lại thành một con số:
Đôi khi nó cũng nói một câu vốn thuộc về người gọi:
Giọng trong các ngôn ngữ khác
Chúng tôi thử nghiệm các mô hình giọng nói mới trên 47 ngôn ngữ mà sản phẩm hỗ trợ. Tiếng Nga của GPT-Live-1 trôi chảy nhưng mang giọng Mỹ rất đậm (trong khi các giọng TTS chúng tôi chạy trong môi trường production thường nghe như người bản ngữ):
Chúng tôi cũng thử tiếng Luganda. Trong cuộc gọi đầu tiên, nó trả lời bằng tiếng Swahili. Trong cuộc gọi thứ hai, nó nói tiếng Luganda, tự nhiên hơn chúng tôi kỳ vọng ở một mô hình tổng quát, nhưng vẫn mang giọng Mỹ rất đậm. Chúng tôi chưa thử mọi ngôn ngữ, nhưng cho rằng kiểu giọng này có lẽ áp dụng rộng rãi. Điều đó không quan trọng với tác nhân AI chỉ dùng tiếng Anh, nhưng là một điểm cần lưu ý khá lớn cho các trường hợp sử dụng bằng ngôn ngữ khác.
Một vài giới hạn API đáng biết
Dựa trên những gì chúng tôi phát hiện trong tuần này, một số giới hạn API có ý nghĩa quan trọng với một tác nhân AI thực tế:
- Hướng dẫn không thể thay đổi sau khi phiên bắt đầu, và bị giới hạn ở 16.384 token.
- Âm thanh đầu ra không bao giờ ngừng stream — cả khoảng lặng cũng được stream — vì vậy không thể dùng "âm thanh đã dừng" làm tín hiệu kết thúc lượt nói cho các trường hợp sử dụng cần phân tách lượt nói.
- API này chỉ có thể truy cập qua endpoint mới
v1/live/sessions, và vẫn chưa có trên Azure vào thời điểm chúng tôi kiểm tra.
Ấn tượng của chúng tôi đến thời điểm này
Tác nhân AI qua điện thoại trong môi trường production phải nghe tự nhiên và tuân thủ kịch bản một cách nhất quán. GPT-Live-1 rất ấn tượng ở điều đầu tiên, nhưng có một số vấn đề nghiêm trọng ở điều thứ hai. Chúng tôi sẽ tiếp tục chạy thêm thử nghiệm theo thời gian và báo cáo các phát hiện của mình.