ThunderPhone 2.0 đã chính thức ra mắt.Tự thiết lập, từ 2 xu/phút.Xem thông báo ra mắt
Tất cả bài viết

Ấn tượng đầu tiên của chúng tôi về API GPT-Live-1 dành cho tác nhân AI giọng nói

12 tháng 9, 2026Alex Kolchinski

OpenAI đã phát hành GPT-Live-1, mô hình giọng nói song công hoàn toàn mới của họ, trên API cách đây hai ngày. Chúng tôi xây dựng và vận hành tác nhân AI qua điện thoại trong môi trường production, nên đã gắn nó vào một số điện thoại thật và gọi thử. Rất nhiều lần.

Chúng tôi đã thử nghiệm với một kịch bản sàng lọc khách hàng tiềm năng khoảng 13.000 token của một khách hàng bảo hiểm, bao gồm các câu bắt buộc phải đọc nguyên văn, quy tắc đọc lại nghiêm ngặt và các câu hỏi tiếp nối theo nhánh. Trong một ngày dài, chúng tôi thực hiện 12 cuộc gọi điện thoại thật, khoảng 25 cuộc phỏng vấn mô phỏng và một loạt thử nghiệm không cấu trúc.

Đây là những ấn tượng đầu tiên của chúng tôi, kèm bản chép lời và âm thanh. Một bài phân tích sâu hơn sẽ sớm được đăng.

Bản chép lời lấy từ các cuộc gọi thử nghiệm của chúng tôi, được GPT-Live phiên âm. Chúng tôi đã thay đổi tên và cách diễn đạt có thể nhận diện danh tính, lược bớt các lượt trao đổi và gộp các đoạn bị tách. Dấu thời gian, tính bằng giây từ đầu cuộc gọi, lấy từ bản gốc.

Độ tự nhiên vượt trội

GPT-Live-1 là người đối thoại có giọng nói tự nhiên nhất mà chúng tôi từng đưa lên đường dây điện thoại. Đây là một bước tiến thực sự.

Nó lắng nghe và nói trên một luồng âm thanh liên tục, không có các giai đoạn phiên âm và tổng hợp riêng biệt. Hầu hết cơ chế hội thoại đều hoạt động trơn tru. Người gọi nghe được âm thanh đầu tiên của nó khoảng 1,3 giây sau khi ngừng nói (trung vị), hoặc khoảng 0,7 giây nếu không tính chặng điện thoại. Chúng tôi không thêm phát hiện hoạt động giọng nói hay logic phân lượt nào. Nó xử lý ngắt lời một cách mượt mà, tạo phản hồi đệm tự nhiên ("Mm-hmm") và nói với nhịp nhanh, giống con người.

Khi được đưa mục tiêu thay vì câu thoại phải đọc, nó điều chỉnh câu hỏi theo cuộc trò chuyện và tiếp nhận sửa đổi một cách tự nhiên:

Caller · 47.0Um, no, it's nine twenty, uh, seventy
Agent · 49.9Thanks for clarifying. So, September twentieth, nineteen seventy, right?
Caller · 56.5Yeah
Agent · 56.7Thanks. Pulling that up. Are you still renting your home?
Caller · 64.5Uh, not anymore now. I uh own my home now
Agent · 67.4Thanks, so you own your home. Is that a house, a condo, or a mobile home?

Nó không hề mất bình tĩnh trước các sửa đổi, ngắt lời hay người gọi thay đổi câu trả lời giữa cuộc gọi. Nếu độ tự nhiên là toàn bộ công việc, bài viết này đã có thể kết thúc tại đây. Đáng tiếc là còn nhiều điều hơn thế.

Nó không tuân thủ chỉ dẫn một cách đáng tin cậy

GPT-Live-1 không tuân thủ chỉ dẫn một cách đáng tin cậy ở những hành vi quan trọng đối với một cuộc gọi điện thoại theo kịch bản.

Nhiều hơn một lần, nó phản hồi với một câu "có" rõ ràng như thể câu trả lời là "không", hỏi lại câu hỏi hoặc chuyển tiếp như thể người gọi đã từ chối.

Lỗi nhất quán nhất là hiểu chỉ dẫn quá theo nghĩa đen. Prompt của chúng tôi nói: nếu người gọi cho biết tình trạng nhà ở trong hồ sơ là sai, hãy hỏi họ sở hữu nhà, thuê nhà hay sống cùng cha mẹ. Một người gọi nói "không, giờ tôi sở hữu rồi", vốn đã trả lời câu hỏi đó. Dù vậy, mô hình vẫn đọc toàn bộ lựa chọn:

Agent · 70.0...you listed as renting your home. Is that still correct?
Caller · 75.1Um, no, I own it now
Agent · 76.6Now, do you own your home, rent your home, live with your parents, or have some other housing situation?

Một số điểm kỳ lạ ban đầu là lỗi từ prompt của chúng tôi, nhưng tính quá sát mặt chữ này vẫn xuất hiện ở mọi biến thể prompt mà chúng tôi thử. Bất kỳ câu trả lời nào chúng tôi chưa nêu rõ đều được xử lý máy móc thay vì hợp lý.

Đôi khi nó cũng suy nghĩ thành tiếng khi chịu áp lực:

Agent · 96.3Thanks. One moment.
Agent · 98.0Hmm. Handling this one carefully.
Agent · 101.4I'll acknowledge it and move on.
Agent · 107.1Thanks. And just to confirm, you're married, right?

Số và ký tự chữ-số tiềm ẩn rủi ro

Cách viết, địa chỉ, ngày sinh và số ID phải chính xác tuyệt đối. Đây là điểm mà phần giọng nói của GPT-Live-1 gặp nhiều vấn đề nhất.

Chúng tôi nghe thấy nó bỏ sót và thay thế ký tự trong các chuỗi chữ-số. Ở đây, nó đọc một số hồ sơ khiếu nại giả; các đoạn âm thanh không được chỉnh sửa ngoài việc cắt khoảng lặng. Trong tiếng Anh, bản chép lời của nó đúng nhưng âm thanh lại thêm một chữ "Y":

Told to say8KD2 - QX7B - M4V9
Actually said8KD2 - QXY7B - M4V9
extra "Y"
GPT-Live-1 · Tiếng AnhĐọc lại số hồ sơ khiếu nại, đầu ra chưa chỉnh sửa
0:00 / 0:08

Trong tiếng Nga còn tệ hơn: chữ "Q" trở thành chữ "X" cả trong âm thanh lẫn bản chép lời.

Told to say8KD2 - QX7B - M4V9
Actually saidвосемь кэй дэ два, тире, икс икс семь бэ, тире, эм четыре вэ девять
Which is8KD2 - XX7B - M4V9
"Q" became "X"
GPT-Live-1 · Tiếng NgaCùng mã đó, được đọc bằng tiếng Nga
0:00 / 0:08

Ngày tháng cũng gặp vấn đề tương tự. Một người gọi cung cấp ngày sinh dưới dạng chữ số, nhưng sau đó mô hình lại đọc lại thành một con số:

Caller · 159.7Uh five five ninety five
Caller · 192.8Wait, what did you get uh, Roberto's birthday as
Agent · 197.2So that's fifty-five ninety-five?
Caller · 203.6Oh what are you talking about
Caller · 210.2I don't know what you mean by fifty five ninety five, that's not a birthday

Đôi khi nó cũng nói một câu vốn thuộc về người gọi:

Agent · 74.7Do you currently have car insurance?
Agent · 78.5Do you currently I do.
Caller · 79.4I do

Giọng trong các ngôn ngữ khác

Chúng tôi thử nghiệm các mô hình giọng nói mới trên 47 ngôn ngữ mà sản phẩm hỗ trợ. Tiếng Nga của GPT-Live-1 trôi chảy nhưng mang giọng Mỹ rất đậm (trong khi các giọng TTS chúng tôi chạy trong môi trường production thường nghe như người bản ngữ):

Здравствуйте! Меня зовут Катя, я виртуальный агент вашей автостраховой. Лицензированный специалист скоро подключится, а пока, не против ли вы, если я задам пару вопросов, чтобы ускорить оформление полиса?
GPT-Live-1 · Lời chào bằng tiếng NgaKatya mở đầu cuộc gọi
0:00 / 0:13

Chúng tôi cũng thử tiếng Luganda. Trong cuộc gọi đầu tiên, nó trả lời bằng tiếng Swahili. Trong cuộc gọi thứ hai, nó nói tiếng Luganda, tự nhiên hơn chúng tôi kỳ vọng ở một mô hình tổng quát, nhưng vẫn mang giọng Mỹ rất đậm. Chúng tôi chưa thử mọi ngôn ngữ, nhưng cho rằng kiểu giọng này có lẽ áp dụng rộng rãi. Điều đó không quan trọng với tác nhân AI chỉ dùng tiếng Anh, nhưng là một điểm cần lưu ý khá lớn cho các trường hợp sử dụng bằng ngôn ngữ khác.

Một vài giới hạn API đáng biết

Dựa trên những gì chúng tôi phát hiện trong tuần này, một số giới hạn API có ý nghĩa quan trọng với một tác nhân AI thực tế:

  • Hướng dẫn không thể thay đổi sau khi phiên bắt đầu, và bị giới hạn ở 16.384 token.
  • Âm thanh đầu ra không bao giờ ngừng stream — cả khoảng lặng cũng được stream — vì vậy không thể dùng "âm thanh đã dừng" làm tín hiệu kết thúc lượt nói cho các trường hợp sử dụng cần phân tách lượt nói.
  • API này chỉ có thể truy cập qua endpoint mới v1/live/sessions, và vẫn chưa có trên Azure vào thời điểm chúng tôi kiểm tra.

Ấn tượng của chúng tôi đến thời điểm này

Tác nhân AI qua điện thoại trong môi trường production phải nghe tự nhiên và tuân thủ kịch bản một cách nhất quán. GPT-Live-1 rất ấn tượng ở điều đầu tiên, nhưng có một số vấn đề nghiêm trọng ở điều thứ hai. Chúng tôi sẽ tiếp tục chạy thêm thử nghiệm theo thời gian và báo cáo các phát hiện của mình.