Hầu hết nền tảng AI giọng nói đều dựa vào quy trình 3 bước: một mô hình chuyển giọng nói thành văn bản, một LLM không có khả năng suy luận và một công cụ chuyển văn bản thành giọng nói. Chỉ cần một bước gặp lỗi, cả hệ thống có thể thất bại. ThunderPhone giảm sai sót bằng cách điều phối đồng thời nhiều mô hình.
ThunderPhone điều phối nhiều mô hình cùng lúc, giúp chúng sửa lỗi cho nhau.
LLM nhanh chỉ đọc bản chép lời.
“Chào Huệ — tôi có thể giúp gì cho bạn?”
LLM nhanh + LLM suy luận cùng đối chiếu: 2 trong 3 luồng cho kết quả trùng khớp.
“Đã hiểu — vậy là bạn thuê.”
BBA đánh giá xem mô hình có hiểu được prompt bằng giọng nói và trả lời chính xác các câu hỏi khó hay không. Cấu hình Storm mạnh nhất của chúng tôi hiện giữ kỷ lục: 99.4% trên bộ đánh giá công khai của chúng tôi.
0.6% tỷ lệ lỗi
Kết quả của ThunderPhone được lấy từ bộ dữ liệu đánh giá công khai của chúng tôi theo liên kết ở trên; các điểm số công khai khác (bảng xếp hạng Artificial Analysis) được liệt kê để tham khảo.
Các nền tảng AI giọng nói khác như Vapi, Retell, Pipecat và LiveKit buộc bạn phải tự đưa ra hàng loạt quyết định về cấu hình để cuộc gọi có thể hoạt động. Tại ThunderPhone, chúng tôi xem việc tinh chỉnh là trách nhiệm của mình, để bạn tốn ít công sức nhất có thể mà cuộc gọi vẫn vận hành mượt mà.
ThunderPhone lo toàn bộ phần tinh chỉnh cho bạn
Spark, Bolt hoặc Storm.
Được tuyển chọn kỹ và kiểm thử qua các cuộc gọi thực tế.
Hành vi, chính sách, công cụ — chỉ cần mô tả bằng ngôn ngữ tự nhiên.
Chỉ cần 3 lựa chọn là xong phần thiết lập — khả năng điều phối, cơ chế dự phòng và tinh chỉnh đều được tích hợp sẵn.
Chúng tôi chọn mô hình tốt nhất cho từng tác vụ rồi kết hợp chúng thành một hệ thống thống nhất. Các mô hình tiên tiến hàng đầu từ OpenAI, Anthropic và Google hoạt động cùng các mô hình mã nguồn mở — tất cả được điều phối để mang lại hiệu năng và mức giá tốt nhất cho từng cuộc gọi, nên bạn không cần phải bận tâm.
Công cụ dựng luồng ra đời vì các hệ thống yếu hơn không thể làm theo prompt phức tạp. Mỗi bước trong cuộc hội thoại trở thành một node mà bạn phải tự xây dựng và bảo trì. Storm làm theo cả bộ chỉ dẫn chi tiết chỉ từ một prompt, nên bạn không còn phải bận tâm đến node hay đường nối.
6 nút cho một luồng đăng ký — mỗi nút có prompt, công cụ, bước chuyển và cơ chế xử lý lỗi riêng.
Chào người gọi và thu thập tên cùng số điện thoại của họ. Xác nhận sự đồng ý trước khi đăng ký — đây là điều bắt buộc. Nếu họ hỏi về thanh toán, hãy làm theo chính sách thanh toán bên dưới. Chỉ gọi enroll() sau khi tất cả các trường đã được xác nhận. Nếu người gọi yêu cầu gặp người thật, hãy chuyển máy cho người thật.
Bạn chỉ cần viết, kiểm thử và tinh chỉnh một prompt duy nhất — đã bao gồm cả logic phân nhánh.
Giọng nói lí nhí, tiếng trò chuyện xung quanh, tên riêng và dãy số, nhiều ngôn ngữ đan xen — ThunderPhone được xây dựng để xử lý những tình huống khiến các hệ thống khác bó tay.
Đối chiếu tín hiệu âm thanh với tín hiệu văn bản, thay vì chỉ dựa vào một bản chép lời.
Các mô hình nhận diện và khử nhiễu giúp làm sạch tín hiệu.
Nhận diện các cuộc trò chuyện ngoài luồng trước khi chúng khiến tác nhân AI phản hồi sai.
Đối chiếu chéo tên riêng, cách viết, con số và thông tin đính chính.
Định tuyến qua các luồng âm thanh và giọng nói hỗ trợ đa ngôn ngữ khi cần.
Áp dụng luồng suy luận mạnh hơn khi hành vi không thể gói gọn trong một quy tắc.
AI giọng nói qua điện thoại phải phản hồi nhanh — nhưng nhanh mà không đúng thì chỉ là mắc lỗi nhanh hơn. Các LLM hiện nay cần chút thời gian để suy luận nhằm duy trì độ tin cậy, vì vậy ThunderPhone cân bằng độ trễ với độ chính xác.
Các nhà cung cấp khác công bố độ trễ 500 ms trong điều kiện lý tưởng, nhưng thường ở mức khoảng 2 giây khi gọi thực tế. Chúng tôi đo độ trễ trong điều kiện thực tế.
Các nhà cung cấp AI gặp những đợt độ trễ tăng vọt, có thể khiến cuộc gọi mất nhịp. Khi đó, hệ thống do ThunderPhone điều phối sẽ tự động chuyển sang phương án nhanh hơn.
Các cuộc gọi tự động vốn luôn gây khó chịu… cho đến bây giờ. Mỗi làn sóng công nghệ đều giúp trải nghiệm tốt hơn, nhưng chưa bao giờ thực sự trơn tru. ThunderPhone thay đổi điều đó.
“Bấm phím 1 để gặp bộ phận kinh doanh, phím 2 để được hỗ trợ.” Menu chỉ có thể định tuyến cuộc gọi.
Nói “kinh doanh” hoặc “thanh toán” rồi hy vọng bộ phân tích slot nhận đúng.
Chuyển lời nói thành văn bản, hỏi nhanh một LLM rồi phát lời đáp — mỗi bước đều mặc nhiên tin vào kết quả của bước trước.
Âm thanh, văn bản, khả năng suy luận, công cụ, giọng nói và cơ chế bảo vệ trong một hệ thống duy nhất.
Đi vào hoạt động chỉ trong 10 phút. Chỉ từ 2¢/phút.