Công nghệ

Bứt khỏi giới hạn của
quy trình 3 bước.

Hầu hết nền tảng AI giọng nói đều dựa vào quy trình 3 bước: một mô hình chuyển giọng nói thành văn bản, một LLM không có khả năng suy luận và một công cụ chuyển văn bản thành giọng nói. Chỉ cần một bước gặp lỗi, cả hệ thống có thể thất bại. ThunderPhone giảm sai sót bằng cách điều phối đồng thời nhiều mô hình.

Người gọi nói “Tôi thuê.”
ASR A“Tôi thuê”
ASR B“Tôi là Huệ”
LLM âm thanh“Tôi thuê”
Đối chiếu thành “Tôi thuê”2 trong 3 luồng cho cùng kết quả

Nghe theo nhiều cách,
rồi đối chiếu để thống nhất kết quả.

ThunderPhone điều phối nhiều mô hình cùng lúc, giúp chúng sửa lỗi cho nhau.

Người gọi nói “Tôi thuê.” — nói lí nhí
Các nền tảng khácQuy trình 3 bước
Chỉ nghe một lần
STT “Tôi là Huệ”
Không có phương án dự phòng khi mô hình duy nhất nghe nhầm
Trả lời nhanh

LLM nhanh chỉ đọc bản chép lời.

Phản hồi

“Chào Huệ — tôi có thể giúp gì cho bạn?”

1 bản chép lời + 1 LLM = câu trả lời sai
ThunderPhoneĐược điều phối
Nghe theo ba cách
“Tôi thuꔓTôi là Huệ”“Tôi thuê”
Lưu lại 3 bản chép lời + âm thanh gốc làm bằng chứng
Đối chiếu

LLM nhanh + LLM suy luận cùng đối chiếu: 2 trong 3 luồng cho kết quả trùng khớp.

Phản hồi

“Đã hiểu — vậy là bạn thuê.”

Xử lý chính xác những chi tiết khó ngay từ lần đầu.

Storm xác lập kỷ lục về trí tuệ trên Big Bench Audio.

BBA đánh giá xem mô hình có hiểu được prompt bằng giọng nói và trả lời chính xác các câu hỏi khó hay không. Cấu hình Storm mạnh nhất của chúng tôi hiện giữ kỷ lục: 99.4% trên bộ đánh giá công khai của chúng tôi.

0.6% tỷ lệ lỗi

· Tháng 7/2026Bộ dữ liệu trên Hugging Face
ThunderPhoneStorm · Extra Intelligence0.6%
Qwen Audio 3.0Realtime Plus0.8%
Qwen3.5 OmniPlus Realtime1.3%
Step-Audio R1.1Realtime2.4%

Kết quả của ThunderPhone được lấy từ bộ dữ liệu đánh giá công khai của chúng tôi theo liên kết ở trên; các điểm số công khai khác (bảng xếp hạng Artificial Analysis) được liệt kê để tham khảo.

Bạn không nên phải tự tay lắp ghép cả một hạ tầng AI giọng nói.

Các nền tảng AI giọng nói khác như Vapi, Retell, Pipecat và LiveKit buộc bạn phải tự đưa ra hàng loạt quyết định về cấu hình để cuộc gọi có thể hoạt động. Tại ThunderPhone, chúng tôi xem việc tinh chỉnh là trách nhiệm của mình, để bạn tốn ít công sức nhất có thể mà cuộc gọi vẫn vận hành mượt mà.

Các nền tảng AI giọng nói khácNhiều tham số phải tinh chỉnh
STTv4-largeSTT dự phòngLLMtemp 0.3LLM dự phòngTTSTTS dự phòngVAD0.62Phát hiện điểm kết thúc lời nói240 msNgưỡng ngắt lời−38 dBBộ lọc phản hồi ngắnXử lý ngắt lờiThời gian chờ lượt thoại800 msKhử nhiễuBộ đệm jitter60 msTần số lấy mẫu8 kHzSchema công cụChính sách thử lại×3Cơ chế dự phòng

ThunderPhone lo toàn bộ phần tinh chỉnh cho bạn

ThunderPhoneBa quyết định
1
Chọn gói

Spark, Bolt hoặc Storm.

2
Chọn giọng nói

Được tuyển chọn kỹ và kiểm thử qua các cuộc gọi thực tế.

3
Viết prompt

Hành vi, chính sách, công cụ — chỉ cần mô tả bằng ngôn ngữ tự nhiên.

Chỉ cần 3 lựa chọn là xong phần thiết lập — khả năng điều phối, cơ chế dự phòng và tinh chỉnh đều được tích hợp sẵn.

Chúng tôi chọn mô hình tốt nhất cho từng tác vụ rồi kết hợp chúng thành một hệ thống thống nhất. Các mô hình tiên tiến hàng đầu từ OpenAI, Anthropic và Google hoạt động cùng các mô hình mã nguồn mở — tất cả được điều phối để mang lại hiệu năng và mức giá tốt nhất cho từng cuộc gọi, nên bạn không cần phải bận tâm.

Một prompt, thay vì
cả một sơ đồ node.

Công cụ dựng luồng ra đời vì các hệ thống yếu hơn không thể làm theo prompt phức tạp. Mỗi bước trong cuộc hội thoại trở thành một node mà bạn phải tự xây dựng và bảo trì. Storm làm theo cả bộ chỉ dẫn chi tiết chỉ từ một prompt, nên bạn không còn phải bận tâm đến node hay đường nối.

Nền tảng xây dựng luồngTự tay nối từng nhánh
Lời chào prompt · giọng nói
Thu thập số điện thoại prompt · kiểm tra hợp lệ
Xác nhận số điện thoại hỏi lại ×2
enroll() công cụ · thử lại
Chuyển cho người thật
Nhánh dự phòng cho mọi trường hợp không hợp lệ ×2 · lỗi

6 nút cho một luồng đăng ký — mỗi nút có prompt, công cụ, bước chuyển và cơ chế xử lý lỗi riêng.

ThunderPhone StormChỉ cần mô tả hành vi một lần
Prompt hành vi

Chào người gọi và thu thập tên cùng số điện thoại của họ. Xác nhận sự đồng ý trước khi đăng ký — đây là điều bắt buộc. Nếu họ hỏi về thanh toán, hãy làm theo chính sách thanh toán bên dưới. Chỉ gọi enroll() sau khi tất cả các trường đã được xác nhận. Nếu người gọi yêu cầu gặp người thật, hãy chuyển máy cho người thật.

Phân nhánh phức tạpCơ chế giám sát tùy chọnDễ tinh chỉnh qua từng vòng

Bạn chỉ cần viết, kiểm thử và tinh chỉnh một prompt duy nhất — đã bao gồm cả logic phân nhánh.

Cuộc gọi khi vận hành thực tế luôn đầy biến số. ThunderPhone đã sẵn sàng.

Giọng nói lí nhí, tiếng trò chuyện xung quanh, tên riêng và dãy số, nhiều ngôn ngữ đan xen — ThunderPhone được xây dựng để xử lý những tình huống khiến các hệ thống khác bó tay.

Lời nói lí nhí

Đối chiếu tín hiệu âm thanh với tín hiệu văn bản, thay vì chỉ dựa vào một bản chép lời.

Âm thanh cuộc gọi kém

Các mô hình nhận diện và khử nhiễu giúp làm sạch tín hiệu.

Tiếng trò chuyện xung quanh

Nhận diện các cuộc trò chuyện ngoài luồng trước khi chúng khiến tác nhân AI phản hồi sai.

Tên & địa chỉ

Đối chiếu chéo tên riêng, cách viết, con số và thông tin đính chính.

Lời nói đan xen nhiều ngôn ngữ

Định tuyến qua các luồng âm thanh và giọng nói hỗ trợ đa ngôn ngữ khi cần.

Prompt dài

Áp dụng luồng suy luận mạnh hơn khi hành vi không thể gói gọn trong một quy tắc.

Trả lời sai nhanh hơn không đồng nghĩa với cuộc gọi tốt hơn.

AI giọng nói qua điện thoại phải phản hồi nhanh — nhưng nhanh mà không đúng thì chỉ là mắc lỗi nhanh hơn. Các LLM hiện nay cần chút thời gian để suy luận nhằm duy trì độ tin cậy, vì vậy ThunderPhone cân bằng độ trễ với độ chính xác.

Spark~3sđến phản hồi đầu tiên
Bolt~2sđến phản hồi đầu tiên
Storm~2–3s~2 giây nếu có lời xác nhận · ~3 giây nếu không
Đo lường

Các nhà cung cấp khác công bố độ trễ 500 ms trong điều kiện lý tưởng, nhưng thường ở mức khoảng 2 giây khi gọi thực tế. Chúng tôi đo độ trễ trong điều kiện thực tế.

Khả năng phục hồi

Các nhà cung cấp AI gặp những đợt độ trễ tăng vọt, có thể khiến cuộc gọi mất nhịp. Khi đó, hệ thống do ThunderPhone điều phối sẽ tự động chuyển sang phương án nhanh hơn.

Thế hệ AI giọng nói mới đã có mặt.

Các cuộc gọi tự động vốn luôn gây khó chịu… cho đến bây giờ. Mỗi làn sóng công nghệ đều giúp trải nghiệm tốt hơn, nhưng chưa bao giờ thực sự trơn tru. ThunderPhone thay đổi điều đó.

1990sThế hệ 1

IVR

“Bấm phím 1 để gặp bộ phận kinh doanh, phím 2 để được hỗ trợ.” Menu chỉ có thể định tuyến cuộc gọi.

2010sThế hệ 2

Bot nhận diện ý định

Nói “kinh doanh” hoặc “thanh toán” rồi hy vọng bộ phân tích slot nhận đúng.

2024Thế hệ 3

AI ba bước

Chuyển lời nói thành văn bản, hỏi nhanh một LLM rồi phát lời đáp — mỗi bước đều mặc nhiên tin vào kết quả của bước trước.

2026 · hiện tạiThế hệ 4

AI tích hợp

Âm thanh, văn bản, khả năng suy luận, công cụ, giọng nói và cơ chế bảo vệ trong một hệ thống duy nhất.

Sinh ra để xử lý những cuộc gọi khiến mọi giải pháp khác bó tay

Thử hệ thống tích hợp của chúng tôi với những cuộc gọi khó nhất của bạn.

Đi vào hoạt động chỉ trong 10 phút. Chỉ từ 2¢/phút.