Công nghệ

Vượt xa quy trình 3 bước.

Hầu hết nền tảng AI giọng nói dựa vào quy trình 3 bước: một mô hình phiên âm, một LLM không suy luận, một công cụ chuyển văn bản thành giọng nói. Mỗi bước đều là một điểm lỗi duy nhất. ThunderPhone giảm sai sót bằng cách điều phối nhiều mô hình cùng lúc.

Người gọi nói “Tôi thuê.”
ASR A“Tôi thuê”
ASR B“Tôi là Huệ”
LLM âm thanh“Tôi thuê”
Đã đối chiếu “Tôi thuê” 2 trong 3 luồng cho kết quả giống nhau
Kiến trúc tích hợp

Nghe theo nhiều cách, rồi đối chiếu.

ThunderPhone điều phối nhiều mô hình cùng lúc, giúp chúng sửa lỗi cho nhau.

Nền tảng khác · quy trình 3 bước

Mỗi bước đều tin vào bước trước.

Âm thanh người gọi
“Tôi thuê.” · nói lí nhí
STT A
“Tôi là Huệ”
STT B
LLM âm thanh
Không có phương án dự phòng khi một mô hình nghe nhầm
LLM
Một mô hình nhanh chỉ xem bản chép lời.
→ trả lời “Chào Huệ — tôi có thể giúp gì?”
LLM nhanh mắc lỗi khi làm theo hướng dẫn
TTS
Câu trả lời được đọc lại thành tiếng.
→ nói “Chào Huệ — tôi có thể giúp gì?” ✗
1 bản chép lời + 1 LLM = câu trả lời sai
ThunderPhone · điều phối

Nhiều luồng, một câu trả lời được phối hợp.

Âm thanh người gọi
“Tôi thuê.” · nói lí nhí
STT A
“Tôi thuê”
STT B
“Tôi là Huệ”
LLM âm thanh
“Tôi thuê”
Lưu 3 bản chép lời + âm thanh gốc làm bằng chứng
Lớp suy luận
LLM nhanh + LLM suy luận đánh giá bằng chứng từ văn bản và âm thanh.
→ 2 trong 3 luồng đồng ý: “Tôi thuê”
LLM suy luận + LLM nhanh đối chiếu chéo trước khi trả lời
TTS
Các giọng nói được chọn lọc giảm thiểu ảo giác về cách đánh vần và chuỗi chữ-số.
→ “Đã hiểu — vậy bạn thuê.” ✓
Nắm đúng các chi tiết khó ngay từ lần đầu.
Bằng chứng hiệu năng

Storm lập kỷ lục về trí thông minh trên Big Bench Audio.

BBA kiểm tra liệu một mô hình có thể hiểu prompt lời nói và trả lời đúng các câu hỏi khó hay không. Cấu hình Storm mạnh nhất của chúng tôi đạt 99,4% trên bộ đánh giá công khai — 0,6% lỗi, ít hơn 4× so với điểm số công khai tốt nhất tiếp theo.

Mô hình
Tỷ lệ lỗi↓ thấp hơn là tốt hơn
Điểm số
ThunderPhone Storm · Extra IntelligenceÍt lỗi hơn 4×
0.6%
Step-Audio R1.1
2.4%
Grok Voice Think Fast
2.9%
Ultravox v0.7 Thinking
3.0%
GPT-Realtime-2 High
3.4%
Gemini 3.1 Flash Live High
3.4%
Xem bộ dữ liệu đánh giá BBA-Storm trên Hugging Face

Tỷ lệ lỗi bằng 100% trừ đi tỷ lệ thành công BBA. Kết quả của ThunderPhone lấy từ bộ dữ liệu đánh giá công khai của chúng tôi, được liên kết ở trên; các điểm số công khai khác (bảng xếp hạng Artificial Analysis) được liệt kê để tham khảo. BBA chưa phản ánh đầy đủ hiệu năng cuộc gọi điện thoại, nhưng là một tín hiệu hữu ích về khả năng suy luận dựa trên prompt lời nói.

Được định hướng sẵn tốt hơn khả năng tùy chỉnh

Bạn không nên phải tự lắp ghép một ngăn xếp giọng nói bằng tay.

Các nền tảng AI giọng nói khác như Vapi, Retell, Pipecat và LiveKit buộc bạn phải đưa ra rất nhiều quyết định cấu hình để cuộc gọi hoạt động. Tại ThunderPhone, chúng tôi tin rằng tinh chỉnh là công việc của chúng tôi, và bạn chỉ nên cần làm ít việc nhất có thể để cuộc gọi vận hành trơn tru.

Các nền tảng AI giọng nói khác · nhiều tham số cần tinh chỉnh
STT LLM TTS Xác định điểm kết thúc Khử nhiễu Ngắt lời Phương án dự phòng Lược đồ công cụ Độ trễ VAD
ThunderPhone tinh chỉnh tất cả điều này cho bạn
ThunderPhone · ba quyết định
1
Chọn một cấp độ
Spark, Bolt hoặc Storm.
2
Chọn một giọng nói
Được tuyển chọn, thử nghiệm trên cuộc gọi thực tế.
3
Viết prompt của bạn
Hành vi, chính sách, công cụ — ngôn ngữ tự nhiên.
Ba quyết định. Đó là toàn bộ thiết lập — điều phối, phương án dự phòng và tinh chỉnh đều được tích hợp sẵn.
Chúng tôi chọn những mô hình tốt nhất cho từng tác vụ và kết nối chúng lại với nhau. Các mô hình tiên tiến từ OpenAI, Anthropic và Google hoạt động cùng các mô hình mã nguồn mở — được điều phối để đạt hiệu năng và mức giá tốt nhất trong mỗi cuộc gọi, để bạn không phải bận tâm về điều đó.
Một prompt, ít sơ đồ rườm rà hơn

Một prompt, không phải một sơ đồ nút.

Các trình xây dựng luồng tồn tại vì những hệ thống yếu hơn không thể làm theo prompt phức tạp. Mỗi bước hội thoại trở thành một nút mà bạn phải tự xây dựng và duy trì. Storm làm theo hướng dẫn phong phú từ một prompt duy nhất, để bạn không phải bận tâm về nút và liên kết.

Nền tảng xây dựng luồng

Tự kết nối từng nhánh.

Lời chàoprompt · giọng nói
Thu thập số điện thoạiprompt · xác thực
Xác nhận số điện thoạinhắc lại ×2
enroll()công cụ · thử lại
Chuyển cấp xử lýchuyển cho người thật
Dự phòngxử lý mọi trường hợp
không hợp lệ ×2lỗi
Sáu nút cho một luồng đăng ký — mỗi nút có prompt, công cụ, chuyển tiếp và cách xử lý lỗi riêng.
ThunderPhone Storm

Mô tả hành vi một lần.

Prompt hành vi
Chào người gọi và thu thập tên cùng số điện thoại của họ.
Xác nhận sự đồng ý trước khi đăng ký — bắt buộc.
Nếu họ hỏi về thanh toán, hãy tuân theo chính sách thanh toán bên dưới.
Chỉ gọi enroll() sau khi mọi trường đều đã được xác nhận.
Nếu người gọi muốn gặp người thật, chuyển máy cho nhân viên.
Phân nhánh phức tạp Bộ giám sát tùy chọn Lặp lại dễ dàng hơn
Một prompt để viết, kiểm thử và lặp lại — đã bao gồm phân nhánh.
Vì sao điều này quan trọng

Cuộc gọi thực tế luôn phức tạp. ThunderPhone đã sẵn sàng.

Lời nói lí nhí, tiếng trò chuyện nền, tên và số, ngôn ngữ lẫn lộn — ThunderPhone được xây dựng cho những tình huống khiến các hệ thống khác gặp trục trặc.

Lời nói lí nhí

So sánh tín hiệu âm thanh và văn bản thay vì tin vào một bản phiên âm duy nhất.

Âm thanh điện thoại kém

Các mô hình nhận diện và giảm nhiễu làm sạch tín hiệu.

Tiếng trò chuyện nền

Nhận diện các cuộc trò chuyện bên lề trước khi chúng làm tác nhân AI mất phương hướng.

Tên & địa chỉ

Đối chiếu chéo danh từ riêng, cách viết, số và các chỉnh sửa.

Lời nói pha trộn ngôn ngữ

Định tuyến qua các luồng âm thanh và giọng nói đa ngôn ngữ khi cần.

Prompt dài

Dùng các luồng suy luận mạnh hơn khi hành vi không thể rút gọn thành một quy tắc.

Độ trễ, chất lượng & chi phí

Câu trả lời sai nhanh hơn không tạo nên cuộc gọi tốt hơn.

AI điện thoại phải phản hồi nhanh — nhưng tốc độ không đi cùng độ chính xác chỉ khiến sai sót xảy ra nhanh hơn. Các LLM hiện nay cần một chút thời gian để suy luận và duy trì độ tin cậy, nên ThunderPhone cân bằng cả hai theo từng gói.

Spark
~3s
đến phản hồi đầu tiên
Bolt
~2s
đến phản hồi đầu tiên
Storm
~2–3s
~2 giây có phản hồi xác nhận · ~3 giây không có
Đo lườngCác nhà cung cấp khác tuyên bố độ trễ 500ms trong điều kiện lý tưởng, nhưng thường mất khoảng 2 giây trong một cuộc gọi thực tế.Chúng tôi đo độ trễ trong điều kiện thực tế.
Khả năng phục hồiCác nhà cung cấp AI gặp những đợt tăng đột biến độ trễ có thể làm gián đoạn cuộc gọi.Hệ thống điều phối của ThunderPhone chuyển sang các lựa chọn nhanh hơn khi điều này xảy ra.
Các thế hệ AI giọng nói

Thế hệ tiếp theo của AI giọng nói đã xuất hiện

Các cuộc gọi điện thoại tự động từng là trải nghiệm gây khó chịu...cho đến bây giờ. Mỗi làn sóng công nghệ đều cải thiện trải nghiệm, nhưng chưa bao giờ đến mức thực sự mượt mà. ThunderPhone thay đổi điều đó.

1990s2010s20242026 · hiện nay
Thế hệ 1

IVR

Nhấn một để gặp bộ phận bán hàng, nhấn hai để được hỗ trợ. Menu chỉ có thể định tuyến.

Thế hệ 2

Bot ý định

Nói “bán hàng” hoặc “thanh toán” và hy vọng bộ phân tích trường nhận đúng.

Thế hệ 3

AI ba bước

Phiên âm, hỏi một LLM nhanh, rồi nói — mỗi bước đều tin vào bước trước.

Thế hệ 4

AI tích hợp

Âm thanh, văn bản, suy luận, công cụ, giọng nói và hàng rào bảo vệ trong một hệ thống.

Được xây dựng cho những cuộc gọi làm mọi thứ khác thất bại

Khám phá hệ thống tích hợp
trên những cuộc gọi khó nhất của bạn.

Triển khai trong mười phút. Từ 2¢/phút.