ThunderPhone 2.0 đã chính thức ra mắt.Tự thiết lập, từ 2 xu/phút.Xem thông báo ra mắt
Tất cả bài viết

Ra mắt ThunderPhone

10 tháng 3, 2026Alex Kolchinski

Cập nhật, tháng 8 năm 2026: Đây là thông báo ra mắt ban đầu của chúng tôi từ tháng 3 năm 2026, được giữ lại để lưu dấu. Một số chi tiết — đặc biệt là giá và các tùy chọn giọng nói — đã thay đổi kể từ đó; xem bảng giá hiện tại để biết thông tin chính xác hôm nay. Và thời gian chờ đợi đã kết thúc: đọc thông báo ra mắt v2!

Hôm nay, chúng tôi tự hào công bố ra mắt công khai ThunderPhone, giúp bạn dễ dàng tự động hóa các cuộc gọi điện thoại bằng AI. Với kiến trúc tích hợp hoàn toàn khác biệt so với các nền tảng AI điện thoại khác, ThunderPhone có thể đạt hiệu suất cao hơn nhiều, chi phí thấp hơn và ít rắc rối khi tích hợp hơn. ThunderPhone hỗ trợ cuộc gọi đến và đi bằng hàng chục ngôn ngữ, đồng thời tuân thủ HIPAA và GDPR.

Lợi thế của kiến trúc tích hợp

Các nền tảng AI điện thoại khác giới hạn hiệu suất hệ thống của họ bằng cách áp đặt cấu trúc 3 bước:

  1. Một mô hình phiên âm, chuyển giọng nói của người dùng thành văn bản.
  2. Một LLM, xử lý văn bản của người dùng và tạo phản hồi.
  3. Một mô hình TTS, chuyển văn bản phản hồi trở lại thành âm thanh.

Phần lớn trong số đó cũng đẩy công việc kỹ thuật sang người dùng, buộc họ phải chọn mô hình muốn sử dụng cũng như các tùy chọn cấu hình như khử nhiễu và tham số phản hồi.

Chúng tôi chọn một cách tiếp cận khác: chúng tôi đã cấu hình bộ công nghệ mà theo chúng tôi là tốt nhất có thể với các mô hình hiện nay, đồng thời giúp nó sẵn sàng sử dụng mà không cần nỗ lực cấu hình phức tạp. Hệ thống của chúng tôi sử dụng nhiều mô hình cùng lúc, định tuyến thông minh giữa chúng tùy theo diễn biến của cuộc hội thoại. Điều này bao gồm:

  • Kết hợp nhiều mô hình phiên âm, trong đó một số nhanh hơn và một số chính xác hơn, để cân bằng tốc độ với độ chính xác và bù trừ lỗi cho nhau.
  • Kết hợp LLM nhận đầu vào âm thanh, có thể có trí thông minh tổng quát thấp hơn nhưng hiểu âm thanh tốt hơn, với LLM chỉ xử lý văn bản, có thể mắc lỗi do bản phiên âm không chính xác nhưng thường thông minh hơn.
  • Kết hợp LLM nhanh nhưng kém thông minh, có thể tạo phản hồi nhanh, với LLM thông minh hơn nhiều nhưng chậm hơn, có thể chạy nền và đảm bảo tác nhân AI tuân theo prompt cũng như phản hồi chính xác những gì người dùng nói.
  • Kết hợp các mô hình thương mại từ những nhà cung cấp hàng đầu, bao gồm OpenAI và Google, mang lại mức trí thông minh cao nhất hiện nay, với nhiều mô hình mã nguồn mở đa dạng, thường có tốc độ tốt hơn với chi phí thấp hơn.
  • Sử dụng đồng thời nhiều mô hình để phân loại và loại bỏ tiếng ồn nền, các cuộc trò chuyện bên cạnh và những tạp âm gây xao nhãng khác vốn có thể làm chệch hướng cuộc hội thoại.

Các thành phần này cùng nhiều thành phần khác được điều phối theo những cách khác nhau trong ba gói dịch vụ Spark, Bolt và Storm — tối ưu Spark cho chi phí, Bolt cho tốc độ và Storm cho trí thông minh, đồng thời giảm thiểu tối đa hạn chế của từng gói. Cả ba hệ thống đều có những lợi thế chung như khả năng hiểu cực kỳ chính xác những gì người dùng nói, kể cả với danh từ riêng và cách viết.

Chúng tôi nhận thấy kiến trúc tích hợp chặt chẽ này mang lại cho hệ thống hiệu suất cao hơn nhiều với chi phí thấp hơn so với cách tiếp cận 3 bước cứng nhắc mà các nhà cung cấp khác đưa ra. Phù hợp với lý thuyết về tính mô-đun của Clay Christensen, AI giọng nói vẫn đang ở giai đoạn đầu, và việc tối đa hóa hiệu suất bằng kiến trúc tích hợp vẫn có giá trị hơn việc tối đa hóa khả năng tùy biến bằng kiến trúc mô-đun.

Quyết định được tối ưu hóa

Và về khả năng tùy chỉnh, chúng tôi phản đối điều đó! Hầu hết nền tảng AI thoại hiện nay buộc người dùng phải điều hướng qua vô số lựa chọn, từ các model chính xác được sử dụng đến những tham số siêu chi tiết như tốc độ tác nhân AI ngắt lời người dùng.

Theo chúng tôi, CHÚNG TÔI có trách nhiệm tối ưu các lựa chọn này ở hậu trường để người dùng ThunderPhone có thể tập trung vào những gì họ làm tốt, thay vì phải lo lắng về cấu hình AI thoại chi tiết. Chúng tôi xem mình như một phiên bản Squarespace, giúp người dùng dễ dàng thiết lập tác nhân điện thoại đạt hiệu suất cao nhất có thể với các model hiện nay mà không cần động tay.

Dễ sử dụng

ThunderPhone cũng cực kỳ dễ sử dụng, dù bạn đang thiết lập một tác nhân điện thoại mới, hay chuyển đổi từ một nền tảng khác hoặc một hệ thống tùy chỉnh. Để thiết lập một tác nhân điện thoại trên ThunderPhone, bạn chỉ cần:

  1. Quyết định bạn muốn dùng Spark, Bolt hay Storm.
  2. Chọn một giọng nói.
  3. Gửi cho chúng tôi prompt của bạn. Không cần tác nhân đa prompt! Nếu prompt của bạn quá phức tạp đối với Spark hoặc Bolt, hãy nâng cấp lên Storm, có thể xử lý ngay cả các trường hợp sử dụng phức tạp chỉ với một prompt.
  4. Kết nối các tích hợp phần mềm (bất kỳ endpoint nào hoặc tích hợp n8n gốc) bằng trình hướng dẫn cực kỳ dễ sử dụng.
  5. Kết nối VoIP của bạn bằng trình hướng dẫn cực kỳ dễ sử dụng.

Thông thường, toàn bộ quá trình này chỉ mất 10 phút hoặc ít hơn.

ThunderPhone tuân thủ HIPAA và GDPR, và chúng tôi sẽ ký cũng như cung cấp BAA và DPA theo yêu cầu.

Câu chuyện của chúng tôi

Chúng tôi là một đội ngũ gồm các cựu thành viên Stanford AI Lab và Y Combinator, đã làm việc với AI giọng nói từ năm 2024. Ban đầu, chúng tôi tập trung vào Flux Interpreting, sản phẩm dịch các cuộc gọi điện thoại giữa các ngôn ngữ. Nhưng sau khi liên tục được khách hàng đề nghị tự động hóa cuộc gọi cho doanh nghiệp của họ thay vì chỉ dịch, chúng tôi đã chuyển trọng tâm sang thứ hiện nay là ThunderPhone.

Vấn đề của các nền tảng hiện có

Ban đầu, chúng tôi xây dựng tác nhân AI qua điện thoại cho khách hàng trên các nền tảng AI điện thoại của những công ty khác. Chúng tôi đã thử gần như mọi nền tảng AI điện thoại trên thị trường, nhưng đáng tiếc là đều thấy chúng còn nhiều thiếu sót, đặc biệt ở các điểm:

  • Khả năng hiểu âm thanh: Việc chỉ có một mô hình phiên âm để chuyển âm thanh của người dùng thành văn bản khiến AI thường “nghe nhầm” người dùng, nhất là với danh từ riêng, từ không phổ biến và cách đánh vần.
  • Khả năng tuân thủ hướng dẫn: Việc chỉ có một LLM nhanh đảm nhiệm “bộ não” thực sự phía sau cuộc gọi khiến các tác nhân AI thường gặp khó khăn trong việc làm đúng theo hướng dẫn và dễ đi chệch hướng.
  • Tích hợp khó khăn: Các nền tảng chúng tôi thử khiến việc kết nối với phần mềm bên ngoài trở nên rất khó, thường buộc chúng tôi phải nhập các cấu hình JSON phức tạp cho những lệnh gọi công cụ rồi vật lộn thử đi thử lại mà hầu như không có phản hồi, cho đến khi chúng đột nhiên hoạt động.
  • Giá: Các nền tảng hiện có thường tính giá rất cao: thường từ 10 xu mỗi phút trở lên cho hiệu năng chỉ ở mức tạm được.

Xây dựng hệ thống của riêng mình

Khi ký hợp đồng triển khai một trường hợp sử dụng cuộc gọi bán hàng cho một khách hàng doanh nghiệp lớn, chúng tôi buộc phải xây dựng hệ thống tùy chỉnh của riêng mình để đáp ứng nhu cầu của họ. Trường hợp sử dụng này rất khắt khe: không giống hỗ trợ khách hàng, nơi người gọi phần lớn phụ thuộc vào doanh nghiệp, khách hàng tiềm năng trong cuộc gọi bán hàng rất dễ cúp máy.

Chất lượng cuộc gọi phải thật xuất sắc để chốt được đơn thay vì mất khách hàng tiềm năng. Điều đó đồng nghĩa với việc phải xử lý nhiều danh từ riêng và cách đánh vần, bao gồm tên và địa chỉ, vốn khó để các mô hình phiên âm tiêu chuẩn nhận diện chính xác. Để làm tốt trường hợp sử dụng này, chúng tôi đã xây dựng thứ hiện nay là ThunderPhone.

Trên hành trình đó, chúng tôi liên tục gặp những người trong cộng đồng AI giọng nói tại San Francisco đang xây dựng các công ty tác nhân AI qua điện thoại theo ngành dọc — cho bác sĩ thú y, tài xế xe tải và nhiều lĩnh vực khác. Đáng ngạc nhiên là hầu hết họ đều có cùng nhận định: các nền tảng hiện có đủ tốt để trình diễn, nhưng chưa đủ cho môi trường vận hành thực tế.

Đáng kinh ngạc là nhiều, nếu không muốn nói là phần lớn, bạn bè của chúng tôi tại các công ty AI giọng nói theo ngành dọc thực tế đang tự xây dựng hệ thống của riêng họ... Điều này chẳng hợp lý chút nào với chúng tôi — nó thực sự giống như các startup web trong thập niên 90 phải tự lưu trữ máy chủ web trên một chiếc máy chủ đặt trong tủ đồ của mình.

Từ nhận thức đó, chúng tôi hiểu rằng đã đến lúc biến hệ thống AI điện thoại của mình thành một nền tảng mà bất kỳ ai cũng có thể sử dụng.

Các công ty AI giọng nói theo ngành dọc và đơn vị tư vấn nên có thể tập trung đáp ứng nhu cầu của thị trường mục tiêu bằng chuyên môn đặc thù ngành của họ — chứ không phải vào việc thiết kế phức tạp công nghệ AI và điện thoại nền tảng! Đó là điều chúng tôi ra mắt hôm nay với ThunderPhone.

Đây là một chặng đường dài để đi đến đây! Chúng tôi xin lỗi tất cả những người đã đăng ký với chúng tôi từ tháng 4 năm ngoái nhưng vẫn đang chờ quyền truy cập: điều chúng tôi nghĩ chỉ là một chặng nước rút ngắn để hoàn tất công việc hóa ra lại là hành trình nhiều tháng tìm cách kết hợp các mô hình hiện có thành một hệ thống vững chắc nhất có thể.

Nhưng giờ đây cuối cùng chúng tôi cũng đã chính thức hoạt động — hãy dùng thử và cho chúng tôi biết bạn nghĩ gì!

Dù chúng tôi đã xử lý những vấn đề lớn, chắc chắn hệ thống vẫn còn lỗi. Nếu bạn gặp bất kỳ vấn đề nào, vui lòng gửi email đến alex@thunderphone.com và tôi sẽ đảm bảo vấn đề được khắc phục cho bạn sớm nhất có thể. Hãy cho tôi biết nếu bạn cũng có yêu cầu tính năng nào, và chúng tôi sẽ thực hiện những yêu cầu đó cho bạn sớm nhất có thể.

Và nếu bạn có những nhu cầu tùy chỉnh hơn, chẳng hạn như hỗ trợ triển khai và tích hợp tùy chỉnh, yêu cầu tuân thủ vượt ngoài HIPAA và GDPR thông thường, SLA, hoặc yêu cầu tính năng tùy chỉnh, chúng tôi rất sẵn lòng trao đổi về một thỏa thuận doanh nghiệp. Hãy liên hệ tại alex@thunderphone.com, và chúng ta sẽ trao đổi về nhu cầu của bạn cũng như liệu chúng tôi có thể hỗ trợ hay không.

Và nói chung: cam kết của chúng tôi với bạn là việc đảm bảo ThunderPhone hoạt động ngay từ đầu với nỗ lực tối thiểu từ phía bạn, đồng thời xử lý các cuộc gọi của doanh nghiệp bạn hoàn hảo nhất có thể với AI hiện nay, trong giới hạn của mức giá bạn chọn — Spark, Bolt hoặc Storm — là trách nhiệm của CHÚNG TÔI. Hãy dùng thử, và chúng tôi rất mong được cho bạn thấy ThunderPhone có thể làm được gì.

Hãy cho chúng tôi biết bạn nghĩ gì, và cảm ơn sự ủng hộ của bạn!