技術

別止步於三階段管線,
再向前一步

多數語音人工智慧平台仰賴三階段管線:一個語音轉文字模型、一個不具推理能力的 LLM,以及一個文字轉語音引擎。任何一個環節出錯,整套系統就會失效。ThunderPhone 讓多個模型同時協作,減少錯誤。

來電者說的是 「I rent」
ASR A「I rent」
ASR B「I’m Brent」
音訊 LLM「I rent」
綜合判定為 「I rent」3 條辨識路徑中有 2 條結果一致

多路辨聽,
再整合判讀。

ThunderPhone 同時協調多個模型運作,讓它們彼此修正錯誤。

來電者說:「I rent.」——語音含糊不清
其他平台3 段式流程
單路辨識
STT「I'm Brent」
單一模型一旦聽錯,就沒有備援機制
快速回答

快速 LLM 只能看到逐字稿。

語音回應

「嗨,Brent——有什麼需要我幫忙的嗎?」

1 份逐字稿+1 個 LLM=錯誤答案
ThunderPhone協同編排
三路辨識
「I rent」「I’m Brent」「I rent」
保留三份逐字稿與原始音訊作為佐證
整合判斷

快速 LLM+推理型 LLM 交叉驗證:3 條路徑中有 2 條結果一致。

語音回應

「了解——所以你在租屋。」

再棘手的細節,也能一次就答對。

Storm 在 Big Bench Audio 創下智慧表現新紀錄。

BBA 測試模型能否理解口述提示,並正確回答高難度問題。我們最強的 Storm 組態目前保持紀錄:在我們公開的評估資料集上取得 99.4%。

0.6% 錯誤率

· 2026 年 7 月Hugging Face 上的資料集
ThunderPhoneStorm · Extra Intelligence0.6%
Qwen Audio 3.0Realtime Plus0.8%
Qwen3.5 OmniPlus Realtime1.3%
Step-Audio R1.1Realtime2.4%

ThunderPhone 的結果來自上方連結的公開評測資料集;其他公開分數(Artificial Analysis 排行榜)則列於此,供比較參考。

語音技術堆疊,不該還要你手動組裝。

Vapi、Retell、Pipecat 與 LiveKit 等其他語音人工智慧平台,會迫使你處理大量設定與取捨,通話才能正常運作。ThunderPhone 的理念很簡單:調校是我們的事,你不用大費周章,就能讓通話順暢運作。

其他語音人工智慧平台大量參數需要調校
STTv4-largeSTT 備援LLMtemp 0.3LLM 備援機制TTSTTS 備援VAD0.62語音端點偵測240 ms插話門檻−38 dB附和語過濾插話處理對話輪次逾時800 ms降噪抖動緩衝區60 ms取樣率8 kHz工具結構描述重試策略×3備援機制

ThunderPhone 會替你調校這一切

ThunderPhone三項決策
1
選擇方案

Spark、Bolt 或 Storm。

2
選擇語音

精心挑選,並經真實通話測試。

3
撰寫提示詞

行為、規範、工具——直接用自然語言設定。

只需做出三個決定,設定就完成——編排、備援與調校全都內建。

我們會為每項任務挑選最合適的模型,再將它們整合起來。結合 OpenAI、Anthropic 與 Google 的尖端模型及開放原始碼模型——統一編排,讓每通電話都能兼顧最佳效能與價格,你完全不必費心。

只要一個提示詞,
不必建節點圖。

能力不足的系統無法遵循複雜提示詞,才需要流程建構器。對話的每個步驟都得變成一個節點,由你手動建立與維護。Storm 只靠一個提示詞,就能遵循詳盡指示,讓你無須再操心節點與連線。

流程建構平台每條分支都得手動串接
問候語 提示詞 · 語音
收集電話號碼 提示詞 · 驗證
確認電話號碼 再次提示 ×2
enroll() 工具 · 重試
轉交真人處理
萬用備援節點 無效 ×2 · 錯誤

光是一個註冊流程就要六個節點——每個節點還得分別設定提示詞、工具、流程轉換與失敗處理。

ThunderPhone Storm只需描述一次運作方式
行為提示詞

向來電者問候,並收集對方的姓名電話號碼。登記前務必確認對方同意——這是必要條件。若對方詢問帳務問題,請遵循下方的帳務政策。待所有欄位都確認無誤後,再呼叫enroll(),且僅能呼叫一次。若來電者要求真人服務,請轉接真人

複雜分支選用看門狗機制迭代更輕鬆

只需撰寫、測試、反覆調整一段提示詞——分支邏輯也包含在內。

實際通話狀況百出,ThunderPhone 準備就緒

口齒不清、背景交談聲、人名與數字、多語混雜——ThunderPhone 專為這些會讓其他系統失靈的情境而打造。

含糊不清的語音

不只採信單一逐字稿,而是交叉比對音訊與文字訊號。

通話音質不佳

噪音辨識與降噪模型能減少訊號中的雜音干擾。

背景交談聲

先辨識一旁的交談,避免語音智慧體被帶偏。

姓名與地址

交叉核對專有名詞、拼法、數字與更正內容。

多語混用

需要時,導向多語音訊與語音處理路徑。

長篇提示詞

當應對方式無法化約為單一規則時,採用更強的推理路徑。

答錯得再快,也不會帶來更好的通話體驗。

電話 AI 必須快速回應——但只快不準,換來的只是更快答錯。現今的 LLM 需要一點思考時間,才能維持可靠表現,因此 ThunderPhone 在延遲與準確度之間取得平衡。

Spark~3s首次回應時間
Bolt~2s首次回應時間
Storm~2–3s約 2 秒(含確認回應)· 約 3 秒(不含確認回應)
實測

其他供應商宣稱理想條件下的延遲僅 500 毫秒,但實際上在真實通話中通常約為 2 秒 我們在真實環境下實測延遲。

系統韌性

AI 供應商的延遲可能突然飆升,打亂整段通話流程。 遇到這種情況時,ThunderPhone 的協同調度架構會自動改用速度更快的選項

下一代語音人工智慧,正式登場

自動化通話向來令人挫折……直到現在。每一波技術革新都讓體驗有所改善,卻始終稱不上真正流暢。有了 ThunderPhone,這一切就此改變。

1990s第 1 代

IVR

「業務請按 1,技術支援請按 2。」選單只能負責轉接。

2010s第 2 代

意圖辨識機器人

說出「業務」或「帳務」,再祈禱槽位解析器能正確辨識。

2024第 3 代

三階段 AI

先轉成文字,交給一個快速 LLM 處理,再把答案說出口——每一步都只能相信上一步的結果。

2026 · 目前第 4 代

整合式 AI

將音訊、文字、推理、工具、語音與防護機制整合為一套系統。

專為其他系統都招架不住的通話而生

用你最棘手的通話,實測我們的整合式技術堆疊。

10 分鐘內即可上線。每分鐘 2 美分起。