技術

突破 3 步流程。

大部分語音 AI 平台都依賴 3 步流程:一個轉錄模型、一個唔會思考嘅 LLM,同埋一個文字轉語音引擎。每一步都可能出錯。ThunderPhone 同時編排多個模型,減少錯誤。

來電者話 “I rent.”
ASR A“I rent”
ASR B“I’m Brent”
音訊 LLM“I rent”
核對後係 “I rent” 3 條路徑入面有 2 條一致
整合式架構

聽到好多種講法,然後綜合判斷。

ThunderPhone 同時編排多個模型,等佢哋可以互相修正錯誤。

其他平台 · 3 步流程

每一步都信賴上一步。

來電者音訊
「I rent。」· 含糊咁講
STT A
“I’m Brent”
STT B
音訊 LLM
單一模型聽錯時冇後備
LLM
快速模型只會睇到逐字稿。
→ 回覆「Hi, Brent — how can I help?」
快速 LLM 喺跟從指示時會出錯
TTS
答案會以語音讀返出嚟。
→ 讀出「Hi, Brent — how can I help?」✗
1 份轉錄 + 1 個 LLM = 錯誤答案
ThunderPhone · 協調編排

多條路徑,一個協調好嘅答案。

來電者音訊
「I rent。」· 含糊咁講
STT A
“I rent”
STT B
“I’m Brent”
音訊 LLM
“I rent”
保留三份逐字稿+原始錄音作為證據
推理層
快速同思考型 LLM 會權衡文字同音訊證據。
→ 3 條路徑中有 2 條一致:「I rent」
思考型同快速 LLM 會喺回答前互相核對
TTS
精心挑選嘅語音資料可減少模型喺串法同字母數字組合上產生幻覺。
→ 「明白——即係你係租屋住。」✓
第一次就準確掌握複雜細節。
效能實證

Storm 喺Big Bench Audio創下智能新紀錄。

BBA 測試模型可唔可以理解口語提示,同埋正確回答困難問題。我哋最強嘅 Storm 配置喺公開評估集上達到 99.4%——只得 0.6% 錯誤,比下一個最佳公開分數少 4 倍。

模型
錯誤率↓ 越低越好
分數
ThunderPhone Storm · Extra Intelligence錯誤少 4 倍
0.6%
Step-Audio R1.1
2.4%
Grok Voice Think Fast
2.9%
Ultravox v0.7 Thinking
3.0%
GPT-Realtime-2 High
3.4%
Gemini 3.1 Flash Live High
3.4%
喺 Hugging Face 查看 BBA-Storm 評估資料集

錯誤率係 BBA 成功率減 100%。ThunderPhone 嘅結果來自上面連結嘅公開評估資料集;其他公開分數(Artificial Analysis 排行榜)列出嚟作參考。BBA 未能完全反映電話通話嘅表現,但對評估模型點樣推理口語提示,仍然係一個有用指標。

有主見勝過任意設定

你唔應該要親手砌一套語音技術堆疊。

Vapi、Retell、Pipecat 同 LiveKit 等其他語音 AI 平台,迫你做大量設定決定,先可以令通話運作。喺 ThunderPhone,我哋相信調校係我哋嘅工作;而你應該盡可能少做嘢,就可以令通話順暢運作。

其他語音 AI 平台 · 有好多設定要調
STT LLM TTS 語句結束偵測 去噪 打斷處理 備援機制 工具綱要 延遲 VAD
ThunderPhone 會幫你調校好晒呢啲
ThunderPhone · 三個決定
1
揀個級別
Spark、Bolt,定係 Storm。
2
揀把聲
精心挑選,並喺真實通話中測試過。
3
寫低你嘅提示
行為、政策、工具——用自然語言寫。
三個決定。設定就係咁——編排、備援同調校全部內置。
我哋會揀最適合工作嘅模型,再將佢哋整合埋一齊。OpenAI、Anthropic 同 Google 嘅前沿模型,配合開源模型一齊運作——每通電話都經過編排,做到最佳效能同價格,唔使你費心。
一個提示詞,少啲流程圖雜亂

一個提示詞,唔係節點圖

流程建構工具之所以存在,係因為較弱嘅系統跟唔到複雜提示詞。對話嘅每一步都變成一個節點,要你人手建立同維護。Storm 用一個提示詞就跟到豐富嘅指示,所以你唔使煩節點同連線。

流程建構平台

每個分支都要人手接線。

打招呼提示詞 · 聲音
收集電話提示詞 · 驗證
確認電話再次提示 ×2
enroll()工具 · 重試
升級處理轉駁畀真人
後備處理通用處理
無效 ×2錯誤
一個登記流程要六個節點——每個都有自己嘅提示詞、工具、轉換同失敗處理。
ThunderPhone Storm

一次過描述你想要嘅行為。

行為提示詞
同來電者打招呼,並收集佢嘅 姓名電話
登記之前要先 確認同意——必須做。
如果佢問帳單問題,跟從下面嘅帳單政策。
確認晒所有欄位之後,先調用 enroll()
如果來電者想搵真人,轉駁畀真人
複雜分支 可選監察機制 更易迭代
一個提示詞就可以寫、測試同迭代——包括分支處理。
點解重要

實際通話好多狀況。ThunderPhone 準備好。

含糊不清嘅說話、背景雜聲、姓名同數字、混合語言——ThunderPhone 就係為咗應付會令其他系統失靈嘅情況而打造。

含糊不清嘅說話

比較音訊同文字訊號,而唔係淨係信一份轉錄。

劣質電話音訊

噪音識別同降噪模型會清理訊號。

背景雜談

喺干擾智能體之前,先識別旁邊嘅對話。

姓名同地址

交叉核對專有名詞、串法、數字同修正內容。

混合語言說話

有需要時,經多語言音訊同語音處理路徑處理。

長提示詞

當行為唔可以簡化成一條規則時,用更強嘅推理路徑。

延遲、質素同成本

快啲答錯,唔會令通話更好。

電話 AI 必須答得快——但得速度而唔準確,只係更快咁交付錯誤。今日嘅 LLM 需要一陣時間思考先至可靠,所以 ThunderPhone 會按每個層級平衡兩者。

Spark
~3s
至首次回應
Bolt
~2s
至首次回應
Storm
~2–3s
約 2 秒(有確認回應)· 約 3 秒(冇確認回應)
量度其他供應商聲稱喺理想環境下有 500ms 延遲,但喺真實通話入面通常接近 2 秒我哋喺真實環境下量度延遲。
韌性AI 供應商會出現延遲飆升,足以搞亂通話。遇到呢種情況時,ThunderPhone 嘅編排技術堆疊會自動切換去更快嘅選項
幾代語音 AI

下一代語音 AI 已經嚟到

自動電話通話一直都係令人挫敗嘅體驗……直到而家。每一波技術都改善咗體驗,但從來未去到真正順暢嘅程度。ThunderPhone 改變咗呢一點。

1990s2010s20242026 · 而家
第 1 代

IVR

撳 1 去銷售部,撳 2 去支援部。選單只可以轉駁電話。

第 2 代

意圖機械人

講「銷售」或者「帳單」,就睇槽位解析器捉唔捉到。

第 3 代

三步式 AI

先轉錄,再問一次快速 LLM,然後講出嚟——每一步都信賴上一步。

第 4 代

整合式 AI

音訊、文字、推理、工具、聲線同防護機制,整合成一個系統。

專為難倒所有其他方案嘅通話而打造

睇吓整合技術堆疊
點樣處理你最棘手嘅通話

十分鐘即可上線。每分鐘 2¢ 起。