ThunderPhone 2.0 正式登場。自助開通,每分鐘 2¢ 起查看公告
語音 AI 的世代演進

電話自動化帶來的通話體驗,大多都很差勁。新技術正在改變這一切

過往電話自動化的問題,並非聲音不夠悅耳,而是理解能力不足,無法讓真正的對話順暢推進。

多層電話語音選單·IVR 時代

致電者只能按機器聽得懂的方式說話。

當時的自動化,就是選單、按鍵分流和輪候隊列。只有來電者一開始已知道該怎樣選,系統才奏效。

尷尬一刻

來電者的意圖只能透過一次按鍵選擇表達,因此選單以外的要求,不是要轉駁,就是要重複說明。

示範通話IVR 時代
我想把明天的預約改期。
賬單查詢請按 1,預約安排請按 2,其他查詢請按 9。

結果 · 來電者只能猜選項、等候,再把同一件事解釋一次。

系統如何思考 · 3 個階段
選單語音提示已修正DTMF 分流不穩定輪候隊列出錯
自訂模型·AI 初期

系統只能理解限定場景,稍為偏離便無法應對。

團隊針對特定通話流程,訓練聲學模型、意圖分類器及欄位擷取器。雖然實用,修改成本卻很高。

尷尬一刻

系統只能識別一個經訓練的意圖,之後卻可能遺漏第二項要求,或按固定流程追問。

示範通話AI 初期
可以把我明天的預約改期,並加上我的配偶嗎?
我可以協助你更改預約日期。你想改到哪一天?

結果 · 由於訓練流程並未涵蓋配偶資料,這項資料因而遺失。

系統如何思考 · 3 個階段
自訂 ASR已修正意圖模型不穩定欄位補全出錯
Vapi/Retell/ElevenLabs 式技術組合·三步式處理流程

技術組合變得更靈活,但每一步仍全盤相信上一步。

現今常見的做法,是將語音轉文字、LLM 及文字轉語音串成一個通話循環。

尷尬一刻

只要轉錄結果出錯,或致電者中途插話,LLM 便會信心十足地作出錯誤回應。

示範通話三步式處理流程
不,我是說「I rent」——我租住這個地方。
明白,這處是牧場物業,對嗎?

結果 · 一次聽錯,就會變成系統說出口的錯誤回應。

系統如何思考 · 3 個階段
語音轉文字出錯LLM不穩定文字轉語音出錯
整合式語音 AI·ThunderPhone

系統可在同一個循環內聽懂、推理並修正失誤。

ThunderPhone 以單一架構統一協調音訊理解、模型路由、對話輪次管理及回應生成。

有何不同

多重聆聽路徑配合基於音訊脈絡的推理,可在單一步驟的失誤傳到致電者耳中前,先行減少這類失誤。

示範通話ThunderPhone
不,我是說「I rent」——我租住這個地方。
明白。你目前租住這個居所,所以我會略過物業擁有權相關問題。

結果 · 通話順利推進,毋須致電者費力與系統周旋。

系統如何思考 · 4 個階段
音訊串流通過多重聆聽通過模型路由通過自然回應通過

突破不在於讓機械聲線更悅耳,而在於一套能讓通話全程不偏離正軌的架構。

辨聽更準確

系統可比對多項訊號,直接分析音訊並作出推理,而非只依賴單一語音轉錄結果。

時機掌握更準確

對話接續與打斷處理,均已融入整個對話循環。

路由更精準

系統可按每輪對話的需要,選用快速處理路徑或更深入的推理。

更佳體驗

來電者可減少糾正自動系統的時間,把更多時間用於完成所需事項。

最終成效

近距離細看整合式架構。