電話通話,愈來愈容易實現自動化。
每一代技術,都讓機器掌握更多通話脈絡。
多層電話語音選單·IVR 時代
致電者只能按機器聽得懂的方式說話。
當時的自動化,就是選單、按鍵分流和輪候隊列。只有來電者一開始已知道該怎樣選,系統才奏效。
尷尬一刻
來電者的意圖只能透過一次按鍵選擇表達,因此選單以外的要求,不是要轉駁,就是要重複說明。
示範通話IVR 時代
“我想把明天的預約改期。”
“賬單查詢請按 1,預約安排請按 2,其他查詢請按 9。”
結果 · 來電者只能猜選項、等候,再把同一件事解釋一次。
系統如何思考 · 3 個階段
選單語音提示已修正DTMF 分流不穩定輪候隊列出錯
自訂模型·AI 初期
系統只能理解限定場景,稍為偏離便無法應對。
團隊針對特定通話流程,訓練聲學模型、意圖分類器及欄位擷取器。雖然實用,修改成本卻很高。
尷尬一刻
系統只能識別一個經訓練的意圖,之後卻可能遺漏第二項要求,或按固定流程追問。
示範通話AI 初期
“可以把我明天的預約改期,並加上我的配偶嗎?”
“我可以協助你更改預約日期。你想改到哪一天?”
結果 · 由於訓練流程並未涵蓋配偶資料,這項資料因而遺失。
系統如何思考 · 3 個階段
自訂 ASR已修正意圖模型不穩定欄位補全出錯
Vapi/Retell/ElevenLabs 式技術組合·三步式處理流程
技術組合變得更靈活,但每一步仍全盤相信上一步。
現今常見的做法,是將語音轉文字、LLM 及文字轉語音串成一個通話循環。
尷尬一刻
只要轉錄結果出錯,或致電者中途插話,LLM 便會信心十足地作出錯誤回應。
示範通話三步式處理流程
“不,我是說「I rent」——我租住這個地方。”
“明白,這處是牧場物業,對嗎?”
結果 · 一次聽錯,就會變成系統說出口的錯誤回應。
系統如何思考 · 3 個階段
語音轉文字出錯LLM不穩定文字轉語音出錯
整合式語音 AI·ThunderPhone
系統可在同一個循環內聽懂、推理並修正失誤。
ThunderPhone 以單一架構統一協調音訊理解、模型路由、對話輪次管理及回應生成。
有何不同
多重聆聽路徑配合基於音訊脈絡的推理,可在單一步驟的失誤傳到致電者耳中前,先行減少這類失誤。
示範通話ThunderPhone
“不,我是說「I rent」——我租住這個地方。”
“明白。你目前租住這個居所,所以我會略過物業擁有權相關問題。”
結果 · 通話順利推進,毋須致電者費力與系統周旋。
系統如何思考 · 4 個階段
音訊串流通過多重聆聽通過模型路由通過自然回應通過
突破不在於讓機械聲線更悅耳,而在於一套能讓通話全程不偏離正軌的架構。
辨聽更準確
系統可比對多項訊號,直接分析音訊並作出推理,而非只依賴單一語音轉錄結果。
時機掌握更準確
對話接續與打斷處理,均已融入整個對話循環。
路由更精準
系統可按每輪對話的需要,選用快速處理路徑或更深入的推理。
更佳體驗
來電者可減少糾正自動系統的時間,把更多時間用於完成所需事項。