每一通電話,都更容易實現自動化。
每一次世代演進,都讓機器掌握更多通話脈絡。
多層式電話語音選單·IVR 時代
來電者得用機器聽得懂的方式說話。
所謂自動化,就是選單、按鍵分流與等候佇列。只有來電者一開始就知道正確路徑時,這套方式才行得通。
尷尬時刻
來電者的完整意圖被壓縮成一個按鍵;任何選單外的需求,不是被轉接,就是得重複說明。
通話範例IVR 時代
“我想把明天的預約改期。”
“帳務問題請按 1,預約安排請按 2,其他問題請按 9。”
結果 · 來電者只能猜選項、等候,再把同一件事重說一遍。
系統的思考流程 · 3 個階段
選單提示已修正DTMF 按鍵分流不穩定等候佇列失效
客製化模型·早期人工智慧
系統只懂有限的情境,一超出範圍就徹底失靈。
團隊必須針對特定通話流程,訓練聲學模型、意圖分類器與槽位擷取器。雖然實用,變更成本卻很高。
尷尬時刻
系統只能辨識一項已訓練的意圖,接著不是漏掉第二項需求,就是用制式問題追問。
通話範例早期人工智慧
“可以幫我把明天的預約改期,再把我配偶加進去嗎?”
“我可以幫你改期。請問想改到哪一天?”
結果 · 由於訓練流程未涵蓋配偶資訊,系統便漏掉了這項需求。
系統的思考流程 · 3 個階段
客製化 ASR已修正意圖模型不穩定槽位填充失效
Vapi / Retell / ElevenLabs 式技術堆疊·三階段管線
技術堆疊變得更靈活,每一步卻仍對上一步照單全收。
現今常見的做法,是將語音轉文字、LLM 和文字轉語音串成一個通話循環。
尷尬時刻
當逐字稿出錯,或來電者中途插話時,LLM 仍會信心滿滿地答非所問。
通話範例三階段管線
“不是,我是租這裡的。”
“了解,這是一處牧場型房產,對嗎?”
結果 · 一次聽辨錯誤,最後就成了說出口的錯誤。
系統的思考流程 · 3 個階段
語音轉文字失效LLM不穩定文字轉語音失效
整合式語音人工智慧·ThunderPhone
系統能在同一個循環內完成聽辨、推理與自我修正。
ThunderPhone 將音訊理解、模型路由、輪次管理與回應生成整合為單一架構,讓各環節協同運作。
有何不同
多重聽辨路徑與音訊感知推理,能及早攔下單一步驟的失誤,降低錯誤傳到來電者耳中的機率。
通話範例ThunderPhone
“不是,我是租這裡的。”
“了解。你目前是租屋,因此我會略過房屋所有權相關問題。”
結果 · 通話順暢推進,來電者不必再費力與系統周旋。
系統的思考流程 · 4 個階段
音訊串流通過多重聽辨通過模型路由通過自然回應通過
真正的突破,不是更悅耳的機器人聲音,而是能讓通話始終順利推進的架構。
聽辨更精準
系統能交叉比對多項訊號,直接針對音訊進行推理,而非只依賴單一份轉錄結果。
應答時機更精準
話輪交替與插話處理,都是對話迴圈的一環。
路由更靈活
系統可依每一輪對話的需求,選擇快速處理路徑或進行更深入的推理。
體驗更順暢
來電者能少花時間糾正自動化系統,把更多時間用來完成任務。