電話通話愈嚟愈容易自動化
每一代都將更多脈絡交畀機器處理。
電話樹狀選單
IVR 時代
來電者要講機器語。
自動化即係選單、按鍵分支同等候隊列。來電者一早知啱路點行嗰陣,佢就運作到。
笨拙時刻
意圖被壓縮成一次撳掣,所以任何唔喺選單入面嘅嘢,都只會變成轉駁或者重複講一次。
示範通話
IVR 時代
來電者
"我想改聽日嘅預約。"
系統
"帳單服務請按 1。預約安排請按 2。其他所有問題請按 9。"
結果
來電者要估、要等,仲要再解釋一次同一件事。
系統點樣思考
3 個階段選單提示
已修正固定腳本列出選項。
DTMF 分支
唔穩定一個按鍵就代表成個意圖。
等候隊列
出錯真正嘅情境要等真人先有。
自訂模型
早期 AI
系統只理解狹窄範圍,之後就散晒。
團隊會為特定通話流程訓練聲學模型、意圖分類器同欄位擷取器。有用,但改動成本高。
笨拙時刻
系統可以捉到一個受訓過嘅意圖,但之後會漏咗第二個要求,或者問一條死板嘅追問。
示範通話
早期 AI
來電者
"你可唔可以改聽日嘅預約,仲加埋我配偶?"
系統
"我可以幫你改期。你想改去邊日?"
結果
因為配偶資料唔喺受訓流程入面,所以遺失咗。
系統點樣思考
3 個階段自訂 ASR
已修正針對特定領域同口音組合調校。
意圖模型
唔穩定將要求分類為最接近嘅已知類別。
欄位填補
出錯缺少欄位時會觸發預設修復流程。
Vapi/Retell/ElevenLabs 風格技術堆疊
三步流程
個技術堆疊彈性大咗,但每一步都信晒上一步。
常見嘅現代做法,會將語音轉文字、LLM 同文字轉語音串連成一個通話迴路。
笨拙時刻
當轉錄出錯或者來電者打斷對話,LLM 會好有信心噉答咗另一個問題。
示範通話
三步流程
來電者
"唔係,我係租住呢度嘅。"
系統
"明白,呢個係農場物業。啱唔啱?"
結果
一次聽錯,就會變成一次講錯。
系統點樣思考
3 個階段語音轉文字
出錯一份轉錄文字會變成唯一可信依據。
LLM
唔穩定根據文字生成,而唔係原始音訊。
文字轉語音
出錯好有信心噉講返個答案出嚟。
整合式語音 AI
ThunderPhone
個系統可以喺同一個迴路入面聆聽、推理同修正。
ThunderPhone 將音訊理解、模型路由、輪次處理同回應生成,協調成同一套架構。
有咩改變
多重聆聽路徑同音訊感知推理,會喺問題影響到來電者之前減少單一步驟嘅失誤。
示範通話
ThunderPhone
來電者
"唔係,我係租住呢度嘅。"
系統
"明白。你係租住,所以我會跳過業權相關問題。"
結果
通話可以順利推進,唔使來電者同個系統拗。
系統點樣思考
4 個階段音訊串流
已通過檢查原始音訊會保留俾系統推理。
多重聆聽
已通過檢查採取行動之前會先比較各種訊號。
模型路由
已通過檢查快速同深度處理路徑會輪流協作。
自然回應
已通過檢查來電者會聽到已修正嘅上下文。