語音 AI 嘅世代演進

大部分自動化電話通話都好差。新技術改變咗呢一點。

舊問題唔係電話自動化冇把悅耳嘅聲音,而係佢唔夠理解力,冇辦法令一段真正嘅對話順暢咁繼續落去。

電話樹狀選單

IVR 時代

來電者要講機器語。

自動化即係選單、按鍵分支同等候隊列。來電者一早知啱路點行嗰陣,佢就運作到。

笨拙時刻

意圖被壓縮成一次撳掣,所以任何唔喺選單入面嘅嘢,都只會變成轉駁或者重複講一次。

示範通話

IVR 時代

來電者

"我想改聽日嘅預約。"

系統

"帳單服務請按 1。預約安排請按 2。其他所有問題請按 9。"

結果

來電者要估、要等,仲要再解釋一次同一件事。

系統點樣思考

3 個階段

選單提示

已修正

固定腳本列出選項。

DTMF 分支

唔穩定

一個按鍵就代表成個意圖。

等候隊列

出錯

真正嘅情境要等真人先有。

自訂模型

早期 AI

系統只理解狹窄範圍,之後就散晒。

團隊會為特定通話流程訓練聲學模型、意圖分類器同欄位擷取器。有用,但改動成本高。

笨拙時刻

系統可以捉到一個受訓過嘅意圖,但之後會漏咗第二個要求,或者問一條死板嘅追問。

示範通話

早期 AI

來電者

"你可唔可以改聽日嘅預約,仲加埋我配偶?"

系統

"我可以幫你改期。你想改去邊日?"

結果

因為配偶資料唔喺受訓流程入面,所以遺失咗。

系統點樣思考

3 個階段

自訂 ASR

已修正

針對特定領域同口音組合調校。

意圖模型

唔穩定

將要求分類為最接近嘅已知類別。

欄位填補

出錯

缺少欄位時會觸發預設修復流程。

Vapi/Retell/ElevenLabs 風格技術堆疊

三步流程

個技術堆疊彈性大咗,但每一步都信晒上一步。

常見嘅現代做法,會將語音轉文字、LLM 同文字轉語音串連成一個通話迴路。

笨拙時刻

當轉錄出錯或者來電者打斷對話,LLM 會好有信心噉答咗另一個問題。

示範通話

三步流程

來電者

"唔係,我係租住呢度嘅。"

系統

"明白,呢個係農場物業。啱唔啱?"

結果

一次聽錯,就會變成一次講錯。

系統點樣思考

3 個階段

語音轉文字

出錯

一份轉錄文字會變成唯一可信依據。

LLM

唔穩定

根據文字生成,而唔係原始音訊。

文字轉語音

出錯

好有信心噉講返個答案出嚟。

整合式語音 AI

ThunderPhone

個系統可以喺同一個迴路入面聆聽、推理同修正。

ThunderPhone 將音訊理解、模型路由、輪次處理同回應生成,協調成同一套架構。

有咩改變

多重聆聽路徑同音訊感知推理,會喺問題影響到來電者之前減少單一步驟嘅失誤。

示範通話

ThunderPhone

來電者

"唔係,我係租住呢度嘅。"

系統

"明白。你係租住,所以我會跳過業權相關問題。"

結果

通話可以順利推進,唔使來電者同個系統拗。

系統點樣思考

4 個階段

音訊串流

已通過檢查

原始音訊會保留俾系統推理。

多重聆聽

已通過檢查

採取行動之前會先比較各種訊號。

模型路由

已通過檢查

快速同深度處理路徑會輪流協作。

自然回應

已通過檢查

來電者會聽到已修正嘅上下文。

最終帶來嘅改變

突破唔係把機械人聲整得更靚,而係令通話唔會偏離軌道嘅架構。

聽得更準

系統可以比較各種訊號,再根據音訊推理,而唔係只靠一份逐字稿。

時機更準

輪流說話同處理打斷,都係對話循環嘅一部分。

更好路由

可以按每一輪對話嘅需要,揀選快速路徑或者更深入嘅推理。

更好體驗

來電者用更少時間糾正自動化系統,用更多時間完成任務。