电话沟通,越来越容易实现自动化。
每一代演进,都让机器承接更多上下文。
电话语音菜单·IVR 时代
来电者只能用机器听得懂的方式说话。
所谓自动化,就是菜单、按键分支和排队等待。只有当来电者一开始就知道该选哪条路径时,它才奏效。
尴尬时刻
来电意图被压缩成一次按键选择,因此菜单之外的任何需求,最终不是转人工,就是再说一遍。
通话示例IVR 时代
“我想把明天的预约改期。”
“如需账单服务,请按 1。如需预约服务,请按 2。其他问题,请按 9。”
结果 · 来电者只能靠猜、等待,然后把同一件事再解释一遍。
系统如何思考 · 3 个阶段
菜单提示语已修复DTMF 分支不稳定等待队列失败
定制模型·早期 AI
系统只能理解有限场景,一旦超出范围就会失灵。
团队针对特定通话流程,分别训练声学模型、意图分类器和槽位提取器。虽然实用,但变更成本高昂。
尴尬时刻
系统只能识别一种训练过的意图,遇到第二个请求就可能漏掉,或只能生硬地追问。
通话示例早期 AI
“你能把我明天的预约改期,再加上我爱人吗?”
“可以,我来帮您改期。您想改到哪一天?”
结果 · 由于“添加配偶”不在已训练流程中,这项需求被遗漏了。
系统如何思考 · 3 个阶段
定制 ASR已修复意图模型不稳定槽位填充失败
Vapi / Retell / ElevenLabs 式技术栈·三段式流水线
技术栈更灵活了,但每一步都只能相信上一步。
一种常见的现代方案,是把语音转文字、LLM 和文字转语音串成一条通话闭环。
尴尬时刻
只要转写出错或来电者插话,LLM 就会沿着错误的上下文,自信地答下去。
通话示例三段式流水线
“不,我租房。”
“明白了,您说的是牧场房产,对吗?”
结果 · 一次听辨错误,最终就会变成一句说出口的错误回答。
系统如何思考 · 3 个阶段
语音转文字失败LLM不稳定文字转语音失败
一体化语音 AI·ThunderPhone
系统能在一个闭环内完成听辨、推理与纠错。
ThunderPhone 在一套架构内协同完成音频理解、模型路由、对话轮次控制与回应生成。
关键变化
多路听辨链路和音频感知推理可降低单步失误,并在其影响来电者前及时纠正。
通话示例ThunderPhone
“不,我租房。”
“明白了,您说的是“我租房”,所以我会跳过房屋产权相关问题。”
结果 · 通话顺畅推进,来电者不必再和系统较劲。
系统如何思考 · 4 个阶段
音频流通过冗余听辨通过模型路由通过自然回应通过
真正的突破不在于让机器人的声音更动听,而在于一套能让通话始终沿着正确方向推进的架构。
听得更准
系统可综合比对多路信号,直接基于音频进行推理,而非轻信单一转写结果。
时机把握更准
话轮衔接与打断处理都融入整个对话闭环。
路由更智能
系统可根据每一轮对话的需要,在快速路径与深度推理之间灵活选择。
体验更佳
来电者无需再花太多时间纠正自动化系统,而能更专注于完成任务。