语音 AI 的演进

大多数自动电话通话都糟透了。新技术正在改变这一点。

旧问题不在于电话自动化缺少悦耳的声音,而在于它缺乏足够的理解能力,无法让真实对话持续推进。

电话树

IVR 时代

来电者不得不说机器的语言。

自动化意味着菜单、按键分支和排队队列。当来电者已经知道正确路径时,它确实有效。

笨拙时刻

意图被压缩为一次按键选择,因此菜单之外的任何内容都只能转接或重复说明。

通话示例

IVR 时代

来电者

"我需要把明天的预约改期。"

系统

"如需账单服务,请按 1。如需预约服务,请按 2。如有其他问题,请按 9。"

结果

来电者只能猜测、等待,并再次解释同一件事。

系统如何思考

3 个阶段

菜单提示

已修复

固定脚本列出选项。

DTMF 分支

不稳定

一个按键承载全部意图。

排队队列

中断

真正的上下文要等人工接听后才会出现。

定制模型

早期 AI

系统只能理解有限场景,随后便会失灵。

团队针对特定通话流程训练声学模型、意图分类器和槽位提取器。有用,但变更成本高。

笨拙时刻

系统可以识别一个经过训练的意图,却会忽略第二个请求,或提出生硬的追问。

通话示例

早期 AI

来电者

"你能把明天的预约改期,并添加我的配偶吗?"

系统

"我可以帮您改期。您希望改到哪一天?"

结果

由于配偶信息不在训练流程中,这一细节被遗漏了。

系统如何思考

3 个阶段

定制 ASR

已修复

针对特定领域和口音组合进行调优。

意图模型

不稳定

将请求归类为最接近的已知类型。

槽位填充

中断

缺失字段会触发预设的补救流程。

Vapi / Retell / ElevenLabs 风格的技术栈

3 步流水线

技术栈更灵活了,但每一步都信任上一步。

一种常见的现代模式是将语音转文本、LLM 和文本转语音串联成一个通话循环。

笨拙时刻

当转写出错或来电者打断时,LLM 会自信地答错这通电话的问题。

通话示例

3 步流水线

来电者

"不,我租房。"

系统

"明白了,这是一处牧场房产。对吗?"

结果

一次听错就会变成一次口头误答。

系统如何思考

3 个阶段

语音转文本

中断

一份转写文本成为唯一事实来源。

LLM

不稳定

基于文本生成,而非原始音频。

文本转语音

中断

自信地说出答案。

一体化语音 AI

ThunderPhone

系统能在一个循环中听见、推理并恢复。

ThunderPhone 将音频理解、模型路由、轮次管理和响应生成协调为一体化技术栈。

变化所在

多条听取路径和感知音频的推理,可在单步失误触及来电者前减少这类问题。

通话示例

ThunderPhone

来电者

"不,我租房。"

系统

"明白了。您租房,所以我会跳过有关房屋所有权的问题。"

结果

通话顺利推进,无需让来电者与系统较劲。

系统如何思考

4 个阶段

音频流

通过

原始音频始终可用于推理。

冗余听取

通过

采取行动前先比对信号。

模型路由

通过

快速路径与深度路径按轮次协同工作。

自然回应

通过

来电者听到经修正的上下文。

这将带来什么

突破不在于更悦耳的机器人声音,而在于让通话始终不偏离方向的架构。

更好的听辨能力

系统可以比较不同信号并基于音频进行推理,而非只依赖一份转写文本。

更好的时机把握

轮次交接和打断处理都是对话循环的一部分。

更好的路由

可根据每一轮对话的需求,选择快速路径或更深入的推理。

更好的体验

来电者花在纠正自动化系统上的时间更少,花在完成任务上的时间更多。