技术

超越3 步流水线

大多数语音 AI 平台依赖 3 步流水线:一个转录模型、一个不具备推理能力的 LLM,以及一个文本转语音引擎。每一步都是单点故障。ThunderPhone 通过同时编排多个模型来减少错误。

来电者说 “I rent.”
ASR A“I rent”
ASR B“I’m Brent”
音频 LLM“I rent”
已核对 “I rent” 3 条路径中有 2 条一致
一体化技术栈

从多个角度听清,再 交叉核验

ThunderPhone 可同时编排多个模型,让它们相互纠正错误。

其他平台 · 3 步流程

每一步都相信上一步。

来电者音频
“I rent.” · 含糊地说
STT A
“I’m Brent”
STT B
音频 LLM
单一模型听错时没有补救
LLM
快速模型只读取转录文本。
→ 回复:“Hi, Brent——我能帮您什么?”
快速 LLM 在遵循指令时会出错
TTS
系统会将答案语音回复。
→ 说:“Hi, Brent——我能帮您什么?” ✗
1 份转录文本 + 1 个 LLM = 错误答案
ThunderPhone · 协同编排

多条路径,一个协调一致的答案。

来电者音频
“I rent.” · 含糊地说
STT A
“I rent”
STT B
“I’m Brent”
音频 LLM
“I rent”
保留三份转录文本和原始音频作为证据
推理层
快速 LLM 与推理型 LLM 权衡文本和音频证据。
→ 3 条路径中有 2 条一致:“I rent”
快速 LLM 与推理型 LLM 在作答前交叉验证
TTS
精心筛选的语音可最大限度减少拼写和字母数字组合上的幻觉。
→ “明白了——您说的是‘我租房’。” ✓
首次就准确处理复杂细节。
性能验证

Storm 在 Big Bench Audio 上创下智能纪录。

BBA 测试模型能否理解语音提示,并正确回答复杂问题。我们最强的 Storm 配置在公开评测集上达到 99.4%——仅 0.6% 的错误率,比下一个最佳公开分数少 4 倍。

模型
错误率↓ 越低越好
得分
ThunderPhone Storm · Extra Intelligence错误少 4 倍
0.6%
Step-Audio R1.1
2.4%
Grok Voice Think Fast
2.9%
Ultravox v0.7 Thinking
3.0%
GPT-Realtime-2 High
3.4%
Gemini 3.1 Flash Live High
3.4%
在 Hugging Face 上查看 BBA-Storm 评测数据集

错误率等于 100% 减去 BBA 成功率。ThunderPhone 的结果来自我们公开的评测数据集,链接见上方;其他公开分数(Artificial Analysis 排行榜)仅列作参考。BBA 无法完全反映电话通话表现,但它是衡量模型对语音提示进行推理能力的有效指标。

预设方案胜过自行配置

你不该需要亲手搭建语音技术栈。

Vapi、Retell、Pipecat 和 LiveKit 等其他语音 AI 平台,迫使你做出大量配置决策,才能让通话正常运行。在 ThunderPhone,我们认为调优是我们的工作;为了让通话顺畅运行,你应当尽可能少做工作。

其他语音 AI 平台 · 众多参数需要调校
语音转文字 LLM TTS 端点检测 降噪 打断处理 回退方案 工具架构 延迟 语音活动检测
ThunderPhone 会为您调校这一切
ThunderPhone · 三项决策
1
选择层级
Spark、Bolt 或 Storm。
2
选择声音
精心挑选,并经真实通话测试。
3
编写提示词
行为、政策、工具——使用自然语言。
三项决策。这就是全部设置——编排、回退方案和调优均已内置。
我们为每项任务挑选最佳模型,并将它们整合起来。来自 OpenAI、Anthropic 和 Google 的前沿模型,与开源模型协同工作——为每一通电话统筹最佳性能与价格,让你无需操心。
一个提示词,减少流程图蔓延

一个提示词,而非节点图。

流程构建器之所以存在,是因为较弱的系统无法遵循复杂提示词。对话中的每一步都会变成一个需要您手动构建和维护的节点。Storm 只需一个提示词就能遵循丰富的指令,因此您无需担心节点和连线。

流程构建平台

手动连接每一个分支。

问候提示词 · 声音
收集电话提示词 · 验证
确认电话重新提示 ×2
enroll()工具 · 重试
升级处理转人工
备用方案兜底
无效 ×2错误
一个登记流程需要六个节点——每个节点都有各自的提示词、工具、转场和故障处理。
ThunderPhone Storm

一次描述清楚行为。

行为提示词
问候来电者,并收集其姓名电话
登记前请确认同意——这是必需步骤。
如果对方询问账单问题,请遵循下方的账单政策。
仅在确认所有字段后调用一次enroll()
如果来电者要求与真人沟通,请转接至人工客服
复杂分支 可选监控机制 更轻松地迭代
一个提示词即可编写、测试和迭代——包含分支逻辑。
为何重要

真实通话很复杂。ThunderPhone 已准备就绪。

含糊不清的语音、背景交谈声、姓名和数字、混合语言——ThunderPhone 专为那些会让其他系统失效的场景而打造。

含糊不清的语音

对比音频与文本信号,而非只信任一份转录文本。

糟糕的电话音频

噪声识别与降噪模型可清理音频信号。

背景交谈声

在干扰智能体之前识别旁人交谈。

姓名和地址

交叉核对专有名词、拼写、数字和更正内容。

混合语言语音

需要时通过多语言音频与语音路径进行路由。

长提示词

当行为无法简化为一条规则时,采用更强的推理路径。

延迟、质量与成本

更快的错误答案并不会带来更好的通话。

电话 AI 必须快速响应——但没有正确性的速度,只会更快地交付错误。如今的 LLM 需要片刻思考才能保持可靠,因此 ThunderPhone 会按层级平衡两者。

Spark
~3s
至首次响应
Bolt
~2s
至首次响应
Storm
~2–3s
有确认回应时 ~2 秒 · 无确认回应时 ~3 秒
测量其他供应商声称在理想条件下延迟为 500 毫秒,但在真实通话中通常 约为 2 秒我们在真实条件下测量延迟。
韧性AI 供应商会出现延迟峰值,可能导致通话偏离正轨。遇到这种情况时,ThunderPhone 的编排式一体化技术栈会 自动切换到更快的选项
语音 AI 的代际演进

新一代语音 AI 已经到来

自动化电话通话一直令人沮丧……直到现在。每一波技术都改善了体验,但从未让体验真正流畅。ThunderPhone 改变了这一切。

1990s2010s20242026 · 现在
第 1 代

IVR

销售请按 1,支持请按 2。菜单只能进行路由。

第 2 代

意图机器人

说出“销售”或“账单”,然后希望槽位解析器能识别出来。

第 3 代

三步式 AI

先转写,再询问一个快速 LLM,最后说话——每一步都依赖上一步。

第 4 代

一体化 AI

音频、文本、推理、工具、语音和安全护栏构成一个系统。

专为让其他方案都失效的通话而打造

了解一体化技术栈
如何应对您的最棘手通话。

十分钟即可上线。每分钟 2 美分起。