技术

不止于
三段式处理链路。

大多数语音 AI 平台都依赖一条三段式处理链路:一个语音转写模型、一个不具备推理能力的 LLM,以及一个文本转语音引擎。每个环节都是一个单点故障源。ThunderPhone 同时编排多个模型,以减少错误。

来电者说:“I rent.”
ASR A“I rent”
ASR B“I’m Brent”
音频 LLM“I rent”
综合判定为 “I rent”3 条路径中有 2 条结果一致

多路听辨,
再交叉校正。

ThunderPhone 同时调度多个模型,让它们相互纠错。

来电者说:“I rent.”——声音含糊
其他平台3 步流水线
单路识别
STT:“I’m Brent”
单一模型一旦听错,没有其他机制兜底
快速应答

快速 LLM 只能看到转写文本。

统一作答

“您好,Brent——有什么可以帮您?”

1 份转写文本 + 1 个 LLM = 错误回答
ThunderPhone协同编排
三路并行识别
“I rent”“I’m Brent”“I rent”
保留 3 份转写文本和原始音频作为证据
交叉核验

快速 LLM 与推理型 LLM 交叉核验:3 条路径中有 2 条结论一致。

统一作答

“明白了——您说的是‘我租房’。”

再难的细节,也能一次准确识别。

Storm 在 Big Bench Audio 上创下智能表现新纪录。

BBA 用来测试模型能否听懂语音提示,并正确回答高难度问题。我们最强的 Storm 配置目前保持纪录:在我们的公开评测集上达到 99.4%。

0.6% 错误率

· 2026 年 7 月Hugging Face 上的数据集
ThunderPhoneStorm · Extra Intelligence0.6%
Qwen Audio 3.0Realtime Plus0.8%
Qwen3.5 OmniPlus Realtime1.3%
Step-Audio R1.1Realtime2.4%

ThunderPhone 的结果来自上方链接的公开评测数据集;其他公开得分(Artificial Analysis 排行榜)仅供参考。

语音技术栈,不该让您亲手拼装。

使用 Vapi、Retell、Pipecat 和 LiveKit 等其他语音 AI 平台,您必须完成大量配置,才能让通话正常运行。ThunderPhone 则认为,调优该由我们负责;要让通话顺畅运行,您需要做的事应该越少越好。

其他语音 AI 平台参数繁多,需逐一调校
STTv4-largeSTT 备用方案LLMtemp 0.3LLM 回退TTSTTS 备用方案VAD0.62端点检测240 ms插话阈值−38 dB附和声过滤打断轮次超时800 ms降噪抖动缓冲区60 ms采样率8 kHz工具 Schema重试策略×3回退机制

这一切都由 ThunderPhone 为您调优

ThunderPhone三项决策
1
选择套餐

Spark、Bolt 或 Storm。

2
选择音色

精心筛选,并经过真实通话验证。

3
编写提示词

行为、策略、工具——直接用自然语言描述。

只需做三项选择,配置即告完成——编排、备用方案和调优全部内置。

我们为每项任务挑选最合适的模型,并将它们无缝组合。OpenAI、Anthropic、Google 的前沿模型与开源模型协同工作——每通电话都经过精心编排,兼顾最佳性能与价格,您无需操心。

一条提示词,
无需节点图。

流程构建器之所以存在,是因为能力较弱的系统无法遵循复杂提示词。对话中的每一步都会变成一个节点,需要您手动搭建和维护。Storm 只需一条提示词就能遵循详尽指令,因此您无需再操心节点和连线。

流程编排平台每个分支都要手动串联
问候语 提示词 · 语音
收集电话号码 提示词 · 验证
确认电话号码 重新提示 ×2
enroll() 工具 · 重试
转人工
全局兜底 无效 ×2 · 错误

一套登记流程就要用到 6 个节点——每个节点都要单独配置提示词、工具、跳转规则和失败处理。

ThunderPhone Storm行为逻辑只需描述一次
行为提示词

向来电者问好,并收集对方的姓名电话号码。录入前先确认对方同意——此项必须完成。如果对方询问计费问题,请遵循下方的计费政策。确认所有字段后,才能调用一次enroll()。如果来电者要求与真人沟通,请转接人工

复杂分支可选的看门狗机制迭代更轻松

一条提示词,从编写、测试到迭代——连分支逻辑也一并涵盖。

真实业务中的通话状况百出。ThunderPhone 早有准备

含混的说话声、背景交谈声、姓名和数字、多语言夹杂——ThunderPhone 正是为这些会让其他系统失灵的场景而打造。

含糊不清的语音

同时比对音频与文本信号,而非只依赖单一转写结果。

通话音质不佳

噪声识别与降噪模型可过滤音频信号中的干扰。

背景交谈声

识别旁人交谈,避免智能体被带偏。

姓名与地址

交叉核验专有名词、拼写、数字和更正内容。

多语言混说

需要时,自动选择多语言音频与语音链路。

长提示词

当智能体行为无法简化为单一规则时,采用更强的推理路径。

答错得再快,也不会带来更好的通话体验。

语音智能体必须快速回应——但快而不准,只会更快出错。如今的 LLM 需要一点思考时间,才能保持可靠,因此 ThunderPhone 会在响应延迟与准确性之间取得平衡。

Spark~3s首次响应耗时
Bolt~2s首次响应耗时
Storm~2–3s约 2 秒(含确认回应)· 约 3 秒(不含确认回应)
实测

其他厂商宣称理想条件下延迟仅 500 毫秒,但在真实通话中通常约为 2 秒 我们基于真实场景测试延迟。

系统韧性

AI 服务商有时会出现延迟飙升,打乱整个通话流程。 ThunderPhone 通过技术栈统一编排,在这种情况下会自动切换至更快的方案

下一代语音 AI,已经到来

过去,自动化通话总让人倍感挫败……但到此为止。一轮轮技术迭代让体验不断改善,却始终称不上真正顺畅。ThunderPhone 改变了这一切。

1990s第 1 代

IVR

“销售请按 1,技术支持请按 2。”菜单只能转接来电。

2010s第 2 代

意图机器人

说出“销售”或“账单”,然后只能寄希望于槽位解析器正确识别。

2024第 3 代

三步式 AI

先转写,再调用一个高速 LLM,最后合成语音——每一步都依赖上一步的结果。

2026 · 现在第 4 代

一体化 AI

将音频、文本、推理、工具、音色与安全护栏融于一套系统。

专为那些让其他方案失效的通话而生

用我们的一体化技术栈应对您最棘手的通话。

10 分钟即可上线。每分钟 2 美分起。