ThunderPhone 可同时编排多个模型,让它们相互纠正错误。
BBA 测试模型能否理解语音提示,并正确回答复杂问题。我们最强的 Storm 配置在公开评测集上达到 99.4%——仅 0.6% 的错误率,比下一个最佳公开分数少 4 倍。
错误率等于 100% 减去 BBA 成功率。ThunderPhone 的结果来自我们公开的评测数据集,链接见上方;其他公开分数(Artificial Analysis 排行榜)仅列作参考。BBA 无法完全反映电话通话表现,但它是衡量模型对语音提示进行推理能力的有效指标。
Vapi、Retell、Pipecat 和 LiveKit 等其他语音 AI 平台,迫使你做出大量配置决策,才能让通话正常运行。在 ThunderPhone,我们认为调优是我们的工作;为了让通话顺畅运行,你应当尽可能少做工作。
流程构建器之所以存在,是因为较弱的系统无法遵循复杂提示词。对话中的每一步都会变成一个需要您手动构建和维护的节点。Storm 只需一个提示词就能遵循丰富的指令,因此您无需担心节点和连线。
含糊不清的语音、背景交谈声、姓名和数字、混合语言——ThunderPhone 专为那些会让其他系统失效的场景而打造。
对比音频与文本信号,而非只信任一份转录文本。
噪声识别与降噪模型可清理音频信号。
在干扰智能体之前识别旁人交谈。
交叉核对专有名词、拼写、数字和更正内容。
需要时通过多语言音频与语音路径进行路由。
当行为无法简化为一条规则时,采用更强的推理路径。
电话 AI 必须快速响应——但没有正确性的速度,只会更快地交付错误。如今的 LLM 需要片刻思考才能保持可靠,因此 ThunderPhone 会按层级平衡两者。
自动化电话通话一直令人沮丧……直到现在。每一波技术都改善了体验,但从未让体验真正流畅。ThunderPhone 改变了这一切。
销售请按 1,支持请按 2。菜单只能进行路由。
说出“销售”或“账单”,然后希望槽位解析器能识别出来。
先转写,再询问一个快速 LLM,最后说话——每一步都依赖上一步。
音频、文本、推理、工具、语音和安全护栏构成一个系统。