ThunderPhone 2.0 正式上线。全程自助,2 美分/分钟起。查看发布公告
全部文章

ThunderPhone 正式发布

2026年3月10日Alex Kolchinski

**更新,2026 年 8 月:**这是我们于 2026 年 3 月发布的原始上线公告,为存档而保留。此后部分细节——尤其是定价和语音选项——已有变化;请查看当前定价,了解今日实际有效的信息。等待已经结束:阅读 v2 上线公告

今天,我们自豪地宣布 ThunderPhone 正式公开上线,它让您能够轻松通过 AI 自动处理电话通话。ThunderPhone 采用与其他电话 AI 平台截然不同的一体化架构,因此能够实现更高的性能、更低的成本,并减少集成难题。ThunderPhone 支持数十种语言的呼入和呼出通话,并符合 HIPAA 和 GDPR 要求。

一体化优势

其他电话 AI 平台通过强制其系统采用三步结构,限制了系统的性能:

  1. 一个转写模型,将用户的语音转换为文本。
  2. 一个 LLM,处理用户的文本并生成回复。
  3. 一个 TTS 模型,将回复文本转换回音频。

其中大多数平台还将工程工作转嫁给用户,迫使用户选择要使用的模型,以及降噪和响应速度等配置选项。

我们采取了不同的方法:我们配置了我们认为基于当今模型所能实现的最佳一体化技术栈,并让您无需投入复杂的配置工作即可使用。我们的系统会同时使用多个模型,并根据对话流程在这些模型之间智能路由。这包括:

  • 结合多个转写模型——有些更快,有些更准确——以平衡速度与准确性,并弥补彼此的错误。
  • 将音频输入 LLM(其通用智能水平可能较低,但对音频的理解更好)与纯文本 LLM 相结合;后者可能因转写不准确而出错,但通常更智能。
  • 将快速但不够智能、能够迅速生成回复的 LLM,与更智能但更慢、能够在后台运行以确保 AI 遵循提示并正确回应用户所说内容的 LLM 相结合。
  • 将 OpenAI 和 Google 等顶级提供商的商业模型——提供当今可用的最高智能水平——与丰富多样的开源模型相结合;开源模型往往能以更低成本提供更快速度。
  • 同时使用多个模型,对背景噪音、旁人交谈以及其他可能干扰对话的噪音进行分类和消除。

在我们的三个服务层级 Spark、Bolt 和 Storm 中,这些组件及更多能力以不同方式编排——Spark 针对成本优化,Bolt 针对速度优化,Storm 针对智能水平优化,同时尽可能减少各自的缺点。三个系统都具备共同优势,例如对用户所说内容拥有极其准确的理解能力,即使其中包含专有名词和拼写也是如此。

我们发现,与其他供应商提供的僵化三步方法相比,这种紧密一体化的架构能让我们的系统以更低成本实现高得多的性能。正如克莱·克里斯滕森的模块化理论所指出的,语音 AI 仍处于早期阶段;与通过模块化架构最大化可定制性相比,通过一体化架构最大化性能仍然更有价值。

优化决策

至于可定制性,我们并不推崇!如今大多数电话 AI 平台迫使用户在无穷无尽的选项中周旋,从所使用的具体模型,到 AI 打断用户速度这类极其细致的参数。

在我们看来,在幕后优化这些选择是我们的职责,这样 ThunderPhone 的用户便能专注于自己擅长的事,而无需担心复杂的语音 AI 配置。我们将自己视为某种 Squarespace,让用户无需费力,即可利用当今的模型,以尽可能高的性能设置电话智能体。

易用性

ThunderPhone 也极其易用,无论您是在设置新的电话智能体,还是从其他平台或自定义技术栈迁移。要在 ThunderPhone 上设置电话智能体,您只需:

  1. 决定您想使用 Spark、Bolt 还是 Storm。
  2. 选择声音。
  3. 向我们提供您的提示词。无需多提示词智能体!如果您的提示词对 Spark 或 Bolt 来说过于复杂,可以升级到 Storm;它只需一个提示词,即可处理复杂的使用场景。
  4. 通过极易使用的向导连接软件集成(任何端点或原生 n8n 集成)。
  5. 通过极易使用的向导连接您的 VoIP。

这一切通常只需 10 分钟或更短时间。

ThunderPhone 符合 HIPAA 和 GDPR 要求,并且我们会应要求签署并提供 BAA 和 DPA。

我们的故事

我们是一支由 Stanford AI Lab 和 Y Combinator 校友组成的团队,自 2024 年起一直专注于语音 AI。最初,我们的重点是 Flux Interpreting,它可以在不同语言之间翻译电话通话。但客户不断询问我们,能否为他们的企业自动处理电话,而不只是翻译电话,因此我们将重心转向了如今的 ThunderPhone。

现有平台的问题

起初,我们是在其他公司的电话 AI 平台上为客户构建电话智能体。我们测试了市面上几乎所有的电话 AI 平台,但遗憾的是,我们发现它们都存在不足,尤其体现在:

  • 音频理解:仅依赖单一转录模型将用户音频转换为文本,意味着 AI 经常会“听错”用户的意思,尤其是在专有名词、生僻词和拼写方面。
  • 指令遵循:由单个快速 LLM 承担通话背后的实际“脑力工作”,意味着 AI 往往难以正确遵循指令,并容易偏离正轨。
  • 集成困难:我们尝试过的平台让连接外部软件变得非常困难,通常需要我们为工具调用输入大量 JSON 配置,并反复尝试,却几乎得不到任何反馈,直到它们突然开始正常工作。
  • 价格:现有平台通常收费极高:表现平平,却往往每分钟收费 10 美分或更多。

构建我们自己的一体化技术栈

当我们签下为一家企业客户实施销售通话场景的项目时,为了满足他们的需求,我们不得不构建自己的定制一体化技术栈。这个场景要求很高:与客户支持不同,客户支持中的来电者大多处于企业的主导之下,而销售来电者很快就会挂断电话。

通话质量必须足够出色,才能促成销售而非失去潜在客户。这意味着需要处理大量标准转录模型难以准确识别的专有名词和拼写,包括姓名和地址。为了做好这一场景,我们构建了如今的 ThunderPhone。

在此过程中,我们不断结识旧金山语音 AI 社区中正在打造垂直领域电话智能体公司的朋友——服务于兽医、卡车司机等行业。令人意外的是,他们大多数人的看法都相同:现有平台足以用于演示,但还不足以投入生产环境。

令人震惊的是,我们在垂直语音 AI 公司中的许多朋友,甚至可能是大多数朋友,实际上都在“自建”一体化技术栈……这让我们无法理解——这真的相当于 90 年代的 Web 创业公司不得不把自己的 Web 服务器托管在壁橱里的一台服务器上。

有了这一洞察,我们意识到,是时候将我们的电话 AI 系统变成一个任何人都能使用的平台了。

垂直语音 AI 公司和顾问应当能够凭借其行业专业知识,专注于满足目标市场的需求——而不是精细地设计底层 AI 和电话技术! 这正是我们今天通过 ThunderPhone 推出的产品。

走到今天是一段漫长的旅程!对于自去年 4 月以来注册、却仍在等待访问权限的每一位用户,我们深表歉意:我们原以为这只是一次快速冲刺就能完成的工作,结果却变成了长达数月的探索——研究如何将当今可用的模型编织成一个尽可能稳健的系统。

但现在我们终于正式上线了——欢迎试用,并告诉我们您的看法!

虽然我们已经解决了主要问题,但系统中肯定仍会有一些 bug。如果您发现任何问题,请发送邮件至 alex@thunderphone.com,我会确保尽快为您修复。若您有任何功能需求,也请告诉我们,我们也会尽快为您实现。

如果您有更多定制需求,例如定制实施和集成支持、超出常规 HIPAA 和 GDPR 范围的合规需求、SLA 以及定制功能需求,我们也很乐意与您洽谈企业合作。请通过 alex@thunderphone.com 联系我们,我们将了解您的需求,并讨论我们能否提供帮助。

更广泛地说:我们对您的承诺是,确保 ThunderPhone 开箱即用、只需您付出极少的精力,并在您选择的任何价位——Spark、Bolt 或 Storm——所允许的范围内,尽可能完美地处理您企业的电话通话,这是我们的职责。欢迎试用,我们很期待向您展示 ThunderPhone 能做到什么。

请告诉我们您的看法,感谢您的支持!