テクノロジー

3ステップのパイプラインを超える。

多くの音声AIプラットフォームは、1つの文字起こしモデル、1つの非推論モデルLLM、1つの音声合成エンジンという3ステップのパイプラインに依存しています。各ステップが単一障害点になります。ThunderPhoneは複数のモデルを同時に連携させ、ミスを減らします。

発信者の発話 “I rent.”
ASR A“I rent”
ASR B“I’m Brent”
音声LLM“I rent”
照合済み “I rent” 3経路中2経路が一致
統合アーキテクチャ

多様な聞こえ方を捉え、照合する。

ThunderPhoneは複数のモデルを同時に連携させ、互いのミスを修正します。

他社プラットフォーム · 3段階パイプライン

各ステップが前の結果を信頼する。

発信者の音声
“I rent.” · つぶやき声
STT A
“I’m Brent”
STT B
音声LLM
単一モデルが聞き間違えてもバックアップがない
LLM
高速モデルが確認するのは文字起こしのみです。
→「Hi, Brent — how can I help?」と応答
高速LLMは指示に従う際にミスをする
TTS
回答を音声で返します。
→「Hi, Brent — how can I help?」と発話 ✗
1つの文字起こし + 1つのLLM = 誤った回答
ThunderPhone · オーケストレーション

複数の経路、ひとつの統合された回答。

発信者の音声
“I rent.” · つぶやき声
STT A
“I rent”
STT B
“I’m Brent”
音声LLM
“I rent”
3件の文字起こしと生音声を証拠として保持
推論レイヤー
高速LLMと推論LLMが、テキストと音声の証拠を比較検討する。
→ 3経路中2経路が一致: “I rent”
推論モデルと非推論モデルのLLMが、回答前に相互検証する
TTS
厳選した音声により、スペルや英数字に関するハルシネーションを最小化します。
→ 「承知しました。賃貸ですね。」✓
難しい詳細も最初から正確に処理します。
性能の実証

StormはBig Bench Audioで知能性能の記録を更新。

BBAは、モデルが音声プロンプトを理解し、難しい質問に正しく答えられるかをテストします。最も高性能なStorm構成は、公開評価セットで99.4%を達成しました。ミス率は0.6%で、次に高い公開スコアより4×少ない結果です。

モデル
ミス率↓ 低いほど良い
スコア
ThunderPhone Storm · Extra Intelligenceミスが4×少ない
0.6%
Step-Audio R1.1
2.4%
Grok Voice Think Fast
2.9%
Ultravox v0.7 Thinking
3.0%
GPT-Realtime-2 High
3.4%
Gemini 3.1 Flash Live High
3.4%
Hugging FaceでBBA-Storm評価データセットを見る

ミス率はBBAの成功率を100%から引いた値です。ThunderPhoneの結果は、上記でリンクしている公開評価データセットによるものです。その他の公開スコア(Artificial Analysisのリーダーボード)は比較の目安として掲載しています。BBAは電話での通話パフォーマンスを完全には捉えきれませんが、音声プロンプトに対する推論能力を測る有用な指標です。

設定自在より、最適化

音声スタックを手作業で組み立てる必要はありません。

Vapi、Retell、Pipecat、LiveKitなどの他の音声AIプラットフォームでは、通話を機能させるために多くの設定を決める必要があります。ThunderPhoneでは、チューニングは私たちの仕事であり、通話をスムーズに機能させるための作業はできる限り少なくあるべきだと考えています。

他の音声AIプラットフォーム · 調整項目が多数
STT LLM TTS 発話終端検出 ノイズ除去 割り込み フォールバック ツールスキーマ レイテンシ VAD
ThunderPhoneがすべてを最適化
ThunderPhone · 3つの選択
1
ティアを選択
Spark、Bolt、またはStorm。
2
音声を選択
厳選し、実際の通話でテスト済み。
3
プロンプトを書く
振る舞い、ポリシー、ツールを、自然な言葉で。
選択は3つ。それがセットアップのすべてです。オーケストレーション、フォールバック、チューニングは標準で組み込まれています。
用途に最適なモデルを選び、組み合わせます。OpenAI、Anthropic、Googleの最先端モデルとオープンソースモデルを連携させ、すべての通話で最高の性能と価格を実現するようオーケストレーションします。細かな調整を気にする必要はありません。
単一のプロンプトで、グラフの乱立を解消

ノードのグラフではなく、1つのプロンプト。

フロービルダーがあるのは、性能の低いシステムでは複雑なプロンプトに従えないからです。会話のすべてのステップが、手作業で構築・保守しなければならないノードになります。Stormは1つのプロンプトから詳細な指示に従うため、ノードやエッジを気にする必要はありません。

フロービルダー型プラットフォーム

すべての分岐を手作業で接続。

あいさつプロンプト・音声
電話番号を取得プロンプト・検証
電話番号を確認再プロンプト ×2
enroll()ツール・再試行
エスカレーション担当者へ
フォールバックその他すべて
無効 ×2エラー
1つの登録フローに6つのノード。それぞれにプロンプト、ツール、遷移、障害対応が必要です。
ThunderPhone Storm

動作を一度説明するだけ。

動作プロンプト
発信者にあいさつし、名前電話番号を取得する。
登録前に同意を確認する — 必須。
請求について質問された場合は、以下の請求ポリシーに従う。
すべての項目を確認してから一度だけenroll()を呼び出す。
発信者が担当者を求めた場合は、担当者に転送する
複雑な分岐 任意の監視機能 簡単な反復改善
作成、テスト、反復改善を1つのプロンプトで。分岐も含まれます。
重要な理由

本番の通話は複雑です。ThunderPhoneなら対応できます。

聞き取りにくい話し方、周囲の雑談、名前や番号、複数言語の混在。ThunderPhoneは、他のシステムが対応できなくなる状況のために設計されています。

不明瞭な発話

1つの文字起こしだけを信頼せず、音声とテキストの信号を比較します。

音質の悪い通話音声

ノイズ識別・低減モデルが音声信号をクリアにします。

周囲の会話

エージェントの対応を妨げる前に、周囲の会話を識別します。

名前と住所

固有名詞、スペル、数字、訂正内容を相互検証します。

複数言語が混じる発話

必要に応じて、多言語対応の音声・音声生成経路へルーティングします。

長いプロンプト

挙動を1つのルールに還元できない場合は、より強力な推論経路を使います。

レイテンシー、品質、コスト

速くても間違った回答では、より良い通話にはなりません。

電話AIには迅速な応答が求められます。しかし、正確さを欠いたスピードは、ミスを速く届けるだけです。現在のLLMは信頼性を維持するために推論の時間を少し必要とするため、ThunderPhoneはティアごとに両者のバランスを取ります。

Spark
~3s
最初の応答まで
Bolt
~2s
最初の応答まで
Storm
~2–3s
約2秒(相づちあり)· 約3秒(相づちなし)
計測他社ベンダーは理想的な条件下で500msのレイテンシーをうたっていますが、実際の通話では通常約2秒かかります実際の環境でレイテンシーを計測しています。
耐障害性AIベンダーでは、通話を台無しにしかねないレイテンシーの急増が発生します。このような場合、ThunderPhoneの統合スタックはより高速な選択肢へフェイルオーバーします
音声AIの世代

次世代の音声AIが登場

自動電話は、これまでストレスの多い体験でした…今までは。技術の各世代で体験は改善されてきましたが、本当にスムーズとは言えませんでした。ThunderPhoneがそれを変えます。

1990s2010s20242026 · 現在
第1世代

IVR

営業は1、サポートは2を押してください。メニューにできるのは振り分けだけです。

第2世代

インテントボット

「営業」や「請求」と言って、スロットパーサーが認識してくれることを願う。

第3世代

3ステップAI

文字起こしし、高速LLMに一度質問してから発話。各ステップは前のステップを信頼します。

第4世代

統合AI

音声、テキスト、推論、ツール、音声合成、ガードレールを一つのシステムとして統合。

他のすべてが対応できない通話のために構築

統合スタックを
最難関の通話でご確認ください。

10分で稼働。1分あたり2¢から。