テクノロジー

3ステップのパイプライン。
その先へ。

多くの音声AIプラットフォームは、音声認識モデル1つ、非推論モデル1つ、音声合成エンジン1つからなる3ステップのパイプラインに依存しています。各ステップが、それぞれ単一障害点になります。ThunderPhoneは、数多くのモデルを同時に連携させることで、ミスを減らします。

発信者の発話:“I rent.”
ASR A“I rent”
ASR B“I’m Brent”
音声LLM“I rent”
照合結果:“I rent”3経路中2経路が一致

いくつもの方法で聞き取り、
結果を突き合わせる。

ThunderPhoneは多数のモデルを同時に協調動作させ、モデル同士がミスを補正し合います。

発信者の発話:“I rent.” — ぼそぼそと不明瞭
他社プラットフォーム3ステップのパイプライン
1通りで聞き取る
STT “I’m Brent”
単一モデルが聞き間違えても、バックアップはない
すばやく回答

高速LLMが参照するのは文字起こしだけ。

話す

「こんにちは、Brentさん。ご用件をお聞かせください」

1つの文字起こし + 1つのLLM = 誤答
ThunderPhone協調制御
3通りで聞き取る
“I rent”“I’m Brent”“I rent”
3つの文字起こしと音声原データを、判断の根拠として保持
照合する

高速LLMと推論モデルでクロスチェック:3経路中2経路が一致。

話す

「承知しました。つまり、賃貸ですね」

聞き取りにくい情報も、一度で正確に把握。

StormがBig Bench Audioで知能性能の新記録を樹立。

BBAは、モデルが音声プロンプトを理解し、難問に正しく答えられるかを検証します。最も高性能なStorm構成が、当社公開の評価セットで99.4%という最高記録を保持しています。

0.6% 誤り率

· 2026年7月Hugging Faceのデータセット
ThunderPhoneStorm · Extra Intelligence0.6%
Qwen Audio 3.0Realtime Plus0.8%
Qwen3.5 OmniPlus Realtime1.3%
Step-Audio R1.1Realtime2.4%

ThunderPhoneの結果は、上記リンクの公開評価データセットに基づいています。その他の公開スコア(Artificial Analysisのリーダーボード)は、比較の目安として掲載しています。

音声スタックを手作業で組み上げる必要はない。

Vapi、Retell、Pipecat、LiveKitなどの音声AIプラットフォームでは、通話を動かすまでに、数多くの設定を自ら判断しなければなりません。ThunderPhoneでは、チューニングは私たちの仕事。スムーズな通話を実現するまでの手間は、できる限り少なくあるべきだと考えています。

他の音声AIプラットフォーム調整項目が多い
STTv4-largeSTTフォールバックLLMtemp 0.3LLMフォールバックTTSTTSフォールバックVAD0.62発話終了判定240 msバージインしきい値−38 dB相づちフィルター割り込みターンタイムアウト800 msノイズ除去ジッターバッファ60 msサンプルレート8 kHzツールスキーマリトライポリシー×3フォールバック

これらすべてをThunderPhoneが自動でチューニング

ThunderPhone3つの設計判断
1
プランを選ぶ

Spark、Bolt、Stormから選択。

2
音声を選ぶ

厳選し、実際の通話で検証済み。

3
プロンプトを書く

振る舞いも、ポリシーも、ツールも。自然な言葉で記述。

決めるのは3つだけ。設定はそれで完了です。オーケストレーション、フォールバック、チューニングはすべて標準搭載。

用途ごとに最適なモデルを選び、組み合わせています。 OpenAI、Anthropic、Googleのフロンティアモデルとオープンソースモデルを連携させ、通話ごとに最高の性能を最適なコストで引き出せるようオーケストレーション。モデルの選定や調整を気にする必要はありません。

ノードをつないだグラフではなく、
1つのプロンプトで。

フロービルダーが必要になるのは、性能の低いシステムでは複雑なプロンプトに従えないからです。会話の各ステップがノードになり、それぞれを手作業で構築・保守しなければなりません。Stormなら、1つのプロンプトにまとめた詳細な指示に従えるため、ノードやエッジを気にする必要はありません。

フロービルダー型プラットフォームすべての分岐を手作業でつなぐ
挨拶 プロンプト・音声
電話番号を取得 プロンプト・検証
電話番号を確認 再質問 ×2
enroll() ツール・再試行
人間の担当者にエスカレーション
全ケース対応のフォールバック 無効 ×2・エラー

1つの登録フローに6つのノード。プロンプト、ツール、遷移、失敗時の処理をノードごとに個別設定。

ThunderPhone Storm振る舞いは一度書くだけ
行動プロンプト

発信者に挨拶し、名前電話番号を取得してください。登録前に同意を確認してください。これは必須です。請求について質問された場合は、以下の請求ポリシーに従ってください。すべての項目を確認した後に限り、enroll()を一度だけ呼び出してください。発信者が担当者との会話を希望した場合は、人間の担当者に転送してください。

複雑な分岐任意設定のウォッチドッグ改善を繰り返しやすい

作成・テスト・改善するのは1つのプロンプトだけ。分岐もその中に含まれます。

本番の通話は、想定外の連続。ThunderPhoneなら準備万端

不明瞭な話し方、周囲の話し声、名前や数字、複数言語が混在する会話。ThunderPhoneは、他のシステムでは対応しきれない状況を前提に設計されています。

不明瞭な発話

1つの文字起こしだけに頼らず、音声とテキストのシグナルを照合します。

聞き取りにくい通話音声

ノイズ識別・低減モデルが音声信号をクリアに整えます。

周囲の話し声

周囲の会話がエージェントの応対に影響する前に識別します。

氏名・住所

固有名詞、表記、数字、訂正内容を突き合わせて確認します。

複数言語が混在する発話

必要に応じて、多言語対応の音声処理・音声生成パスへルーティングします。

長文プロンプト

エージェントの挙動を1つのルールに落とし込めない場合は、より強力な推論アプローチを用います。

誤った答えを速く返しても、通話は良くならない。

音声AIには素早い応答が求められます。しかし、正確さが伴わなければ、ただ間違いを早く返すだけです。現在のLLMが信頼性を保つには、わずかな推論時間が必要です。ThunderPhoneは、レイテンシーと精度のバランスを取ります。

Spark~3s最初の応答まで
Bolt~2s最初の応答まで
Storm~2–3s約2秒(相づちあり)・約3秒(相づちなし)
測定

他社は理想的な条件下で500msのレイテンシーをうたっていますが、通常、実際の通話では2秒前後です。 実際の利用環境に即した条件でレイテンシーを測定しています。

耐障害性

AIベンダーではレイテンシーが突発的に跳ね上がり、通話が破綻することがあります。 ThunderPhoneはスタック全体をオーケストレーションし、こうした場合にはより高速な選択肢へフェイルオーバーします

次世代の音声AIが、いまここに。

自動化された電話対応は、これまでストレスのたまる体験でした。技術革新のたびに改善されてきたものの、本当にスムーズだと言える水準には一度も届いていません。ThunderPhoneが、その常識を変えます。

1990s第1世代

IVR

「営業は1、サポートは2を押してください」。メニューにできるのは、振り分けだけ。

2010s第2世代

インテントボット

「営業」か「請求」と話し、あとはスロットパーサーが正しく拾うことを祈るだけ。

2024第3世代

3ステップAI

文字起こし、高速なLLMへの問い合わせ、音声での応答——各ステップは直前の結果頼み。

2026 · 現在第4世代

統合型AI

音声、テキスト、推論、ツール、ボイス、ガードレールをひとつのシステムに統合。

他のシステムでは対応しきれない通話のために設計

対応が最も難しい通話で、ThunderPhoneの統合スタックをお試しください。

10分で稼働開始。1分あたり2セントから。