ThunderPhone 2.0、提供開始。セルフサービスで、1分あたり2¢から。発表内容を見る
音声AIの進化

自動化された電話対応のほとんどは、使いものにならない。新しいテクノロジーがその現状を変える。

従来の電話自動化に足りなかったのは、聞き心地のよい音声ではない。人との会話を途切れさせず、前に進めるだけの理解力だ。

電話の自動音声メニュー·IVRの時代

発信者は、機械の言葉で話すしかなかった。

自動化とは、メニュー、DTMF分岐、待機キューを組み合わせることだった。機能するのは、発信者が正しい経路をあらかじめ知っている場合に限られた。

ぎこちない瞬間

インテントがボタン入力ひとつに単純化されるため、メニューにない用件は、転送か同じ説明の繰り返しになる。

通話サンプルIVRの時代
明日の予約を変更したいです。
請求に関するお問い合わせは1を、予約に関するお問い合わせは2を、その他のお問い合わせは9を押してください。

結果 · 発信者は勘で選び、待たされ、同じ説明を繰り返す。

システムの思考プロセス · 3ステージ
メニュー案内固定DTMF分岐不安定待機キュー破綻
カスタムモデル·初期のAI

限られた範囲は理解できても、そこを外れると破綻した。

チームは、特定の通話フローごとに音響モデル、インテント分類器、スロット抽出器を学習させていた。有用だったが、変更には高いコストがかかった。

ぎこちない瞬間

システムは学習済みインテントを1つしか認識できず、2つ目の依頼を取りこぼすか、定型的な追加質問を返す。

通話サンプル初期のAI
明日の予約を変更して、配偶者も追加できますか?
予約変更ですね。ご希望の日付を教えてください。

結果 · 配偶者の追加は学習済みフローに含まれていないため、その情報は取りこぼされる。

システムの思考プロセス · 3ステージ
カスタムASR固定インテントモデル不安定スロットフィリング破綻
Vapi / Retell / ElevenLabs型のスタック·3ステップのパイプライン

スタックは柔軟になった。だが、各ステップは直前の結果を鵜呑みにしていた。

現在主流の構成では、音声認識、LLM、音声合成をつなぎ、1つの通話ループを作ります。

ぎこちない瞬間

文字起こしを誤ったり、発信者が途中で割り込んだりすると、LLMは文脈を取り違えたまま、迷いなく誤った応答を返します。

通話サンプル3ステップのパイプライン
いいえ、「I rent」です。ここは借りています。
承知しました。牧場の物件ということですね。お間違いないですか?

結果 · 一度の聞き取りミスが、そのまま誤った応答になる。

システムの思考プロセス · 3ステージ
音声認識破綻LLM不安定音声合成破綻
統合型音声AI·ThunderPhone

システムが聞き取り、推論し、立て直す。そのすべてを1つのループで。

ThunderPhoneは、音声理解、モデルルーティング、ターンテイキング、応答生成を、単一のアーキテクチャ上で連携させます。

ここが違う

複数の聞き取り経路と音声を考慮した推論により、単一ステップでの失敗が発信者に影響する前に食い止めます。

通話サンプルThunderPhone
いいえ、「I rent」です。ここは借りています。
承知しました。お住まいは賃貸ですね。所有に関する質問は省略します。

結果 · 発信者にシステムとの格闘を強いることなく、通話がスムーズに進む。

システムの思考プロセス · 4ステージ
音声ストリーム検証聞き取りの冗長化検証モデルルーティング検証自然な応答検証

ブレイクスルーは、より自然なロボット音声ではない。通話を脱線させないアーキテクチャだ。

より正確な音声理解

単一の文字起こしを鵜呑みにせず、複数の信号を比較し、音声そのものをもとに推論できます。

より自然なタイミング

ターンテイキングと割り込みへの対応を、会話ループに組み込んでいます。

より的確なルーティング

各ターンの要件に応じて、高速な処理経路と、より深い推論を使い分けられます。

より快適な体験

発信者は、自動応答の誤りを訂正する時間を減らし、用件の完了により多くの時間を使えます。

統合がもたらすもの

統合アーキテクチャを詳しく見る