音声AIの世代

ほとんどの自動電話応対はひどいものです。新しい技術がそれを変えます。

従来の課題は、電話自動化に心地よい声がなかったことではありません。実際の会話を続けるために十分な理解力がなかったことです。

電話ツリー

IVRの時代

発信者は機械語を話さなければなりませんでした。

自動化とは、メニュー、キーパッドによる分岐、待機列を意味していました。発信者が正しい経路をすでに知っている場合に機能していました。

ぎこちない場面

意図はボタン操作に圧縮されるため、メニュー外の内容はすべて転送か、説明の繰り返しになります。

通話例

IVRの時代

発信者

"明日の予約を変更したいです。"

システム

"請求は1、予約は2、その他のお問い合わせは9を押してください。"

結果

発信者は推測し、待たされ、同じことをもう一度説明します。

システムの思考の仕組み

3 ステージ

メニュー案内

修正済み

固定スクリプトで選択肢を案内。

DTMF分岐

不安定

1つのボタンが意図全体を表す。

待機列

失敗

本当の文脈は人間につながってから届く。

カスタムモデル

初期のAI

限定的な範囲では理解できても、すぐに破綻しました。

チームは特定の通話フロー向けに、音響モデル、意図分類器、スロット抽出器を学習させていました。有用ではあるものの、変更にはコストがかかります。

ぎこちない場面

システムは学習済みの意図を1つ認識できても、2つ目の依頼を取りこぼしたり、融通の利かない追加質問をしたりします。

通話例

初期のAI

発信者

"明日の予約を変更して、配偶者も追加できますか?"

システム

"予約変更をお手伝いできます。希望の日付を教えてください。"

結果

学習済みフローに含まれていないため、配偶者に関する詳細は失われます。

システムの思考の仕組み

3 ステージ

カスタムASR

修正済み

特定の領域とアクセントの組み合わせに合わせて調整。

意図モデル

不安定

既知の依頼のうち最も近いものを分類。

スロット充填

失敗

不足項目があると、スクリプト化された補完を実行。

Vapi / Retell / ElevenLabs型スタック

3ステップのパイプライン

スタックは柔軟になった一方で、各ステップは前の結果を信頼していました。

一般的なモダン構成では、音声認識、LLM、音声合成を1つの通話ループに接続します。

ぎこちない場面

文字起こしが誤っている、または発信者が割り込むと、LLMは誤った内容に自信を持って応答します。

通話例

3ステップのパイプライン

発信者

"いいえ、「I rent」です。ここを借りています。"

システム

"承知しました。牧場の物件ですね。正しいですか?"

結果

たった1つの聞き取りミスが、音声での誤答につながります。

システムの思考の仕組み

3 ステージ

音声認識

失敗

1つの文字起こしが唯一の正しい情報源になります。

LLM

不安定

元の音声ではなく、テキストから生成します。

音声合成

失敗

自信を持って回答を読み上げます。

統合型音声AI

ThunderPhone

1つのループで聞き取り、推論し、立て直せるシステムです。

ThunderPhoneは、音声理解、モデルルーティング、ターンテイキング、応答生成を1つのアーキテクチャとして統合します。

変わること

複数のリスニング経路と音声を理解する推論により、発信者に届く前に単一ステップの失敗を減らします。

通話例

ThunderPhone

発信者

"いいえ、「I rent」です。ここを借りています。"

システム

"承知しました。住居は賃貸とのことなので、所有に関する質問は省略します。"

結果

発信者にシステムとの格闘を強いることなく、通話が前に進みます。

システムの思考の仕組み

4 ステージ

音声ストリーム

チェック済み

生の音声を推論に活用できます。

冗長リスニング

チェック済み

行動する前にシグナルを比較します。

モデルルーティング

チェック済み

高速な経路と高度な経路が、ターンごとに連携します。

自然な応答

チェック済み

発信者には修正された文脈が伝わります。

その先にあるもの

ブレークスルーは、より自然なロボット音声ではありません。通話を正しい流れに保つアーキテクチャです。

より正確な聞き取り

システムは単一の文字起こしを鵜呑みにせず、信号を比較して音声全体を推論できます。

より良いタイミング

ターンテイキングと割り込み処理は、会話ループの一部です。

より良いルーティング

各ターンのニーズに応じて、高速な経路とより深い推論を選択できます。

より良い体験

発信者は自動応答の訂正に費やす時間を減らし、用件の完了により多くの時間を使えます。