音声AIの世代
ほとんどの自動電話応対はひどいものです。新しい技術がそれを変えます。
従来の課題は、電話自動化に心地よい声がなかったことではありません。実際の会話を続けるために十分な理解力がなかったことです。
電話応対は自動化しやすくなる
世代が進むごとに、より多くのコンテキストが機械に取り込まれます。
電話ツリー
IVRの時代
発信者は機械語を話さなければなりませんでした。
自動化とは、メニュー、キーパッドによる分岐、待機列を意味していました。発信者が正しい経路をすでに知っている場合に機能していました。
ぎこちない場面
意図はボタン操作に圧縮されるため、メニュー外の内容はすべて転送か、説明の繰り返しになります。
通話例
IVRの時代
発信者
"明日の予約を変更したいです。"
システム
"請求は1、予約は2、その他のお問い合わせは9を押してください。"
結果
発信者は推測し、待たされ、同じことをもう一度説明します。
システムの思考の仕組み
3 ステージメニュー案内
修正済み固定スクリプトで選択肢を案内。
DTMF分岐
不安定1つのボタンが意図全体を表す。
待機列
失敗本当の文脈は人間につながってから届く。
カスタムモデル
初期のAI
限定的な範囲では理解できても、すぐに破綻しました。
チームは特定の通話フロー向けに、音響モデル、意図分類器、スロット抽出器を学習させていました。有用ではあるものの、変更にはコストがかかります。
ぎこちない場面
システムは学習済みの意図を1つ認識できても、2つ目の依頼を取りこぼしたり、融通の利かない追加質問をしたりします。
通話例
初期のAI
発信者
"明日の予約を変更して、配偶者も追加できますか?"
システム
"予約変更をお手伝いできます。希望の日付を教えてください。"
結果
学習済みフローに含まれていないため、配偶者に関する詳細は失われます。
システムの思考の仕組み
3 ステージカスタムASR
修正済み特定の領域とアクセントの組み合わせに合わせて調整。
意図モデル
不安定既知の依頼のうち最も近いものを分類。
スロット充填
失敗不足項目があると、スクリプト化された補完を実行。
Vapi / Retell / ElevenLabs型スタック
3ステップのパイプライン
スタックは柔軟になった一方で、各ステップは前の結果を信頼していました。
一般的なモダン構成では、音声認識、LLM、音声合成を1つの通話ループに接続します。
ぎこちない場面
文字起こしが誤っている、または発信者が割り込むと、LLMは誤った内容に自信を持って応答します。
通話例
3ステップのパイプライン
発信者
"いいえ、「I rent」です。ここを借りています。"
システム
"承知しました。牧場の物件ですね。正しいですか?"
結果
たった1つの聞き取りミスが、音声での誤答につながります。
システムの思考の仕組み
3 ステージ音声認識
失敗1つの文字起こしが唯一の正しい情報源になります。
LLM
不安定元の音声ではなく、テキストから生成します。
音声合成
失敗自信を持って回答を読み上げます。
統合型音声AI
ThunderPhone
1つのループで聞き取り、推論し、立て直せるシステムです。
ThunderPhoneは、音声理解、モデルルーティング、ターンテイキング、応答生成を1つのアーキテクチャとして統合します。
変わること
複数のリスニング経路と音声を理解する推論により、発信者に届く前に単一ステップの失敗を減らします。
通話例
ThunderPhone
発信者
"いいえ、「I rent」です。ここを借りています。"
システム
"承知しました。住居は賃貸とのことなので、所有に関する質問は省略します。"
結果
発信者にシステムとの格闘を強いることなく、通話が前に進みます。
システムの思考の仕組み
4 ステージ音声ストリーム
チェック済み生の音声を推論に活用できます。
冗長リスニング
チェック済み行動する前にシグナルを比較します。
モデルルーティング
チェック済み高速な経路と高度な経路が、ターンごとに連携します。
自然な応答
チェック済み発信者には修正された文脈が伝わります。
その先にあるもの
ブレークスルーは、より自然なロボット音声ではありません。通話を正しい流れに保つアーキテクチャです。
より正確な聞き取り
システムは単一の文字起こしを鵜呑みにせず、信号を比較して音声全体を推論できます。
より良いタイミング
ターンテイキングと割り込み処理は、会話ループの一部です。
より良いルーティング
各ターンのニーズに応じて、高速な経路とより深い推論を選択できます。
より良い体験
発信者は自動応答の訂正に費やす時間を減らし、用件の完了により多くの時間を使えます。