自動化された電話対応のほとんどは、使いものにならない。新しいテクノロジーがその現状を変える。
従来の電話自動化に足りなかったのは、聞き心地のよい音声ではない。人との会話を途切れさせず、前に進めるだけの理解力だ。
電話対応の自動化は、もっと簡単になる。
世代が進むたび、機械が扱える文脈は増えていく。
発信者は、機械の言葉で話すしかなかった。
自動化とは、メニュー、DTMF分岐、待機キューを組み合わせることだった。機能するのは、発信者が正しい経路をあらかじめ知っている場合に限られた。
インテントがボタン入力ひとつに単純化されるため、メニューにない用件は、転送か同じ説明の繰り返しになる。
結果 · 発信者は勘で選び、待たされ、同じ説明を繰り返す。
限られた範囲は理解できても、そこを外れると破綻した。
チームは、特定の通話フローごとに音響モデル、インテント分類器、スロット抽出器を学習させていた。有用だったが、変更には高いコストがかかった。
システムは学習済みインテントを1つしか認識できず、2つ目の依頼を取りこぼすか、定型的な追加質問を返す。
結果 · 配偶者の追加は学習済みフローに含まれていないため、その情報は取りこぼされる。
スタックは柔軟になった。だが、各ステップは直前の結果を鵜呑みにしていた。
現在主流の構成では、音声認識、LLM、音声合成をつなぎ、1つの通話ループを作ります。
文字起こしを誤ったり、発信者が途中で割り込んだりすると、LLMは文脈を取り違えたまま、迷いなく誤った応答を返します。
結果 · 一度の聞き取りミスが、そのまま誤った応答になる。
システムが聞き取り、推論し、立て直す。そのすべてを1つのループで。
ThunderPhoneは、音声理解、モデルルーティング、ターンテイキング、応答生成を、単一のアーキテクチャ上で連携させます。
複数の聞き取り経路と音声を考慮した推論により、単一ステップでの失敗が発信者に影響する前に食い止めます。
結果 · 発信者にシステムとの格闘を強いることなく、通話がスムーズに進む。
ブレイクスルーは、より自然なロボット音声ではない。通話を脱線させないアーキテクチャだ。
より正確な音声理解
単一の文字起こしを鵜呑みにせず、複数の信号を比較し、音声そのものをもとに推論できます。
より自然なタイミング
ターンテイキングと割り込みへの対応を、会話ループに組み込んでいます。
より的確なルーティング
各ターンの要件に応じて、高速な処理経路と、より深い推論を使い分けられます。
より快適な体験
発信者は、自動応答の誤りを訂正する時間を減らし、用件の完了により多くの時間を使えます。