ThunderPhoneは複数のモデルを同時に連携させ、互いのミスを修正します。
BBAは、モデルが音声プロンプトを理解し、難しい質問に正しく答えられるかをテストします。最も高性能なStorm構成は、公開評価セットで99.4%を達成しました。ミス率は0.6%で、次に高い公開スコアより4×少ない結果です。
ミス率はBBAの成功率を100%から引いた値です。ThunderPhoneの結果は、上記でリンクしている公開評価データセットによるものです。その他の公開スコア(Artificial Analysisのリーダーボード)は比較の目安として掲載しています。BBAは電話での通話パフォーマンスを完全には捉えきれませんが、音声プロンプトに対する推論能力を測る有用な指標です。
Vapi、Retell、Pipecat、LiveKitなどの他の音声AIプラットフォームでは、通話を機能させるために多くの設定を決める必要があります。ThunderPhoneでは、チューニングは私たちの仕事であり、通話をスムーズに機能させるための作業はできる限り少なくあるべきだと考えています。
フロービルダーがあるのは、性能の低いシステムでは複雑なプロンプトに従えないからです。会話のすべてのステップが、手作業で構築・保守しなければならないノードになります。Stormは1つのプロンプトから詳細な指示に従うため、ノードやエッジを気にする必要はありません。
聞き取りにくい話し方、周囲の雑談、名前や番号、複数言語の混在。ThunderPhoneは、他のシステムが対応できなくなる状況のために設計されています。
1つの文字起こしだけを信頼せず、音声とテキストの信号を比較します。
ノイズ識別・低減モデルが音声信号をクリアにします。
エージェントの対応を妨げる前に、周囲の会話を識別します。
固有名詞、スペル、数字、訂正内容を相互検証します。
必要に応じて、多言語対応の音声・音声生成経路へルーティングします。
挙動を1つのルールに還元できない場合は、より強力な推論経路を使います。
電話AIには迅速な応答が求められます。しかし、正確さを欠いたスピードは、ミスを速く届けるだけです。現在のLLMは信頼性を維持するために推論の時間を少し必要とするため、ThunderPhoneはティアごとに両者のバランスを取ります。
自動電話は、これまでストレスの多い体験でした…今までは。技術の各世代で体験は改善されてきましたが、本当にスムーズとは言えませんでした。ThunderPhoneがそれを変えます。
営業は1、サポートは2を押してください。メニューにできるのは振り分けだけです。
「営業」や「請求」と言って、スロットパーサーが認識してくれることを願う。
文字起こしし、高速LLMに一度質問してから発話。各ステップは前のステップを信頼します。
音声、テキスト、推論、ツール、音声合成、ガードレールを一つのシステムとして統合。