ThunderPhone은 여러 모델을 동시에 오케스트레이션하여 서로의 실수를 바로잡도록 합니다.
BBA는 모델이 음성 프롬프트를 이해하고 어려운 질문에 정확히 답할 수 있는지 평가합니다. 가장 강력한 Storm 구성은 공개 평가 세트에서 99.4%를 달성했습니다. 실수율은 0.6%로, 다음으로 높은 공개 점수보다 4배 적습니다.
실수율은 BBA 성공률에서 100%를 뺀 값입니다. ThunderPhone의 결과는 위에 링크된 공개 평가 데이터세트의 결과이며, 다른 공개 점수(Artificial Analysis 리더보드)는 참고용으로 제시했습니다. BBA는 전화 통화 성능을 완전히 포착하지는 못하지만, 음성 프롬프트에 대한 추론 능력을 판단하는 유용한 신호입니다.
Vapi, Retell, Pipecat, LiveKit과 같은 다른 음성 AI 플랫폼에서는 통화를 작동시키기 위해 광범위한 구성 결정을 내려야 합니다. ThunderPhone은 튜닝이 우리의 업무이며, 원활한 통화를 위해 고객이 해야 할 일은 최대한 적어야 한다고 생각합니다.
약한 시스템은 복잡한 프롬프트를 따를 수 없기 때문에 플로우 빌더가 존재합니다. 대화의 모든 단계는 직접 구축하고 유지해야 하는 노드가 됩니다. Storm은 하나의 프롬프트로 풍부한 지시를 이행하므로 노드와 엣지를 신경 쓸 필요가 없습니다.
웅얼거리는 말투, 주변 잡담, 이름과 숫자, 혼합 언어 등 다른 시스템이 무너지는 상황을 위해 ThunderPhone은 설계되었습니다.
하나의 전사 결과만 신뢰하지 않고 오디오와 텍스트 신호를 비교합니다.
소음 식별 및 감소 모델이 신호를 정리합니다.
주변 대화가 에이전트를 방해하기 전에 식별합니다.
고유명사, 철자, 숫자 및 정정 내용을 교차 확인합니다.
필요할 때 다국어 오디오 및 음성 경로로 라우팅합니다.
동작을 하나의 규칙으로 축소할 수 없을 때 더 강력한 추론 경로를 사용합니다.
전화 AI는 빠르게 응답해야 합니다. 하지만 정확성 없는 속도는 오류를 빠르게 전달할 뿐입니다. 오늘날의 LLM은 신뢰성을 유지하려면 잠시 생각할 시간이 필요하므로, ThunderPhone은 계층별로 두 요소의 균형을 맞춥니다.
자동화된 전화 통화는 답답한 경험이었습니다... 지금까지는 그랬습니다. 기술의 물결마다 경험은 개선되었지만, 진정으로 매끄러운 경험에 이르지는 못했습니다. ThunderPhone으로 달라집니다.
영업은 1번, 지원은 2번을 누르세요. 전화 메뉴는 연결만 할 수 있습니다.
“영업” 또는 “청구”라고 말하고 슬롯 파서가 이를 포착하기를 바랍니다.
전사하고, 빠른 LLM에 한 번 묻고, 말합니다. 각 단계는 이전 단계를 신뢰합니다.
오디오, 텍스트, 추론, 도구, 음성, 가드레일을 하나의 시스템으로 제공합니다.