기술

3단계 파이프라인을 넘어가십시오.

대부분의 음성 AI 플랫폼은 하나의 전사 모델, 하나의 비추론형 LLM, 하나의 텍스트 음성 변환 엔진으로 구성된 3단계 파이프라인에 의존합니다. 각 단계는 단일 장애 지점입니다. ThunderPhone은 여러 모델을 동시에 오케스트레이션하여 오류를 줄입니다.

발신자가 말했습니다 “렌트입니다.”
ASR A“렌트입니다”
ASR B“브렌트입니다”
오디오 LLM“렌트입니다”
“렌트입니다”로 대조 확인 3개 경로 중 2개가 일치합니다
통합 아키텍처

여러 방식으로 듣고, 대조합니다.

ThunderPhone은 여러 모델을 동시에 오케스트레이션하여 서로의 실수를 바로잡도록 합니다.

기타 플랫폼 · 3단계 파이프라인

각 단계는 이전 단계를 신뢰합니다.

발신자 오디오
“렌트입니다.” · 웅얼거림
STT A
“브렌트입니다”
STT B
오디오 LLM
단일 모델이 잘못 들으면 대안이 없습니다
LLM
빠른 모델은 전사본만 확인합니다.
→ “안녕하세요, 브렌트. 무엇을 도와드릴까요?”라고 응답합니다
빠른 LLM은 지시 이행에서 실수합니다
TTS
답변을 음성으로 다시 전달합니다.
→ “안녕하세요, 브렌트. 무엇을 도와드릴까요?”라고 말합니다 ✗
트랜스크립트 1개 + LLM 1개 = 오답
ThunderPhone · 오케스트레이션

여러 경로, 하나의 조율된 답변.

발신자 오디오
“렌트입니다.” · 웅얼거림
STT A
“렌트입니다”
STT B
“브렌트입니다”
오디오 LLM
“렌트입니다”
전사본 3개와 원본 오디오를 증거로 보관
추론 레이어
빠른 LLM과 추론 LLM이 텍스트와 오디오 증거를 함께 평가합니다.
→ 3개 경로 중 2개가 일치: “렌트입니다”
추론 LLM과 빠른 LLM이 답변 전에 상호 검증합니다
TTS
선별된 음성은 철자와 영숫자에서 발생하는 환각을 최소화합니다.
→ “알겠습니다 — 렌트 중이시군요.” ✓
복잡한 세부 정보도 처음부터 정확하게 파악합니다.
성능 입증

Storm이 Big Bench Audio에서 지능 기록을 세웁니다.

BBA는 모델이 음성 프롬프트를 이해하고 어려운 질문에 정확히 답할 수 있는지 평가합니다. 가장 강력한 Storm 구성은 공개 평가 세트에서 99.4%를 달성했습니다. 실수율은 0.6%로, 다음으로 높은 공개 점수보다 4배 적습니다.

모델
실수율↓ 낮을수록 좋음
점수
ThunderPhone Storm · Extra Intelligence실수 4배 감소
0.6%
Step-Audio R1.1
2.4%
Grok Voice Think Fast
2.9%
Ultravox v0.7 Thinking
3.0%
GPT-Realtime-2 High
3.4%
Gemini 3.1 Flash Live High
3.4%
Hugging Face에서 BBA-Storm 평가 데이터세트 보기

실수율은 BBA 성공률에서 100%를 뺀 값입니다. ThunderPhone의 결과는 위에 링크된 공개 평가 데이터세트의 결과이며, 다른 공개 점수(Artificial Analysis 리더보드)는 참고용으로 제시했습니다. BBA는 전화 통화 성능을 완전히 포착하지는 못하지만, 음성 프롬프트에 대한 추론 능력을 판단하는 유용한 신호입니다.

의견이 반영된 설계가 구성 가능성보다 낫습니다

음성 스택을 직접 조립할 필요가 없어야 합니다.

Vapi, Retell, Pipecat, LiveKit과 같은 다른 음성 AI 플랫폼에서는 통화를 작동시키기 위해 광범위한 구성 결정을 내려야 합니다. ThunderPhone은 튜닝이 우리의 업무이며, 원활한 통화를 위해 고객이 해야 할 일은 최대한 적어야 한다고 생각합니다.

기타 음성 AI 플랫폼 · 조정할 설정이 많음
STT LLM TTS 발화 종료 감지 노이즈 제거 끼어들기 대체 처리 도구 스키마 지연 시간 VAD
ThunderPhone이 이 모든 것을 자동으로 조정합니다
ThunderPhone · 세 가지 결정
1
티어를 선택하세요
Spark, Bolt 또는 Storm.
2
음성을 선택하세요
선별되어 실제 통화로 테스트되었습니다.
3
프롬프트 작성
행동, 정책, 도구를 자연어로 작성합니다.
세 가지 결정이면 됩니다. 이것이 설정의 전부이며 오케스트레이션, 대체 처리, 튜닝이 기본으로 제공됩니다.
업무에 가장 적합한 모델을 선택하고 하나로 연결합니다. OpenAI, Anthropic, Google의 최첨단 모델을 오픈 소스 모델과 함께 활용하며, 모든 통화에서 최고의 성능과 가격을 제공하도록 오케스트레이션하므로 신경 쓸 필요가 없습니다.
하나의 프롬프트로 그래프 복잡성을 줄이세요

하나의 프롬프트로 노드 그래프 없이 처리하세요.

약한 시스템은 복잡한 프롬프트를 따를 수 없기 때문에 플로우 빌더가 존재합니다. 대화의 모든 단계는 직접 구축하고 유지해야 하는 노드가 됩니다. Storm은 하나의 프롬프트로 풍부한 지시를 이행하므로 노드와 엣지를 신경 쓸 필요가 없습니다.

플로우 빌더 플랫폼

모든 분기를 직접 연결하세요.

인사프롬프트 · 음성
전화번호 수집프롬프트 · 검증
전화번호 확인재질문 ×2
enroll()도구 · 재시도
상담원 연결상담원에게
대체 처리포괄 처리
유효하지 않음 ×2오류
하나의 등록 흐름에 노드 6개가 필요합니다. 각 노드에는 자체 프롬프트, 도구, 전환, 실패 처리 방식이 있습니다.
ThunderPhone Storm

행동을 한 번만 설명하세요.

행동 프롬프트
발신자에게 인사하고 이름전화번호를 수집합니다.
등록하기 전에 동의를 확인합니다 — 필수입니다.
청구에 관해 문의하면 아래 청구 정책을 따릅니다.
모든 필드가 확인된 후에만 enroll()을 한 번 호출합니다.
발신자가 사람을 요청하면 상담원에게 연결합니다.
복잡한 분기 선택형 감시 항목 더 쉬운 반복 개선
작성, 테스트, 반복 개선을 위한 하나의 프롬프트 — 분기도 포함됩니다.
중요한 이유

실제 운영 통화는 복잡합니다. ThunderPhone은 준비되어 있습니다.

웅얼거리는 말투, 주변 잡담, 이름과 숫자, 혼합 언어 등 다른 시스템이 무너지는 상황을 위해 ThunderPhone은 설계되었습니다.

웅얼거리는 발화

하나의 전사 결과만 신뢰하지 않고 오디오와 텍스트 신호를 비교합니다.

불량한 전화 음질

소음 식별 및 감소 모델이 신호를 정리합니다.

주변 대화

주변 대화가 에이전트를 방해하기 전에 식별합니다.

이름 및 주소

고유명사, 철자, 숫자 및 정정 내용을 교차 확인합니다.

혼합 언어 발화

필요할 때 다국어 오디오 및 음성 경로로 라우팅합니다.

긴 프롬프트

동작을 하나의 규칙으로 축소할 수 없을 때 더 강력한 추론 경로를 사용합니다.

지연 시간, 품질 및 비용

더 빠른 오답이 더 나은 통화는 아닙니다.

전화 AI는 빠르게 응답해야 합니다. 하지만 정확성 없는 속도는 오류를 빠르게 전달할 뿐입니다. 오늘날의 LLM은 신뢰성을 유지하려면 잠시 생각할 시간이 필요하므로, ThunderPhone은 계층별로 두 요소의 균형을 맞춥니다.

Spark
~3s
첫 응답까지
Bolt
~2s
첫 응답까지
Storm
~2–3s
맞장구 포함 시 ~2초 · 미포함 시 ~3초
측정다른 공급업체는 이상적인 환경에서 500ms 지연 시간을 내세우지만, 실제 통화에서는 대개 약 2초가 걸립니다.실제 환경에서 지연 시간을 측정합니다.
복원력AI 공급업체에서는 통화를 방해할 수 있는 지연 시간 급증이 발생합니다.이런 상황이 발생하면 ThunderPhone의 오케스트레이션 스택은 더 빠른 옵션으로 장애 조치합니다.
음성 AI의 세대

차세대 음성 AI가 여기 있습니다

자동화된 전화 통화는 답답한 경험이었습니다... 지금까지는 그랬습니다. 기술의 물결마다 경험은 개선되었지만, 진정으로 매끄러운 경험에 이르지는 못했습니다. ThunderPhone으로 달라집니다.

1990s2010s20242026 · 현재
1세대

IVR

영업은 1번, 지원은 2번을 누르세요. 전화 메뉴는 연결만 할 수 있습니다.

2세대

의도 봇

“영업” 또는 “청구”라고 말하고 슬롯 파서가 이를 포착하기를 바랍니다.

3세대

3단계 AI

전사하고, 빠른 LLM에 한 번 묻고, 말합니다. 각 단계는 이전 단계를 신뢰합니다.

4세대

통합 AI

오디오, 텍스트, 추론, 도구, 음성, 가드레일을 하나의 시스템으로 제공합니다.

다른 모든 것을 무너뜨리는 통화를 위해 설계되었습니다

통합 스택을 확인하세요
가장 까다로운 통화에서.

10분 만에 시작합니다. 분당 2센트부터.