기술

3단계 파이프라인을
넘어설 때입니다.

대부분의 음성 AI 플랫폼은 3단계 파이프라인에 의존합니다. 음성 인식 모델 하나, 추론하지 않는 LLM 하나, 음성 합성 엔진 하나로 구성됩니다. 각 단계가 곧 단일 장애점입니다. ThunderPhone은 여러 모델을 동시에 조율해 오류를 줄입니다.

발신자의 말: “렌트입니다.”
ASR A“렌트입니다”
ASR B“브렌트입니다”
오디오 LLM“렌트입니다”
최종 조정 결과: “렌트입니다”3개 경로 중 2개 일치

여러 방식으로 듣습니다.
결과는 하나로 종합합니다.

ThunderPhone은 여러 모델을 동시에 조율해 서로의 오류를 바로잡도록 합니다.

발신자가 “렌트입니다”라고 웅얼거립니다.
다른 플랫폼3단계 파이프라인
한 번만 듣습니다
STT “브렌트입니다”
단일 모델이 잘못 들어도 이를 바로잡을 안전장치가 없습니다.
빠르게 답변합니다

고속 LLM은 전사 결과만 봅니다.

말합니다

“안녕하세요, 브렌트. 무엇을 도와드릴까요?”

전사 결과 1개 + LLM 1개 = 잘못된 답변
ThunderPhone오케스트레이션
세 가지 방식으로 듣습니다
“렌트입니다”“브렌트입니다”“렌트입니다”
3개의 전사 결과와 원본 오디오를 증거로 보존합니다.
종합합니다

고속 LLM과 추론 LLM이 교차 검증해 3개 경로 중 2개가 일치합니다.

말합니다

“알겠습니다. 렌트이시군요.”

까다로운 정보도 한 번에 정확히 파악합니다.

Storm은 Big Bench Audio 지능 평가에서 신기록을 세웠습니다.

BBA는 모델이 음성으로 전달된 프롬프트를 이해하고 어려운 질문에 정확히 답할 수 있는지 평가합니다. 가장 강력한 Storm 구성은 ThunderPhone의 공개 평가 세트에서 99.4%로 최고 기록을 보유하고 있습니다.

0.6% 오류율

· 2026년 7월Hugging Face 데이터셋
ThunderPhoneStorm · Extra Intelligence0.6%
Qwen Audio 3.0Realtime Plus0.8%
Qwen3.5 OmniPlus Realtime1.3%
Step-Audio R1.1Realtime2.4%

ThunderPhone 결과는 위에 링크된 공개 평가 데이터셋에서 산출했습니다. 그 외 공개 점수(Artificial Analysis 리더보드)는 비교 참고용으로 표기했습니다.

음성 스택을 일일이 직접 구성할 필요는 없습니다.

Vapi, Retell, Pipecat, LiveKit 같은 다른 음성 AI 플랫폼에서는 통화를 구현하려면 수많은 설정 항목을 일일이 결정해야 합니다. ThunderPhone은 저희가 튜닝을 맡아야 하며, 통화가 원활하게 작동하도록 고객이 해야 할 일은 가능한 한 적어야 한다고 믿습니다.

다른 음성 AI 플랫폼직접 조정할 항목이 많습니다
STTv4-largeSTT 폴백LLMtemp 0.3LLM 폴백TTSTTS 폴백VAD0.62발화 종료 감지240 ms끼어들기 감지 임계값−38 dB맞장구 필터대화 중단 처리턴 타임아웃800 ms노이즈 제거지터 버퍼60 ms샘플링 레이트8 kHz도구 스키마재시도 정책×3폴백

ThunderPhone이 이 모든 항목을 알아서 튜닝합니다

ThunderPhone세 가지 결정
1
요금제를 선택하세요

Spark, Bolt, Storm 중에서 선택합니다.

2
음성을 선택하세요

엄선한 뒤 실제 통화로 검증했습니다.

3
프롬프트를 작성하세요

동작과 정책, 도구를 자연어로 작성합니다.

세 가지만 선택하면 설정이 끝납니다. 오케스트레이션, 폴백, 튜닝은 모두 기본 내장되어 있습니다.

목적에 가장 알맞은 모델을 골라 유기적으로 연결합니다. OpenAI, Anthropic, Google의 최첨단 모델과 오픈소스 모델을 함께 활용하고, 매 통화마다 성능과 비용을 최적화하도록 오케스트레이션합니다. 고객이 직접 신경 쓸 필요가 없습니다.

노드 그래프는 필요 없습니다.
프롬프트 하나면 충분합니다.

플로 빌더가 존재하는 이유는 성능이 부족한 시스템이 복잡한 프롬프트의 지시를 이행하지 못하기 때문입니다. 대화의 모든 단계가 사용자가 직접 구축하고 유지 관리해야 하는 노드가 됩니다. Storm은 프롬프트 하나만으로도 정교한 지시를 이행하므로 노드와 엣지를 신경 쓸 필요가 없습니다.

플로우 빌더 플랫폼모든 분기를 일일이 직접 연결하세요
인사말 프롬프트 · 음성
전화번호 수집 프롬프트 · 검증
전화번호 확인 재질문 ×2
enroll() 도구 · 재시도
담당자에게 연결
모든 예외를 처리하는 폴백 유효하지 않음 ×2 · 오류

등록 플로우 하나에 노드 6개가 필요합니다. 각 노드마다 프롬프트, 도구, 전환, 실패 처리를 따로 설정해야 합니다.

ThunderPhone Storm동작을 한 번만 정의하세요
동작 프롬프트

발신자에게 인사하고 이름전화번호를 받으세요. 등록 전 동의 확인은 필수입니다. 결제 관련 질문에는 아래 결제 정책을 따르세요. 모든 항목을 확인한 뒤에만 enroll()을 한 번 호출하세요. 발신자가 직원과 통화하고 싶어 하면 담당자에게 연결하세요.

복잡한 분기선택형 워치독손쉬운 반복 개선

분기까지 포함한 프롬프트 하나만 작성하고 테스트하며 개선하면 됩니다.

실제 운영 환경의 통화는 변수투성이입니다. ThunderPhone은 준비됐습니다.

웅얼거리는 말, 주변의 말소리, 이름과 숫자, 여러 언어가 뒤섞인 대화까지 — ThunderPhone은 다른 시스템이 버티지 못하는 상황에서도 작동하도록 설계되었습니다.

웅얼거리는 발화

하나의 전사 결과만 믿지 않고 오디오와 텍스트 신호를 비교합니다.

열악한 통화 음질

소음 식별·저감 모델이 음성 신호를 깨끗하게 정리합니다.

주변 대화

에이전트의 응대 흐름이 깨지기 전에 주변 대화를 감지합니다.

이름과 주소

고유명사와 철자, 숫자, 정정 내용을 교차 확인합니다.

여러 언어가 섞인 발화

필요할 때 다국어 오디오·음성 처리 경로로 라우팅합니다.

장문 프롬프트

원하는 동작을 하나의 규칙으로 단순화할 수 없을 때는 더 정교한 추론 경로를 활용합니다.

오답을 더 빨리 내놓는다고 통화가 더 나아지지는 않습니다.

음성 AI는 빠르게 응답해야 합니다. 하지만 정확하지 않다면 빨라지는 것은 실수뿐입니다. 오늘날의 LLM은 신뢰할 수 있는 답변을 내놓으려면 잠시 추론할 시간이 필요합니다. 그래서 ThunderPhone은 지연 시간과 정확성의 균형을 맞춥니다.

Spark~3s첫 응답까지
Bolt~2s첫 응답까지
Storm~2–3s~2초(맞장구 사용) · ~3초(맞장구 미사용)
측정

다른 AI 제공업체들은 이상적인 조건에서 지연 시간이 500ms라고 내세우지만, 실제 통화에서는 대개 약 2초가 걸립니다. ThunderPhone은 실제 통화 환경에서 지연 시간을 측정합니다.

복원력

AI 제공업체의 지연 시간이 급증하면 통화 진행에 차질이 생길 수 있습니다. 이런 상황이 발생하면 ThunderPhone의 오케스트레이션 스택이 더 빠른 옵션으로 자동 전환합니다.

차세대 음성 AI는 이제 현실입니다.

자동화된 통화는 늘 답답했습니다… 지금까지는 그랬습니다. 기술이 세대를 거듭할 때마다 통화 경험은 나아졌지만, 진정으로 매끄러운 수준에는 한 번도 이르지 못했습니다. ThunderPhone이 이를 바꿉니다.

1990s1세대

IVR

“영업은 1번, 지원은 2번을 눌러주세요.” 전화 메뉴가 할 수 있는 건 연결뿐입니다.

2010s2세대

의도 인식 봇

“영업” 또는 “청구”라고 말한 뒤, 슬롯 파서가 제대로 잡아내길 바라야 합니다.

20243세대

3단계 AI

음성을 텍스트로 변환하고, 단일 고속 LLM에 물은 뒤, 다시 음성으로 답합니다. 각 단계는 앞선 단계의 결과를 그대로 신뢰합니다.

2026 · 현재4세대

통합형 AI

오디오, 텍스트, 추론, 도구, 음성, 가드레일이 하나의 시스템으로 작동합니다.

다른 시스템이 모두 실패하는 통화도 처리하도록 설계했습니다

가장 까다로운 통화에 ThunderPhone의 통합 스택을 적용해 보세요.

10분이면 바로 시작할 수 있습니다. 요금은 분당 2센트부터입니다.