음성 AI의 세대
대부분의 자동화 전화 통화는 형편없습니다. 새로운 기술이 이를 바꿉니다.
기존의 문제는 전화 자동화에 자연스러운 음성이 없었다는 점이 아니었습니다. 실제 대화를 이어갈 만큼 충분히 이해하지 못했다는 점이었습니다.
전화 통화는 자동화하기가 더 쉬워집니다
각 세대는 더 많은 맥락을 시스템에 담습니다.
전화 메뉴
IVR 시대
발신자가 기계의 언어로 말해야 했습니다.
자동화는 메뉴, 키패드 분기, 대기열을 의미했습니다. 발신자가 이미 올바른 경로를 알고 있을 때는 작동했습니다.
어색한 순간
의도가 버튼 입력 하나로 축소되므로, 전화 메뉴 밖의 요청은 연결되거나 반복해야 합니다.
통화 예시
IVR 시대
발신자
"내일 예약을 변경해야 합니다."
시스템
"청구 관련은 1번, 예약 관련은 2번, 그 외 모든 문의는 9번을 누르세요."
결과
발신자는 추측하고, 기다리고, 같은 내용을 다시 설명합니다.
시스템의 사고 방식
3단계메뉴 안내
수정됨고정된 스크립트가 선택지를 안내합니다.
DTMF 분기
취약버튼 하나가 전체 의도를 대신합니다.
대기열
오류실제 맥락은 상담원에게 전달됩니다.
맞춤형 모델
초기 AI
시스템은 제한된 범위만 이해했고, 그 밖에서는 무너졌습니다.
팀은 특정 통화 흐름을 위해 음향 모델, 의도 분류기, 슬롯 추출기를 학습시켰습니다. 유용했지만 변경 비용이 컸습니다.
어색한 순간
시스템은 학습된 하나의 의도는 파악할 수 있지만, 두 번째 요청을 놓치거나 경직된 후속 질문을 합니다.
통화 예시
초기 AI
발신자
"내일 예약을 변경하고 배우자도 추가할 수 있나요?"
시스템
"예약 변경을 도와드릴 수 있습니다. 원하시는 날짜는 언제인가요?"
결과
훈련된 흐름에 없기 때문에 배우자 정보가 누락됩니다.
시스템의 사고 방식
3단계맞춤형 ASR
수정됨특정 도메인과 다양한 억양에 맞게 조정됩니다.
의도 모델
취약가장 가까운 알려진 요청으로 분류합니다.
슬롯 채우기
오류누락된 필드는 스크립트 기반 보완을 유발합니다.
Vapi / Retell / ElevenLabs 스타일 스택
3단계 파이프라인
스택은 유연해졌지만, 각 단계는 이전 단계를 신뢰했습니다.
일반적인 현대식 패턴은 음성-텍스트 변환, LLM, 텍스트-음성 변환을 하나의 통화 루프로 연결합니다.
어색한 순간
전사가 잘못되었거나 발신자가 끼어들면, LLM은 잘못 이해한 통화에 자신 있게 응답합니다.
통화 예시
3단계 파이프라인
발신자
"아니요, 렌트입니다."
시스템
"알겠습니다. 브렌트 소유의 부동산이군요. 맞습니까?"
결과
한 번의 청취 오류가 음성 응답 실수로 이어집니다.
시스템의 사고 방식
3단계음성을 텍스트로 변환
오류하나의 전사가 기준 정보가 됩니다.
LLM
취약원본 오디오가 아닌 텍스트를 기반으로 생성합니다.
텍스트를 음성으로 변환
오류답변을 자신 있게 음성으로 전달합니다.
통합 음성 AI
ThunderPhone
시스템은 하나의 루프에서 듣고, 추론하고, 복구할 수 있습니다.
ThunderPhone은 오디오 이해, 모델 라우팅, 발화 순서 조정, 응답 생성을 하나의 아키텍처로 조율합니다.
달라지는 점
여러 청취 경로와 오디오 인지 추론이 단일 단계의 실패가 발신자에게 닿기 전에 줄여 줍니다.
통화 예시
ThunderPhone
발신자
"아니요, 렌트입니다."
시스템
"알겠습니다. 주택을 렌트 중이시군요. 그러면 소유 여부에 관한 질문은 건너뛰겠습니다."
결과
발신자가 시스템과 씨름하지 않아도 통화가 계속 진행됩니다.
시스템의 사고 방식
4단계오디오 스트림
통과추론에 사용할 수 있도록 원본 오디오를 유지합니다.
이중 청취
통과행동하기 전에 신호를 비교합니다.
모델 라우팅
통과빠른 경로와 심층 경로가 발화 순서에 따라 협력합니다.
자연스러운 응답
통과발신자는 수정된 맥락을 듣습니다.
이것이 가져오는 변화
혁신은 더 그럴듯한 로봇 음성이 아닙니다. 통화가 계획대로 진행되도록 하는 아키텍처입니다.
더 나은 청취
시스템은 하나의 전사 결과만 신뢰하는 대신 신호를 비교하고 오디오를 바탕으로 추론할 수 있습니다.
더 나은 타이밍
대화 차례 조정과 끼어들기 처리는 대화 루프의 일부입니다.
더 나은 라우팅
각 대화 차례의 필요에 따라 빠른 경로와 더 깊은 추론을 선택할 수 있습니다.
더 나은 경험
발신자는 자동화 시스템을 수정하는 데 쓰는 시간을 줄이고 작업을 완료하는 데 더 많은 시간을 씁니다.