※ 이 글에는 제휴 마케팅 링크가 포함될 수 있으며, 구매 시 수수료를 받을 수 있습니다.
전화기 너머의 목소리가 사람인지 기계인지, 당신은 몇 초 만에 알아챌 수 있는가? 요즘은 그게 점점 어려워지고 있다. 그런데 문제는 정반대 지점에서 터진다. 목소리는 완벽하게 사람 같은데, 대화를 세 번 주고받고 나면 “아, 이건 기계구나"가 아니라 “아, 이건 나를 도와줄 생각이 없구나"라는 확신이 든다. 전화 응대 자동화의 진짜 실패는 여기서 시작된다.
월 1억 통화를 처리하는 회사가 파는 것
Rime이라는 회사가 있다. 대량 전화 음성 에이전트를 위해 만들어진 엔터프라이즈 TTS(텍스트-음성 변환) API로, 월 1억 건 이상의 전화 통화를 처리하고 Domino’s, Wingstop 같은 고객사를 두고 있다. (출처: CMSWire) 피자 주문 전화, 치킨 픽업 확인 — 그 지루하고 반복적인 통화의 상당수가 이제 사람이 아니라 Rime이 만든 목소리로 처리된다.
Rime이 파는 건 ‘대화’가 아니라 ‘목소리’다. 이 구분이 중요하다. Rime은 세 가지 TTS 모델을 제공한다. 균형 잡힌 품질·속도의 Coda, 표현력 있는 다국어의 Arcana, 실시간 저지연용 Mist. (출처: Rime) 그리고 600개 이상의 음성과 50개 이상의 언어를 지원하며, 억양·속도·톤까지 커스터마이징할 수 있는 단일 API를 제공한다. (출처: Rime Pricing)
여기서 눈여겨볼 숫자는 지연 시간이다. 2026년 2월 나온 Arcana v3 모델은 온프레미스 환경에서 120ms 지연을 달성한다. (출처: rywalker.com) 120밀리초. 사람이 전화로 “여보세요” 하고 상대가 반응하기까지 걸리는 자연스러운 침묵보다 짧다. 이 정도면 대화의 리듬이 끊기지 않는다. 목소리 자체의 품질 경쟁에서 Rime은 확실히 앞선 자리에 있다.
그런데 목소리는 절반의 문제다
여기서 이 글이 하려는 이야기가 나온다. 전화 응대 자동화의 승부처는 ‘얼마나 사람 같은 목소리냐’가 아니라 ‘언제 사람에게 넘길지 아느냐’에 있다.
국내 사례를 보자. 금융권을 중심으로 AI 상담 도입이 빠르게 확산되고 있지만, ‘답답하다’, ‘문제를 해결해주지 않는다’는 고객 불만이 쌓이면서 체감 만족도가 기대에 미치지 못하고 있다. (출처: VOC Studio) 목소리가 어색해서가 아니다. 목소리는 오히려 좋아졌다. 문제는 그 좋은 목소리가 같은 안내 멘트를 세 번째 반복할 때 고객이 느끼는 감정이다.
AI 상담사는 이전 대화의 맥락을 장기적으로 기억·활용하는 데 제약이 있다. 그래서 복잡한 대화에서 맥락 이해와 공감 능력의 한계가 드러나고, 이것이 고객 경험과 브랜드 신뢰에 악영향을 줄 수 있다. (출처: gttkorea.com) 소프트웨어나 네트워크 장애처럼 실시간 진단이 필요한 상황에서는 AI 고객센터만으로 만족스러운 결과를 얻기 어렵고, 결국 인간 상담원 연계가 필요하다. (출처: rsupport.com)
가장 뼈아픈 지적은 이것이다. 잘못 설계된 AI 응대는 오히려 브랜드 이미지와 서비스 신뢰도를 깎아먹으며, 그 뒤처리로 CX팀과 상담원이 더 예민해진 이슈와 누적된 고객 분노를 떠안게 된다. (출처: VOC Studio) 자동화가 상담원의 일을 덜어주는 게 아니라, 이미 화가 날 대로 난 고객만 사람에게 넘기는 ‘분노 필터’가 되어버리는 것이다.
Rime처럼 도입한다는 것의 진짜 의미
그래서 ‘Rime처럼 전화 응대를 자동화한다’는 말을 다시 정의해야 한다. 그건 좋은 TTS 엔진을 붙인다는 뜻이 아니다. 자동화가 잘 통하는 통화와 그렇지 않은 통화를 냉정하게 갈라내고, 후자를 빠르게 사람에게 넘기는 경계선을 설계한다는 뜻이다.
Rime의 고객사가 Domino’s와 Wingstop이라는 사실이 힌트다. 피자 주문, 픽업 시간 확인, 메뉴 안내 — 이건 변수가 적고, 대화의 골격이 정해져 있으며, 실패해도 “직원 연결해 드릴까요?“로 깔끔하게 빠질 수 있는 통화다. 자동화가 가장 큰 힘을 발휘하는 영역이 정확히 여기다. 반대로 “3일 전에 시킨 피자가 상해서 배탈이 났고 환불을 원한다"는 통화는 목소리가 아무리 매끄러워도 AI 혼자 감당할 영역이 아니다.
도입을 검토하는 실무자라면 순서는 이렇게 잡는 게 맞다.
첫째, 통화 유형을 나눠라. 전체 인바운드 통화를 뽑아 ‘골격이 정해진 반복 통화’와 ‘진단·감정·예외가 필요한 통화’로 분류한다. 자동화 대상은 전자다. 이 분류 없이 “전화를 다 AI로 받자"고 시작하면 위의 국내 금융권 사례를 그대로 밟는다.
둘째, 넘김(handoff) 규칙을 목소리보다 먼저 설계하라. 고객이 같은 요구를 두 번 반복하면, 감정 어휘가 감지되면, 정해진 시나리오 밖으로 벗어나면 — 이런 조건에서 즉시 사람으로 연결되는 규칙이 있어야 한다. 이 규칙이 곧 자동화의 품질이다.
셋째, 그 다음에 목소리를 고른다. 여기서 Rime 같은 도구가 들어온다. 3,000분 무료 티어가 제공되므로 실제 통화 스크립트를 넣어보고 억양·속도·톤을 조정한 뒤 도입 여부를 판단할 수 있다. (출처: Rime Pricing) 순서를 뒤집지 마라. 목소리부터 고르고 나중에 넘김 규칙을 끼워 넣으면, 그 시스템은 화난 고객을 상담원에게 배달하는 기계가 된다.
비용은 생각보다 낮고, 위험은 생각보다 높다

가격만 보면 진입 장벽은 낮다. Starter 요금제는 1,000자당 $0.05이며 3,000분을 무료로 제공하고 동시 TTS 생성 20개를 지원한다. 모델별로는 Mist가 1,000자당 $0.03, Arcana가 $0.04, Coda가 $0.05다. (출처: Rime Pricing, CMSWire) 대규모 조직은 Enterprise 요금제로 볼륨 프라이싱과 함께 무제한 동시 생성, SLA, 온프레미스/VPC 배포, HIPAA BAA, SOC 2 같은 보안 옵션을 받는다. (출처: Rime Pricing) 의료·금융처럼 규제가 빡빡한 곳도 도입할 길이 열려 있다는 뜻이다.
문제는 이 계산에 안 잡히는 비용이다. TTS 단가는 1,000자당 몇 센트지만, 잘못 넘겨받은 화난 고객 한 명이 남기는 리뷰 한 줄과 이탈은 그 숫자에 들어가지 않는다. 자동화의 손익분기점은 API 청구서가 아니라 여기서 결정된다.
목소리는 해결됐다. 이제 판단이 남았다
Rime의 등장이 알려주는 건 명확하다. ‘기계 같은 목소리’라는 오래된 핑계는 이제 유효기간이 지났다. 120ms 지연에 600개의 음성, 50개 언어 — 목소리는 더 이상 자동화를 막는 병목이 아니다. (출처: rywalker.com)
그래서 남은 질문은 기술이 아니라 판단이다. 어떤 통화를 기계에 맡기고, 어떤 순간에 사람에게 돌려줄 것인가. 이 경계선을 그리는 일은 API가 대신해 주지 않는다. Rime처럼 자동화한다는 건, 좋은 목소리를 사는 게 아니라 그 목소리를 언제 멈춰야 하는지 아는 것이다. 도입을 서두르기 전에, 당신 회사의 전화 목록을 먼저 두 무더기로 갈라 보길 권한다. 그 분류가 끝나기 전까지, 아무리 좋은 목소리도 위험한 투자다.
