
Voice AI Weekly #11 - 2026년 9월 4째 주
이번 주 해외 음성 AI 업계에서 나온 소식 중 마고 사업과 맞닿은 다섯 가지를 골라봤습니다. STT 정확도 경쟁부터 컨택센터 AI 도입, 온디바이스 시장 움직임까지 짚어봅니다.
1. xAI, 음성 전사 모델 Grok Voice Transcribe 2.0 공개
xAI가 9월 18일 음성 전사 모델 Grok Voice Transcribe 2.0을 내놨습니다. 공개 벤치마크 Artificial Analysis에서 스트리밍 모델 32개 중 1위를 차지했고 다국어 짧은 구문 오류율을 20.6%에서 6.8%로 낮췄습니다.
도메인 용어 등록 기능이 STT API 기본값으로 들어가기 시작했는데요. 전문용어 인식에서도 범용 모델이 도메인 적응 쪽으로 움직이고 있는 것으로 보이네요.
2. 화웨이-SVOA-ACONNECT, 태국 AICC 구축에 협력
화웨이와 ICT 기업 SVOA, 20년 경력 아웃소싱 컨택센터 ACONNECT가 9월 22일 인공지능 컨택센터(AICC) 솔루션을 함께 개발하기로 양해각서를 맺었습니다. 세 회사는 인프라부터 구축, 서비스까지 통합 지원하는 형태로 협력하며 태국 은행, 보험사, 대형 유통기업을 우선 공략 대상으로 잡았습니다. 고객 문의 처리와 상담사 지원, 대화 분석, 다채널 응대를 아우르는 AICC 솔루션을 보여줄 시연 센터도 함께 세울 계획입니다.
규제 업종인 은행과 보험을 첫 타깃으로 잡은 만큼 온프레미스 대응이 가능한 음성 AI 수요도 함께 늘어날 가능성이 높아보이네요.
3. 아이슬란드 스타트업 Treble, 음성 AI 시뮬레이션에 1800만 달러 유치
음향 엔지니어 출신 창업자들이 세운 Treble이 9월 16일 시리즈A 후속 투자로 1800만 달러를 추가로 모았습니다. Paladin Capital Group이 이번 라운드를 이끌었고 누적 투자액은 4000만 달러를 넘었습니다. Treble은 음성 AI 모델과 하드웨어를 검증할 합성 데이터를 만들어주는 시뮬레이션 플랫폼으로 Amazon과 Logitech을 고객사로 두고 있습니다.
4. 구글 Gemini 3.8 Live, 음성 에이전트 벤치마크 1위 달성
구글이 9월 15일 실시간 음성 모델 Gemini 3.8 Live와 Extended Thinking 버전을 공개했습니다. Speech to Speech Quality Index에서 82.6점을 받아 해당 지표 최고점을 기록했고 ServiceNow가 만든 EVA-Bench에서도 1위에 올랐습니다. 97개 언어를 지원하며 음성 처리와 추론, 백그라운드 도구 호출을 동시에 수행한다고 밝혔습니다.
5. 알리바바 Qwen, 오디오·영상 통합 모델 Qwen3.8-Omni-Flash 출시
알리바바 Qwen팀이 9월 18일 텍스트, 이미지, 오디오, 영상을 함께 입력받는 Qwen3.8-Omni-Flash를 내놨습니다. 함수 호출과 웹 검색, 구조화된 출력을 지원하고 113개 언어와 방언을 처리합니다. 회사 측은 오디오 처리 성능이 Gemini 3.8 Flash를 웃돌고 장시간 오디오 입력 비용은 98% 넘게 줄었다고 밝혔습니다.
범용 음성 모델의 성능과 가격 경쟁이 뜨거워질수록 도메인 전문성과 온프레미스 대응력의 가치는 더 뚜렷해지는데요.
음성 AI 도입을 검토하고 계시다면 contact@holamago.com으로 편하게 문의해 주세요. 다음 주 Voice AI Weekly에서 또 다른 소식으로 돌아오겠습니다.
