음성 모델은 텍스트 모델과 달리 언어 지원, 오디오 길이 제약, 실시간성, 화자 분리 여부가 먼저 정해지고 그다음에 모델이 결정됩니다. 이 글은 2026-08-12에 확인한 STT와 TTS 오픈 모델의 파라미터, 라이선스, 지원 언어, 오디오 제약을 정리하고, 실시간이라는 말을 어떻게 쪼개야 하는지, 카드에 적힌 환각과 동의 관련 경고가 왜 설계 제약인지를 설명합니다. 오픈 모델 가이드 시리즈 5편입니다.
2026년의 음성 AI는 STT → LLM → TTS 파이프라인이 끝나고, 풀듀플렉스 실시간 음성 에이전트가 표준이 된 해다. ElevenLabs v3가 다국어·감정 TTS의 왕좌를 지키는 동안, Cartesia Sonic은 75ms TTFW로 LiveKit Agents의 기본 TTS가 됐고, OpenAI Realtime API · Google Gemini Live · Anthropic Claude voice mode는 LLM-네이티브 음성을 정착시켰다. Hume EVI 2 · Sesame Maya/Miles는 감정 음성을, Fish Audio · CosyVoice 2 · F5-TTS는 오픈/중화권을 장악했다. STT 쪽은 Deepgram Nova-3가 50ms 미만으로 가장 빠르고, AssemblyAI Universal-2 · OpenAI GPT-4o transcribe가 정확도로 맞선다. LiveKit Agents · Pipecat · Vapi · Retell AI · Bland AI가 오케스트레이션을 맡고, Tennessee ELVIS 법 · EU AI Act가 클로닝 윤리에 선을 그었다. 한국은 타입캐스트 · 클로바 더빙, 일본은 CoeFont · VOICEVOX가 시장을 나눠 갖는다. 이 글은 그 전체 지도를 그린다.
2024년 10월 Whisper Large v3 Turbo가 8배 빨라지고, Cartesia가 Mamba 저자들 손으로 90ms TTS를 만들고, Sesame의 Brendan Iribe가 "voice presence"를 들고 나오면서 2026년 음성 AI는 TTS·STT·실시간 에이전트 세 축이 모두 폭발했다. ElevenLabs V3부터 NVIDIA Parakeet 1.1, VOICEVOX, F5-TTS, Vapi/Retell까지 — 누가 무엇을 잘하고 무엇을 골라야 하는지 정리한다.