TECH 으로 돌아가기
TECH HACKER NEWS 오늘 7분 읽기 22 READS

Gemini 3.8 TTS 공개, 이제 목소리를 '고르는' 게 아니라 '디렉팅'하는 시대예요

Gemini 3.8 TTS 공개, 이제 목소리를 '고르는' 게 아니라 '디렉팅'하는 시대예요
SOURCE IMAGE · HACKER NEWS
Gemini 3.8 TTS 공개, 이제 목소리를 '고르는' 게 아니라 '디렉팅'하는 시대예요

무슨 일이 있었나요

구글이 Gemini 3.8 세대의 텍스트 음성 변환(TTS, Text-to-Speech) 모델을 공개했어요. TTS가 뭐냐면 글자를 넣으면 사람 목소리로 읽어주는 기술이에요. 내비게이션 안내 음성이나 유튜브의 AI 더빙 같은 게 다 여기 속하죠. '그거 옛날부터 있던 거 아니야?' 싶으실 텐데, 최근 1~2년 사이에 이 분야의 판이 완전히 바뀌었어요. 그리고 이번 Gemini 3.8 TTS는 그 바뀐 판에서 구글이 어디까지 왔는지 보여주는 발표예요.

핵심을 한 줄로 요약하면 이래요. 예전 TTS가 '어떤 목소리를 고를지'를 정하는 도구였다면, Gemini 계열 TTS는 '이 문장을 어떤 감정과 속도와 분위기로 말할지'를 자연어 프롬프트로 지시하는 도구예요. 마치 성우에게 디렉팅하듯이요.

이게 뭐냐면: 왜 LLM 기반 TTS가 다른가

기존 TTS는 여러 단계를 이어 붙인 파이프라인이었어요. 먼저 텍스트를 정리하고(숫자를 읽는 법, 약어 처리), 발음 기호로 바꾸고, 음향 모델이 소리의 특징을 만든 다음, 보코더라는 마지막 단계가 실제 파형을 그려냈어요. Tacotron이나 FastSpeech 같은 이름을 들어보셨다면 이 세대예요. 성능은 좋아졌지만 구조상 '이 문장은 조금 망설이면서 읽어줘' 같은 요청을 이해할 방법이 없었어요. 각 단계가 자기 일만 하니까요.

Gemini 같은 LLM 기반 TTS는 접근이 달라요. 이게 어떻게 되냐면, 소리를 아주 잘게 쪼개서 '오디오 토큰'이라는 단위로 만들어요. 텍스트를 토큰으로 쪼개듯이요. 그러면 언어 모델이 다음 단어를 예측하듯 다음 소리 조각을 예측하는 방식으로 음성을 생성할 수 있어요. 이 구조의 장점은 모델이 문장의 '뜻'을 이해한 상태에서 소리를 만든다는 거예요. 그래서 '속삭이듯이', '피곤한 목소리로', '뉴스 앵커처럼 또박또박' 같은 지시를 텍스트 프롬프트로 주면 그대로 반영돼요. 대화체 대본을 주고 화자 두 명을 지정하면 서로 다른 목소리로 자연스럽게 주고받는 팟캐스트 형태의 음성도 한 번에 만들 수 있고요. Gemini 2.5 세대에서 이런 '조종 가능한(controllable) TTS' 방향을 잡았고, 3.8은 그 연장선에 있는 최신 버전이에요. 지원 언어, 가격, 지연 시간 같은 구체적인 숫자는 원문 발표에서 꼭 확인해 보세요.

업계 맥락: 지금 TTS 판은 어떻게 돌아가나

이 분야에서 기준점 역할을 하는 건 ElevenLabs예요. 감정 표현과 음성 복제 품질로 앞서 나갔고, 최근 모델에서는 대본 안에 감정 태그를 직접 적어 넣는 방식으로 연기 디렉팅을 지원해요. OpenAI도 '이렇게 말해'라는 지시를 받는 TTS 모델을 API로 내놓으면서 같은 방향으로 움직였고요. 구글의 강점은 이 기능이 Gemini라는 범용 모델 안에 통합되어 있다는 점이에요. 텍스트 생성, 이해, 음성 출력이 한 모델 패밀리 안에 있으니, 에이전트가 답을 만들고 그걸 바로 말로 내보내는 흐름을 짜기가 수월해요.

오픈소스 진영도 무섭게 따라오고 있어요. Kokoro는 작은 크기로 노트북에서도 돌아가는 품질 좋은 음성을 보여줬고, Dia는 한국인 창업자들이 만든 Nari Labs가 공개한 모델로 웃음소리나 기침 같은 비언어 표현까지 대본으로 넣을 수 있다는 차별점을 보여줬어요. Sesame의 CSM처럼 대화 맥락을 기억하며 말하는 모델도 있고요. 국내에서는 네이버 클로바 보이스, 타입캐스트, 하이브 계열의 수퍼톤이 한국어 품질과 콘텐츠 제작 도구 쪽에서 자리를 잡고 있어요. 요약하면 폐쇄형 API는 품질과 편의성으로, 오픈소스는 비용과 커스터마이징으로 각자 영역을 넓히는 중이에요.

한국 개발자에게 주는 시사점

먼저 한국어 품질을 직접 들어보세요. 다국어 TTS 모델은 영어 데모가 화려해도 한국어에서 억양이 어색하거나 숫자와 한자어 읽기에서 삐끗하는 경우가 많아요. 특히 '1시 30분'을 '한 시 삼십 분'으로 읽는지, 외래어 표기를 자연스럽게 소화하는지가 실전 품질을 가르는 지점이에요. 구글 AI Studio에서 몇 문장 넣어보는 것만으로 감이 와요.

당장 써볼 만한 곳은 꽤 있어요. 고객 응대 봇의 음성 채널, 사내 문서를 출퇴근길에 듣는 오디오 변환, 게임 NPC 대사 프로토타이핑, 교육 콘텐츠의 다국어 더빙 같은 것들이요. 예전에는 성우 녹음 비용 때문에 엄두를 못 냈던 '대사 수천 줄' 규모의 작업이 API 호출 몇 번으로 바뀌는 거예요. 특히 화자 두 명의 대화 생성은 팟캐스트나 학습용 대화 콘텐츠를 만들 때 바로 쓸 수 있어요.

주의할 점도 있어요. 실시간 대화형 서비스라면 첫 소리가 나올 때까지의 지연 시간이 품질만큼 중요해요. 그리고 음성 복제 기능은 국내에서도 보이스피싱과 딥페이크 이슈로 규제 논의가 진행 중이니, 서비스에 넣기 전에 동의 절차와 워터마킹 같은 안전장치를 먼저 설계하셔야 해요.

마무리

Gemini 3.8 TTS는 '목소리를 고르는 시대'에서 '연기를 디렉팅하는 시대'로 TTS가 넘어왔다는 걸 다시 확인시켜 준 발표예요.

여러분은 TTS를 어떤 프로젝트에 넣어보고 싶으세요? 그리고 한국어 TTS에서 아직 아쉬운 부분이 있다면 어떤 게 가장 먼저 해결됐으면 하시나요?


🔗 출처: Hacker News

SOURCE · HACKER NEWS
원문 전체 보기 → https://blog.google/innovation-and-ai/models-and-research/ge...
SHARE
NEXT · CHOOSE

변화를 읽었다면,
내가 만들 수익 구조를 고릅니다.

정보를 더 모으는 데서 멈추지 않고, 광고·외주·판매·중개·구독 중 내 상황에 맞는 출발점을 정해보세요.

21가지 수익 구조 살펴보기
처리 중...