구글이 텍스트를 음성으로 바꾸는 새 모델 두 종, 제미나이 3.8 플래시 TTS와 제미나이 3.8 플래시-라이트 TTS를 공개했다. 구글은 이 모델들을 지금까지 자사가 내놓은 오디오 모델 가운데 가장 표현력이 풍부한 것으로 소개하며, 음성 생성이 정해진 프리셋을 고르는 방식에서 벗어나 창작자가 직접 음성을 설계하고 연출하는 '스튜디오' 방식으로 옮겨간다고 설명했다. 두 모델은 구글 AI 스튜디오, 제미나이 API, 제미나이 엔터프라이즈, 제미나이 노트북, 구글 비즈(Vids)를 통해 순차적으로 제공된다.
이번 발표의 핵심은 음성의 '수'가 아니라 '설계 자유도'다. 기존에는 미리 준비된 30종의 음성을 선택하는 방식이었다면, 3.8 플래시 TTS는 억양과 감정 톤까지 지정해 완전히 새로운 캐릭터 목소리를 만들거나 일관된 브랜드 대변자용 음성을 만들 수 있는 사실상 무한한 음성 라이브러리를 지향한다. 구글은 멜버른 출신의 활기찬 DJ 목소리, 단조로운 금속성 로봇 음성, 일본풍 용 캐릭터 음성 같은 사례를 예로 들었다. 음성을 고른 뒤에는 두 모델 모두 대사 한 줄 단위로 전달 방식을 제어할 수 있어, 대화형 음성 에이전트나 애니메이션 대본처럼 연기와 자연스러운 화자 전환이 필요한 콘텐츠에 활용할 수 있다는 설명이다.
벤치마크와 다국어 지원
구글은 성능 근거로 외부 평가 결과를 제시했다. 3.8 플래시 TTS는 휴먼AI(Hume AI)의 보이스 디자인 벤치마크에서 71.4점으로 종합 1위, 억양 모델링 부문에서도 60.8점으로 선두를 차지했다고 밝혔다. 또한 휴먼AI의 종합 품질 지수(Overall Quality Index)에서 플래시와 플래시-라이트가 각각 1위와 2위를 기록했다. 특히 장문 콘텐츠나 2인 화자 대본 제어 같은 영역에서 이전 세대인 제미나이 3.1 플래시 TTS 대비 개선이 컸다고 한다. 블라인드 선호도 평가인 보이스 아레나에서는 일본어, 브라질 포르투갈어, 베트남어, 표준 아랍어, 멕시코 스페인어, 힌디어 등 주요 언어에서 상위권을 확보했으며, 지원 언어는 100개 이상이다.
실무자 입장에서 눈여겨볼 대목은 이런 지표가 대부분 벤치마크 순위와 자체 선호도 평가에 기반한다는 점이다. 원문에는 지연 시간, 처리 비용, 시간당 생성량 같은 운영 지표나 구체적인 가격 정보가 제시되지 않았다. 한국어 성능에 대한 별도 수치도 언급되지 않았기 때문에, 국내 서비스에 적용하려는 팀이라면 자사 대본과 발화 상황을 기준으로 별도의 검증이 필요하다. 특히 감정 표현이나 억양 지시가 실제 한국어 발화에서 얼마나 자연스럽게 구현되는지는 직접 테스트하기 전에는 단정하기 어렵다.
안전장치와 도입 경로
음성 복제 기능에는 오남용을 막기 위한 절차가 붙었다. 구글은 특정 인물의 목소리를 복제하려면 해당 음성 소유자의 구두 동의 녹음을 제출해야 하고, 이 녹음이 참조 화자와 일치해야만 음성이 생성되는 동의 검증 방식을 적용했다고 밝혔다. 여기에 더해 제미나이 오디오 모델이 생성하는 모든 오디오에는 사람이 감지할 수 없는 형태의 워터마크인 신스ID(SynthID)가 삽입돼, AI가 만든 음성인지 사후에 판별할 수 있도록 했다. 성우와 화자의 신원을 보호하고 콘텐츠 출처를 투명하게 하려는 조치로, 음성 합성이 허위정보 제작에 악용되는 상황을 겨냥한 것이다.
도입 경로도 함께 열렸다. 개발자는 오늘부터 구글 AI 스튜디오에서 새 음성 정체성을 처음부터 설계하거나 자신의 목소리를 복제한 뒤, 2인 화자 대본 편집기로 가져와 대사별 전달 방식을 연출할 수 있다. 제미나이 API를 통해서는 아고라, 라이브킷, 파이프캣, 버셀 같은 개발자 플랫폼에서 음성 생성 기능을 붙일 수 있고, 피그마, 헤이젠, 링구아나, 원더크래프트, 99.co, 올랑 등이 이미 글로벌 더빙과 지역 억양 현지화, 대규모 대화형 음성 에이전트에 이 모델을 통합하고 있다고 구글은 소개했다.
종합하면 이번 발표는 오디오북, 게임, 팟캐스트, 미디어 현지화처럼 다량의 표현력 있는 음성이 필요한 워크플로를 겨냥한다. 다만 실제 채택 여부를 가르는 것은 벤치마크 순위보다 비용 구조, 응답 속도, 그리고 무엇보다 각 언어권에서의 자연스러움일 가능성이 크다. 동의 기반 음성 복제와 신스ID 워터마킹은 규제와 신뢰 측면에서 진입 장벽을 낮추는 요소이지만, 이를 준수하는 운영 절차를 어떻게 설계하느냐는 결국 도입 기업의 몫으로 남는다.