구글 제미나이 3.8 플래시 TTS, 프롬프트 기반 음성 설계 도입
구글이 제미나이 3.8 플래시 TTS 및 플래시-라이트 TTS를 출시하여 프롬프트로 맞춤형 음성을 생성하고 다자 대화를 제어할 수 있는 API를 지원합니다.

구글이 제미나이 3.8 플래시 TTS(Gemini 3.8 Flash TTS)와 제미나이 3.8 플래시-라이트 TTS(Gemini 3.8 Flash-Lite TTS)를 선보이며 제미나이 오디오(Gemini Audio) 제품군을 대폭 확장했습니다. 이 두 텍스트 음성 변환(TTS) 모델은 기존의 정적 음성 프리셋 방식에서 벗어나 자연어 프롬프트 명령을 통해 음성 출력을 직접 연출하는 생성 방식으로의 전환을 보여줍니다. 구글은 이번 모델이 지금까지 출시한 음성 생성 시스템 중 가장 뛰어난 표현력을 제공한다고 설명하며, 엔지니어와 콘텐츠 제작자가 자연어 지시어만으로 맞춤형 보이스를 구축하고 세밀한 연기 톤을 제어할 수 있도록 지원합니다. 두 모델은 제미나이 API(Gemini API)와 구글 AI 스튜디오(Google AI Studio)에서 모델 식별자 gemini-3.8-flash-tts 및 gemini-3.8-flash-lite-tts를 통해 즉시 이용할 수 있습니다. 구글은 이들 모델이 온프레미스 로컬 호스팅을 위한 오픈 가중치를 제공하지 않고 철저히 API 기반으로만 운영되며, 기업용 서비스인 제미나이 엔터프라이즈(Gemini Enterprise) 지원도 곧 제공될 예정이라고 확인했습니다.
이번에 공개된 2계층 아키텍처는 연출의 창의적 깊이와 운영 비용 및 지연 시간 간의 균형을 유지하도록 설계되었습니다. 제미나이 3.8 플래시 TTS는 비디오 게임, 팟캐스트, 오디오북, 인터랙티브 미디어 등에서 정교한 창의적 디렉팅과 캐릭터 보이스 설계, 풍부한 오디오 경험을 구축하는 데 특화되었습니다. 반면 제미나이 3.8 플래시-라이트 TTS는 대규모 미디어 더빙, 대량 콘텐츠 생성, 실시간 대화형 보이스 에이전트 구축을 목표로 대규모 처리량과 비용 효율성에 최적화되었습니다. 이 모델들은 기존 구글 제미나이 오디오 라인업인 3.5 라이브 트랜스레이트(3.5 Live Translate), 3.5 트랜스크라이브(3.5 Transcribe), 3.8 라이브(3.8 Live), 3.8 라이브 익스텐디드 씽킹(3.8 Live Extended Thinking)을 보완합니다.
생성형 음성 설계와 세분화된 연기 연출 기능
제미나이 3.8 릴리스의 주요 기술적 도약은 과거 30개의 기본 음성 프리셋에 머물던 라이브러리를 넘어선 것입니다. 개발자는 이제 역할, 억양, 보컬 음색 등을 묘사하는 자연어 텍스트 프롬프트를 사용하여 100개 이상의 언어 및 방언에 걸쳐 처음부터 맞춤형 음성을 생성하는 생성형 음성 설계를 활용할 수 있습니다. 구글이 공개한 기술 자료에는 멜버른 라디오 DJ, 깡통 소리가 나는 단조로운 로봇 음성, 극적인 톤의 일본 용 캐릭터 등의 구현 사례가 포함되었습니다. 사전 구축된 음성 자산이 필요한 프로젝트를 위해 플랫폼은 스코틀랜드 영어, 퀘벡 프랑스어, 멕시코 스페인어 등 지역 방언을 포함한 2,000개 이상의 상용 음성 라이브러리를 제공합니다. 제작자가 직접 설계한 맞춤형 음성은 저장 후 재사용할 수 있어 장기적인 제작 파이프라인에서 발생할 수 있는 음향적 드리프트(acoustic drift) 현상을 방지합니다.
- 대본 줄 단위 연출: 개발자가 직접 지문(stage directions)을 삽입하거나 자연스러운 텍스트 문맥을 활용하여 속삭임부터 권위 있는 대화까지 발화 톤을 정밀하게 제어할 수 있습니다.
- 네이티브 2인 화자 장면 구성: 단일 대본 파일 하나만으로도 명확한 음성 분리와 자연스러운 발언 교대(turn-taking)를 유지하며 다자 대화를 구현합니다.
- 장편 오디오 생성의 안정성: 수 시간 동안 이어지는 긴 오디오 생성 과정에서도 음색, 발화 속도, 음향 충실도를 일정하게 유지하는 아키텍처를 갖췄습니다.
- 대화형 비언어적 감정 표현: 대본 내에 « laughs »(웃음), « sigh »(한숨), « gasp »(헐떡임)과 같은 직접 태그를 삽입해 인간다운 음향적 질감을 부여할 수 있습니다.
- 적극적 경청 간투사 연출: « mhm »이나 « yeah » 같은 적극적 듣기 추임새를 대본에 배치하여 코미디 타이밍이나 반응 정적을 미세하게 조율할 수 있습니다.
- 음성 리믹싱: 텍스트 프롬프트로 기존 라이브러리 음성의 음색, 음조, 속도, 억양을 수정할 수 있는 후속 기능이 예정되어 있습니다.
또한 제작 파이프라인은 30초 길이의 레퍼런스 오디오 샘플을 바탕으로 음성을 복제하는 기능도 지원합니다. 구글은 무단 음성 복제를 방지하기 위해 원본 화자의 구두 동의 녹음 파일을 필수로 요구하며, 음성 생성이 승인되기 전에 레퍼런스 오디오와 일치하는지 검증을 거칩니다. 현재 구글 AI 스튜디오 내의 음성 복제 도구는 규제 검토에 따라 유럽경제지역(EEA), 영국, 인도 등 일부 관할 지역에서는 사용이 제한되어 제공되지 않습니다.
벤치마크 성능 평가와 콘텐츠 출처 추적성
구글이 발표한 벤치마크 데이터에 따르면, 제미나이 3.8 플래시 TTS는 흄 AI(Hume AI)의 음성 설계 벤치마크(Voice Design Benchmark)에서 71.4점을 기록하며 종합 1위를 차지했고, 억양 모델링 부문에서도 60.8점으로 최고점을 획득했습니다. 흄 AI의 종합 품질 지수(Overall Quality Index)에서도 제미나이 3.8 플래시 TTS와 제미나이 3.8 플래시-라이트 TTS가 각각 1위와 2위를 석권하며 이전 세대인 제미나이 3.1 플래시 TTS 대비 뚜렷한 품질 향상을 나타냈습니다. 아울러 보이스 아레나(Voice Arena)에서 실시된 블라인드 인간 선호도 평가 결과 현대 표준 아랍어, 힌디어, 브라질 포르투갈어, 일본어, 베트남어, 멕시코 스페인어를 비롯한 주요 언어 전반에서 두 모델 모두 최상위 순위를 기록했다고 보고했습니다.
합성 미디어의 오용 방지와 출처 투명성 확보를 위해 구글은 제미나이 오디오 모델이 생성하는 모든 오디오 출력물에 사람이 인지할 수 없는 신스ID(SynthID) 워터마크를 기본으로 내장합니다. 또한 복제 파이프라인을 통해 제작된 클론 음성에는 C2PA(콘텐츠 출처 및 진위 확인 연합) 표준 콘텐츠 자격 증명이 함께 포함되어 해당 미디어가 합성된 것임을 검증할 수 있는 메타데이터를 제공합니다.
배포 생태계 및 기업 운영에 미치는 영향
이 모델들은 현재 구글 비즈(Google Vids)와 제미나이 노트북(Gemini Notebook) 등 구글 자체 제품군에 네이티브로 통합되고 있습니다. 외부 소프트웨어 개발 환경을 위해 아고라(Agora), 라이브킷(LiveKit), 파이프캣(Pipecat), 버셀(Vercel)과 같은 주요 개발자 인프라 플랫폼이 제미나이 API 지원을 활성화했습니다. 이와 함께 피그마(Figma), 헤이젠(HeyGen), 링구아나(Linguana), 원더크래프트(Wondercraft), 99.co, 올랑(Ollang) 등의 상용 미디어 및 소프트웨어 기업들이 자동 더빙, 지역별 오디오 현지화, 실시간 대화형 에이전트 구축을 위해 이들 모델을 프로덕션 환경에 배포하고 있습니다.
기업과 기술 조직의 입장에서 이번 발표는 합성 음성 배포에 따르는 경제성과 시스템 엔지니어링 구조를 근본적으로 변화시킵니다. 이제 개발팀은 정형화된 음성 카탈로그에 얽매이거나 다자 대화 생성을 위해 여러 개의 취약한 파이프라인을 개별 구축할 필요가 없어졌습니다. 지연 시간에 민감한 대규모 고객 지원 에이전트는 플래시-라이트 TTS로 라우팅하고, 브랜드 정체성이 중요한 내레이션이나 복잡한 극적 미디어 제작은 플래시 TTS에 할당하는 이원화 설계를 통해 표준화된 API 환경과 출처 검증 체계 안에서 효율적인 음성 파이프라인을 운영할 수 있게 되었습니다.
출처
- Google Releases Gemini 3.8 Flash TTS and Flash-Lite TTSMarkTechPost · 2026년 9월 23일
- Gemini 3.8 text-to-speech says helloGoogle · 2026년 9월 23일



