谷歌Gemini 3.8 Flash TTS支持提示词驱动声音设计
谷歌推出Gemini 3.8 Flash TTS与Flash-Lite TTS,支持通过文本提示词设计语音,并通过API实现逐行对话导演级控制。

谷歌扩大了其Gemini音频(Gemini Audio)产品阵容,正式推出Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS两款文本转语音(TTS)模型。这两款新模型推动语音合成技术从传统的静态预设转变为由自然语言提示词完全引导的声音生成。谷歌将本次发布描述为其迄今为止表现力最丰富的音频生成系统,使工程师与创作者能够利用自然语言指令生成定制化声线并精确控制演绎效果。两款模型目前已通过Gemini API和Google AI Studio全面上线,模型标识符分别为gemini-3.8-flash-tts与gemini-3.8-flash-lite-tts。谷歌证实,模型访问严格采用API形式,不提供本地部署的开放权重(open weights),而面向企业的Gemini Enterprise版本被标注为即将推出。
此次发布引入了双层架构设计,旨在平衡创作深度与实际运营中的成本及延迟要求。其中,Gemini 3.8 Flash TTS专为深度创意指导、角色设计以及电子游戏、播客、有声读物和互动媒体等丰富音频场景量身定制。相比之下,Gemini 3.8 Flash-Lite TTS则针对高并发、高性价比的规模化需求进行了优化,主要面向大规模影视与自媒体配音、内容批量生成以及会话型语音代理。这两款模型进一步完善了谷歌现有的Gemini音频产品线,该产品线已涵盖3.5 Live Translate、3.5 Transcribe、3.8 Live以及3.8 Live Extended Thinking。
生成式声音设计与颗粒化演绎控制
3.8版本的一大核心技术变革,在于彻底突破了以往仅有30种原生声音的预设库限制。开发者现在可以通过生成式声音设计,利用描述角色身份、口音特征和声音音色的自然语言提示词,从零构建跨越100多种语言及方言的定制声线。在技术发布资料中,谷歌展示了从墨尔本电台DJ、带有金属杂音的单调机器人到极具戏剧张力的日本巨龙等多样范例。针对需要开箱即用资产的项目,平台提供了包含2000多种可直接用于生产环境的声音库,涵盖苏格兰英语、魁北克法语及墨西哥西班牙语等区域语言变体。定制设计的声音可以保存并重复调用,以防止长期制作流程中出现声学漂移。
- 脚本逐行导演控制:开发者可以插入书面舞台指示或依靠自然文本语境,精准引导从低语呢喃到权威口吻的演绎变化。
- 原生双人场景编排:可通过单一剧本同时调度双人多轮对话,维持清晰的声音分离度与逼真的轮流发言节奏。
- 长音频生成稳定性:模型架构可在数小时的连续生成过程中,始终保持音色、语速节奏及音频保真度的高度一致。
- 会话级非语言拟真爆发音:脚本中可直接嵌入如« laughs »(笑声)、« sigh »(叹气)和« gasp »(喘息)等标签,增添真实人类质感。
- 回声确认插话反馈:支持诸如« mhm »和« yeah »等积极倾听线索,便于精细校准喜剧时机掌控与反应停顿。
- 声音混音重塑:即将推出的全新功能,允许创作者通过文本提示词直接调整预设库声音的音色、音高、语速和口音。
此外,生成工作流还支持基于30秒参考音频样本的声音复制。为防范未经授权的声音克隆行为,谷歌强制要求声音所有者录制一段口头知情同意声明,并在系统比对验证该声明与参考说话人一致后方可授权生成。目前,Google AI Studio内的声音复制工具受到严格限制,在包括欧洲经济区(EEA)、英国和印度在内的多个司法管辖区暂不提供。
基准测试表现与内容溯源机制
根据谷歌公布的基准测试数据,Gemini 3.8 Flash TTS在Hume AI的声音设计基准(Voice Design Benchmark)中以71.4分的成绩斩获总分第一,并在口音建模测试中以60.8分位居榜首。在Hume AI的整体质量指数(Overall Quality Index)中,Gemini 3.8 Flash TTS与Gemini 3.8 Flash-Lite TTS分别占据第一和第二位,相较于Gemini 3.1 Flash TTS展现出显著的性能提升。此外,谷歌报告称,在Voice Arena的双盲人类偏好评估中,这两款模型在现代标准阿拉伯语、印地语、巴西葡萄牙语、日语、越南语和墨西哥西班牙语等多种主流语言评测中均名列前茅。
为了解决媒体内容溯源与防范滥用问题,谷歌在其Gemini音频模型生成的音频文件中直接嵌入了人耳不可察觉的SynthID水印。经由声音复制流程生成的克隆声音还会整合C2PA内容凭证(Content Credentials),提供关于该媒体合成属性的可验证元数据。
部署架构与企业运营影响
这两款模型正在被深度集成到谷歌旗下产品中,包括Google Vids和Gemini Notebook。在外部软件集成方面,Agora、LiveKit、Pipecat和Vercel等开发者基础设施平台已通过Gemini API提供接入支持。Figma、HeyGen、Linguana、Wondercraft、99.co以及Ollang等商业媒体与软件企业正在部署这些模型,用于处理自动化视频配音、区域音频本地化及实时交互代理等业务。
对于企业和技术机构而言,本次发布改变了合成语音部署的经济学模型与工程架构。团队不再受限于死板的声音目录,也不再需要为多角色对话搭建复杂而脆弱的独立处理管线。双层模型结构使系统架构师能够将高并发、对延迟敏感的客户支持代理等应用分流至成本更低的Flash-Lite TTS,同时将Flash TTS保留给符合品牌调性的叙事和复杂剧本媒体制作,且全程置于标准化的API控制与嵌入式溯源追踪管理之下。
信息来源
- Google Releases Gemini 3.8 Flash TTS and Flash-Lite TTSMarkTechPost · 2026年9月23日
- Gemini 3.8 text-to-speech says helloGoogle · 2026年9月23日



