Google推出Gemini 3.8 Flash TTS語音模型:以文字提示詞打造客製聲音並實現多角色劇本對話演出
Google推出Gemini 3.8 Flash TTS與Flash-Lite TTS,讓開發團隊能透過自然語言提示詞自訂聲音,並藉由API進行逐行劇本對話排演與語音生成。

Google擴展旗下Gemini Audio系列,正式推出Gemini 3.8 Flash TTS與Gemini 3.8 Flash-Lite TTS。這兩款文字轉語音(TTS)模型標誌著語音合成技術從過往固定的預設聲音,轉向由文字提示詞直接驅動的聲音生成與表演控制。Google將此次發布定位為其迄今表現力最強大的音訊生成系統,讓工程師與創作者能藉由自然語言指令量身打造專屬聲音並精細調控語音演出。兩款模型現已可透過Gemini API以及Google AI Studio存取,模型識別碼分別為gemini-3.8-flash-tts與gemini-3.8-flash-lite-tts。Google確認目前存取方式嚴格限於API,並未釋出供本地託管的開源模型權重,而Gemini Enterprise企業版整合支援預計將於近期推出。
本次發布引進了雙層架構設計,旨在創意表現深度、營運成本與延遲表現之間取得平衡。Gemini 3.8 Flash TTS專為深度創意指導、角色設計以及電子遊戲、播客、有聲書與互動媒體中的豐富音訊體驗量身打造;相較之下,Gemini 3.8 Flash-Lite TTS則針對大規模高通量、具備成本效益的應用進行最佳化,主要鎖定大規模媒體配音、內容生成與對話式語音助理。這兩款新模型進一步補足了Google現有的Gemini Audio產品線,包括3.5 Live Translate、3.5 Transcribe、3.8 Live以及3.8 Live Extended Thinking。
生成式聲音設計與細緻對白演出調控
3.8版本在技術上的重大躍進,在於打破了以往僅有30種原始聲音的限制。開發者現在可利用生成式聲音設計功能,透過描述角色、口音與音色的自然語言提示詞,從零開始構建支援超過100種語言與方言的客製化聲音。在技術發表資料中,Google展示了多元範例,從墨爾本電台DJ、帶有金屬單調感的機器人,到充滿戲劇張力的日本巨龍等角色。針對需要現成語音資源的專案,該平台亦提供包含超過2,000種可直接用於正式環境的聲音庫,涵蓋蘇格蘭英語、魁北克法語與墨西哥西班牙語等各區域語言變體。客製設計的聲音亦可保存並重複調用,以避免長期製作流程中出現聲學漂移。
- 逐行劇本指導:開發者可插入書面舞台指示或仰賴自然文字脈絡,精準引導語音表現,從低聲耳語到具權威感的對白皆能自由掌控。
- 原生雙人場景排演:可透過單一劇本直接編排多輪對話,同時維持清晰的聲音分離度與自然的輪流發言節奏。
- 長篇內容穩定性:該架構能在長達數小時的生成音訊中,持續維持穩定的音色、語速節奏與音質保真度。
- 對話式非語言爆發音:劇本中可直接嵌入標籤,如« laughs »、« sigh »與« gasp »,增添逼真的人性化質感。
- 監聽反饋插話:支援如« mhm »與« yeah »等主動聆聽語氣詞,以精確校準喜劇節奏與回應停頓。
- 聲音混音:即將推出的新功能,旨在允許創作者透過文字提示詞微調既有聲音庫中的音色、音高、語速及口音。
此生成工作流程亦支援依據30秒參考音訊樣本進行聲音複製。為了防止未經授權的聲音複製濫用,Google要求聲音擁有者必須同時提供口頭同意錄音,並在授權生成之前與參考說話者進行比對驗證。目前Google AI Studio內的複製語音工具受到限制,在包含歐洲經濟區、英國與印度在內的多個司法管轄區暫不開放使用。
基準測試表現與內容來源驗證
根據Google發布的基準測試數據,Gemini 3.8 Flash TTS在Hume AI的聲音設計基準測試(Voice Design Benchmark)中以71.4分奪得總榜冠軍,並在口音建模方面拿下60.8分的領先成績。在Hume AI整體品質指數(Overall Quality Index)上,Gemini 3.8 Flash TTS與Gemini 3.8 Flash-Lite TTS分別佔據第一與第二名,較Gemini 3.1 Flash TTS展現出顯著的效能提升。此外,Google指出在Voice Arena的雙盲人類偏好評估中,兩款模型在現代標準阿拉伯語、印地語、巴西葡萄牙語、日語、越南語及墨西哥西班牙語等多個主要語言中皆名列前茅。
為了解決媒體來源溯源與潛在濫用問題,Google直接在Gemini Audio模型生成的音訊中嵌入無法察覺的SynthID浮水印。透過複製工作流程生成的複製聲音亦整合了C2PA內容憑證,提供可供驗證的元數據以標明該媒體內容為合成生成。
部署架構與對企業組織的營運影響
這些模型正原生整合至Google Vids與Gemini Notebook等產品中。在外部軟體整合方面,Agora、LiveKit、Pipecat與Vercel等開發者基礎設施平台已透過Gemini API啟用相關支援。包括Figma、HeyGen、Linguana、Wondercraft、99.co和Ollang等商業媒體與軟體企業,亦正部署這些模型來處理自動化配音、區域音訊在地化以及即時互動助理等任務。
對於企業與技術組織而言,這項發布從根本上改變了合成語音部署的經濟效益與工程架構。開發團隊不再受限於僵化的預設聲音目錄,也不必再為多角色對話生成維護複雜且脆弱的獨立管線。雙層架構使系統架構師得以將客戶支援助理等注重低延遲、高通量的應用導向Flash-Lite TTS,同時將Flash TTS保留給貼合品牌形象的敘事與複雜劇本媒體創作,且所有流程均在標準化的API控制機制與內建來源追蹤技術下受到嚴密管理。
資料來源
- Google Releases Gemini 3.8 Flash TTS and Flash-Lite TTSMarkTechPost · 2026年9月23日
- Gemini 3.8 text-to-speech says helloGoogle · 2026年9月23日



