Google 推出 Gemini 3.8 Live Avatar,支援 97 種語言即時唇形同步
Google 於 2026 年 9 月 25 日發布 Gemini 3.8 Live Avatar,這款合成主播能在 97 種語言下同步唇形與螢幕資料,現已向 Gemini Enterprise 客戶開放。

Google 在 2026 年 9 月 25 日正式對外宣佈,為其 Gemini 3.8 Live 平台增添全新 Live Avatar 功能,這項技術被定位為即時回應的動畫化虛擬主播,能夠將語音的音素與口型、臉部表情同步,並在畫面上即時疊加圖表、文字或其他視覺資訊,以提升資訊傳遞的完整度與沉浸感。
根據 Google 的說明,這個虛擬形象支援多達 97 種語言,使用者在不同語言之間切換時,畫面的解析度與流暢度皆不受影響,亦不會出現常見的視覺漂移或口型不匹配的問題,確保每一次的語言切換都保持高品質的視聽體驗。
技術運作原理
Gemini 3.8 Live 於一週前首次公開亮相,展示了近即時處理視覺輸入的能力。Live Avatar 建立在此基礎上,透過 3D 動畫引擎即時生成虛擬臉部,並將 Gemini 語言模型所產生的音素資訊映射到對應的口型變化,使得每一個語音單位都能在畫面上得到精準的口形呈現。
在官方示範影片中,虛擬形象先以英語說出一句話,緊接著無縫切換至日語,口型與表情仍然精確對應各自語言的音素特徵,證明了系統在多語言環境下的同步能力。
系統同時提供螢幕疊層功能,允許虛擬形象在說話的同時顯示圖表、要點或其他視覺提示,將純粹的語音回應升級為類似簡報的多媒體呈現,提升受眾的理解與記憶。
僅限企業客戶推出
Google 在發佈會上明確指出,Live Avatar 目前僅向 Gemini Enterprise 客戶開放,這些訂閱企業方案的組織可以從預設的虛擬形象庫中挑選合適的角色,或委託 Google 依照企業的品牌指引打造專屬的客製化臉孔,以確保品牌形象的一致性。
每段由系統生成的影片都會自動嵌入一個不可見的 SynthID 水印,Google 表示此水印結合內建的防護機制,旨在保護內容的身分認證,並協助下游平台驗證該影片屬於合成產物,防止被惡意偽造或盜用。
潛在效益與應用情境
- 客戶服務代理人可使用母語與來電者對話,免除多語言人員招聘
- 內部培訓模組由同一位虛擬講師以多語言傳遞內容
- 行銷影片可即時本地化,支援全球行銷活動
- 線上研討會中,虛擬形象可即時切換語言,服務多語言觀眾
在品牌導向的溝通中,保持跨語言的視覺一致性尤為重要。傳統上,靜態主播加上字幕常會產生「怪異谷」效應,觀眾會感受到不自然的口型與語言不匹配。Live Avatar 透過即時口型同步,成功避免了這一問題,提升了品牌訊息的專業度與可信度。
然而,此項技術的發布同時也引發了身份偽造、資訊揭露與無障礙可及性等議題。監管機構與數位權益倡議團體警告說,合成主播若被惡意使用,可能冒充真實人物或隱匿資訊來源,對公共資訊安全構成風險。Google 雖以 SynthID 水印作為第一道防線,但目前尚未說明第三方平台如何有效偵測與驗證此水印。
從無障礙的角度來看,若搭配高精度字幕,虛擬形象可為聽障使用者提供更完整的內容理解,同時為依賴唇讀的觀眾提供即時的視覺線索,提升資訊的多模態可及性。儘管如此,Google 仍未公布此功能是否已通過相關的無障礙認證或符合國際標準。
對於以中文為主要語言的企業而言,Live Avatar 意味著可以以更大規模產出多語言影片,無需為每種語言分別聘請配音員、翻譯或影片剪輯師。單一的 Gemini Enterprise 授權即可在 97 種語言中保持相同的訊息、品牌語調與視覺風格,將原本可能需要數週的製作周期縮短至數分鐘,顯著加速產品上市節奏、降低在地化預算,並確保跨市場觀眾的體驗一致。
最後,Google 強調此技術仍處於持續迭代階段,未來將持續優化口型同步的自然度、擴充語言庫以及加強水印偵測機制,以回應企業與監管部門的期待,並在全球多元語言環境中提供更安全、更高效的 AI 合成解決方案。
資料來源
- Gemini 3.8 Live with Live Avatar gives Google’s AI a faceThe Verge · 2026年9月25日
- أكثر من مجرد صوت.. جوجل تمنح Gemini وجهًا متحركًا يتحدث بـ97 لغةAIT News · 2026年9月25日



