Google Gemini 3.8 Flash TTS bringt promptbasiertes Audio
Google stellt Gemini 3.8 Flash TTS und Flash-Lite TTS vor, mit denen Teams Stimmen per Textprompt gestalten und Dialoge zeilenweise über eine API steuern können.

Google hat seine Gemini-Audio-Produktfamilie durch die Einführung von Gemini 3.8 Flash TTS und Gemini 3.8 Flash-Lite TTS erweitert. Diese beiden Text-to-Speech-Modelle markieren einen grundlegenden Übergang in der Sprachsynthese: Sie verabschieden sich von starren Voreinstellungen und setzen stattdessen auf eine rein durch Prompts gesteuerte Stimmerzeugung. Google selbst bezeichnet diese Veröffentlichung als sein bislang ausdrucksstärkstes System zur Audiogenerierung. Es ermöglicht Ingenieuren sowie Kreativen, maßgeschneiderte Stimmen zu entwerfen und deren stimmliche Darbietung präzise über natürliche Sprachanweisungen zu lenken. Beide Modellvarianten sind ab sofort über die Gemini-API und Google AI Studio unter den Modellbezeichnungen gemini-3.8-flash-tts und gemini-3.8-flash-lite-tts verfügbar. Google bestätigte dabei ausdrücklich, dass der Zugriff ausschließlich API-basiert erfolgt und keine offenen Modellgewichte für ein lokales Hosting bereitgestellt werden. Eine geschäftliche Bereitstellung innerhalb von Gemini Enterprise ist laut Unternehmensangaben für die nahe Zukunft geplant.
Die Veröffentlichung stützt sich auf eine zweistufige Architektur, die gezielt darauf ausgelegt ist, kreative Tiefe mit betrieblichen Kosten und Latenzanforderungen in Einklang zu bringen. Gemini 3.8 Flash TTS wurde speziell für eine tiefgehende kreative Regie, detailliertes Charakterdesign und klanglich anspruchsvolle Audioerlebnisse in Videospielen, Podcasts, Hörbüchern und interaktiven Medienformaten entwickelt. Im Gegensatz dazu ist Gemini 3.8 Flash-Lite TTS auf hochvolumige, kosteneffiziente Skalierung optimiert und zielt auf umfangreiche Mediensynchronisationen, großflächige Inhaltsproduktionen sowie dialogorientierte Sprachassistenten ab. Diese neuen Modelle ergänzen das bestehende Portfolio von Google Gemini Audio, welches bereits Systeme wie 3.5 Live Translate, 3.5 Transcribe, 3.8 Live sowie 3.8 Live Extended Thinking umfasst.
Generatives Sprachdesign und detaillierte Regieanweisungen
Ein wesentlicher technischer Fortschritt der Version 3.8 besteht in der deutlichen Erweiterung über den bisherigen Katalog von 30 Originalstimmen hinaus. Entwickler können nun generatives Sprachdesign nutzen, um individuelle Stimmen von Grund auf mithilfe beschreibender Prompts in natürlicher Sprache zu erstellen. Diese Prompts können Angaben zu Rolle, Akzent und Klangfarbe in mehr als 100 Sprachen und Dialekten enthalten. In den technischen Veröffentlichungsunterlagen demonstrierte Google Anwendungsbeispiele, die von einem Radiomoderator aus Melbourne über einen blechernen, monotonen Roboter bis hin zu einem dramatischen japanischen Drachen reichen. Für Projekte, die auf vorgefertigte Ressourcen zurückgreifen möchten, stellt die Plattform zudem eine Bibliothek mit mehr als 2.000 sofort einsatzbereiten Stimmen bereit, einschließlich regionaler linguistischer Varianten wie schottischem Englisch, Quebecer Französisch und mexikanischem Spanisch. Eigens entworfene Stimmen lassen sich dauerhaft speichern und wiederverwenden, um eine akustische Drift über langfristige Produktionszyklen hinweg zu verhindern.
- Zeilenweise Skriptregie: Entwickler können schriftliche Regieanweisungen einfügen oder sich auf den natürlichen Textkontext verlassen, um den Tonfall stufenlos vom Flüstern bis hin zu autoritären Dialogen zu modulieren.
- Natives Szenen-Staging für zwei Sprecher: Mehrteilige Dialoge lassen sich aus einem einzigen Drehbuchskript heraus inszenieren, wobei eine klare stimmliche Trennung und ein realistischer Sprecherwechsel gewahrt bleiben.
- Stabilität bei Langformaten: Die Architektur behält Klangfarbe, Sprechtempo und Klangtreue über viele Stunden generierten Materials hinweg kontinuierlich bei.
- Konversationelle nonverbale Laute: Skripte können direkte Markierungen wie « laughs », « sigh » und « gasp » einbetten, um der Sprache eine menschliche Textur zu verleihen.
- Rückkanal-Interjektionen: Signale des aktiven Zuhörens wie « mhm » und « yeah » ermöglichen eine feingliedrige Abstimmung von komödiantischem Timing und Reaktionspausen.
- Voice-Remixing: Eine angekündigte Funktion, mit der Kreative Klangfarbe, Tonhöhe, Sprechtempo und Akzent bestehender Bibliotheksstimmen über Textprompts nachträglich verändern können.
Der Arbeitsablauf unterstützt zudem die Nachbildung von Stimmen auf Basis einer 30-sekündigen Audio-Referenzaufnahme. Um eine unbefugte Stimmenvervielfältigung zu unterbinden, verlangt Google eine begleitende mündliche Einverständniserklärung des Stimmrechteinhabers. Diese Aufnahme wird vor der Freigabe der Synthese automatisiert mit der Referenzstimme abgeglichen. Werkzeuge zur Stimmenreplikation innerhalb von Google AI Studio unterliegen derzeit regionalen Beschränkungen und sind in mehreren Rechtsräumen, darunter im Europäischen Wirtschaftsraum, im Vereinigten Königreich und in Indien, nicht verfügbar.
Benchmark-Ergebnisse und Kennzeichnung synthetischer Inhalte
Laut den von Google veröffentlichten Benchmark-Ergebnissen sicherte sich Gemini 3.8 Flash TTS den ersten Gesamtplatz im Voice Design Benchmark von Hume AI mit einer Punktzahl von 71.4 sowie einem Spitzenwert von 60.8 bei der Modellierung von Akzenten. Im Overall Quality Index von Hume AI belegten Gemini 3.8 Flash TTS und Gemini 3.8 Flash-Lite TTS jeweils den ersten und zweiten Platz, was deutliche Leistungssteigerungen gegenüber Gemini 3.1 Flash TTS belegt. Darüber hinaus berichtete Google, dass verblindete menschliche Präferenztests in der Voice Arena beiden Modellen Spitzenplatzierungen in mehreren wichtigen Sprachen einbrachten, darunter modernes Standardarabisch, Hindi, brasilianisches Portugiesisch, Japanisch, Vietnamesisch und mexikanisches Spanisch.
Um Herkunftsnachweise zu sichern und Missbrauch vorzubeugen, bettet Google ein unhörbares SynthID-Wasserzeichen direkt in das von seinen Gemini-Audio-Modellen erzeugte Audiosignal ein. Geklonte Stimmen, die über den Replikationsprozess entstehen, werden zusätzlich mit C2PA-Inhaltsnachweisen versehen, die überprüfbare Metadaten über den synthetischen Ursprung des Audiomaterials liefern.
Architektur zur Bereitstellung und operative Konsequenzen
Die Modelle werden nativ in Google-eigene Produkte wie Google Vids und Gemini Notebook integriert. Für externe Softwareumgebungen haben Entwicklerplattformen wie Agora, LiveKit, Pipecat und Vercel die Unterstützung über die Gemini-API aktiviert. Kommerzielle Medien- und Softwareunternehmen, darunter Figma, HeyGen, Linguana, Wondercraft, 99.co und Ollang, setzen die Modelle bereits ein, um automatisierte Synchronisationen, regionale Audiolokalisierungen und interaktive Echtzeit-Agenten bereitzustellen.
Für Unternehmen und technische Organisationen verändert diese Veröffentlichung die Wirtschaftlichkeit und Architektur synthetischer Sprachsysteme grundlegend. Entwicklungsteams sind nicht länger an starre Stimmenkataloge oder fehleranfällige, getrennte Pipelines für Dialoge mit mehreren Charakteren gebunden. Die zweistufige Struktur erlaubt es Systemarchitekten, latenzkritische Anwendungen mit hohem Durchsatz, wie etwa Kundendienst-Agenten, gezielt über Flash-Lite TTS abzuwickeln, während Flash TTS für markenspezifische Sprachaufnahmen und komplexe Skriptproduktionen reserviert bleibt – gesteuert über standardisierte APIs und geschützt durch integrierte Herkunftsnachweise.
Quellen
- Google Releases Gemini 3.8 Flash TTS and Flash-Lite TTSMarkTechPost · 23. September 2026
- Gemini 3.8 text-to-speech says helloGoogle · 23. September 2026



