Google hat am 23. September Gemini 3.8 Flash TTS und Gemini 3.8 Flash-Lite TTS vorgestellt. Damit ergänzt das Unternehmen ein ausdrucksstärkeres Sprachmodell um eine günstigere Option für Audioaufgaben mit hohem Volumen.
In der Google-Ankündigung erklärt das Unternehmen, dass Flash auf gezieltere Sprachproduktion ausgerichtet ist, während Flash-Lite für durchsatzsensible Workloads entwickelt wurde. Flash unterstützt Sprachdesign per Prompt in mehr als 100 Sprachen und Dialekten. Builder können laut Google außerdem eine Bibliothek mit mehr als 2,000 voreingestellten Stimmen nutzen.
Google beschränkt zudem die Stimmreplikation: Für das Klonen sind ein 30-Sekunden-Sample sowie eine passende gesprochene Einwilligungsaufnahme des Stimmeninhabers erforderlich. Die Modelle unterstützen auch die Steuerung der Sprechweise Zeile für Zeile, die Generierung längerer Inhalte und Szenen mit zwei Sprechern. Die Einführung in Google AI Studio und der Gemini API begann am 23. September, allerdings ist die Stimmreplikation im EWR, im Vereinigten Königreich, in der Schweiz, in Indien, Illinois und Texas nicht verfügbar.
