Latenode

Google startet Gemini 3.8 TTS mit einwilligungspflichtigem Stimmenklonen

Builder können hochwertige Sprachausgaben und Sprachgenerierung in großen Mengen auf zwei Modelle verteilen. Workflows mit geklonten Stimmen benötigen jedoch ausdrückliche Einwilligungsprüfungen und eine regionsspezifische Verarbeitung.

KI-generierte Stimmen mit Einwilligungsprüfung

Google hat am 23. September Gemini 3.8 Flash TTS und Gemini 3.8 Flash-Lite TTS vorgestellt. Damit ergänzt das Unternehmen ein ausdrucksstärkeres Sprachmodell um eine günstigere Option für Audioaufgaben mit hohem Volumen.

In der Google-Ankündigung erklärt das Unternehmen, dass Flash auf gezieltere Sprachproduktion ausgerichtet ist, während Flash-Lite für durchsatzsensible Workloads entwickelt wurde. Flash unterstützt Sprachdesign per Prompt in mehr als 100 Sprachen und Dialekten. Builder können laut Google außerdem eine Bibliothek mit mehr als 2,000 voreingestellten Stimmen nutzen.

Google beschränkt zudem die Stimmreplikation: Für das Klonen sind ein 30-Sekunden-Sample sowie eine passende gesprochene Einwilligungsaufnahme des Stimmeninhabers erforderlich. Die Modelle unterstützen auch die Steuerung der Sprechweise Zeile für Zeile, die Generierung längerer Inhalte und Szenen mit zwei Sprechern. Die Einführung in Google AI Studio und der Gemini API begann am 23. September, allerdings ist die Stimmreplikation im EWR, im Vereinigten Königreich, in der Schweiz, in Indien, Illinois und Texas nicht verfügbar.

Wenn sich Modelle und APIs ändern läuft der Workflow weiter

Verbinden Sie die Modelle und Apps aus solchen Meldungen in einem Szenario. Ändert ein Anbieter Routing, Preise oder Verfügbarkeit, aktualisieren Sie den Workflow — Sie fangen nicht von vorn an.

Dauerhaft kostenloser Plan. Keine Kreditkarte erforderlich.