Google a lancé Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS le 23 septembre, avec un modèle vocal plus expressif et une option moins coûteuse pour les traitements audio à grand volume.
Dans l'annonce de Google, l'entreprise indique que Flash cible une production vocale plus guidée, tandis que Flash-Lite est conçu pour les charges de travail sensibles au débit. Flash prend en charge la conception de voix par prompt dans plus de 100 langues et dialectes, et Google précise que les builders peuvent aussi utiliser une bibliothèque de plus de 2 000 voix prédéfinies.
Google encadre également la réplication vocale : le clonage exige un échantillon de 30 secondes ainsi qu'un enregistrement oral de consentement correspondant de la part du propriétaire de la voix. Les modèles prennent aussi en charge le contrôle de la restitution ligne par ligne, la génération de contenus longs et les scènes à deux intervenants. Le déploiement a commencé dans Google AI Studio et l'API Gemini le 23 septembre, mais la réplication vocale n'est pas disponible dans l'EEE, au Royaume-Uni, en Suisse, en Inde, dans l'Illinois et au Texas.
