Google a lancé le 23 septembre 2026 Gemini 3.8 Flash TTS et sa déclinaison allégée Flash-Lite TTS, deux modèles de synthèse vocale capables de créer une voix à partir d’une simple description écrite. Ils couvrent plus de 100 langues, gèrent des dialogues à deux voix et sont disponibles dès maintenant dans l’API Gemini et Google AI Studio.
Une voix décrite, puis dirigée ligne par ligne
La nouveauté principale est la conception de voix par prompt : on décrit le timbre, l’âge ou l’attitude recherchés, et le modèle génère une voix qui n’existait pas. D’après l’annonce de Google, les modèles offrent aussi :
- une direction de jeu ligne par ligne : rythme, émotion, sons de conversation ;
- des rires, soupirs, exclamations et interjections placés dans le script ;
- une mise en scène native de dialogues à deux voix ;
- la génération de plusieurs heures d’audio continu, avec peu de dérive de la voix selon The Decoder ;
- plus de 2 000 voix prêtes à l’emploi et la prise en charge de variantes régionales (espagnol mexicain, français du Québec, anglais écossais).
Clonage de voix : 30 secondes et un consentement enregistré
Les modèles peuvent reproduire une voix à partir d’un échantillon de 30 secondes. Google encadre cette fonction : selon The Decoder, la personne clonée doit enregistrer une déclaration orale de consentement, et la voix de cet enregistrement doit correspondre à l’échantillon. Tout l’audio produit porte le filigrane SynthID, et les métadonnées C2PA sont prises en charge pour tracer l’origine des contenus.
Disponibilité et prix
Les deux modèles sont accessibles dès aujourd’hui via l’API Gemini et Google AI Studio. Gemini Enterprise suivra. Côté produits, Flash TTS alimente Gemini Notebook (dont les conversations vocales ont été lancées la semaine dernière) et Flash-Lite TTS équipe Google Vids.
The Decoder détaille la grille tarifaire par million de tokens : 0,50 $ en entrée texte pour les deux modèles, et 9 $ (Flash) ou 6 $ (Flash-Lite) en sortie audio pour 2026, des montants qui doublent en 2027. Une seconde d’audio correspondant à 25 tokens, une heure générée avec Flash TTS revient à 0,81 $ en 2026, puis 1,62 $ en 2027.
Benchmarks et partenaires
Google revendique la première place du Voice Design Benchmark de Hume AI (score de 71,4) et de son indice de qualité global, ainsi que des premières places sur le classement Voice Arena pour le japonais, le portugais brésilien, le vietnamien, l’arabe standard, l’espagnol mexicain et l’hindi. Ces chiffres proviennent de Google et restent à confirmer par des tests indépendants. Parmi les premiers intégrateurs cités : Figma, HeyGen, Wondercraft, LiveKit, Pipecat, Agora et Vercel.
Ce lancement complète Gemini 3.8 Live, la voix conversationnelle présentée mi-septembre, et place Google face à ElevenLabs et OpenAI sur la voix de synthèse destinée aux développeurs.
Où utiliser Gemini 3.8 Flash TTS ?
Dans l’API Gemini et Google AI Studio depuis le 23 septembre 2026. Gemini Enterprise est annoncé prochainement ; le modèle alimente aussi Gemini Notebook.
Peut-on cloner n’importe quelle voix ?
Non. Selon The Decoder, la personne clonée doit enregistrer une déclaration de consentement dont la voix correspond à l’échantillon de 30 secondes. L’audio généré porte le filigrane SynthID.
Combien coûte une heure d’audio ?
Selon The Decoder, 0,81 $ l’heure avec Flash TTS en 2026, puis 1,62 $ en 2027, les tarifs doublant. Flash-Lite TTS est moins cher en sortie audio (6 $ contre 9 $ par million de tokens en 2026).

