Gemini 3.8 Flash TTS
Gemini 3.8 Flash TTS transforme un texte en parole. Flash-Lite TTS vise la production à grand volume. Ces modèles se distinguent de Live, dédié à la conversation vocale en temps réel.
01 Deux modèles, deux priorités
Flash TTS cible la narration, les personnages et les dialogues expressifs. Flash-Lite TTS vise le débit et la latence pour les lectures à grande échelle. Google annonce aussi la création de voix et la réplication avec vérification du consentement dans cette nouvelle famille.
Les deux modèles reçoivent du texte et produisent de l’audio. Ils ne remplacent pas un agent qui raisonne et appelle des outils. Pour la conversation, consulter la fiche Live.
02 Limites API documentées
Flash TTS affiche 8 192 tokens en entrée et 16 384 en sortie dans Gemini API. Sa fiche ne prend pas en charge Live API, les appels de fonctions ou la recherche intégrée. Découper un texte long et contrôler la continuité de la voix entre segments.
03 Éviter de faire lire les consignes
Dans le schéma 3.8, le texte est traité comme une transcription à prononcer. Place le style et l’identité du locuteur dans speech_metadata, pas dans une phrase telle que « dis ceci joyeusement ». Chaque tour à plusieurs voix doit identifier son locuteur.
Les requêtes unitaires renvoient du WAV par défaut. Un ancien pipeline qui ajoutait lui-même un en-tête WAV à du PCM doit être adapté. Vérifier le format réel avant de réutiliser le code.
04 Prix API et échéance de la promotion
Standard, relevé du 30 septembre 2026. Dollars par million de tokens. Promotion jusqu’au 31 décembre 2026.
- Flash TTS
- Texte entrant : 0,50 $. Audio produit : 9 $.
- Flash-Lite TTS
- Texte entrant : 0,50 $. Audio produit : 6 $.
À compter du 1er janvier 2027, la grille annonce respectivement 1 $/18 $ et 1 $/12 $. Un palier gratuit existe, avec quotas et conditions d’utilisation des données distincts du payant. Les modes Batch, Flex et Priority ont leurs propres grilles.
05 Un test simple avant intégration
Faire lire le même texte contenant dates, noms propres et sigles à ces modèles et à ElevenLabs. Comparer les reprises nécessaires, les accents, les pauses et la stabilité. Conserver les droits et consentements nécessaires pour les voix utilisées.
Pour une application qui écoute et répond, consulter Gemini 3.8 Live. Une synthèse vocale et une session interactive ne se comparent pas à partir d’un tarif par token isolé.
Sources officielles
- Flash TTS et migration
- Flash-Lite TTS
- Grille de prix
- Guide de génération vocale
- Annonce Google du 23 septembre
Consultées le 30 septembre 2026. Documentation éditeur, sans test indépendant revendiqué.