Gemini 3.8 Live
Gemini 3.8 Live sert à construire une conversation vocale réactive. Sa variante Extended Thinking ajoute du raisonnement en arrière-plan pour les demandes à plusieurs étapes.
La voix à partir du texte
Gemini 3.8 Flash TTS et Flash-Lite TTS sont dédiés à la synthèse vocale. Leur fiche distingue narration, production en volume et contraintes API, sans les confondre avec une conversation Live.
Actualisation ciblée du 30 septembre 2026. Source officielle · Source officielle
01 Deux variantes pour un agent vocal
Google documente deux modèles stables : gemini-3.8-live et gemini-3.8-live-extended-thinking. Cette fiche concerne Live API pour les développeurs ; elle ne promet pas le même choix de modèle dans l’application Gemini.
02 Voix, images et outils
Live accepte du texte, des images, de l’audio et de la vidéo. La réponse de session est audio ; une transcription permet d’en récupérer le texte. La fiche indique une limite d’entrée de 131 072 tokens et une sortie maximale de 65 536 tokens.
Les appels de fonctions et la recherche Google sont pris en charge. L’exécution de code intégrée, les sorties structurées et la génération d’images ne figurent pas parmi les capacités supportées de ces modèles.
03 Quand choisir Extended Thinking
Extended Thinking poursuit son raisonnement et ses appels d’outils asynchrones pendant une interaction vocale. Le réglage du raisonnement propose low, medium et high. Le client doit surveiller interaction_status : la fin d’un tour audio ne signifie pas nécessairement la fin du traitement.
Les appels bloquants ne sont pas acceptés par cette variante. Prévois une interface qui distingue la parole terminée du travail encore en cours, notamment avant une confirmation de réservation ou une action externe.
04 Migrer une application vocale
Avec Live standard, retire le paramètre thinking_level. L’audio proactif est permanent et l’ancien paramètre de dialogue affectif doit être retiré. Les mises à jour de contenu client sont permises pendant la session ; une interruption doit être traitée explicitement.
Teste le micro dans le bruit, les interruptions, les pertes de connexion et les résultats d’outils tardifs. Une conversation fluide ne suffit pas à garantir l’exactitude de la commande transmise.
05 Tarifs API
Tarifs relevés le 22 septembre 2026. La grille commune aux deux variantes affiche les montants suivants en dollars par million de tokens.
- Entrée
- Texte : 0,75 $. Audio : 3 $. Image ou vidéo : 1 $.
- Sortie
- Texte, raisonnement inclus : 4,50 $. Audio : 12 $.
Un palier gratuit est affiché, sans signifier un usage illimité. Les données du palier gratuit peuvent servir à améliorer les produits ; la grille distingue ce traitement du palier payant. La recherche Google peut ajouter une facturation propre. Ne compare pas un seul flux audio à un prix global par minute.
06 Un protocole de comparaison utile
Face à GPT-Live-1, utilise la même conversation : demande simple, correction en cours de phrase, puis tâche nécessitant un outil. Relève les erreurs, les interruptions réussies, le délai et le coût total. Source IA ne revendique pas de mesure comparative indépendante des deux systèmes.
Pour traduire plutôt que conduire une conversation avec des outils, consulte aussi Gemini 3.5 Live Translate.
Sources officielles
- Fiche du modèle Live
- Fiche Extended Thinking
- Tarification Gemini API
- Raisonnement dans Live API
- Model card audio du 15 septembre
Consultées le 22 septembre 2026. Documentation éditeur, sans test indépendant revendiqué.
Choisir selon son usage
Comparer les capacités et les contraintes avant de s’abonner ou d’intégrer une API.