Source IA
Fiche modèle · Google

Gemini 3.8 Live

Gemini 3.8 Live sert à construire une conversation vocale réactive. Sa variante Extended Thinking ajoute du raisonnement en arrière-plan pour les demandes à plusieurs étapes.

La voix à partir du texte

Gemini 3.8 Flash TTS et Flash-Lite TTS sont dédiés à la synthèse vocale. Leur fiche distingue narration, production en volume et contraintes API, sans les confondre avec une conversation Live.

Actualisation ciblée du 30 septembre 2026. Source officielle · Source officielle

Vérifié le 22 septembre 20265 sources officiellesPublication : Soulinked Arts
Notre repère de choix
Commencer par Live pour une conversation rapide. Évaluer Extended Thinking lorsque le raisonnement et les outils apportent un gain mesurable, en contrôlant la latence et le coût de toute la session.

01 Deux variantes pour un agent vocal

Google documente deux modèles stables : gemini-3.8-live et gemini-3.8-live-extended-thinking. Cette fiche concerne Live API pour les développeurs ; elle ne promet pas le même choix de modèle dans l’application Gemini.

02 Voix, images et outils

Live accepte du texte, des images, de l’audio et de la vidéo. La réponse de session est audio ; une transcription permet d’en récupérer le texte. La fiche indique une limite d’entrée de 131 072 tokens et une sortie maximale de 65 536 tokens.

Les appels de fonctions et la recherche Google sont pris en charge. L’exécution de code intégrée, les sorties structurées et la génération d’images ne figurent pas parmi les capacités supportées de ces modèles.

03 Quand choisir Extended Thinking

Extended Thinking poursuit son raisonnement et ses appels d’outils asynchrones pendant une interaction vocale. Le réglage du raisonnement propose low, medium et high. Le client doit surveiller interaction_status : la fin d’un tour audio ne signifie pas nécessairement la fin du traitement.

Les appels bloquants ne sont pas acceptés par cette variante. Prévois une interface qui distingue la parole terminée du travail encore en cours, notamment avant une confirmation de réservation ou une action externe.

04 Migrer une application vocale

Avec Live standard, retire le paramètre thinking_level. L’audio proactif est permanent et l’ancien paramètre de dialogue affectif doit être retiré. Les mises à jour de contenu client sont permises pendant la session ; une interruption doit être traitée explicitement.

Teste le micro dans le bruit, les interruptions, les pertes de connexion et les résultats d’outils tardifs. Une conversation fluide ne suffit pas à garantir l’exactitude de la commande transmise.

05 Tarifs API

Tarifs relevés le 22 septembre 2026. La grille commune aux deux variantes affiche les montants suivants en dollars par million de tokens.

Entrée
Texte : 0,75 $. Audio : 3 $. Image ou vidéo : 1 $.
Sortie
Texte, raisonnement inclus : 4,50 $. Audio : 12 $.

Un palier gratuit est affiché, sans signifier un usage illimité. Les données du palier gratuit peuvent servir à améliorer les produits ; la grille distingue ce traitement du palier payant. La recherche Google peut ajouter une facturation propre. Ne compare pas un seul flux audio à un prix global par minute.

06 Un protocole de comparaison utile

Face à GPT-Live-1, utilise la même conversation : demande simple, correction en cours de phrase, puis tâche nécessitant un outil. Relève les erreurs, les interruptions réussies, le délai et le coût total. Source IA ne revendique pas de mesure comparative indépendante des deux systèmes.

Pour traduire plutôt que conduire une conversation avec des outils, consulte aussi Gemini 3.5 Live Translate.

Sources officielles

Consultées le 22 septembre 2026. Documentation éditeur, sans test indépendant revendiqué.

Choisir selon son usage

Comparer les capacités et les contraintes avant de s’abonner ou d’intégrer une API.