Le coût réel de Gemini 3.8 Flash dépend de la quantité de tokens utilisée par la tâche. Jusqu’au 31 décembre 2026, le tarif Standard est de 0,75 USD par million de tokens en entrée et 3,75 USD en sortie. La sortie inclut les tokens de thinking. La lecture du cache coûte 0,075 USD et le stockage 0,50 USD par million de tokens-heure. Google affiche le double de ces tarifs Standard à partir du 1er janvier 2027.
La formule est : (entrée non mise en cache×tarif + lecture du cache×tarif + sortie avec thinking×tarif)/1 000 000 + stockage. Ne mélangez pas abonnement et facture API.

À retenir
Le thinking est compté une seule fois dans la sortie.
Batch et Flex sont des modes séparés et leurs remises ne se cumulent pas.
Le budget mensuel inclut tâches, relances, outils et durée de stockage.
Vérifiez la page officielle des prix et la fiche du modèle.
Grille des tarifs
| Élément | Jusqu’au 31-12-2026 | Dès le 01-01-2027 | Unité |
|---|---|---|---|
| Entrée Standard | $0.75 | $1.50 | 1M tokens |
| Sortie Standard, thinking inclus | $3.75 | $7.50 | 1M tokens |
| Lecture du cache | $0.075 | $0.15 | 1M tokens |
| Stockage du cache | $0.50 | $1.00 | 1M tokens-heure |
| Entrée Batch | $0.375 | $0.75 | 1M tokens |
| Sortie Batch | $1.875 | $3.75 | 1M tokens |
| Lecture Batch | $0.0375 | $0.075 | 1M tokens |
Google sépare Standard, Batch, Flex et Priority. La compatibilité du modèle avec un mode ne transforme pas une requête Standard en requête remisée.
Deux calculs
Avec 200 000 tokens d’entrée non cachés et 20 000 tokens de sortie, thinking inclus :
(0,2×$0,75) + (0,02×$3,75) = $0,225100 tâches coûtent $22,50. Avec un facteur de relance de 1,2, prévoyez $22,50×1,2=$27,00, hors outils. En 2027, la même tâche coûte $0,45.
Pour un document de 900 000 tokens gardé 10 heures, avec 900 000 tokens lus en cache, 100 000 non cachés et 30 000 en sortie :
tokens = (0,1×$0,75)+(0,9×$0,075)+(0,03×$3,75) = $0,255
stockage = 0,9×10×$0,50 = $4,5020 tâches sur cette période coûtent $4,50+(20×$0,255)=$9,60. Lecture et stockage sont deux frais différents.
Batch, Flex, outils et relances
Batch convient aux travaux qui peuvent attendre. Flex est un autre mode d’inférence ; utilisez sa ligne actuelle sur la page officielle. Search grounding, Maps, URL context, Code execution et File Search ont leurs propres règles. Consultez la tarification des outils. Le budget mensuel suit tâches réussies×coût des tokens par tentative×tentatives par réussite + outils + stockage.
La limite Tabbit
Tabbit Browser peut aider à organiser des pages de recherche : voir AI browser, navigateur agentique, automatisation et ressource modèle (English). Le client de test affichait Gemini-3.8-Flash dans le sélecteur, mais une nouvelle tâche a échoué au chargement et aucune inférence n’a abouti. Cela ne prouve ni l’accès en production ni le prix Tabbit.
Lisez aussi la vue d’ensemble, la revue et les alternatives, ainsi que la comparaison des navigateurs IA, en séparant API, abonnement et produit.
Comparaison de charges
| Charge | Estimation 2026 (USD) | Hors calcul |
|---|---|---|
| 100 tâches sans cache, 1,2 tentative par réussite | 27.00 | Outils et création du cache si applicable |
| 20 tâches avec cache sur 10 heures, sans relance | 9.60 | Outils et création du cache si applicable |
Ce que montrent les créateurs
NERD UP aborde la consommation de tokens et les coûts cachés ; Bijan Bowen présente des tâches de code et de navigateur. Nous citons uniquement les titres et chapitres visibles, pas des factures ni des tests comparables. Le budget doit compter les relances et toute la sortie.
C_tokens = (I_uncached × P_input + I_cached × P_cached + O_total × P_output) / 1,000,000
C_total = sum(C_tokens for ALL attempts) + C_storage + C_tools
C_success = C_total / N_success [N_success > 0]Comptez toutes les tentatives facturées, y compris les échecs ; ajoutez une seule fois le stockage partagé et les outils. Sans réussite, le coût par réussite est indéfini.
Le débat communautaire sur le coût par tâche
Dans une discussion Hacker News du même jour, gundmc défend le coût par tâche, tandis que bermudi et criley2 soulignent que les tokens de sortie et le niveau d’effort peuvent changer le classement. Ce sont des lectures de liens Artificial Analysis, pas un classement reproduit ici.
Commentaires originaux : gundmc (2 sept.), bermudi (2 sept.), criley2 (2 sept.) et criley2 (3 sept.).




En pratique, notez l’effort et la sortie totale avant d’appliquer le tarif officiel.
Échelle de la famille, effort et limites de facturation
Dans la grille Standard 2026, Gemini 3.8 Flash, 3.7 Flash et 3.6 Flash affichent $0,75 en entrée, $3,75 en sortie et $0,075 pour la lecture du cache par million de tokens. Un tarif identique ne prouve ni une qualité, ni une latence, ni une disponibilité identiques. Le coût dépend surtout du taux de cache, de la sortie totale (thinking compris), du nombre de tours et des relances. Baisser l’effort ne réduit la facture que si la sortie diminue sans dégrader le résultat.
Le thinking est inclus dans la sortie et la lecture du cache est distincte de son stockage. Batch et Flex sont deux modes séparés : leurs tarifs de tokens 2026 ne se cumulent pas. Search, Maps, URL context et File Search ont leurs propres règles. Une requête échouée peut tout de même consommer des tokens.
Deux charges de travail, avec leurs hypothèses
Tarifs Standard 2026. La sortie inclut la réflexion une seule fois ; stockage, outils, nouvelles tentatives et taxes sont exclus. Avec les tarifs Standard 2027 annoncés, les totaux mensuels de tokens seraient de 30 et 36 dollars.
| Charge | Entrée par tâche | Part en cache | Sortie totale par tâche | Tâches par mois | Coût mensuel des tokens |
|---|---|---|---|---|---|
| Extraction courte | 10,000 | 0% | 2,000 | 1,000 | $15 |
| Analyse répétée de documents | 1,000,000 | 90% | 10,000 | 100 | $18 |
Calcul local
Estimez le coût mensuel des tokens
Tarifs API Standard jusqu’au 31-12-2026. Comptez la réflexion une seule fois dans la sortie. Les valeurs restent dans le navigateur.
Hors stockage, outils, nouvelles tentatives et taxes. Un tarif identique ne garantit pas le même volume. Vérifié le 20-09-2026. Vérifier les tarifs actuels
Le calcul reste dans le navigateur et compare trois modèles connus. Les tarifs inconnus ne deviennent pas zéro. Le stockage, les outils, les relances et les taxes sont exclus. Vérifiez la grille officielle avant de valider un budget.
Après le calcul, choisissez où exécuter le flux
Tabbit Browser peut servir à organiser les pages et le contexte. Consultez sa page du modèle Gemini 3.8 Flash (English). Dans Tabbit Browser Dev, avec un compte connecté au site de test, une extraction de registre de paiement a correctement renvoyé quatre champs : currency, paid_total, overdue_ids et unknown_status_ids. L’interface affichait Google Search, mais l’exécution d’une recherche n’a pas été vérifiée indépendamment ; coût, durée et stabilité n’ont pas été mesurés.

Sources
Consultez la tarification Gemini API et la documentation Gemini 3.8 Flash. Pour une tâche après le 1er janvier 2027, doublez les lignes Standard de tokens et de cache avant de remplacer les hypothèses par vos journaux.
Questions fréquentes
Quel est le prix de Gemini 3.8 Flash avant le 31 décembre 2026 ?
Le tarif Standard est de 0,75 USD par million de tokens en entrée et 3,75 USD en sortie, thinking inclus. La lecture du cache coûte 0,075 USD et son stockage 0,50 USD par million de tokens-heure.
Les tokens de thinking sont-ils facturés séparément ?
Non. Google les inclut dans le prix de sortie. Comptez-les une seule fois dans le total de sortie.
Que se passe-t-il en 2027 ?
À partir du 1er janvier 2027, les tarifs Standard passent à 1,50 USD en entrée, 7,50 USD en sortie, 0,15 USD pour la lecture du cache et 1,00 USD pour son stockage.
Peut-on cumuler Batch et Flex ?
Non. Ce sont deux modes distincts. Choisissez un mode et appliquez uniquement sa grille.
Un abonnement Gemini ou Tabbit paie-t-il l’API ?
Non. L’abonnement grand public, le compte Developer API et les conditions Tabbit sont séparés.
Comment prévoir les relances ?
Multipliez le coût d’une réussite par le nombre moyen d’essais, puis ajoutez les outils et le stockage. Un appel échoué peut aussi consommer des tokens facturables.