Friday, 7 August 2026 | Mise à jour quotidienne L'intelligence artificielle au service des constructeurs

Tarification de l’API Gemini (2026) : coût par million de jetons pour chaque modèle

Les tarifs de l’API Gemini commencent à 1,25 $ par million de jetons d’entrée sur Gemini 2.5 Pro et atteignent
2 $ sur Gemini 3.1 Pro, avec des tarifs de sortie compris entre 7,50 $ et 12 $.
Les tarifs affichés sont
compétitifs, mais la politique tarifaire de Gemini possède une caractéristique qu’aucun de ses concurrents ne partage à ce degré :
les prompts dépassant environ 200 000 jetons sont facturés à un tarif majoré sur plusieurs modèles. Pour une famille commercialisée sur sa capacité à gérer des contextes d’un million de jetons, c’est ce seuil de 200 000 jetons qui détermine votre facture réelle.
Prix de l’API Gemini : tous les modèles, par million de jetons

Coût mensuel de Gemini

ModèleEntrée : $/1 millionSortie : $/1 millionCoût combiné par million de dollarsContexte
Gemini 3.6 Flash$1.50$7.50$2.701 million
Gemini 2.5 Pro$1.25$10.00$3.001 million (1 048 576 jetons)
Gemini 3.5 Flash$1.50$9.00$3.001 million
Gemini 3.1 Pro$2.00$12.00$4.001,05 million

Le tarif combiné correspond au taux effectif pour un ratio entrée/sortie de 4:1, qui reflète ce qu’une charge de travail typique de discussion ou de recherche produit réellement. C’est ce chiffre qu’il faut comparer entre fournisseurs — un prix affiché pour les entrées masque le coût réel des sorties.

Comparaison de Gemini avec d’autres fournisseurs

Charge de travailJetons/moisGemini 3.6 Flash
le moins cher
Gemini 3.1 Pro
niveau le plus performant
Projet secondaire1 million en entrée / 0,25 million en sortie$3.38$5.00
Petite équipe20 millions en entrée / 5 millions en sortie$68$100
Production200 millions en entrée / 50 millions en sortie$675$1,000

Modélisez vos propres volumes sur la Calculateur de coûts des API IA.

Quel modèle Gemini choisir ?

Le modèle le moins cher proposé par chaque fournisseur, afin d’assurer une comparaison équitable sur le coût d’entrée.

FournisseurModèle le moins cherCoût combiné par million de dollars
Mistral AIMistral 7B$0.0220
MetaLlama 3.1 8B$0.0220
AlibabaQwen3 8B$0.0600
Google cette pageGemma 3 4B$0.0600
MicrosoftPhi-4$0.0840
DeepSeekDeepSeek V4-Flash$0.168
Moonshot AIKimi K2.7 Code$0.980
AnthropicClaude Haiku 4.5$1.80
Zhipu AIGLM 5.2$2.00
xAIGrok 4$5.40
OpenAIGPT-5.6 Sol$10.00

Le modèle le moins cher ne signifie pas nécessairement le meilleur rapport qualité-prix — vérifiez les performances en complément du prix sur la Classement des grands modèles linguistiques (LLM), ou parcourez tous les modèles disponibles dans la Base de données des modèles d'IA.

Ce qui rend intéressante la gamme actuelle de Google, c’est que la gamme économique est souvent la meilleure.

surpasse Gemini 3.1 Pro sur les benchmarks de programmation et d’agents autonomes
tout en étant environ quatre fois plus rapide et environ 25 % moins cher, avec le même contexte de 1 million de jetons. Lorsqu’un modèle plus rapide et moins coûteux obtient également de meilleurs résultats, la version Pro cesse d’être le choix par défaut pour devenir une option spécialisée. Pour les assistants de programmation, les boucles d’agents ou toute application où l’utilisateur attend une réponse, Flash l’emporte sur tous les critères à la fois — une situation rare dans le choix des modèles, où vitesse, coût et qualité s’opposent habituellement.

Gemini 3.5 Flash , lancé le 21 juillet 2026, est le plus récent de la gamme. Son tarif d’entrée reste inchangé à 1,50 $, tandis que le tarif de sortie passe de 9 $ à 7,50 $ — une réduction de 17 % sur la partie de la facture qui domine généralement. Pour les charges de travail axées sur la génération, il s’agit d’une économie directe sans compromis sur les capacités, ce qui en fait le choix par défaut au sein de la gamme Flash pour les nouveaux projets. Sur les charges de travail axées sur les prompts (recherche), les deux modèles sont interchangeables sur le plan des coûts, puisque leurs tarifs d’entrée sont identiques. Pour répondre à une question fréquente : il n’existe pas encore de Gemini 4 en juillet 2026.
mérite d’être choisi pour sa profondeur multimodale plutôt que par défaut, étant donné que Flash le surpasse en programmation à un prix inférieur.
reste largement déployé et bien pris en charge. Il est passé en disponibilité générale le 17 juin 2025 et s’est distingué comme leader sur les benchmarks de programmation, de mathématiques et de raisonnement sur contextes longs, avec un contexte natif de 1 048 576 jetons et une prise en charge complète des entrées multimodales — texte, images, audio, vidéo et fichiers PDF. Les modèles plus récents de la série 3.x le remplacent, mais à 1,25 $ par million de jetons d’entrée, il demeure l’un des meilleurs rapports qualité-prix parmi les modèles avancés de raisonnement.
Le seuil de 200 000 jetons est celui autour duquel il faut concevoir son architecture
La facturation de Gemini pour les contextes longs est le point critique qui fait exploser les budgets. Gemini 3.1 Pro facture les prompts dépassant 200 000 jetons à un tarif d’entrée approximativement doublé. Gemini 2.5 Pro applique explicitement une tarification en tranches : 1,25 $ par million de jetons d’entrée jusqu’à 200 000 jetons, puis 2,50 $ au-delà, tandis que le tarif de sortie passe de 10 $ à 15 $.
La conséquence pratique est qu’une fonctionnalité dont le coût est fixé lors des tests peut coûter deux fois plus en production, car ce seuil est évalué à chaque requête et dépend entièrement de la quantité de texte collée par l’utilisateur. Prévoir un budget pour une fonctionnalité à base de contexte long en se fondant uniquement sur le tarif affiché sous-estimera fortement la facture dès que les vrais prompts commenceront à arriver.

Gemini 3.6 FlashDeux approches raisonnables s’offrent à vous. Concevoir votre système en contournant ce seuil grâce à une récupération (retrieval) et un réordonnancement (reranking) agressifs afin de maintenir les prompts en dessous de ce seuil — ce qui améliore généralement aussi la qualité des réponses, car l’attention portée à des contextes très longs n’est pas uniforme. Ou comparer avec un modèle facturé à un tarif unique sur toute la longueur de sa fenêtre contextuelle ;
Claude Opus
4.8 n’applique aucune majoration pour les contextes longs
, ce qui, pour une charge de travail véritablement axée sur la recherche, peut s’avérer moins coûteux malgré un prix catalogue plus élevé.
Les modèles ouverts de Google ont une tarification distincte
Gemma 3 est la famille de modèles open-weight de Google et n’apparaît pas dans ce tableau, car elle relève d’une proposition différente : modèles de 4 milliards, 12 milliards et 27 milliards de paramètres, sous licence ouverte, multimodaux (texte et images), contexte de 128 000 jetons, et suffisamment peu coûteux sur les API hébergées (0,05 $ à 0,16 $ par million de jetons) pour que la vraie question soit de savoir si vous préférez les exécuter vous-même. Gemma 3 27B nécessite environ 16 Go de VRAM en quantification 4 bits, ce qui permet de l’exécuter sur une seule carte grand public. Dimensionnez-le à l’aide du
, ou déterminez si l’auto-hébergement est plus avantageux que l’API à votre volume d’utilisation, à l’aide du

Gemini 3.1 Pro Combien coûte l’API Gemini ?
Les tarifs de l’API Gemini varient de 2,70 $ par million de jetons combinés (blended) sur Gemini 3.6 Flash à 4,00 $ sur Gemini 3.1 Pro. Le tarif combiné suppose un ratio entrée/sortie de 4:1. Les entrées et sorties sont facturées séparément, et les sorties sont toujours la composante la plus coûteuse.

Gemini 2.5 Pro reste largement déployé et bien pris en charge. Il est entré en disponibilité générale le 17 juin 2025 et s’est imposé comme leader de référence en codage, en mathématiques et en
raisonnement sur contextes longs, avec un contexte natif de 1 048 576 jetons et une prise en charge entièrement multimodale des entrées — texte,
images, audio, vidéo et fichiers PDF. Les modèles plus récents de la série 3.x le remplacent, mais à 1,25 $ l’entrée, il demeure
l’un des meilleurs rapports qualité-prix parmi les modèles de pointe en matière de raisonnement.
Le seuil de 200 000 jetons est le paramètre central à prendre en compte dans la planification.

La facturation de Gemini pour les contextes longs est ce qui fait exploser les budgets. Gemini 3.1 Pro facture les prompts dépassant

200 000 jetons à un tarif d’entrée approximativement doublé. Gemini 2.5 Pro adopte quant à lui une structure tarifaire explicite : 1,25 $ par million de jetons en entrée jusqu’à 200 000 jetons, puis 2,50 $ au-delà de ce seuil, tandis que le coût de sortie passe de 10 $ à 15 $.
La conséquence pratique est qu’une fonctionnalité dont le coût est fixé à un montant donné lors des tests peut coûter deux fois plus cher en production, car ce seuil est évalué à chaque requête et dépend entièrement de la quantité de contenu collé par l’utilisateur.
Prévoir un budget pour une fonctionnalité à contexte long uniquement sur la base du tarif affiché conduit à sous-estimer

son coût réel.
that in production, because the threshold is crossed per request and depends entirely on how
much a user pasted in. Budgeting a long-context feature on the headline figure will understate
la facture augmente sensiblement dès que des prompts réels commencent à arriver.

Il existe deux réponses raisonnables. Concevoir l’application en tenant compte de ce seuil, avec une récupération et
un réordonnancement agressifs afin de maintenir les prompts en dessous de celui-ci — ce qui améliore généralement de toute façon la qualité des réponses, car
l’attention portée à des contextes très longs n’est pas uniforme. Ou comparer le modèle à un autre qui applique un tarif forfaitaire
sur l’intégralité de sa fenêtre contextuelle ; Claude Opus
4.8 ne comporte aucune surcharge pour les contextes longs
, ce qui, dans le cas d’une charge de travail véritablement axée sur la récupération, peut
s’avérer moins coûteux malgré un prix catalogue plus élevé.

Les modèles ouverts de Google sont tarifés séparément

Gemma 3 est la famille de modèles open-weight de Google et n’apparaît pas dans ce tableau, car il s’agit d’une offre différente : des modèles de 4 milliards, 12 milliards et 27 milliards de paramètres sous licence ouverte, multimodaux (texte et images),
proposition : modèles de 4 milliards, 12 milliards et 27 milliards de paramètres sous une licence ouverte, multimodaux (texte et images),
un contexte de 128 K et suffisamment peu coûteux sur les API hébergées (0,05 à 0,16 $ par million de jetons) pour que la véritable question soit
de savoir si vous souhaitez les exécuter vous-même. Gemma 3 27B nécessite environ 16 Go de VRAM en quantification 4 bits, ce qui permet de l’exécuter sur
une seule carte grand public. Évaluez sa taille dans le cadre de
Calculateur de VRAM, ou déterminez si
l’auto-hébergement est plus avantageux que l’API, selon votre volume d’utilisation, à l’aide du
Hébergement local vs API
calculateur
.

Questions fréquemment posées

Combien coûte l’API Gemini ?

Les tarifs de l’API Gemini vont de 2,70 $ par million de jetons combinés pour Gemini 3.6 Flash à 4,00 $ pour Gemini 3.1 Pro. Le tarif « combiné » suppose un rapport entrée/sortie de 4:1. Les entrées et les sorties sont facturées séparément, la sortie étant toujours la plus coûteuse.

Quel est le modèle Gemini le moins cher ?

Gemini 3.6 Flash, à 1,50 $ par million de jetons d’entrée et 7,50 $ par million de jetons de sortie. Pour une charge de travail mensuelle de petite équipe de 20 millions de jetons d’entrée et 5 millions de jetons de sortie, le coût s’élève à environ 68 $.

Quel est le coût mensuel de Gemini ?

Pour une utilisation mensuelle de 20 millions de jetons d’entrée et 5 millions de jetons de sortie, Gemini 3.6 Flash coûte environ 68 $, contre environ 100 $ pour Gemini 3.1 Pro. Un projet secondaire utilisant 1 million de jetons d’entrée et 0,25 million de jetons de sortie coûte une fraction de ce montant. Utilisez la calculatrice de coûts de l’API IA pour estimer vos propres volumes.

Gemini est-il moins cher que Mistral AI ?

Au niveau des tarifs d’entrée, Gemini débute à 2,70 $ par million de jetons combinés (entrée + sortie), tandis que Mistral AI débute à 0,0220 $ pour Mistral 7B. Mistral AI constitue donc le point d’entrée le moins coûteux, bien que les capacités diffèrent — comparez les deux modèles sur le classement avant de changer.

Pourquoi Gemini facture-t-il davantage les jetons de sortie que les jetons d’entrée ?

Les jetons de sortie sont générés un par un et ne peuvent pas être traités par lots comme un prompt, ce qui augmente leur coût de traitement. C’est pourquoi les charges de travail axées sur les prompts — telles que la recherche ou la classification — sont nettement moins coûteuses à exécuter que celles axées sur la génération, et pourquoi le tarif combiné revêt plus d’importance que le prix affiché pour les entrées.

Les prix indiqués correspondent aux tarifs publics officiels pour l’API principale de chaque modèle, mis à jour régulièrement à mesure que les fournisseurs les modifient. Les remises liées aux volumes, au traitement par lots ou au cache des entrées ne sont pas incluses. Dernière mise à jour en août 2026.

Défiler vers le haut
Featured on There's An AI For That