Combien coûteront réellement par mois les API d’OpenAI, d’Anthropic ou de DeepSeek ? Google Saisissez votre volume d’utilisation et comparez tous les modèles côte à côte — les prix sont récupérés en temps réel depuis notre Base de données des modèles IA.
| Modèle | Développeur | $/1 M d’entrées | $/1 M de sorties | Coût estimé mensuel |
|---|
Estimation = (millions d’entrées × prix par million d’entrées) + (millions de sorties × prix par million de sorties). Les factures réelles peuvent varier en raison de la mise en cache, des remises accordées pour traitement par lots et des frais supplémentaires liés aux contextes longs. Les modèles open-weight que vous hébergez vous-même ne figurent pas dans cette liste (leur coût correspond à celui de votre matériel et de votre consommation électrique, et non à un coût par jeton).
Le modèle le moins cher n’est pas toujours le mieux adapté — consultez la fiche technique de chaque modèle pour connaître sa fenêtre de contexte, ses performances sur les benchmarks et ses fonctionnalités avant de changer. N’oubliez pas que les modèles open-weight que vous hébergez vous-même ne génèrent aucun coût par jeton.
Combien coûte une API de modèle linguistique volumineux (LLM), et comment en calcule-t-on le prix ?
Les tarifs des API d’IA sont facturés à la pièce (« token »), séparément pour les tokens d’entrée (votre demande, ainsi que tout contexte que vous fournissez) et les tokens de sortie (la réponse du modèle), et affichés par million de tokens. Pour estimer une facture, multipliez le nombre de tokens d’entrée par le prix unitaire correspondant, ajoutez-y le nombre de tokens de sortie multiplié par leur prix unitaire, puis appliquez ce calcul au volume mensuel de requêtes. En 2026, les prix d’entrée s’échelonnent approximativement entre 0,10 $ et 5 $ par million de tokens, tandis que les prix de sortie vont de 0,30 $ à 30 $ par million ; les tokens de sortie coûtent presque toujours plus cher que les tokens d’entrée — généralement 2 à 5 fois plus (un ratio médian d’environ 4×).
- La formule : coût mensuel ≈ (requêtes/mois × tokens d’entrée moyens × prix d’entrée ÷ 1 000 000) + (requêtes/mois × tokens de sortie moyens × prix de sortie ÷ 1 000 000).
- Règle « token/mot » : environ 1,3 token par mot anglais, donc 1 000 tokens correspondent à environ 750 mots, et 1 million de tokens à environ 750 000 mots.
- Écart tarifaire : les modèles économiques ou « légers » (« budget » / « lite ») se situent autour de 0,10 $ à 0,15 $ par million de tokens d’entrée ; les modèles phares de pointe atteignent environ 5 $ pour l’entrée et 25 $ à 30 $ pour la sortie.
- Les modèles open-weight auto-hébergés ne comportent aucun frais par token — vous payez uniquement le GPU, l’électricité et l’hébergement.
Questions fréquemment posées
Comment calculer le coût mensuel d’une API d’IA ?
Prenez vos tokens d’entrée et de sortie moyens par requête, multipliez chacun par le prix par million de tokens propre au modèle concerné (le prix d’entrée et le prix de sortie sont distincts), additionnez ces deux montants pour obtenir un coût par requête, puis multipliez le résultat par votre volume mensuel de requêtes. Par exemple, pour 100 000 requêtes mensuelles avec 1 000 tokens d’entrée et 500 tokens de sortie chacune, cela représente 100 millions de tokens d’entrée et 50 millions de tokens de sortie ; à 1 $/million pour l’entrée et 4 $/million pour la sortie, le coût mensuel s’élève à 100 $ + 200 $ = 300 $.
Pourquoi les tokens de sortie coûtent-ils plus cher que les tokens d’entrée ?
Les tokens d’entrée sont traités en une seule passe parallèle, tandis que chaque token de sortie nécessite sa propre passe complète vers l’avant (« forward pass ») à travers le modèle : générer du texte exige donc bien davantage de puissance de calcul que simplement lire une entrée. C’est pourquoi les tokens de sortie sont généralement facturés 2 à 5 fois plus cher que les tokens d’entrée, avec un ratio typique d’environ 4×. Lorsque vous estimez une facture, tenez compte de ce surcoût pour les tokens de sortie plutôt que de supposer qu’entrée et sortie ont le même coût.
Que signifie concrètement « coût par million de tokens » ?
Les fournisseurs indiquent leurs tarifs par million de tokens plutôt que par requête, car le nombre de tokens varie fortement d’un appel à l’autre. Un token équivaut approximativement à trois quarts d’un mot anglais, donc un million de tokens correspond à environ 750 000 mots — la longueur d’un livre volumineux. Pour obtenir votre coût réel, divisez le prix affiché par million par 1 000 000, puis multipliez le résultat par le nombre exact de tokens envoyés et reçus.
Quelle est l’API LLM la moins chère en 2026 ?
Les options les moins coûteuses sont les API « flash », « lite » et celles basées sur des modèles open source, dont les tarifs se situent aux alentours de 0,10 $ à 0,15 $ par million de tokens d’entrée et de 0,30 $ à 0,60 $ par million de tokens de sortie — souvent 30 à 50 fois moins chères que les modèles phares de pointe, qui avoisinent 5 $ pour l’entrée et 25 $ à 30 $ pour la sortie. La meilleure valeur se trouve généralement dans le modèle le moins coûteux qui satisfait encore vos exigences de qualité : choisissez donc le modèle adapté à la tâche, plutôt que de systématiquement opter pour le plus onéreux. Comme les tarifs évoluent fréquemment (généralement chaque trimestre), consultez les chiffres actualisés dans la calculatrice ci-dessus avant de vous engager sur un volume important.
Les modèles open source ou open-weight comportent-ils un coût par token via une API ?
Non — si vous auto-hébergez un modèle open-weight (tel que Llama, Qwen, DeepSeek ou des variantes de Mistral), il n’y a aucun frais par token via une API ; vous ne payez que le GPU ou le serveur, l’électricité et la maintenance. Cela inverse complètement la logique économique : l’auto-hébergement implique un coût fixe horaire, indépendant de l’utilisation, et n’est donc rentable que pour des volumes élevés et réguliers. À faible volume ou en cas d’utilisation sporadique ou en rafale, une API hébergée est presque toujours moins chère, puisque vous ne payez que pour les tokens effectivement consommés.
De combien de VRAM ai-je besoin pour auto-héberger un modèle au lieu de payer par token ?
À une quantification 4 bits, un modèle nécessite environ 0,5 à 0,6 Go de VRAM par milliard de paramètres, plus une marge supplémentaire pour le cache KV, dont la taille augmente avec la longueur du contexte. Ainsi, un modèle de 8 milliards de paramètres nécessite environ 5 à 6 Go (et tient donc sur un GPU grand public), tandis qu’un modèle de 70 milliards de paramètres requiert environ 40 à 48 Go (une carte de centre de données ou deux cartes de 24 Go chacune) ; prévoir une marge de sécurité de 15 à 20 % pour le cache KV et les surcoûts liés aux opérations est une bonne règle empirique. Des fenêtres de contexte plus longues et des tailles de lot plus importantes augmentent la demande en cache KV : dimensionnez donc votre configuration selon vos longueurs réelles de prompts, et non seulement selon la taille des poids.
Comment réduire ma facture liée à une API d’IA ?
Les leviers les plus efficaces consistent à envoyer moins de tokens et à choisir un niveau de modèle moins coûteux pour les tâches simples. La mise en cache des prompts peut réduire jusqu’à ~90 % le coût des prompts système ou des blocs de contexte répétés, tandis que les points de terminaison groupés (« batch ») ou asynchrones offrent couramment une réduction d’environ 50 % pour les travaux non urgents. Réduire la longueur du contexte fourni, limiter la longueur maximale de sortie, et router les requêtes simples vers un modèle léger tout en réservant les modèles phares aux tâches complexes permet généralement de réduire la facture d’un multiple important.
Plus d’outils gratuits de Convly
Coût combiné (« blended ») d’une API par million de tokens — le vrai coût des modèles d’IA
$0.02
$0.02
$0.03
$0.06
$0.07
$0.07
$0.09
$0.10
$0.13
$0.15
$6.00
$10.00
$10.00
$11.25
$11.25
$20.00
Blended cost = (3 × input + output) ÷ 4 · 10 cheapest + 6 priciest of 36 tracked, log scale · full spread 909× · Green = best value, orange = highest. Updated Sep 07, 2026.
🔍 Intégrez ce graphique sur votre site (gratuit, avec mention de la source)
Obtenez les chiffres avant tout le monde
Un e-mail par semaine : quels modèles d’IA ont changé de prix, ce que les nouveaux benchmarks mesurent réellement, et quel GPU vaut vraiment l’achat. Aucun buzz, aucun remplissage.
Gratuit. Désabonnez-vous en un clic. Nous ne vendons ni ne partageons jamais votre adresse.
