Les tarifs de l’API DeepSeek commencent à 0,14 $ par million de jetons d’entrée sur DeepSeek V4-Flash — soit environ
un soixantième du prix facturé par les modèles de pointe. Cet écart, et non le nombre de paramètres, explique pourquoi
DeepSeek est pertinent. Chaque modèle de la gamme est également publié sous une licence ouverte, ce qui signifie que le prix de l’API constitue une simple charge de commodité, et non la seule façon d’exécuter ces modèles.
Tarifs de l’API DeepSeek : tous les modèles, par million de jetons
Coût mensuel estimé de DeepSeek
| Modèle | Entrée : $/1 million | Sortie : $/1 million | Coût combiné par million de dollars | Contexte |
|---|---|---|---|---|
| DeepSeek V4-Flash poids ouverts | $0.140 | $0.280 | $0.168 | 1 million |
| DeepSeek V4-Pro poids ouverts | $0.435 | $0.870 | $0.522 | 1 million |
| DeepSeek R1 Distill Llama 70B poids ouverts | $0.800 | $0.800 | $0.800 | 128 K |
| DeepSeek R1 poids ouverts | $0.500 | $2.15 | $0.830 | 128 K |
Le tarif combiné correspond au taux effectif pour un ratio entrée/sortie de 4:1, qui reflète ce qu’une charge de travail typique de discussion ou de recherche produit réellement. C’est ce chiffre qu’il faut comparer entre fournisseurs — un prix affiché pour les entrées masque le coût réel des sorties.
Comparaison de DeepSeek avec d’autres fournisseurs
| Charge de travail | Jetons/mois | DeepSeek V4-Flash le moins cher | DeepSeek R1 niveau le plus performant |
|---|---|---|---|
| Projet secondaire | 1 million en entrée / 0,25 million en sortie | $0.21 | $1.04 |
| Petite équipe | 20 millions en entrée / 5 millions en sortie | $4.20 | $21 |
| Production | 200 millions en entrée / 50 millions en sortie | $42 | $208 |
Modélisez vos propres volumes sur la Calculateur de coûts des API IA.
Quel modèle DeepSeek choisir ?
Le modèle le moins cher proposé par chaque fournisseur, afin d’assurer une comparaison équitable sur le coût d’entrée.
| Fournisseur | Modèle le moins cher | Coût combiné par million de dollars |
|---|---|---|
| Mistral AI | Mistral 7B | $0.0220 |
| Meta | Llama 3.1 8B | $0.0220 |
| Alibaba | Qwen3 8B | $0.0600 |
| Gemma 3 4B | $0.0600 | |
| Microsoft | Phi-4 | $0.0840 |
| DeepSeek cette page | DeepSeek V4-Flash | $0.168 |
| Moonshot AI | Kimi K2.7 Code | $0.980 |
| Anthropic | Claude Haiku 4.5 | $1.80 |
| Zhipu AI | GLM 5.2 | $2.00 |
| xAI | Grok 4 | $5.40 |
| OpenAI | GPT-5.6 Sol | $10.00 |
Le modèle le moins cher ne signifie pas nécessairement le meilleur rapport qualité-prix — vérifiez les performances en complément du prix sur la Classement des grands modèles linguistiques (LLM), ou parcourez tous les modèles disponibles dans la Base de données des modèles d'IA.
est le modèle phare orienté volume : 284 milliards de paramètres au total, dont environ 13 milliards activés par jeton, une fenêtre contextuelle de 1 million de jetons et un tarif combiné d’environ 0,17 $ par million, contre 10 $ pour un modèle de pointe.
V4-Flash Pour la classification massive, le traitement de documents, la synthèse initiale, la génération de données synthétiques ou encore la couche de récupération (retrieval) d’un pipeline RAG, il est quasiment inégalé en termes de rapport capacité/prix. Une fenêtre contextuelle de 1 million de jetons à ce prix n’existe nulle part ailleurs.
est le modèle phare ouvert : un mélange d’experts (MoE) de 1,6 billion de paramètres, activant environ 49 milliards de paramètres par jeton, avec une fenêtre contextuelle de 1 million de jetons. À un tarif combiné d’environ 0,52 $, il coûte environ vingt fois moins cher qu’un modèle de pointe tout en restant compétitif sur les tâches de raisonnement général.
R1
est le modèle ouvert de référence dédié au raisonnement : un mélange d’experts de 671 milliards de paramètres, dont environ 37 milliards sont activés par jeton, offrant un raisonnement chaîné (chain-of-thought) à une fraction du coût des solutions propriétaires. Sa fenêtre contextuelle de 128 K jetons est toutefois plus étroite que les 1 M jetons proposés par la série V4.
R1 Distill Llama 70B
V4-Pro existe pour une seule raison : le matériel. Le modèle R1 complet nécessite environ 400 Go de VRAM en quantification 4 bits ; la version distillée n’en requiert que 40 Go, ce qui permet de passer d’une solution « louer un serveur » à « acheter une station de travail ». Elle facture également 0,80 $ à la fois pour les jetons d’entrée et ceux de sortie, ce qui signifie que les charges de travail axées sur la génération ne coûtent pas plus cher que celles axées sur les prompts — une simplicité budgétaire inhabituelle.
Le coût de basculement est inférieur à ce que l’on pourrait imaginer
Le détail qui fait de DeepSeek une option réellement viable, plutôt qu’une simple curiosité, est que l’API V4-Pro accepte à la fois les formats de requêtes OpenAI et Anthropic. La migration se limite généralement à modifier l’URL de base et la clé d’API, sans nécessiter de réécriture complète. La friction d’intégration qui protège habituellement les fournisseurs établis disparaît donc largement, ce qui rend une différence de coût de 20× concrètement exploitable, et non purement théorique.
Le schéma le plus rationnel n’est pas une migration complète, mais un routage intelligent : diriger le gros volume de trafic à faible enjeu vers V4-Flash, tout en conservant un modèle de pointe uniquement pour les requêtes qui en ont réellement besoin. La plupart des applications constatent que la répartition penche fortement en faveur de la solution économique. Les poids ouverts modifient-ils les calculs ?
Tous les modèles DeepSeek présentés ici sont téléchargeables librement, ce qui soulève une question évidente. Pour la plupart des équipes, la réponse honnête est que la licence achète surtout l’auditabilité et la portabilité entre fournisseurs, plutôt qu’un déploiement réaliste en infrastructure locale.
Les exigences matérielles en sont la raison principale. V4-Pro nécessite environ 800 Go de VRAM en quantification 4 bits — une configuration typique de centre de données impliquant huit GPU H100 de 80 Go ou plus. R1 en demande environ 400 Go. V4-Flash en nécessite environ 140 Go, soit deux H100 de 80 Go. Seule la version distillée de R1, avec ses 40 Go requis, s’inscrit dans la fourchette matérielle qu’une petite équipe pourrait réellement acquérir.
Face à des tarifs API aussi bas, l’auto-hébergement doit franchir une barre élevée : il n’est rentable que si votre volume est suffisamment élevé pour maintenir ce matériel continuellement sollicité, et le seuil de rentabilité évolue à chaque baisse de prix annoncée par DeepSeek. Calculez-le vous-même en fonction de votre volume mensuel de jetons avant de vous engager dans un investissement matériel. Ce que les poids ouverts garantissent, en revanche, c’est que vous ne serez jamais verrouillé, victime de hausses abusives ou abandonné suite à une désuétude technique — une garantie qui a une valeur intrinsèque, même si vous ne les téléchargez jamais. Combien coûte l’API DeepSeek ?
Les tarifs de l’API DeepSeek vont de 0,168 $ par million de jetons combinés sur DeepSeek V4-Flash à 0,830 $ sur DeepSeek R1. Le tarif combiné suppose un ratio entrée/sortie de 4:1. Les jetons d’entrée et de sortie sont facturés séparément, la sortie étant toujours la composante la plus coûteuse.
Quel est le modèle DeepSeek le moins cher ?
DeepSeek V4-Flash, à 0,140 $ par million de jetons d’entrée et 0,280 $ par million de jetons de sortie. Pour une petite équipe générant 20 millions de jetons d’entrée et 5 millions de jetons de sortie par mois, le coût s’élève à environ 4,20 $.
Combien coûte DeepSeek par mois ?
Pour 20 millions de jetons d’entrée et 5 millions de jetons de sortie par mois, DeepSeek V4-Flash coûte environ 4,20 $, tandis que DeepSeek R1 coûte environ 21 $. Un projet secondaire de 1 million / 0,25 million coûte une fraction de ce montant. Utilisez notre calculateur de coûts pour les API IA afin d’estimer vos propres besoins.
DeepSeek est-il moins cher que Mistral AI ?
Au niveau des tarifs d’entrée, DeepSeek commence à 0,168 $ par million de jetons combinés, tandis que Mistral AI commence à 0,0220 $ sur Mistral 7B. Mistral AI constitue donc le point d’entrée le moins coûteux, bien que les capacités diffèrent — comparez les deux modèles sur le classement avant de basculer.
Pourquoi DeepSeek facture-t-il davantage les jetons de sortie que les jetons d’entrée ?
théorique.
Le schéma pertinent n’est pas une migration complète, mais un routage : envoyer le volume élevé et la majorité des requêtes à faible enjeu vers V4-Flash, tout en conservant un modèle de pointe pour les requêtes qui en ont réellement besoin.
La plupart des applications constatent que la répartition penche fortement en faveur de la solution économique.
La plupart des applications constatent que la répartition penche fortement en faveur de la solution économique.
La plupart des applications constatent que la répartition penche fortement en faveur de la solution économique.
La disponibilité des poids ouverts modifie-t-elle les calculs ?
Chaque modèle DeepSeek présenté ici est téléchargeable librement, ce qui soulève une question évidente.
Pour la plupart des équipes, la réponse honnête est que la licence garantit surtout l’auditabilité et la portabilité entre fournisseurs, plutôt qu’un déploiement réaliste sur site.
La raison en est liée aux exigences matérielles : V4-Pro nécessite environ 800 Go de VRAM en quantification 4 bits — une opération de centre de données impliquant huit GPU H100 de 80 Go ou plus. R1 nécessite environ 400 Go. V4-Flash nécessite environ 140 Go, soit deux GPU H100 de 80 Go. Seule la version distillée de R1, avec ses 40 Go, convient au matériel dont disposerait une petite équipe.
Les exigences matérielles en sont la raison. V4-Pro nécessite environ 800 Go de VRAM en quantification 4 bits — une
opération destinée aux centres de données, impliquant huit GPU H100 de 80 Go ou plus. R1 nécessite environ 400 Go. V4-Flash nécessite environ
140 Go, soit deux GPU H100 de 80 Go. Seule la version distillée de R1, avec 40 Go, s’adapte au matériel dont disposerait une petite équipe.
réellement acheter.
Comparé à des tarifs d’API aussi bas, l’auto-hébergement doit franchir une barre élevée : il n’est rentable que lorsque
votre volume est suffisamment élevé pour maintenir ce matériel continuellement occupé, et le seuil de rentabilité
change à chaque réduction des prix par DeepSeek. Calculez-le vous-même en fonction de votre volume mensuel de jetons, dans la
calculateur auto-hébergement vs API
avant de vous engager sur du matériel. Ce que les poids ouverts garantissent, en revanche, c’est que vous ne serez jamais
verrouillé, victime de prix abusifs ou laissé à l’abandon suite à une dépréciation — ce qui a une valeur intrinsèque, même si vous
ne les téléchargez jamais.
Questions fréquemment posées
Combien coûte l’API DeepSeek ?
Les tarifs de l’API DeepSeek vont de 0,168 $ par million de jetons combinés (« blended ») pour DeepSeek V4-Flash à 0,830 $ pour DeepSeek R1. Le calcul « blended » suppose un ratio entrée/sortie de 4:1. Les jetons d’entrée et de sortie sont facturés séparément, la sortie étant toujours plus coûteuse.
Quel est le modèle DeepSeek le moins cher ?
DeepSeek V4-Flash, à 0,140 $ par million de jetons d’entrée et 0,280 $ par million de jetons de sortie. Pour une petite équipe générant mensuellement 20 millions de jetons d’entrée et 5 millions de jetons de sortie, le coût s’élève à environ 4,20 $.
Quel est le coût mensuel de DeepSeek ?
Pour 20 millions de jetons d'entrée et 5 millions de jetons de sortie par mois, DeepSeek V4-Flash coûte environ 4,20 $ et DeepSeek R1 environ 21 $. Un projet secondaire de 1 million de jetons d'entrée et 0,25 million de jetons de sortie coûte une fraction minime de ce montant. Utilisez la calculatrice de coûts de l'API IA pour estimer vos propres volumes.
DeepSeek est-il moins cher que Mistral AI ?
Au niveau des tarifs d'entrée, DeepSeek commence à 0,168 $ par million de jetons combinés (input/output), tandis que Mistral AI commence à 0,0220 $ par million de jetons pour le modèle Mistral 7B. Mistral AI constitue donc le point d'entrée le moins coûteux, bien que les capacités diffèrent — comparez les deux modèles sur le classement avant de changer.
Pourquoi DeepSeek facture-t-il davantage les jetons de sortie que les jetons d'entrée ?
Les jetons de sortie sont générés un par un et ne peuvent pas être traités par lots comme un prompt, ce qui augmente leur coût de traitement. C’est pourquoi les charges de travail axées sur les prompts — telles que la recherche ou la classification — sont nettement moins coûteuses à exécuter que celles axées sur la génération, et pourquoi le tarif combiné revêt plus d’importance que le prix affiché pour les entrées.
Les prix indiqués correspondent aux tarifs publics officiels pour l’API principale de chaque modèle, mis à jour régulièrement à mesure que les fournisseurs les modifient. Les remises liées aux volumes, au traitement par lots ou au cache des entrées ne sont pas incluses. Dernière mise à jour en août 2026.

