Friday, 7 August 2026 | Updating Daily AI insight, written for builders

Prezzi delle API DeepSeek (2026): costo per 1 milione di token per ogni modello

I prezzi dell’API DeepSeek partono da 0,14 USD per 1 milione di token in ingresso su DeepSeek V4-Flash — circa
un sessantesimo rispetto ai prezzi richiesti dai modelli di frontiera.
È questo divario, non il numero di parametri, a rendere DeepSeek rilevante. Ogni modello della linea è inoltre rilasciato con una licenza aperta, quindi il prezzo dell’API rappresenta un semplice costo di comodità, piuttosto che l’unico modo per eseguirli.
DeepSeek è rilevante. Ogni modello della serie è inoltre rilasciato sotto una licenza aperta, quindi l'API
ha un costo di comodità piuttosto che rappresentare l'unico modo per eseguirli.

Prezzi dell’API DeepSeek: ogni modello, per 1 milione di token

ModelloInput $/1 milioneOutput $/1 milioneCosto combinato ($/1 milione)Contesto
DeepSeek V4-Flash pesi aperti$0.140$0.280$0.1681 milione
DeepSeek V4-Pro pesi aperti$0.435$0.870$0.5221 milione
DeepSeek R1 Distill Llama 70B pesi aperti$0.800$0.800$0.800128K
DeepSeek R1 pesi aperti$0.500$2.15$0.830128K

Il costo combinato rappresenta il tasso effettivo per un rapporto ingresso-uscita di 4:1, che corrisponde alla tipica produzione di un carico di lavoro basato su chat o recupero informazioni. È questo il valore da confrontare tra i diversi fornitori: un prezzo indicativo per l’input nasconde infatti quanto costa l’output.

Quanto costa DeepSeek al mese

Carico di lavoroToken/meseDeepSeek V4-Flash
più economico
DeepSeek R1
livello più performante
Progetto secondario1 milione in ingresso / 0,25 milioni in uscita$0.21$1.04
Piccolo team20 milioni in ingresso / 5 milioni in uscita$4.20$21
Produzione200 milioni in ingresso / 50 milioni in uscita$42$208

Modella i tuoi volumi personalizzati nella Calcolatore dei costi delle API per l'IA.

Come si confronta DeepSeek con altri fornitori

Il modello più economico offerto da ciascun fornitore, in modo che il confronto sia omogeneo dal punto di vista del costo d’ingresso.

FornitoreModello più economicoCosto combinato ($/1 milione)
Mistral AIMistral 7B$0.0220
MetaLlama 3.1 8B$0.0220
AlibabaQwen3 8B$0.0600
GoogleGemma 3 4B$0.0600
MicrosoftPhi-4$0.0840
DeepSeek questa paginaDeepSeek V4-Flash$0.168
Moonshot AIKimi K2.7 Code$0.980
AnthropicClaude Haiku 4.5$1.80
Zhipu AIGLM 5.2$2.00
xAIGrok 4$5.40
OpenAIGPT-5.6 Sol$10.00

Il modello più economico non equivale necessariamente al miglior rapporto qualità-prezzo: verifica le capacità del modello insieme al prezzo sulla Classifica LLM, oppure esplora tutti i modelli disponibili nel Database di modelli di intelligenza artificiale.

Quale modello DeepSeek dovresti utilizzare?

V4-Flash è il modello ad alte prestazioni per carichi di lavoro intensivi: 284 miliardi di parametri totali, con circa 13 miliardi attivati per token, contesto da 1 milione di token e un costo medio di circa 0,17 USD per 1 milione di token, contro i 10 USD richiesti da un modello di frontiera.
Per classificazioni in bulk, elaborazione documentale, sintesi preliminare, generazione di dati sintetici e strato di retrieval in una pipeline RAG, offre quasi nessun rivale in termini di capacità per dollaro speso. Un contesto da 1 milione di token a tale prezzo non esiste altrove.
del modello è di 10 dollari. Per la classificazione su larga scala, l’elaborazione di documenti, la sintesi preliminare, la generazione di dati sintetici e il livello di recupero (retrieval) di una pipeline RAG, esso è quasi insuperabile in termini di capacità per dollaro speso. Un contesto da 1 milione di token a tale prezzo non esiste altrove.
generazione di dati e il livello di recupero in una pipeline RAG, è quasi insuperabile in termini di
capacità per dollaro. Un contesto da 1 milione a quel prezzo non esiste altrove.

V4-Pro è il modello aperto di punta: un misto di esperti (MoE) da 1,6 trilioni di parametri, con circa 49 miliardi di parametri attivati per token e contesto da 1 milione di token. Con un costo medio di circa 0,52 USD, opera a circa un ventesimo del prezzo dei modelli di frontiera mantenendo ottime prestazioni nel ragionamento generale.
attivando circa 49 miliardi di parametri per token, con un contesto da 1 milione di token. A un costo combinato di circa 0,52 dollari,
l’esecuzione costa circa un ventesimo rispetto ai prezzi dei modelli all’avanguardia, mantenendo comunque ottime prestazioni nel ragionamento generale.

R1 è il modello aperto di riferimento per il ragionamento, un misto di esperti (MoE) da 671 miliardi di parametri con 37 miliardi attivati, capace di ragionamento passo-passo (chain-of-thought) a una frazione del costo dei modelli proprietari. Il suo contesto da 128K token è più limitato rispetto ai 1 milione di token offerti dalla serie V4.
attivo, fornisce ragionamento passo-passo (chain-of-thought) a una frazione del costo dei modelli proprietari. Il suo contesto da 128K
è più ristretto rispetto ai 1 milione di token della linea V4.

R1 Distill Llama 70B esiste per un solo motivo: l’hardware. L’R1 completo richiede circa
400 GB di VRAM in precisione 4-bit; la versione distill ne necessita invece circa 40 GB, spostando l’uso da «noleggia un server» a «acquista una workstation». Inoltre, addebita 0,80 USD sia per l’input che per l’output, rendendo i costi di workload incentrati sulla generazione identici a quelli incentrati sui prompt — insolitamente semplice da pianificare.
«acquistare una workstation». Addebita inoltre 0,80 dollari sia per l’input che per l’output, quindi i carichi di lavoro incentrati sulla generazione non costano più di quelli incentrati sull’invio di prompt — insolitamente semplice da pianificare dal punto di vista dei costi.
i carichi di lavoro non costano più dei carichi basati su prompt — insolitamente semplici da pianificare nel budget.

Il costo di migrazione è inferiore a quanto si possa pensare

Il dettaglio che rende DeepSeek una scelta concreta, anziché una semplice curiosità, è che l’API V4-Pro
supporta entrambi i formati di richiesta OpenAI e Anthropic. La migrazione richiede solitamente solo la modifica dell’URL base e della chiave API, senza necessità di riscrivere il codice. L’attrito legato all’integrazione, che normalmente protegge i fornitori consolidati, scompare in gran parte, trasformando una differenza di costo pari a 20 volte da teorica in effettivamente applicabile.
piuttosto che una riscrittura. La resistenza all’integrazione che normalmente protegge i fornitori consolidati
fornitori scompare quasi del tutto, il che rende una differenza di costo pari a 20x concretamente applicabile anziché
puramente teorica.

Il criterio più sensato non è la migrazione completa, ma il routing intelligente: instradare la maggior parte del traffico — ad alto volume e basso impatto — verso V4-Flash, mantenendo un modello di frontiera solo per le richieste che ne hanno effettivamente bisogno. La maggior parte delle applicazioni scopre che la suddivisione è fortemente sbilanciata verso la soluzione economica.
bassa priorità alla maggior parte del traffico su V4-Flash e riservare un modello di ultima generazione solo per le richieste che
ne hanno effettivamente bisogno. La maggior parte delle applicazioni scopre che la suddivisione è fortemente sbilanciata verso la soluzione
più economica.

Le pesi aperti modificano i calcoli economici?

Tutti i modelli DeepSeek elencati qui sono scaricabili liberamente, il che pone una domanda ovvia. Per la maggior parte dei team, la risposta onesta è che la licenza garantisce soprattutto auditabilità e portabilità tra fornitori, piuttosto che una reale possibilità di deployment on-premises.
per la maggior parte dei team la risposta onesta è che la licenza garantisce auditabilità e portabilità tra fornitori
piuttosto che una reale distribuzione on-premises.

Il motivo risiede nei requisiti hardware. V4-Pro richiede circa 800 GB di VRAM in precisione 4-bit — un’operazione da data center che implica l’uso di otto GPU H100 da 80 GB o più. R1 ne richiede circa 400 GB. V4-Flash ne richiede circa 140 GB, ovvero due GPU H100 da 80 GB. Solo la versione distill di R1, con 40 GB, rientra nelle capacità hardware che un piccolo team potrebbe effettivamente acquistare.
esercizio data-center che richiede otto GPU H100 da 80 GB o più. R1 necessita di circa 400 GB. V4-Flash ne richiede circa
140 GB, ovvero due GPU H100 da 80 GB. Solo la versione distillata di R1, da 40 GB, si adatta all’hardware che un piccolo team potrebbe
effettivamente acquistare.

Confrontato con questi prezzi estremamente contenuti dell’API, l’auto-hosting deve superare una soglia molto alta: risulta conveniente solo quando il volume di utilizzo è sufficiente a tenere tale hardware costantemente occupato, e il punto di pareggio si sposta ogni volta che DeepSeek riduce i propri prezzi. Calcolalo in base al tuo volume specifico di token prima di impegnarti nell’acquisto di hardware. Ciò che i pesi aperti garantiscono, tuttavia, è che non potrai mai essere bloccato in un vendor lock-in, subire aumenti arbitrari dei prezzi o rimanere isolato a causa di un deprecazione — un vantaggio di per sé significativo, anche se non li scaricherai mai.
il vostro volume sia sufficientemente elevato da mantenere tale hardware costantemente occupato, e il punto di pareggio
cambia ogni volta che DeepSeek riduce i prezzi. Calcolatelo in base al vostro volume specifico di token nel
calcolatore self-hosting vs API
prima di impegnarsi sull’hardware. Ciò che i pesi aperti garantiscono è che non si potrà mai essere
bloccati, soggetti a prezzi eccessivi o abbandonati a causa di una deprecazione — un vantaggio concreto, anche se non li si dovesse mai scaricare.
mai scaricarli.

Domande frequenti

Quanto costa l’API DeepSeek?

I prezzi dell’API DeepSeek variano da 0,168 USD per 1 milione di token medi (blended) su DeepSeek V4-Flash fino a 0,830 USD su DeepSeek R1. Il costo medio (blended) presuppone un rapporto input/output di 4:1. Input e output sono fatturati separatamente, e l’output è sempre la componente più costosa.

Qual è il modello DeepSeek più economico?

DeepSeek V4-Flash, a 0,140 USD per 1 milione di token in input e 0,280 USD per 1 milione di token in output. Un carico di lavoro mensile di un piccolo team — 20 milioni di token in input e 5 milioni in output — costa circa 4,20 USD.

Quanto costa DeepSeek al mese?

Con 20 milioni di token in input e 5 milioni in output al mese, DeepSeek V4-Flash costa circa 4,20 USD e DeepSeek R1 circa 21 USD. Un progetto secondario con 1 milione di token in input e 0,25 milioni in output costa una frazione di tale importo. Usa la calcolatrice dei costi per API AI per valutare i tuoi volumi specifici.

DeepSeek è più economico di Mistral AI?

Sui prezzi d’ingresso, DeepSeek parte da 0,168 USD per 1 milione di token medi (blended), mentre Mistral AI parte da 0,0220 USD sul modello Mistral 7B. Mistral AI rappresenta quindi il punto di ingresso più economico, anche se le capacità differiscono — confronta entrambi sui leaderboard prima di effettuare il passaggio.

Perché DeepSeek addebita di più per i token in output rispetto a quelli in input?

I token in output vengono generati uno alla volta e non possono essere elaborati in batch come invece avviene per i prompt, pertanto il loro servizio ha un costo maggiore. Questo spiega perché i carichi di lavoro incentrati sui prompt — ad esempio il recupero di informazioni o la classificazione — sono molto meno costosi rispetto a quelli orientati alla generazione, e perché il costo combinato è più significativo del semplice prezzo indicativo per l’input.

I prezzi indicati corrispondono alle tariffe pubblicate ufficialmente per l’API principale di ciascun modello e vengono aggiornati periodicamente in base alle modifiche apportate dai fornitori. Sconti per volume, elaborazione in batch o input memorizzati nella cache non sono inclusi. Ultimo aggiornamento: agosto 2026.

Scroll to Top
Featured on There's An AI For That