Sunday, 13 September 2026 | Updating Daily AI insight, written for builders

Calcolatore dei costi delle API AI — Confronta i prezzi dei modelli linguistici di grandi dimensioni in base all'utilizzo mensile

Quanto costeranno effettivamente ogni mese le API di OpenAI, Anthropic o DeepSeek? Google Inserisci il tuo utilizzo e confronta tutti i modelli uno a uno — i prezzi vengono recuperati in tempo reale dalla nostra Database di modelli IA.

Suggerimento: una tipica interazione con un chatbot richiede circa 1.000 token in ingresso e 500 token in uscita. 50 milioni di token in ingresso e 10 milioni in uscita corrispondono approssimativamente a circa 50.000 interazioni di questo tipo al mese.
ModelloSviluppatore$/1 milione in ingresso$/1 milione in uscitaCosto mensile stimato

Stima = (milioni di token in ingresso × prezzo per token in ingresso) + (milioni di token in uscita × prezzo per token in uscita). Le fatture reali possono variare a causa della cache, degli sconti per elaborazione in batch e dei sovrapprezzi per contesti lunghi. I modelli open-weight che ospiti autonomamente non sono elencati qui (il loro costo è rappresentato dall'hardware e dall'elettricità impiegati, non da un costo per singolo token).

Il modello meno costoso non è sempre la scelta migliore: prima di effettuare il passaggio, consulta la pagina di ciascun modello per verificare la lunghezza massima del contesto, i benchmark e le funzionalità disponibili. Ricorda inoltre che i modelli open-weight che ospiti autonomamente non comportano alcun costo per token.

Quanto costa un'API di un modello linguistico di grandi dimensioni (LLM) e come si calcola?

I prezzi delle API per l'IA sono calcolati in base al numero di token, fatturati separatamente per l'input (il tuo prompt più qualsiasi contesto che invii) e per l'output (la risposta del modello), con prezzi indicati per milione di token. Per stimare il costo mensile moltiplichi il numero di token in input per il prezzo relativo all'input, aggiungi il prodotto tra il numero di token in output e il prezzo relativo all'output, quindi moltiplichi il risultato per il numero di richieste effettuate al mese. Nel 2026 i prezzi per l'input variano approssimativamente da 0,10 a 5 dollari per milione di token, mentre quelli per l'output vanno da circa 0,30 a 30 dollari per milione; l'output costa quasi sempre di più dell'input — tipicamente da 2 a 5 volte tanto (con una mediana di circa 4 volte).

  • La formula: costo mensile ≈ (richieste/mese × token input medi × prezzo input ÷ 1.000.000) + (richieste/mese × token output medi × prezzo output ÷ 1.000.000).
  • Regola token-parola: circa 1,3 token per parola inglese, quindi 1.000 token ≈ 750 parole e 1 milione di token ≈ 750.000 parole.
  • Differenziale di prezzo: I modelli economici o «lite» si collocano intorno a 0,10–0,15 dollari per milione di token in input; i modelli di punta avanzati raggiungono invece circa 5 dollari per l'input e 25–30 dollari per l'output.
  • I modelli open-weight auto-ospitati non prevedono alcuna tariffa per token — paghi invece per la GPU, l'energia elettrica e l'hosting.

Domande frequenti

Come calcolo il costo mensile di un'API per l'IA?

Prendi il numero medio di token in input e in output per richiesta, moltiplica ciascuno per il prezzo per milione di token del modello scelto (il prezzo per l'input e quello per l'output sono distinti), somma i due valori per ottenere il costo per richiesta, quindi moltiplica per il volume mensile di richieste. Ad esempio, 100.000 richieste al mese con 1.000 token in input e 500 in output equivalgono a 100 milioni di token in input e 50 milioni in output; con un prezzo di 1 dollaro per milione di token in input e 4 dollari per milione in output, il costo mensile sarà di 100 + 200 = 300 dollari.

Perché i token in output costano di più dei token in input?

I token in input vengono elaborati in un'unica passata parallela, mentre ogni token in output richiede una propria intera passata forward attraverso il modello: generare testo è quindi molto più dispendioso in termini di potenza computazionale rispetto alla semplice lettura. Questo spiega perché i token in output sono solitamente tariffati da 2 a 5 volte di più rispetto a quelli in input, con un rapporto tipico di circa 4:1. Quando stimi un costo, tieni conto di questo fattore e non assumere che input e output abbiano lo stesso costo.

Cosa significa esattamente «costo per 1 milione di token»?

I fornitori indicano i prezzi per milione di token anziché per richiesta perché il numero di token varia enormemente da una chiamata all'altra. Un token corrisponde approssimativamente ai tre quarti di una parola inglese, quindi un milione di token equivale a circa 750.000 parole — la lunghezza di un libro piuttosto corposo. Per calcolare il costo effettivo, dividi il prezzo indicato per milione per 1.000.000 e moltiplica il risultato per il numero esatto di token inviati e ricevuti.

Qual è l'API LLM più economica nel 2026?

Le opzioni meno costose sono le API «flash», «lite» e quelle basate su modelli open-source, con prezzi intorno a 0,10–0,15 dollari per milione di token in input e circa 0,30–0,60 dollari per milione di token in output — spesso da 30 a 50 volte più economiche rispetto ai modelli di punta avanzati, che costano circa 5 dollari per l'input e 25–30 dollari per l'output. Il miglior rapporto qualità-prezzo si ottiene di solito scegliendo il modello meno costoso che soddisfi comunque i tuoi requisiti di qualità: seleziona quindi il modello in base al compito specifico, evitando di ricorrere automaticamente a quello più costoso. Poiché i prezzi cambiano quasi ogni trimestre, prima di impegnarti su volumi significativi consulta i dati aggiornati nel calcolatore qui sopra.

I modelli open-source o open-weight prevedono un costo per token tramite API?

No — se auto-ospiti un modello open-weight (come Llama, Qwen, DeepSeek o varianti Mistral), non vi è alcun costo per token tramite API; paghi solo per la GPU o il server, per l'elettricità e per la manutenzione. Ciò ribalta completamente la logica economica: l'auto-hosting comporta un costo fisso orario indipendente dall'utilizzo, quindi risulta conveniente rispetto alle tariffe per token solo a volumi elevati e costanti. A volumi bassi o irregolari, un'API ospitata è quasi sempre più economica, poiché paghi esattamente per i token utilizzati.

Quanta VRAM mi serve per auto-ospitare un modello invece di pagare per token?

Con una quantizzazione a 4 bit, un modello richiede circa 0,5–0,6 GB di VRAM per ogni miliardo di parametri, più ulteriore spazio per la cache KV, che cresce con la lunghezza del contesto. Dunque un modello da 8B necessita di circa 5–6 GB ed è gestibile su una GPU consumer, mentre uno da 70B richiede circa 40–48 GB (una scheda per data center oppure due schede da 24 GB ciascuna); aggiungere un margine di sicurezza del 15–20% per la cache KV e gli overhead è una buona regola empirica. Finestre di contesto più lunghe e dimensioni maggiori dei batch aumentano il fabbisogno di memoria per la cache KV: progetta quindi la configurazione in base alle lunghezze reali dei tuoi prompt, non solo ai pesi del modello.

Come posso ridurre la mia bolletta per l'uso di un'API per l'IA?

I fattori più incisivi sono inviare meno token e scegliere un livello di modello meno costoso per i compiti più semplici. La cache dei prompt può ridurre fino al ~90% il costo dei prompt di sistema o del contesto ripetuti, mentre gli endpoint batch o asincroni offrono comunemente sconti del ~50% per lavori non urgenti. Ridurre la lunghezza del contesto, limitare la lunghezza massima dell'output e instradare le richieste semplici verso un modello «lite», riservando i modelli di punta solo ai compiti più complessi, permette di ridurre notevolmente la bolletta — spesso di un multiplo consistente.


Costo combinato per 1 milione di token delle API — quanto costano davvero i modelli di intelligenza artificiale

Mistral 7B

$0.02

Llama 3.1 8B

$0.02

Mistral NeMo 12B

$0.03

Gemma 3 4B

$0.06

Qwen3 8B

$0.07

Gemma 3 12B

$0.07

Phi-4

$0.09

Gemma 3 27B

$0.10

Qwen3 32B

$0.13

Llama 4 Scout

$0.15

Claude Sonnet 4.6

$6.00

Claude Opus 5

$10.00

Claude Opus 4.8

$10.00

GPT-5.6 Sol

$11.25

GPT-5.5

$11.25

Claude Fable 5

$20.00

Blended cost = (3 × input + output) ÷ 4 · 10 cheapest + 6 priciest of 36 tracked, log scale · full spread 909× · Green = best value, orange = highest. Updated Sep 07, 2026.

🔍 Incorpora questo grafico sul tuo sito (gratuito, con attribuzione)

Ottieni i dati prima di tutti gli altri

Una email a settimana: quali modelli AI hanno cambiato prezzo, cosa misurano realmente i nuovi benchmark e quale GPU vale la pena acquistare. Niente hype, niente riempitivi.

Gratuito. Annulla l’iscrizione in un clic. Non vendiamo né condividiamo mai il tuo indirizzo.

Scroll to Top