Saturday, 26 September 2026 | Updating Daily AI insight, written for builders

Self-hosting vs API: Calcolatore del punto di pareggio dei costi per LLM

Convieni acquistare una GPU e auto-ospitare un LLM open source, oppure continuare a pagare per token utilizzati tramite un’API? Dipende dal volume. Inserisci il tuo utilizzo mensile e la tua configurazione hardware: questo calcolatore ti mostra il punto di pareggio, ovvero il momento in cui possedere la GPU diventa più economico rispetto alla bolletta dell’API.

Il tuo utilizzo

La tua configurazione per self-hosting

Costo API (per il tuo volume)—
Costo self-hosting (GPU ammortizzata)—
Costo self-hosting (elettricità)—
Costo totale self-hosting al mese—

Esecuzioni self-hosting modelli open-weight (pesi gratuiti), quindi questo confronta il costo per token dell’API con quello dell’acquisto dell’hardware. Si assume che la tua GPU sia in grado di gestire il carico richiesto (una singola GPU ha un limite massimo di token/sec) e non tiene conto del tempo necessario per configurazione e manutenzione. Verifica quali modelli una GPU può effettivamente eseguire nel nostro Calcolatore VRAM, e i prezzi attuali delle API nella calcolatore dei costi.

Ricorda: l'auto-hosting esegue modelli open-weight, quindi considera la differenza di qualità rispetto a un'API di ultima generazione — e utilizza il nostro Calcolatore VRAM per verificare che la tua GPU possa effettivamente eseguire il modello desiderato.

Risposta rapida: è più economico auto-ospitare un LLM o utilizzare un'API?

Dipende quasi interamente dal volume mensile sostenuto di token. Per la maggior parte degli utenti, un'API ospitata è più economica: al di sotto di circa 50 milioni di token al mese, il prezzo per token risulta inferiore al costo di acquisto e gestione di una GPU. L'auto-ospitazione diventa conveniente solo con volumi elevati e costanti — tipicamente decine o centinaia di milioni di token al mese, destinati ad agenti, processi batch o a un intero team — dove una GPU di proprietà, mantenuta costantemente occupata, ammortizza il suo costo iniziale rispetto a un'inferenza praticamente illimitata. Il punto di pareggio non è una linea fissa, ma un intervallo che varia in funzione delle dimensioni del modello, della fascia della GPU, del costo dell'elettricità e, soprattutto, del grado di utilizzo effettivo della scheda.

  • Basso volume (sotto ~50 milioni di token/mese): l'API vince quasi sempre.
  • Zona di scelta (~50–500 milioni di token/mese): una vera e propria moneta lanciata, ma l'auto-ospitazione vale la pena solo se si dispone di tempo ingegneristico dedicato per gestirla.
  • Alto volume sostenuto (agenti, batch o intero team, 500 milioni+ di token/mese): una GPU di proprietà ben utilizzata può ridurre i costi di inferenza fino a circa 5 volte.
  • Una GPU paga sé stessa solo se viene tenuta costantemente occupata — una scheda inattiva continua a comportare comunque l’intero costo in conto capitale e quello energetico.
  • Le API «flash» a budget o per modelli piccoli sono così economiche che l’auto-ospitazione raramente risulta giustificata, a qualsiasi volume.

Domande frequenti

Quando una GPU locale paga sé stessa?

Una GPU paga sé stessa nel momento in cui la spesa mensile sostenuta su un'API equivalente per un modello open source supera costantemente il costo totale di possesso. Una GPU consumer da circa 2.000–2.500 dollari, ammortizzata su tre anni, corrisponde a circa 55–70 dollari al mese, più 30–60 dollari per l’energia — quindi il costo totale mensile di possesso è all’incirca di 85–130 dollari. Se la spesa equivalente su API rimane al di sotto di questa cifra, l’API è più economica; una volta che supera significativamente tale soglia — nell’ordine di alcune centinaia di dollari al mese — la scheda recupera il suo costo iniziale di 2.000–2.500 dollari in circa un anno, generando risparmi successivi.

Di quanta VRAM ho bisogno per eseguire un LLM localmente?

Con una quantizzazione a 4 bit, calcola circa 0,5–0,6 GB di VRAM per ogni miliardo di parametri, più ulteriore spazio per la cache KV, che cresce con la lunghezza del contesto. In pratica, un modello da 7 miliardi di parametri richiede circa 8 GB, uno da 13 miliardi ne richiede 12–16 GB, mentre un modello da 70 miliardi di parametri a 4 bit necessita di circa 40–48 GB. Ciò significa che un modello da 7–13 miliardi di parametri può essere eseguito su una singola scheda da 8–16 GB, ma un modello da 70 miliardi a 4 bit è troppo grande per qualsiasi GPU consumer singola — nemmeno una scheda da 32 GB è sufficiente, quindi servono due schede da 24 GB, una scheda workstation da 48 GB oppure un modello più piccolo e quantizzato in modo più aggressivo.

Quali sono i costi nascosti dell’auto-ospitazione di un LLM?

Il prezzo della GPU rappresenta solo una parte del costo complessivo — una volta aggiunti elettricità, raffreddamento e, soprattutto, il tempo ingegneristico, l’auto-ospitazione costa tipicamente da 3 a 5 volte il costo base di noleggio della GPU. Prevedi 10–20 ore al mese per configurazione, monitoraggio e manutenzione; questo lavoro, insieme al costo di una scheda inattiva tra un processo e l’altro, è ciò che fa fallire la maggior parte delle stime naive sul punto di pareggio.

Le dimensioni del modello modificano il punto di pareggio?

Sì. Modelli più grandi richiedono GPU più potenti o più costose, aumentando il capex da ammortizzare, ma comportano anche i prezzi più alti per token su API, spostando verso il basso il punto di pareggio in termini di volume. Un modello piccolo da 7–13 miliardi di parametri è economico da auto-ospitare, ma lo è altrettanto tramite API, quindi quest’ultima soluzione vince quasi sempre; un modello open source da 70 miliardi di parametri o superiore è invece il caso in cui una GPU di proprietà ben utilizzata tende a offrire i risparmi maggiori.

L’elettricità rende troppo costosa l’auto-ospitazione?

Di solito no — l’energia è una voce secondaria rispetto al costo dell’hardware. Una singola GPU desktop alimentata al massimo assorbe circa 400–600 W, che, ai normali prezzi dell’elettricità, corrispondono a soli circa 30–60 dollari al mese se funziona ininterrottamente. Il costo dominante dell’auto-ospitazione è l’hardware iniziale e il tempo ingegneristico necessario per gestirlo, non l’elettricità.

Un piccolo team o una startup dovrebbe auto-ospitare o usare un’API?

Inizia con un’API. Fino a quando non hai un volume elevato e prevedibile e qualcuno incaricato di gestire l’infrastruttura, il pricing per token è più economico, permette di lanciare più velocemente e non comporta rischi iniziali. L’auto-ospitazione va rivalutata solo quando la bolletta mensile diventa consistente e stabile — tipicamente una volta che si superano regolarmente i decine di milioni di token al mese su un modello open source comparabile.


Ottieni i dati prima di tutti gli altri

Una email a settimana: quali modelli AI hanno cambiato prezzo, cosa misurano realmente i nuovi benchmark e quale GPU vale la pena acquistare. Niente hype, niente riempitivi.

Gratuito. Annulla l’iscrizione in un clic. Non vendiamo né condividiamo mai il tuo indirizzo.

Scroll to Top