Ti stai chiedendo se la tua GPU è in grado di eseguire un determinato modello linguistico di grandi dimensioni (LLM) in locale? Questa calcolatrice gratuita stima la VRAM necessaria per ciascun modello a ogni livello di quantizzazione — indicandoti esattamente quali modelli sono compatibili con la tua scheda.
| Quantizzazione | Qualità | VRAM stimata | Compatibile con la tua GPU? |
|---|
Stima basata sui pesi del modello a ciascuna quantizzazione + ~1,5 GB di overhead runtime. Contesti lunghi aggiungono memoria per la cache KV (che cresce con la lunghezza del contesto scelto). Nei modelli a mixture-of-experts, tutti i parametri devono essere caricati nella VRAM anche se solo un sottoinsieme viene utilizzato per ogni token.
Scegli un modello dalla nostra Database di modelli IA (oppure inserisci manualmente il numero di parametri), seleziona la tua GPU, imposta la lunghezza del contesto e verifica istantaneamente se il modello è eseguibile — e a quale qualità. Le stime si basano sui pesi del modello; i contesti lunghi aggiungono memoria per la cache KV.
Risposta rapida: quanta VRAM è necessaria per eseguire un LLM in locale?
Per eseguire un modello linguistico di grandi dimensioni (LLM) in locale con quantizzazione a 4 bit, prevedere circa 0,5–0,6 GB di VRAM GPU per miliardo di parametri, più 1–3 GB per la cache KV a lunghezze tipiche del contesto. In pratica, un modello da 8 miliardi di parametri (8B) richiede circa 5–6 GB (comodo su una RTX 3060 da 12 GB; funziona anche su una RTX 4060 da 8 GB), un modello da 13B necessita di circa 8–10 GB, un modello da 32B richiede una scheda da 24 GB come la RTX 4090 (~20 GB per i pesi), mentre un modello da 70B ha bisogno di circa 40–48 GB — ovvero una singola scheda da 48 GB o due GPU da 24 GB. Con quantizzazione a 8 bit queste cifre raddoppiano approssimativamente (~1–1,2 GB per miliardo), mentre in fp16 si quadruplicano (~2 GB per miliardo).
Regole empiriche rapide per i pesi del modello, prima di aggiungere il contesto:
- 4 bit (Q4): ~0,5–0,6 GB per miliardo di parametri
- 8 bit (Q8): ~1–1,2 GB per miliardo di parametri
- fp16 / bf16: ~2 GB per miliardo di parametri
- Cache KV (contestuale): aggiungere ~1–4 GB per contesti da 8K a 32K token; di più per contesti molto lunghi o modelli più grandi
Domande frequenti
Quanta VRAM serve per eseguire un modello da 70B?
Un modello da 70B richiede circa 40–48 GB di VRAM con quantizzazione a 4 bit — circa 0,5–0,6 GB per miliardo di parametri per i pesi, più la cache KV. Ciò è compatibile con una singola scheda da 48 GB oppure con due GPU da 24 GB, ad esempio una coppia di RTX 4090. A 8 bit la cifra raddoppia approssimativamente a ~80 GB, mentre in fp16 servono circa 140 GB.
La mia RTX 4060 o una GPU da 12 GB può eseguire un modello da 8B o 7B?
Sì. Un modello da 7B–8B a 4 bit utilizza solo circa 4–5 GB di VRAM, quindi gira agevolmente su una scheda da 12 GB come la RTX 3060, lasciando ampio margine per il contesto. La RTX 4060 ha 8 GB di VRAM e gestisce comunque bene un modello da 7–8B — semplicemente con meno spazio disponibile per finestre di contesto molto lunghe.
Quanta VRAM serve per un modello da 13B?
Un modello da 13B richiede circa 8–10 GB di VRAM con quantizzazione a 4 bit. Si adatta a una GPU da 12 GB per contesti brevi o moderati, ma una scheda da 16 GB è più sicura se si aggiunge una finestra di contesto più lunga e si tiene conto dell’overhead del framework.
Una GPU da 24 GB come la RTX 4090 può eseguire un modello da 32B o da 70B?
Una GPU da 24 GB esegue bene un modello da 32B a 4 bit: i pesi occupano circa 20 GB, lasciando alcuni GB per la cache KV. Non riesce invece a contenere un modello da 70B a 4 bit — che richiede ~40–48 GB — quindi servirebbe una seconda GPU, l’offloading sulla CPU o una quantizzazione di qualità inferiore (2–3 bit).
Quanta memoria GPU consuma un LLM per miliardo di parametri?
Come regola generale, prevedere ~0,5–0,6 GB per miliardo di parametri a 4 bit, ~1–1,2 GB a 8 bit e ~2 GB in fp16/bf16. Dunque un modello da 30B richiede circa 16–18 GB a 4 bit, ~32 GB a 8 bit e ~60 GB in fp16, prima di aggiungere la cache KV.
Quanta VRAM aggiuntiva richiede la lunghezza del contesto (cache KV)?
La cache KV cresce linearmente con la lunghezza del contesto e aggiunge circa 3 GB su un modello da 8B passando da 8K a 32K token (circa 1 GB a 8K fino a circa 4 GB a 32K), con modelli più grandi e contesti più lunghi che ne richiedono di più. Quantizzare la cache KV a 8 bit ne riduce approssimativamente a metà il costo, quindi lasciare sempre 1–4 GB di margine rispetto ai pesi del modello.
Quali dimensioni di modello posso eseguire con 8 GB o 16 GB di VRAM?
Con 8 GB di VRAM è possibile eseguire comodamente modelli da 7–8B a 4 bit; con 16 GB si possono gestire agevolmente modelli fino a ~13B e forzare l’esecuzione di un modello da 20–24B con un contesto modesto. Per un modello da 32B servono 24 GB, mentre per uno da 70B sono necessari circa 48 GB.
Altri strumenti gratuiti di Convly
VRAM necessaria per eseguire modelli open AI in locale (4 bit)
1,4 GB
3 GB
4,5 GB
5 GB
5 GB
7,5 GB
8 GB
9 GB
9 GB
16 GB
18 GB
20 GB
21 GB
40 GB
40 GB
65 GB
140 GB
140 GB
240 GB
370 GB
400 GB
400 GB
500 GB
800 GB
GB of VRAM at 4-bit quantization · open-weight models in the Convly database · Green = best value, orange = highest. Updated Sep 14, 2026.
🔍 Incorpora questo grafico sul tuo sito (gratuito, con attribuzione)
Ottieni i dati prima di tutti gli altri
Una email a settimana: quali modelli AI hanno cambiato prezzo, cosa misurano realmente i nuovi benchmark e quale GPU vale la pena acquistare. Niente hype, niente riempitivi.
Gratuito. Annulla l’iscrizione in un clic. Non vendiamo né condividiamo mai il tuo indirizzo.
