La domanda più frequente che riceviamo dai neofiti dei modelli linguistici locali nel 2026 non è «Quale modello devo usare?», ma «Questo modello funzionerà sulla mia GPU?»
Questa guida è la risposta. Abbiamo testato ogni principale modello linguistico open source, a ogni comune livello di quantizzazione, su hardware che va da una RTX 3060 da 12 GB a un H100 da 80 GB; quanto segue è la scheda riassuntiva che avremmo voluto avere quando abbiamo iniziato.
Un promemoria per gli impazienti: La VRAM è il vincolo determinante. Se il modello più la cache KV più il contesto non rientrano nella VRAM disponibile, le prestazioni di inferenza precipitano drasticamente. Tutto quanto segue presuppone che si desideri un’inferenza puramente su GPU; se invece si accetta l’offload sulla CPU, dividere le prestazioni di throughput per un fattore compreso tra 5 e 10.
Punti chiave
- VRAM da 12 GB: 7–8 B models at Q5+, 13 B at Q4. Llama 3 8B, Mistral 7B, Phi-4 Mini.
- 16 GB di VRAM: 13–14 miliardi di parametri a Q5+. Fascia scomoda: troppo per modelli da 8 miliardi, ma non abbastanza per quelli da 30 miliardi.
- 24 GB di VRAM: 30 miliardi di parametri a Q5+, 70 miliardi a Q3_K_S (con poco margine). Il punto ottimale.
- 32 GB di VRAM: 70 miliardi di parametri a Q4_K_M con ampio margine, 30 miliardi a Q8.
- 48 GB di VRAM: 70 miliardi di parametri a Q5_K_M, oltre 100 miliardi a Q3/Q4.
- 128 GB unificati (M4 Max): 405 miliardi di parametri a Q4, ma più lento per token rispetto a Nvidia.
- Tabella di riferimento rapido
- Memoria della cache KV — quella che tutti dimenticano
- Matrice di compatibilità GPU
- Come scegliere la quantizzazione adatta al tuo hardware
- Modelli MoE — la nota a piè di pagina
- Configurazioni pronte all’uso per diverse fasce di budget
- Domande frequenti
- Conclusione
- Articoli correlati
Tabella di riferimento rapido
Ogni principale LLM open-source del 2026 e i relativi requisiti di VRAM ai comuni livelli di quantizzazione. I valori si riferiscono esclusivamente ai pesi del modello, con contesto da 8 K. Aggiungere 1–2 GB per la cache KV come margine aggiuntivo ogni 8 K di contesto effettivamente utilizzato.
| Modello | FP16 | Q8_0 | Q5_K_M | Q4_K_M | Q3_K_M | IQ2_XXS |
|---|---|---|---|---|---|---|
| Phi-4 Mini (3,8 miliardi) | 7,6 GB | 4,0 GB | 2,7 GB | 2,3 GB | 1,9 GB | 1,4 GB |
| Gemma 2 da 2 miliardi | 5,0 GB | 2,7 GB | 1,8 GB | 1,6 GB | 1,3 GB | 1,0 GB |
| Llama 3 8B | 16,1 GB | 8,5 GB | 5,7 GB | 4,9 GB | 4,0 GB | 2,9 GB |
| Mistral 7B v0.3 | 14,5 GB | 7,7 GB | 5,1 GB | 4,4 GB | 3,6 GB | 2,6 GB |
| Qwen 2.5 7B | 15,2 GB | 8,1 GB | 5,4 GB | 4,7 GB | 3,8 GB | 2,7 GB |
| Phi-4 (14 B) | 28,0 GB | 14,9 GB | 10,0 GB | 8,5 GB | 7,0 GB | 5,0 GB |
| Qwen 2.5 14B | 29,5 GB | 15,7 GB | 10,5 GB | 9,0 GB | 7,4 GB | 5,3 GB |
| Mistral Nemo 12B | 24,5 GB | 13,0 GB | 8,7 GB | 7,5 GB | 6,1 GB | 4,4 GB |
| Qwen 2.5 32B | 65,0 GB | 34,6 GB | 23,0 GB | 19,8 GB | 16,3 GB | 11,6 GB |
| Yi-1.5 34B | 68,5 GB | 36,4 GB | 24,3 GB | 20,7 GB | 17,1 GB | 12,2 GB |
| Llama 3 70B | 141,0 GB | 74,9 GB | 49,9 GB | 42,5 GB | 34,7 GB | 24,9 GB |
| Qwen 2.5 72B | 145,0 GB | 77,1 GB | 51,4 GB | 43,8 GB | 35,7 GB | 25,6 GB |
| Command R+ 104B | 208,0 GB | 110,5 GB | 73,8 GB | 62,7 GB | 51,6 GB | 36,8 GB |
| Mistral Large 2 (123B) | 247,0 GB | 131,4 GB | 87,5 GB | 74,5 GB | 61,0 GB | 43,6 GB |
| Mixtral 8x22B (141 B) | 282,0 GB | 150,0 GB | 100,0 GB | 85,1 GB | 69,8 GB | 49,9 GB |
| DeepSeek V3 (236 B MoE) | 475,0 GB | 252,0 GB | 168,5 GB | 143,6 GB | 117,4 GB | 84,1 GB |
| Llama 3.1 405B | 810,0 GB | 431,0 GB | 287,0 GB | 244,5 GB | 200,1 GB | 143,0 GB |
Una nota pratica: per un utilizzo quotidiano, Q4_K_M rappresenta il compromesso consigliato tra dimensione e qualità. La perdita di qualità rispetto all'FP16 è modesta (incremento tipico della perplessità < 2%) e i risparmi di memoria sono notevoli (~3,3× più piccolo). Q5_K_M offre una qualità marginalmente migliore con un aumento di circa il 17% della memoria occupata. Q3 e IQ2 vanno utilizzati solo in casi di emergenza — la qualità degrada in modo evidente.
Memoria della cache KV — quella che tutti dimenticano
I valori indicati sopra si riferiscono esclusivamente ai pesi del modello. La cache KV — la memoria attiva necessaria per memorizzare tutti i token della conversazione in corso — risiede anch’essa nella VRAM e cresce linearmente con la lunghezza del contesto.
Dimensione approssimativa della cache KV per ogni 1K token di contesto, in FP16:
| Classe del modello | Cache KV per 1K token | Cache KV per contesto da 32K |
|---|---|---|
| modelli da 7 a 8 miliardi di parametri | ~32 MB | ~1,0 GB |
| modelli da 13 a 14 miliardi di parametri | ~50 MB | ~1,6 GB |
| modelli da 30 a 34 miliardi di parametri | ~80 MB | ~2,6 GB |
| modelli da 70 a 72 miliardi di parametri | ~160 MB | ~5,1 GB |
| modelli da 100 a 123 miliardi di parametri | ~220 MB | ~7,0 GB |
| 405 miliardi di parametri | ~500 MB | ~16,0 GB |
La quantizzazione della cache KV (un'opzione disponibile in llama.cpp e vLLM nel 2026) riduce questo valore di circa 2–4 volte, con un lieve impatto sulla qualità. La maggior parte delle configurazioni produttive utilizza attualmente la cache KV in Q8: il costo qualitativo è quasi nullo e si ottiene un notevole risparmio di VRAM per contesti lunghi.
Se prevedi di utilizzare un contesto di 32 K o superiore, includi la cache KV nei tuoi calcoli di VRAM prima di scegliere la GPU.
Matrice di compatibilità GPU
Quali modelli trovano spazio comodamente su ciascuna GPU comune, ai quantizzatori raccomandati e con contesto da 8 K? Per «comodamente» si intende modello + cache KV + 1 GB di margine di sistema.
| GPU | VRAM | Miglior adattamento (Q4_K_M) | Miglior adattamento (Q5_K_M) | Massimo (qualsiasi quantizzazione) |
|---|---|---|---|---|
| RTX 3060 12 GB | 12 GB | 8 miliardi di parametri | 8 miliardi di parametri | 14 miliardi di parametri in Q3 |
| RTX 4060 Ti 16 GB | 16 GB | 13 miliardi di parametri | 13 miliardi di parametri | 30 miliardi di parametri in IQ2 |
| RTX 5080 / 5070 Ti | 16 GB | 13 miliardi di parametri | 13 miliardi di parametri | 30 miliardi di parametri in IQ2 |
| RTX 3090 / 4090 | 24 GB | 30 miliardi di parametri (Qwen 32B) | 30 miliardi di parametri | 70 miliardi di parametri in Q3_K_S |
| RX 7900 XTX | 24 GB | 30 miliardi di parametri | 30 miliardi di parametri | 70 miliardi di parametri in Q3_K_S |
| RTX 5090 | 32 GB | 70 miliardi di parametri | 70 miliardi di parametri (adattamento stretto) | 70 miliardi di parametri in Q5_K_M |
| 2× RTX 3090 / 4090 | 48 GB | 70 miliardi di parametri | 70 miliardi di parametri | 104 miliardi di parametri in Q3 |
| RTX A6000 / 6000 Ada | 48 GB | 70 miliardi di parametri | 70 miliardi di parametri | 104 miliardi di parametri in Q3 |
| Mac Studio M4 Max da 64 GB | 64 GB di memoria unificata | 70 miliardi di parametri | 70 miliardi di parametri | 123 miliardi di parametri in Q3 |
| H100 da 80 GB | 80 GB | 70 miliardi di parametri (FP16-ish) | 104 miliardi di parametri | 123 miliardi di parametri in Q4 |
| Mac Studio M4 Max da 128 GB | 128 GB di memoria unificata | 104 miliardi di parametri | 123 miliardi di parametri | 405 miliardi di parametri in IQ2 (lento) |
| H200 / DIGITS | 141 GB / 128 GB unificati | 123 miliardi di parametri | 123 miliardi di parametri | 405 miliardi di parametri in Q3 (lento) |
| B200 | 192 GB | 123 miliardi di parametri | 123 miliardi di parametri | 405 miliardi di parametri in Q4 (adattamento stretto) |
I pattern da memorizzare:
1. 12 GB rappresenta la soglia minima di ingresso. Sotto questo limite, sei costretto a modelli molto piccoli che non giustificano l’uso di una GPU dedicata.
2. 24 GB rappresenta il punto di svolta. È il livello più economico in cui diventa possibile eseguire Llama 3 da 70B (con quantizzazioni compromesse).
3. 32 GB consentono di eseguire correttamente il modello da 70B. Questo è l’unico vero motivo per scegliere la RTX 5090 rispetto alla 4090.
4. 48 GB rappresentano un margine confortevole. La maggior parte delle attività che desideri svolgere vi si adatta perfettamente.
5. 128 GB di memoria unificata costituiscono il tetto per i consumatori. Oltre questa soglia, stai acquistando hardware server.
Come scegliere la quantizzazione adatta al tuo hardware
La quantizzazione ottimale non è sempre «la più grande che entra nella tua VRAM». La qualità conta, e talvolta un modello più piccolo con una quantizzazione migliore supera un modello più grande con una quantizzazione peggiore.
Classifica approssimativa della qualità (basata sulla perplexity, valori più bassi sono migliori):
- FP16 / BF16 — originale. Riferimento di qualità di base.
- Q8_0 — aumento di circa lo 0,3% della perplexity. Praticamente indistinguibile.
- Q6_K — aumento di circa lo 0,5%. Indistinguibile nella pratica.
- Q5_K_M — aumento di circa l’1,0%. Leggero calo di qualità, ma comunque qualità molto elevata.
- Q4_K_M — aumento del 1,5–2,5%. Raccomandata per la maggior parte degli utenti.
- Q4_K_S — aumento di circa il 3%. Risultato sensibilmente peggiore rispetto a Q4_K_M per dimensioni simili.
- Q3_K_M — aumento del 5–8%. Output visibilmente compromesso.
- Q3_K_S — aumento di circa il 10%. Da usare solo se Q4 non entra nella VRAM disponibile.
- IQ2_XXS — aumento del 15–25%. Ultima risorsa.
Regola generale: preferisci un modello con meno parametri in Q5_K_M rispetto a un modello più grande in Q3_K_S per compiti quotidiani. Un Qwen da 32B in Q5 supera generalmente un Llama 3 da 70B in IQ2_XXS su benchmark reali, nonostante quest’ultimo sembri più impressionante sulla carta.
Eccezione: attività di programmazione e ragionamento dove il vantaggio intrinseco in termini di conoscenza del modello più grande spesso resiste anche a una quantizzazione aggressiva. Per la generazione di codice in particolare, persino una versione Q3_K_S di un modello da 70B può superare un modello da 30B in Q5_K_M.
Modelli MoE — la nota a piè di pagina
I modelli Mixture-of-Experts (MoE), come Mixtral 8x22B e DeepSeek V3 presentano un’asimmetria che confonde i principianti:
- VRAM necessaria = numero totale di parametri (poiché devi caricare tutti gli esperti)
- Calcolo richiesto = numero di parametri attivi per token (molto inferiore)
Mixtral 8x22B ha 141 miliardi di parametri totali / 39 miliardi attivi. Richiede oltre 80 GB di VRAM per essere eseguito, ma la velocità per token è simile a quella di un modello denso da 40 miliardi.
DeepSeek V3 ha un totale di 236 miliardi di parametri, di cui 21 miliardi attivi. Richiede oltre 150 GB di VRAM, ma la velocità di generazione dei token si avvicina a quella di un modello denso da 20 miliardi di parametri. Questo è il motivo per cui DeepSeek V3 è definita «veloce per le sue dimensioni»: paghi il costo in termini di VRAM, ma ottieni uno sconto sul carico computazionale.
Se il tuo hardware riesce a ospitare un modello MoE, è spesso la scelta migliore. Se non ci riesce, allora il modello denso della stessa classe di parametri è ciò che ti serve.
Configurazioni pronte all’uso per diverse fasce di budget
Per chi cerca una risposta concreta, ecco configurazioni testate in cinque fasce di budget nel 2026:
| Budget | GPU | Modello migliore | Token/sec |
|---|---|---|---|
| $300 | RTX 3060 12 GB | Llama 3 8B Q5_K_M | ~48 |
| $700 | RTX 3090 usata | Qwen 2.5 32B Q5_K_M | ~28 |
| $1,300 | RTX 4090 usata | Llama 3 da 70B in Q3_K_S | ~13 |
| $1,400 | 2× RTX 3090 usate + NVLink | Llama 3 70B Q4_K_M | ~15 |
| $2,400 | RTX 5090 | Llama 3 70B Q5_K_M | ~18 |
| $5,000 | Mac Studio M4 Max da 128 GB | Mistral Large 2 in Q4 | ~6 |
La «fascia di miglior rapporto qualità-prezzo» nel 2026 rimane ancora l’RTX 3090 o 4090 usata: sono le uniche GPU consumer per cui il rapporto prezzo/VRAM è favorevole, e entrambe rimarranno performanti almeno fino al 2028.
Per un’analisi approfondita sulla scelta della GPU più adatta, consulta migliore GPUs for local LLMs nel 2026.
Domande frequenti
Quanta VRAM mi serve per eseguire Llama 3 da 70B in locale nel 2026?
Minimo 24 GB per Llama 3 da 70B in Q3_K_S (qualità scadente). Con 32 GB puoi eseguire comodamente Q4_K_M (la quantizzazione raccomandata). Servono 40+ GB per Q5_K_M. Con 24 GB e contesto da 8K hai praticamente zero margine; portare il contesto a 32K richiede l’offload sulla CPU o una quantizzazione più aggressiva.
Qual è la differenza tra Q4_K_M e Q4_K_S?
Entrambe sono quantizzazioni a 4 bit dello stesso modello. Q4_K_M («medium») utilizza 5 bit per alcuni gruppi critici di pesi, rendendola leggermente più grande ma di qualità sensibilmente migliore rispetto a Q4_K_S («small»). A parità quasi identica di utilizzo di VRAM, Q4_K_M è preferibile. Q4_K_S ha senso solo quando stai cercando di far entrare un modello in un budget di VRAM estremamente ristretto.
Posso eseguire un LLM più grande della mia VRAM?
Sì — utilizzando l’offload sulla CPUl'offload su CPU, in cui alcuni strati del modello vengono eseguiti sulla CPU utilizzando la RAM di sistema invece della VRAM della GPU. La penalità in termini di prestazioni è severa (5–10 volte più lento), ma consente di eseguire modelli che altrimenti non entrerebbero nella memoria disponibile. Pratico per un utilizzo occasionale, estremamente scomodo come strumento quotidiano. Sia llama.cpp che Ollama supportano questa funzionalità nativamente tramite l'impostazione n_gpu_layers .
Il cache KV ha davvero un impatto sulla pianificazione della VRAM?
Sì, soprattutto con contesti lunghi. Per Llama 3 da 70 miliardi di parametri a contesto da 32 K, il solo cache KV occupa circa 5 GB. Se sei già al limite della tua VRAM, andrai in out-of-memory (OOM) non appena una conversazione si allungherà. Pianifica lo spazio necessario per il cache KV e considera la quantizzazione Q8 per il cache KV (opzione disponibile nei moderni motori di inferenza), che ne riduce approssimativamente a metà l’occupazione.
Esiste un modo per eseguire Llama 3 da 405 miliardi di parametri a casa?
Sì, ma hai bisogno di oltre 200 GB di memoria a quantizzazioni utilizzabili. Le soluzioni realistiche per il 2026 sono: Mac Studio M4 Ultra con 512 GB ($12.000, lento per token ma funzionante), 8× RTX 4090 ($13.000, configurazione complessa), Nvidia DIGITS ($3.000, progettato appositamente per questo scopo) oppure una combinazione CPU + 256 GB di RAM DDR5 con GPU di fascia media per un offload parziale ($8.000, lento). Consulta la nostra guida passo-passo per eseguire Llama 3 da 405 miliardi di parametri a casa.
Esistono formati di quantizzazione per il 2026, oltre a GGUF, di cui dovrei essere a conoscenza?
Sì — AWQ (Activation-aware Weight Quantization) e GPTQ sono ancora ampiamente utilizzati, specialmente per i deployment basati su vLLM e TensorRT-LLM. In alcuni casi offrono una qualità leggermente superiore rispetto a GGUF allo stesso numero di bit. Per l’uso consumer locale di LLM con llama.cpp / Ollama / LM Studio, GGUF rimane il formato dominante nel 2026 grazie alla sua semplicità e al vasto supporto strumentale.
La quantizzazione Q4 influenzerà le capacità di scrittura del codice?
Meno di quanto si possa pensare, ma sì. Per il completamento diretto del codice, Q4_K_M è essenzialmente identico a FP16. Per ragionamenti complessi in più passaggi su un intero codebase, Q4 produce occasionalmente logiche meno accurate rispetto a Q5+. Se utilizzi modelli locali per attività di programmazione impegnative, preferisci Q5_K_M e scegli l’hardware in grado di supportarlo.
Conclusione
La pianificazione della VRAM per gli LLM locali nel 2026 non è complicata, ma premia la precisione. Scegli prima la classe di parametri (la dimensione del modello che offre le capacità di cui hai bisogno), quindi la quantizzazione più leggera che garantisca una qualità accettabile (Q4_K_M è generalmente la scelta giusta), aggiungi poi lo spazio richiesto dal cache KV in base alla lunghezza effettiva del contesto che prevedi di usare, e infine seleziona la GPU in base a tale stima.
Se dovessi ricordare solo tre numeri, questi sono:
- 12 GB gestisce agevolmente modelli da 8 miliardi di parametri.
- 24 GB gestisce modelli da 30 miliardi di parametri a quantizzazioni di qualità, mentre quelli da 70 miliardi risultano appena sufficienti.
- 32 GB gestisce modelli da 70 miliardi di parametri a quantizzazioni di qualità.
Oltre i 32 GB si entra nel territorio dei server, mentre sotto i 12 GB si entra nel campo dei dispositivi mobili o embedded. La maggior parte delle attività locali con LLM nel 2026 avviene nella fascia 12–32 GB, che corrisponde esattamente alla gamma delle GPU consumer — non per caso, ma per progettazione.

