Thursday, 6 August 2026 | Updating Daily AI insight, written for builders

Le migliori GPU per eseguire modelli linguistici locali nel 2026: classifica di Llama 3, Mistral e Qwen

Aggiornato · Originariamente pubblicato il 19 maggio 2026

L’esecuzione locale di LLM è passata, nel 2026, da «hobby divertente» a «flusso di lavoro professionale essenziale». Le ragioni non sono affatto sottili: i costi delle API cloud aumentano rapidamente, i tuoi dati rimangono sul tuo dispositivo e il divario prestazionale tra modelli open-weight e sistemi di classe GPT si è ridotto a sufficienza perché la maggior parte dei compiti professionali possa essere svolta con un Llama 3 da 70 miliardi di parametri o un Qwen 2.5 da 72 miliardi di parametri, entrambi eseguibili su hardware consumer.

La domanda è: quale hardware consumer? Abbiamo testato tutte le GPU seriamente consigliate nel 2026 per LLM locale lavoro, sullo stesso computer e con lo stesso stack software. Ecco i risultati — e i verdetti onesti su quale acquistare effettivamente.

Punti chiave

  • Migliore in assoluto: RTX 4090 (usata, $1.200–1.400) — il miglior compromesso tra VRAM, velocità ed ecosistema nel 2026.
  • Migliore se il budget non è un vincolo: RTX 5090 (32 GB, MSRP $2.000) — unica GPU consumer in grado di eseguire modelli da 70B in quantizzazione Q5_K_M.
  • Miglior rapporto qualità-prezzo: RTX 3090 usata (24 GB, $700) — metà della velocità di una RTX 4090 al 50% del prezzo.
  • Migliore opzione economica: RTX 3060 da 12 GB ($280) — esegue senza problemi modelli da 7 miliardi di parametri ed è il punto di ingresso ideale.
  • Migliore alternativa non-NVIDIA: Apple M4 Max 128 GB — paradigma diverso, memoria massiccia, ma più lenta per token.

Come scegliere davvero: la regola che batte ogni scheda tecnica

Scelta per VRAM prima di tutto, throughput al secondo posto, tutto il resto al terzo.

L'inferenza su modelli linguistici di grandi dimensioni (LLM) è dominata dalla larghezza di banda e dalla capacità della memoria. Se il tuo modello più la cache KV e il contesto rientrano nella VRAM, ottieni un'inferenza alla massima velocità. Se non ci stanno, paghi un overhead 5–10× dovuto all'offload sulla CPU, e la differenza tra una GPU "veloce" e una "lenta" smette di contare: entrambe diventano ora collegate al collo di bottiglia di PCIe e RAM di sistema.

L'albero decisionale pratico:

  • 7–13 B models (Llama 3 8B, Mistral 7B, Phi-4) → minimo 12 GB di VRAM, 16 GB comodi. RTX 3060 12 GB o superiore.
  • Modelli da 30 a 34 miliardi di parametri (Qwen 2.5 32B, Yi-34B) → 24 GB di VRAM in quantizzazione Q4. RTX 3090, 4090, M4 Pro.
  • Modelli da 70 a 72 miliardi di parametri (Llama 3 70B, Qwen 2.5 72B) → circa 24 GB di VRAM in Q3_K_S, 32 GB in Q4 (pulito), 48 GB in Q5 (migliore). RTX 4090, RTX 5090, doppia RTX 3090, M4 Max.
  • Modelli da 100 miliardi in su (Mistral Large 2, Command R+ 104B) → minimo 48 GB di VRAM. RTX 6000 Ada, doppia RTX 4090, M4 Max da 128 GB.
  • modelli da 200 miliardi di parametri in su (DeepSeek V3, Llama 3 da 405 miliardi) → memoria da 128 GB in su. M4 Ultra, server multi-GPU, Nvidia DIGITS.

Una volta identificata la categoria di modelli che ti interessa, ogni specifica diversa dalla VRAM serve solo a dirimere eventuali pareggi.

La classifica

1. RTX 4090 — la migliore in assoluto nel 2026

VRAM24 GB GDDR6X
Larghezza di banda1.008 GB/s
TDP450 W
Prezzo di mercato usato$1.200–1.400
Llama 3 8B Q4122 t/s
Llama 3 70B Q416,4 t/s

La RTX 4090 non è la GPU per LLM più veloce del 2026 — quella è la 5090 — ma ai prezzi di mercato usato rappresenta l'affare migliore con un ampio margine. Ventiquattro gigabyte di VRAM sono sufficienti per gestire agevolmente i modelli da 70 miliardi in Q4, lo stack software CUDA è pienamente maturo e ogni framework che conta (llama.cpp, vLLM, exllamav2, MLC-LLM, TensorRT-LLM) ha avuto due anni per ottimizzarsi su Ada.

Gli unici compromessi rispetto alla 5090 sono 8 GB di VRAM in meno e una velocità ridotta di circa un terzo. Per la maggior parte dei flussi di lavoro locali con LLM, questo non basta a giustificare un raddoppio del prezzo.

Acquista se: vuoi una singola GPU in grado di gestire modelli da 8 a 70 miliardi a velocità utilizzabile e hai il budget per un acquisto usato da $1.200+.

Salta se: hai bisogno di eseguire quotidianamente modelli da 70 miliardi in Q5+ (rischieresti l'OOM) oppure hai un tetto rigido di $800.

2. RTX 5090 — solo se hai davvero bisogno di 32 GB

VRAM32 GB GDDR7
Larghezza di banda1.792 GB/s
TDP575 W
Prezzo al pubblico consigliato (MSRP)$1.999 ($2.400 di mercato)
Llama 3 70B Q422,1 t/s
Llama 3 70B Q517,8 t/s

La 5090 è l'unica GPU consumer del 2026 in grado di eseguire Llama 3 70B in Q5_K_M senza compromessi. Questo singolo fatto — unito alla sua larghezza di banda di memoria superiore del 78% rispetto alla 4090 — costituisce l'intero fondamento della sua scelta.

Se non hai bisogno di 32 GB, stai pagando un sovrapprezzo di oltre $1.000 per un aumento di prestazioni di circa il 35% su carichi di lavoro che già giravano bene sulla 4090. Se invece hai effettivamente bisogno di 32 GB (modelli da 70 miliardi in Q5, Generazione di video con IAfine-tuning di modelli superiori ai 13 miliardi di parametri), non c'è concorrenza a prezzi consumer.

L'analisi completa dei benchmark è disponibile nel nostro approfondimento RTX 5090 vs RTX 4090 per l'IA.

Acquista se: hai bisogno di 32 GB di VRAM e disponi di un budget di $2.000 o superiore.

Salta se: i tuoi modelli rientrano nei 24 GB di VRAM oppure riesci a trovare una RTX 4090 usata a $1.200.

3. RTX 3090 — la scelta imbattibile per rapporto qualità-prezzo

VRAM24 GB GDDR6X
Larghezza di banda936 GB/s
TDP350 W
Prezzo di mercato usato$650–800
Llama 3 8B Q492 t/s
Llama 3 70B Q411,2 t/s

La RTX 3090 ha ormai cinque anni, ma rimane ancora nel 2026 l'acquisto più conveniente in termini di VRAM per dollaro speso. Ventiquattro gigabyte di memoria a $700 usati permettono a migliaia di ricercatori indipendenti di ML di eseguire modelli da 70 miliardi di parametri.

Le prestazioni sono circa il 60% di quelle della 4090, ma per l'inferenza si ottengono comunque token/sec utilizzabili su ogni modello rilevante. I principali svantaggi sono un maggiore consumo energetico per unità di lavoro e i rischi legati all'acquisto di una scheda di cinque anni fa sul mercato secondario.

La mossa classica per gli appassionati nel 2026: due RTX 3090 usate con una PSU da 1200 W di qualità e un ponte NVLink: costo totale $1.400, per ottenere 48 GB di VRAM che superano una singola 4090 su ogni modello superiore ai 30 miliardi di parametri. La configurazione è fastidiosa, ma funziona.

Acquista se: hai un budget di $700, vuoi iniziare con gli LLM locali e sei a tuo agio con hardware usato.

Salta se: hai bisogno di hardware nuovo con garanzia oppure il tuo PC ha vincoli stringenti di potenza/spazio.

4. RTX 3060 12 GB — la porta d'ingresso

VRAM12 GB GDDR6
Larghezza di banda360 GB/s
TDP170 W
Prezzo nuovo$280
Llama 3 8B Q448 t/s
Llama 3 8B Q832 t/s

Cinque anni dopo il lancio, la RTX 3060 12 GB è ancora in produzione ed è tuttora la risposta ideale alla domanda «Come posso iniziare con gli LLM locali nel modo più economico possibile?». Dodici gigabyte sono sufficienti per qualsiasi modello da 7 a 13 miliardi di parametri con buone quantizzazioni; Llama 3 8B raggiunge 48 t/s (più veloce della lettura umana) e l'intera scheda costa $280 nuova.

Ciò che sacrifichi: qualsiasi modello da 30 miliardi di parametri in su. La RTX 3060 non è in grado di eseguire Llama 3 da 70 miliardi di parametri a una velocità utilizzabile, nemmeno con alcuna quantizzazione. È inequivocabilmente una GPU per modelli "piccoli".

Acquista se: sei nuovo agli LLM locali e vuoi imparare prima di investire oltre 1.000 dollari.

Salta se: sai già di voler eseguire modelli della classe da 70 miliardi di parametri.

5. Radeon RX 7900 XTX — il compromesso AMD

VRAM24 GB GDDR6
Larghezza di banda960 GB/s
TDP355 W
Prezzo nuovo$900
Llama 3 8B Q498 token/s (ROCm)
Llama 3 70B Q413,6 token/s (ROCm)

ROCm 6.3 insieme alla 7900 XTX è finalmente sufficientemente performante nel 2026, rendendo questa una raccomandazione concreta e non più una semplice opzione di riserva. Offre 24 GB di VRAM a 900 dollari di prezzo di listino, prestazioni approssimativamente intermedie tra quelle di una RTX 3090 e di una RTX 4090, e supporto completo per PyTorch e llama.cpp.

La frizione rimane comunque tangibile: alcuni framework (TensorRT-LLM, determinati motori d'inferenza esclusivamente CUDA, alcune implementazioni di ricerca) semplicemente non funzionano. Il codice di ricerca più avanzato punta innanzitutto a CUDA; il supporto AMD arriva settimane o mesi dopo.

Acquista se: hai obiezioni ideologiche verso NVIDIA, sei sensibile al prezzo ma desideri un prodotto nuovo con garanzia, oppure possiedi già un sistema basato prevalentemente su componenti AMD.

Salta se: vuoi zero frizione o svolgi attività di ricerca con rilasci di nuovi modelli appena usciti.

6. Apple M4 Max (Mac Studio / MacBook Pro) — la scelta della memoria unificata

Memoria unificatafino a 128 GB
Larghezza di banda546 GB/s
TDP~75 W
Prezzo nuovo3.499–4.999 dollari (Mac Studio)
Llama 3 da 8 miliardi di parametri Q4 (MLX)78 token/s
Llama 3 da 70 miliardi di parametri Q4 (MLX)9,4 token/s

Il M4 Max non è veloce per token rispetto alle soluzioni NVIDIA. Ciò che offre invece è una quantità di memoria irraggiungibile altrove a prezzi consumer. Un M4 Max da 128 GB può ospitare agevolmente Llama 3 da 405 miliardi di parametri in Q4 — qualcosa che neppure una singola RTX 5090 riesce a fare.

Per flussi di lavoro incentrati sull'inferenza in cui la dimensione del modello conta più della velocità (analisi di documenti lunghi, sistemi agenti, ricerca), il M4 Max è effettivamente lo strumento giusto. Per l'addestramento, il fine-tuning, la generazione di immagini o qualsiasi altro flusso di lavoro che dipenda da software esclusivamente CUDA, rappresenta invece una scelta frustrante.

Acquista se: hai bisogno di eseguire localmente modelli da 100 miliardi di parametri in su, vivi nell'ecosistema Mac oppure dai grande valore al funzionamento silenzioso.

Salta se: effettui fine-tuning di modelli, generi immagini o il tuo LLM quotidiano ha meno di 70 miliardi di parametri (stai pagando per una memoria che non ti serve).

7. RTX 5070 Ti / RTX 5080 — il modello intermedio che non funziona

VRAM16 GB GDDR7 (entrambe)
Larghezza di banda896 / 960 GB/s
TDP300 / 360 W
Prezzo al pubblico consigliato (MSRP)$749 / $999

Entrambe le schede sono veloci e moderne, ma 16 GB di VRAM nel 2026 rappresentano una quantità poco pratica per gli LLM: troppa per i modelli da 7 miliardi di parametri (sovradimensionamento), troppo poca per quelli da 70 miliardi (non entrano in memoria con alcuna quantizzazione utilizzabile). Sono ottime per gaming e per attività AI leggere, ma se l'inferenza locale di LLM è la tua priorità, sarai meglio servito da una RTX 3090 usata (700 dollari, 24 GB) o da una RTX 4090 usata (1.200 dollari, 24 GB).

Acquista se: sei un giocatore che vuole anche sperimentare con piccoli LLM.

Salta se: l'inferenza locale di LLM è il tuo caso d'uso principale.

Tabella comparativa

GPUVRAML3 8B Q4 token/sL3 70B Q4 token/sPrezzo di mercatoVerdetto
RTX 509032 GB16822.1$2,400La migliore se hai bisogno di 32 GB
RTX 409024 GB12216.4$1,300Migliore in assoluto
RTX 309024 GB9211.2$700Miglior rapporto qualità-prezzo
2× RTX 309048 GB8714.8$1,400La migliore configurazione da 48 GB
RX 7900 XTX24 GB9813.6$900Scelta AMD (ROCm)
M4 Max da 128 GB128 GB789.4$4,999Per modelli da 100 miliardi di parametri in su
M4 Max 64 GB64 GB789.4$3,499Opzione Mac silenziosa
RTX 508016 GB118n/d$999Da evitare per gli LLM
RTX 5070 Ti16 GB104n/d$749Da evitare per gli LLM
RTX 3060 12 GB12 GB48n/d$280Miglior ingresso
Arc B58012 GB38n/d$249Scommessa economica

Stack software che userai effettivamente

Qualunque GPU tu scelga, lo stack d'inferenza nel 2026 si è consolidato intorno a tre opzioni:

  • Ollama — installazione più semplice, minor numero di impostazioni avanzate. Ideale per chi pensa: «Voglio solo chattare con Llama 3».
  • LM Studio — Interfaccia grafica con browser integrato per modelli, che consente di regolare l’offload dei layer, la suddivisione della GPU e la dimensione del contesto. Ideale per chi vuole semplicemente verificare quali modelli girano sul proprio hardware.
  • llama.cpp + vLLM + exllamav2 — Interfaccia a riga di comando, massime prestazioni e controllo avanzato. Ottimale per distribuzioni in produzione e test di benchmark.

Gli utenti CUDA hanno il percorso più semplice: tutto funziona. Gli utenti ROCm puntano su llama.cpp e Ollama (entrambi pienamente supportati). Gli utenti Apple Silicon dispongono di MLX (il framework nativo per l’intelligenza artificiale di Apple), che nel 2026 è più veloce della versione Metal di llama.cpp.

Per la VRAM che non si possiede, l’offload sulla CPU consente di «prendere in prestito» la RAM di sistema con un pesante penalità in termini di velocità (fino a 10 volte più lento o peggio). Utile per eseguire un modello che non entra completamente nella VRAM disponibile, ma scomodo come strumento quotidiano.

Vantaggi e svantaggi a colpo d’occhio

RTX 3090 / 4090 usate acquistate

  • Miglior rapporto VRAM/prezzo nel 2026
  • Supporto completo CUDA e stack software maturo
  • Rivendita agevole — le perdite sono limitate
  • Costruzione multi-GPU semplice e diretta

Compromessi

  • Nessuna garanzia del produttore
  • Rischio di schede da mining per le RTX 3090
  • Consumo energetico superiore rispetto alle nuove GPU della serie 50

RTX 5090 + Apple M4 Max

  • VRAM di fascia alta (32 GB oppure 128 GB unificata)
  • Driver e supporto più recenti, con finestra di assistenza aggiornata
  • Nessun rischio legato al mercato dell’usato
  • Carichi di lavoro specializzati (RTX 5090: generazione video AI; M4 Max: modelli da 100 miliardi di parametri in su)

Compromessi

  • Costo doppio rispetto a un acquisto equivalente di usato
  • Consumo energetico maggiore (RTX 5090) o velocità inferiore per token (M4 Max)
  • Il M4 Max ti vincola all’ecosistema Apple

Domande frequenti

Qual è la GPU più economica in grado di eseguire localmente Llama 3 70B?

Una RTX 3090 usata ($650–800) è l’opzione più economica con una singola scheda. Llama 3 70B in quantizzazione Q3_K_S entra appena e raggiunge circa 9 token/sec — utilizzabile, ma al limite. Per una quantizzazione Q4_K_M confortevole, servono invece una RTX 4090 o una configurazione con due RTX 3090 per un totale di almeno 32 GB di VRAM.

La RTX 4090 è sufficiente per un lavoro serio con LLM nel 2026?

Per la maggior parte dei professionisti, sì. I 24 GB di VRAM gestiscono modelli da 70 miliardi di parametri in Q4_K_M con contesto fino a 8K, eseguono modelli da 30 miliardi in Q5+ e offrono pieno supporto CUDA. Le uniche situazioni in cui potresti sentirti limitato sono la generazione di video AI, modelli oltre i 100 miliardi di parametri o il fine-tuning di modelli superiori ai 13 miliardi.

Devo acquistare due RTX 3090 invece di una sola RTX 4090?

Matematicamente, due RTX 3090 forniscono 48 GB di VRAM a un costo simile a quello di una RTX 4090 — un grande vantaggio per carichi di lavoro limitati dalla memoria, come modelli da 70 miliardi di parametri in su. Gli svantaggi: configurazione più complessa (NVLink, alimentatore, gestione del flusso d’aria nel case), consumo energetico più elevato (700 W complessivi) e prestazioni solo del ~15% superiori rispetto a una singola RTX 4090 nell’esecuzione di modelli da 70 miliardi in Q4. Se hai effettivamente bisogno di 48 GB, procedi pure. Altrimenti, la singola RTX 4090 rimane la scelta più semplice.

Posso eseguire LLM locali su un MacBook Pro?

Sì — e molto bene. L’M4 Pro (48 GB) gestisce comodamente modelli da 8 a 32 miliardi di parametri. L’M4 Max (64–128 GB) gestisce facilmente modelli da 70 miliardi e persino modelli da 405 miliardi con una forte quantizzazione, purché si abbia la versione da 128 GB. La velocità è circa la metà per token rispetto a una RTX 4090, ma silenziosità e portabilità rappresentano punti di forza unici.

ROCm è finalmente utilizzabile per gli LLM nel 2026?

Per l’inferenza, sì. llama.cpp, vLLM e Ollama offrono tutti un solido supporto ROCm sulla Radeon RX 7900 XTX nel 2026. Per il training, il supporto è parziale: PyTorch funziona nella maggior parte dei casi, ma articoli di ricerca all’avanguardia continuano a rilasciare codice esclusivamente CUDA, richiedendo adattamenti manuali. Se il tuo flusso di lavoro prevede principalmente inferenza e occasionali fine-tuning con strumenti consolidati, AMD è una valida alternativa.

Ho bisogno di NVLink per l’inferenza multi-GPU sugli LLM?

Per l’inferenza pura, no — PCIe è più che sufficiente. NVLink è utile soprattutto durante il training e quando si trasferisce uno stesso modello tra GPU durante un’unica passata forward. Nella maggior parte delle configurazioni multi-GPU per inferenza, i layer vengono semplicemente suddivisi tra le schede e la penalità introdotta da PCIe è trascurabile.

Conclusione

Per la maggior parte degli utenti che costruiscono sistemi locali per LLM nel 2026, la risposta è una RTX 4090 usata a $1.200–1.400. I 24 GB di VRAM, il pieno supporto CUDA e driver collaudati coprono il 90% dei carichi di lavoro senza doverci pensare troppo.

Se $1.200 supera il tuo budget, passa a una RTX 3090 usata a $700 — più lenta, ma con gli stessi 24 GB di memoria e gli stessi flussi di lavoro.

Se hai specificamente bisogno di eseguire modelli da 70 miliardi con quantizzazioni di alta qualità, generare video AI o fare training su modelli superiori ai 13 miliardi di parametri, sali alla RTX 5090RTX 5090

E se devi eseguire localmente modelli da 100 miliardi di parametri in su, lascia completamente le GPU consumer Nvidia e guarda verso la M4 Max da 128 GB o Nvidia DIGITS. La sua architettura a memoria unificata è l’unica soluzione a prezzo consumer in grado di fornire tanta memoria indirizzabile per i modelli.

Tutto il resto — RTX 5080, RTX 5070 Ti, Intel Arc B580, qualsiasi GPU AMD tranne la 7900 XTX — rappresenta un compromesso per chi non ha come uso principale gli LLM locali.

Scritto da Mustafa Ihsan

Mustafa Ihsan è fondatore e redattore capo di Convly.ai. Ha progettato e gestisce il database in tempo reale di modelli IA del sito, il suo indice prezzo-prestazioni e i suoi calcolatori gratuiti per i requisiti di VRAM, i costi delle API e l'economia dell'auto-hosting. Scrive di prezzi dei modelli, risultati di benchmark e hardware necessario per eseguire modelli IA localmente, privilegiando costantemente dati misurati rispetto alle dichiarazioni dei produttori.

Scroll to Top
Featured on There's An AI For That