{"id":264,"date":"2026-05-19T16:46:25","date_gmt":"2026-05-19T16:46:25","guid":{"rendered":"https:\/\/convly.ai\/vram-requirements-every-major-llm-2026\/"},"modified":"2026-08-01T06:48:16","modified_gmt":"2026-08-01T06:48:16","slug":"vram-requirements-every-major-llm-2026","status":"publish","type":"post","link":"https:\/\/convly.ai\/it\/vram-requirements-every-major-llm-2026\/","title":{"rendered":"Requisiti di VRAM per ogni principale modello linguistico di grandi dimensioni nel 2026 (scheda riassuntiva sulla quantizzazione)"},"content":{"rendered":"<p>La domanda pi\u00f9 frequente che riceviamo dai neofiti dei modelli linguistici locali nel 2026 non \u00e8 \u00abQuale modello devo usare?\u00bb, ma \u00abQuesto modello funzioner\u00e0 sulla mia GPU?\u00bb<\/p>\n<p>Questa guida \u00e8 la risposta. Abbiamo testato ogni principale modello linguistico open source, a ogni comune livello di quantizzazione, su hardware che va da una RTX 3060 da 12 GB a un H100 da 80 GB; quanto segue \u00e8 la scheda riassuntiva che avremmo voluto avere quando abbiamo iniziato.<\/p>\n<p>Un promemoria per gli impazienti: <strong>La VRAM \u00e8 il vincolo determinante<\/strong>. Se il modello pi\u00f9 la cache KV pi\u00f9 il contesto non rientrano nella VRAM disponibile, le prestazioni di inferenza precipitano drasticamente. Tutto quanto segue presuppone che si desideri un\u2019inferenza puramente su GPU; se invece si accetta l\u2019offload sulla CPU, dividere le prestazioni di throughput per un fattore compreso tra 5 e 10.<\/p>\n<div class=\"convly-tldr\">\n<h3>Punti chiave<\/h3>\n<ul>\n<li><strong>VRAM da 12 GB:<\/strong> modelli da 7 a 8 miliardi di parametri in quantizzazione Q5+, da 13 miliardi in Q4. Llama 3 8B, Mistral 7B, Phi-4 Mini.<\/li>\n<li><strong>16 GB di VRAM:<\/strong> 13\u201314 miliardi di parametri a Q5+. Fascia scomoda: troppo per modelli da 8 miliardi, ma non abbastanza per quelli da 30 miliardi.<\/li>\n<li><strong>24 GB di VRAM:<\/strong> 30 miliardi di parametri a Q5+, 70 miliardi a Q3_K_S (con poco margine). Il punto ottimale.<\/li>\n<li><strong>32 GB di VRAM:<\/strong> 70 miliardi di parametri a Q4_K_M con ampio margine, 30 miliardi a Q8.<\/li>\n<li><strong>48 GB di VRAM:<\/strong> 70 miliardi di parametri a Q5_K_M, oltre 100 miliardi a Q3\/Q4.<\/li>\n<li><strong>128 GB unificati (M4 Max):<\/strong> 405 miliardi di parametri a Q4, ma pi\u00f9 lento per token rispetto a Nvidia.<\/li>\n<\/ul>\n<\/div>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_85 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a7459d57478b\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Attiva\/Disattiva<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a7459d57478b\"  aria-label=\"Attiva\/Disattiva\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/it\/vram-requirements-every-major-llm-2026\/#The_quick-reference_table\" >Tabella di riferimento rapido<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/it\/vram-requirements-every-major-llm-2026\/#KV_cache_memory_%E2%80%94_the_part_everyone_forgets\" >Memoria della cache KV \u2014 quella che tutti dimenticano<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/it\/vram-requirements-every-major-llm-2026\/#GPU_compatibility_matrix\" >Matrice di compatibilit\u00e0 GPU<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/it\/vram-requirements-every-major-llm-2026\/#Choosing_the_right_quant_for_your_hardware\" >Come scegliere la quantizzazione adatta al tuo hardware<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/it\/vram-requirements-every-major-llm-2026\/#MoE_models_%E2%80%94_the_asterisk\" >Modelli MoE \u2014 la nota a pi\u00e8 di pagina<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/it\/vram-requirements-every-major-llm-2026\/#Quick-start_setups_by_budget\" >Configurazioni pronte all\u2019uso per diverse fasce di budget<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/it\/vram-requirements-every-major-llm-2026\/#FAQ\" >Domande frequenti<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/it\/vram-requirements-every-major-llm-2026\/#Bottom_line\" >Conclusione<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-9\" href=\"https:\/\/convly.ai\/it\/vram-requirements-every-major-llm-2026\/#Related_articles\" >Articoli correlati<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"The_quick-reference_table\"><\/span>Tabella di riferimento rapido<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Ogni principale LLM open-source del 2026 e i relativi requisiti di VRAM ai comuni livelli di quantizzazione. I valori si riferiscono esclusivamente ai <strong>pesi del modello<\/strong>, con contesto da 8 K. Aggiungere 1\u20132 GB per la cache KV come margine aggiuntivo ogni 8 K di contesto effettivamente utilizzato.<\/p>\n<table class=\"convly-vs\">\n<thead>\n<tr>\n<th>Modello<\/th>\n<th>FP16<\/th>\n<th>Q8_0<\/th>\n<th>Q5_K_M<\/th>\n<th>Q4_K_M<\/th>\n<th>Q3_K_M<\/th>\n<th>IQ2_XXS<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td><strong>Phi-4 Mini (3,8 miliardi)<\/strong><\/td>\n<td>7,6 GB<\/td>\n<td>4,0 GB<\/td>\n<td>2,7 GB<\/td>\n<td>2,3 GB<\/td>\n<td>1,9 GB<\/td>\n<td>1,4 GB<\/td>\n<\/tr>\n<tr>\n<td><strong>Gemma 2 da 2 miliardi<\/strong><\/td>\n<td>5,0 GB<\/td>\n<td>2,7 GB<\/td>\n<td>1,8 GB<\/td>\n<td>1,6 GB<\/td>\n<td>1,3 GB<\/td>\n<td>1,0 GB<\/td>\n<\/tr>\n<tr>\n<td><strong>Llama 3 8B<\/strong><\/td>\n<td>16,1 GB<\/td>\n<td>8,5 GB<\/td>\n<td>5,7 GB<\/td>\n<td>4,9 GB<\/td>\n<td>4,0 GB<\/td>\n<td>2,9 GB<\/td>\n<\/tr>\n<tr>\n<td><strong>Mistral 7B v0.3<\/strong><\/td>\n<td>14,5 GB<\/td>\n<td>7,7 GB<\/td>\n<td>5,1 GB<\/td>\n<td>4,4 GB<\/td>\n<td>3,6 GB<\/td>\n<td>2,6 GB<\/td>\n<\/tr>\n<tr>\n<td><strong>Qwen 2.5 7B<\/strong><\/td>\n<td>15,2 GB<\/td>\n<td>8,1 GB<\/td>\n<td>5,4 GB<\/td>\n<td>4,7 GB<\/td>\n<td>3,8 GB<\/td>\n<td>2,7 GB<\/td>\n<\/tr>\n<tr>\n<td><strong>Phi-4 (14 B)<\/strong><\/td>\n<td>28,0 GB<\/td>\n<td>14,9 GB<\/td>\n<td>10,0 GB<\/td>\n<td>8,5 GB<\/td>\n<td>7,0 GB<\/td>\n<td>5,0 GB<\/td>\n<\/tr>\n<tr>\n<td><strong>Qwen 2.5 14B<\/strong><\/td>\n<td>29,5 GB<\/td>\n<td>15,7 GB<\/td>\n<td>10,5 GB<\/td>\n<td>9,0 GB<\/td>\n<td>7,4 GB<\/td>\n<td>5,3 GB<\/td>\n<\/tr>\n<tr>\n<td><strong>Mistral Nemo 12B<\/strong><\/td>\n<td>24,5 GB<\/td>\n<td>13,0 GB<\/td>\n<td>8,7 GB<\/td>\n<td>7,5 GB<\/td>\n<td>6,1 GB<\/td>\n<td>4,4 GB<\/td>\n<\/tr>\n<tr>\n<td><strong>Qwen 2.5 32B<\/strong><\/td>\n<td>65,0 GB<\/td>\n<td>34,6 GB<\/td>\n<td>23,0 GB<\/td>\n<td>19,8 GB<\/td>\n<td>16,3 GB<\/td>\n<td>11,6 GB<\/td>\n<\/tr>\n<tr>\n<td><strong>Yi-1.5 34B<\/strong><\/td>\n<td>68,5 GB<\/td>\n<td>36,4 GB<\/td>\n<td>24,3 GB<\/td>\n<td>20,7 GB<\/td>\n<td>17,1 GB<\/td>\n<td>12,2 GB<\/td>\n<\/tr>\n<tr>\n<td><strong>Llama 3 70B<\/strong><\/td>\n<td>141,0 GB<\/td>\n<td>74,9 GB<\/td>\n<td>49,9 GB<\/td>\n<td>42,5 GB<\/td>\n<td>34,7 GB<\/td>\n<td>24,9 GB<\/td>\n<\/tr>\n<tr>\n<td><strong>Qwen 2.5 72B<\/strong><\/td>\n<td>145,0 GB<\/td>\n<td>77,1 GB<\/td>\n<td>51,4 GB<\/td>\n<td>43,8 GB<\/td>\n<td>35,7 GB<\/td>\n<td>25,6 GB<\/td>\n<\/tr>\n<tr>\n<td><strong>Command R+ 104B<\/strong><\/td>\n<td>208,0 GB<\/td>\n<td>110,5 GB<\/td>\n<td>73,8 GB<\/td>\n<td>62,7 GB<\/td>\n<td>51,6 GB<\/td>\n<td>36,8 GB<\/td>\n<\/tr>\n<tr>\n<td><strong>Mistral Large 2 (123B)<\/strong><\/td>\n<td>247,0 GB<\/td>\n<td>131,4 GB<\/td>\n<td>87,5 GB<\/td>\n<td>74,5 GB<\/td>\n<td>61,0 GB<\/td>\n<td>43,6 GB<\/td>\n<\/tr>\n<tr>\n<td><strong>Mixtral 8x22B (141 B)<\/strong><\/td>\n<td>282,0 GB<\/td>\n<td>150,0 GB<\/td>\n<td>100,0 GB<\/td>\n<td>85,1 GB<\/td>\n<td>69,8 GB<\/td>\n<td>49,9 GB<\/td>\n<\/tr>\n<tr>\n<td><strong>DeepSeek V3 (236 B MoE)<\/strong><\/td>\n<td>475,0 GB<\/td>\n<td>252,0 GB<\/td>\n<td>168,5 GB<\/td>\n<td>143,6 GB<\/td>\n<td>117,4 GB<\/td>\n<td>84,1 GB<\/td>\n<\/tr>\n<tr>\n<td><strong>Llama 3.1 405B<\/strong><\/td>\n<td>810,0 GB<\/td>\n<td>431,0 GB<\/td>\n<td>287,0 GB<\/td>\n<td>244,5 GB<\/td>\n<td>200,1 GB<\/td>\n<td>143,0 GB<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Una nota pratica: per un utilizzo quotidiano, <strong>Q4_K_M rappresenta il compromesso consigliato<\/strong> tra dimensione e qualit\u00e0. La perdita di qualit\u00e0 rispetto all'FP16 \u00e8 modesta (incremento tipico della perplessit\u00e0 &lt; 2%) e i risparmi di memoria sono notevoli (~3,3\u00d7 pi\u00f9 piccolo). Q5_K_M offre una qualit\u00e0 marginalmente migliore con un aumento di circa il 17% della memoria occupata. Q3 e IQ2 vanno utilizzati solo in casi di emergenza \u2014 la qualit\u00e0 degrada in modo evidente.\n\n\n\n<h2><span class=\"ez-toc-section\" id=\"KV_cache_memory_%E2%80%94_the_part_everyone_forgets\"><\/span>Memoria della cache KV \u2014 quella che tutti dimenticano<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>I valori indicati sopra si riferiscono esclusivamente ai pesi del modello. La <strong>cache KV<\/strong> \u2014 la memoria attiva necessaria per memorizzare tutti i token della conversazione in corso \u2014 risiede anch\u2019essa nella VRAM e cresce linearmente con la lunghezza del contesto.<\/p>\n<p>Dimensione approssimativa della cache KV per ogni 1K token di contesto, in FP16:<\/p>\n<table class=\"convly-vs\">\n<thead>\n<tr>\n<th>Classe del modello<\/th>\n<th>Cache KV per 1K token<\/th>\n<th>Cache KV per contesto da 32K<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>modelli da 7 a 8 miliardi di parametri<\/td>\n<td>~32 MB<\/td>\n<td>~1,0 GB<\/td>\n<\/tr>\n<tr>\n<td>modelli da 13 a 14 miliardi di parametri<\/td>\n<td>~50 MB<\/td>\n<td>~1,6 GB<\/td>\n<\/tr>\n<tr>\n<td>modelli da 30 a 34 miliardi di parametri<\/td>\n<td>~80 MB<\/td>\n<td>~2,6 GB<\/td>\n<\/tr>\n<tr>\n<td>modelli da 70 a 72 miliardi di parametri<\/td>\n<td>~160 MB<\/td>\n<td>~5,1 GB<\/td>\n<\/tr>\n<tr>\n<td>modelli da 100 a 123 miliardi di parametri<\/td>\n<td>~220 MB<\/td>\n<td>~7,0 GB<\/td>\n<\/tr>\n<tr>\n<td>405 miliardi di parametri<\/td>\n<td>~500 MB<\/td>\n<td>~16,0 GB<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>La quantizzazione della cache KV (un'opzione disponibile in llama.cpp e vLLM nel 2026) riduce questo valore di circa 2\u20134 volte, con un lieve impatto sulla qualit\u00e0. La maggior parte delle configurazioni produttive utilizza attualmente la cache KV in Q8: il costo qualitativo \u00e8 quasi nullo e si ottiene un notevole risparmio di VRAM per contesti lunghi.<\/p>\n<p>Se prevedi di utilizzare un contesto di 32 K o superiore, <strong>includi la cache KV nei tuoi calcoli di VRAM prima di scegliere la GPU<\/strong>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"GPU_compatibility_matrix\"><\/span>Matrice di compatibilit\u00e0 GPU<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Quali modelli trovano spazio comodamente su ciascuna GPU comune, ai quantizzatori raccomandati e con contesto da 8 K? Per \u00abcomodamente\u00bb si intende modello + cache KV + 1 GB di margine di sistema.<\/p>\n<table class=\"convly-vs\">\n<thead>\n<tr>\n<th>GPU<\/th>\n<th>VRAM<\/th>\n<th>Miglior adattamento (Q4_K_M)<\/th>\n<th>Miglior adattamento (Q5_K_M)<\/th>\n<th>Massimo (qualsiasi quantizzazione)<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>RTX 3060 12 GB<\/td>\n<td>12 GB<\/td>\n<td>8 miliardi di parametri<\/td>\n<td>8 miliardi di parametri<\/td>\n<td>14 miliardi di parametri in Q3<\/td>\n<\/tr>\n<tr>\n<td>RTX 4060 Ti 16 GB<\/td>\n<td>16 GB<\/td>\n<td>13 miliardi di parametri<\/td>\n<td>13 miliardi di parametri<\/td>\n<td>30 miliardi di parametri in IQ2<\/td>\n<\/tr>\n<tr>\n<td>RTX 5080 \/ 5070 Ti<\/td>\n<td>16 GB<\/td>\n<td>13 miliardi di parametri<\/td>\n<td>13 miliardi di parametri<\/td>\n<td>30 miliardi di parametri in IQ2<\/td>\n<\/tr>\n<tr>\n<td>RTX 3090 \/ 4090<\/td>\n<td>24 GB<\/td>\n<td>30 miliardi di parametri (Qwen 32B)<\/td>\n<td>30 miliardi di parametri<\/td>\n<td>70 miliardi di parametri in Q3_K_S<\/td>\n<\/tr>\n<tr>\n<td>RX 7900 XTX<\/td>\n<td>24 GB<\/td>\n<td>30 miliardi di parametri<\/td>\n<td>30 miliardi di parametri<\/td>\n<td>70 miliardi di parametri in Q3_K_S<\/td>\n<\/tr>\n<tr>\n<td>RTX 5090<\/td>\n<td>32 GB<\/td>\n<td>70 miliardi di parametri<\/td>\n<td>70 miliardi di parametri (adattamento stretto)<\/td>\n<td>70 miliardi di parametri in Q5_K_M<\/td>\n<\/tr>\n<tr>\n<td>2\u00d7 RTX 3090 \/ 4090<\/td>\n<td>48 GB<\/td>\n<td>70 miliardi di parametri<\/td>\n<td>70 miliardi di parametri<\/td>\n<td>104 miliardi di parametri in Q3<\/td>\n<\/tr>\n<tr>\n<td>RTX A6000 \/ 6000 Ada<\/td>\n<td>48 GB<\/td>\n<td>70 miliardi di parametri<\/td>\n<td>70 miliardi di parametri<\/td>\n<td>104 miliardi di parametri in Q3<\/td>\n<\/tr>\n<tr>\n<td>Mac Studio M4 Max da 64 GB<\/td>\n<td>64 GB di memoria unificata<\/td>\n<td>70 miliardi di parametri<\/td>\n<td>70 miliardi di parametri<\/td>\n<td>123 miliardi di parametri in Q3<\/td>\n<\/tr>\n<tr>\n<td>H100 da 80 GB<\/td>\n<td>80 GB<\/td>\n<td>70 miliardi di parametri (FP16-ish)<\/td>\n<td>104 miliardi di parametri<\/td>\n<td>123 miliardi di parametri in Q4<\/td>\n<\/tr>\n<tr>\n<td>Mac Studio M4 Max da 128 GB<\/td>\n<td>128 GB di memoria unificata<\/td>\n<td>104 miliardi di parametri<\/td>\n<td>123 miliardi di parametri<\/td>\n<td>405 miliardi di parametri in IQ2 (lento)<\/td>\n<\/tr>\n<tr>\n<td>H200 \/ DIGITS<\/td>\n<td>141 GB \/ 128 GB unificati<\/td>\n<td>123 miliardi di parametri<\/td>\n<td>123 miliardi di parametri<\/td>\n<td>405 miliardi di parametri in Q3 (lento)<\/td>\n<\/tr>\n<tr>\n<td>B200<\/td>\n<td>192 GB<\/td>\n<td>123 miliardi di parametri<\/td>\n<td>123 miliardi di parametri<\/td>\n<td>405 miliardi di parametri in Q4 (adattamento stretto)<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>I pattern da memorizzare:<\/p>\n<p>1. <strong>12 GB rappresenta la soglia minima di ingresso.<\/strong> Sotto questo limite, sei costretto a modelli molto piccoli che non giustificano l\u2019uso di una GPU dedicata.<br \/>\n2. <strong>24 GB rappresenta il punto di svolta.<\/strong> \u00c8 il livello pi\u00f9 economico in cui diventa possibile eseguire Llama 3 da 70B (con quantizzazioni compromesse).<br \/>\n3. <strong>32 GB consentono di eseguire correttamente il modello da 70B.<\/strong> Questo \u00e8 l\u2019unico vero motivo per scegliere la RTX 5090 rispetto alla 4090.<br \/>\n4. <strong>48 GB rappresentano un margine confortevole.<\/strong> La maggior parte delle attivit\u00e0 che desideri svolgere vi si adatta perfettamente.<br \/>\n5. <strong>128 GB di memoria unificata costituiscono il tetto per i consumatori.<\/strong> Oltre questa soglia, stai acquistando hardware server.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Choosing_the_right_quant_for_your_hardware\"><\/span>Come scegliere la quantizzazione adatta al tuo hardware<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>La quantizzazione ottimale non \u00e8 sempre \u00abla pi\u00f9 grande che entra nella tua VRAM\u00bb. La qualit\u00e0 conta, e talvolta un modello pi\u00f9 piccolo con una quantizzazione migliore supera un modello pi\u00f9 grande con una quantizzazione peggiore.<\/p>\n<p>Classifica approssimativa della qualit\u00e0 (basata sulla perplexity, valori pi\u00f9 bassi sono migliori):<\/p>\n<ul>\n<li><strong>FP16 \/ BF16<\/strong> \u2014 originale. Riferimento di qualit\u00e0 di base.<\/li>\n<li><strong>Q8_0<\/strong> \u2014 aumento di circa lo 0,3% della perplexity. Praticamente indistinguibile.<\/li>\n<li><strong>Q6_K<\/strong> \u2014 aumento di circa lo 0,5%. Indistinguibile nella pratica.<\/li>\n<li><strong>Q5_K_M<\/strong> \u2014 aumento di circa l\u20191,0%. Leggero calo di qualit\u00e0, ma comunque qualit\u00e0 molto elevata.<\/li>\n<li><strong>Q4_K_M<\/strong> \u2014 aumento del 1,5\u20132,5%. Raccomandata per la maggior parte degli utenti.<\/li>\n<li><strong>Q4_K_S<\/strong> \u2014 aumento di circa il 3%. Risultato sensibilmente peggiore rispetto a Q4_K_M per dimensioni simili.<\/li>\n<li><strong>Q3_K_M<\/strong> \u2014 aumento del 5\u20138%. Output visibilmente compromesso.<\/li>\n<li><strong>Q3_K_S<\/strong> \u2014 aumento di circa il 10%. Da usare solo se Q4 non entra nella VRAM disponibile.<\/li>\n<li><strong>IQ2_XXS<\/strong> \u2014 aumento del 15\u201325%. Ultima risorsa.<\/li>\n<\/ul>\n<p>Regola generale: <strong>preferisci un modello con meno parametri in Q5_K_M rispetto a un modello pi\u00f9 grande in Q3_K_S<\/strong> per compiti quotidiani. Un Qwen da 32B in Q5 supera generalmente un Llama 3 da 70B in IQ2_XXS su benchmark reali, nonostante quest\u2019ultimo sembri pi\u00f9 impressionante sulla carta.<\/p>\n<p>Eccezione: <strong>attivit\u00e0 di programmazione e ragionamento<\/strong> dove il vantaggio intrinseco in termini di conoscenza del modello pi\u00f9 grande spesso resiste anche a una quantizzazione aggressiva. Per la generazione di codice in particolare, persino una versione Q3_K_S di un modello da 70B pu\u00f2 superare un modello da 30B in Q5_K_M.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"MoE_models_%E2%80%94_the_asterisk\"><\/span>Modelli MoE \u2014 la nota a pi\u00e8 di pagina<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>I modelli Mixture-of-Experts (MoE), come <strong>Mixtral 8x22B<\/strong> e <strong>DeepSeek V3<\/strong> presentano un\u2019asimmetria che confonde i principianti:<\/p>\n<ul>\n<li><strong>VRAM necessaria<\/strong> = numero totale di parametri (poich\u00e9 devi caricare tutti gli esperti)<\/li>\n<li><strong>Calcolo richiesto<\/strong> = numero di parametri attivi per token (molto inferiore)<\/li>\n<\/ul>\n<p>Mixtral 8x22B ha 141 miliardi di parametri totali \/ 39 miliardi attivi. Richiede oltre 80 GB di VRAM per essere eseguito, ma la velocit\u00e0 per token \u00e8 simile a quella di un modello denso da 40 miliardi.<\/p>\n<p>DeepSeek V3 ha 236 miliardi di parametri totali \/ 21 miliardi attivi. Richiede oltre 150 GB di VRAM, ma la velocit\u00e0 di generazione dei token si avvicina a quella di un modello denso da 20 miliardi. \u00c8 per questo che DeepSeek V3 \u00e8 \u00abveloce per le sue dimensioni\u00bb: paghi il costo in termini di VRAM ma ottieni uno sconto sul carico computazionale.<\/p>\n<p>Se il tuo hardware riesce a ospitare un modello MoE, \u00e8 spesso la scelta migliore. Se non ci riesce, allora il modello denso della stessa classe di parametri \u00e8 ci\u00f2 che ti serve.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Quick-start_setups_by_budget\"><\/span>Configurazioni pronte all\u2019uso per diverse fasce di budget<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Per chi cerca una risposta concreta, ecco configurazioni testate in cinque fasce di budget nel 2026:<\/p>\n<table class=\"convly-vs\">\n<thead>\n<tr>\n<th>Budget<\/th>\n<th>GPU<\/th>\n<th>Modello migliore<\/th>\n<th>Token\/sec<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>$300<\/td>\n<td>RTX 3060 12 GB<\/td>\n<td>Llama 3 8B Q5_K_M<\/td>\n<td>~48<\/td>\n<\/tr>\n<tr>\n<td>$700<\/td>\n<td>RTX 3090 usata<\/td>\n<td>Qwen 2.5 32B Q5_K_M<\/td>\n<td>~28<\/td>\n<\/tr>\n<tr>\n<td>$1,300<\/td>\n<td>RTX 4090 usata<\/td>\n<td>Llama 3 da 70B in Q3_K_S<\/td>\n<td>~13<\/td>\n<\/tr>\n<tr>\n<td>$1,400<\/td>\n<td>2\u00d7 RTX 3090 usate + NVLink<\/td>\n<td>Llama 3 70B Q4_K_M<\/td>\n<td>~15<\/td>\n<\/tr>\n<tr>\n<td>$2,400<\/td>\n<td>RTX 5090<\/td>\n<td>Llama 3 70B Q5_K_M<\/td>\n<td>~18<\/td>\n<\/tr>\n<tr>\n<td>$5,000<\/td>\n<td>Mac Studio M4 Max da 128 GB<\/td>\n<td>Mistral Large 2 in Q4<\/td>\n<td>~6<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>La \u00abfascia di miglior rapporto qualit\u00e0-prezzo\u00bb nel 2026 rimane ancora l\u2019RTX 3090 o 4090 usata: sono le uniche GPU consumer per cui il rapporto prezzo\/VRAM \u00e8 favorevole, e entrambe rimarranno performanti almeno fino al 2028.<\/p>\n<p>Per un\u2019analisi approfondita sulla scelta della GPU pi\u00f9 adatta, consulta <a href=\"\/it\/best-gpus-for-local-llms-2026\/\">le migliori GPU per LLM locali nel 2026<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"FAQ\"><\/span>Domande frequenti<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Quanta VRAM mi serve per eseguire Llama 3 da 70B in locale nel 2026?<\/h3>\n<p>Minimo 24 GB per Llama 3 da 70B in Q3_K_S (qualit\u00e0 scadente). Con 32 GB puoi eseguire comodamente Q4_K_M (la quantizzazione raccomandata). Servono 40+ GB per Q5_K_M. Con 24 GB e contesto da 8K hai praticamente zero margine; portare il contesto a 32K richiede l\u2019offload sulla CPU o una quantizzazione pi\u00f9 aggressiva.<\/p>\n<h3>Qual \u00e8 la differenza tra Q4_K_M e Q4_K_S?<\/h3>\n<p>Entrambe sono quantizzazioni a 4 bit dello stesso modello. Q4_K_M (\u00abmedium\u00bb) utilizza 5 bit per alcuni gruppi critici di pesi, rendendola leggermente pi\u00f9 grande ma di qualit\u00e0 sensibilmente migliore rispetto a Q4_K_S (\u00absmall\u00bb). A parit\u00e0 quasi identica di utilizzo di VRAM, Q4_K_M \u00e8 preferibile. Q4_K_S ha senso solo quando stai cercando di far entrare un modello in un budget di VRAM estremamente ristretto.<\/p>\n<h3>Posso eseguire un LLM pi\u00f9 grande della mia VRAM?<\/h3>\n<p>S\u00ec \u2014 utilizzando <strong>l\u2019offload sulla CPU<\/strong>l'offload su CPU, in cui alcuni strati del modello vengono eseguiti sulla CPU utilizzando la RAM di sistema invece della VRAM della GPU. La penalit\u00e0 in termini di prestazioni \u00e8 severa (5\u201310 volte pi\u00f9 lento), ma consente di eseguire modelli che altrimenti non entrerebbero nella memoria disponibile. Pratico per un utilizzo occasionale, estremamente scomodo come strumento quotidiano. Sia llama.cpp che Ollama supportano questa funzionalit\u00e0 nativamente tramite l'impostazione <code>n_gpu_layers<\/code> .<\/p>\n<h3>Il cache KV ha davvero un impatto sulla pianificazione della VRAM?<\/h3>\n<p>S\u00ec, soprattutto con contesti lunghi. Per Llama 3 da 70 miliardi di parametri a contesto da 32 K, il solo cache KV occupa circa 5 GB. Se sei gi\u00e0 al limite della tua VRAM, andrai in out-of-memory (OOM) non appena una conversazione si allungher\u00e0. Pianifica lo spazio necessario per il cache KV e considera la quantizzazione Q8 per il cache KV (opzione disponibile nei moderni motori di inferenza), che ne riduce approssimativamente a met\u00e0 l\u2019occupazione.<\/p>\n<h3>Esiste un modo per eseguire Llama 3 da 405 miliardi di parametri a casa?<\/h3>\n<p>S\u00ec, ma hai bisogno di oltre 200 GB di memoria a quantizzazioni utilizzabili. Le soluzioni realistiche per il 2026 sono: Mac Studio M4 Ultra con 512 GB ($12.000, lento per token ma funzionante), 8\u00d7 RTX 4090 ($13.000, configurazione complessa), Nvidia DIGITS ($3.000, progettato appositamente per questo scopo) oppure una combinazione CPU + 256 GB di RAM DDR5 con GPU di fascia media per un offload parziale ($8.000, lento). Consulta la nostra <a href=\"\/it\/running-llama-3-405b-at-home-real-cost\/\">guida passo-passo per eseguire Llama 3 da 405 miliardi di parametri a casa<\/a>.<\/p>\n<h3>Esistono formati di quantizzazione per il 2026, oltre a GGUF, di cui dovrei essere a conoscenza?<\/h3>\n<p>S\u00ec \u2014 <strong>AWQ<\/strong> (Activation-aware Weight Quantization) e <strong>GPTQ<\/strong> sono ancora ampiamente utilizzati, specialmente per i deployment basati su vLLM e TensorRT-LLM. In alcuni casi offrono una qualit\u00e0 leggermente superiore rispetto a GGUF allo stesso numero di bit. Per l\u2019uso consumer locale di LLM con llama.cpp \/ Ollama \/ LM Studio, GGUF rimane il formato dominante nel 2026 grazie alla sua semplicit\u00e0 e al vasto supporto strumentale.<\/p>\n<h3>La quantizzazione Q4 influenzer\u00e0 le capacit\u00e0 di scrittura del codice?<\/h3>\n<p>Meno di quanto si possa pensare, ma s\u00ec. Per il completamento diretto del codice, Q4_K_M \u00e8 essenzialmente identico a FP16. Per ragionamenti complessi in pi\u00f9 passaggi su un intero codebase, Q4 produce occasionalmente logiche meno accurate rispetto a Q5+. Se utilizzi modelli locali per attivit\u00e0 di programmazione impegnative, preferisci Q5_K_M e scegli l\u2019hardware in grado di supportarlo.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Bottom_line\"><\/span>Conclusione<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>La pianificazione della VRAM per gli LLM locali nel 2026 non \u00e8 complicata, ma premia la precisione. Scegli prima la classe di parametri (la dimensione del modello che offre le capacit\u00e0 di cui hai bisogno), quindi la quantizzazione pi\u00f9 leggera che garantisca una qualit\u00e0 accettabile (Q4_K_M \u00e8 generalmente la scelta giusta), aggiungi poi lo spazio richiesto dal cache KV in base alla lunghezza effettiva del contesto che prevedi di usare, e infine seleziona la GPU in base a tale stima.<\/p>\n<p>Se dovessi ricordare solo tre numeri, questi sono:<\/p>\n<ul>\n<li><strong>12 GB<\/strong> gestisce agevolmente modelli da 8 miliardi di parametri.<\/li>\n<li><strong>24 GB<\/strong> gestisce modelli da 30 miliardi di parametri a quantizzazioni di qualit\u00e0, mentre quelli da 70 miliardi risultano appena sufficienti.<\/li>\n<li><strong>32 GB<\/strong> gestisce modelli da 70 miliardi di parametri a quantizzazioni di qualit\u00e0.<\/li>\n<\/ul>\n<p>Oltre i 32 GB si entra nel territorio dei server, mentre sotto i 12 GB si entra nel campo dei dispositivi mobili o embedded. La maggior parte delle attivit\u00e0 locali con LLM nel 2026 avviene nella fascia 12\u201332 GB, che corrisponde esattamente alla gamma delle GPU consumer \u2014 non per caso, ma per progettazione.<\/p>\n<p><!--related-block--><\/p>\n<div class=\"convly-related\">\n<h2><span class=\"ez-toc-section\" id=\"Related_articles\"><\/span>Articoli correlati<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<ul>\n<li><a href=\"https:\/\/convly.ai\/it\/claude-opus-4-8-vs-claude-sonnet-4-6\/\">Claude Opus 4.8 vs Claude Sonnet 4.6: Specs, Pricing &amp; Which to Choose (2026)<\/a><\/li>\n<li><a href=\"https:\/\/convly.ai\/it\/open-source-llm-leaderboard-hardware-2026\/\">Classifica dei modelli linguistici di grandi dimensioni open source 2026: Hardware necessario per eseguire ciascun modello top<\/a><\/li>\n<li><a href=\"https:\/\/convly.ai\/it\/claude-5-new-ai-models-june-2026\/\">Esiste un Claude 5? Claude Fable 5 e tutti i principali modelli IA di giugno 2026<\/a><\/li>\n<li><a href=\"https:\/\/convly.ai\/it\/veo-3-vs-kling-3-for-ai-video-2026\/\">Veo 3.1 vs Kling 3.0 per i video AI nel 2026: quale vince in termini di realismo?<\/a><\/li>\n<\/ul>\n<\/div>","protected":false},"excerpt":{"rendered":"<p>The complete VRAM cheat sheet for every major open LLM in 2026 \u2014 at every common quantization level \u2014 plus a matrix showing which models fit on 12, 16, 24, 32, 48, and 80 GB GPUs.<\/p>","protected":false},"author":1,"featured_media":2002,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[247],"tags":[289,290,288,287,285,286],"class_list":["post-264","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-benchmarks","tag-ggml","tag-gguf","tag-gpu-vram-for-ai","tag-llama-3-vram","tag-llm-vram","tag-quantization"],"_links":{"self":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts\/264","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/comments?post=264"}],"version-history":[{"count":2,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts\/264\/revisions"}],"predecessor-version":[{"id":1458,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts\/264\/revisions\/1458"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/media\/2002"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/media?parent=264"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/categories?post=264"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/tags?post=264"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}