{"id":790,"date":"2026-06-06T01:59:14","date_gmt":"2026-06-06T01:59:14","guid":{"rendered":"https:\/\/convly.ai\/ollama-system-requirements-2026\/"},"modified":"2026-08-01T06:47:14","modified_gmt":"2026-08-01T06:47:14","slug":"ollama-system-requirements-2026","status":"publish","type":"post","link":"https:\/\/convly.ai\/it\/ollama-system-requirements-2026\/","title":{"rendered":"Requisiti di sistema per Ollama nel 2026: quanta RAM e VRAM ti servono davvero"},"content":{"rendered":"<p>Il motivo pi\u00f9 comune per cui un modello non viene eseguito su Ollama non \u00e8 un bug, bens\u00ec il fatto che il modello \u00e8 pi\u00f9 grande della memoria disponibile. Ollama stesso \u00e8 estremamente leggero; sono i modelli a richiedere risorse hardware. Questa guida fornisce i valori reali di RAM e VRAM necessari per ciascuna dimensione di modello nel 2026, oltre a una semplice formula per capire quali modelli possono essere eseguiti sul proprio sistema <em>prima di<\/em> di dedicare dieci minuti al download di un modello che poi non riuscir\u00e0 a caricarsi.<\/p>\n<p>Se ancora non hai installato Ollama, inizia con la nostra <a href=\"https:\/\/convly.ai\/it\/how-to-install-ollama-2026\/\">guida passo-passo all\u2019installazione<\/a>.<\/p>\n<div class=\"convly-tldr\">\n<h3>Punti chiave<\/h3>\n<ul>\n<li><strong>Regola empirica:<\/strong> un modello quantizzato (Q4) richiede circa <strong>0,6 GB di memoria per ogni miliardo di parametri<\/strong>, pi\u00f9 spazio aggiuntivo per il contesto.<\/li>\n<li><strong>Modelli da 2\u20133 miliardi:<\/strong> eseguibili sulla CPU, con circa 2\u20134 GB di RAM. Funzionano bene anche su un laptop base.<\/li>\n<li><strong>Modelli da 7\u20138 miliardi:<\/strong> circa 6\u20138 GB di RAM\/VRAM. Il compromesso ideale per la maggior parte dei laptop.<\/li>\n<li><strong>Modelli da 27\u201334 miliardi:<\/strong> circa 20\u201324 GB di VRAM. Richiedono una GPU di fascia alta o un chip Apple Silicon dotato di molta memoria unificata.<\/li>\n<li><strong>Modelli da 70 miliardi in su:<\/strong> 40 GB o pi\u00f9 \u2014 necessitano di una GPU workstation, di un sistema multi-GPU o di almeno 64 GB di memoria unificata.<\/li>\n<\/ul>\n<\/div>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_85 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a7458c22f433\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Attiva\/Disattiva<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a7458c22f433\"  aria-label=\"Attiva\/Disattiva\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/it\/ollama-system-requirements-2026\/#Why_memory_is_the_whole_story\" >Perch\u00e9 la memoria \u00e8 l'unico fattore determinante<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/it\/ollama-system-requirements-2026\/#The_simple_formula\" >La formula semplice<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/it\/ollama-system-requirements-2026\/#Requirements_by_model_size\" >Requisiti in base alla dimensione del modello<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/it\/ollama-system-requirements-2026\/#GPU_vs_CPU_vs_Apple_Silicon\" >GPU vs CPU vs Apple Silicon<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/it\/ollama-system-requirements-2026\/#How_to_make_a_big_model_fit\" >Come far funzionare un modello di grandi dimensioni<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/it\/ollama-system-requirements-2026\/#Storage_and_software_prerequisites_people_forget\" >Requisiti di archiviazione e software spesso dimenticati<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/it\/ollama-system-requirements-2026\/#FAQ\" >Domande frequenti<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/it\/ollama-system-requirements-2026\/#Bottom_line\" >Conclusione<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-9\" href=\"https:\/\/convly.ai\/it\/ollama-system-requirements-2026\/#Related_articles\" >Articoli correlati<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"Why_memory_is_the_whole_story\"><\/span>Perch\u00e9 la memoria \u00e8 l'unico fattore determinante<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Per generare testo, i pesi di un modello devono risiedere nella memoria veloce \u2014 ovvero nella VRAM della GPU o nella RAM di sistema se si esegue su CPU. Se il modello non entra nella memoria disponibile, si verifica uno dei due seguenti casi: Ollama sposta parte dei dati nella memoria pi\u00f9 lenta (con conseguente crollo delle prestazioni), oppure rifiuta di caricare il modello mostrando un errore di memoria insufficiente. Tutti gli altri fattori \u2014 velocit\u00e0 della CPU, disco rigido, sistema operativo \u2014 hanno un impatto molto minore rispetto alla disponibilit\u00e0 di memoria adeguata.<\/p>\n<p>Due fattori determinano i requisiti:<\/p>\n<ol>\n<li><strong>Numero di parametri<\/strong> \u2014 un modello da 7 miliardi ha 7 miliardi di pesi; un modello da 70 miliardi ne ha dieci volte di pi\u00f9.<\/li>\n<li><strong>Quantizzazione<\/strong> \u2014 Ollama utilizza pesi compressi nel formato GGUF. Una quantizzazione a 4 bit (Q4) riduce approssimativamente della met\u00e0 l'occupazione di memoria rispetto a una quantizzazione a 8 bit, con una perdita di qualit\u00e0 minima; per questo motivo rappresenta la scelta predefinita ottimale.<\/li>\n<\/ol>\n<h2><span class=\"ez-toc-section\" id=\"The_simple_formula\"><\/span>La formula semplice<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Per un modello quantizzato a 4 bit \u2014 quello che Ollama scarica di default \u2014 stima:<\/p>\n<blockquote>\n<p><strong>Memoria necessaria \u2248 (parametri in miliardi) \u00d7 0,6 GB + sovraccarico per il contesto<\/strong><\/p>\n<\/blockquote>\n<p>Quindi un modello da 7 miliardi richiede circa 4\u20135 GB, uno da 13 miliardi circa 8 GB, uno da 27 miliardi circa 18\u201320 GB e uno da 70 miliardi 40 GB o pi\u00f9. Aggiungi un po' di spazio aggiuntivo per la cache KV, che aumenta con la lunghezza delle conversazioni. Lascia sempre qualche gigabyte di margine per il sistema operativo.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Requirements_by_model_size\"><\/span>Requisiti in base alla dimensione del modello<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<table class=\"convly-vs\">\n<thead>\n<tr>\n<th>Dimensione del modello<\/th>\n<th>Memoria (Q4)<\/th>\n<th>Eseguibile su<\/th>\n<th>Esempi di modelli<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>2\u20133 miliardi<\/td>\n<td>~2\u20134 GB<\/td>\n<td>CPU \/ qualsiasi laptop<\/td>\n<td>Gemma2 2B, Phi-4 mini<\/td>\n<\/tr>\n<tr>\n<td>7\u20138 miliardi<\/td>\n<td>~6\u20138 GB<\/td>\n<td>GPU entry-level \/ laptop da 16 GB<\/td>\n<td>DeepSeek-R1 7B, Llama 3.3 8B<\/td>\n<\/tr>\n<tr>\n<td>13\u201314 miliardi<\/td>\n<td>~10\u201312 GB<\/td>\n<td>GPU di fascia media<\/td>\n<td>Phi-4, Qwen di fascia media<\/td>\n<\/tr>\n<tr>\n<td>27\u201334 miliardi<\/td>\n<td>~18\u201324 GB<\/td>\n<td>GPU high-end \/ Apple Silicon<\/td>\n<td>Gemma 4 26B, Qwen 3.6 27B<\/td>\n<\/tr>\n<tr>\n<td>70 miliardi<\/td>\n<td>~40\u201348 GB<\/td>\n<td>Workstation \/ multi-GPU<\/td>\n<td>Classe Llama 70B<\/td>\n<\/tr>\n<tr>\n<td>200 miliardi+ (MoE)<\/td>\n<td>100 GB+<\/td>\n<td>Server \/ memoria unificata molto capiente<\/td>\n<td>Qwen3 235B-A22B<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Per un\u2019analisi pi\u00f9 approfondita relativa a modelli specifici, consulta la nostra guida su <a href=\"https:\/\/convly.ai\/it\/vram-requirements-every-major-llm-2026\/\">Requisiti di VRAM per ogni principale modello linguistico di grandi dimensioni (LLM)<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"GPU_vs_CPU_vs_Apple_Silicon\"><\/span>GPU vs CPU vs Apple Silicon<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p><strong>GPU NVIDIA<\/strong> \u2014 lo standard di riferimento. La VRAM rappresenta il limite fisso: il modello deve entrare interamente nella memoria della tua scheda per funzionare velocemente. Una scheda da 24 GB (RTX 4090\/5090) esegue comodamente modelli fino a ~27\u201334 miliardi di parametri.<\/p>\n<p><strong>Solo CPU<\/strong> \u2014 funziona con modelli piccoli (2\u20138 miliardi), ma \u00e8 molto pi\u00f9 lenta, poich\u00e9 la larghezza di banda della RAM di sistema non pu\u00f2 competere con quella di una GPU. \u00c8 perfettamente adeguata per compiti leggeri su un laptop senza GPU dedicata.<\/p>\n<p><strong>Apple Silicon<\/strong> \u2014 un caso particolare, e di grande efficacia. Poich\u00e9 i Mac utilizzano una memoria <em>memoria unificata<\/em> condivisa tra CPU e GPU, un Mac da 64 GB pu\u00f2 caricare modelli che richiederebbero un costoso PC multi-GPU. Dalla versione v0.19 di Ollama (marzo 2026), con l\u2019introduzione del backend MLX, le prestazioni su Apple Silicon sono notevolmente migliorate, rendendo un Mac con molta memoria una delle migliori soluzioni monoblocco disponibili per l\u2019esecuzione locale di LLM. Per un confronto con una GPU dedicata, vedi <a href=\"https:\/\/convly.ai\/it\/amd-strix-halo-vs-apple-m4-pro\/\">Strix Halo vs Apple M4 Pro<\/a>.<\/p>\n<p><strong>GPU AMD<\/strong> \u2014 supportata tramite ROCm. Funziona bene per l\u2019inferenza nel 2026; consulta la nostra <a href=\"https:\/\/convly.ai\/it\/amd-rocm-vs-nvidia-cuda-2026\/\">Confronto tra ROCm e CUDA<\/a> per lo stato aggiornato.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"How_to_make_a_big_model_fit\"><\/span>Come far funzionare un modello di grandi dimensioni<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Se il modello che desideri supera di poco la tua capacit\u00e0 di memoria, hai diverse opzioni prima di arrenderti:<\/p>\n<ul>\n<li><strong>Usa una quantizzazione pi\u00f9 leggera<\/strong> \u2014 scarica una variante <code>q4<\/code> o addirittura <code>q3<\/code> invece di <code>q8<\/code>. Si sacrifica un po\u2019 di qualit\u00e0 in cambio di un notevole risparmio di memoria.<\/li>\n<li><strong>Scegli un modello pi\u00f9 piccolo<\/strong> \u2014 un modello ben scelto da 8 miliardi spesso supera un modello da 27 miliardi che fatica a girare e viene parzialmente spostato in memoria swap.<\/li>\n<li><strong>Riduci la finestra contestuale<\/strong> \u2014 un contesto pi\u00f9 piccolo richiede meno memoria per la cache KV.<\/li>\n<li><strong>Chiudi le altre applicazioni<\/strong> \u2014 su una macchina con CPU o memoria unificata, la RAM libera \u00e8 il tuo budget.<\/li>\n<\/ul>\n<p>Per scegliere un modello adatto al tuo hardware, consulta la sezione <a href=\"https:\/\/convly.ai\/it\/best-local-llms-to-run-on-ollama-2026\/\">migliori modelli linguistici di grandi dimensioni locali da eseguire su Ollama<\/a>.<\/p>\n<p><!--ai-enriched--><\/p>\n<h2><span class=\"ez-toc-section\" id=\"Storage_and_software_prerequisites_people_forget\"><\/span>Requisiti di archiviazione e software spesso dimenticati<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>RAM e VRAM attirano tutta l\u2019attenzione, ma due requisiti meno evidenti causano pi\u00f9 problemi delle prime installazioni rispetto a qualsiasi altro fattore: lo spazio su disco e lo stack software sottostante. Se questi elementi non sono configurati correttamente, Ollama rifiuta l\u2019installazione oppure fallisce a met\u00e0 del download di un modello.<\/p>\n<p><strong>Spazio su disco.<\/strong> Il binario di Ollama \u00e8 molto leggero: prevedi circa <strong>4&nbsp;GB<\/strong> per l\u2019installazione. Sono invece i modelli a occupare la maggior parte dello spazio su disco. Ogni modello viene scaricato una sola volta e memorizzato nella cache su disco, quindi caricato in memoria all\u2019avvio; pertanto hai bisogno di spazio sufficiente per memorizzare integralmente i pesi del modello, oltre a quanto gi\u00e0 disponibile sul tuo disco. Come linea guida approssimativa per la quantizzazione comune a 4 bit:<\/p>\n<ul>\n<li><strong>Un modello da 8 miliardi di parametri (8B)<\/strong> (es. Llama 3.1 8B): circa 5&nbsp;GB su disco.<\/li>\n<li><strong>Un modello da 20 miliardi di parametri (classe 20B):<\/strong> circa 12\u201314&nbsp;GB.<\/li>\n<li><strong>Un modello da 70 miliardi di parametri (70B):<\/strong> circa 40&nbsp;GB.<\/li>\n<li><strong>Un modello MoE molto grande<\/strong> (classe Llama&nbsp;4): 65&nbsp;GB o pi\u00f9.<\/li>\n<\/ul>\n<p>Questi valori si accumulano rapidamente. Una collezione casuale di alcuni modelli richiede gi\u00e0 30\u201380&nbsp;GB; mantenere diverse varianti di grandi dimensioni ti porter\u00e0 facilmente oltre i 200&nbsp;GB. Un SSD da 512&nbsp;GB rappresenta un minimo ragionevole se prevedi di accumulare modelli.<\/p>\n<p><strong>Utilizza un SSD, preferibilmente NVMe.<\/strong> Poich\u00e9 i pesi vengono letti dal disco nella RAM o nella VRAM ogni volta che un modello viene caricato per la prima volta, un disco meccanico lento si traduce direttamente in tempi di avvio prolungati: un modello da 40&nbsp;GB impiega molto tempo per caricarsi da un disco rotante. Un\u2019archiviazione veloce non influisce sulla velocit\u00e0 di generazione dei token (tokens-per-second) una volta che il modello \u00e8 caricato, ma rende istantanea la risposta al primo prompt anzich\u00e9 causare un\u2019attesa di 30 secondi.<\/p>\n<p><strong>Sistema operativo e driver.<\/strong> Ollama funziona nativamente su tutte e tre le piattaforme, ma ciascuna ha un requisito minimo:<\/p>\n<ul>\n<li><strong>macOS:<\/strong> versione 11 (Big Sur) o successiva, sia su Apple Silicon che su Intel.<\/li>\n<li><strong>Windows:<\/strong> Windows 10 22H2 o versione successiva (Home o Pro), su x86_64 e ARM64 \u2014 quindi i dispositivi con processore Snapdragon lo eseguono nativamente, senza emulazione x86.<\/li>\n<li><strong>Linux:<\/strong> la maggior parte delle distribuzioni moderne (Ubuntu 18.04+, Debian, Fedora, RHEL, Arch).<\/li>\n<\/ul>\n<p>Per l\u2019accelerazione GPU \u00e8 inoltre necessario disporre di driver aggiornati: un driver NVIDIA recente \u2014 <strong>versione 531 o successiva<\/strong> (e versione 570 o successiva per le schede pi\u00f9 vecchie delle serie Maxwell e Pascal) \u2014 per CUDA, oppure uno stack di driver compatibile con Vulkan o ROCm v7 per le GPU AMD Radeon. Se i driver mancano, Ollama ricade automaticamente e silenziosamente sulla CPU \u2014 questa \u00e8 la causa pi\u00f9 comune per cui un sistema dotato di una \u00abbuona GPU\u00bb mostra prestazioni scadenti.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"FAQ\"><\/span>Domande frequenti<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Quanta RAM mi serve per eseguire Ollama?<\/h3>\n<p>Dipende interamente dal modello. Ollama stesso richiede quasi nulla; \u00e8 il modello a stabilire il requisito. Come regola generale, un modello quantizzato a 4 bit necessita di circa 0,6 GB per ogni miliardo di parametri \u2014 quindi ~4\u20135 GB per un modello da 7 miliardi, ~8 GB per uno da 13 miliardi e 40 GB+ per uno da 70 miliardi. Lascia sempre qualche gigabyte libero per il sistema operativo.<\/p>\n<h3>Posso eseguire Ollama senza GPU?<\/h3>\n<p>S\u00ec. I modelli piccoli (2\u20138 miliardi) funzionano bene sulla CPU, anche se pi\u00f9 lentamente rispetto a una GPU. Un modello come Gemma2 2B richiede solo circa 1,7 GB di RAM ed \u00e8 utilizzabile anche su laptop base. Per modelli superiori ai ~13 miliardi, una GPU o un Apple Silicon con memoria unificata fa davvero la differenza.<\/p>\n<h3>Quanta VRAM mi serve per un modello da 7 miliardi?<\/h3>\n<p>Circa 6\u20138 GB per un modello da 7 miliardi quantizzato a 4 bit, inclusi i margini per il contesto. Questo si adatta comodamente alla maggior parte delle GPU discrete entry-level e ai laptop dotati di 16 GB di memoria unificata o di sistema.<\/p>\n<h3>Perch\u00e9 Ollama gira cos\u00ec lentamente?<\/h3>\n<p>Quasi sempre perch\u00e9 il modello non entra interamente nella VRAM della tua GPU, quindi parte di esso viene spostata nella RAM di sistema o sulla CPU. Verifica con <code>ollama ps<\/code> \u2014 se mostra un alto utilizzo della CPU, passa a un modello pi\u00f9 piccolo o a una quantizzazione pi\u00f9 aggressiva, in modo che l\u2019intero modello entri nella memoria veloce.<\/p>\n<h3>\u00c8 un Mac adatto all\u2019esecuzione di Ollama?<\/h3>\n<p>S\u00ec, spesso eccellente. La memoria unificata di Apple Silicon consente a un Mac da 64 GB di eseguire modelli <a href=\"https:\/\/convly.ai\/it\/llm-vram-calculator\/\" data-wpil-monitor-id=\"62\">che altrimenti richiederebbero un costoso PC con pi\u00f9 GPU, e il backend MLX (dalla versione v0.19) li rende anche veloci. Un Mac con molta memoria \u00e8 una delle migliori opzioni monomacchina per LLM locali nel 2026.<\/a> that would otherwise need a costly multi-GPU PC, and the MLX backend (since v0.19) made it fast too. A high-memory Mac is one of the best single-machine options for local LLMs in 2026.<\/p>\n<h3>Quanto spazio su disco serve per Ollama?<\/h3>\n<p>Prevedi circa 4&nbsp;GB per l\u2019installazione di Ollama stesso, quindi aggiungi la dimensione di ciascun modello che scarichi. Con la quantizzazione a 4 bit, un modello da 8B occupa circa 5&nbsp;GB, uno da 70B circa 40&nbsp;GB e i modelli pi\u00f9 grandi superano i 65&nbsp;GB. Una configurazione tipica con pi\u00f9 modelli richiede tra 30 e 80&nbsp;GB, quindi un SSD da 512&nbsp;GB rappresenta un punto di partenza confortevole. Si raccomanda fortemente l\u2019uso di un SSD (preferibilmente NVMe), poich\u00e9 i modelli vengono caricati dal disco ogni volta che vengono eseguiti per la prima volta.<\/p>\n<h3>Dove Ollama memorizza i modelli e posso spostarli su un altro disco?<\/h3>\n<p>Per impostazione predefinita, Ollama conserva i modelli scaricati in una cartella nascosta nella tua directory home \u2014 <strong>~\/.ollama<\/strong> su macOS e Linux, e <strong>%HOMEPATH%.ollama<\/strong> su Windows. Se il tuo disco di sistema \u00e8 poco capiente, puoi reindirizzare l\u2019archiviazione verso un disco pi\u00f9 grande o esterno impostando la variabile d\u2019ambiente <strong>OLLAMA_MODELS<\/strong> prima di avviare Ollama. Questa \u00e8 la soluzione pi\u00f9 pulita quando il disco di avvio esaurisce lo spazio disponibile.<\/p>\n<h3>Quali sistemi operativi supporta Ollama?<\/h3>\n<p>Ollama funziona nativamente su macOS 11 (Big Sur) o versione successiva, Windows 10 22H2 o versione successiva (64 bit, inclusi dispositivi ARM64 come i laptop Snapdragon) e la maggior parte delle distribuzioni Linux moderne, quali Ubuntu 18.04+, Fedora e Arch. Per l\u2019accelerazione GPU \u00e8 inoltre necessario disporre di un driver aggiornato \u2014 un driver NVIDIA recente per CUDA, oppure un driver compatibile con ROCm\/Vulkan per AMD \u2014 altrimenti Ollama verr\u00e0 eseguito sulla CPU.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Bottom_line\"><\/span>Conclusione<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Prima di scaricare qualsiasi cosa, fai rapidamente i conti: parametri \u00d7 0,6 GB per un modello quantizzato a 4 bit, pi\u00f9 un margine di sicurezza. Confronta questo valore con la tua VRAM (NVIDIA\/AMD) o con la memoria unificata (Apple), e non incontrerai mai pi\u00f9 frustranti errori di memoria insufficiente. In caso di dubbio, inizia con un modello di una taglia inferiore rispetto a quanto pensi: un modello che entra e gira velocemente batte sempre uno pi\u00f9 grande che procede a passo d\u2019uomo.<\/p>\n<p><!--related-block--><\/p>\n<div class=\"convly-related\">\n<h2><span class=\"ez-toc-section\" id=\"Related_articles\"><\/span>Articoli correlati<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<ul>\n<li><a href=\"https:\/\/convly.ai\/it\/deepseek-v4-flash-vs-gemini-3-5-flash\/\">DeepSeek V4-Flash vs Gemini 3.5 Flash: Specs, Pricing &amp; Which to Choose (2026)<\/a><\/li>\n<li><a href=\"https:\/\/convly.ai\/it\/ollama-vs-jan-2026\/\">Ollama vs Jan: quale applicazione locale per l'IA vince nel 2026?<\/a><\/li>\n<li><a href=\"https:\/\/convly.ai\/it\/lm-studio-complete-guide-2026\/\">LM Studio: la guida completa (2026)<\/a><\/li>\n<li><a href=\"https:\/\/convly.ai\/it\/claude-5-new-ai-models-june-2026\/\">Esiste un Claude 5? Claude Fable 5 e tutti i principali modelli IA di giugno 2026<\/a><\/li>\n<li><a href=\"https:\/\/convly.ai\/it\/llm-hallucinations-complete-guide\/\">Allucinazioni nei modelli linguistici di grandi dimensioni nel 2026: perch\u00e9 si verificano e come evitarle<\/a><\/li>\n<li><a href=\"https:\/\/convly.ai\/it\/prompt-engineering-techniques\/\">Ingegneria dei prompt nel 2026: 12 tecniche che funzionano davvero<\/a><\/li>\n<li><a href=\"https:\/\/convly.ai\/it\/what-is-ollama-complete-guide-2026\/\">Cos\u2019\u00e8 Ollama? La guida completa all\u2019esecuzione locale di modelli linguistici di grandi dimensioni nel 2026<\/a><\/li>\n<\/ul>\n<\/div>","protected":false},"excerpt":{"rendered":"<p>The number-one reason a model fails to run isn&#8217;t a bug \u2014 it&#8217;s memory. Here&#8217;s exactly how much RAM and VRAM each Ollama model size needs, and a formula to know before you download.<\/p>","protected":false},"author":1,"featured_media":1955,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[3],"tags":[642,643,640,644,641,639],"class_list":["post-790","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-llms","tag-local-llm-vram","tag-ollama-gpu","tag-ollama-hardware-requirements","tag-ollama-ram","tag-ollama-requirements","tag-ollama-system-requirements"],"_links":{"self":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts\/790","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/comments?post=790"}],"version-history":[{"count":5,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts\/790\/revisions"}],"predecessor-version":[{"id":1432,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts\/790\/revisions\/1432"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/media\/1955"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/media?parent=790"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/categories?post=790"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/tags?post=790"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}