Il motivo più comune per cui un modello non viene eseguito su Ollama non è un bug, bensì il fatto che il modello è più grande della memoria disponibile. Ollama stesso è estremamente leggero; sono i modelli a richiedere risorse hardware. Questa guida fornisce i valori reali di RAM e VRAM necessari per ciascuna dimensione di modello nel 2026, oltre a una semplice formula per capire quali modelli possono essere eseguiti sul proprio sistema prima di di dedicare dieci minuti al download di un modello che poi non riuscirà a caricarsi.
Se ancora non hai installato Ollama, inizia con la nostra guida passo-passo all’installazione.
Punti chiave
- Regola empirica: un modello quantizzato (Q4) richiede circa 0,6 GB di memoria per ogni miliardo di parametri, più spazio aggiuntivo per il contesto.
- Modelli da 2–3 miliardi: eseguibili sulla CPU, con circa 2–4 GB di RAM. Funzionano bene anche su un laptop base.
- Modelli da 7–8 miliardi: circa 6–8 GB di RAM/VRAM. Il compromesso ideale per la maggior parte dei laptop.
- Modelli da 27–34 miliardi: circa 20–24 GB di VRAM. Richiedono una GPU di fascia alta o un chip Apple Silicon dotato di molta memoria unificata.
- Modelli da 70 miliardi in su: 40 GB o più — necessitano di una GPU workstation, di un sistema multi-GPU o di almeno 64 GB di memoria unificata.
Perché la memoria è l'unico fattore determinante
Per generare testo, i pesi di un modello devono risiedere nella memoria veloce — ovvero nella VRAM della GPU o nella RAM di sistema se si esegue su CPU. Se il modello non entra nella memoria disponibile, si verifica uno dei due seguenti casi: Ollama sposta parte dei dati nella memoria più lenta (con conseguente crollo delle prestazioni), oppure rifiuta di caricare il modello mostrando un errore di memoria insufficiente. Tutti gli altri fattori — velocità della CPU, disco rigido, sistema operativo — hanno un impatto molto minore rispetto alla disponibilità di memoria adeguata.
Due fattori determinano i requisiti:
- Numero di parametri — un modello da 7 miliardi ha 7 miliardi di pesi; un modello da 70 miliardi ne ha dieci volte di più.
- Quantizzazione — Ollama utilizza pesi compressi nel formato GGUF. Una quantizzazione a 4 bit (Q4) riduce approssimativamente della metà l'occupazione di memoria rispetto a una quantizzazione a 8 bit, con una perdita di qualità minima; per questo motivo rappresenta la scelta predefinita ottimale.
La formula semplice
Per un modello quantizzato a 4 bit — quello che Ollama scarica di default — stima:
Memoria necessaria ≈ (parametri in miliardi) × 0,6 GB + sovraccarico per il contesto
Quindi un modello da 7 miliardi richiede circa 4–5 GB, uno da 13 miliardi circa 8 GB, uno da 27 miliardi circa 18–20 GB e uno da 70 miliardi 40 GB o più. Aggiungi un po' di spazio aggiuntivo per la cache KV, che aumenta con la lunghezza delle conversazioni. Lascia sempre qualche gigabyte di margine per il sistema operativo.
Requisiti in base alla dimensione del modello
| Dimensione del modello | Memoria (Q4) | Eseguibile su | Esempi di modelli |
|---|---|---|---|
| 2–3 miliardi | ~2–4 GB | CPU / qualsiasi laptop | Gemma2 2B, Phi-4 mini |
| 7–8 miliardi | ~6–8 GB | GPU entry-level / laptop da 16 GB | DeepSeek-R1 7B, Llama 3.3 8B |
| 13–14 miliardi | ~10–12 GB | GPU di fascia media | Phi-4, Qwen di fascia media |
| 27–34 miliardi | ~18–24 GB | GPU high-end / Apple Silicon | Gemma 4 26B, Qwen 3.6 27B |
| 70 miliardi | ~40–48 GB | Workstation / multi-GPU | Classe Llama 70B |
| 200 miliardi+ (MoE) | 100 GB+ | Server / memoria unificata molto capiente | Qwen3 235B-A22B |
Per un’analisi più approfondita relativa a modelli specifici, consulta la nostra guida su Requisiti di VRAM per ogni principale modello linguistico di grandi dimensioni (LLM).
GPU vs CPU vs Apple Silicon
GPU NVIDIA — lo standard di riferimento. La VRAM rappresenta il limite fisso: il modello deve entrare interamente nella memoria della tua scheda per funzionare velocemente. Una scheda da 24 GB (RTX 4090/5090) esegue comodamente modelli fino a ~27–34 miliardi di parametri.
Solo CPU — funziona con modelli piccoli (2–8 miliardi), ma è molto più lenta, poiché la larghezza di banda della RAM di sistema non può competere con quella di una GPU. È perfettamente adeguata per compiti leggeri su un laptop senza GPU dedicata.
Apple Silicon — un caso particolare, e di grande efficacia. Poiché i Mac utilizzano una memoria memoria unificata condivisa tra CPU e GPU, un Mac da 64 GB può caricare modelli che richiederebbero un costoso PC multi-GPU. Dalla versione v0.19 di Ollama (marzo 2026), con l’introduzione del backend MLX, le prestazioni su Apple Silicon sono notevolmente migliorate, rendendo un Mac con molta memoria una delle migliori soluzioni monoblocco disponibili per l’esecuzione locale di LLM. Per un confronto con una GPU dedicata, vedi Strix Halo vs Apple M4 Pro.
GPU AMD — supportata tramite ROCm. Funziona bene per l’inferenza nel 2026; consulta la nostra Confronto tra ROCm e CUDA per lo stato aggiornato.
Come far funzionare un modello di grandi dimensioni
Se il modello che desideri supera di poco la tua capacità di memoria, hai diverse opzioni prima di arrenderti:
- Usa una quantizzazione più leggera — scarica una variante
q4o addiritturaq3invece diq8. Si sacrifica un po’ di qualità in cambio di un notevole risparmio di memoria. - Scegli un modello più piccolo — un modello ben scelto da 8 miliardi spesso supera un modello da 27 miliardi che fatica a girare e viene parzialmente spostato in memoria swap.
- Riduci la finestra contestuale — un contesto più piccolo richiede meno memoria per la cache KV.
- Chiudi le altre applicazioni — su una macchina con CPU o memoria unificata, la RAM libera è il tuo budget.
Per scegliere un modello adatto al tuo hardware, consulta la sezione migliori modelli linguistici di grandi dimensioni locali da eseguire su Ollama.
Requisiti di archiviazione e software spesso dimenticati
RAM e VRAM attirano tutta l’attenzione, ma due requisiti meno evidenti causano più problemi delle prime installazioni rispetto a qualsiasi altro fattore: lo spazio su disco e lo stack software sottostante. Se questi elementi non sono configurati correttamente, Ollama rifiuta l’installazione oppure fallisce a metà del download di un modello.
Spazio su disco. Il binario di Ollama è molto leggero: prevedi circa 4 GB per l’installazione. Sono invece i modelli a occupare la maggior parte dello spazio su disco. Ogni modello viene scaricato una sola volta e memorizzato nella cache su disco, quindi caricato in memoria all’avvio; pertanto hai bisogno di spazio sufficiente per memorizzare integralmente i pesi del modello, oltre a quanto già disponibile sul tuo disco. Come linea guida approssimativa per la quantizzazione comune a 4 bit:
- Un modello da 8 miliardi di parametri (8B) (e.g. Llama 3.1 8B): about 5 GB on disk.
- Un modello da 20 miliardi di parametri (classe 20B): circa 12–14 GB.
- Un modello da 70 miliardi di parametri (70B): circa 40 GB.
- Un modello MoE molto grande (classe Llama 4): 65 GB o più.
Questi valori si accumulano rapidamente. Una collezione casuale di alcuni modelli richiede già 30–80 GB; mantenere diverse varianti di grandi dimensioni ti porterà facilmente oltre i 200 GB. Un SSD da 512 GB rappresenta un minimo ragionevole se prevedi di accumulare modelli.
Utilizza un SSD, preferibilmente NVMe. Poiché i pesi vengono letti dal disco nella RAM o nella VRAM ogni volta che un modello viene caricato per la prima volta, un disco meccanico lento si traduce direttamente in tempi di avvio prolungati: un modello da 40 GB impiega molto tempo per caricarsi da un disco rotante. Un’archiviazione veloce non influisce sulla velocità di generazione dei token (tokens-per-second) una volta che il modello è caricato, ma rende istantanea la risposta al primo prompt anziché causare un’attesa di 30 secondi.
Sistema operativo e driver. Ollama funziona nativamente su tutte e tre le piattaforme, ma ciascuna ha un requisito minimo:
- macOS: versione 11 (Big Sur) o successiva, sia su Apple Silicon che su Intel.
- Windows: Windows 10 22H2 o versione successiva (Home o Pro), su x86_64 e ARM64 — quindi i dispositivi con processore Snapdragon lo eseguono nativamente, senza emulazione x86.
- Linux: la maggior parte delle distribuzioni moderne (Ubuntu 18.04+, Debian, Fedora, RHEL, Arch).
Per l’accelerazione GPU è inoltre necessario disporre di driver aggiornati: un driver NVIDIA recente — versione 531 o successiva (e versione 570 o successiva per le schede più vecchie delle serie Maxwell e Pascal) — per CUDA, oppure uno stack di driver compatibile con Vulkan o ROCm v7 per le GPU AMD Radeon. Se i driver mancano, Ollama ricade automaticamente e silenziosamente sulla CPU — questa è la causa più comune per cui un sistema dotato di una «buona GPU» mostra prestazioni scadenti.
Domande frequenti
Quanta RAM mi serve per eseguire Ollama?
Dipende interamente dal modello. Ollama stesso richiede quasi nulla; è il modello a stabilire il requisito. Come regola generale, un modello quantizzato a 4 bit necessita di circa 0,6 GB per ogni miliardo di parametri — quindi ~4–5 GB per un modello da 7 miliardi, ~8 GB per uno da 13 miliardi e 40 GB+ per uno da 70 miliardi. Lascia sempre qualche gigabyte libero per il sistema operativo.
Posso eseguire Ollama senza GPU?
Sì. I modelli piccoli (2–8 miliardi) funzionano bene sulla CPU, anche se più lentamente rispetto a una GPU. Un modello come Gemma2 2B richiede solo circa 1,7 GB di RAM ed è utilizzabile anche su laptop base. Per modelli superiori ai ~13 miliardi, una GPU o un Apple Silicon con memoria unificata fa davvero la differenza.
Quanta VRAM mi serve per un modello da 7 miliardi?
Circa 6–8 GB per un modello da 7 miliardi quantizzato a 4 bit, inclusi i margini per il contesto. Questo si adatta comodamente alla maggior parte delle GPU discrete entry-level e ai laptop dotati di 16 GB di memoria unificata o di sistema.
Perché Ollama gira così lentamente?
Quasi sempre perché il modello non entra interamente nella VRAM della tua GPU, quindi parte di esso viene spostata nella RAM di sistema o sulla CPU. Verifica con ollama ps — se mostra un alto utilizzo della CPU, passa a un modello più piccolo o a una quantizzazione più aggressiva, in modo che l’intero modello entri nella memoria veloce.
È un Mac adatto all’esecuzione di Ollama?
Sì, spesso eccellente. La memoria unificata di Apple Silicon consente a un Mac da 64 GB di eseguire modelli che altrimenti richiederebbero un costoso PC con più GPU, e il backend MLX (dalla versione v0.19) li rende anche veloci. Un Mac con molta memoria è una delle migliori opzioni monomacchina per LLM locali nel 2026. that would otherwise need a costly multi-GPU PC, and the MLX backend (since v0.19) made it fast too. A high-memory Mac is one of the best single-machine options for local LLMs in 2026.
Quanto spazio su disco serve per Ollama?
Plan for about 4 GB for the Ollama install itself, then add the size of each model you pull. At 4-bit quantization an 8B model is roughly 5 GB, a 70B is around 40 GB, and the largest models exceed 65 GB. A typical multi-model setup lands between 30 and 80 GB, so a 512 GB SSD is a comfortable starting point. An SSD (preferably NVMe) is strongly recommended, because models load off disk every time you first run them.
Dove Ollama memorizza i modelli e posso spostarli su un altro disco?
Per impostazione predefinita, Ollama conserva i modelli scaricati in una cartella nascosta nella tua directory home — ~/.ollama su macOS e Linux, e %HOMEPATH%.ollama su Windows. Se il tuo disco di sistema è poco capiente, puoi reindirizzare l’archiviazione verso un disco più grande o esterno impostando la variabile d’ambiente OLLAMA_MODELS prima di avviare Ollama. Questa è la soluzione più pulita quando il disco di avvio esaurisce lo spazio disponibile.
Quali sistemi operativi supporta Ollama?
Ollama funziona nativamente su macOS 11 (Big Sur) o versione successiva, Windows 10 22H2 o versione successiva (64 bit, inclusi dispositivi ARM64 come i laptop Snapdragon) e la maggior parte delle distribuzioni Linux moderne, quali Ubuntu 18.04+, Fedora e Arch. Per l’accelerazione GPU è inoltre necessario disporre di un driver aggiornato — un driver NVIDIA recente per CUDA, oppure un driver compatibile con ROCm/Vulkan per AMD — altrimenti Ollama verrà eseguito sulla CPU.
Conclusione
Prima di scaricare qualsiasi cosa, fai rapidamente i conti: parametri × 0,6 GB per un modello quantizzato a 4 bit, più un margine di sicurezza. Confronta questo valore con la tua VRAM (NVIDIA/AMD) o con la memoria unificata (Apple), e non incontrerai mai più frustranti errori di memoria insufficiente. In caso di dubbio, inizia con un modello di una taglia inferiore rispetto a quanto pensi: un modello che entra e gira velocemente batte sempre uno più grande che procede a passo d’uomo.

