Tuesday, 18 August 2026 | Updating Daily AI insight, written for builders

Elenco modelli Ollama (2026): tutti i modelli popolari, dimensioni e RAM richieste

Aggiornato · Originariamente pubblicato il 3 luglio 2026

Se esegui modelli in locale, la libreria Ollama è la fonte principale della maggior parte di essi — ma cambia costantemente e i nomi sono criptici. Questa è una pratica Elenco modelli Ollama per il 2026: i modelli effettivamente utilizzati dagli utenti, la memoria necessaria per ciascuno e le loro caratteristiche principali, oltre a istruzioni su come elencare i modelli già presenti sul proprio sistema ed eseguire il download di nuovi. Per impostazione predefinita, Ollama scarica una versione quantizzata a 4 bit, motivo per cui un modello da "70B" può essere eseguito su una workstation performante e uno da "8B" su un laptop. Le dimensioni indicate sono approssimative e corrispondono alle configurazioni predefinite — verificare sempre la Database di modelli IA documentazione ufficiale ollama list o eseguire il comando

Riferimento rapido

  • Eseguibile su qualsiasi laptop (8 GB di RAM): Llama 3.2 3B, Phi-3 Mini, Gemma 3 4B — small, fast, offline.
  • Migliore compromesso (16 GB di RAM): Llama 3.1 8B, Qwen 2.5 7B, Mistral 7B — the sweet spot for most people.
  • Alta qualità (32 GB+ / GPU): Gemma 2 27B, Qwen 2.5 32B, Mixtral 8x7B.
  • Quasi all’avanguardia (workstation / 48 GB+): Llama 3.3 70B, DeepSeek-R1 70B.
  • Ragionamento: DeepSeek-R1 è una versione distillata. Programmazione: Qwen 2.5 Coder, Code Llama. Visione: LLaVA. Embedding: nomic-embed-text.
  • La regola: scegli in base alla memoria disponibile — verifica qualsiasi modello con il nostro strumento gratuito Calcolatore VRAM.

Key Facts

  • Qualsiasi laptop (8 GB di RAM): Llama 3.2 3B, Phi-3 Mini, Gemma 3 4B
  • Il punto ottimale con 16 GB: Llama 3.1 8B, Qwen 2.5 7B, Mistral 7B
  • 32 GB+ o GPU: Gemma 2 27B, Qwen 2.5 32B, Mixtral 8x7B — Workstation da 48 GB+: Llama 3.3 70B, DeepSeek-R1 70B
  • Ollama scarica per impostazione predefinita versioni quantizzate a 4 bit — ecco perché un modello da "70B" può essere eseguito su una buona workstation
  • Modelli specializzati: Qwen 2.5 Coder (codice) · LLaVA (visione) · nomic-embed-text (embedding) · versioni distillate di DeepSeek-R1 (ragionamento)

I modelli Ollama più popolari a colpo d’occhio

Ogni modello riportato di seguito è disponibile con un semplice comando ollama pull <nome>. «Scarica» indica approssimativamente la dimensione predefinita in formato 4-bit (Q4); «Memoria minima» rappresenta la soglia pratica di RAM di sistema (CPU) o VRAM (GPU) necessaria per eseguirlo agevolmente. Il numero di parametri è esatto; le dimensioni sono approssimative e possono variare con ogni nuova versione.

ModelloParametriScarica (Q4)Memoria minimaIdeale per
Llama 3.21B / 3B~1,3 / 2 GB4–8 GBDispositivi edge, smartphone, chat ultraleggera
Llama 3.18B~4,7 GB8–16 GBMiglior modello piccolo universale
Llama 3.370B~43 GB48 GB+Modello aperto quasi all’avanguardia
Gemma 31B / 4B~0,8 / 3,3 GB4–8 GBPiccolo ed efficiente (Google)
Gemma 29B / 27B~5,4 / 16 GB12–32 GBElevata qualità rapportata alle dimensioni
Qwen 2.50,5B–72B~0,4–47 GB4 GB+Multilingue, ampia gamma di dimensioni
Qwen 2.5 Coder1,5B–32B~1–20 GB8 GB o piùAssistente locale per la programmazione
Mistral7B~4,1 GB8 GBClassico rapido e affidabile
Mistral Nemo12B~7 GB16 GBLungo contesto da 128k
Mixtral8×7B~26 GB32 GB o piùQualità da modello misto (Mixture-of-Experts)
Phi-414B~9 GB16 GBRagionamento in un modello di piccole dimensioni
Phi-3 Mini3,8 miliardi di parametri~2,3 GB8 GBPiccolo ma capace
DeepSeek-R1 (distill)1,5–70 miliardi di parametri~1,1–43 GB8 GB o piùRagionamento passo dopo passo
LLaVA7–34 miliardi di parametri~4,7–20 GB8 GB o piùVisione (comprensione delle immagini)
nomic-embed-text~0,3 GB2 GBEmbedding per RAG/ricerca

Vuoi confrontare questi modelli locali con i modelli cloud in termini di costo e velocità? La Database di modelli IA elenca modelli open source e chiusi affiancati, mentre la Calcolatore dei costi delle API per l'IA mostra quando eseguire localmente risulta più conveniente che pagare per token.

Come elencare i modelli Ollama già installati

Per visualizzare tutti i modelli già presenti sul tuo computer, con le relative dimensioni e la data dell’ultimo utilizzo, esegui:

ollama list

Questo comando stampa il nome, il tag, l’ID univoco e la dimensione di ciascun modello. Per vedere quali modelli sono attualmente caricati in memoria, usa ollama ps; per rimuoverne uno non più necessario e liberare spazio su disco, usa ollama rm <nome>. Questi tre comandi — list, ps e rm — sono tutto ciò che ti serve per gestire una collezione di modelli locali.

Come cercare e scaricare nuovi modelli dalla libreria

Il catalogo completo di Ollama è disponibile nella sua libreria online, e scaricare qualsiasi modello richiede un solo comando:

ollama pull llama3.1  oppure eseguilo direttamente con  ollama run llama3.1

I nomi dei modelli usano i tag per indicare dimensioni e varianti — ad esempio llama3.1:8b, gemma2:27b, qwen2.5:14b. Se ometti il tag, Ollama scarica automaticamente una versione predefinita ragionevole (di solito la variante più popolare quantizzata a 4 bit). Per la prima installazione, la nostra step-by-step Ollama install guida copre Mac, Windows e Linux.

Modelli piccoli — eseguibili su quasi qualsiasi laptop

I modelli da 1 a circa 4 miliardi di parametri funzionano agevolmente su un laptop moderno con 8 GB di RAM, senza necessità di GPU. Llama 3.2 3B, Gemma 3 4B e Phi-3 Mini sono i modelli più apprezzati: veloci, davvero utili per riassumere testi, redigere bozze e rispondere a domande semplici, e abbastanza piccoli da poter essere mantenuti costantemente caricati in memoria. Non eguagliano le prestazioni dei modelli cloud più avanzati, ma per compiti quotidiani privati ed offline sono eccellenti — e rappresentano il punto di partenza ideale per chi si avvicina per la prima volta all’intelligenza artificiale locale.

Modelli di medie dimensioni — il punto ottimale per 16 GB

La classe da 7 a 14 miliardi di parametri è quella in cui la maggior parte degli utenti dovrebbe operare. Llama 3.1 8B, Qwen 2.5 7B e Mistral 7B offrono un netto miglioramento della coerenza rispetto ai modelli più piccoli, pur occupando comodamente al massimo 16 GB di RAM o una GPU mainstream. Phi-4 e Mistral Nemo spingono ulteriormente qualità e lunghezza del contesto. Se cerchi un singolo modello per un uso generico, scegli tra quelli di questa riga: offrono il miglior compromesso tra capacità e richieste hardware.

Modelli grandi — ambito workstation e GPU

A partire dai 27 miliardi di parametri in su, servono hardware di livello professionale. Gemma 2 27B e Qwen 2.5 32B richiede 32 GB o più di RAM; Mixtral 8x7B e i modelli da 70 miliardi di parametri — Llama 3.3 70B e il DeepSeek-R1 70B (distill) — richiedono 48 GB o più di memoria veloce, il che nella pratica significa una GPU con molta VRAM oppure un Mac Apple Silicon dotato di molta RAM. Il vantaggio è una qualità che si avvicina a quella dei grandi modelli cloud, eseguita interamente sulla tua macchina. Consulta la nostra migliori GPU per l'IA guida su quali hardware riescono effettivamente a eseguirli.

Modelli specializzati: programmazione, visione artificiale ed embedding

Oltre alle conversazioni generali, Ollama ospita modelli specializzati per compiti specifici. Qwen 2.5 Coder e Code Llama sono progettati per la programmazione e si integrano bene con gli strumenti IDE locali. LLaVA aggiunge capacità visive, consentendo a un modello di descrivere o ragionare su immagini. I modelli di embedding, come nomic-embed-text e mxbai-embed-large non supportano affatto le conversazioni: trasformano il testo in vettori per la ricerca e la generazione migliorata da recupero (RAG), pilastro di una configurazione RAG locale.

Quale modello Ollama scegliere effettivamente?

La risposta onesta è: il più grande che la tua memoria riesce a contenere nella classe di cui hai bisogno. Per un utilizzo generico, inizia con un modello da 8 miliardi di parametri (8B) e passa a modelli più grandi solo se la qualità non soddisfa le tue aspettative. Per attività di ragionamento, prova una versione distillata di DeepSeek-R1; per la programmazione, Qwen 2.5 Coder; per l’elaborazione di immagini, LLaVA. Nella nostra classifica dei migliori modelli per caso d’uso, presentiamo i migliori modelli LLM locali da eseguire su Ollama, e confrontiamo Ollama stesso con le alternative in Ollama vs LM Studio vs vLLM vs llama.cpp.

Verifica la compatibilità del modello prima dello scaricamento

L’errore più comune è scaricare un modello troppo grande per la propria macchina: in tal caso, o rifiuterà di caricarsi oppure funzionerà in modo estremamente lento, ricorrendo allo scambio di dati con il disco. Prima di scaricare un modello, valutane le dimensioni: in linea generale, un modello quantizzato a 4 bit richiede poco meno di 1 GB di memoria per ogni miliardo di parametri, più una certa quantità di spazio aggiuntivo per gestire il contesto. Il nostro strumento gratuito Calcolatore VRAM fornisce la cifra esatta di memoria necessaria per qualsiasi modello e livello di quantizzazione, mentre Requisiti di sistema di Ollama spiegano in dettaglio il compromesso tra RAM e VRAM.

Domande frequenti

Come elenco i modelli installati in Ollama? Esegui ollama list per visualizzare tutti i modelli installati con le relative dimensioni, ollama ps per verificare quale modello è attualmente caricato e ollama rm <nome> per eliminarne uno.

Qual è il miglior modello Ollama? Non esiste un singolo modello migliore: la scelta dipende dalla quantità di memoria disponibile. Llama 3.1 8B è la scelta più equilibrata per macchine con 16 GB di RAM; consulta la nostra lista classificata per ciascun caso d’uso.

Quanti modelli offre Ollama? Centinaia, appartenenti alle famiglie di modelli per chat, programmazione, visione ed embedding, ciascuna con diverse dimensioni. La tabella sopra riporta i modelli effettivamente utilizzati dalla maggior parte degli utenti.

Di quanta RAM ho bisogno per eseguire i modelli Ollama? 8 GB sono sufficienti per modelli piccoli (1B–4B); 16 GB permettono di eseguire la popolare classe da 7B–8B; per modelli da 27B in su servono invece almeno 32 GB di RAM o una GPU. Verifica i requisiti di qualsiasi modello con il nostro Calcolatore VRAM.

Posso eseguire questi modelli offline? Sì: una volta scaricati, tutti i modelli Ollama girano interamente sulla tua macchina, senza alcuna connessione Internet — ed è proprio questo il principale vantaggio dell’uso di modelli locali.

In sintesi

L’elenco dei modelli Ollama è lungo, ma la scelta è semplice: determina innanzitutto la tua esigenza — chat generica, ragionamento, programmazione, visione o embedding — quindi scegli il modello più grande possibile all’interno di quella categoria, compatibilmente con la memoria disponibile. Inizia con un modello da 8B, usa ollama list per tenere traccia dei modelli installati e consulta sempre il Calcolatore VRAM prima di ogni download, così da evitare di scaricare un modello incompatibile con la tua macchina. Da quel momento, eseguire un’intelligenza artificiale potente, locale e privata richiede soltanto un paio di comandi.

I nomi, le dimensioni e la disponibilità dei modelli cambiano frequentemente; i valori indicati sono stime approssimative basate sulle impostazioni predefinite aggiornate a metà 2026 — verifica sempre le informazioni con ollama list e la libreria ufficiale prima di fare affidamento su di esse.

Scritto da Mustafa Ihsan

Mustafa Ihsan è il fondatore e redattore di Convly.ai. Ha creato e gestisce il database in tempo reale dei modelli IA del sito, il suo indice prezzo-prestazioni e i suoi calcolatori gratuiti per i requisiti di VRAM, i costi delle API e l'economia dell'auto-hosting. Scrive di prezzi dei modelli, risultati di benchmark e dell'hardware necessario per eseguire modelli IA in locale, privilegiando sempre dati misurati rispetto alle affermazioni dei produttori.

Scroll to Top
Featured on There's An AI For That