Thursday, 6 August 2026 | Updating Daily AI insight, written for builders

I migliori modelli linguistici locali da eseguire su Ollama nel 2026 (ordinati per caso d’uso)

Aggiornato · Originariamente pubblicato il 6 giugno 2026

Ollama può eseguire oltre cento modelli, ed è proprio per questo che molte persone restano bloccate nella scelta. La buona notizia è che ne servono solo pochi. Questa guida ordina i migliori modelli linguistici locali del 2026 in base al compito che intendi svolgere — lavoro generico, programmazione, ragionamento o esecuzione su hardware limitato — indicando anche la quantità di memoria richiesta da ciascuno.

Nuovo qui? Inizia con cos’è Ollama, quindi verifica le caratteristiche del tuo hardware prima di scaricare qualsiasi cosa.

Punti chiave

  • Miglior strumento versatile: Gemma 4 26B A4B — supporto per chiamata di strumenti e visione, eseguibile agevolmente, la scelta più pratica per la maggior parte degli utenti. ollama run gemma4
  • Ideale per la programmazione: Qwen 3.6 27B — il miglior modello denso per la programmazione, con un punteggio del ~77% su SWE-bench; richiede circa 22 GB di VRAM.
  • Ideale per il ragionamento/matematica: DeepSeek-R1 7B — prestazioni migliori nella catena di ragionamento eseguibili su dispositivi di piccole dimensioni.
  • Ideale per hardware limitato: Gemma2 2B — eseguibile con circa 1,7 GB di RAM, perfettamente funzionante anche su un laptop con CPU senza GPU.
  • Licenza commerciale più sicura: Qwen 3 e Gemma 4 sono rilasciati sotto licenza Apache 2.0.

Come scegliere un modello

Tre fattori determinano quale modello sia il «migliore» per te, nell’ordine seguente:

  1. Quali modelli può supportare il tuo hardware? Un modello deve rientrare nella tua RAM o VRAM (nella sua versione quantizzata). Il miglior modello che non puoi eseguire è inutile. Confronta le dimensioni richieste con le specifiche del tuo sistema utilizzando la nostra guida ai requisiti di sistema.
  2. Qual è il compito da svolgere? Programmazione, conversazione generica, ragionamento e elaborazione di documenti richiedono modelli diversi. Un ottimo programmatore non è sempre un ottimo scrittore.
  3. La licenza è importante? Se stai sviluppando un prodotto, preferisci modelli con licenza Apache 2.0 (Qwen 3, Gemma 4) rispetto a quelli con licenze più restrittive.

Miglior modello universale: Gemma 4 26B A4B

Il modello di Google Gemma 4 26B A4B (rilasciato ad aprile 2026) è quello che consiglieremmo alla maggior parte degli utenti. Si tratta di un modello basato su architettura «mixture-of-experts», con supporto integrato per la chiamata di strumenti e la visione artificiale, e offre prestazioni eccellenti rispetto alle sue esigenze di memoria — rendendolo ideale per agenti locali, chiamate di funzioni e output strutturati. È rilasciato con licenza Apache 2.0, quindi puoi utilizzarlo liberamente anche a fini commerciali.

ollama run gemma4

Se cerchi un singolo modello per conversazioni, programmazione leggera, riassunti ed elaborazione tramite agenti, questa è la scelta predefinita più sicura.

Ideale per la programmazione: Qwen 3.6 27B

Per scrivere e ristrutturare codice in locale — senza inviare una singola riga a un'API — Qwen 3.6 27B è il modello di codifica denso più performante che tu possa eseguire localmente, ottenendo circa il 77% su SWE-bench e richiedendo all’incirca 22 GB di VRAM. Se il tuo sistema lo supporta, è la soluzione più vicina a un assistente per la programmazione basato sul cloud che non invia mai dati all’esterno.

Hai hardware più limitato? Passa a una variante più leggera del codificatore Qwen oppure usa Gemma 4. Per un’analisi completa dei modelli specializzati per la programmazione e il loro confronto su compiti reali, consulta la nostra guida sui migliori LLM locali per la programmazione.

Ideale per il ragionamento e la matematica: DeepSeek-R1 7B

DeepSeek-R1 7B è un modello basato sul ragionamento sequenziale (chain-of-thought) che offre le migliori prestazioni locali in ambito matematico e logico nella categoria da 7 miliardi di parametri. Poiché «ragiona» passo dopo passo sui problemi, è la scelta ideale quando la correttezza nella risoluzione di logiche multistep conta più della velocità. Con i suoi 7 miliardi di parametri, gira agevolmente su hardware modesto, rendendolo un modello di ragionamento eccezionalmente accessibile.

ollama run deepseek-r1

Ideale per hardware limitato: Gemma2 2B

Non hai una GPU dedicata? Gemma2 2B è l’opzione più veloce per l’inferenza su CPU e richiede soltanto circa 1,7 GB di RAM. Non vincerà nessun benchmark, ma è effettivamente utilizzabile per riassunti, domande e risposte semplici e stesura di testi anche su un laptop base: la dimostrazione che non serve una workstation per iniziare con l’intelligenza artificiale locale.

Ideale per applicazioni aziendali su larga scala: Qwen3 235B-A22B

Se disponi di hardware potente e desideri un modello open source di ultima generazione con una licenza chiara, Qwen3 235B-A22B è una delle scelte più sicure per ambienti aziendali: un modello misto (Mixture-of-Experts) con 235 miliardi di parametri totali, ma soltanto 22 miliardi attivi per token, rilasciato sotto licenza Apache 2.0. È particolarmente adatto a applicazioni multilingue e prodotti commerciali — purché tu disponga della memoria necessaria per ospitarlo.

Confronto rapido

ModelloIdeale perMemoria approssimativaLicenza
Gemma 4 26B A4BGenerale / agenti / visioneGPU di fascia mediaApache 2.0
Qwen 3.6 27BProgrammazione~22 GB di VRAMApache 2.0
DeepSeek-R1 7BRagionamento / matematicaModestoMIT
Gemma2 2BHardware debole / solo CPU~1,7 GB di RAMLicenza Gemma
Qwen3 235B-A22BAziendale / multilingueMolto elevataApache 2.0

Un semplice percorso decisionale

  • Un modello per ogni esigenza → Gemma 4.
  • Principalmente programmazione, GPU potente → Qwen 3.6 27B.
  • Ragionamento complesso o matematica → DeepSeek-R1.
  • Vecchio laptop, nessuna GPU → Gemma2 2B.
  • Stai sviluppando un prodotto commerciale → opta per i modelli con licenza Apache 2.0 (Qwen 3, Gemma 4).

Qualunque modello tu scelga, il comando è sempre lo stesso — ollama run <modello> — e puoi tenerne installati diversi contemporaneamente, passando liberamente da uno all’altro. Per eseguirne uno qualsiasi, dovrai prima aver configurato Ollama: ecco la nostra guida passo-passo all’installazione.

Quantizzazione: perché lo stesso modello può richiedere 4 GB o 14 GB

Ogni valore di VRAM indicato in questa guida corrisponde in realtà a una cifra relativa alla quantizzazione. I pesi grezzi di un modello sono distribuiti in precisione a 16 bit (FP16), ma Ollama li comprime prima che vengano eseguiti sul tuo computer — ed è proprio questo livello di compressione, non il numero di parametri da solo, a determinare se un modello entra nella tua memoria. Quando esegui ollama run gemma4 senza specificare un tag, Ollama scarica per impostazione predefinita una versione Q4_K_M costruita con quantizzazione a 4 bit, che rappresenta lo standard di fatto per l’hardware consumer.

I risparmi sono notevoli. Un modello da 7 miliardi di parametri occupa circa 14 GB in FP16, circa 7,7 GB in Q8_0 e soltanto ~4,5 GB in Q4_K_M. È proprio questa quantizzazione a 4 bit predefinita che permette a un modello da 7B specializzato nel ragionamento di adattarsi comodamente su una scheda grafica da 8 GB, e spiega perché i "22 GB" richiesti da un modello da 27B per la programmazione non equivalgono a 50+ GB. Il costo in termini di qualità è inferiore a quanto molti si aspettino: Q4_K_M perde tipicamente solo l'1–3% sui benchmark come MMLU rispetto alla precisione completa — ad esempio, un modello da 7B che ottiene il 73% in FP16 raggiunge circa il 71–72%. Nella pratica ciò si traduce occasionalmente in frasi riformulate, non in risposte errate.

Quando dunque conviene abbandonare la quantizzazione predefinita?

  • Rimani su Q4_K_M per conversazioni, stesura di testi, riassunti e attività generali di agenti. È il miglior compromesso possibile tra qualità e ingombro, punto e basta.
  • Passa a Q8_0 (quasi senza perdita di qualità, ma con un consumo di memoria pressoché raddoppiato) soltanto per la generazione di codice e per compiti di ragionamento particolarmente rigorosi, dove un singolo token errato compromette l’intero output — e solo se disponi di sufficiente VRAM disponibile.
  • Riduci ulteriormente la quantizzazione a Q3 o inferiore solo come ultima risorsa, per far entrare un modello più grande su una scheda con poca VRAM. Percepirai chiaramente la perdita di qualità, e in genere è preferibile optare per un modello più piccolo in Q4 piuttosto che uno più grande in Q3.

Per scaricare un livello specifico, aggiungi il relativo tag al nome del modello: ollama run qwen3.6:27b-q8_0 invece del semplice nome. La regola empirica valida su ogni tipo di hardware è: un modello più grande in Q4 batte quasi sempre un modello più piccolo in Q8 con lo stesso budget di memoria. La quantizzazione è ciò che ti consente di eseguire il modello che desideri davvero: scegli innanzitutto il modello più grande che il tuo sistema riesce a ospitare in Q4_K_M, quindi aumenta la precisione soltanto se la qualità lo richiede e se hai ancora VRAM disponibile.

Domande frequenti

Qual è il miglior modello Ollama nel 2026?

Per la maggior parte degli utenti, Gemma 4 26B A4B: un modello versatile, capace di chiamare strumenti e gestire input visivi, rilasciato con licenza Apache 2.0 e con un impatto sulla memoria ragionevole. Per la programmazione, Qwen 3.6 27B è più performante; per il ragionamento, invece, scegli DeepSeek-R1.

Qual è il miglior LLM locale per hardware entry-level?

Gemma2 2B. Gira con circa 1,7 GB di RAM ed è compatibile con laptop dotati soltanto di CPU. Se hai un po’ più di spazio disponibile, un modello da 7–8 miliardi di parametri come DeepSeek-R1 7B offre una qualità sensibilmente superiore pur restando compatibile con macchine di fascia bassa.

Quale modello locale si avvicina di più a ChatGPT?

I modelli open source più grandi ospitabili localmente — come Qwen3 235B-A22B — riducono notevolmente il divario, ma nei compiti di ragionamento più complessi i migliori modelli cloud di ultima generazione mantengono ancora un vantaggio. Per conversazioni quotidiane, programmazione e elaborazione di documenti, un modello locale ben scelto è più che sufficiente e garantisce la privacy dei tuoi dati.

Ho bisogno di una GPU potente per questi modelli?

Dipende dal modello. Gemma2 2B gira su CPU; un modello da 7 miliardi di parametri è comodo con 8 GB di memoria; Qwen 3.6 27B richiede ~22 GB di VRAM. Scegli il modello adatto al tuo hardware usando la nostra guida ai requisiti di sistema.

Questi modelli sono gratuiti per uso commerciale?

Qwen 3 e Gemma 4 sono rilasciati con licenza Apache 2.0, che consente un utilizzo commerciale senza restrizioni. DeepSeek-R1 ha licenza MIT. Verifica sempre la licenza specifica del modello prima di integrarlo in un prodotto commerciale, poiché i termini possono variare a seconda della versione.

Come faccio a scaricare una versione di qualità superiore e meno compressa di un modello?

Aggiungi il tag relativo alla quantizzazione al nome del modello. ollama run qwen3.6:27b ti fornisce la versione predefinita Q4_K_M; invece ollama run qwen3.6:27b-q8_0 scarica la versione quasi senza perdita di qualità a 8 bit del modello stesso , che richiede all’incirca il doppio della memoria. Visita la pagina del modello su ollama.com per vedere tutti i tag effettivamente pubblicati — la convenzione di denominazione segue lo schema modello:dimensione-quant . Per conversazioni e uso generale la versione predefinita Q4_K_M è la scelta migliore; riserva Q8_0 per la programmazione o per compiti di ragionamento precisi, purché tu abbia VRAM sufficiente da dedicare.

Posso eseguire più modelli contemporaneamente?

Sì, ma condividono la tua memoria. Ollama carica un modello su richiesta e lo mantiene in memoria per alcuni minuti, quindi passare da un modello all’altro — ad esempio da Gemma 4 a DeepSeek-R1 — è istantaneo una volta che entrambi sono installati; tuttavia, eseguirli simultaneamente significa che i loro consumi di memoria si sommano. Su una singola GPU da 8–16 GB, puoi normalmente eseguire un solo modello performante alla volta, lasciando che Ollama li sostituisca automaticamente al momento dell’invocazione. Puoi installarne quanti ne desideri; solo quelli attivi consumano VRAM.

Perché il mio modello rallenta o esaurisce la memoria con documenti lunghi?

Perché il contesto richiede VRAM. Oltre ai pesi del modello stesso, Ollama alloca una cache KV che cresce linearmente con la dimensione della finestra di contesto; inoltre, le versioni moderne di Ollama regolano automaticamente la lunghezza predefinita del contesto in base all’hardware disponibile (circa 4K token con meno di 24 GB di VRAM, fino a 32K con 24–48 GB e addirittura 256K oltre i 48 GB). Inserire un documento molto lungo o una cronologia di chat estesa può aggiungere diversi gigabyte di cache e ridurre drasticamente i token al secondo. Se raggiungi i limiti, accorcia la lunghezza del contesto oppure abilita la quantizzazione della cache KV, che può ridurne l’overhead di circa la metà con un impatto minimo sulla qualità.

Conclusione

Non devi provare cento modelli: ti servono soltanto i quattro o cinque giusti. Usa Gemma 4 come modello predefinito, Qwen 3.6 quando programmi, DeepSeek-R1 quando devi ragionare e Gemma2 2B quando le risorse hardware sono limitate. Ciascuno di essi è a un semplice ollama run di distanza, e tutti mantengono i tuoi dati esclusivamente sul tuo dispositivo.

Scritto da Mustafa Ihsan

Mustafa Ihsan è fondatore ed editor di Convly.ai. Ha sviluppato e gestisce il database in tempo reale di modelli di IA del sito, il suo indice prezzo-prestazioni e i calcolatori gratuiti per i requisiti di VRAM, i costi delle API e l’economia del self-hosting. Scrive di prezzi dei modelli, risultati dei benchmark e dell’hardware necessario per eseguire localmente modelli di IA, privilegiando sempre dati misurati rispetto alle dichiarazioni dei produttori.

Scroll to Top
Featured on There's An AI For That