Tuesday, 1 September 2026 | Updating Daily AI insight, written for builders

Ollama per Windows: Guida all'installazione e alle istruzioni di configurazione

In breve:

  • Scarica l'installer ufficiale da ollama.com/download, eseguilo e Ollama verrà installato come servizio in background
  • Richiede Windows 10 o versione successiva e almeno 8 GB di RAM; le GPU NVIDIA/AMD vengono rilevate automaticamente per l'accelerazione hardware
  • Esegui i modelli con ollama run <modello> dal Prompt dei comandi o da PowerShell—non è necessaria alcuna configurazione aggiuntiva
  • I modelli vengono installati nella cartella %USERPROFILE%.ollamamodels per impostazione predefinita; è possibile modificarla tramite la variabile d'ambiente OLLAMA_MODELS environment variable

Ollama per Windows è un'applicazione nativa che esegue modelli linguistici di grandi dimensioni localmente, senza ricorrere a Docker o WSL2. L'installer per Windows configura Ollama come servizio di sistema che si avvia automaticamente e fornisce l'accelerazione GPU tramite DirectML e CUDA. L'installazione richiede meno di due minuti e puoi eseguire modelli come Llama 3.3 70B o Mistral 7B immediatamente dalla riga di comando.

Requisiti di sistema per Ollama su Windows

Ollama richiede Windows 10 (build 1903 o successiva) oppure Windows 11. Le specifiche hardware minime sono le seguenti:

Componente Minimo Consigliato
Sistema operativo Windows 10 (1903+) Windows 11
RAM 8 GB 16 GB o più
Spazio su disco 10 GB liberi 50+ GB per più modelli
GPU (opzionale) NVIDIA GTX 1050 o equivalente AMD NVIDIA RTX 3060 da 12 GB in su o migliore

L'accelerazione GPU funziona con le GPU NVIDIA (CUDA 11.8 o versione successiva) e con le GPU AMD più recenti (tramite ROCm su Windows). L'installer include le librerie GPU necessarie; non è quindi necessario installare CUDA separatamente. In assenza di una GPU, Ollama ricorre all'inferenza sulla CPU, che risulta 5-10 volte più lenta ma comunque funzionante per modelli di dimensioni ridotte.

Le dimensioni effettive della memoria RAM o VRAM richieste dipendono dalle dimensioni del modello. Ad esempio, Mistral 7B richiede circa 4,5 GB di VRAM con quantizzazione a 4 bit, mentre Llama 3.3 70B ne richiede circa 40 GB. Controlla la Calcolatore VRAM per stimare i requisiti di qualsiasi modello prima del download.

Installazione di Ollama su Windows

L'installer ufficiale per Windows è un singolo file eseguibile che gestisce tutte le dipendenze:

  1. Scarica OllamaSetup.exe da ollama.com/download
  2. Esegui l'installer—sono richiesti privilegi di amministratore
  3. Accetta la licenza e fai clic su Installa (la posizione predefinita è C:\Program Files\Ollama)
  4. L'installazione viene completata in 30-60 secondi e avvia automaticamente il servizio Ollama

Dopo l'installazione, apri il Prompt dei comandi o PowerShell e verifica l'installazione con il comando:

ollama --version

Dovresti visualizzare un output simile a ollama versione 0.x.x. Il servizio Ollama viene eseguito in background—quando è attivo, vedrai un'icona di Ollama nella barra delle applicazioni.

Supporto e rilevamento GPU

Ollama rileva e utilizza automaticamente le GPU disponibili su Windows. Per verificare che l'accelerazione GPU sia attiva:

ollama run llama3.3:70b "test"

Mentre il modello viene caricato, osserva il Task Manager (scheda Prestazioni). Se compare un'utilizzo della GPU sotto GPU 0 o GPU 1, l'accelerazione è attiva. Alla prima esecuzione il modello viene scaricato (da 5 a 40 GB, a seconda delle dimensioni) nella cartella %USERPROFILE%.ollamamodels, operazione che può richiedere diversi minuti su connessioni lente.

Gli utenti NVIDIA con GPU RTX 3060 o successive ottengono le migliori prestazioni grazie ai 12+ GB di VRAM e alle ottimizzazioni per le architetture Ampere/Ada. Il supporto per le GPU AMD su Windows sta migliorando, ma rimane ancora inferiore rispetto a quello offerto da NVIDIA—ci si può attendere un'inferenza dal 20% al 30% più lenta su hardware AMD equivalente. Le GPU Intel Arc non sono ufficialmente supportate al settembre 2026.

Se Ollama non rileva la tua GPU, verifica che i driver siano aggiornati (NVIDIA: 537.13 o successivo, AMD: Adrenalin 23.11 o successivo). I messaggi di errore di Ollama indicano generalmente se la GPU è stata ignorata a causa di VRAM insufficiente o driver mancanti.

Esecuzione del primo modello

Il ollama run Il comando scarica, carica e avvia una sessione interattiva con un modello:

ollama run phi4

Questo scarica il modello Phi-4 di Microsoft (circa 9 GB di VRAM con quantizzazione a 4 bit) e apre un prompt di chat. Digita la tua domanda, premi Invio e il modello risponderà localmente. Per uscire digita /bye oppure Ctrl+C.

Modelli comuni da provare su hardware Windows:

Modello VRAM (4-bit) Ideale per
Mistral 7B ~4,5 GB Attività generali, risposte rapide
Llama 3.1 8B ~5 GB Qualità e velocità bilanciate
Phi-4 ~9 GB Ragionamento, dimensioni compatte
Llama 3.3 70B ~40 GB GPU di fascia alta, qualità migliore

Esplora i modelli disponibili su Elenco modelli Ollama oppure cerca nella libreria con ollama list dopo aver scaricato almeno un modello.

Configurazione e variabili d'ambiente

Ollama legge la configurazione dalle variabili d'ambiente di Windows. Impostale nelle Proprietà sistema → Variabili d'ambiente oppure in PowerShell con $env:VARIABLE_NAME.

Variabili principali:

  • OLLAMA_MODELS: cartella per l'archiviazione dei modelli (predefinita: %USERPROFILE%.ollamamodels). Modificala se il tuo disco C ha spazio limitato.
  • OLLAMA_HOST: indirizzo del server (predefinito: 127.0.0.1:11434). Impostalo su 0.0.0.0:11434 per accettare connessioni di rete.
  • OLLAMA_NUM_PARALLEL: numero di richieste simultanee (predefinito: 1). Aumentalo se stai servendo più client.
  • OLLAMA_MAX_LOADED_MODELS: numero di modelli mantenuti nella VRAM (predefinito: 1). Impostalo a 2 o superiore se disponi di almeno 24 GB di VRAM e desideri passare istantaneamente da un modello all'altro.

Dopo aver modificato le variabili d'ambiente, riavvia il servizio Ollama da Servizi (Win+R, digita services.msc, individua Ollama, fai clic destro e seleziona Riavvia) oppure riavvia il computer.

Per spostare i modelli su un'unità diversa, imposta OLLAMA_MODELS e quindi riavvia il servizio. I modelli esistenti devono essere scaricati nuovamente: Ollama non li migra automaticamente.

Ottimizzazione delle prestazioni

La velocità di inferenza dipende dalla VRAM, dalle dimensioni del modello e dal livello di quantizzazione. Un modello da 7 miliardi di parametri quantizzato a 4 bit genera 30–60 token al secondo su una RTX 3060, mentre i modelli da 70 miliardi scendono a 3–8 token al secondo, a meno che tu non disponga di almeno 48 GB di VRAM distribuiti su più GPU.

I sistemi multi-GPU funzionano automaticamente: Ollama distribuisce i layer del modello sulle GPU rilevate. Ad esempio, due RTX 3090 (24 GB ciascuna) possono eseguire Llama 3.3 70B a una velocità accettabile, mentre una singola RTX 3090 dovrebbe scaricare alcuni layer nella RAM di sistema, rallentando drasticamente le prestazioni.

Se le prestazioni risultano inferiori alle aspettative:

  • Controlla il Task Manager durante l'inferenza: un utilizzo della CPU superiore al 30% indica che parte del modello risiede nella RAM di sistema a causa di insufficiente VRAM
  • Prova una quantizzazione più leggera (ad esempio, ollama pull mistral:7b-instruct-q4_K_M invece della predefinita Q8)
  • Chiudi altre applicazioni che utilizzano la GPU (browser con accelerazione hardware, giochi, software di editing video)
  • Aggiorna i driver della GPU: i driver NVIDIA più recenti migliorano la velocità di inferenza del 5–10% rispetto a versioni di sei mesi fa

Per aggiornamenti hardware, consulta la le migliori GPU per LLM locali guida comparativa per valutare rapporto prezzo/prestazioni tra opzioni NVIDIA e AMD.

Integrazione con applicazioni

Ollama espone un'API REST su localhost:11434 compatibile con la struttura dell'API OpenAI. Le applicazioni che supportano endpoint compatibili con OpenAI possono puntare a Ollama con modifiche minime.

Esempio di comando curl per generare testo:

curl http://localhost:11434/api/generate -d '{
  "model": "mistral",
  "prompt": "Spiega Docker in una frase"
}'

Tra le integrazioni più diffuse figurano Open WebUI (interfaccia web), Continue.dev (estensione per VS Code) e LangChain (Python). Il servizio Ollama deve essere in esecuzione affinché le chiamate API funzionino: di default viene avviato automaticamente all'avvio del sistema.

Domande frequenti

Ollama richiede WSL2 o Docker su Windows?

No. L'installer per Windows è un'applicazione nativa che esegue Ollama come servizio di Windows senza ricorrere a virtualizzazione o contenitori. Le versioni precedenti richiedevano Docker, ma la release nativa per Windows ha eliminato tale dipendenza alla fine del 2024. Se hai installato Ollama prima di novembre 2024, disinstalla la versione basata su Docker e scarica l'attuale installer nativo.

Posso utilizzare Ollama offline dopo aver scaricato i modelli?

Sì. Una volta scaricato un modello con ollama pull <modello>, questo viene memorizzato localmente ed eseguito senza accesso a Internet. L'unico requisito di rete è il download iniziale: i modelli variano da 2 GB (modelli piccoli da 7B) a oltre 80 GB (modelli grandi da 70B+). Dopo il download, puoi disconnetterti dalla rete e Ollama continuerà a funzionare normalmente.

Qual è il costo dell'esecuzione dei modelli Ollama rispetto all'uso di API?

Ollama è gratuito: paghi solo per l'hardware e l'elettricità. Confronta questo costo con quello delle API: Claude Sonnet 5 addebita $2,00 per ogni milione di token in input, quindi 10 milioni di token (circa 7,5 milioni di parole) costano $20. Una configurazione self-hosted diventa conveniente molto rapidamente se elabori volumi significativi. Usa il calcolatore self-hosting vs API calcolatore di break-even per stimare il punto di pareggio in base al tuo utilizzo previsto.

Quali modelli funzionano meglio sulle GPU consumer?

Per GPU con 8–12 GB di VRAM (RTX 3060, 4060 Ti), Mistral 7B (~4,5 GB a 4 bit), Llama 3.1 8B (~5 GB) e Phi-4 (~9 GB) offrono ottimi rapporti qualità/prestazioni. Se disponi di 16–24 GB di VRAM (RTX 3090, 4090), diventano utilizzabili anche Mistral NeMo 12B (~7,5 GB) e persino Llama 3.3 70B (~40 GB con quantizzazione aggressiva o offloading). Consulta Requisiti VRAM per modello per l'elenco completo.

Ollama può utilizzare contemporaneamente GPU NVIDIA e AMD?

No. Ollama utilizza esclusivamente CUDA (per NVIDIA) o ROCm (per AMD), in base a quale tecnologia rileva per prima, ma non è possibile combinare backend GPU diversi in una singola sessione. Se possiedi sia GPU NVIDIA che AMD, Ollama dà priorità alle GPU NVIDIA. Il supporto multi-GPU funziona solo quando tutte le GPU impiegano lo stesso stack di driver—ad esempio due schede NVIDIA o due schede AMD, ma non una di ciascun tipo.

Come posso disinstallare Ollama da Windows?

Apri Impostazioni → App → App installate, individua Ollama e fai clic su Disinstalla. Questa operazione rimuove l'applicazione e il servizio, ma lascia i modelli nella cartella %USERPROFILE%.ollama. Elimina manualmente tale cartella per liberare spazio su disco. Se il servizio non si arresta durante la disinstallazione, apri il Task Manager, individua OllamaService.exe sotto Processi in background ed elimina il processo prima di riprovare.

Passi successivi

Dopo aver installato Ollama su Windows, esplora l'intera libreria di modelli su Guida completa a Ollama per comprendere come la scelta del modello, la quantizzazione e la finestra di contesto influenzino la qualità. Per carichi di lavoro produttivi, calcola i costi ricorrenti delle API rispetto al self-hosting con il Calcolatore dei costi API calcolatore di break-even per determinare se l'inferenza locale o le API cloud meglio soddisfano le tue esigenze di budget e scalabilità.

Scritto da Mustafa Ihsan

Mustafa Ihsan è il fondatore e redattore di Convly.ai. Ha creato e gestisce il database in tempo reale dei modelli IA del sito, il suo indice prezzo-prestazioni e i suoi calcolatori gratuiti per i requisiti di VRAM, i costi delle API e l'economia dell'auto-hosting. Scrive di prezzi dei modelli, risultati di benchmark e dell'hardware necessario per eseguire modelli IA in locale, privilegiando sempre dati misurati rispetto alle affermazioni dei produttori.

Scroll to Top