Thursday, 6 August 2026 | Updating Daily AI insight, written for builders

Come installare Ollama nel 2026: Mac, Windows e Linux (guida passo passo)

Aggiornato · Originariamente pubblicato il 6 giugno 2026

Installare Ollama richiede effettivamente solo due minuti su ogni sistema operativo principale. Questa guida fornisce i passaggi esatti per Mac, Windows e Linux, mostra come eseguire il primo modello e illustra le poche problematiche comuni che gli utenti incontrano.

Nuovi a questo strumento? Iniziate con cos’è Ollama e come funziona, quindi tornate qui per procedere con l’installazione.

Quick answer: How do you install Ollama?

Installing Ollama is a download-and-run process that takes around two minutes on every major operating system. On macOS, download the app from ollama.com or run eseguite brew install ollama; on Windows, run the official installer, which is native and needs no WSL; on Linux, run the one-liner curl -fsSL https://ollama.com/install.sh | sh. Then pull and run your first model with ollama run gemma4, and confirm it works when the local API answers at http://localhost:11434.

  • macOS: download the app from ollama.com or run eseguite brew install ollama.
  • Windows: run the official .exe installer — native, no WSL required — then check ollama --version.
  • Linux: un unico comando — curl -fsSL https://ollama.com/install.sh | sh.
  • First model to run: ollama run gemma4 downloads and runs a strong all-rounder in a single command.
  • RAM you need: roughly as much free RAM (or VRAM) as the quantized model size — around 4–5 GB for a 7B model and about 8 GB for a 13B model.

Punti chiave

  • Mac: scaricate l’app da ollama.com oppure eseguite brew install ollama.
  • Windows: scaricate ed eseguite l’installer ufficiale — nativo, senza bisogno di WSL.
  • Linux: un unico comando — curl -fsSL https://ollama.com/install.sh | sh.
  • Primo modello: ollama run gemma4 scarica ed esegue un modello performante e versatile.
  • Verifica del corretto funzionamento: l’API risponde all’indirizzo http://localhost:11434.

Prima di installare: il vostro computer è in grado di eseguirlo?

Ollama stesso è molto leggero, ma i modelli modelli non lo sono. Una regola empirica rapida: avete bisogno di una quantità di RAM (o VRAM) libera approssimativamente pari alle dimensioni del modello quantizzato — circa 4–5 GB per un modello da 7 miliardi di parametri (7B), 8 GB per un modello da 13 miliardi (13B), e molto di più per i modelli più grandi. Se non siete sicuri delle capacità del vostro hardware, leggete prima la nostra guida ai requisiti di sistema per Ollama per scegliere un modello compatibile con le vostre risorse.

Installazione su macOS

Il metodo più semplice è l’app nativa:

  1. Recatevi su ollama.com/download e scaricate l’app per macOS.
  2. Aprire il file .dmg e trascinare Ollama nella cartella Applicazioni.
  3. Avviatelo — Ollama verrà eseguito in background e il comando ollama diventerà disponibile nel vostro terminale.

Preferite la riga di comando? Usate Homebrew:

eseguite brew install ollama

Su Apple Silicon (M1–M5), Ollama utilizza automaticamente la GPU tramite il backend MLX di Apple (a partire dalla versione v0.19), garantendo così inferenze veloci senza alcuna configurazione aggiuntiva.

Installazione su Windows

Ollama è eseguibile nativamente su Windows: non hai più bisogno di WSL:

  1. Scarica l'installer per Windows da ollama.com/download.
  2. Esegui il file .exe e segui le istruzioni a schermo.
  3. Apri PowerShell o Prompt dei comandi e digita ollama --version per verificare che l'installazione sia avvenuta correttamente.

Se disponi di una GPU NVIDIA, Ollama la rileva automaticamente e utilizza CUDA. Non sono necessari interventi complessi sui driver, purché i driver della tua GPU siano aggiornati.

Installazione su Linux

Un singolo comando esegue tutto:

curl -fsSL https://ollama.com/install.sh | sh

Questo comando installa Ollama e lo configura come servizio systemd che si avvia automaticamente all'accensione del sistema. Per verificare che sia in esecuzione:

systemctl status ollama

Su Ubuntu e sulla maggior parte delle distribuzioni Linux, l'installer rileva automaticamente le GPU NVIDIA e AMD e configura il backend appropriato. Per le schede AMD, assicurati che ROCm sia installato — consulta la nostra analisi approfondita su ROCm vs CUDA per conoscere lo stato del supporto AMD in Ollama nel 2026.

Eseguite il vostro primo modello

Una volta installato Ollama, puoi scaricare ed eseguire un modello con un singolo comando:

ollama run gemma4

Alla prima esecuzione il modello viene scaricato (alcuni gigabyte), dopodiché verrai indirizzato a una finestra di chat interattiva. Digita una domanda e riceverai una risposta — interamente sul tuo computer. Alcuni comandi utili:

  • ollama list — mostra l'elenco dei modelli già scaricati.
  • ollama pull qwen3 — scarica un modello senza eseguirlo.
  • ollama rm gemma4 — elimina un modello per liberare spazio su disco.
  • ollama ps — mostra quali modelli sono attualmente caricati in memoria.

Non sai quale modello scegliere per iniziare? La nostra guida ai migliori LLM locali su Ollama associa i modelli a specifici casi d'uso e tipologie di hardware.

Verificate che l’API sia in esecuzione

Ollama espone un'API REST sulla porta 11434. Per verificarne il funzionamento, esegui:

curl http://localhost:11434/api/tags

Una risposta JSON contenente l'elenco dei tuoi modelli indica che tutto funziona correttamente. Questo endpoint è quello a cui si rivolgeranno le tue applicazioni personalizzate — e poiché Ollama offre un'API compatibile con OpenAI, gran parte del codice esistente funzionerà semplicemente modificando l'URL base.

Problemi comuni durante l’installazione e relative soluzioni

  • «ollama: command not found» (Mac/Linux): l'app è stata installata, ma non è presente nel tuo percorso PATH. Su Mac, assicurati di aver lanciato l'app almeno una volta; su Linux, apri una nuova shell dopo l'installazione.
  • I download dei modelli sono lenti o si bloccano: Ollama scarica file di grandi dimensioni; un download bloccato di solito riprende correttamente eseguendo nuovamente ollama pull <modello> — il processo riprende dall'ultimo punto invece di ricominciare da zero.
  • La GPU non viene utilizzata: controlla ollama ps — se viene mostrato un utilizzo del 100% della CPU, i driver della GPU potrebbero essere obsoleti oppure il modello potrebbe essere troppo grande per entrare nella VRAM e quindi essere stato spostato parzialmente sulla CPU. Prova un modello più piccolo o più fortemente quantizzato.
  • Errori «out of memory»: il modello è più grande della RAM/VRAM disponibile. Scarica una versione quantizzata più leggera (cerca le varianti con indicazione q4 ) oppure un modello di dimensioni inferiori. La nostra guida ai requisiti di sistema tabella comparativa
  • mostra quali modelli si adattano a ciascuna configurazione hardware. La porta 11434 è già in uso:ollama ps un'altra istanza di Ollama è già in esecuzione. Arrestala (

Configura Ollama dopo l’installazione: archiviazione, memoria e interfaccia utente

Installare Ollama è la parte più semplice. Alcune impostazioni determinano se il programma rimane trasparente oppure consuma silenziosamente spazio su disco e RAM. Tutte queste impostazioni sono variabili d’ambiente, il cui posizionamento dipende dal sistema operativo: su macOS usa launchctl setenv, su Linux modifica il servizio con systemctl edit ollama.service e aggiungi una riga Environment= ; su Windows, invece, aggiungi una variabile d’ambiente utente dalle Impostazioni. Dopo ogni modifica, riavvia Ollama affinché gli effetti abbiano luogo.

Le quattro variabili più importanti sono:

  • OLLAMA_MODELS — specifica la cartella in cui vengono memorizzati i modelli. Poiché i modelli sono molto grandi e la posizione predefinita si trova sul disco di sistema (~/.ollama/models su macOS, /usr/share/ollama/.ollama/models su Linux, C:\Users\<tuonome>\.ollama\models su Windows), ti consigliamo di puntare questa variabile verso un’unità più capiente o più veloce prima di scaricare diversi modelli. Su Linux, assicurati che l’utente ollama abbia i permessi di lettura e scrittura sulla nuova cartella.
  • OLLAMA_KEEP_ALIVE — indica per quanto tempo un modello rimane caricato in memoria dopo una richiesta. Il valore predefinito è 5 minuti. Impostalo su -1 per mantenere il modello sempre in memoria, evitando ritardi sulla prima richiesta, oppure su 0 per scaricarlo immediatamente e liberare la VRAM non appena termini l’uso.
  • OLLAMA_CONTEXT_LENGTH — definisce la finestra contestuale. Per impostazione predefinita, Ollama utilizza un valore conservativo di 4096 token, pertanto documenti lunghi vengono troncati in modo silenzioso. Aumentalo (ad esempio a 8192 o superiore) se il modello lo supporta, abbinandolo a OLLAMA_FLASH_ATTENTION=1 per contenere i costi aggiuntivi di memoria.
  • OLLAMA_HOST — specifica l’indirizzo a cui il server si associa. Per impostazione predefinita, Ollama ascolta solo su 127.0.0.1:11434, quindi nessun altro dispositivo della tua rete può raggiungerlo. Impostalo su 0.0.0.0:11434 per utilizzare Ollama da un altro computer, da uno smartphone o da un contenitore Docker.

Un’ultima importante avvertenza riguardo a quest’ultima opzione: l’API di Ollama non dispone di autenticazione integrata. Associato a 0.0.0.0 significa che chiunque possa raggiungere la porta 11434 e far girare modelli sul tuo hardware. Effettua questa configurazione esclusivamente su una LAN attendibile e, qualora il computer sia esposto pubblicamente, proteggilo con un reverse proxy o una regola firewall.

Infine, la riga di comando va bene per i test, ma diventa noiosa per un utilizzo quotidiano. La soluzione più comune è Open WebUI, un’interfaccia web self-hosted, simile a ChatGPT, che comunica con la tua istanza locale di Ollama. Il metodo più rapido prevede l’uso di Docker: il contenitore espone internamente la porta 8080, quindi mappala su una porta host con -p 3000:8080 e apri http://localhost:3000, quindi configuralo per puntare alla tua istanza di Ollama. Otterrai cronologia delle conversazioni, commutazione tra modelli e caricamento di documenti, il tutto eseguito interamente sul tuo computer.

Domande frequenti

Come installo Ollama su Windows?

Scarica l'installer nativo da ollama.com/download ed esegui il file .exe. Ollama gira nativamente su Windows, senza richiedere WSL, e utilizza automaticamente una GPU NVIDIA tramite CUDA, qualora ne sia disponibile una. Verifica l'installazione eseguendo ollama --version in PowerShell.

Come installo Ollama su Linux?

Esegui curl -fsSL https://ollama.com/install.sh | sh. Questo comando installa Ollama e lo registra come servizio systemd. Verificalo con systemctl status ollama. L'installer rileva automaticamente le GPU NVIDIA e AMD.

Posso installare Ollama tramite Homebrew?

Sì — eseguite brew install ollama funziona su macOS. L'app nativa da ollama.com è altrettanto valida e include una presenza nella barra dei menu; l’installazione tramite Homebrew è comoda se gestisci tutto dalla riga di comando.

Dove memorizza Ollama i modelli?

Per impostazione predefinita, su Mac e Linux in ~/.ollama/models, e su Windows nella tua cartella profilo utente. I modelli possono occupare diversi gigabyte ciascuno, quindi usa ollama list per tenere traccia di ciò che hai scaricato e ollama rm <modello> per liberare spazio.

È sicuro installare Ollama?

Sì. Ollama è open source (licenza MIT) ed è ampiamente utilizzato. Vale la solita cautela per lo script di installazione Linux in un’unica riga: si tratta dello script ufficiale del progetto, ma, se preferisci, puoi scaricare ed esaminare install.sh prima di eseguirlo.

Perché Ollama taglia continuamente i prompt o i documenti lunghi?

Ollama utilizza per impostazione predefinita una finestra di contesto di 4096 token, indipendentemente dalla capacità effettiva del modello; pertanto, gli input più lunghi vengono troncati senza alcun avviso. Per aumentarla, avvia il server con OLLAMA_CONTEXT_LENGTH impostando un valore più alto (ad esempio 8192 o superiore), fino al limite massimo supportato dal modello. Una finestra di contesto più ampia richiede più memoria, quindi abilita OLLAMA_FLASH_ATTENTION=1 per compensare questo costo e monitora attentamente lo spazio disponibile nella RAM o nella VRAM.

Come faccio ad accedere a Ollama da un altro computer della mia rete?

Per impostazione predefinita, Ollama ascolta solo su localhost e risulta quindi invisibile agli altri dispositivi. Imposta OLLAMA_HOST=0.0.0.0:11434 e riavvia il servizio; quindi connettiti utilizzando l’indirizzo IP LAN del computer host sulla porta 11434. Tieni presente che l’API non prevede alcuna autenticazione, quindi esponila esclusivamente su reti di cui ti fidi pienamente; inoltre, se il computer è raggiungibile dall’esterno della tua abitazione o del tuo ufficio, proteggilo mediante una regola firewall o un reverse proxy.

Come posso impedire a Ollama di ricaricare il modello ad ogni richiesta?

Questo ritardo corrisponde al caricamento del modello in memoria tra un’utilizzo e l’altro. Per impostazione predefinita, Ollama mantiene il modello caricato per 5 minuti; imposta OLLAMA_KEEP_ALIVE=-1 per mantenerlo residente in memoria indefinitamente, garantendo così tempi di risposta istantanei ai prompt. Il compromesso è che il modello occuperà costantemente RAM o VRAM; se preferisci liberare tale memoria non appena una richiesta viene completata, utilizza invece 0 .

Conclusione

Su qualsiasi sistema operativo, installare Ollama richiede semplicemente di scaricare ed eseguire il programma: ci vogliono circa due minuti, e il primo modello locale è a portata di un solo comando. Scegli un modello adatto al tuo hardware, verifica che l’API risponda sulla porta 11434, e avrai un LLM privato e gratuito in esecuzione direttamente sul tuo computer. Da qui, puoi esplorare quali modelli eseguire e quanta potenza hardware richiede ciascuno.

Scritto da Mustafa Ihsan

Mustafa Ihsan è fondatore e redattore capo di Convly.ai. Ha progettato e gestisce il database in tempo reale di modelli IA del sito, il suo indice prezzo-prestazioni e i suoi calcolatori gratuiti per i requisiti di VRAM, i costi delle API e l'economia dell'auto-hosting. Scrive di prezzi dei modelli, risultati di benchmark e hardware necessario per eseguire modelli IA localmente, privilegiando costantemente dati misurati rispetto alle dichiarazioni dei produttori.

Scroll to Top
Featured on There's An AI For That