- OpenAI non ha rilasciato una famiglia di modelli denominata «GPT-OSS». Il termine di ricerca fa probabilmente riferimento all’esecuzione di alternative open source (Llama 3, Mistral, Qwen) tramite Ollama.
- Ollama esegue localmente centinaia di modelli con pesi aperti. Alcune opzioni popolari:
ollama pull llama3.1:8b,ollama pull mistral:7b,ollama pull qwen2.5:7b. - Esigenze di VRAM: i modelli da 7 miliardi di parametri richiedono 6–8 GB (quantizzazione Q4), quelli da 13 miliardi ne richiedono 10–14 GB e quelli da 70 miliardi ne richiedono 40–48 GB. Per stimare le esigenze, utilizzare il Calcolatore VRAM calcolatore.
- I modelli quantizzati (Q4, Q5) si adattano alle GPU consumer con una perdita minima di qualità. L’FP16 garantisce la massima qualità, ma raddoppia l’uso di VRAM.
Se hai cercato «ollama gpt oss», probabilmente desideri eseguire localmente modelli linguistici di grandi dimensioni open source tramite Ollama — tuttavia OpenAI non ha rilasciato una famiglia di modelli open weight chiamata «GPT-OSS». OpenAI ha reso disponibile GPT-2 nel 2019 come modello open weight, ma i suoi modelli più recenti (GPT-4, GPT-4o, GPT-4.1) rimangono prodotti proprietari accessibili esclusivamente tramite API. Ciò che non esiste invece sono centinaia di modelli open weight provenienti da Meta (Llama), Mistral AI, Alibaba (Qwen) e altri, che è possibile scaricare ed eseguire tramite Ollama sul proprio hardware. Questa guida illustra quali modelli funzionano, la quantità di VRAM richiesta per ciascuna dimensione, come la quantizzazione influisce sulla qualità e come tali modelli si confrontano tra loro.
- Cosa esegue effettivamente Ollama
- Famiglie di modelli open source disponibili in Ollama
- Scaricare ed eseguire un modello
- Dimensioni dei parametri e requisiti di VRAM
- Quantizzazione: compromesso tra qualità e VRAM
- Confronto delle prestazioni: classe da 7 miliardi di parametri
- Quale modello scegliere
- Quando eseguire autonomamente rispetto all’uso di un’API
- Note specifiche per piattaforma
- Domande frequenti
Cosa esegue effettivamente Ollama
Ollama è un motore di inferenza locale che scarica, quantizza ed esegue modelli linguistici di grandi dimensioni con pesi aperti su macOS, Linux e Windows. Non ospita modelli OpenAI. Il Elenco modelli Ollama catalogo include Llama 3.1, Mistral 7BMistral, Qwen 2.5, Gemma 2, Phi-3 e molti altri. Ciascun modello è disponibile in diversi livelli di quantizzazione (Q4_K_M, Q5_K_M, FP16) per bilanciare VRAM e qualità.
Istruzioni complete per l’installazione: come installare Ollama.
Famiglie di modelli open source disponibili in Ollama
| Famiglia di modelli | Sviluppatore | Dimensioni dei parametri | Licenza | Caratteristiche principali |
|---|---|---|---|---|
| Llama 3.1 | Meta | 8B, 70B, 405B | Llama 3.1 (licenza commerciale permessa) | Migliore ragionamento generale per ogni classe di dimensioni |
| Mistral | Mistral AI | 7B, 22B (Mixtral 8x7B) | Apache 2.0 | Veloce, efficiente e particolarmente valido per la programmazione |
| Qwen 2.5 | Alibaba | 0,5B, 1,5B, 3B, 7B, 14B, 32B, 72B | Apache 2.0 | Multilingue, contesto lungo (128k) |
| Gemma 2 | 2B, 9B, 27B | Gemma (licenza commerciale permessa) | Leggero e veloce, eseguibile anche su CPU | |
| Phi-3.5 | Microsoft | 3,8B (mini), 14B (medium) | MIT | Compatto e performante nei benchmark di ragionamento |
Il Database di modelli IA elencano specifiche tecniche, requisiti di VRAM e prezzi per 37 modelli, inclusi tutti quelli sopra citati.
Scaricare ed eseguire un modello
Una volta installato Ollama, scarica un modello con il comando ollama pull <modello>:<tag>. Il tag specifica il numero di parametri e il livello di quantizzazione. Esempi:
ollama pull llama3.1:8b
ollama pull mistral:7b-instruct-q4_K_M
ollama pull qwen2.5:7b
ollama pull gemma2:9bEsegui il modello:
ollama run llama3.1:8bQuesto avvia una sessione interattiva di chat. Digita il tuo prompt, premi Invio e il modello genera una risposta in locale. Per uscire, digita /bye.
Per utilizzare il modello a livello programmatico tramite l’API:
curl http://localhost:11434/api/generate -d '{
"model": "llama3.1:8b",
"prompt": "Spiega la ricorsione in una frase."
}'Ollama espone un endpoint compatibile con l’API OpenAI, /v1/chat/completions quindi è possibile reindirizzare il codice esistente basato sull’SDK OpenAI verso http://localhost:11434 e sostituire il modello remoto con uno locale.
Dimensioni dei parametri e requisiti di VRAM
La dimensione del modello (7B, 13B, 70B) determina sia la qualità delle prestazioni sia l’impronta di VRAM. Modelli più grandi offrono migliori capacità di ragionamento, ma richiedono maggiore memoria GPU. La quantizzazione (Q4, Q5, FP16) comprime i pesi per ridurre l’uso di VRAM, con un lieve impatto sulla qualità.
| Numero di parametri | Quantizzazione | VRAM (approssimativa) | Modelli di esempio | Raccomandazione GPU |
|---|---|---|---|---|
| 7B | Q4_K_M | 4,5 GB | Llama 3.1 8B, Mistral 7B | RTX 3060 (12 GB), RTX 4060 Ti (16 GB) |
| 7B | Q5_K_M | 5,5 GB | Come sopra | Stesso |
| 7B | FP16 | 14 GB | Come sopra | RTX 4060 Ti (16 GB), RTX 4070 |
| 13B | Q4_K_M | 8 GB | Qwen 2.5 14B, Phi-3.5 14B | RTX 3060 (12 GB), RTX 4060 Ti (16 GB) |
| 13B | FP16 | 26 GB | Stesso | RTX 4090 (24 GB) o A5000 (24 GB) |
| 70B | Q4_K_M | 40 GB | Llama 3.1 70B, Qwen 2.5 72B | A100 (40/80 GB) o doppia RTX 3090 (48 GB totali) |
| 70B | FP16 | 140 GB | Stesso | Configurazione multi-GPU o A100 da 80 GB |
Usa la Calcolatore VRAM per stimare le esigenze di memoria per qualsiasi modello e livello di quantizzazione. Il Guida ai requisiti di VRAM elenco riporta valori precisi per ogni modello principale.
Per decisioni sull’acquisto di una GPU, consulta migliori GPU per eseguire LLM localmente.
Quantizzazione: compromesso tra qualità e VRAM
La quantizzazione riduce la precisione dei pesi del modello da numeri in virgola mobile a 16 bit (FP16) a interi a 4 o 5 bit (Q4, Q5). Ciò riduce la VRAM del 60–75% con una perdita minima di qualità per la maggior parte dei compiti.
- Q4_K_M: Quantizzazione a 4 bit. Minima occupazione di VRAM, leggera perdita di qualità nel ragionamento complesso. Ideale per chatbot, riassunti e completamento del codice.
- Q5_K_M: Quantizzazione a 5 bit. Occupa circa il 20% in più di VRAM rispetto a Q4, con qualità molto vicina a quella FP16. Il miglior compromesso per la maggior parte degli utenti.
- Q8_0: Quantizzazione a 8 bit. Qualità quasi equivalente a FP16, con una riduzione del 50% della VRAM. Da utilizzare solo se si dispone di sufficiente spazio VRAM disponibile.
- FP16: Precisione completa. Massima qualità, ma richiede il doppio della VRAM rispetto a Q4. Necessaria soltanto per scopi di ricerca o qualora le regressioni qualitative non siano accettabili.
Esempio: Llama 3.1 8B il modello Llama 3.1 8B a Q4_K_M occupa 4,5 GB di VRAM e ottiene un punteggio di 67,2 su MMLU; in versione FP16 occupa 14 GB e ottiene 68,1 su MMLU. Per la maggior parte dei compiti, la differenza di 0,9 punti è impercettibile.
Per scaricare una specifica versione quantizzata:
ollama pull llama3.1:8b-instruct-q4_K_M
ollama pull llama3.1:8b-instruct-fp16Se non specifichi il tag di quantizzazione, Ollama utilizza per impostazione predefinita Q4_K_M.
Confronto delle prestazioni: classe da 7 miliardi di parametri
La classe di modelli da 7B a 8B è la più popolare per l’uso locale: si adatta alle GPU consumer ed eroga ottime prestazioni in ambiti come programmazione, ragionamento e conversazione.
| Modello | MMLU (zero-shot) | HumanEval (pass@1) | Lunghezza del contesto | VRAM (Q4) |
|---|---|---|---|---|
| Llama 3.1 8B | 67.2 | 62.2 | 128k | 4,5 GB |
| Mistral 7B v0.3 | 62.5 | 40.2 | 32k | 4,1 GB |
| Qwen 2.5 7B | 70.3 | 61.6 | 128k | 4,3 GB |
| Gemma 2 9B | 71.3 | 61.0 | 8k | 5,2 GB |
Qwen 2.5 7B e Gemma 2 9B ottengono i migliori risultati su MMLU (conoscenza generale); Llama 3.1 8B è leader su HumanEval (programmazione); Mistral 7B offre le prestazioni più elevate in termini di velocità di inferenza ed è rilasciato con la licenza più permissiva (Apache 2.0). La Classifica LLM classifica tutti i modelli in base a intelligenza, costo e lunghezza del contesto.
Quale modello scegliere
- Migliore qualità complessiva (classe 7B):
ollama pull qwen2.5:7boollama pull llama3.1:8b - Migliore per la programmazione:
ollama pull llama3.1:8boollama pull qwen2.5-coder:7b - Inferenza più veloce:
ollama pull mistral:7boollama pull gemma2:2b(per CPU/bassa VRAM) - Multilingue:
ollama pull qwen2.5:7b(supporta 29 lingue) - Documenti lunghi (contestuale ≥128k):
ollama pull llama3.1:8boollama pull qwen2.5:7b - Miglior ragionamento (se si dispone di almeno 40 GB di VRAM):
ollama pull llama3.1:70boollama pull qwen2.5:72b
Il i migliori modelli linguistici locali per Ollama guida confronta sistematicamente tutti i modelli e raccomanda tag specifici in base all’uso previsto.
Quando eseguire autonomamente rispetto all’uso di un’API
Esegui Ollama localmente se:
- Possiedi già una GPU con almeno 12 GB di VRAM (ad es. RTX 3060, 4060 Ti o superiore)
- Elabori dati sensibili che non possono lasciare la tua rete
- Generi oltre 5 milioni di token al mese (i costi dell’API superano il TCO dell’hosting autonomo)
- Hai bisogno di uptime garantito e di assenza di limiti di frequenza
Utilizza un’API ospitata (OpenAI, Anthropic, Groq) se:
- Generi meno di 1 milione di token al mese (l'ammortamento della GPU per l'auto-hosting richiede anni)
- Hai bisogno della qualità assolutamente migliore (Claude 3.5 Sonnet e GPT-4o superano tutti i modelli open source)
- Non vuoi gestire l'infrastruttura per l'inferenza
Il calcolatore self-hosting vs API stima il punto di pareggio in base al tuo volume di token, al costo della GPU e al prezzo dell'elettricità. Il Calcolatore dei costi API proietta la spesa mensile per modello.
Note specifiche per piattaforma
macOS
Ollama utilizza Metal per l'accelerazione GPU sui Mac M1/M2/M3. La memoria unificata significa che la VRAM corrisponde alla RAM di sistema. Un chip M2 Max con 64 GB di RAM può eseguire Llama 3.1 70B in quantizzazione Q4 (40 GB) lasciando spazio sufficiente per il sistema operativo. Installalo tramite Homebrew:
eseguite brew install ollamaAvvia il servizio:
ollama serveLinux
Ollama richiede GPU NVIDIA con CUDA 11.8+ o GPU AMD con ROCm 5.7+. Installalo con:
curl -fsSL https://ollama.com/install.sh | shQuesto comando installa il binario in /usr/local/bin/ollama e crea un servizio systemd. Avvialo con:
sudo systemctl start ollamaI modelli vengono scaricati in ~/.ollama/models. Per modificare la cartella di destinazione, imposta OLLAMA_MODELS=/percorso/alla/cartella/dei/modelli in , quindi esegue.
Windows
Ollama per Windows richiede GPU NVIDIA con CUDA 11.8+ e driver versione 520+. Scarica l'installer da ollama.com ed eseguilo. Il servizio viene avviato automaticamente. I modelli vengono scaricati in C:\Users\\.ollama\models.
Per eseguirlo da PowerShell:
ollama run llama3.1:8bDomande frequenti
OpenAI offre un modello open source che posso eseguire in Ollama?
No. OpenAI ha rilasciato GPT-2 (2019) come modello a pesi aperti, ma tutti i modelli più recenti (GPT-3.5, GPT-4, GPT-4o, o1) sono proprietari e disponibili esclusivamente tramite API. Se desideri ragionamenti di qualità paragonabile a quelli di OpenAI da eseguire localmente, prova Llama 3.1 70B o Qwen 2.5 72B: entrambi superano GPT-3.5 nella maggior parte dei benchmark ed è possibile eseguirli in Ollama con 40 GB di VRAM in quantizzazione Q4.
Posso eseguire Ollama su CPU senza GPU?
Sì, ma l'inferenza è 10–50 volte più lenta. Modelli piccoli (Gemma 2 2B, Qwen 2.5 0.5B, Phi-3.5 mini 3.8B) sono utilizzabili su CPU moderne (16+ thread). Modelli più grandi (7B+) genereranno 1–3 token al secondo su CPU, una velocità troppo bassa per un utilizzo interattivo. Se non possiedi una GPU, valuta l'uso di un'API ospitata invece di quella locale — consulta la sezione calcolatore self-hosting vs API.
Quanto costa eseguire Ollama rispetto all'API di OpenAI?
OpenAI addebita $0,15 per milione di token in input e $0,60 per milione di token in output per GPT-4o mini. Una GPU da 12 GB (RTX 4060 Ti, $400) che esegue Llama 3.1 8B consuma $0,05/ora di elettricità (con un costo di $0,12/kWh e un assorbimento del sistema di 400 W). Il punto di pareggio si attesta intorno ai 3–5 milioni di token al mese. Il Calcolatore dei costi API e calcolatore per l'auto-hosting mostra il costo totale di proprietà (TCO) esatto in base al tuo utilizzo.
Qual è la differenza tra Q4_K_M, Q5_K_M e FP16?
Q4_K_M utilizza una quantizzazione a 4 bit (minima occupazione di VRAM, lieve perdita di qualità). Q5_K_M utilizza una quantizzazione a 5 bit (20% in più di VRAM, qualità molto vicina a quella completa). FP16 è la precisione completa a 16 bit (massima qualità, doppia occupazione di VRAM rispetto a Q4). Per la maggior parte dei compiti, Q5_K_M rappresenta il miglior compromesso. Usa FP16 solo se hai VRAM in eccesso e hai bisogno dell'ultimo 1–2% di qualità per ricerca o produzione.
Posso effettuare il fine-tuning di modelli in Ollama?
No. Ollama è un motore di inferenza, non un framework per il training. Per effettuare il fine-tuning di un modello open source, usa Hugging Face Transformers con PEFT/LoRA, Axolotl o LLaMA Factory. Esporta i pesi ottenuti dopo il fine-tuning nel formato GGUF e importali in Ollama con il comando ollama create. Il blocco Guida completa a Ollama illustra questo flusso di lavoro.
Quale GPU dovrei acquistare per eseguire modelli da 7B in locale?
Per la quantizzazione Q4 (4,5 GB di VRAM): RTX 3060 da 12 GB ($250 usata) o RTX 4060 Ti da 16 GB ($450 nuova). Per FP16 (14 GB di VRAM): RTX 4060 Ti da 16 GB o RTX 4070 ($550–600). Per modelli da 70B in quantizzazione Q4 (40 GB): due RTX 3090 da 24 GB ciascuna ($1800 usate) oppure A100 da 40 GB ($6000+ usata). La guida alle migliori GPU presenta benchmark sul rapporto prezzo/prestazioni per ogni classe di dimensione.

