- gpt-oss:20b richiede circa 16 GB di memoria (compatibile con la maggior parte delle GPU per gaming), gpt-oss:120b richiede circa 70 GB (una singola GPU da 80 GB o suddivisione su schede consumer)
- Installa con
ollama pull gpt-oss:20boollama pull gpt-oss:120b, quindi eseguilo conollama run gpt-oss:20b - Entrambe le versioni utilizzano la quantizzazione MXFP4 a 4,25 bit per parametro e supportano finestre di contesto fino a 128K token
- Rilasciati da OpenAI come modelli open-weight in collaborazione con Ollama, sono paragonabili per qualità a Llama 3.1 e Qwen 2.5
OpenAI ha rilasciato gpt-oss come modelli open-weight nell’agosto 2025, distribuiti esclusivamente tramite Ollama. La famiglia gpt-oss comprende due varianti: un modello da 20 miliardi di parametri, eseguibile agevolmente su hardware consumer, e un modello da 120 miliardi di parametri che offre prestazioni prossime al top di gamma su una singola GPU high-end. Entrambi impiegano la quantizzazione MXFP4, comprimendo i pesi del modello a 4,25 bit per parametro pur mantenendo una qualità vicina a quella dell’inferenza in precisione piena.
Che cosa sono i modelli GPT-OSS?
I modelli gpt-oss rappresentano il primo rilascio open-weight di OpenAI, frutto della crescente pressione del settore verso trasparenza e riproducibilità. A differenza di GPT-4 o GPT-4o, questi modelli includono tutti i pesi, i dettagli architetturali e licenze permissive che ne consentono l’uso commerciale senza restrizioni.
Entrambi i modelli supportano una finestra di contesto di 128K token, gestiscono conversazioni multiround e seguono istruzioni con un livello di competenza comparabile ad altri modelli open nella stessa classe di parametri. La variante da 20 miliardi di parametri compete direttamente con Llama 3.1 8B e Mistral 7B, mentre il modello da 120 miliardi di parametri si colloca tra Llama 3.1 70B e sistemi di ultima generazione come GPT-4.
OpenAI ha collaborato con Ollama per la distribuzione e l’ottimizzazione dell’inferenza. Ciò significa che puoi installare ed eseguire gpt-oss nello stesso modo in cui fai con qualsiasi altro modello Ollama, senza dover eseguire passaggi aggiuntivi di conversione o quantizzazione.
Requisiti hardware
La tabella seguente mostra l’hardware minimo e consigliato per ciascuna variante gpt-oss. I valori di memoria tengono conto sia dei pesi del modello sia di un ragionevole overhead per contesto e buffer di inferenza.
| Modello | Parametri | Dimensione su disco | Memoria minima | Memoria consigliata | Esempio di hardware |
|---|---|---|---|---|---|
| gpt-oss:20b | 20B | 14 GB | 16 GB | 24 GB | RTX 4090, RTX 3090, A5000 |
| gpt-oss:120b | 120B | 65 GB | 70 GB | 80 GB | A100 80 GB, H100, 2× RTX 4090 |
Il modello da 20 miliardi di parametri è compatibile con facilità su GPU consumer rilasciate dal 2020 in poi. Se disponi di una RTX 3090 o 4090 con 24 GB di VRAM, puoi eseguire gpt-oss:20b lasciando spazio sufficiente per una finestra di contesto fino a 16K token. Con 16 GB di VRAM (ad esempio RTX 4080 o RTX 3080 Ti) puoi comunque eseguire il modello, ma dovrai limitare la lunghezza del contesto a 8K token per evitare overflow di memoria.
Il modello da 120 miliardi di parametri richiede hardware datacenter oppure una configurazione multi-GPU consumer. Una A100 da 80 GB lo gestisce agevolmente. Due RTX 4090 in un sistema desktop possono suddividere il modello tra le due schede, anche se la velocità di inferenza risulta leggermente ridotta rispetto a una configurazione monoscheda. Usa il Calcolatore VRAM per stimare i requisiti di memoria per diverse lunghezze di contesto.
CPU e RAM di sistema
Se non disponi di VRAM sufficiente, Ollama scaricherà alcuni layer nella RAM di sistema ed eseguirà l’inferenza sulla CPU. Per gpt-oss:20b hai bisogno di almeno 32 GB di RAM di sistema se esegui tutto sulla CPU. Per gpt-oss:120b, l’inferenza su CPU è impraticabile: anche su sistemi con molti core, ti aspettano diversi secondi per token. Consulta la migliore GPU per LLM locali guida se stai costruendo o aggiornando l’hardware specificamente per l’inferenza di modelli.
Installazione
Per prima cosa, installa Ollama se non l’hai già fatto. Il processo varia a seconda della piattaforma:
macOS
Scarica l’app macOS di Ollama da ollama.com e trascinala in /Applications. L’installer configura automaticamente la CLI di ollama . In alternativa, installa tramite Homebrew:
eseguite brew install ollama
Linux
Esegui lo script ufficiale di installazione, che posiziona il binario in /usr/local/bin/ollama e configura un servizio systemd:
curl -fsSL https://ollama.com/install.sh | sh
Per installazioni manuali o istruzioni specifiche per la tua distribuzione, consulta la Guida all'installazione di Ollama.
Windows
Scarica l'installer per Windows da ollama.com ed eseguilo. L’installer aggiunge Ollama al tuo PATH e avvia automaticamente il servizio in background. Dopo l’installazione, apri PowerShell o Prompt dei comandi per verificare:
ollama --version
Download ed esecuzione dei modelli
Una volta installato Ollama, scarica il modello desiderato. Per la variante da 20 miliardi di parametri:
ollama pull gpt-oss:20b
Per la variante da 120 miliardi di parametri:
ollama pull gpt-oss:120b
Il download dei pesi del modello avviene in ~/.ollama/models su macOS e Linux, oppure in %USERPROFILE%.ollamamodels su Windows. Il download è interrompibile e riprendibile, quindi puoi sospendere e riavviare senza perdere progressi.
Dopo aver scaricato il modello, avvia una sessione interattiva:
ollama run gpt-oss:20b
Oppure, per il modello più grande:
ollama run gpt-oss:120b
Questo apre un’interfaccia chat. Digita il tuo prompt, premi Invio e il modello restituisce la risposta in streaming. Digita /bye per uscire.
Accesso all'API
Ollama esegue un server HTTP locale all'indirizzo http://localhost:11434. È possibile inviare richieste tramite curl, Python o qualsiasi client HTTP:
curl http://localhost:11434/api/generate -d '{
"model": "gpt-oss:20b",
"prompt": "Spiega la quantizzazione MXFP4 in una frase."
}'
Per applicazioni strutturate, utilizza l’SDK Python o JavaScript di Ollama. Entrambi sono disponibili tramite i normali gestori di pacchetti (pip install ollama, npm install ollama) e forniscono interfacce tipizzate per la generazione, l’embedding e la gestione dei modelli.
Prestazioni e confronto tra modelli
Il modello da 20 miliardi di parametri genera da 15 a 30 token al secondo su una RTX 4090, a seconda della lunghezza del contesto e della complessità del prompt. Il modello da 120 miliardi di parametri genera da 8 a 15 token al secondo su una A100 da 80 GB. Entrambe le cifre presuppongono le impostazioni predefinite, senza ulteriori ottimizzazioni come la decodifica speculativa.
Dal punto di vista qualitativo, gpt-oss:20b offre prestazioni paragonabili a quelle di Llama 3.1 8B e Mistral 7B sui benchmark di ragionamento come MMLU e GSM8K. Supera entrambi nei compiti di esecuzione di istruzioni su più turni, probabilmente grazie al fine-tuning basato sul rinforzo con feedback umano (RLHF) effettuato da OpenAI. La variante da 120 miliardi di parametri si avvicina alla qualità di GPT-3.5 Turbo, rendendola il modello open source più performante sotto i 200 miliardi di parametri al momento di agosto 2026.
Rispetto ai modelli proprietari basati su API, l’esecuzione locale di gpt-oss diventa conveniente a partire da circa 2 milioni di token al mese per il modello da 20 miliardi di parametri, oppure da 500.000 token al mese per il modello da 120 miliardi di parametri, supponendo che tu possieda già l’hardware necessario. Usa il calcolatore self-hosting vs API per stimare il tuo punto di pareggio in base al volume di token e ai costi hardware.
Quantizzazione MXFP4
Entrambi i modelli gpt-oss includono integrata la quantizzazione MXFP4. MXFP4 è un formato floating-point a microscala che rappresenta i pesi con una media di 4,25 bit per parametro, rispetto ai 16 bit della precisione half-standard. A differenza di schemi di quantizzazione più vecchi come GPTQ o AWQ, MXFP4 preserva un maggior range dinamico, riducendo la perdita di accuratezza tipicamente associata a compressioni aggressive.
Nella pratica, i modelli quantizzati in MXFP4 si comportano quasi identicamente alle loro controparti a piena precisione nella maggior parte dei compiti. La quantizzazione avviene durante l’addestramento, non successivamente, consentendo così al modello di adattarsi alla minore precisione. Questo approccio riduce i requisiti di VRAM di circa il 75% rispetto all’FP16, rendendo fattibile l’esecuzione di modelli da 120 miliardi di parametri su una singola GPU consumer.
Finestra di contesto e utilizzo della memoria
Entrambe le varianti di gpt-oss supportano una finestra di contesto di 128K token, equivalente a circa 100.000 parole di testo inglese. Tuttavia, sfruttare effettivamente l’intera finestra di contesto richiede una quantità significativa di memoria aggiuntiva oltre ai pesi base del modello.
Per gpt-oss:20b, una finestra di contesto da 128K token aggiunge circa 8 GB di overhead di memoria. Con 24 GB di VRAM è possibile utilizzare comodamente l’intera finestra; con 16 GB, invece, è consigliabile limitare il contesto a 32K–48K token per evitare esaurimenti di memoria durante la generazione.
Per gpt-oss:120b, una finestra di contesto da 128K token aggiunge circa 20 GB di overhead. Una GPU da 80 GB può gestirla agevolmente, ma un deployment da 70 GB (due GPU consumer) dovrebbe limitare il contesto a 64K token. Consulta Requisiti VRAM per modello per curve dettagliate di scalabilità della memoria.
Domande frequenti
È possibile effettuare il fine-tuning dei modelli gpt-oss?
Sì. OpenAI ha rilasciato gpt-oss sotto una licenza permissiva che ne consente il fine-tuning per qualsiasi scopo, inclusi gli utilizzi commerciali. È possibile utilizzare framework standard per il fine-tuning come Axolotl o Hugging Face TRL. I pesi del modello sono compatibili con l’architettura Llama, quindi gran parte degli strumenti sviluppati per Llama funziona senza modifiche.
Come si confronta gpt-oss:120b con Llama 3.1 70B?
gpt-oss:120b supera Llama 3.1 70B nell’esecuzione di istruzioni e nelle conversazioni su più turni, specialmente nei compiti che richiedono il mantenimento del contesto attraverso numerosi scambi. Llama 3.1 70B registra leggeri vantaggi sui benchmark puri di ragionamento come MATH e DROP. Entrambi i modelli offrono prestazioni simili nei compiti di programmazione. Il modello da 120 miliardi di parametri richiede più VRAM (70 GB contro 40 GB), ma garantisce un miglioramento qualitativo evidente nelle interazioni di tipo assistente.
Posso eseguire gpt-oss:120b su più GPU consumer?
Sì. Ollama suddivide automaticamente il modello tra le GPU disponibili se una singola GPU non dispone di memoria sufficiente. Due RTX 4090 (48 GB di VRAM complessiva) possono eseguire gpt-oss:120b, anche se la velocità di inferenza diminuisce del 20–30% rispetto a quella ottenibile con una singola GPU da 80 GB, a causa dell’overhead legato alla comunicazione tra GPU. L’uso di tre o più GPU offre benefici marginali: se hai il budget per questo, una singola A100 o H100 risulta più conveniente.
gpt-oss funziona offline?
Sì, una volta scaricato il modello con ollama pull. Ollama memorizza localmente tutti i pesi del modello e l’inferenza avviene interamente sulla tua macchina. L’accesso alla rete avviene soltanto durante il download iniziale e quando si verificano eventuali aggiornamenti del modello. È possibile disabilitare gli aggiornamenti automatici impostando OLLAMA_SKIP_UPGRADE=1 nel tuo ambiente.
Quale licenza si applica agli output generati da gpt-oss?
La licenza gpt-oss di OpenAI non rivendica alcun diritto di proprietà sugli output generati. Tu sei il proprietario degli output prodotti e puoi utilizzarli per qualsiasi scopo, inclusi prodotti e servizi commerciali. Ciò differisce dai termini di servizio dell’API di OpenAI, che limitano alcuni casi d’uso. Leggi sempre attentamente il testo completo della licenza incluso nel download del modello per verificare i termini più aggiornati.
Posso utilizzare i modelli gpt-oss a fini commerciali?
Sì. La licenza ne consente l’uso commerciale senza restrizioni, inclusa l’integrazione del modello in prodotti proprietari, la sua offerta come servizio o l’utilizzo per generare contenuti da vendere. Non sei tenuto a rilasciare come open source opere derivate né a dichiarare esplicitamente l’uso di gpt-oss nel tuo prodotto, sebbene l’attribuzione sia incoraggiata.
