- Non esiste alcun rilascio ufficiale di Gemma 4 ad agosto 2026. L'ultima famiglia Gemma comprende Gemma 2 (2B, 9B, 27B) e la versione originale Gemma (2B, 7B).
- Esegui Gemma 2 su Ollama con
ollama run gemma2:27b,ollama run gemma2:9b, oppureollama run gemma2:2ba seconda della memoria GPU disponibile. - Il modello da 27 miliardi di parametri richiede almeno 16 GB di VRAM in piena precisione, mentre quello da 9 miliardi gira agevolmente su GPU da 8 GB e quello da 2 miliardi su GPU da 4 GB.
- Tutti i modelli Gemma disponibili su Ollama supportano nativamente i prompt di sistema, la modalità JSON e conversazioni multiround.
Quando cerchi Ollama Gemma 4, probabilmente stai cercando i modelli Gemma più recenti disponibili tramite Ollama. Ad agosto 2026 non esiste alcun rilascio ufficiale di Gemma 4 da parte di Google DeepMind. I modelli più recenti sono la famiglia Gemma 2 (varianti da 2B, 9B e 27B parametri) e la serie originale Gemma (2B e 7B). Entrambe le famiglie girano nativamente su Ollama con un singolo comando.
Modelli Gemma disponibili su Ollama
Ollama supporta sei varianti di modelli Gemma appartenenti a due generazioni. Ciascuna utilizza la licenza open-weight di Google ed è in grado di funzionare interamente offline una volta scaricata.
| Nome del modello | Parametri | Comando Ollama | VRAM minima (Q4) | Lunghezza del contesto |
|---|---|---|---|---|
| Gemma 2 27B | 27 miliardi | ollama run gemma2:27b | 16 GB | 8.192 token |
| Gemma 2 9B | 9 miliardi | ollama run gemma2:9b | 6 GB | 8.192 token |
| Gemma 2 da 2 miliardi | 2 miliardi | ollama run gemma2:2b | 2 GB | 8.192 token |
| Gemma 7B | 7 miliardi | ollama run gemma:7b | 5 GB | 8.192 token |
| Gemma 2B | 2 miliardi | ollama run gemma:2b | 2 GB | 8.192 token |
| Gemma 2B Instruct | 2 miliardi | ollama run gemma:2b-instruct | 2 GB | 8.192 token |
La serie Gemma 2 offre migliori prestazioni per parametro rispetto ai modelli Gemma originali. Per la maggior parte degli utenti, gemma2:9b rappresenta il miglior compromesso tra qualità e requisiti hardware. Puoi confrontare queste prestazioni con altri modelli nella Classifica LLM.
Installazione ed esecuzione dei modelli Gemma
Prima di tutto, assicurati che Ollama sia installato sul tuo sistema. Se non lo hai ancora installato, segui le Guida all'installazione di Ollama istruzioni specifiche per la tua piattaforma. Una volta installato, l'esecuzione di qualsiasi modello Gemma richiede un singolo comando che ne avvia automaticamente il download e l'avvio.
macOS e Linux
Apri il Terminale ed esegui:
ollama run gemma2:9bQuesto scarica il modello Gemma 2 da 9 miliardi di parametri (circa 5,5 GB nella versione quantizzata a 4 bit) e avvia una sessione interattiva di chat. Per utilizzare una dimensione diversa:
# Per 27B (massima qualità, richiede 16 GB+ di VRAM)
ollama run gemma2:27b
# Per 2B (più veloce, funziona su GPU da 4 GB)
ollama run gemma2:2b
# Gemma originale da 7B
ollama run gemma:7bWindows
Apri Prompt dei comandi o PowerShell e usa gli stessi comandi:
ollama run gemma2:9bGli utenti Windows con GPU NVIDIA dovrebbero assicurarsi che i driver GPU siano aggiornati per ottenere prestazioni ottimali. Il supporto per GPU AMD tramite ROCm funziona su Linux, ma rimane sperimentale su Windows ad agosto 2026.
Esecuzione come server API
Per eseguire Gemma come servizio API persistente anziché come chat interattiva:
# Avvia il server Ollama (viene avviato automaticamente su macOS/Linux, manualmente su Windows)
ollama serve
# In un altro terminale, scarica il modello senza avviare la chat
ollama pull gemma2:9b
# Effettua richieste API
curl http://localhost:11434/api/generate -d '{
"model": "gemma2:9b",
"prompt": "Spiega l'entanglement quantistico in termini semplici.",
"stream": false
}'Questo approccio funziona in modo identico su tutte le piattaforme e si integra con librerie compatibili con OpenAI puntando semplicemente a http://localhost:11434.
Requisiti di sistema e prestazioni
I modelli Gemma girano in modo efficiente su hardware consumer grazie alle ottimizzazioni e alla quantizzazione implementate da Ollama. I requisiti di VRAM variano notevolmente in base alle dimensioni del modello e al livello di quantizzazione.
| Modello | Precisione completa (FP16) | Quantizzazione a 4 bit (Q4) | Token al secondo (RTX 4090) |
|---|---|---|---|
| Gemma 2 27B | 54 GB | 16 GB | 22–28 t/s |
| Gemma 2 9B | 18 GB | 6 GB | 45-60 token/s |
| Gemma 2 da 2 miliardi | non sono un dettaglio estetico: | 2 GB | 120-150 token/s |
| Gemma 7B | 14 GB | 5 GB | 40-55 token/s |
Per impostazione predefinita, Ollama scarica versioni quantizzate a 4 bit che riducono l'utilizzo della memoria del 75% con una perdita di qualità minima. Calcola i requisiti esatti di VRAM per il tuo hardware utilizzando lo strumento Calcolatore VRAM, che tiene conto della lunghezza del contesto e della dimensione del batch. Per un'analisi completa dei requisiti di memoria per diversi modelli, consulta Requisiti VRAM per modello.
GPU consigliate
- RTX 4060 Ti 16 GB / RTX 3090: Consente di eseguire Gemma 2 da 27 miliardi di parametri (27B) con quantizzazione Q4 e finestra di contesto completa.
- RTX 4070 / RX 7800 XT: Ideale per Gemma 2 da 9 miliardi di parametri (9B), con margine sufficiente per conversazioni prolungate.
- RTX 4060 / RTX 3060: Gestisce agevolmente Gemma 2 da 2 miliardi di parametri (2B) e Gemma da 7 miliardi di parametri (7B).
- GPU integrate (Apple Silicon, Intel Arc): Gemma 2 da 2 miliardi di parametri (2B) funziona bene sui Mac M1/M2 e sulle recenti GPU Intel Arc dotate di almeno 16 GB di memoria unificata.
Per raccomandazioni dettagliate sulle GPU e benchmark prestazionali, consulta la migliori GPU per eseguire LLM localmente guida.
Scelta tra i modelli Gemma
La scelta del modello Gemma più adatto dipende dal tuo caso d'uso, dall'hardware disponibile e dai requisiti di qualità. I modelli Gemma 2 superano costantemente i loro predecessori in termini di ragionamento, capacità di seguire istruzioni e attività di programmazione.
Gemma 2 27B compete per qualità con modelli molto più grandi, ma richiede una notevole quantità di VRAM. Utilizzalo per compiti complessi di ragionamento, stesura tecnica o generazione di codice, quando l'accuratezza è più importante della velocità. In molti benchmark risulta comparabile ai modelli da 70 miliardi di parametri di altre famiglie.
Gemma 2 9B rappresenta il compromesso ideale per la maggior parte degli sviluppatori. Può essere eseguito su GPU di fascia media, offre ottime prestazioni su compiti generali e genera risposte abbastanza velocemente per applicazioni interattive. Questo è il modello da cui partire, a meno che non siano presenti vincoli specifici.
Gemma 2 da 2 miliardi eccelle negli scenari ad alto throughput: elaborazione batch, distribuzione su dispositivi edge o esecuzione simultanea di più agenti. Sebbene sia meno capace delle varianti più grandi, si rivela sorprendentemente competente nell'estrazione di dati strutturati, nella classificazione e nei dialoghi semplici.
L'originale Gemma 7B e 2B rimangono disponibili, ma non offrono vantaggi rispetto a Gemma 2 se non un leggero risparmio di VRAM a parità di dimensione. Per nuovi progetti si raccomanda di utilizzare per default Gemma 2.
Per ulteriori opzioni, esplora l'intero Elenco modelli Ollama o consulta I migliori modelli locali per Ollama per alternative come Llama, Mistral e Qwen.
Configurazione e ottimizzazione del modello
Ollama espone diversi parametri per regolare il comportamento e le prestazioni di Gemma. Crea un Modelfile per personalizzare le impostazioni:
FROM gemma2:9b
# Imposta la temperatura (0,0 = deterministico, 1,0 = creativo)
PARAMETER temperature 0.7
# Limita la lunghezza della risposta
PARAMETER num_predict 512
# Imposta il prompt di sistema
SYSTEM Sei un assistente per la redazione di documentazione tecnica. Fornisci risposte accurate e concise, accompagnate da esempi di codice.Carica la tua configurazione personalizzata:
ollama create my-gemma -f ./Modelfile
ollama run my-gemmaI parametri principali includono:
temperature: Controlla il grado di casualità (0,1–0,3 per compiti fattuali, 0,7–0,9 per lavori creativi)top_p: Soglia di campionamento nucleare (valore predefinito 0,9; inferiore per output più mirati)num_predict: Numero massimo di token da generare (-1 per illimitato; tipicamente 512–2048)num_ctx: Dimensione della finestra di contesto (2048–8192; valori più alti richiedono più VRAM)
Per confrontare i costi tra l'esecuzione locale di Gemma e l'utilizzo di API ospitate, usa lo strumento calcolatore self-hosting vs API per trovare il tuo punto di pareggio.
Integrazione con strumenti di sviluppo
I modelli Gemma su Ollama sono compatibili con le comuni librerie per LLM, basta indirizzarle all'endpoint locale di Ollama. Ecco come integrarli con i framework più diffusi:
Python (LangChain)
from langchain_community.llms import Ollama
llm = Ollama(model="gemma2:9b")
response = llm.invoke("Scrivi una funzione Python per calcolare i numeri di Fibonacci.")
print(response)JavaScript (LangChain.js)
import { Ollama } from "@langchain/community/llms/ollama";
const llm = new Ollama({
baseUrl: "http://localhost:11434",
model: "gemma2:9b",
});
const response = await llm.invoke("Spiega async/await in JavaScript.");
console.log(response);Client compatibili con OpenAI
Molte librerie supportano il formato API di OpenAI. Configurale per utilizzare Ollama:
import openai
client = openai.OpenAI(
base_url="http://localhost:11434/v1",
api_key="ollama" # obbligatorio ma ignorato
)
response = client.chat.completions.create(
model="gemma2:9b",
messages=[{"role": "user", "content": "Ciao!"}]
)
print(response.choices[0].message.content)Risoluzione dei problemi comuni
Download del modello falliti o timeout: I modelli Gemma variano da 1,5 GB (2B quantizzato) a 54 GB (27B in precisione piena). Su connessioni lente, utilizza ollama pull gemma2:9b in un terminale dedicato per monitorare lo stato del download. I download parziali vengono ripresi automaticamente in caso di interruzione.
Errori di memoria insufficiente (out of memory): Se Ollama si arresta in modo anomalo o rifiuta di caricare un modello, la tua GPU non dispone di VRAM sufficiente. Passa a un modello più piccolo (ad esempiogemma2:2b invece di 9b) oppure riduci la finestra di contesto utilizzando PARAMETER num_ctx 2048 in un Modelfile personalizzato. Verifica i requisiti effettivi con lo strumento Calcolatore VRAM.
Generazione lenta su Apple Silicon: Assicurati che l'accelerazione Metal sia abilitata. Ollama utilizza Metal per impostazione predefinita su macOS, ma le versioni più vecchie di Ollama potrebbero ricadere sull'elaborazione CPU. Aggiorna all'ultima versione con brew upgrade ollama oppure reinstalla Ollama dal sito web ufficiale.
L'API restituisce risposte vuote: Verifica che ollama serve sia in esecuzione e accessibile all'indirizzo http://localhost:11434. Esegui un test con curl http://localhost:11434/api/tags per elencare i modelli disponibili. Se il modello non compare, esegui ollama pull gemma2:9b primo.
GPU non rilevata su Windows: Ollama richiede GPU NVIDIA con supporto CUDA oppure GPU AMD con supporto ROCm (solo su Linux). Aggiorna i driver della tua GPU tramite Gestione dispositivi o direttamente dal sito web del produttore. Verifica la rilevazione con nvidia-smi (NVIDIA) oppure rocm-smi (AMD).
Domande frequenti
Esiste un modello Gemma 4?
No. Al momento di agosto 2026, Google DeepMind ha rilasciato Gemma (2B, 7B) e Gemma 2 (2B, 9B, 27B), ma non esiste alcun modello Gemma 4. Il numero «2» in Gemma 2 indica la seconda generazione della famiglia di modelli, non il numero di parametri. Quando cerchi «Gemma 4», probabilmente intendi i modelli più recenti: Gemma 2 27B per la massima qualità, Gemma 2 9B per un equilibrio tra prestazioni e risorse, oppure Gemma 2 2B per ambienti con risorse limitate.
Qual è la differenza tra Gemma e Gemma 2?
Gemma 2 è un'architettura di seconda generazione con miglioramenti significativi nelle capacità di ragionamento, di esecuzione di istruzioni e multilingue. I modelli Gemma 2 raggiungono una qualità comparabile a quella di modelli di prima generazione più grandi, pur utilizzando meno memoria e generando risposte più velocemente. Ad esempio, Gemma 2 9B eguaglia o supera il modello originale Gemma 7B nella maggior parte dei benchmark. A meno che tu non abbia una motivazione specifica per utilizzare la serie originale Gemma, ti consigliamo di partire da Gemma 2.
Posso utilizzare i modelli Gemma a fini commerciali?
Sì. I modelli Gemma sono rilasciati con la licenza open-weight di Google, che ne autorizza l'uso commerciale, la modifica e la distribuzione. A differenza di alcuni modelli aperti con licenze riservate alla ricerca, puoi distribuire Gemma in applicazioni di produzione, prodotti SaaS o sistemi aziendali senza ulteriori obblighi di licenza. L'unica restrizione è che non puoi usare il nome «Gemma» per suggerire un endorsement da parte di Google del tuo prodotto.
Come si confronta Gemma 2 9B con Llama 3 8B su Ollama?
Entrambi i modelli funzionano bene su hardware simile (6–8 GB di VRAM), ma presentano punti di forza diversi. Gemma 2 9B offre generalmente prestazioni migliori nell'esecuzione di istruzioni e nella generazione di output strutturati, rendendolo preferibile per l'utilizzo di strumenti, la generazione di JSON e le applicazioni basate su agenti. Llama 3 8B tende invece a produrre risposte conversazionali più naturali e gestisce leggermente meglio la scrittura creativa. Per compiti tecnici e di programmazione, la maggior parte degli sviluppatori considera Gemma 2 9B più affidabile. Valuta entrambi i modelli nel tuo caso d'uso specifico, poiché la percezione della qualità varia a seconda dell'applicazione.
Devo pagare per eseguire i modelli Gemma su Ollama?
No. Ollama è un software gratuito e open source, e i modelli Gemma sono rilasciati con pesi aperti e senza costi. Pagherai soltanto per l'hardware necessario (GPU, RAM, energia elettrica) per farli girare. Per confrontare i costi di utilizzo, il Calcolatore dei costi API mostra quando l'hosting locale diventa più conveniente rispetto alle API cloud. La maggior parte degli sviluppatori che eseguono più di 10.000 query al mese risparmia denaro ospitando localmente Gemma anziché ricorrere ad API commerciali.
I modelli Gemma possono essere eseguiti senza GPU?
Sì, ma molto lentamente. Ollama ricade automaticamente sull'esecuzione su CPU quando non rileva una GPU compatibile. Gemma 2 2B genera da 3 a 8 token al secondo su CPU moderne (Ryzen 5000+ o Intel di dodicesima generazione o successive), il che è accettabile per richieste occasionali, ma frustrante per chat interattive. Gemma 2 9B e modelli più grandi generano meno di 2 token al secondo su CPU, rendendoli impraticabili. Per un utilizzo serio LLM locale ti consigliamo di investire in una GPU — anche una scheda entry-level come una RTX 3060 o una usata RTX 2080 migliora drasticamente l'esperienza. Consulta le raccomandazioni hardware nella Guida completa a Ollama.

