Friday, 2 October 2026 | Updating Daily AI insight, written for builders

Ollama Gemma 4: Modelli Gemma attuali e come eseguirli

TL;DR:

  • Non esiste alcun rilascio di Gemma 4 a partire da agosto 2026. La famiglia Gemma più recente include Gemma 2 (2B, 9B, 27B) e il Gemma originale (2B, 7B).
  • Esegui Gemma 2 su Ollama con ollama run gemma2:27b, ollama run gemma2:9b, oppure ollama run gemma2:2b a seconda della memoria GPU disponibile.
  • Il modello 27B richiede 16 GB+ di VRAM per la precisione completa, mentre il 9B funziona comodamente su GPU da 8 GB e il 2B su 4 GB.
  • Tutti i modelli Gemma su Ollama supportano prompt di sistema, modalità JSON e conversazioni multi-turno out of the box.

Quando cerchi Ollama Gemma 4, probabilmente stai cercando i modelli Gemma più recenti disponibili tramite Ollama. A partire da agosto 2026, non esiste alcun rilascio ufficiale di Gemma 4 da Google DeepMind. I modelli più recenti sono la famiglia Gemma 2 (varianti con 2B, 9B e 27B parametri) e la serie Gemma originale (2B e 7B). Entrambe le famiglie funzionano nativamente su Ollama con un singolo comando.

Modelli Gemma Disponibili su Ollama

Ollama supporta sei varianti del modello Gemma su due generazioni. Ognuno utilizza la licenza open-weight di Google e può essere eseguito completamente offline una volta scaricato.

Nome del Modello Parametri Comando Ollama VRAM Min. (Q4) Lunghezza del contesto
Gemma 2 27B 27 miliardi ollama run gemma2:27b 16 GB 8.192 token
Gemma 2 9B 9 miliardi ollama run gemma2:9b 6 GB 8.192 token
Gemma 2 2B 2 miliardi ollama run gemma2:2b 2 GB 8.192 token
Gemma 7B 7 miliardi ollama run gemma:7b 5 GB 8.192 token
Gemma 2B 2 miliardi ollama run gemma:2b 2 GB 8.192 token
Gemma 2B Instruct 2 miliardi ollama run gemma:2b-instruct 2 GB 8.192 token

La serie Gemma 2 offre prestazioni migliori per parametro rispetto ai modelli Gemma originali. Per la maggior parte degli utenti, gemma2:9b fornisce il migliore equilibrio tra qualità e requisiti hardware. Puoi vedere come questi modelli si confrontano con le alternative in Classifica LLM.

Installazione ed Esecuzione dei Modelli Gemma

Per prima cosa, assicurati che Ollama sia installato sul tuo sistema. Se non l'hai ancora installato, segui le Guida all'installazione di Ollama per la tua piattaforma. Una volta installato, l'esecuzione di qualsiasi modello Gemma richiede un singolo comando che scarica e avvia il modello automaticamente.

macOS e Linux

Apri Terminal ed esegui:

ollama run gemma2:9b

Questo scarica il modello Gemma 2 con 9 miliardi di parametri (circa 5,5 GB per la versione quantizzata a 4 bit) e avvia una sessione di chat interattiva. Per usare una dimensione diversa:

# Per 27B (massima qualità, serve 16GB+ VRAM)
ollama run gemma2:27b

# Per 2B (più veloce, gira su GPU da 4GB)
ollama run gemma2:2b

# Gemma 7B originale
ollama run gemma:7b

Windows

Apri il Prompt dei Comandi o PowerShell e usa gli stessi comandi:

ollama run gemma2:9b

Gli utenti Windows con GPU NVIDIA dovrebbero assicurarsi che i driver della GPU siano aggiornati per prestazioni ottimali. Il supporto GPU AMD tramite ROCm funziona su Linux ma rimane sperimentale su Windows a partire da agosto 2026.

Esecuzione come Server API

Per eseguire Gemma come servizio API persistente anziché una chat interattiva:

# Avvia il server Ollama (si esegue automaticamente su macOS/Linux, manuale su Windows)
ollama serve

# In un altro terminale, scarica il modello senza avviare la chat
ollama pull gemma2:9b

# Effettua richieste API
curl http://localhost:11434/api/generate -d '{
  "model": "gemma2:9b",
  "prompt": "Spiega l'entanglement quantistico in termini semplici.",
  "stream": false
}'

Questo approccio funziona in modo identico su tutte le piattaforme e si integra con le librerie compatibili con OpenAI indicandole su http://localhost:11434.

Requisiti di Sistema e Prestazioni

I modelli Gemma funzionano in modo efficiente su hardware consumer grazie alle ottimizzazioni di Ollama e alla quantizzazione. I requisiti di VRAM variano in modo significativo in base alle dimensioni del modello e al livello di quantizzazione.

Modello Precisione Completa (FP16) Quantizzato a 4 bit (Q4) Token/Secondo (RTX 4090)
Gemma 2 27B 54 GB 16 GB 22-28 t/s
Gemma 2 9B 18 GB 6 GB 45-60 t/s
Gemma 2 2B 4 GB 2 GB 120-150 t/s
Gemma 7B 14 GB 5 GB 40-55 t/s

Per impostazione predefinita, Ollama scarica versioni quantizzate a 4 bit che riducono l'utilizzo di memoria del 75% con una perdita di qualità minima. Calcola i requisiti esatti di VRAM per il tuo hardware utilizzando il Calcolatore VRAM, che tiene conto della lunghezza del contesto e della dimensione del batch. Per una ripartizione completa dei requisiti di memoria tra i modelli, consulta Requisiti VRAM per modello.

GPU Consigliate

  • RTX 4060 Ti 16GB / RTX 3090: Può eseguire Gemma 2 27B con quantizzazione Q4 con finestre di contesto completo.
  • RTX 4070 / RX 7800 XT: Ideale per Gemma 2 9B con spazio aggiuntivo per conversazioni lunghe.
  • RTX 4060 / RTX 3060: Gestisce comodamente Gemma 2 2B e Gemma 7B.
  • GPU Integrate (Apple Silicon, Intel Arc): Gemma 2 2B funziona bene su Mac M1/M2 e GPU Intel Arc recenti con memoria unificata 16GB+.

Per raccomandazioni GPU dettagliate e benchmark delle prestazioni, consulta il migliori GPU per eseguire LLM localmente guida.

Scelta tra i Modelli Gemma

Il modello Gemma giusto dipende dal tuo caso d'uso, dall'hardware e dai requisiti di qualità. I modelli Gemma 2 superano costantemente i loro predecessori in ragionamento, comprensione delle istruzioni e compiti di codifica.

Gemma 2 27B compete con modelli molto più grandi in qualità ma richiede una VRAM sostanziale. Usalo per ragionamento complesso, scrittura tecnica o generazione di codice dove l'accuratezza conta più della velocità. È paragonabile a modelli 70B di altre famiglie in molti benchmark.

Gemma 2 9B è il compromesso ideale per la maggior parte degli sviluppatori. Funziona su GPU di fascia media, offre prestazioni solide su compiti generali e genera risposte abbastanza velocemente per applicazioni interattive. Questo è il modello con cui iniziare a meno che tu non abbia vincoli specifici.

Gemma 2 2B eccelle in scenari ad alto throughput: elaborazione batch, deployment edge o esecuzione di più agenti simultaneamente. Anche se meno capace delle varianti più grandi, è sorprendentemente competente nell'estrazione di dati strutturati, classificazione e dialogo semplice.

Gli originali Gemma 7B e 2B rimangono disponibili ma non offrono vantaggi rispetto a Gemma 2 se non un utilizzo leggermente inferiore di VRAM a dimensioni equivalenti. I nuovi progetti dovrebbero predefinire Gemma 2.

Per più opzioni, esplora il Elenco modelli Ollama oppure consulta migliori modelli locali per Ollama per alternative come Llama, Mistral e Qwen.

Configurazione e Ottimizzazione del Modello

Ollama espone diversi parametri per ottimizzare il comportamento e le prestazioni di Gemma. Crea un Modelfile per personalizzare le impostazioni:

FROM gemma2:9b

# Set temperature (0.0 = deterministic, 1.0 = creative)
PARAMETER temperature 0.7

# Limit response length
PARAMETER num_predict 512

# Set system prompt
SYSTEM You are a technical documentation assistant. Provide accurate, concise answers with code examples.

Carica la tua configurazione personalizzata:

ollama create my-gemma -f ./Modelfile
ollama run my-gemma

I parametri chiave includono:

  • temperature: Controlla la casualità (0.1-0.3 per compiti fattuali, 0.7-0.9 per lavoro creativo)
  • top_p: Soglia di campionamento nucleus (0.9 predefinito, più basso per output più focalizzati)
  • num_predict: Token massimi da generare (-1 per illimitato, 512-2048 tipico)
  • num_ctx: Dimensione della finestra di contesto (2048-8192, più alto utilizza più VRAM)

Per il confronto dei costi tra eseguire Gemma localmente rispetto all'utilizzo di API ospitate, utilizza il calcolatore self-hosting vs API per trovare il tuo punto di pareggio.

Integrazione con Strumenti di Sviluppo

I modelli Gemma su Ollama funzionano con le librerie LLM standard puntando all'endpoint Ollama locale. Ecco come integrarsi con i framework più diffusi:

Python (LangChain)

from langchain_community.llms import Ollama

llm = Ollama(model="gemma2:9b")
response = llm.invoke("Write a Python function to calculate Fibonacci numbers.")
print(response)

JavaScript (LangChain.js)

import { Ollama } from "@langchain/community/llms/ollama";

const llm = new Ollama({
  baseUrl: "http://localhost:11434",
  model: "gemma2:9b",
});

const response = await llm.invoke("Explain async/await in JavaScript.");
console.log(response);

Client compatibili con OpenAI

Molte librerie supportano il formato API di OpenAI. Configurale per usare Ollama:

import openai

client = openai.OpenAI(
    base_url="http://localhost:11434/v1",
    api_key="ollama"  # required but ignored
)

response = client.chat.completions.create(
    model="gemma2:9b",
    messages=[{"role": "user", "content": "Hello!"}]
)
print(response.choices[0].message.content)

Risoluzione dei Problemi Comuni

I download dei modelli falliscono o scadono: I modelli Gemma vanno da 1.5 GB (2B quantizzato) a 54 GB (27B precisione completa). Su connessioni lente, usa ollama pull gemma2:9b in un terminale dedicato per monitorare il progresso del download. I download parziali riprendono automaticamente se interrotti.

Errori di memoria insufficiente: Se Ollama si arresta in modo anomalo o rifiuta di caricare un modello, la tua GPU non dispone di VRAM sufficiente. Riduci a un modello più piccolo (gemma2:2b al posto di 9b) oppure riduci la finestra di contesto utilizzando PARAMETER num_ctx 2048 in un Modelfile personalizzato. Verifica i requisiti effettivi con lo strumento Calcolatore VRAM.

Generazione lenta su Apple Silicon: Assicurati che l'accelerazione Metal sia abilitata. Ollama utilizza Metal per impostazione predefinita su macOS, ma le versioni più vecchie di Ollama potrebbero ricadere sull'elaborazione CPU. Aggiorna all'ultima versione con brew upgrade ollama oppure reinstalla Ollama dal sito web ufficiale.

L'API restituisce risposte vuote: Verifica che ollama serve sia in esecuzione e accessibile all'indirizzo http://localhost:11434. Esegui un test con curl http://localhost:11434/api/tags per elencare i modelli disponibili. Se il modello non compare, esegui ollama pull gemma2:9b primo.

GPU non rilevata su Windows: Ollama richiede GPU NVIDIA con supporto CUDA oppure GPU AMD con supporto ROCm (solo su Linux). Aggiorna i driver della tua GPU tramite Gestione dispositivi o direttamente dal sito web del produttore. Verifica la rilevazione con nvidia-smi (NVIDIA) oppure rocm-smi (AMD).

Domande frequenti

Esiste un modello Gemma 4?

No. Al momento di agosto 2026, Google DeepMind ha rilasciato Gemma (2B, 7B) e Gemma 2 (2B, 9B, 27B), ma non esiste alcun modello Gemma 4. Il numero «2» in Gemma 2 indica la seconda generazione della famiglia di modelli, non il numero di parametri. Quando cerchi «Gemma 4», probabilmente intendi i modelli più recenti: Gemma 2 27B per la massima qualità, Gemma 2 9B per un equilibrio tra prestazioni e risorse, oppure Gemma 2 2B per ambienti con risorse limitate.

Qual è la differenza tra Gemma e Gemma 2?

Gemma 2 è un'architettura di seconda generazione con miglioramenti significativi nelle capacità di ragionamento, di esecuzione di istruzioni e multilingue. I modelli Gemma 2 raggiungono una qualità comparabile a quella di modelli di prima generazione più grandi, pur utilizzando meno memoria e generando risposte più velocemente. Ad esempio, Gemma 2 9B eguaglia o supera il modello originale Gemma 7B nella maggior parte dei benchmark. A meno che tu non abbia una motivazione specifica per utilizzare la serie originale Gemma, ti consigliamo di partire da Gemma 2.

Posso utilizzare i modelli Gemma a fini commerciali?

Sì. I modelli Gemma sono rilasciati con la licenza open-weight di Google, che ne autorizza l'uso commerciale, la modifica e la distribuzione. A differenza di alcuni modelli aperti con licenze riservate alla ricerca, puoi distribuire Gemma in applicazioni di produzione, prodotti SaaS o sistemi aziendali senza ulteriori obblighi di licenza. L'unica restrizione è che non puoi usare il nome «Gemma» per suggerire un endorsement da parte di Google del tuo prodotto.

Come si confronta Gemma 2 9B con Llama 3 8B su Ollama?

Entrambi i modelli funzionano bene su hardware simile (6–8 GB di VRAM), ma presentano punti di forza diversi. Gemma 2 9B offre generalmente prestazioni migliori nell'esecuzione di istruzioni e nella generazione di output strutturati, rendendolo preferibile per l'utilizzo di strumenti, la generazione di JSON e le applicazioni basate su agenti. Llama 3 8B tende invece a produrre risposte conversazionali più naturali e gestisce leggermente meglio la scrittura creativa. Per compiti tecnici e di programmazione, la maggior parte degli sviluppatori considera Gemma 2 9B più affidabile. Valuta entrambi i modelli nel tuo caso d'uso specifico, poiché la percezione della qualità varia a seconda dell'applicazione.

Devo pagare per eseguire i modelli Gemma su Ollama?

No. Ollama è un software gratuito e open source, e i modelli Gemma sono rilasciati con pesi aperti e senza costi. Pagherai soltanto per l'hardware necessario (GPU, RAM, energia elettrica) per farli girare. Per confrontare i costi di utilizzo, il Calcolatore costi API mostra quando l'hosting locale diventa più conveniente rispetto alle API cloud. La maggior parte degli sviluppatori che eseguono più di 10.000 query al mese risparmia denaro ospitando localmente Gemma anziché ricorrere ad API commerciali.

I modelli Gemma possono essere eseguiti senza GPU?

Sì, ma molto lentamente. Ollama ricade automaticamente sull'esecuzione su CPU quando non rileva una GPU compatibile. Gemma 2 2B genera da 3 a 8 token al secondo su CPU moderne (Ryzen 5000+ o Intel di dodicesima generazione o successive), il che è accettabile per richieste occasionali, ma frustrante per chat interattive. Gemma 2 9B e modelli più grandi generano meno di 2 token al secondo su CPU, rendendoli impraticabili. Per un utilizzo serio LLM locale ti consigliamo di investire in una GPU — anche una scheda entry-level come una RTX 3060 o una usata RTX 2080 migliora drasticamente l'esperienza. Consulta le raccomandazioni hardware nella Guida completa di Ollama.

Scritto da Mustafa Ihsan

Mustafa Ihsan è il fondatore e redattore di Convly.ai. Ha costruito e mantiene il database live dei modelli AI del sito, il suo indice prezzo-performance e i suoi calcolatori gratuiti per i requisiti di VRAM, i costi API e l'economia dell'hosting autonomo. Scrive su prezzi dei modelli, risultati di benchmark e l'hardware necessario per eseguire modelli AI localmente, e preferisce coerentemente i numeri misurati alle affermazioni dei fornitori.

Scroll to Top