Monday, 17 August 2026 | Updating Daily AI insight, written for builders

Ollama Gemma 4: modelli Gemma attuali e come eseguirli

In breve:

  • Non esiste alcun rilascio ufficiale di Gemma 4 ad agosto 2026. L'ultima famiglia Gemma comprende Gemma 2 (2B, 9B, 27B) e la versione originale Gemma (2B, 7B).
  • Esegui Gemma 2 su Ollama con ollama run gemma2:27b, ollama run gemma2:9b, oppure ollama run gemma2:2b a seconda della memoria GPU disponibile.
  • Il modello da 27 miliardi di parametri richiede almeno 16 GB di VRAM in piena precisione, mentre quello da 9 miliardi gira agevolmente su GPU da 8 GB e quello da 2 miliardi su GPU da 4 GB.
  • Tutti i modelli Gemma disponibili su Ollama supportano nativamente i prompt di sistema, la modalità JSON e conversazioni multiround.

Quando cerchi Ollama Gemma 4, probabilmente stai cercando i modelli Gemma più recenti disponibili tramite Ollama. Ad agosto 2026 non esiste alcun rilascio ufficiale di Gemma 4 da parte di Google DeepMind. I modelli più recenti sono la famiglia Gemma 2 (varianti da 2B, 9B e 27B parametri) e la serie originale Gemma (2B e 7B). Entrambe le famiglie girano nativamente su Ollama con un singolo comando.

Modelli Gemma disponibili su Ollama

Ollama supporta sei varianti di modelli Gemma appartenenti a due generazioni. Ciascuna utilizza la licenza open-weight di Google ed è in grado di funzionare interamente offline una volta scaricata.

Nome del modelloParametriComando OllamaVRAM minima (Q4)Lunghezza del contesto
Gemma 2 27B27 miliardiollama run gemma2:27b16 GB8.192 token
Gemma 2 9B9 miliardiollama run gemma2:9b6 GB8.192 token
Gemma 2 da 2 miliardi2 miliardiollama run gemma2:2b2 GB8.192 token
Gemma 7B7 miliardiollama run gemma:7b5 GB8.192 token
Gemma 2B2 miliardiollama run gemma:2b2 GB8.192 token
Gemma 2B Instruct2 miliardiollama run gemma:2b-instruct2 GB8.192 token

La serie Gemma 2 offre migliori prestazioni per parametro rispetto ai modelli Gemma originali. Per la maggior parte degli utenti, gemma2:9b rappresenta il miglior compromesso tra qualità e requisiti hardware. Puoi confrontare queste prestazioni con altri modelli nella Classifica LLM.

Installazione ed esecuzione dei modelli Gemma

Prima di tutto, assicurati che Ollama sia installato sul tuo sistema. Se non lo hai ancora installato, segui le Guida all'installazione di Ollama istruzioni specifiche per la tua piattaforma. Una volta installato, l'esecuzione di qualsiasi modello Gemma richiede un singolo comando che ne avvia automaticamente il download e l'avvio.

macOS e Linux

Apri il Terminale ed esegui:

ollama run gemma2:9b

Questo scarica il modello Gemma 2 da 9 miliardi di parametri (circa 5,5 GB nella versione quantizzata a 4 bit) e avvia una sessione interattiva di chat. Per utilizzare una dimensione diversa:

# Per 27B (massima qualità, richiede 16 GB+ di VRAM)
ollama run gemma2:27b

# Per 2B (più veloce, funziona su GPU da 4 GB)
ollama run gemma2:2b

# Gemma originale da 7B
ollama run gemma:7b

Windows

Apri Prompt dei comandi o PowerShell e usa gli stessi comandi:

ollama run gemma2:9b

Gli utenti Windows con GPU NVIDIA dovrebbero assicurarsi che i driver GPU siano aggiornati per ottenere prestazioni ottimali. Il supporto per GPU AMD tramite ROCm funziona su Linux, ma rimane sperimentale su Windows ad agosto 2026.

Esecuzione come server API

Per eseguire Gemma come servizio API persistente anziché come chat interattiva:

# Avvia il server Ollama (viene avviato automaticamente su macOS/Linux, manualmente su Windows)
ollama serve

# In un altro terminale, scarica il modello senza avviare la chat
ollama pull gemma2:9b

# Effettua richieste API
curl http://localhost:11434/api/generate -d '{
  "model": "gemma2:9b",
  "prompt": "Spiega l'entanglement quantistico in termini semplici.",
  "stream": false
}'

Questo approccio funziona in modo identico su tutte le piattaforme e si integra con librerie compatibili con OpenAI puntando semplicemente a http://localhost:11434.

Requisiti di sistema e prestazioni

I modelli Gemma girano in modo efficiente su hardware consumer grazie alle ottimizzazioni e alla quantizzazione implementate da Ollama. I requisiti di VRAM variano notevolmente in base alle dimensioni del modello e al livello di quantizzazione.

ModelloPrecisione completa (FP16)Quantizzazione a 4 bit (Q4)Token al secondo (RTX 4090)
Gemma 2 27B54 GB16 GB22–28 t/s
Gemma 2 9B18 GB6 GB45-60 token/s
Gemma 2 da 2 miliardinon sono un dettaglio estetico:2 GB120-150 token/s
Gemma 7B14 GB5 GB40-55 token/s

Per impostazione predefinita, Ollama scarica versioni quantizzate a 4 bit che riducono l'utilizzo della memoria del 75% con una perdita di qualità minima. Calcola i requisiti esatti di VRAM per il tuo hardware utilizzando lo strumento Calcolatore VRAM, che tiene conto della lunghezza del contesto e della dimensione del batch. Per un'analisi completa dei requisiti di memoria per diversi modelli, consulta Requisiti VRAM per modello.

GPU consigliate

  • RTX 4060 Ti 16 GB / RTX 3090: Consente di eseguire Gemma 2 da 27 miliardi di parametri (27B) con quantizzazione Q4 e finestra di contesto completa.
  • RTX 4070 / RX 7800 XT: Ideale per Gemma 2 da 9 miliardi di parametri (9B), con margine sufficiente per conversazioni prolungate.
  • RTX 4060 / RTX 3060: Gestisce agevolmente Gemma 2 da 2 miliardi di parametri (2B) e Gemma da 7 miliardi di parametri (7B).
  • GPU integrate (Apple Silicon, Intel Arc): Gemma 2 da 2 miliardi di parametri (2B) funziona bene sui Mac M1/M2 e sulle recenti GPU Intel Arc dotate di almeno 16 GB di memoria unificata.

Per raccomandazioni dettagliate sulle GPU e benchmark prestazionali, consulta la migliori GPU per eseguire LLM localmente guida.

Scelta tra i modelli Gemma

La scelta del modello Gemma più adatto dipende dal tuo caso d'uso, dall'hardware disponibile e dai requisiti di qualità. I modelli Gemma 2 superano costantemente i loro predecessori in termini di ragionamento, capacità di seguire istruzioni e attività di programmazione.

Gemma 2 27B compete per qualità con modelli molto più grandi, ma richiede una notevole quantità di VRAM. Utilizzalo per compiti complessi di ragionamento, stesura tecnica o generazione di codice, quando l'accuratezza è più importante della velocità. In molti benchmark risulta comparabile ai modelli da 70 miliardi di parametri di altre famiglie.

Gemma 2 9B rappresenta il compromesso ideale per la maggior parte degli sviluppatori. Può essere eseguito su GPU di fascia media, offre ottime prestazioni su compiti generali e genera risposte abbastanza velocemente per applicazioni interattive. Questo è il modello da cui partire, a meno che non siano presenti vincoli specifici.

Gemma 2 da 2 miliardi eccelle negli scenari ad alto throughput: elaborazione batch, distribuzione su dispositivi edge o esecuzione simultanea di più agenti. Sebbene sia meno capace delle varianti più grandi, si rivela sorprendentemente competente nell'estrazione di dati strutturati, nella classificazione e nei dialoghi semplici.

L'originale Gemma 7B e 2B rimangono disponibili, ma non offrono vantaggi rispetto a Gemma 2 se non un leggero risparmio di VRAM a parità di dimensione. Per nuovi progetti si raccomanda di utilizzare per default Gemma 2.

Per ulteriori opzioni, esplora l'intero Elenco modelli Ollama o consulta I migliori modelli locali per Ollama per alternative come Llama, Mistral e Qwen.

Configurazione e ottimizzazione del modello

Ollama espone diversi parametri per regolare il comportamento e le prestazioni di Gemma. Crea un Modelfile per personalizzare le impostazioni:

FROM gemma2:9b

# Imposta la temperatura (0,0 = deterministico, 1,0 = creativo)
PARAMETER temperature 0.7

# Limita la lunghezza della risposta
PARAMETER num_predict 512

# Imposta il prompt di sistema
SYSTEM Sei un assistente per la redazione di documentazione tecnica. Fornisci risposte accurate e concise, accompagnate da esempi di codice.

Carica la tua configurazione personalizzata:

ollama create my-gemma -f ./Modelfile
ollama run my-gemma

I parametri principali includono:

  • temperature: Controlla il grado di casualità (0,1–0,3 per compiti fattuali, 0,7–0,9 per lavori creativi)
  • top_p: Soglia di campionamento nucleare (valore predefinito 0,9; inferiore per output più mirati)
  • num_predict: Numero massimo di token da generare (-1 per illimitato; tipicamente 512–2048)
  • num_ctx: Dimensione della finestra di contesto (2048–8192; valori più alti richiedono più VRAM)

Per confrontare i costi tra l'esecuzione locale di Gemma e l'utilizzo di API ospitate, usa lo strumento calcolatore self-hosting vs API per trovare il tuo punto di pareggio.

Integrazione con strumenti di sviluppo

I modelli Gemma su Ollama sono compatibili con le comuni librerie per LLM, basta indirizzarle all'endpoint locale di Ollama. Ecco come integrarli con i framework più diffusi:

Python (LangChain)

from langchain_community.llms import Ollama

llm = Ollama(model="gemma2:9b")
response = llm.invoke("Scrivi una funzione Python per calcolare i numeri di Fibonacci.")
print(response)

JavaScript (LangChain.js)

import { Ollama } from "@langchain/community/llms/ollama";

const llm = new Ollama({
  baseUrl: "http://localhost:11434",
  model: "gemma2:9b",
});

const response = await llm.invoke("Spiega async/await in JavaScript.");
console.log(response);

Client compatibili con OpenAI

Molte librerie supportano il formato API di OpenAI. Configurale per utilizzare Ollama:

import openai

client = openai.OpenAI(
    base_url="http://localhost:11434/v1",
    api_key="ollama"  # obbligatorio ma ignorato
)

response = client.chat.completions.create(
    model="gemma2:9b",
    messages=[{"role": "user", "content": "Ciao!"}]
)
print(response.choices[0].message.content)

Risoluzione dei problemi comuni

Download del modello falliti o timeout: I modelli Gemma variano da 1,5 GB (2B quantizzato) a 54 GB (27B in precisione piena). Su connessioni lente, utilizza ollama pull gemma2:9b in un terminale dedicato per monitorare lo stato del download. I download parziali vengono ripresi automaticamente in caso di interruzione.

Errori di memoria insufficiente (out of memory): Se Ollama si arresta in modo anomalo o rifiuta di caricare un modello, la tua GPU non dispone di VRAM sufficiente. Passa a un modello più piccolo (ad esempiogemma2:2b invece di 9b) oppure riduci la finestra di contesto utilizzando PARAMETER num_ctx 2048 in un Modelfile personalizzato. Verifica i requisiti effettivi con lo strumento Calcolatore VRAM.

Generazione lenta su Apple Silicon: Assicurati che l'accelerazione Metal sia abilitata. Ollama utilizza Metal per impostazione predefinita su macOS, ma le versioni più vecchie di Ollama potrebbero ricadere sull'elaborazione CPU. Aggiorna all'ultima versione con brew upgrade ollama oppure reinstalla Ollama dal sito web ufficiale.

L'API restituisce risposte vuote: Verifica che ollama serve sia in esecuzione e accessibile all'indirizzo http://localhost:11434. Esegui un test con curl http://localhost:11434/api/tags per elencare i modelli disponibili. Se il modello non compare, esegui ollama pull gemma2:9b primo.

GPU non rilevata su Windows: Ollama richiede GPU NVIDIA con supporto CUDA oppure GPU AMD con supporto ROCm (solo su Linux). Aggiorna i driver della tua GPU tramite Gestione dispositivi o direttamente dal sito web del produttore. Verifica la rilevazione con nvidia-smi (NVIDIA) oppure rocm-smi (AMD).

Domande frequenti

Esiste un modello Gemma 4?

No. Al momento di agosto 2026, Google DeepMind ha rilasciato Gemma (2B, 7B) e Gemma 2 (2B, 9B, 27B), ma non esiste alcun modello Gemma 4. Il numero «2» in Gemma 2 indica la seconda generazione della famiglia di modelli, non il numero di parametri. Quando cerchi «Gemma 4», probabilmente intendi i modelli più recenti: Gemma 2 27B per la massima qualità, Gemma 2 9B per un equilibrio tra prestazioni e risorse, oppure Gemma 2 2B per ambienti con risorse limitate.

Qual è la differenza tra Gemma e Gemma 2?

Gemma 2 è un'architettura di seconda generazione con miglioramenti significativi nelle capacità di ragionamento, di esecuzione di istruzioni e multilingue. I modelli Gemma 2 raggiungono una qualità comparabile a quella di modelli di prima generazione più grandi, pur utilizzando meno memoria e generando risposte più velocemente. Ad esempio, Gemma 2 9B eguaglia o supera il modello originale Gemma 7B nella maggior parte dei benchmark. A meno che tu non abbia una motivazione specifica per utilizzare la serie originale Gemma, ti consigliamo di partire da Gemma 2.

Posso utilizzare i modelli Gemma a fini commerciali?

Sì. I modelli Gemma sono rilasciati con la licenza open-weight di Google, che ne autorizza l'uso commerciale, la modifica e la distribuzione. A differenza di alcuni modelli aperti con licenze riservate alla ricerca, puoi distribuire Gemma in applicazioni di produzione, prodotti SaaS o sistemi aziendali senza ulteriori obblighi di licenza. L'unica restrizione è che non puoi usare il nome «Gemma» per suggerire un endorsement da parte di Google del tuo prodotto.

Come si confronta Gemma 2 9B con Llama 3 8B su Ollama?

Entrambi i modelli funzionano bene su hardware simile (6–8 GB di VRAM), ma presentano punti di forza diversi. Gemma 2 9B offre generalmente prestazioni migliori nell'esecuzione di istruzioni e nella generazione di output strutturati, rendendolo preferibile per l'utilizzo di strumenti, la generazione di JSON e le applicazioni basate su agenti. Llama 3 8B tende invece a produrre risposte conversazionali più naturali e gestisce leggermente meglio la scrittura creativa. Per compiti tecnici e di programmazione, la maggior parte degli sviluppatori considera Gemma 2 9B più affidabile. Valuta entrambi i modelli nel tuo caso d'uso specifico, poiché la percezione della qualità varia a seconda dell'applicazione.

Devo pagare per eseguire i modelli Gemma su Ollama?

No. Ollama è un software gratuito e open source, e i modelli Gemma sono rilasciati con pesi aperti e senza costi. Pagherai soltanto per l'hardware necessario (GPU, RAM, energia elettrica) per farli girare. Per confrontare i costi di utilizzo, il Calcolatore dei costi API mostra quando l'hosting locale diventa più conveniente rispetto alle API cloud. La maggior parte degli sviluppatori che eseguono più di 10.000 query al mese risparmia denaro ospitando localmente Gemma anziché ricorrere ad API commerciali.

I modelli Gemma possono essere eseguiti senza GPU?

Sì, ma molto lentamente. Ollama ricade automaticamente sull'esecuzione su CPU quando non rileva una GPU compatibile. Gemma 2 2B genera da 3 a 8 token al secondo su CPU moderne (Ryzen 5000+ o Intel di dodicesima generazione o successive), il che è accettabile per richieste occasionali, ma frustrante per chat interattive. Gemma 2 9B e modelli più grandi generano meno di 2 token al secondo su CPU, rendendoli impraticabili. Per un utilizzo serio LLM locale ti consigliamo di investire in una GPU — anche una scheda entry-level come una RTX 3060 o una usata RTX 2080 migliora drasticamente l'esperienza. Consulta le raccomandazioni hardware nella Guida completa a Ollama.

Scritto da Mustafa Ihsan

Mustafa Ihsan è il fondatore e redattore di Convly.ai. Ha creato e gestisce il database in tempo reale dei modelli IA del sito, il suo indice prezzo-prestazioni e i suoi calcolatori gratuiti per i requisiti di VRAM, i costi delle API e l'economia dell'auto-hosting. Scrive di prezzi dei modelli, risultati di benchmark e dell'hardware necessario per eseguire modelli IA in locale, privilegiando sempre dati misurati rispetto alle affermazioni dei produttori.

Scroll to Top
Featured on There's An AI For That