- Es gibt bis August 2026 keine offizielle Gemma-4-Version. Die neueste Gemma-Familie umfasst Gemma 2 (2 Mrd., 9 Mrd. und 27 Mrd. Parameter) sowie das ursprüngliche Gemma (2 Mrd. und 7 Mrd. Parameter).
- Führen Sie Gemma 2 unter Ollama mit folgendem Befehl aus:
ollama run gemma2:27b,ollama run gemma2:9b, oderollama run gemma2:2bje nach verfügbarem GPU-Speicher. - Das 27-Mrd.-Modell benötigt mindestens 16 GB VRAM für vollständige Präzision, während das 9-Mrd.-Modell problemlos auf GPUs mit 8 GB und das 2-Mrd.-Modell auf GPUs mit 4 GB VRAM läuft.
- Alle Gemma-Modelle in Ollama unterstützen systemseitige Prompts, JSON-Modus und Mehr-Runden-Gespräche standardmäßig.
Wenn Sie nach „Ollama Gemma 4“ suchen, suchen Sie wahrscheinlich nach den aktuellsten über Ollama verfügbaren Gemma-Modellen. Bis August 2026 gibt es von Google DeepMind keine offizielle Gemma-4-Version. Die neuesten Modelle sind die Gemma-2-Familie (mit 2 Mrd., 9 Mrd. und 27 Mrd. Parametern) sowie die ursprüngliche Gemma-Reihe (2 Mrd. und 7 Mrd. Parameter). Beide Familien laufen nativ unter Ollama mit einem einzigen Befehl.
Verfügbare Gemma-Modelle in Ollama
Ollama unterstützt sechs verschiedene Gemma-Modellvarianten aus zwei Generationen. Alle nutzen Googles Open-Weight-Lizenz und können vollständig offline ausgeführt werden, sobald sie heruntergeladen sind.
| Modellname | Parameter | Ollama-Befehl | Mindest-VRAM (Q4) | Kontextlänge |
|---|---|---|---|---|
| Gemma 2 27B | 27 Milliarden | ollama run gemma2:27b | 16 GB | 8.192 Tokens |
| Gemma 2 9B | 9 Milliarden | ollama run gemma2:9b | 6 GB | 8.192 Tokens |
| Gemma 2 2B | 2 Milliarden | ollama run gemma2:2b | 2 GB | 8.192 Tokens |
| Gemma 7B | 7 Milliarden | ollama run gemma:7b | 5 GB | 8.192 Tokens |
| Gemma 2B | 2 Milliarden | ollama run gemma:2b | 2 GB | 8.192 Tokens |
| Gemma 2B Instruct | 2 Milliarden | ollama run gemma:2b-instruct | 2 GB | 8.192 Tokens |
Die Gemma-2-Reihe bietet eine bessere Leistung pro Parameter als die ursprünglichen Gemma-Modelle. Für die meisten Nutzer stellt gemma2:9b die beste Balance aus Qualität und Hardwareanforderungen dar. Ein Vergleich dieser Modelle mit Alternativen ist im LLM-Leaderboard.
Installation und Ausführung von Gemma-Modellen
Stellen Sie zunächst sicher, dass Ollama auf Ihrem System installiert ist. Falls noch nicht geschehen, befolgen Sie die Ollama-Installationsanleitung Anleitung für Ihre Plattform. Nach der Installation genügt ein einzelner Befehl, um jedes Gemma-Modell automatisch herunterzuladen und zu starten.
macOS und Linux
Öffnen Sie das Terminal und führen Sie folgenden Befehl aus:
ollama run gemma2:9bDies lädt das 9-Mrd.-Parameter-Gemma-2-Modell (ca. 5,5 GB für die 4-Bit-quantisierte Version) herunter und startet eine interaktive Chat-Sitzung. Um eine andere Modellgröße zu verwenden:
# Für 27B (höchste Qualität, benötigt 16 GB+ VRAM)
ollama run gemma2:27b
# Für 2B (schnellstes Modell, läuft auf GPUs mit 4 GB VRAM)
ollama run gemma2:2b
# Ursprüngliches Gemma 7B
ollama run gemma:7bWindows
Öffnen Sie Eingabeaufforderung oder PowerShell und verwenden Sie dieselben Befehle:
ollama run gemma2:9bWindows-Nutzer mit NVIDIA-GPUs sollten sicherstellen, dass ihre Grafiktreiber auf dem neuesten Stand sind, um optimale Leistung zu gewährleisten. Die AMD-GPU-Unterstützung über ROCm funktioniert unter Linux, ist unter Windows jedoch bis August 2026 noch experimentell.
Ausführung als API-Server
Um Gemma als dauerhaften API-Dienst statt als interaktiven Chat auszuführen:
# Starten Sie den Ollama-Server (läuft unter macOS/Linux automatisch, manuell unter Windows)
ollama serve
# Laden Sie in einem anderen Terminal das Modell herunter, ohne den Chat zu starten
ollama pull gemma2:9b
# Senden Sie API-Anfragen
curl http://localhost:11434/api/generate -d '{
"model": "gemma2:9b",
"prompt": "Erklären Sie Quantenverschränkung in einfachen Worten.",
"stream": false
}'Dieser Ansatz funktioniert plattformübergreifend identisch und lässt sich durch Verweis auf http://localhost:11434.
Systemanforderungen und Leistung
Gemma-Modelle laufen dank der Optimierungen und Quantisierung durch Ollama effizient auf Consumer-Hardware. Die VRAM-Anforderungen variieren stark je nach Modellgröße und Quantisierungsstufe.
| Modell | Vollständige Präzision (FP16) | 4-Bit-Quantisiert (Q4) | Tokens/Sekunde (RTX 4090) |
|---|---|---|---|
| Gemma 2 27B | 54 GB | 16 GB | 22–28 t/s |
| Gemma 2 9B | 18 GB | 6 GB | 45–60 t/s |
| Gemma 2 2B | 4 GB | 2 GB | 120–150 Tokens/s |
| Gemma 7B | 14 GB | 5 GB | 40–55 Tokens/s |
Standardmäßig lädt Ollama 4-Bit-quantisierte Modelle herunter, wodurch der Speicherverbrauch um 75 % reduziert wird, ohne dass die Qualität merklich leidet. Berechnen Sie den exakten VRAM-Bedarf für Ihre Hardware mithilfe des VRAM-Rechner, der Länge des Kontextfensters und die Batch-Größe berücksichtigt. Für eine detaillierte Übersicht über den Speicherbedarf verschiedener Modelle siehe VRAM-Anforderungen nach Modell.
Empfohlene GPUs
- RTX 4060 Ti 16 GB / RTX 3090: Kann Gemma 2 27B in Q4-Quantisierung mit vollem Kontextfenster ausführen.
- RTX 4070 / RX 7800 XT: Ideal für Gemma 2 9B mit ausreichend Reserven für längere Konversationen.
- RTX 4060 / RTX 3060: Verarbeitet Gemma 2 2B und Gemma 7B problemlos.
- Integrierte GPUs (Apple Silicon, Intel Arc): Gemma 2 2B läuft gut auf M1-/M2-Macs und neueren Intel-Arc-GPUs mit 16 GB oder mehr einheitlichem Arbeitsspeicher.
Für detaillierte GPU-Empfehlungen und Leistungsbenchmarks konsultieren Sie bitte das besten GPUs für lokales LLM-Hosting Leitfaden.
Auswahl zwischen Gemma-Modellen
Das richtige Gemma-Modell hängt von Ihrem Anwendungsfall, Ihrer Hardware und Ihren Qualitätsanforderungen ab. Die Gemma-2-Modelle übertreffen ihre Vorgänger bei Aufgaben wie logischem Denken, Befolgung von Anweisungen und Programmierung durchgängig.
Gemma 2 27B konkurriert qualitativ mit deutlich größeren Modellen, erfordert jedoch erheblichen VRAM. Verwenden Sie es für komplexe Denkaufgaben, technische Texterstellung oder Codegenerierung, wenn Genauigkeit wichtiger ist als Geschwindigkeit. In vielen Benchmarks ist es vergleichbar mit 70B-Modellen anderer Modellfamilien.
Gemma 2 9B stellt den idealen Kompromiss für die meisten Entwickler dar. Es läuft auf Mid-Range-GPUs, liefert starke Leistung bei allgemeinen Aufgaben und generiert Antworten schnell genug für interaktive Anwendungen. Dies ist das Modell, mit dem Sie beginnen sollten – es sei denn, Sie haben spezifische Einschränkungen.
Gemma 2 2B überzeugt bei Hochdurchsatz-Szenarien: Batch-Verarbeitung, Edge-Bereitstellung oder gleichzeitiges Ausführen mehrerer Agenten. Obwohl es weniger leistungsfähig ist als größere Varianten, bewältigt es überraschend gut strukturierte Datenauswertung, Klassifizierung und einfache Dialoge.
Das ursprüngliche Gemma 7B und 2B sind weiterhin verfügbar, bieten aber außer einem geringfügig niedrigeren VRAM-Verbrauch bei vergleichbarer Größe keinerlei Vorteile gegenüber Gemma 2. Neue Projekte sollten standardmäßig auf Gemma 2 setzen.
Für weitere Optionen erkunden Sie die vollständige Ollama-Modellliste oder sehen Sie sich beste lokale Modelle für Ollama für Alternativen wie Llama, Mistral und Qwen an.
Modellkonfiguration und Optimierung
Ollama stellt mehrere Parameter bereit, um das Verhalten und die Leistung von Gemma anzupassen. Erstellen Sie eine Modelfile um Einstellungen individuell zu konfigurieren:
FROM gemma2:9b
# Temperatur festlegen (0,0 = deterministisch, 1,0 = kreativ)
PARAMETER temperature 0,7
# Maximale Antwortlänge begrenzen
PARAMETER num_predict 512
# System-Prompt festlegen
SYSTEM Sie sind ein Assistent für technische Dokumentation. Geben Sie präzise, knappe Antworten mit Codebeispielen.Laden Sie Ihre benutzerdefinierte Konfiguration:
ollama create my-gemma -f ./Modelfile
ollama run my-gemmaWichtige Parameter umfassen:
temperature: Steuert die Zufälligkeit (0,1–0,3 für faktenbasierte Aufgaben, 0,7–0,9 für kreative Aufgaben)top_p: Schwellenwert für Nucleus-Sampling (Standardwert: 0,9; niedrigere Werte führen zu fokussierteren Ausgaben)num_predict: Maximale Anzahl generierter Tokens (−1 für unbegrenzt, typischerweise 512–2048)num_ctx: Größe des Kontextfensters (2048–8192; höhere Werte erhöhen den VRAM-Verbrauch)
Für einen Kostenvergleich zwischen lokalem Betrieb von Gemma und der Nutzung gehosteter APIs nutzen Sie den Selbsthosting vs. API-Rechner um Ihren Break-Even-Punkt zu ermitteln.
Integration in Entwicklungstools
Gemma-Modelle unter Ollama funktionieren mit gängigen LLM-Bibliotheken, indem Sie diese auf den lokalen Ollama-Endpunkt verweisen. So integrieren Sie sie in verbreitete Frameworks:
Python (LangChain)
from langchain_community.llms import Ollama
llm = Ollama(model="gemma2:9b")
response = llm.invoke("Schreiben Sie eine Python-Funktion zur Berechnung der Fibonacci-Zahlen.")
print(response)JavaScript (LangChain.js)
import { Ollama } from "@langchain/community/llms/ollama";
const llm = new Ollama({
baseUrl: "http://localhost:11434",
model: "gemma2:9b",
});
const response = await llm.invoke("Erklären Sie async/await in JavaScript.");
console.log(response);OpenAI-kompatible Clients
Viele Bibliotheken unterstützen das OpenAI-API-Format. Konfigurieren Sie sie für die Nutzung von Ollama:
import openai
client = openai.OpenAI(
base_url="http://localhost:11434/v1",
api_key="ollama" # erforderlich, wird aber ignoriert
)
response = client.chat.completions.create(
model="gemma2:9b",
messages=[{"role": "user", "content": "Hallo!"}]
)
print(response.choices[0].message.content)Behandlung häufiger Probleme
Modell-Downloads scheitern oder time out: Gemma-Modelle reichen von 1,5 GB (2B quantisiert) bis zu 54 GB (27B in voller Präzision). Bei langsamen Internetverbindungen verwenden Sie ollama pull gemma2:9b in einem separaten Terminal, um den Downloadfortschritt zu verfolgen. Unterbrochene Downloads werden automatisch fortgesetzt.
Fehler „Out of memory“: Wenn Ollama abstürzt oder ein Modell nicht laden will, fehlt Ihrer GPU möglicherweise ausreichend VRAM. Wechseln Sie zu einem kleineren Modell (gemma2:2b anstelle von 9b) oder verringern Sie die Kontextfenstergröße mittels PARAMETER num_ctx 2048 in einer benutzerdefinierten Modelfile. Überprüfen Sie den tatsächlichen Bedarf mit dem VRAM-Rechner.
Langsame Generierung auf Apple Silicon: Stellen Sie sicher, dass die Metal-Beschleunigung aktiviert ist. Ollama verwendet auf macOS standardmäßig Metal, aber ältere Ollama-Versionen können auf die CPU zurückfallen. Aktualisieren Sie auf die neueste Version mit brew upgrade ollama oder installieren Sie Ollama erneut von der offiziellen Website.
Die API gibt leere Antworten zurück: Überprüfen Sie, ob ollama serve ausgeführt wird und unter http://localhost:11434erreichbar ist. Testen Sie dies mit curl http://localhost:11434/api/tags , um die verfügbaren Modelle aufzulisten. Falls das Modell nicht angezeigt wird, führen Sie ollama pull gemma2:9b erstens.
Windows-GPU wird nicht erkannt: Ollama erfordert NVIDIA-GPUs mit CUDA-Unterstützung oder AMD-GPUs mit ROCm (nur unter Linux). Aktualisieren Sie Ihre Grafiktreiber über den Geräte-Manager oder direkt von der Herstellerwebsite. Überprüfen Sie die Erkennung mit nvidia-smi (für NVIDIA) oder rocm-smi (AMD).
Häufig gestellte Fragen
Gibt es ein Gemma-4-Modell?
Nein. Stand August 2026 hat Google DeepMind Gemma (2 Mrd., 7 Mrd.) sowie Gemma 2 (2 Mrd., 9 Mrd., 27 Mrd.) veröffentlicht, jedoch kein Gemma 4. Die „2“ in Gemma 2 bezeichnet die zweite Generation der Modellfamilie – nicht die Anzahl der Parameter. Wenn Sie nach „Gemma 4“ suchen, meinen Sie wahrscheinlich die aktuellsten Modelle: Gemma 2 27B für höchste Qualität, Gemma 2 9B für ausgewogenes Leistungsverhältnis oder Gemma 2 2B für ressourcenbeschränkte Umgebungen.
Was unterscheidet Gemma von Gemma 2?
Gemma 2 ist eine Architektur der zweiten Generation mit deutlichen Verbesserungen bei logischem Denken, Befolgung von Anweisungen und multilingualem Verständnis. Gemma-2-Modelle erreichen vergleichbare Qualität wie größere Modelle der ersten Generation, benötigen dabei jedoch weniger Speicher und generieren schneller. So übertrifft oder erreicht beispielsweise Gemma 2 9B die ursprüngliche Gemma 7B in den meisten Benchmarks. Sofern Sie keinen spezifischen Grund für die Nutzung der ursprünglichen Gemma-Reihe haben, sollten Sie mit Gemma 2 beginnen.
Darf ich Gemma-Modelle kommerziell nutzen?
Ja. Gemma-Modelle stehen unter Googles Open-Weight-Lizenz, die kommerzielle Nutzung, Modifikation und Weiterverbreitung erlaubt. Im Gegensatz zu einigen Open-Source-Modellen mit ausschließlich forschungsbezogenen Lizenzen dürfen Sie Gemma problemlos in Produktionsanwendungen, SaaS-Produkten oder Unternehmenssystemen einsetzen – ohne zusätzliche Lizenzgebühren. Die einzige Einschränkung lautet, dass Sie den Namen „Gemma“ nicht verwenden dürfen, um eine Billigung Ihres Produkts durch Google zu suggerieren.
Wie schneidet Gemma 2 9B im Vergleich zu Llama 3 8B auf Ollama ab?
Beide Modelle laufen gut auf vergleichbarer Hardware (6–8 GB VRAM), weisen jedoch unterschiedliche Stärken auf. Gemma 2 9B überzeugt in der Regel bei Aufgaben zur Befolgung von Anweisungen und zur Generierung strukturierter Ausgaben – was es besonders für Tool-Integrationen, JSON-Generierung und Agent-Anwendungen prädestiniert. Llama 3 8B erzeugt dagegen natürlichere Konversationsantworten und bewältigt kreatives Schreiben leicht besser. Bei technischen und Programmieraufgaben halten die meisten Entwickler Gemma 2 9B für zuverlässiger. Führen Sie daher für Ihren konkreten Anwendungsfall eigene Benchmarks durch, da die wahrgenommene Qualität stark vom Einsatzszenario abhängt.
Muss ich für den Betrieb von Gemma-Modellen auf Ollama bezahlen?
Nein. Ollama ist kostenlose Open-Source-Software, und Gemma-Modelle werden mit offenen Gewichten kostenfrei bereitgestellt. Sie zahlen lediglich für die erforderliche Hardware (GPU, Arbeitsspeicher, Strom). Für einen Vergleich der Betriebskosten zeigt die API-Kostenrechner den Zeitpunkt, ab dem das lokale Hosting kostengünstiger wird als Cloud-APIs. Die meisten Entwickler, die mehr als 10.000 Abfragen pro Monat durchführen, sparen durch Self-Hosting von Gemma Geld gegenüber kommerziellen APIs.
Können Gemma-Modelle auch ohne GPU betrieben werden?
Ja, allerdings sehr langsam. Ollama wechselt automatisch in den CPU-Modus, wenn keine kompatible GPU erkannt wird. Gemma 2 2B erreicht auf modernen CPUs (Ryzen 5000+ oder Intel 12. Generation+) 3–8 Tokens pro Sekunde – ausreichend für gelegentliche Abfragen, aber frustrierend bei interaktiven Chats. Gemma 2 9B und größere Modelle liefern auf der CPU weniger als 2 Tokens pro Sekunde und sind daher praktisch unbrauchbar. Für ernsthafte lokales LLM -Anwendungszwecke lohnt sich die Investition in eine GPU – selbst eine preisgünstige RTX 3060 oder eine gebrauchte RTX 2080 verbessert die Erfahrung deutlich. Weitere Hardware-Empfehlungen finden Sie im Kompletter Ollama-Leitfaden.

