- gpt-oss:20b läuft mit ca. 16 GB Arbeitsspeicher (passt auf die meisten Gaming-GPUs) gpt-oss:120b benötigt ca. 70 GB (eine einzelne 80-GB-GPU oder Aufteilung auf mehrere Consumer-GPUs)
- Installieren Sie mit
ollama pull gpt-oss:20boderollama pull gpt-oss:120b, anschließend mit folgendem Befehl ausführenollama run gpt-oss:20b - Beide Varianten verwenden die MXFP4-Quantisierung mit 4,25 Bit pro Parameter und unterstützen Kontextfenster mit bis zu 128 K Token
- Von OpenAI als Open-Weight-Modelle in Zusammenarbeit mit Ollama veröffentlicht; qualitativ vergleichbar mit Llama 3.1 und Qwen 2.5
OpenAI veröffentlichte gpt-oss im August 2025 als Open-Weight-Modelle, ausschließlich über Ollama verteilt. Die gpt-oss-Familie umfasst zwei Varianten: ein Modell mit 20 Milliarden Parametern, das problemlos auf Consumer-Hardware läuft, sowie ein Modell mit 120 Milliarden Parametern, das nahezu Spitzenleistung auf einer einzigen High-End-GPU erbringt. Beide Modelle nutzen die MXFP4-Quantisierung, wodurch die Modellgewichte mit 4,25 Bit pro Parameter komprimiert werden, ohne nennenswerte Einbußen bei der Qualität gegenüber vollpräziser Inferenz zu erleiden.
Was sind die GPT-OSS-Modelle?
Die gpt-oss-Modelle stellen OpenAIs erste Open-Weight-Veröffentlichung dar – eine Reaktion auf den branchenweiten Druck nach mehr Transparenz und Reproduzierbarkeit. Im Gegensatz zu GPT-4 oder GPT-4o werden diese Modelle mit vollständigen Gewichten, detaillierten Architekturangaben und einer sehr liberalen Lizenz ausgeliefert, die uneingeschränkte kommerzielle Nutzung erlaubt.
Beide Modelle unterstützen ein Kontextfenster von bis zu 128.000 Token, verarbeiten Mehrfachdialoge (multi-turn conversations) und folgen Anweisungen mit einer Qualität, die anderen Open-Source-Modellen ihrer Parameterklasse entspricht. Die 20-Milliarden-Variante konkurriert direkt mit Llama 3.1 8B und Mistral 7B, während das 120-Milliarden-Modell zwischen Llama 3.1 70B und hochmodernen Frontiersystemen wie GPT-4 einzuordnen ist.
OpenAI arbeitete mit Ollama zusammen, um Verteilung und Optimierung der Inferenz zu gewährleisten. Das bedeutet, dass Sie gpt-oss genauso installieren und ausführen wie jedes andere Ollama-Modell, ohne zusätzliche Konvertierungs- oder Quantisierungsschritte.
Hardware-Anforderungen
In der folgenden Tabelle sind die Mindest- und Empfehlungswerte für die Hardwareanforderungen jeder gpt-oss-Variante angegeben. Die angegebenen Speicherwerte berücksichtigen sowohl die Modellgewichte als auch einen realistischen Overhead für Kontext und Inferenzpuffer.
| Modell | Parameter | Festplattenspeicher | Mindestspeicher | Empfohlener Speicher | Beispielhafte Hardware |
|---|---|---|---|---|---|
| gpt-oss:20b | 20B | 14 GB | 16 GB | 24 GB | RTX 4090, RTX 3090, A5000 |
| gpt-oss:120b | 120B | 65 GB | 70 GB | 80 GB | A100 80 GB, H100, 2× RTX 4090 |
Das Modell mit 20 Milliarden Parametern läuft problemlos auf Consumer-GPUs, die seit 2020 erschienen sind. Besitzen Sie beispielsweise eine RTX 3090 oder RTX 4090 mit 24 GB VRAM, können Sie gpt-oss:20b sogar mit einem Kontextfenster von bis zu 16.000 Token betreiben. Bei 16 GB VRAM (RTX 4080, RTX 3080 Ti) ist das Modell ebenfalls lauffähig, allerdings sollte die Kontextlänge auf 8.000 Token begrenzt werden, um Speicherüberlauf zu vermeiden.
Das Modell mit 120 Milliarden Parametern erfordert entweder Rechenzentrumshardware oder ein Multi-GPU-Setup mit Consumer-GPUs. Eine A100 mit 80 GB VRAM bewältigt es mühelos. Zwei RTX 4090 in einem Desktop-System können das Modell auf beide GPUs verteilen, wobei die Inferenzgeschwindigkeit jedoch leicht unter der eines Single-GPU-Einsatzes liegt. Nutzen Sie den VRAM-Rechner zur Abschätzung des Speicherbedarfs bei unterschiedlichen Kontextlängen.
CPU und System-Arbeitsspeicher
Falls nicht genügend VRAM zur Verfügung steht, entlastet Ollama automatisch einzelne Schichten in den System-Arbeitsspeicher und führt sie auf der CPU aus. Für gpt-oss:20b benötigen Sie mindestens 32 GB System-Arbeitsspeicher, falls das gesamte Modell rein auf der CPU ausgeführt wird. Für gpt-oss:120b ist eine reine CPU-Inferenz praktisch nicht sinnvoll – selbst auf Systemen mit sehr hoher Kernanzahl sind mehrere Sekunden pro Token zu erwarten. Weitere Informationen finden Sie im bestes GPUs für lokale LLMs Anleitung , falls Sie Hardware speziell für Modellinferenz neu zusammenstellen oder aufrüsten möchten.
Installation
Installieren Sie zunächst Ollama, sofern dies noch nicht geschehen ist. Der Installationsprozess variiert je nach Betriebssystem:
macOS
Laden Sie die Ollama-macOS-App von ollama.com herunter und ziehen Sie sie in den Ordner /Applications. Der Installer richtet die Ollama CLI automatisch ein. Alternativ können Sie Ollama über Homebrew installieren:
installieren Sie Ollama über Homebrew mit „brew install ollama“
Linux
Führen Sie das offizielle Installations-Skript aus, das die Binärdatei unter /usr/local/bin/ollama ablegt und einen systemd-Service einrichtet:
curl -fsSL https://ollama.com/install.sh | sh
Für manuelle Installation oder distributionspezifische Anleitungen siehe die Ollama-Installationsanleitung.
Windows
Laden Sie den Windows-Installer von ollama.com und führen Sie es aus. Der Installer fügt Ollama automatisch Ihrem PATH hinzu und startet den Hintergrunddienst. Nach der Installation öffnen Sie PowerShell oder Eingabeaufforderung, um die Installation zu überprüfen:
ollama --version
Herunterladen und Ausführen der Modelle
Sobald Ollama installiert ist, laden Sie das gewünschte Modell herunter. Für die Variante mit 20 Milliarden Parametern gilt:
ollama pull gpt-oss:20b
Für die Variante mit 120 Milliarden Parametern gilt:
ollama pull gpt-oss:120b
Der Download der Modellgewichte erfolgt nach ~/.ollama/models unter macOS und Linux bzw. nach %USERPROFILE%.ollamamodels unter Windows. Der Download ist fortsetzbar, sodass Unterbrechungen ohne Datenverlust möglich sind.
Nach dem Herunterladen starten Sie eine interaktive Sitzung mit folgendem Befehl:
ollama run gpt-oss:20b
Oder für das größere Modell:
ollama run gpt-oss:120b
Dadurch wird eine Chat-Oberfläche geöffnet. Geben Sie Ihre Eingabeaufforderung (Prompt) ein, drücken Sie Enter, und das Modell gibt seine Antwort schrittweise aus. Geben Sie /bye zum Beenden.
API-Zugriff
Ollama führt einen lokalen HTTP-Server unter http://localhost:11434aus. Sie können Anfragen über curl, Python oder einen beliebigen HTTP-Client senden:
curl http://localhost:11434/api/generate -d '{
"model": "gpt-oss:20b",
"prompt": "Erklären Sie MXFP4-Quantisierung in einem Satz."
}'
Für strukturierte Anwendungen verwenden Sie das Ollama-Python- oder JavaScript-SDK. Beide sind über gängige Paketmanager verfügbar (pip install ollama, npm install ollama) und bieten typisierte Schnittstellen für Textgenerierung, Embeddings und Modellverwaltung.
Leistungsvergleich und Modellbewertung
Das Modell mit 20 Milliarden Parametern generiert je nach Kontextlänge und Prompt-Komplexität 15–30 Tokens pro Sekunde auf einer RTX 4090. Das Modell mit 120 Milliarden Parametern erzeugt 8–15 Tokens pro Sekunde auf einer A100 mit 80 GB VRAM. Beide Werte gelten für die Standardeinstellungen ohne zusätzliche Optimierungen wie spekulative Decodierung.
Qualitativ gesehen erreicht gpt-oss:20b auf Reasoning-Benchmarks wie MMLU und GSM8K ein ähnliches Niveau wie Llama 3.1 8B und Mistral 7B. Bei der Ausführung mehrstufiger Anweisungen übertrifft es beide Modelle – vermutlich dank der Feinabstimmung mittels Reinforcement Learning from Human Feedback (RLHF) durch OpenAI. Die 120B-Variante nähert sich der Qualität von GPT-3.5 Turbo an und ist damit zum August 2026 das leistungsstärkste offene Modell mit weniger als 200 Milliarden Parametern.
Im Vergleich zu proprietären, API-basierten Modellen wird der lokale Betrieb von gpt-oss ab etwa zwei Millionen Tokens pro Monat bei der 20B-Version bzw. ab 500.000 Tokens pro Monat bei der 120B-Version kosteneffizient – vorausgesetzt, Sie besitzen bereits die erforderliche Hardware. Nutzen Sie den Selbsthosting vs. API-Rechner zur Abschätzung Ihres Break-even-Punkts anhand des Token-Volumens und der Hardwarekosten.
MXFP4-Quantisierung
Beide gpt-oss-Modelle werden standardmäßig mit MXFP4-Quantisierung ausgeliefert. MXFP4 ist ein Mikroskalierungs-Gleitkommaformat, das Gewichte im Durchschnitt mit 4,25 Bit pro Parameter darstellt – verglichen mit 16 Bit bei herkömmlicher Halbgenauigkeit (FP16). Im Gegensatz zu älteren Quantisierungsschemata wie GPTQ oder AWQ bewahrt MXFP4 einen größeren Dynamikbereich und reduziert so den typischerweise mit starker Kompression verbundenen Genauigkeitsverlust.
In der Praxis verhalten sich MXFP4-quantisierte Modelle bei den meisten Aufgaben nahezu identisch zu ihren vollpräzisen Pendants. Die Quantisierung erfolgt bereits während des Trainings – nicht nachträglich – sodass sich das Modell an die reduzierte Präzision anpassen kann. Dieser Ansatz senkt den VRAM-Bedarf um rund 75 % gegenüber FP16 und macht Modelle mit 120 Milliarden Parametern auch auf einer einzelnen Consumer-GPU praktikabel.
Kontextfenster und Speicherverbrauch
Beide gpt-oss-Varianten unterstützen ein Kontextfenster von 128 K Tokens – entsprechend etwa 100.000 englischen Wörtern. Für die tatsächliche Nutzung des vollen Kontextfensters sind jedoch erheblich mehr Speicherressourcen zusätzlich zu den Basis-Modellgewichten erforderlich.
Bei gpt-oss:20b erhöht ein 128K-Kontext den Speicherverbrauch um ca. 8 GB. Mit 24 GB VRAM können Sie das volle Kontextfenster problemlos nutzen; mit 16 GB VRAM sollten Sie den Kontext auf 32K–48K Tokens begrenzen, um während der Generierung nicht unerwartet Speicher zu erschöpfen.
Bei gpt-oss:120b erhöht ein 128K-Kontext den Speicherverbrauch um etwa 20 GB. Eine GPU mit 80 GB VRAM kann dies bewältigen; bei einer 70-GB-Bereitstellung (zwei Consumer-GPUs) sollte das Kontextfenster jedoch auf 64K Tokens begrenzt werden. Weitere Informationen finden Sie unter VRAM-Anforderungen nach Modell für detaillierte Kurven zur Speicherskalierung.
Häufig gestellte Fragen
Kann ich die gpt-oss-Modelle feinjustieren?
Ja. OpenAI hat gpt-oss unter einer weitgehend permissiven Lizenz veröffentlicht, die Fine-Tuning für jegliche Zwecke – auch kommerzielle Anwendungen – erlaubt. Sie können gängige Fine-Tuning-Frameworks wie Axolotl oder Hugging Face TRL verwenden. Die Modellgewichte sind kompatibel mit der Llama-Architektur, sodass die meisten für Llama optimierten Tools ohne Anpassung funktionieren.
Wie schneidet gpt-oss:120b im Vergleich zu Llama 3.1 70B ab?
gpt-oss:120b übertrifft Llama 3.1 70B bei der Befolgung von Anweisungen und bei Dialogen mit mehreren Gesprächsrunden – insbesondere bei Aufgaben, die eine langfristige Kontextbeibehaltung über viele Austausche hinweg erfordern. Llama 3.1 70B liegt bei reinen Reasoning-Benchmarks wie MATH und DROP knapp vorne. Bei Programmieraufgaben liegen beide Modelle etwa gleichauf. Das 120B-Modell benötigt zwar mehr VRAM (70 GB gegenüber 40 GB), bietet aber bei Assistenten-ähnlichen Interaktionen eine spürbar höhere Qualität.
Kann ich gpt-oss:120b auf mehreren Consumer-GPUs betreiben?
Ja. Ollama verteilt das Modell automatisch auf alle verfügbaren GPUs, falls eine einzelne GPU nicht genügend Speicher bereitstellt. Zwei RTX 4090 (insgesamt 48 GB VRAM) können gpt-oss:120b ausführen, wobei die Inferenzgeschwindigkeit jedoch aufgrund der Kommunikationslatenz zwischen den GPUs um 20–30 % gegenüber einer einzelnen 80-GB-GPU sinkt. Drei oder mehr GPUs bringen nur noch geringfügige Verbesserungen – wer hierfür Budget aufwenden kann, erhält mit einer einzigen A100 oder H100 bessere Kosten-Nutzen-Verhältnisse.
Funktioniert gpt-oss offline?
Ja, sobald Sie das Modell mit ollama pullheruntergeladen haben. Ollama speichert die vollständigen Modellgewichte lokal, und die Inferenz erfolgt ausschließlich auf Ihrem Rechner. Netzwerkzugriff ist lediglich beim ersten Download sowie bei der Überprüfung auf Modellaktualisierungen erforderlich. Automatische Updates können Sie deaktivieren, indem Sie die Umgebungsvariable OLLAMA_SKIP_UPGRADE=1 in Ihrer Umgebung.
Welche Lizenz gilt für von gpt-oss erzeugte Ausgaben?
Die gpt-oss-Lizenz von OpenAI beansprucht keinerlei Eigentumsrechte an generierten Inhalten. Sie behalten das volle Eigentum an Ihren Ausgaben und dürfen diese für beliebige Zwecke nutzen – auch für kommerzielle Produkte und Dienstleistungen. Dies unterscheidet sich von den Nutzungsbedingungen der OpenAI-API, die bestimmte Verwendungszwecke einschränken. Lesen Sie stets den vollständigen Lizenztext, der mit dem Modell-Download bereitgestellt wird, um die aktuellsten Bestimmungen zu prüfen.
Darf ich gpt-oss-Modelle kommerziell nutzen?
Ja. Die Lizenz gestattet uneingeschränkte kommerzielle Nutzung – beispielsweise die Einbettung des Modells in proprietäre Produkte, den Betrieb als Dienstleistung oder die Erstellung verkaufsfähiger Inhalte. Sie sind nicht verpflichtet, abgeleitete Werke als Open Source zu veröffentlichen oder offenzulegen, dass Sie gpt-oss in Ihrem Produkt eingesetzt haben – allerdings wird eine Quellenangabe empfohlen.
