Monday, 28 September 2026 | Updating Daily AI insight, written for builders

Ollama GPT OSS: Vollständiger Leitfaden zum Ausführen der Open-Source-Modelle von OpenAI

Zusammenfassung

  • gpt-oss:20b läuft mit ca. 16 GB Arbeitsspeicher (passt auf die meisten Gaming-GPUs) gpt-oss:120b benötigt ca. 70 GB (eine einzelne 80-GB-GPU oder Aufteilung auf mehrere Consumer-GPUs)
  • Installieren Sie mit ollama pull gpt-oss:20b oder ollama pull gpt-oss:120b, anschließend mit folgendem Befehl ausführen ollama run gpt-oss:20b
  • Beide Varianten verwenden die MXFP4-Quantisierung mit 4,25 Bit pro Parameter und unterstützen Kontextfenster mit bis zu 128 K Token
  • Von OpenAI als Open-Weight-Modelle in Zusammenarbeit mit Ollama veröffentlicht; qualitativ vergleichbar mit Llama 3.1 und Qwen 2.5

OpenAI veröffentlichte gpt-oss im August 2025 als Open-Weight-Modelle, ausschließlich über Ollama verteilt. Die gpt-oss-Familie umfasst zwei Varianten: ein Modell mit 20 Milliarden Parametern, das problemlos auf Consumer-Hardware läuft, sowie ein Modell mit 120 Milliarden Parametern, das nahezu Spitzenleistung auf einer einzigen High-End-GPU erbringt. Beide Modelle nutzen die MXFP4-Quantisierung, wodurch die Modellgewichte mit 4,25 Bit pro Parameter komprimiert werden, ohne nennenswerte Einbußen bei der Qualität gegenüber vollpräziser Inferenz zu erleiden.

Was sind die GPT-OSS-Modelle?

Die gpt-oss-Modelle stellen OpenAIs erste Open-Weight-Veröffentlichung dar – eine Reaktion auf den branchenweiten Druck nach mehr Transparenz und Reproduzierbarkeit. Im Gegensatz zu GPT-4 oder GPT-4o werden diese Modelle mit vollständigen Gewichten, detaillierten Architekturangaben und einer sehr liberalen Lizenz ausgeliefert, die uneingeschränkte kommerzielle Nutzung erlaubt.

Beide Modelle unterstützen ein Kontextfenster von bis zu 128.000 Token, verarbeiten Mehrfachdialoge (multi-turn conversations) und folgen Anweisungen mit einer Qualität, die anderen Open-Source-Modellen ihrer Parameterklasse entspricht. Die 20-Milliarden-Variante konkurriert direkt mit Llama 3.1 8B und Mistral 7B, während das 120-Milliarden-Modell zwischen Llama 3.1 70B und hochmodernen Frontiersystemen wie GPT-4 einzuordnen ist.

OpenAI arbeitete mit Ollama zusammen, um Verteilung und Optimierung der Inferenz zu gewährleisten. Das bedeutet, dass Sie gpt-oss genauso installieren und ausführen wie jedes andere Ollama-Modell, ohne zusätzliche Konvertierungs- oder Quantisierungsschritte.

Hardware-Anforderungen

In der folgenden Tabelle sind die Mindest- und Empfehlungswerte für die Hardwareanforderungen jeder gpt-oss-Variante angegeben. Die angegebenen Speicherwerte berücksichtigen sowohl die Modellgewichte als auch einen realistischen Overhead für Kontext und Inferenzpuffer.

Modell Parameter Festplattenspeicher Mindestspeicher Empfohlener Speicher Beispielhafte Hardware
gpt-oss:20b 20B 14 GB 16 GB 24 GB RTX 4090, RTX 3090, A5000
gpt-oss:120b 120B 65 GB 70 GB 80 GB A100 80 GB, H100, 2× RTX 4090

Das Modell mit 20 Milliarden Parametern läuft problemlos auf Consumer-GPUs, die seit 2020 erschienen sind. Besitzen Sie beispielsweise eine RTX 3090 oder RTX 4090 mit 24 GB VRAM, können Sie gpt-oss:20b sogar mit einem Kontextfenster von bis zu 16.000 Token betreiben. Bei 16 GB VRAM (RTX 4080, RTX 3080 Ti) ist das Modell ebenfalls lauffähig, allerdings sollte die Kontextlänge auf 8.000 Token begrenzt werden, um Speicherüberlauf zu vermeiden.

Das Modell mit 120 Milliarden Parametern erfordert entweder Rechenzentrumshardware oder ein Multi-GPU-Setup mit Consumer-GPUs. Eine A100 mit 80 GB VRAM bewältigt es mühelos. Zwei RTX 4090 in einem Desktop-System können das Modell auf beide GPUs verteilen, wobei die Inferenzgeschwindigkeit jedoch leicht unter der eines Single-GPU-Einsatzes liegt. Nutzen Sie den VRAM-Rechner zur Abschätzung des Speicherbedarfs bei unterschiedlichen Kontextlängen.

CPU und System-Arbeitsspeicher

Falls nicht genügend VRAM zur Verfügung steht, entlastet Ollama automatisch einzelne Schichten in den System-Arbeitsspeicher und führt sie auf der CPU aus. Für gpt-oss:20b benötigen Sie mindestens 32 GB System-Arbeitsspeicher, falls das gesamte Modell rein auf der CPU ausgeführt wird. Für gpt-oss:120b ist eine reine CPU-Inferenz praktisch nicht sinnvoll – selbst auf Systemen mit sehr hoher Kernanzahl sind mehrere Sekunden pro Token zu erwarten. Weitere Informationen finden Sie im bestes GPUs für lokale LLMs Anleitung , falls Sie Hardware speziell für Modellinferenz neu zusammenstellen oder aufrüsten möchten.

Installation

Installieren Sie zunächst Ollama, sofern dies noch nicht geschehen ist. Der Installationsprozess variiert je nach Betriebssystem:

macOS

Laden Sie die Ollama-macOS-App von ollama.com herunter und ziehen Sie sie in den Ordner /Applications. Der Installer richtet die Ollama CLI automatisch ein. Alternativ können Sie Ollama über Homebrew installieren:

installieren Sie Ollama über Homebrew mit „brew install ollama“

Linux

Führen Sie das offizielle Installations-Skript aus, das die Binärdatei unter /usr/local/bin/ollama ablegt und einen systemd-Service einrichtet:

curl -fsSL https://ollama.com/install.sh | sh

Für manuelle Installation oder distributionspezifische Anleitungen siehe die Ollama-Installationsanleitung.

Windows

Laden Sie den Windows-Installer von ollama.com und führen Sie es aus. Der Installer fügt Ollama automatisch Ihrem PATH hinzu und startet den Hintergrunddienst. Nach der Installation öffnen Sie PowerShell oder Eingabeaufforderung, um die Installation zu überprüfen:

ollama --version

Herunterladen und Ausführen der Modelle

Sobald Ollama installiert ist, laden Sie das gewünschte Modell herunter. Für die Variante mit 20 Milliarden Parametern gilt:

ollama pull gpt-oss:20b

Für die Variante mit 120 Milliarden Parametern gilt:

ollama pull gpt-oss:120b

Der Download der Modellgewichte erfolgt nach ~/.ollama/models unter macOS und Linux bzw. nach %USERPROFILE%.ollamamodels unter Windows. Der Download ist fortsetzbar, sodass Unterbrechungen ohne Datenverlust möglich sind.

Nach dem Herunterladen starten Sie eine interaktive Sitzung mit folgendem Befehl:

ollama run gpt-oss:20b

Oder für das größere Modell:

ollama run gpt-oss:120b

Dadurch wird eine Chat-Oberfläche geöffnet. Geben Sie Ihre Eingabeaufforderung (Prompt) ein, drücken Sie Enter, und das Modell gibt seine Antwort schrittweise aus. Geben Sie /bye zum Beenden.

API-Zugriff

Ollama führt einen lokalen HTTP-Server unter http://localhost:11434aus. Sie können Anfragen über curl, Python oder einen beliebigen HTTP-Client senden:

curl http://localhost:11434/api/generate -d '{
  "model": "gpt-oss:20b",
  "prompt": "Erklären Sie MXFP4-Quantisierung in einem Satz."
}'

Für strukturierte Anwendungen verwenden Sie das Ollama-Python- oder JavaScript-SDK. Beide sind über gängige Paketmanager verfügbar (pip install ollama, npm install ollama) und bieten typisierte Schnittstellen für Textgenerierung, Embeddings und Modellverwaltung.

Leistungsvergleich und Modellbewertung

Das Modell mit 20 Milliarden Parametern generiert je nach Kontextlänge und Prompt-Komplexität 15–30 Tokens pro Sekunde auf einer RTX 4090. Das Modell mit 120 Milliarden Parametern erzeugt 8–15 Tokens pro Sekunde auf einer A100 mit 80 GB VRAM. Beide Werte gelten für die Standardeinstellungen ohne zusätzliche Optimierungen wie spekulative Decodierung.

Qualitativ gesehen erreicht gpt-oss:20b auf Reasoning-Benchmarks wie MMLU und GSM8K ein ähnliches Niveau wie Llama 3.1 8B und Mistral 7B. Bei der Ausführung mehrstufiger Anweisungen übertrifft es beide Modelle – vermutlich dank der Feinabstimmung mittels Reinforcement Learning from Human Feedback (RLHF) durch OpenAI. Die 120B-Variante nähert sich der Qualität von GPT-3.5 Turbo an und ist damit zum August 2026 das leistungsstärkste offene Modell mit weniger als 200 Milliarden Parametern.

Im Vergleich zu proprietären, API-basierten Modellen wird der lokale Betrieb von gpt-oss ab etwa zwei Millionen Tokens pro Monat bei der 20B-Version bzw. ab 500.000 Tokens pro Monat bei der 120B-Version kosteneffizient – vorausgesetzt, Sie besitzen bereits die erforderliche Hardware. Nutzen Sie den Selbsthosting vs. API-Rechner zur Abschätzung Ihres Break-even-Punkts anhand des Token-Volumens und der Hardwarekosten.

MXFP4-Quantisierung

Beide gpt-oss-Modelle werden standardmäßig mit MXFP4-Quantisierung ausgeliefert. MXFP4 ist ein Mikroskalierungs-Gleitkommaformat, das Gewichte im Durchschnitt mit 4,25 Bit pro Parameter darstellt – verglichen mit 16 Bit bei herkömmlicher Halbgenauigkeit (FP16). Im Gegensatz zu älteren Quantisierungsschemata wie GPTQ oder AWQ bewahrt MXFP4 einen größeren Dynamikbereich und reduziert so den typischerweise mit starker Kompression verbundenen Genauigkeitsverlust.

In der Praxis verhalten sich MXFP4-quantisierte Modelle bei den meisten Aufgaben nahezu identisch zu ihren vollpräzisen Pendants. Die Quantisierung erfolgt bereits während des Trainings – nicht nachträglich – sodass sich das Modell an die reduzierte Präzision anpassen kann. Dieser Ansatz senkt den VRAM-Bedarf um rund 75 % gegenüber FP16 und macht Modelle mit 120 Milliarden Parametern auch auf einer einzelnen Consumer-GPU praktikabel.

Kontextfenster und Speicherverbrauch

Beide gpt-oss-Varianten unterstützen ein Kontextfenster von 128 K Tokens – entsprechend etwa 100.000 englischen Wörtern. Für die tatsächliche Nutzung des vollen Kontextfensters sind jedoch erheblich mehr Speicherressourcen zusätzlich zu den Basis-Modellgewichten erforderlich.

Bei gpt-oss:20b erhöht ein 128K-Kontext den Speicherverbrauch um ca. 8 GB. Mit 24 GB VRAM können Sie das volle Kontextfenster problemlos nutzen; mit 16 GB VRAM sollten Sie den Kontext auf 32K–48K Tokens begrenzen, um während der Generierung nicht unerwartet Speicher zu erschöpfen.

Bei gpt-oss:120b erhöht ein 128K-Kontext den Speicherverbrauch um etwa 20 GB. Eine GPU mit 80 GB VRAM kann dies bewältigen; bei einer 70-GB-Bereitstellung (zwei Consumer-GPUs) sollte das Kontextfenster jedoch auf 64K Tokens begrenzt werden. Weitere Informationen finden Sie unter VRAM-Anforderungen nach Modell für detaillierte Kurven zur Speicherskalierung.

Häufig gestellte Fragen

Kann ich die gpt-oss-Modelle feinjustieren?

Ja. OpenAI hat gpt-oss unter einer weitgehend permissiven Lizenz veröffentlicht, die Fine-Tuning für jegliche Zwecke – auch kommerzielle Anwendungen – erlaubt. Sie können gängige Fine-Tuning-Frameworks wie Axolotl oder Hugging Face TRL verwenden. Die Modellgewichte sind kompatibel mit der Llama-Architektur, sodass die meisten für Llama optimierten Tools ohne Anpassung funktionieren.

Wie schneidet gpt-oss:120b im Vergleich zu Llama 3.1 70B ab?

gpt-oss:120b übertrifft Llama 3.1 70B bei der Befolgung von Anweisungen und bei Dialogen mit mehreren Gesprächsrunden – insbesondere bei Aufgaben, die eine langfristige Kontextbeibehaltung über viele Austausche hinweg erfordern. Llama 3.1 70B liegt bei reinen Reasoning-Benchmarks wie MATH und DROP knapp vorne. Bei Programmieraufgaben liegen beide Modelle etwa gleichauf. Das 120B-Modell benötigt zwar mehr VRAM (70 GB gegenüber 40 GB), bietet aber bei Assistenten-ähnlichen Interaktionen eine spürbar höhere Qualität.

Kann ich gpt-oss:120b auf mehreren Consumer-GPUs betreiben?

Ja. Ollama verteilt das Modell automatisch auf alle verfügbaren GPUs, falls eine einzelne GPU nicht genügend Speicher bereitstellt. Zwei RTX 4090 (insgesamt 48 GB VRAM) können gpt-oss:120b ausführen, wobei die Inferenzgeschwindigkeit jedoch aufgrund der Kommunikationslatenz zwischen den GPUs um 20–30 % gegenüber einer einzelnen 80-GB-GPU sinkt. Drei oder mehr GPUs bringen nur noch geringfügige Verbesserungen – wer hierfür Budget aufwenden kann, erhält mit einer einzigen A100 oder H100 bessere Kosten-Nutzen-Verhältnisse.

Funktioniert gpt-oss offline?

Ja, sobald Sie das Modell mit ollama pullheruntergeladen haben. Ollama speichert die vollständigen Modellgewichte lokal, und die Inferenz erfolgt ausschließlich auf Ihrem Rechner. Netzwerkzugriff ist lediglich beim ersten Download sowie bei der Überprüfung auf Modellaktualisierungen erforderlich. Automatische Updates können Sie deaktivieren, indem Sie die Umgebungsvariable OLLAMA_SKIP_UPGRADE=1 in Ihrer Umgebung.

Welche Lizenz gilt für von gpt-oss erzeugte Ausgaben?

Die gpt-oss-Lizenz von OpenAI beansprucht keinerlei Eigentumsrechte an generierten Inhalten. Sie behalten das volle Eigentum an Ihren Ausgaben und dürfen diese für beliebige Zwecke nutzen – auch für kommerzielle Produkte und Dienstleistungen. Dies unterscheidet sich von den Nutzungsbedingungen der OpenAI-API, die bestimmte Verwendungszwecke einschränken. Lesen Sie stets den vollständigen Lizenztext, der mit dem Modell-Download bereitgestellt wird, um die aktuellsten Bestimmungen zu prüfen.

Darf ich gpt-oss-Modelle kommerziell nutzen?

Ja. Die Lizenz gestattet uneingeschränkte kommerzielle Nutzung – beispielsweise die Einbettung des Modells in proprietäre Produkte, den Betrieb als Dienstleistung oder die Erstellung verkaufsfähiger Inhalte. Sie sind nicht verpflichtet, abgeleitete Werke als Open Source zu veröffentlichen oder offenzulegen, dass Sie gpt-oss in Ihrem Produkt eingesetzt haben – allerdings wird eine Quellenangabe empfohlen.

Verfasst von Mustafa Ihsan

Mustafa Ihsan ist Gründer und Chefredakteur von Convly.ai. Er entwickelte und pflegt die Live-Datenbank für KI-Modelle der Website, ihren Preis-Leistungs-Index sowie kostenlose Rechner für VRAM-Anforderungen, API-Kosten und Wirtschaftlichkeit des Self-Hostings. Er schreibt über Modellpreise, Benchmark-Ergebnisse und die Hardware, die zum lokalen Betrieb von KI-Modellen erforderlich ist, und bevorzugt stets messbare Zahlen gegenüber Herstellerangaben.

Scroll to Top