{"id":2235,"date":"2026-08-18T20:04:34","date_gmt":"2026-08-18T20:04:34","guid":{"rendered":"https:\/\/convly.ai\/?p=2235"},"modified":"2026-08-23T03:54:48","modified_gmt":"2026-08-23T03:54:48","slug":"ollama-gpt-oss-guide","status":"publish","type":"post","link":"https:\/\/convly.ai\/de\/ollama-gpt-oss-guide\/","title":{"rendered":"Ollama GPT OSS: Vollst\u00e4ndiger Leitfaden zum Ausf\u00fchren der Open-Source-Modelle von OpenAI"},"content":{"rendered":"<div class=\"convly-tldr\"><strong>Zusammenfassung<\/strong><\/p>\n<ul>\n<li><strong>gpt-oss:20b<\/strong> l\u00e4uft mit ca. 16 GB Arbeitsspeicher (passt auf die meisten Gaming-GPUs) <strong>gpt-oss:120b<\/strong> ben\u00f6tigt ca. 70 GB (eine einzelne 80-GB-GPU oder Aufteilung auf mehrere Consumer-GPUs)<\/li>\n<li>Installieren Sie mit <code>ollama pull gpt-oss:20b<\/code> oder <code>ollama pull gpt-oss:120b<\/code>, anschlie\u00dfend mit folgendem Befehl ausf\u00fchren <code>ollama run gpt-oss:20b<\/code><\/li>\n<li>Beide Varianten verwenden die MXFP4-Quantisierung mit 4,25 Bit pro Parameter und unterst\u00fctzen Kontextfenster mit bis zu 128 K Token<\/li>\n<li>Von OpenAI als Open-Weight-Modelle in Zusammenarbeit mit Ollama ver\u00f6ffentlicht; qualitativ vergleichbar mit Llama 3.1 und Qwen 2.5<\/li>\n<\/ul>\n<\/div>\n<p>OpenAI ver\u00f6ffentlichte gpt-oss im August 2025 als Open-Weight-Modelle, ausschlie\u00dflich \u00fcber Ollama verteilt. Die gpt-oss-Familie umfasst zwei Varianten: ein Modell mit 20 Milliarden Parametern, das problemlos auf Consumer-Hardware l\u00e4uft, sowie ein Modell mit 120 Milliarden Parametern, das nahezu Spitzenleistung auf einer einzigen High-End-GPU erbringt. Beide Modelle nutzen die MXFP4-Quantisierung, wodurch die Modellgewichte mit 4,25 Bit pro Parameter komprimiert werden, ohne nennenswerte Einbu\u00dfen bei der Qualit\u00e4t gegen\u00fcber vollpr\u00e4ziser Inferenz zu erleiden.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_88 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6abaab6a8db66\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Umschalten<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6abaab6a8db66\"  aria-label=\"Umschalten\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/de\/ollama-gpt-oss-guide\/#What_Are_the_GPT-OSS_Models\" >Was sind die GPT-OSS-Modelle?<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/de\/ollama-gpt-oss-guide\/#Hardware_Requirements\" >Hardware-Anforderungen<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/de\/ollama-gpt-oss-guide\/#Installation\" >Installation<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/de\/ollama-gpt-oss-guide\/#Pulling_and_Running_the_Models\" >Herunterladen und Ausf\u00fchren der Modelle<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/de\/ollama-gpt-oss-guide\/#Performance_and_Model_Comparison\" >Leistungsvergleich und Modellbewertung<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/de\/ollama-gpt-oss-guide\/#MXFP4_Quantisation\" >MXFP4-Quantisierung<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/de\/ollama-gpt-oss-guide\/#Context_Window_and_Memory_Usage\" >Kontextfenster und Speicherverbrauch<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/de\/ollama-gpt-oss-guide\/#Frequently_Asked_Questions\" >H\u00e4ufig gestellte Fragen<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"What_Are_the_GPT-OSS_Models\"><\/span>Was sind die GPT-OSS-Modelle?<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Die gpt-oss-Modelle stellen OpenAIs erste Open-Weight-Ver\u00f6ffentlichung dar \u2013 eine Reaktion auf den branchenweiten Druck nach mehr Transparenz und Reproduzierbarkeit. Im Gegensatz zu GPT-4 oder GPT-4o werden diese Modelle mit vollst\u00e4ndigen Gewichten, detaillierten Architekturangaben und einer sehr liberalen Lizenz ausgeliefert, die uneingeschr\u00e4nkte kommerzielle Nutzung erlaubt.<\/p>\n<p>Both models support a 128K token context window, handle multi-turn conversations, and perform instruction following comparable to other open models in their parameter class. The 20B variant competes directly with Llama 3.1 8B and Mistral 7B, while the 120B model sits between Llama 3.1 70B and full frontier systems like GPT-4.<\/p>\n<p>OpenAI arbeitete mit Ollama zusammen, um Verteilung und Optimierung der Inferenz zu gew\u00e4hrleisten. Das bedeutet, dass Sie gpt-oss genauso installieren und ausf\u00fchren wie jedes andere <a href=\"https:\/\/convly.ai\/de\/what-is-ollama-complete-guide-2026\/\">Ollama-Modell<\/a>, ohne zus\u00e4tzliche Konvertierungs- oder Quantisierungsschritte.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Hardware_Requirements\"><\/span>Hardware-Anforderungen<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>In der folgenden Tabelle sind die Mindest- und Empfehlungswerte f\u00fcr die Hardwareanforderungen jeder gpt-oss-Variante angegeben. Die angegebenen Speicherwerte ber\u00fccksichtigen sowohl die Modellgewichte als auch einen realistischen Overhead f\u00fcr Kontext und Inferenzpuffer.<\/p>\n<table>\n<thead>\n<tr>\n<th>Modell<\/th>\n<th>Parameter<\/th>\n<th>Festplattenspeicher<\/th>\n<th>Mindestspeicher<\/th>\n<th>Empfohlener Speicher<\/th>\n<th>Beispielhafte Hardware<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>gpt-oss:20b<\/td>\n<td>20B<\/td>\n<td>14 GB<\/td>\n<td>16 GB<\/td>\n<td>24 GB<\/td>\n<td>RTX 4090, RTX 3090, A5000<\/td>\n<\/tr>\n<tr>\n<td>gpt-oss:120b<\/td>\n<td>120B<\/td>\n<td>65 GB<\/td>\n<td>70 GB<\/td>\n<td>80 GB<\/td>\n<td>A100 80 GB, H100, 2\u00d7 RTX 4090<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Das Modell mit 20 Milliarden Parametern l\u00e4uft problemlos auf Consumer-GPUs, die seit 2020 erschienen sind. Besitzen Sie beispielsweise eine RTX 3090 oder RTX 4090 mit 24 GB VRAM, k\u00f6nnen Sie gpt-oss:20b sogar mit einem Kontextfenster von bis zu 16.000 Token betreiben. Bei 16 GB VRAM (RTX 4080, RTX 3080 Ti) ist das Modell ebenfalls lauff\u00e4hig, allerdings sollte die Kontextl\u00e4nge auf 8.000 Token begrenzt werden, um Speicher\u00fcberlauf zu vermeiden.<\/p>\n<p>Das Modell mit 120 Milliarden Parametern erfordert entweder Rechenzentrumshardware oder ein Multi-GPU-Setup mit Consumer-GPUs. Eine A100 mit 80 GB VRAM bew\u00e4ltigt es m\u00fchelos. Zwei RTX 4090 in einem Desktop-System k\u00f6nnen das Modell auf beide GPUs verteilen, wobei die Inferenzgeschwindigkeit jedoch leicht unter der eines Single-GPU-Einsatzes liegt. Nutzen Sie den <a href=\"https:\/\/convly.ai\/de\/llm-vram-calculator\/\">VRAM-Rechner<\/a> zur Absch\u00e4tzung des Speicherbedarfs bei unterschiedlichen Kontextl\u00e4ngen.<\/p>\n<h3>CPU und System-Arbeitsspeicher<\/h3>\n<p>Falls nicht gen\u00fcgend VRAM zur Verf\u00fcgung steht, entlastet Ollama automatisch einzelne Schichten in den System-Arbeitsspeicher und f\u00fchrt sie auf der CPU aus. F\u00fcr gpt-oss:20b ben\u00f6tigen Sie mindestens 32 GB System-Arbeitsspeicher, falls das gesamte Modell rein auf der CPU ausgef\u00fchrt wird. F\u00fcr gpt-oss:120b ist eine reine CPU-Inferenz praktisch nicht sinnvoll \u2013 selbst auf Systemen mit sehr hoher Kernanzahl sind mehrere Sekunden pro Token zu erwarten. Weitere Informationen finden Sie im <a href=\"https:\/\/convly.ai\/de\/best-gpus-for-local-llms-2026\/\">Leitfaden zu den besten GPUs f\u00fcr lokale LLMs<\/a> , falls Sie Hardware speziell f\u00fcr Modellinferenz neu zusammenstellen oder aufr\u00fcsten m\u00f6chten.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Installation\"><\/span>Installation<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Installieren Sie zun\u00e4chst Ollama, sofern dies noch nicht geschehen ist. Der Installationsprozess variiert je nach Betriebssystem:<\/p>\n<h3>macOS<\/h3>\n<p>Laden Sie die Ollama-macOS-App von <code>ollama.com<\/code> herunter und ziehen Sie sie in den Ordner <code>\/Applications<\/code>. Der Installer richtet die <code>Ollama<\/code> CLI automatisch ein. Alternativ k\u00f6nnen Sie Ollama \u00fcber Homebrew installieren:<\/p>\n<pre><code>installieren Sie Ollama \u00fcber Homebrew mit \u201ebrew install ollama\u201c<\/code><\/pre>\n<h3>Linux<\/h3>\n<p>F\u00fchren Sie das offizielle Installations-Skript aus, das die Bin\u00e4rdatei unter <code>\/usr\/local\/bin\/ollama<\/code> ablegt und einen systemd-Service einrichtet:<\/p>\n<pre><code>curl -fsSL https:\/\/ollama.com\/install.sh | sh<\/code><\/pre>\n<p>F\u00fcr manuelle Installation oder distributionspezifische Anleitungen siehe die <a href=\"https:\/\/convly.ai\/de\/how-to-install-ollama-2026\/\">Ollama-Installationsanleitung<\/a>.<\/p>\n<h3>Windows<\/h3>\n<p>Laden Sie den Windows-Installer von <code>ollama.com<\/code> und f\u00fchren Sie es aus. Der Installer f\u00fcgt Ollama automatisch Ihrem PATH hinzu und startet den Hintergrunddienst. Nach der Installation \u00f6ffnen Sie PowerShell oder Eingabeaufforderung, um die Installation zu \u00fcberpr\u00fcfen:<\/p>\n<pre><code>ollama --version<\/code><\/pre>\n<h2><span class=\"ez-toc-section\" id=\"Pulling_and_Running_the_Models\"><\/span>Herunterladen und Ausf\u00fchren der Modelle<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Sobald Ollama installiert ist, laden Sie das gew\u00fcnschte Modell herunter. F\u00fcr die Variante mit 20 Milliarden Parametern gilt:<\/p>\n<pre><code>ollama pull gpt-oss:20b<\/code><\/pre>\n<p>F\u00fcr die Variante mit 120 Milliarden Parametern gilt:<\/p>\n<pre><code>ollama pull gpt-oss:120b<\/code><\/pre>\n<p>Der Download der Modellgewichte erfolgt nach <code>~\/.ollama\/models<\/code> unter macOS und Linux bzw. nach <code>%USERPROFILE%.ollamamodels<\/code> unter Windows. Der Download ist fortsetzbar, sodass Unterbrechungen ohne Datenverlust m\u00f6glich sind.<\/p>\n<p>Nach dem Herunterladen starten Sie eine interaktive Sitzung mit folgendem Befehl:<\/p>\n<pre><code>ollama run gpt-oss:20b<\/code><\/pre>\n<p>Oder f\u00fcr das gr\u00f6\u00dfere Modell:<\/p>\n<pre><code>ollama run gpt-oss:120b<\/code><\/pre>\n<p>Dadurch wird eine Chat-Oberfl\u00e4che ge\u00f6ffnet. Geben Sie Ihre Eingabeaufforderung (Prompt) ein, dr\u00fccken Sie Enter, und das Modell gibt seine Antwort schrittweise aus. Geben Sie <code>\/bye<\/code> zum Beenden.<\/p>\n<h3>API-Zugriff<\/h3>\n<p>Ollama f\u00fchrt einen lokalen HTTP-Server unter <code>http:\/\/localhost:11434<\/code>aus. Sie k\u00f6nnen Anfragen \u00fcber curl, Python oder einen beliebigen HTTP-Client senden:<\/p>\n<pre><code>curl http:\/\/localhost:11434\/api\/generate -d '{\n  \"model\": \"gpt-oss:20b\",\n  \"prompt\": \"Erkl\u00e4ren Sie MXFP4-Quantisierung in einem Satz.\"\n}'<\/code><\/pre>\n<p>F\u00fcr strukturierte Anwendungen verwenden Sie das Ollama-Python- oder JavaScript-SDK. Beide sind \u00fcber g\u00e4ngige Paketmanager verf\u00fcgbar (<code>pip install ollama<\/code>, <code>npm install ollama<\/code>) und bieten typisierte Schnittstellen f\u00fcr Textgenerierung, Embeddings und Modellverwaltung.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Performance_and_Model_Comparison\"><\/span>Leistungsvergleich und Modellbewertung<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Das Modell mit 20 Milliarden Parametern generiert je nach Kontextl\u00e4nge und Prompt-Komplexit\u00e4t 15\u201330 Tokens pro Sekunde auf einer RTX 4090. Das Modell mit 120 Milliarden Parametern erzeugt 8\u201315 Tokens pro Sekunde auf einer A100 mit 80 GB VRAM. Beide Werte gelten f\u00fcr die Standardeinstellungen ohne zus\u00e4tzliche Optimierungen wie spekulative Decodierung.<\/p>\n<p>Qualitativ gesehen erreicht gpt-oss:20b auf Reasoning-Benchmarks wie MMLU und GSM8K ein \u00e4hnliches Niveau wie Llama 3.1 8B und Mistral 7B. Bei der Ausf\u00fchrung mehrstufiger Anweisungen \u00fcbertrifft es beide Modelle \u2013 vermutlich dank der Feinabstimmung mittels Reinforcement Learning from Human Feedback (RLHF) durch OpenAI. Die 120B-Variante n\u00e4hert sich der Qualit\u00e4t von GPT-3.5 Turbo an und ist damit zum August 2026 das leistungsst\u00e4rkste offene Modell mit weniger als 200 Milliarden Parametern.<\/p>\n<p>Im Vergleich zu propriet\u00e4ren, API-basierten Modellen wird der lokale Betrieb von gpt-oss ab etwa zwei Millionen Tokens pro Monat bei der 20B-Version bzw. ab 500.000 Tokens pro Monat bei der 120B-Version kosteneffizient \u2013 vorausgesetzt, Sie besitzen bereits die erforderliche Hardware. Nutzen Sie den <a href=\"https:\/\/convly.ai\/de\/self-hosting-vs-api-calculator\/\">Selbsthosting vs. API-Rechner<\/a> zur Absch\u00e4tzung Ihres Break-even-Punkts anhand des Token-Volumens und der Hardwarekosten.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"MXFP4_Quantisation\"><\/span>MXFP4-Quantisierung<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Beide gpt-oss-Modelle werden standardm\u00e4\u00dfig mit MXFP4-Quantisierung ausgeliefert. MXFP4 ist ein Mikroskalierungs-Gleitkommaformat, das Gewichte im Durchschnitt mit 4,25 Bit pro Parameter darstellt \u2013 verglichen mit 16 Bit bei herk\u00f6mmlicher Halbgenauigkeit (FP16). Im Gegensatz zu \u00e4lteren Quantisierungsschemata wie GPTQ oder AWQ bewahrt MXFP4 einen gr\u00f6\u00dferen Dynamikbereich und reduziert so den typischerweise mit starker Kompression verbundenen Genauigkeitsverlust.<\/p>\n<p>In der Praxis verhalten sich MXFP4-quantisierte Modelle bei den meisten Aufgaben nahezu identisch zu ihren vollpr\u00e4zisen Pendants. Die Quantisierung erfolgt bereits w\u00e4hrend des Trainings \u2013 nicht nachtr\u00e4glich \u2013 sodass sich das Modell an die reduzierte Pr\u00e4zision anpassen kann. Dieser Ansatz senkt den VRAM-Bedarf um rund 75 % gegen\u00fcber FP16 und macht Modelle mit 120 Milliarden Parametern auch auf einer einzelnen Consumer-GPU praktikabel.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Context_Window_and_Memory_Usage\"><\/span>Kontextfenster und Speicherverbrauch<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Beide gpt-oss-Varianten unterst\u00fctzen ein Kontextfenster von 128 K Tokens \u2013 entsprechend etwa 100.000 englischen W\u00f6rtern. F\u00fcr die tats\u00e4chliche Nutzung des vollen Kontextfensters sind jedoch erheblich mehr Speicherressourcen zus\u00e4tzlich zu den Basis-Modellgewichten erforderlich.<\/p>\n<p>Bei gpt-oss:20b erh\u00f6ht ein 128K-Kontext den Speicherverbrauch um ca. 8 GB. Mit 24 GB VRAM k\u00f6nnen Sie das volle Kontextfenster problemlos nutzen; mit 16 GB VRAM sollten Sie den Kontext auf 32K\u201348K Tokens begrenzen, um w\u00e4hrend der Generierung nicht unerwartet Speicher zu ersch\u00f6pfen.<\/p>\n<p>Bei gpt-oss:120b erh\u00f6ht ein 128K-Kontext den Speicherverbrauch um etwa 20 GB. Eine GPU mit 80 GB VRAM kann dies bew\u00e4ltigen; bei einer 70-GB-Bereitstellung (zwei Consumer-GPUs) sollte das Kontextfenster jedoch auf 64K Tokens begrenzt werden. Weitere Informationen finden Sie unter <a href=\"https:\/\/convly.ai\/de\/vram-requirements-every-major-llm-2026\/\">VRAM-Anforderungen nach Modell<\/a> f\u00fcr detaillierte Kurven zur Speicherskalierung.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_Asked_Questions\"><\/span>H\u00e4ufig gestellte Fragen<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Kann ich die gpt-oss-Modelle feinjustieren?<\/h3>\n<p>Ja. OpenAI hat gpt-oss unter einer weitgehend permissiven Lizenz ver\u00f6ffentlicht, die Fine-Tuning f\u00fcr jegliche Zwecke \u2013 auch kommerzielle Anwendungen \u2013 erlaubt. Sie k\u00f6nnen g\u00e4ngige Fine-Tuning-Frameworks wie Axolotl oder Hugging Face TRL verwenden. Die Modellgewichte sind kompatibel mit der Llama-Architektur, sodass die meisten f\u00fcr Llama optimierten Tools ohne Anpassung funktionieren.<\/p>\n<h3>Wie schneidet gpt-oss:120b im Vergleich zu Llama 3.1 70B ab?<\/h3>\n<p>gpt-oss:120b \u00fcbertrifft Llama 3.1 70B bei der Befolgung von Anweisungen und bei Dialogen mit mehreren Gespr\u00e4chsrunden \u2013 insbesondere bei Aufgaben, die eine langfristige Kontextbeibehaltung \u00fcber viele Austausche hinweg erfordern. Llama 3.1 70B liegt bei reinen Reasoning-Benchmarks wie MATH und DROP knapp vorne. Bei Programmieraufgaben liegen beide Modelle etwa gleichauf. Das 120B-Modell ben\u00f6tigt zwar mehr VRAM (70 GB gegen\u00fcber 40 GB), bietet aber bei Assistenten-\u00e4hnlichen Interaktionen eine sp\u00fcrbar h\u00f6here Qualit\u00e4t.<\/p>\n<h3>Kann ich gpt-oss:120b auf mehreren Consumer-GPUs betreiben?<\/h3>\n<p>Ja. Ollama verteilt das Modell automatisch auf alle verf\u00fcgbaren GPUs, falls eine einzelne GPU nicht gen\u00fcgend Speicher bereitstellt. Zwei RTX 4090 (insgesamt 48 GB VRAM) k\u00f6nnen gpt-oss:120b ausf\u00fchren, wobei die Inferenzgeschwindigkeit jedoch aufgrund der Kommunikationslatenz zwischen den GPUs um 20\u201330 % gegen\u00fcber einer einzelnen 80-GB-GPU sinkt. Drei oder mehr GPUs bringen nur noch geringf\u00fcgige Verbesserungen \u2013 wer hierf\u00fcr Budget aufwenden kann, erh\u00e4lt mit einer einzigen A100 oder H100 bessere Kosten-Nutzen-Verh\u00e4ltnisse.<\/p>\n<h3>Funktioniert gpt-oss offline?<\/h3>\n<p>Ja, sobald Sie das Modell mit <code>ollama pull<\/code>heruntergeladen haben. Ollama speichert die vollst\u00e4ndigen Modellgewichte lokal, und die Inferenz erfolgt ausschlie\u00dflich auf Ihrem Rechner. Netzwerkzugriff ist lediglich beim ersten Download sowie bei der \u00dcberpr\u00fcfung auf Modellaktualisierungen erforderlich. Automatische Updates k\u00f6nnen Sie deaktivieren, indem Sie die Umgebungsvariable <code>OLLAMA_SKIP_UPGRADE=1<\/code> in Ihrer Umgebung.<\/p>\n<h3>Welche Lizenz gilt f\u00fcr von gpt-oss erzeugte Ausgaben?<\/h3>\n<p>Die gpt-oss-Lizenz von OpenAI beansprucht keinerlei Eigentumsrechte an generierten Inhalten. Sie behalten das volle Eigentum an Ihren Ausgaben und d\u00fcrfen diese f\u00fcr beliebige Zwecke nutzen \u2013 auch f\u00fcr kommerzielle Produkte und Dienstleistungen. Dies unterscheidet sich von den Nutzungsbedingungen der OpenAI-API, die bestimmte Verwendungszwecke einschr\u00e4nken. Lesen Sie stets den vollst\u00e4ndigen Lizenztext, der mit dem Modell-Download bereitgestellt wird, um die aktuellsten Bestimmungen zu pr\u00fcfen.<\/p>\n<h3>Darf ich gpt-oss-Modelle kommerziell nutzen?<\/h3>\n<p>Ja. Die Lizenz gestattet uneingeschr\u00e4nkte kommerzielle Nutzung \u2013 beispielsweise die Einbettung des Modells in propriet\u00e4re Produkte, den Betrieb als Dienstleistung oder die Erstellung verkaufsf\u00e4higer Inhalte. Sie sind nicht verpflichtet, abgeleitete Werke als Open Source zu ver\u00f6ffentlichen oder offenzulegen, dass Sie gpt-oss in Ihrem Produkt eingesetzt haben \u2013 allerdings wird eine Quellenangabe empfohlen.<\/p>","protected":false},"excerpt":{"rendered":"<p>TL;DRgpt-oss:20b runs in ~16GB memory (fits most gaming GPUs), gpt-oss:120b needs ~70GB (single 80GB GPU or split across consumer cards)Install with ollama pull gpt-oss:20b or ollama pull gpt-oss:120b, then run with ollama run gpt-oss:20bBoth variants use MXFP4 quantisation at 4.25 bits per parameter and support 128K context windowsReleased by OpenAI as open-weight models in partnership with Ollama, comparable to Llama 3.1 and Qwen 2.5 in quality OpenAI released gpt-oss as open-weight models in August 2025, distributed exclusively through Ollama.<\/p>","protected":false},"author":1,"featured_media":2236,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[9],"tags":[],"class_list":["post-2235","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-tutorials"],"_links":{"self":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts\/2235","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/comments?post=2235"}],"version-history":[{"count":2,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts\/2235\/revisions"}],"predecessor-version":[{"id":2278,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts\/2235\/revisions\/2278"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/media\/2236"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/media?parent=2235"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/categories?post=2235"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/tags?post=2235"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}