Friday, 14 August 2026 | Updating Daily AI insight, written for builders

Ollama GPT OSS: Lokales Ausführen von Open-Source-LLMs (Anleitung)

Zusammenfassung

  • OpenAI hat keine Modellfamilie namens „GPT-OSS“ veröffentlicht. Der Suchbegriff bezieht sich wahrscheinlich darauf, Open-Source-Alternativen (Llama 3, Mistral, Qwen) über Ollama lokal auszuführen.
  • Ollama führt Hunderte offener Modelle lokal aus. Beliebte Optionen: ollama pull llama3.1:8b, ollama pull mistral:7b, ollama pull qwen2.5:7b.
  • VRAM-Bedarf: Modelle mit 7 Milliarden Parametern benötigen 6–8 GB (Q4-Quantisierung), Modelle mit 13 Milliarden Parametern 10–14 GB und Modelle mit 70 Milliarden Parametern 40–48 GB. Verwenden Sie den VRAM-Rechner zur Abschätzung.
  • Quantisierte Modelle (Q4, Q5) passen auf Consumer-GPUs mit nur geringem Qualitätsverlust. FP16 bietet die beste Qualität, verdoppelt jedoch den VRAM-Bedarf.

Falls Sie nach „ollama gpt oss“ gesucht haben, möchten Sie wahrscheinlich Open-Source-Sprachmodelle mithilfe von Ollama lokal ausführen – doch OpenAI hat keine offene Modellfamilie namens „GPT-OSS“ veröffentlicht. OpenAI stellte 2019 GPT-2 als offenes Modell zur Verfügung, doch jüngste Modelle (GPT-4, GPT-4o, GPT-4.1) bleiben proprietäre, ausschließlich über APIs zugängliche Produkte. Was hingegen überlebt existiert: Hunderte offener Modelle von Meta (Llama), Mistral AI, Alibaba (Qwen) und anderen, die Sie über Ollama auf Ihrer eigenen Hardware herunterladen und ausführen können. Diese Anleitung behandelt, welche Modelle funktionieren, wie viel VRAM die jeweiligen Größen benötigen, wie sich Quantisierung auf die Qualität auswirkt und wie sie sich zueinander verhalten.

Was Ollama tatsächlich ausführt

Ollama ist eine lokale Inferenz-Engine, die offene Sprachmodelle unter macOS, Linux und Windows herunterlädt, quantisiert und ausführt. Sie hostet keine OpenAI-Modelle. Die Ollama-Modellliste umfasst Llama 3.1, Mistral 7BMistral, Qwen 2.5, Gemma 2, Phi-3 und Dutzende weitere Modelle. Jedes Modell ist in mehreren Quantisierungsstufen verfügbar (Q4_K_M, Q5_K_M, FP16), um VRAM gegen Qualität abzuwägen.

Ausführliche Installationsanleitung: So installieren Sie Ollama.

In Ollama verfügbare Open-Source-Modellfamilien

ModellfamilieEntwicklerParametergrößenLizenzBesonders hervorzuheben
Llama 3.1Meta8 Mrd., 70 Mrd., 405 Mrd.Llama 3.1 (kommerziell nutzbar)Beste allgemeine Schlussfolgerungsfähigkeit in jeder Größenklasse
MistralMistral AI7 Mrd., 22 Mrd. (Mixtral 8x7B)Apache 2.0Schnell, effizient, stark im Codieren
Qwen 2.5Alibaba0,5 Mrd., 1,5 Mrd., 3 Mrd., 7 Mrd., 14 Mrd., 32 Mrd., 72 Mrd.Apache 2.0Mehrsprachig, langer Kontext (128 k)
Gemma 2Google2 Mrd., 9 Mrd., 27 Mrd.Gemma (kommerziell nutzbar)Klein, schnell, läuft auch auf der CPU
Phi-3.5Microsoft3,8 Mrd. (Mini), 14 Mrd. (Medium)MITKompakt, starke Leistung bei Schlussfolgerungsbenchmarks

Der Datenbank für KI-Modelle listet Spezifikationen, VRAM-Anforderungen und Preise für 37 Modelle – darunter alle oben genannten – auf.

Herunterladen und Ausführen eines Modells

Sobald Ollama installiert ist, laden Sie ein Modell mit ollama pull <Modell>:<Tag>herunter. Der Tag gibt Parameteranzahl und Quantisierung an. Beispiele:

ollama pull llama3.1:8b
ollama pull mistral:7b-instruct-q4_K_M
ollama pull qwen2.5:7b
ollama pull gemma2:9b

Führen Sie das Modell aus:

ollama run llama3.1:8b

Dadurch wird eine interaktive Chat-Sitzung geöffnet. Geben Sie Ihre Eingabeaufforderung ein, drücken Sie Enter, und das Modell generiert lokal eine Antwort. Um die Sitzung zu beenden, geben Sie /bye.

ein. Um das Modell programmatisch über die API zu nutzen:

curl http://localhost:11434/api/generate -d '{
  "model": "llama3.1:8b",
  "prompt": "Erklären Sie Rekursion in einem Satz."
}'

Ollama stellt einen OpenAI-kompatiblen /v1/chat/completions Endpunkt bereit, sodass Sie bestehenden OpenAI-SDK-Code auf http://localhost:11434 ausrichten und durch ein lokales Modell ersetzen können.

Parametergrößen und VRAM-Anforderungen

Die Modellgröße (7 Mrd., 13 Mrd., 70 Mrd.) bestimmt sowohl Qualität als auch VRAM-Bedarf. Größere Modelle weisen bessere Schlussfolgerungsfähigkeiten auf, benötigen aber mehr GPU-Speicher. Die Quantisierung (Q4, Q5, FP16) komprimiert die Gewichte, um den VRAM-Bedarf bei geringem Qualitätsverlust zu reduzieren.

ParameteranzahlQuantisierungVRAM (ca.)BeispielmodelleGPU-Empfehlung
7BQ4_K_M4,5 GBLlama 3.1 8B, Mistral 7BRTX 3060 (12 GB), RTX 4060 Ti (16 GB)
7BQ5_K_M5,5 GBWie obenGleich
7BFP1614 GBWie obenRTX 4060 Ti (16 GB), RTX 4070
13BQ4_K_M8 GBQwen 2.5 14B, Phi-3.5 14BRTX 3060 (12 GB), RTX 4060 Ti (16 GB)
13BFP1626 GBGleichRTX 4090 (24 GB) oder A5000 (24 GB)
70BQ4_K_M40 GBLlama 3.1 70B, Qwen 2.5 72BA100 (40/80 GB), zwei RTX 3090 (insgesamt 48 GB)
70BFP16140 GBGleichMulti-GPU-Setup oder A100 mit 80 GB

Verwenden Sie den VRAM-Rechner um den VRAM-Bedarf für beliebige Modelle und Quantisierungsstufen abzuschätzen. Die Leitfaden zu VRAM-Anforderungen listet präzise Werte für alle gängigen Modelle auf.

Für Entscheidungshilfen beim GPU-Kauf siehe besten GPUs für lokales LLM-Hosting.

Quantisierung: Kompromiss zwischen Qualität und VRAM

Quantisierung reduziert die Genauigkeit der Modellgewichte von 16-Bit-Gleitkommazahlen (FP16) auf 4-Bit- oder 5-Bit-Ganzzahlen (Q4, Q5). Dadurch sinkt der VRAM-Bedarf um 60–75 %, bei nur geringfügigen Einbußen bei der Qualität für die meisten Aufgaben.

  • Q4_K_M: 4-Bit-Quantisierung. Geringster VRAM-Bedarf, leichter Qualitätsverlust bei komplexen Schlussfolgerungsaufgaben. Gut geeignet für Chatbots, Zusammenfassungen und Code-Vervollständigung.
  • Q5_K_M: 5-Bit-Quantisierung. Etwa 20 % mehr VRAM als Q4, Qualität nahe an FP16. Beste Balance für die meisten Nutzer.
  • Q8_0: 8-Bit-Quantisierung. Nahezu FP16-Qualität, 50 % weniger VRAM. Verwenden Sie diese Stufe, wenn ausreichend VRAM zur Verfügung steht.
  • FP16: Volle Präzision. Beste Qualität, doppelt so viel VRAM wie bei Q4. Nur für Forschungszwecke erforderlich oder falls Qualitätsrückgänge unbedingt vermieden werden müssen.

Beispiel: Llama 3.1 8B nutzt bei Q4_K_M 4,5 GB VRAM und erzielt einen MMLU-Wert von 67,2. Bei FP16 benötigt es 14 GB VRAM und erreicht 68,1 Punkte im MMLU. Für die meisten Aufgaben ist der Unterschied von 0,9 Punkten kaum wahrnehmbar.

Um eine bestimmte Quantisierung herunterzuladen:

ollama pull llama3.1:8b-instruct-q4_K_M
ollama pull llama3.1:8b-instruct-fp16

Falls Sie die Quantisierungsangabe weglassen, verwendet Ollama standardmäßig Q4_K_M.

Leistungsvergleich: Klasse mit 7 Milliarden Parametern

Die Modellgröße der Klasse 7B–8B ist für lokale Anwendungen am verbreitetsten. Sie passt auf Consumer-GPUs und liefert hervorragende Ergebnisse bei Programmieraufgaben, logischem Denken und im Chat.

ModellMMLU (ohne Beispiele)HumanEval (pass@1)KontextlängeVRAM (Q4)
Llama 3.1 8B67.262.2128k4,5 GB
Mistral 7B v0.362.540.232k4,1 GB
Qwen 2.5 7B70.361.6128k4,3 GB
Gemma 2 9B71.361.08k5,2 GB

Qwen 2.5 7B und Gemma 2 9B führen bei MMLU (Allgemeinwissen). Llama 3.1 8B führt bei HumanEval (Programmierung). Mistral 7B ist am schnellsten und verfügt über die permissivste Lizenz (Apache 2.0). Der LLM-Leaderboard bewertet sämtliche Modelle nach Intelligenz, Preis und Kontextlänge.

Welches Modell wählen?

  • Beste Gesamtqualität (7B-Klasse): ollama pull qwen2.5:7b oder ollama pull llama3.1:8b
  • Bestes Modell für Programmierung: ollama pull llama3.1:8b oder ollama pull qwen2.5-coder:7b
  • Schnellste Inferenz: ollama pull mistral:7b oder ollama pull gemma2:2b (für CPU/niedrigen VRAM)
  • Mehrsprachig: ollama pull qwen2.5:7b (unterstützt 29 Sprachen)
  • Lange Dokumente (128k+ Kontext): ollama pull llama3.1:8b oder ollama pull qwen2.5:7b
  • Stärkste Schlussfolgerungsfähigkeit (bei 40+ GB VRAM): ollama pull llama3.1:70b oder ollama pull qwen2.5:72b

Der beste lokale LLMs für Ollama -Leitfaden bewertet sämtliche Modelle und empfiehlt spezifische Tags je nach Anwendungsfall.

Wann selbst hosten statt eine API nutzen?

Der lokale Betrieb von Ollama lohnt sich, wenn:

  • Sie bereits über eine GPU mit mindestens 12 GB VRAM verfügen (z. B. RTX 3060, 4060 Ti oder besser)
  • Sie sensible Daten verarbeiten, die Ihr Netzwerk nicht verlassen dürfen
  • Sie monatlich mehr als fünf Millionen Tokens generieren (API-Kosten überschreiten dann die Gesamtbetriebskosten des Self-Hosting)
  • Sie eine garantierte Verfügbarkeit und keine Rate-Limits benötigen

Verwenden Sie stattdessen eine gehostete API (OpenAI, Anthropic, Groq), wenn:

  • Sie generieren weniger als 1 Million Tokens pro Monat (die Amortisation einer selbst gehosteten GPU dauert Jahre)
  • Sie benötigen die absolut beste Qualität (Claude 3.5 Sonnet und GPT-4o übertreffen alle Open-Source-Modelle)
  • Sie möchten keine Inferenz-Infrastruktur verwalten

Der Selbsthosting vs. API-Rechner schätzt den Break-even-Punkt basierend auf Ihrem Token-Volumen, den GPU-Kosten und Ihrem Stromtarif. Der API-Kostenrechner berechnet die monatlichen Ausgaben pro Modell.

Plattformspezifische Hinweise

macOS

Ollama nutzt Metal für GPU-Beschleunigung auf M1-/M2-/M3-Macs. Der einheitliche Speicher bedeutet, dass VRAM = Arbeitsspeicher (RAM) ist. Ein M2 Max mit 64 GB RAM kann Llama 3.1 70B in der Q4-Quantisierung (40 GB) ausführen und noch genügend Speicher für das Betriebssystem freihalten. Installation über Homebrew:

installieren Sie Ollama über Homebrew mit „brew install ollama“

Starten Sie den Dienst:

ollama serve

Linux

Ollama erfordert NVIDIA-GPUs mit CUDA 11.8+ oder AMD-GPUs mit ROCm 5.7+. Installieren Sie mit:

curl -fsSL https://ollama.com/install.sh | sh

Dadurch wird die Binärdatei nach /usr/local/bin/ollama installiert und ein systemd-Dienst erstellt. Starten Sie ihn mit:

sudo systemctl start ollama

Modelle werden nach ~/.ollama/modelsheruntergeladen. Um den Speicherort zu ändern, setzen Sie OLLAMA_MODELS=/pfad/zum/modelle in /etc/systemd/system/ollama.service.

Windows

Die Windows-Version von Ollama erfordert NVIDIA-GPUs mit CUDA 11.8+ und Treiber-Version 520+. Laden Sie den Installer von ollama.com herunter und führen Sie ihn aus. Der Dienst startet automatisch. Modelle werden nach C:\Users\\.ollama\models.

heruntergeladen. Um Ollama über PowerShell auszuführen:

ollama run llama3.1:8b

Häufig gestellte Fragen

Bietet OpenAI ein Open-Source-Modell an, das ich in Ollama ausführen kann?

Nein. OpenAI veröffentlichte 2019 GPT-2 als Open-Weight-Modell, doch alle jüngeren Modelle (GPT-3.5, GPT-4, GPT-4o, o1) sind proprietär und ausschließlich über die API nutzbar. Falls Sie eine lokal lauffähige Alternative mit OpenAI-ähnlicher Schlussfolgerungsqualität suchen, probieren Sie Llama 3.1 70B oder Qwen 2.5 72B – beide schneiden bei den meisten Benchmarks besser ab als GPT-3.5 und laufen in Ollama mit 40 GB VRAM in Q4-Quantisierung.

Kann ich Ollama auf einer CPU ohne GPU ausführen?

Ja, allerdings ist die Inferenz 10–50-mal langsamer. Kleinere Modelle (z. B. Gemma 2 2B, Qwen 2.5 0.5B, Phi-3.5 mini 3.8B) sind auf modernen CPUs mit 16 oder mehr Threads durchaus nutzbar. Größere Modelle (ab 7B Parameter) erzeugen auf der CPU nur 1–3 Tokens pro Sekunde, was für interaktive Anwendungen zu langsam ist. Falls Sie keine GPU besitzen, erwägen Sie stattdessen die Nutzung einer gehosteten API – siehe dazu die Selbsthosting vs. API-Rechner.

Wie hoch sind die Kosten für den Betrieb von Ollama im Vergleich zur OpenAI-API?

OpenAI berechnet 0,15 USD pro Million Eingabetokens und 0,60 USD pro Million Ausgabetokens für GPT-4o mini. Eine 12-GB-GPU (z. B. RTX 4060 Ti für 400 USD), auf der Llama 3.1 8B läuft, verursacht bei einem Strompreis von 0,12 USD/kWh und einem Systemverbrauch von 400 W Stromkosten von etwa 0,05 USD pro Stunde. Der Break-even liegt bei ca. 3–5 Millionen Tokens pro Monat. Der API-Kostenrechner und Self-Hosting-Rechner zeigt die genauen Gesamtbetriebskosten (TCO) für Ihre individuelle Nutzung an.

Was ist der Unterschied zwischen Q4_K_M, Q5_K_M und FP16?

Q4_K_M verwendet 4-Bit-Quantisierung (geringster VRAM-Bedarf, geringfügiger Qualitätsverlust). Q5_K_M verwendet 5-Bit-Quantisierung (ca. 20 % mehr VRAM, Qualität nahe der Vollpräzision). FP16 ist die vollständige 16-Bit-Genauigkeit (beste Qualität, doppelter VRAM-Bedarf im Vergleich zu Q4). Für die meisten Anwendungsfälle stellt Q5_K_M das beste Verhältnis aus Effizienz und Qualität dar. FP16 sollten Sie nur verwenden, wenn ausreichend VRAM verfügbar ist und Sie für Forschung oder Produktion die letzte 1–2 % an Qualität benötigen.

Kann ich Modelle in Ollama feinjustieren (fine-tunen)?

Nein. Ollama ist ein reiner Inferenz-Engine und kein Trainingsframework. Um ein Open-Source-Modell zu fine-tunen, nutzen Sie Hugging Face Transformers mit PEFT/LoRA, Axolotl oder LLaMA Factory. Exportieren Sie die fine-getunten Gewichte ins GGUF-Format und importieren Sie sie anschließend mittels ollama create. Der Kompletter Ollama-Leitfaden in Ollama – dieser Workflow wird dort ausführlich beschrieben.

Welche GPU sollte ich kaufen, um 7B-Modelle lokal auszuführen?

Für Q4-Quantisierung (4,5 GB VRAM): RTX 3060 mit 12 GB VRAM (ca. 250 USD gebraucht) oder RTX 4060 Ti mit 16 GB VRAM (ca. 450 USD neu). Für FP16 (14 GB VRAM): RTX 4060 Ti mit 16 GB VRAM oder RTX 4070 (550–600 USD). Für 70B-Modelle in Q4-Quantisierung (40 GB): zwei RTX 3090 mit je 24 GB VRAM (ca. 1800 USD gebraucht) oder A100 mit 40 GB VRAM (ab 6000 USD gebraucht). Der Beste-GPUs-Leitfaden bewertet Preis-Leistungs-Verhältnisse für jede GPU-Klasse anhand praktischer Benchmarks.

Verfasst von Mustafa Ihsan

Mustafa Ihsan ist Gründer und Chefredakteur von Convly.ai. Er entwickelte und pflegt die Live-Datenbank für KI-Modelle der Website, ihren Preis-Leistungs-Index sowie kostenlose Rechner für VRAM-Anforderungen, API-Kosten und Wirtschaftlichkeit des Self-Hostings. Er schreibt über Modellpreise, Benchmark-Ergebnisse und die Hardware, die zum lokalen Betrieb von KI-Modellen erforderlich ist, und bevorzugt stets messbare Zahlen gegenüber Herstellerangaben.

Scroll to Top
Featured on There's An AI For That