- OpenAI hat keine Modellfamilie namens „GPT-OSS“ veröffentlicht. Der Suchbegriff bezieht sich wahrscheinlich darauf, Open-Source-Alternativen (Llama 3, Mistral, Qwen) über Ollama lokal auszuführen.
- Ollama führt Hunderte offener Modelle lokal aus. Beliebte Optionen:
ollama pull llama3.1:8b,ollama pull mistral:7b,ollama pull qwen2.5:7b. - VRAM-Bedarf: Modelle mit 7 Milliarden Parametern benötigen 6–8 GB (Q4-Quantisierung), Modelle mit 13 Milliarden Parametern 10–14 GB und Modelle mit 70 Milliarden Parametern 40–48 GB. Verwenden Sie den VRAM-Rechner zur Abschätzung.
- Quantisierte Modelle (Q4, Q5) passen auf Consumer-GPUs mit nur geringem Qualitätsverlust. FP16 bietet die beste Qualität, verdoppelt jedoch den VRAM-Bedarf.
Falls Sie nach „ollama gpt oss“ gesucht haben, möchten Sie wahrscheinlich Open-Source-Sprachmodelle mithilfe von Ollama lokal ausführen – doch OpenAI hat keine offene Modellfamilie namens „GPT-OSS“ veröffentlicht. OpenAI stellte 2019 GPT-2 als offenes Modell zur Verfügung, doch jüngste Modelle (GPT-4, GPT-4o, GPT-4.1) bleiben proprietäre, ausschließlich über APIs zugängliche Produkte. Was hingegen überlebt existiert: Hunderte offener Modelle von Meta (Llama), Mistral AI, Alibaba (Qwen) und anderen, die Sie über Ollama auf Ihrer eigenen Hardware herunterladen und ausführen können. Diese Anleitung behandelt, welche Modelle funktionieren, wie viel VRAM die jeweiligen Größen benötigen, wie sich Quantisierung auf die Qualität auswirkt und wie sie sich zueinander verhalten.
- Was Ollama tatsächlich ausführt
- In Ollama verfügbare Open-Source-Modellfamilien
- Herunterladen und Ausführen eines Modells
- Parametergrößen und VRAM-Anforderungen
- Quantisierung: Kompromiss zwischen Qualität und VRAM
- Leistungsvergleich: Klasse mit 7 Milliarden Parametern
- Welches Modell wählen?
- Wann selbst hosten statt eine API nutzen?
- Plattformspezifische Hinweise
- Häufig gestellte Fragen
Was Ollama tatsächlich ausführt
Ollama ist eine lokale Inferenz-Engine, die offene Sprachmodelle unter macOS, Linux und Windows herunterlädt, quantisiert und ausführt. Sie hostet keine OpenAI-Modelle. Die Ollama-Modellliste umfasst Llama 3.1, Mistral 7BMistral, Qwen 2.5, Gemma 2, Phi-3 und Dutzende weitere Modelle. Jedes Modell ist in mehreren Quantisierungsstufen verfügbar (Q4_K_M, Q5_K_M, FP16), um VRAM gegen Qualität abzuwägen.
Ausführliche Installationsanleitung: So installieren Sie Ollama.
In Ollama verfügbare Open-Source-Modellfamilien
| Modellfamilie | Entwickler | Parametergrößen | Lizenz | Besonders hervorzuheben |
|---|---|---|---|---|
| Llama 3.1 | Meta | 8 Mrd., 70 Mrd., 405 Mrd. | Llama 3.1 (kommerziell nutzbar) | Beste allgemeine Schlussfolgerungsfähigkeit in jeder Größenklasse |
| Mistral | Mistral AI | 7 Mrd., 22 Mrd. (Mixtral 8x7B) | Apache 2.0 | Schnell, effizient, stark im Codieren |
| Qwen 2.5 | Alibaba | 0,5 Mrd., 1,5 Mrd., 3 Mrd., 7 Mrd., 14 Mrd., 32 Mrd., 72 Mrd. | Apache 2.0 | Mehrsprachig, langer Kontext (128 k) |
| Gemma 2 | 2 Mrd., 9 Mrd., 27 Mrd. | Gemma (kommerziell nutzbar) | Klein, schnell, läuft auch auf der CPU | |
| Phi-3.5 | Microsoft | 3,8 Mrd. (Mini), 14 Mrd. (Medium) | MIT | Kompakt, starke Leistung bei Schlussfolgerungsbenchmarks |
Der Datenbank für KI-Modelle listet Spezifikationen, VRAM-Anforderungen und Preise für 37 Modelle – darunter alle oben genannten – auf.
Herunterladen und Ausführen eines Modells
Sobald Ollama installiert ist, laden Sie ein Modell mit ollama pull <Modell>:<Tag>herunter. Der Tag gibt Parameteranzahl und Quantisierung an. Beispiele:
ollama pull llama3.1:8b
ollama pull mistral:7b-instruct-q4_K_M
ollama pull qwen2.5:7b
ollama pull gemma2:9bFühren Sie das Modell aus:
ollama run llama3.1:8bDadurch wird eine interaktive Chat-Sitzung geöffnet. Geben Sie Ihre Eingabeaufforderung ein, drücken Sie Enter, und das Modell generiert lokal eine Antwort. Um die Sitzung zu beenden, geben Sie /bye.
ein. Um das Modell programmatisch über die API zu nutzen:
curl http://localhost:11434/api/generate -d '{
"model": "llama3.1:8b",
"prompt": "Erklären Sie Rekursion in einem Satz."
}'Ollama stellt einen OpenAI-kompatiblen /v1/chat/completions Endpunkt bereit, sodass Sie bestehenden OpenAI-SDK-Code auf http://localhost:11434 ausrichten und durch ein lokales Modell ersetzen können.
Parametergrößen und VRAM-Anforderungen
Die Modellgröße (7 Mrd., 13 Mrd., 70 Mrd.) bestimmt sowohl Qualität als auch VRAM-Bedarf. Größere Modelle weisen bessere Schlussfolgerungsfähigkeiten auf, benötigen aber mehr GPU-Speicher. Die Quantisierung (Q4, Q5, FP16) komprimiert die Gewichte, um den VRAM-Bedarf bei geringem Qualitätsverlust zu reduzieren.
| Parameteranzahl | Quantisierung | VRAM (ca.) | Beispielmodelle | GPU-Empfehlung |
|---|---|---|---|---|
| 7B | Q4_K_M | 4,5 GB | Llama 3.1 8B, Mistral 7B | RTX 3060 (12 GB), RTX 4060 Ti (16 GB) |
| 7B | Q5_K_M | 5,5 GB | Wie oben | Gleich |
| 7B | FP16 | 14 GB | Wie oben | RTX 4060 Ti (16 GB), RTX 4070 |
| 13B | Q4_K_M | 8 GB | Qwen 2.5 14B, Phi-3.5 14B | RTX 3060 (12 GB), RTX 4060 Ti (16 GB) |
| 13B | FP16 | 26 GB | Gleich | RTX 4090 (24 GB) oder A5000 (24 GB) |
| 70B | Q4_K_M | 40 GB | Llama 3.1 70B, Qwen 2.5 72B | A100 (40/80 GB), zwei RTX 3090 (insgesamt 48 GB) |
| 70B | FP16 | 140 GB | Gleich | Multi-GPU-Setup oder A100 mit 80 GB |
Verwenden Sie den VRAM-Rechner um den VRAM-Bedarf für beliebige Modelle und Quantisierungsstufen abzuschätzen. Die Leitfaden zu VRAM-Anforderungen listet präzise Werte für alle gängigen Modelle auf.
Für Entscheidungshilfen beim GPU-Kauf siehe besten GPUs für lokales LLM-Hosting.
Quantisierung: Kompromiss zwischen Qualität und VRAM
Quantisierung reduziert die Genauigkeit der Modellgewichte von 16-Bit-Gleitkommazahlen (FP16) auf 4-Bit- oder 5-Bit-Ganzzahlen (Q4, Q5). Dadurch sinkt der VRAM-Bedarf um 60–75 %, bei nur geringfügigen Einbußen bei der Qualität für die meisten Aufgaben.
- Q4_K_M: 4-Bit-Quantisierung. Geringster VRAM-Bedarf, leichter Qualitätsverlust bei komplexen Schlussfolgerungsaufgaben. Gut geeignet für Chatbots, Zusammenfassungen und Code-Vervollständigung.
- Q5_K_M: 5-Bit-Quantisierung. Etwa 20 % mehr VRAM als Q4, Qualität nahe an FP16. Beste Balance für die meisten Nutzer.
- Q8_0: 8-Bit-Quantisierung. Nahezu FP16-Qualität, 50 % weniger VRAM. Verwenden Sie diese Stufe, wenn ausreichend VRAM zur Verfügung steht.
- FP16: Volle Präzision. Beste Qualität, doppelt so viel VRAM wie bei Q4. Nur für Forschungszwecke erforderlich oder falls Qualitätsrückgänge unbedingt vermieden werden müssen.
Beispiel: Llama 3.1 8B nutzt bei Q4_K_M 4,5 GB VRAM und erzielt einen MMLU-Wert von 67,2. Bei FP16 benötigt es 14 GB VRAM und erreicht 68,1 Punkte im MMLU. Für die meisten Aufgaben ist der Unterschied von 0,9 Punkten kaum wahrnehmbar.
Um eine bestimmte Quantisierung herunterzuladen:
ollama pull llama3.1:8b-instruct-q4_K_M
ollama pull llama3.1:8b-instruct-fp16Falls Sie die Quantisierungsangabe weglassen, verwendet Ollama standardmäßig Q4_K_M.
Leistungsvergleich: Klasse mit 7 Milliarden Parametern
Die Modellgröße der Klasse 7B–8B ist für lokale Anwendungen am verbreitetsten. Sie passt auf Consumer-GPUs und liefert hervorragende Ergebnisse bei Programmieraufgaben, logischem Denken und im Chat.
| Modell | MMLU (ohne Beispiele) | HumanEval (pass@1) | Kontextlänge | VRAM (Q4) |
|---|---|---|---|---|
| Llama 3.1 8B | 67.2 | 62.2 | 128k | 4,5 GB |
| Mistral 7B v0.3 | 62.5 | 40.2 | 32k | 4,1 GB |
| Qwen 2.5 7B | 70.3 | 61.6 | 128k | 4,3 GB |
| Gemma 2 9B | 71.3 | 61.0 | 8k | 5,2 GB |
Qwen 2.5 7B und Gemma 2 9B führen bei MMLU (Allgemeinwissen). Llama 3.1 8B führt bei HumanEval (Programmierung). Mistral 7B ist am schnellsten und verfügt über die permissivste Lizenz (Apache 2.0). Der LLM-Leaderboard bewertet sämtliche Modelle nach Intelligenz, Preis und Kontextlänge.
Welches Modell wählen?
- Beste Gesamtqualität (7B-Klasse):
ollama pull qwen2.5:7boderollama pull llama3.1:8b - Bestes Modell für Programmierung:
ollama pull llama3.1:8boderollama pull qwen2.5-coder:7b - Schnellste Inferenz:
ollama pull mistral:7boderollama pull gemma2:2b(für CPU/niedrigen VRAM) - Mehrsprachig:
ollama pull qwen2.5:7b(unterstützt 29 Sprachen) - Lange Dokumente (128k+ Kontext):
ollama pull llama3.1:8boderollama pull qwen2.5:7b - Stärkste Schlussfolgerungsfähigkeit (bei 40+ GB VRAM):
ollama pull llama3.1:70boderollama pull qwen2.5:72b
Der beste lokale LLMs für Ollama -Leitfaden bewertet sämtliche Modelle und empfiehlt spezifische Tags je nach Anwendungsfall.
Wann selbst hosten statt eine API nutzen?
Der lokale Betrieb von Ollama lohnt sich, wenn:
- Sie bereits über eine GPU mit mindestens 12 GB VRAM verfügen (z. B. RTX 3060, 4060 Ti oder besser)
- Sie sensible Daten verarbeiten, die Ihr Netzwerk nicht verlassen dürfen
- Sie monatlich mehr als fünf Millionen Tokens generieren (API-Kosten überschreiten dann die Gesamtbetriebskosten des Self-Hosting)
- Sie eine garantierte Verfügbarkeit und keine Rate-Limits benötigen
Verwenden Sie stattdessen eine gehostete API (OpenAI, Anthropic, Groq), wenn:
- Sie generieren weniger als 1 Million Tokens pro Monat (die Amortisation einer selbst gehosteten GPU dauert Jahre)
- Sie benötigen die absolut beste Qualität (Claude 3.5 Sonnet und GPT-4o übertreffen alle Open-Source-Modelle)
- Sie möchten keine Inferenz-Infrastruktur verwalten
Der Selbsthosting vs. API-Rechner schätzt den Break-even-Punkt basierend auf Ihrem Token-Volumen, den GPU-Kosten und Ihrem Stromtarif. Der API-Kostenrechner berechnet die monatlichen Ausgaben pro Modell.
Plattformspezifische Hinweise
macOS
Ollama nutzt Metal für GPU-Beschleunigung auf M1-/M2-/M3-Macs. Der einheitliche Speicher bedeutet, dass VRAM = Arbeitsspeicher (RAM) ist. Ein M2 Max mit 64 GB RAM kann Llama 3.1 70B in der Q4-Quantisierung (40 GB) ausführen und noch genügend Speicher für das Betriebssystem freihalten. Installation über Homebrew:
installieren Sie Ollama über Homebrew mit „brew install ollama“Starten Sie den Dienst:
ollama serveLinux
Ollama erfordert NVIDIA-GPUs mit CUDA 11.8+ oder AMD-GPUs mit ROCm 5.7+. Installieren Sie mit:
curl -fsSL https://ollama.com/install.sh | shDadurch wird die Binärdatei nach /usr/local/bin/ollama installiert und ein systemd-Dienst erstellt. Starten Sie ihn mit:
sudo systemctl start ollamaModelle werden nach ~/.ollama/modelsheruntergeladen. Um den Speicherort zu ändern, setzen Sie OLLAMA_MODELS=/pfad/zum/modelle in /etc/systemd/system/ollama.service.
Windows
Die Windows-Version von Ollama erfordert NVIDIA-GPUs mit CUDA 11.8+ und Treiber-Version 520+. Laden Sie den Installer von ollama.com herunter und führen Sie ihn aus. Der Dienst startet automatisch. Modelle werden nach C:\Users\\.ollama\models.
heruntergeladen. Um Ollama über PowerShell auszuführen:
ollama run llama3.1:8bHäufig gestellte Fragen
Bietet OpenAI ein Open-Source-Modell an, das ich in Ollama ausführen kann?
Nein. OpenAI veröffentlichte 2019 GPT-2 als Open-Weight-Modell, doch alle jüngeren Modelle (GPT-3.5, GPT-4, GPT-4o, o1) sind proprietär und ausschließlich über die API nutzbar. Falls Sie eine lokal lauffähige Alternative mit OpenAI-ähnlicher Schlussfolgerungsqualität suchen, probieren Sie Llama 3.1 70B oder Qwen 2.5 72B – beide schneiden bei den meisten Benchmarks besser ab als GPT-3.5 und laufen in Ollama mit 40 GB VRAM in Q4-Quantisierung.
Kann ich Ollama auf einer CPU ohne GPU ausführen?
Ja, allerdings ist die Inferenz 10–50-mal langsamer. Kleinere Modelle (z. B. Gemma 2 2B, Qwen 2.5 0.5B, Phi-3.5 mini 3.8B) sind auf modernen CPUs mit 16 oder mehr Threads durchaus nutzbar. Größere Modelle (ab 7B Parameter) erzeugen auf der CPU nur 1–3 Tokens pro Sekunde, was für interaktive Anwendungen zu langsam ist. Falls Sie keine GPU besitzen, erwägen Sie stattdessen die Nutzung einer gehosteten API – siehe dazu die Selbsthosting vs. API-Rechner.
Wie hoch sind die Kosten für den Betrieb von Ollama im Vergleich zur OpenAI-API?
OpenAI berechnet 0,15 USD pro Million Eingabetokens und 0,60 USD pro Million Ausgabetokens für GPT-4o mini. Eine 12-GB-GPU (z. B. RTX 4060 Ti für 400 USD), auf der Llama 3.1 8B läuft, verursacht bei einem Strompreis von 0,12 USD/kWh und einem Systemverbrauch von 400 W Stromkosten von etwa 0,05 USD pro Stunde. Der Break-even liegt bei ca. 3–5 Millionen Tokens pro Monat. Der API-Kostenrechner und Self-Hosting-Rechner zeigt die genauen Gesamtbetriebskosten (TCO) für Ihre individuelle Nutzung an.
Was ist der Unterschied zwischen Q4_K_M, Q5_K_M und FP16?
Q4_K_M verwendet 4-Bit-Quantisierung (geringster VRAM-Bedarf, geringfügiger Qualitätsverlust). Q5_K_M verwendet 5-Bit-Quantisierung (ca. 20 % mehr VRAM, Qualität nahe der Vollpräzision). FP16 ist die vollständige 16-Bit-Genauigkeit (beste Qualität, doppelter VRAM-Bedarf im Vergleich zu Q4). Für die meisten Anwendungsfälle stellt Q5_K_M das beste Verhältnis aus Effizienz und Qualität dar. FP16 sollten Sie nur verwenden, wenn ausreichend VRAM verfügbar ist und Sie für Forschung oder Produktion die letzte 1–2 % an Qualität benötigen.
Kann ich Modelle in Ollama feinjustieren (fine-tunen)?
Nein. Ollama ist ein reiner Inferenz-Engine und kein Trainingsframework. Um ein Open-Source-Modell zu fine-tunen, nutzen Sie Hugging Face Transformers mit PEFT/LoRA, Axolotl oder LLaMA Factory. Exportieren Sie die fine-getunten Gewichte ins GGUF-Format und importieren Sie sie anschließend mittels ollama create. Der Kompletter Ollama-Leitfaden in Ollama – dieser Workflow wird dort ausführlich beschrieben.
Welche GPU sollte ich kaufen, um 7B-Modelle lokal auszuführen?
Für Q4-Quantisierung (4,5 GB VRAM): RTX 3060 mit 12 GB VRAM (ca. 250 USD gebraucht) oder RTX 4060 Ti mit 16 GB VRAM (ca. 450 USD neu). Für FP16 (14 GB VRAM): RTX 4060 Ti mit 16 GB VRAM oder RTX 4070 (550–600 USD). Für 70B-Modelle in Q4-Quantisierung (40 GB): zwei RTX 3090 mit je 24 GB VRAM (ca. 1800 USD gebraucht) oder A100 mit 40 GB VRAM (ab 6000 USD gebraucht). Der Beste-GPUs-Leitfaden bewertet Preis-Leistungs-Verhältnisse für jede GPU-Klasse anhand praktischer Benchmarks.

