Sunday, 30 August 2026 | Updating Daily AI insight, written for builders

Ollama Local AI: Vollständige Einrichtungsanleitung und Modellvoraussetzungen

Zusammenfassung

  • Ollama ermöglicht es Ihnen, KI-Sprachmodelle wie Llama, Mistral und Gemma lokal über ein einziges Kommandozeilenwerkzeug auszuführen
  • Installation in Sekunden: curl https://ollama.com/install.sh | sh (Linux/macOS) oder laden Sie den Windows-Installer herunter
  • Modelle für den Einstiegsbereich benötigen 4–8 GB VRAM; Produktionsmodelle mit 70 Milliarden Parametern benötigen bei 4-Bit-Quantisierung etwa 40 GB VRAM
  • Kostengleichgewicht im Vergleich zu Cloud-APIs: ca. 500.000 Tokens/Monat für ein 70B-Modell, weniger für kleinere Modelle

Ollama ist ein Kommandozeilenwerkzeug, das KI-Sprachmodelle in Container verpackt, die Sie auf Ihrer eigenen Hardware ausführen können. Statt Ihre Prompts an OpenAI, Anthropic oder Google zu senden und pro Token zu bezahlen, laden Sie ein Modell einmal herunter –Llama 3.3 70B, Mistral 7B, Phi-4, oder eines der Dutzende unterstützten Modelle– und führen die Inferenz vollständig auf Ihrer GPU oder CPU durch. Ihre Daten bleiben lokal, nach den anfänglichen Hardwarekosten fallen keine Kosten pro Anfrage an, und Sie behalten die volle Kontrolle über Verhalten und Verfügbarkeit des Modells.

Der Kompromiss liegt in der Hardware: Sie benötigen genügend VRAM, um das Modell zu halten. Ein 7B-Parameter-Modell mit 4-Bit-Quantisierung benötigt etwa 4–5 GB GPU-Speicher – ausreichend für eine Consumer-GPU wie die RTX 4060. Ein 70B-Modell benötigt bei 4-Bit-Quantisierung rund 40 GB VRAM und erfordert daher eine Workstation-GPU wie die RTX 6000 Ada oder einen Multi-GPU-Setup. Die VRAM-Rechner zeigt die exakten Anforderungen für jede Modellgröße und jeden Quantisierungsgrad an.

Ollama installieren

Linux

Führen Sie das offizielle Installations-Skript aus, das Ihre Distribution erkennt und den Ollama Dienst einrichtet:

curl -fsSL https://ollama.com/install.sh | sh

Dadurch wird die Binärdatei nach /usr/local/bin/ollama und registriert einen systemd-Dienst. Der Dienst startet automatisch und bleibt nach einem Neustart aktiv. Zur Überprüfung:

ollama --version

Wenn Sie sich hinter einem Unternehmensproxy befinden oder eine manuelle Installation benötigen, laden Sie die Binärdatei direkt von den GitHub-Releases herunter und platzieren Sie sie in Ihrem PATH.

macOS

Laden Sie das .dmg Installer von ollama.com/download, öffnen Sie ihn und ziehen Sie Ollama in den Ordner „Anwendungen“. Die Menüleisten-App startet den lokalen Server unter localhost:11434. Um Ollama über das Terminal zu nutzen:

ollama --version

macOS-Nutzer mit Apple Silicon (M1/M2/M3/M4) können Modelle mithilfe des einheitlichen Arbeitsspeichers statt eines dedizierten VRAM ausführen. Ein Mac Studio mit 192 GB einheitlichem Speicher kann ein Llama 4 Maverick (240 GB bei 4-Bit-Quantisierung) durch Auslagern auf die Festplatte bereitstellen – allerdings sinkt die Inferenzgeschwindigkeit deutlich, sobald der physische Arbeitsspeicher überschritten wird.

Windows

Laden Sie das OllamaSetup.exe Installer von ollama.com/download und führen Sie ihn aus. Der Installer fügt ollama.exe zu Ihrem PATH hinzu und startet den Hintergrunddienst. Öffnen Sie PowerShell oder die Eingabeaufforderung und überprüfen Sie die Installation mit:

ollama --version

Windows Subsystem for Linux (WSL2) mit GPU-Passthrough wird unterstützt: Installieren Sie Ollama innerhalb Ihrer WSL2-Distribution gemäß den Linux-Anweisungen und stellen Sie sicher, dass die NVIDIA-CUDA-Treiber auf dem Windows-Host installiert sind.

Ihr erstes Modell ausführen

Laden Sie das Modell Llama 3.1 8B herunter und führen Sie es aus – ein leistungsfähiges Modell zur Befolgung von Anweisungen, das in 5 GB VRAM Platz findet:

ollama run llama3.1:8b

Ollama lädt das Modell (ca. 4,7 GB) nach ~/.ollama/models (Linux/macOS) oder %USERPROFILE%.ollamamodels (Windows) herunter, lädt es in den Arbeitsspeicher und öffnet eine interaktive Eingabeaufforderung. Geben Sie eine Nachricht ein, drücken Sie Enter, und das Modell generiert lokal eine Antwort. Drücken Sie Strg+D oder geben Sie /bye zum Beenden.

Um ein Modell im Hintergrund auszuführen und per API darauf zuzugreifen:

ollama serve

Dies startet einen Server unter http://localhost:11434. In einem anderen Terminalfenster:

curl http://localhost:11434/api/generate -d '{
  "model": "llama3.1:8b",
  "prompt": "Erklären Sie TCP-Congestion-Control",
  "stream": false
}'

Die Antwort wird als JSON zurückgegeben, wobei die vollständige Generierung im Feld response enthalten ist.

Modellauswahl und VRAM-Anforderungen

Ollama unterstützt Open-Weight-Modelle von Meta, Mistral AI, Microsoft, Google, Alibaba und anderen. Die folgende Tabelle zeigt beliebte Modelle sowie ihren Speicherbedarf bei 4-Bit-Quantisierung, basierend auf der VRAM-Anforderungsdatenbank:

Modell Parameter Kontextlänge VRAM bei 4-Bit Einsatzgebiet
Llama 3.1 8B 8B 128 K ~5 GB Allgemeine Anweisungsbefolgung, passt auf Consumer-GPUs
Mistral 7B 7B 32K ~4,5 GB Schnelle Inferenz, gute Codegenerierung
Phi-4 14B 16K ~9 GB Schlussfolgern und Mathematik, effizient für seine Größe
Mistral NeMo 12B 12B 128 K ~7,5 GB Aufgaben mit langem Kontext, mehrsprachig
Qwen3 8B 8B 128 K ~5 GB Starke multilinguale Leistung, konkurrenzfähig mit größeren Modellen
Gemma 3 4B 4 Mrd. 128 K ca. 3 GB Kleinstes praktikables Modell, läuft auf integrierten GPUs
Llama 3.3 70B 70B 128 K ~40 GB Produktionsreife Schlussfolgerungsfähigkeit, vergleichbar mit GPT-4-Klasse
DeepSeek R1 Distill Llama 70B 70B 128 K ~40 GB Destilliertes Schlussfolgerungsmodell mit starker Leistung in MINT-Fächern

So listen Sie alle verfügbaren Modelle auf Ihrem System auf:

ollama list

So löschen Sie ein Modell und gewinnen Speicherplatz auf der Festplatte frei:

ollama rm llama3.1:8b

Modell-Tags folgen dem Format name:size oder name:version. Wird das Tag weggelassen, wird standardmäßig :latestverwendet. Den vollständigen Katalog finden Sie unter beste lokale LLMs für Ollama.

Häufig verwendete Befehle und Konfiguration

Führen Sie ein Modell mit benutzerdefinierten Parametern aus:

ollama run llama3.1:8b --temperature 0.7 --top-p 0.9

Übergeben Sie eine Eingabeaufforderung direkt, ohne den interaktiven Modus zu betreten:

ollama run llama3.1:8b "Schreiben Sie eine Python-Funktion zum Parsen von ISO-8601-Datumsangaben"

Laden Sie ein Modell in den Arbeitsspeicher, ohne eine Eingabeaufforderung anzuzeigen (nützlich zum Vorwärmen vor der Verarbeitung von Anfragen):

ollama pull llama3.1:8b

Prüfen Sie, welche Modelle aktuell im VRAM geladen sind:

ollama ps

Legen Sie die Anzahl der GPU-Schichten fest, die ausgelagert werden sollen (nützlich für teilweises GPU-Offloading bei begrenztem VRAM):

OLLAMA_NUM_GPU=35 ollama run llama3.3:70b

Standardmäßig entlädt Ollama alle Schichten auf die GPU. Durch Verringerung von OLLAMA_NUM_GPU bleiben einige Schichten auf der CPU, wodurch Geschwindigkeit zugunsten geringeren VRAM-Verbrauchs geopfert wird. Ein 70B-Modell mit 20 Schichten auf der GPU benötigt möglicherweise nur 20 GB VRAM, läuft aber 3–5× langsamer.

Um das Modellspeicherverzeichnis zu ändern, setzen Sie OLLAMA_MODELS vor dem Ausführen:

export OLLAMA_MODELS=/mnt/nvme/ollama_models
ollama pull llama3.1:8b

Ollama nutzt Memory-mapped Files, daher laden Modelle von NVMe schneller als von SATA-SSDs. Auf einem modernen System ist mit einer Ladezeit von 10–15 Sekunden für ein 8B-Modell und 60–90 Sekunden für ein 70B-Modell zu rechnen.

Hardware-Anforderungen

Der limitierende Faktor ist das VRAM, nicht die Rechenleistung. Ein 4-Bit-quantisiertes 70B-Modell benötigt 40 GB GPU-Speicher, läuft aber durchaus akzeptabel auf Architekturen der vorherigen Generation. Eine RTX 3090 (24 GB) kann zwei 8B-Modelle oder ein 30B-Modell bedienen. Eine RTX 4090 (24 GB) bewältigt dieselbe Last mit einer um 30–40 % höheren Durchsatzrate dank der verbesserten Tensor-Kernen von Ada Lovelace.

Empfohlene GPUs nach Budget:

  • Einsteiger ($300–500): RTX 4060 Ti 16 GB bewältigt 8B- und 12B-Modelle
  • Prosumer ($1000–1500): RTX 4090 oder A4000 Ada führt 30B-Modelle problemlos aus
  • Workstation ($4000–7000): RTX 6000 Ada (48 GB) oder zwei RTX 4090 für 70B-Modelle
  • Mehrfachmodell-Bereitstellung ($10.000+): A100 80 GB oder H100 80 GB für mehrere 70B-Instanzen

Weitere Details finden Sie im GPU-Kaufberater für detaillierte Vergleiche. Nutzer von Apple Silicon profitieren vom einheitlichen Arbeitsspeicher: Ein M2 Ultra mit 192 GB kann Modelle ausführen, für die sonst eine NVIDIA-Hardware im Wert von 25.000 US-Dollar erforderlich wäre – allerdings liegt die Token-Durchsatzrate um das 2–3-Fache niedriger als bei einer A100.

Kostenvergleich: Lokale Ausführung vs. API

Cloud-APIs berechnen pro Token. Claude Sonnet 5 kostet 2,00 US-Dollar pro Million Eingabetokens und 10,00 US-Dollar pro Million Ausgabetokens. Eine typische Sitzung mit einem Code-Assistenten erzeugt monatlich 500.000 Tokens (250.000 Eingabe-, 250.000 Ausgabetokens), was jährliche Kosten von 3.000 US-Dollar bedeutet.

Ein selbstgehostetes Llama-3.3-70B-Modell auf einer 6.000-US-Dollar-Workstation (RTX 6000 Ada) verursacht nach dem Hardwarekauf keine weiteren marginalen Kosten. Der Break-even-Punkt liegt bei etwa 500.000 Tokens pro Monat. Darunter sind Cloud-APIs kostengünstiger; darüber lohnt sich lokale Inferenz. Nutzen Sie den Self-Hosting-Rechner , um Ihre spezifische Arbeitslast zu modellieren.

Kleinere Modelle erreichen den Break-even schneller. Ein 8B-Modell auf einer 500-US-Dollar-RTX-4060-Ti amortisiert sich bei moderater Nutzung (100.000 Tokens/Monat) innerhalb von drei bis vier Monaten gegenüber Cloud-APIs. Der Vorteil liegt in der Privatsphäre: Ihr Code, Ihre Dokumente und Ihre internen Daten verlassen niemals Ihr Netzwerk.

Häufig gestellte Fragen

Kann Ollama Modelle ausschließlich auf der CPU ausführen?

Ja, allerdings ist die Inferenz je nach Modellgröße 10–50× langsamer. Ein 8B-Modell generiert 1–3 Tokens pro Sekunde auf einer modernen Ryzen- oder Intel-CPU, verglichen mit 40–80 Tokens/Sek. auf einer RTX 4090. Setzen Sie OLLAMA_NUM_GPU=0 , um ausschließlich CPU-basierte Inferenz zu erzwingen. Praktisch für Batch-Verarbeitung oder Anwendungen mit geringem Datenverkehr, jedoch ungeeignet für interaktive Chats.

Wie beeinflusst Quantisierung die Qualität?

4-Bit-Quantisierung reduziert die Modellgröße um 75 % bei nur geringfügigem Qualitätsverlust – Benchmarks zeigen einen Genauigkeitsrückgang von 1–3 % bei MMLU und HumanEval im Vergleich zu FP16. 3-Bit-(Q3-)Quantisierung verringert die Größe weiter, verschlechtert aber Schlussfolgerungsfähigkeit und Befolgung von Anweisungen spürbar. Ollama verwendet standardmäßig Q4_0, um Qualität und VRAM-Verbrauch auszugleichen. Sie können 8-Bit- oder FP16-Versionen durch Angabe entsprechender Tags wie llama3.1:8b-q8_0abrufen, wodurch sich der VRAM-Bedarf verdoppelt.

Kann ich Modelle mit Ollama feinjustieren?

Nein. Ollama ist eine Inferenz-Laufzeitumgebung, kein Trainingsframework. Um ein Modell anzupassen, verwenden Sie Tools wie Hugging Face Transformers, Axolotl oder LLaMA Factory, exportieren das Ergebnis im GGUF-Format und importieren es über eine Modelfile in Ollama. Der gesamte Prozess ist im GitHub-Repository von Ollama unter docs/import.md.

Was ist die Ollama-API und wie verwende ich sie?

Ollama stellt eine OpenAI-kompatible REST-API unter localhost:11434. Der /api/generate bereit, die Komplettierungen verarbeitet; der Endpunkt /api/chat unterstützt Mehr-Runden-Gespräche mit Nachrichtenverlauf. Sie können Ollama nahtlos in bestehende Codebasen integrieren, indem Sie einfach die Basis-URL austauschen: Statt https://api.openai.com/v1rufen Sie Ihren Client auf http://localhost:11434auf. Viele Frameworks wie LangChain und LlamaIndex bieten native Ollama-Unterstützung.

Wie viele Anfragen pro Sekunde kann Ollama verarbeiten?

Ein einmal geladenes Modell bearbeitet jeweils nur eine Anfrage gleichzeitig. Der Durchsatz hängt von der Modellgröße und der Hardware ab: Eine RTX 4090 erzeugt für ein 8B-Modell 60–80 Tokens/Sekunde, für ein 70B-Modell 15–25 Tokens/Sekunde. Um mehrere gleichzeitige Benutzer zu bedienen, können Sie entweder horizontal skalieren (mehrere Maschinen) oder das Application-Layer-Batching nutzen. Ollama bietet keine eingebaute Anfragewarteschlange; dafür benötigen Sie einen Reverse-Proxy wie NGINX oder einen Load-Balancer.

Kann ich mehrere Modelle gleichzeitig ausführen?

Ja, sofern ausreichend VRAM zur Verfügung steht. Laden Sie ein zweites Modell mit ollama run in einem neuen Terminal, während das erste Modell läuft. Ollama teilt die GPU zwischen den Modellen. Zwei 8B-Modelle (insgesamt ca. 10 GB) laufen problemlos auf einer 24-GB-RTX-4090. Der Wechsel zwischen Modellen erfolgt nahezu sofort, wenn beide bereits geladen sind; andernfalls sind Ladezeiten von 10–90 Sekunden je nach Modellgröße zu erwarten.

Verfasst von Mustafa Ihsan

Mustafa Ihsan ist Gründer und Chefredakteur von Convly.ai. Er entwickelte und pflegt die Live-Datenbank für KI-Modelle der Website, ihren Preis-Leistungs-Index sowie kostenlose Rechner für VRAM-Anforderungen, API-Kosten und Wirtschaftlichkeit des Self-Hostings. Er schreibt über Modellpreise, Benchmark-Ergebnisse und die Hardware, die zum lokalen Betrieb von KI-Modellen erforderlich ist, und bevorzugt stets messbare Zahlen gegenüber Herstellerangaben.

Scroll to Top
Featured on There's An AI For That