Tuesday, 1 September 2026 | Updating Daily AI insight, written for builders

Ollama für Windows: Installationsanleitung und Einrichtungsanweisungen

Zusammenfassung:

  • Laden Sie den offiziellen Installer von ollama.com/downloadherunter, führen Sie ihn aus, und Ollama wird als Hintergrunddienst installiert
  • Erfordert Windows 10 oder neuer sowie mindestens 8 GB Arbeitsspeicher; NVIDIA- bzw. AMD-GPUs werden automatisch zur Beschleunigung erkannt
  • Führen Sie Modelle mit ollama run <modell> über Eingabeaufforderung oder PowerShell aus – keine zusätzliche Konfiguration erforderlich
  • Modelle werden standardmäßig in %USERPROFILE%.ollamamodels installiert; Pfadänderung über die Umgebungsvariable OLLAMA_MODELS möglich

Ollama für Windows ist eine native Anwendung, die große Sprachmodelle lokal ohne Docker oder WSL2 ausführt. Der Windows-Installer richtet Ollama als Systemdienst ein, der automatisch gestartet wird und GPU-Beschleunigung über DirectML und CUDA bereitstellt. Die Installation dauert weniger als zwei Minuten, und Sie können Modelle wie Llama 3.3 70B oder Mistral 7B sofort über die Befehlszeile ausführen.

Systemvoraussetzungen für Ollama unter Windows

Ollama erfordert Windows 10 (Build 1903 oder neuer) oder Windows 11. Die Mindest-Hardwareanforderungen lauten:

Komponente Mindestanforderung Empfohlen
Betriebssystem Windows 10 (1903+) Windows 11
Arbeitsspeicher (RAM) 8 GB 16 GB oder mehr
Festplattenspeicher 10 GB freier Speicherplatz 50+ GB für mehrere Modelle
GPU (optional) NVIDIA GTX 1050 oder AMD-Äquivalent NVIDIA RTX 3060 mit 12 GB VRAM oder besser

Die GPU-Beschleunigung funktioniert mit NVIDIA-GPUs (CUDA 11.8 oder neuer) und neueren AMD-GPUs (über ROCm unter Windows). Der Installer enthält alle erforderlichen GPU-Bibliotheken; eine separate CUDA-Installation ist daher nicht notwendig. Ohne GPU wechselt Ollama automatisch zur CPU-Inferenz, die zwar 5- bis 10-mal langsamer ist, aber für kleinere Modelle durchaus funktionsfähig bleibt.

Die tatsächlichen RAM- oder VRAM-Anforderungen hängen von der Modellgröße ab. Beispielsweise benötigt Mistral 7B bei 4-Bit-Quantisierung etwa 4,5 GB VRAM, während Llama 3.3 70B rund 40 GB erfordert. Prüfen Sie die VRAM-Rechner , um die Anforderungen eines beliebigen Modells vor dem Download abzuschätzen.

Installation von Ollama unter Windows

Der offizielle Windows-Installer ist eine einzelne ausführbare Datei, die sämtliche Abhängigkeiten enthält:

  1. Herunterladen OllamaSetup.exe von ollama.com/download
  2. Führen Sie den Installer aus – Administratorrechte sind erforderlich
  3. Akzeptieren Sie die Lizenzvereinbarung und klicken Sie auf „Installieren“ (Standardzielort ist C:\Program Files\Ollama)
  4. Der Installer benötigt 30–60 Sekunden und startet den Ollama-Dienst automatisch

Öffnen Sie nach der Installation die Eingabeaufforderung oder PowerShell und überprüfen Sie die Installation mit:

ollama --version

Sie sollten eine Ausgabe wie ollama version 0.x.xsehen. Der Ollama-Dienst läuft im Hintergrund – sobald er aktiv ist, erscheint ein Ollama-Symbol in der Taskleiste.

GPU-Unterstützung und -Erkennung

Ollama erkennt und nutzt unter Windows automatisch verfügbare GPUs. Um zu prüfen, ob die GPU-Beschleunigung funktioniert, geben Sie ein:

ollama run llama3.3:70b "test"

Während das Modell geladen wird, beobachten Sie den Task-Manager (Registerkarte „Leistung“). Wenn eine GPU-Auslastung unter „GPU 0“ oder „GPU 1“ angezeigt wird, ist die Beschleunigung aktiv. Beim ersten Aufruf wird das Modell (5–40 GB je nach Größe) nach %USERPROFILE%.ollamamodelsheruntergeladen – bei langsamen Internetverbindungen kann dies mehrere Minuten dauern.

NVIDIA-Nutzer mit RTX-3060- oder neueren GPUs erzielen die beste Leistung dank 12+ GB VRAM und Optimierungen für die Ampere-/Ada-Architektur. Die AMD-GPU-Unterstützung unter Windows verbessert sich stetig, liegt aber nach wie vor hinter NVIDIA zurück – erwarten Sie auf vergleichbarer AMD-Hardware eine um 20–30 % langsamere Inferenz. Intel Arc-GPUs werden zum Stand September 2026 offiziell nicht unterstützt.

Falls Ollama Ihre GPU nicht erkennt, stellen Sie sicher, dass Ihre Grafiktreiber aktuell sind (NVIDIA: 537.13 oder neuer, AMD: Adrenalin 23.11 oder neuer). Ollamas Fehlermeldungen geben in der Regel an, ob die GPU aufgrund unzureichender VRAM oder fehlender Treiber übersprungen wurde.

Ihr erstes Modell ausführen

Der ollama run Der Befehl lädt, lädt in den Speicher und startet eine interaktive Sitzung mit einem Modell:

ollama run phi4

Dies lädt Microsofts Phi-4 (ca. 9 GB VRAM bei 4-Bit-Quantisierung) und öffnet eine Chat-Eingabeaufforderung. Geben Sie Ihre Frage ein, drücken Sie Enter, und das Modell antwortet lokal. Beenden Sie die Sitzung mit /bye oder Strg+C.

Gängige Modelle für Windows-Hardware zum Ausprobieren:

Modell VRAM (4-Bit) Am besten geeignet für
Mistral 7B ~4,5 GB Allgemeine Aufgaben, schnelle Antworten
Llama 3.1 8B ~5 GB Ausgewogene Qualität und Geschwindigkeit
Phi-4 ~9 GB Schlussfolgerungsfähigkeit, kompakte Größe
Llama 3.3 70B ~40 GB High-End-GPUs, beste Qualität

Durchsuchen Sie die verfügbaren Modelle unter Ollama-Modellliste oder durchsuchen Sie die Bibliothek mit ollama list nach dem Herunterladen mindestens eines Modells.

Konfiguration und Umgebungsvariablen

Ollama liest die Konfiguration aus Windows-Umgebungsvariablen ein. Legen Sie diese in den Systemeigenschaften → Umgebungsvariablen oder in PowerShell mit $env:VARIABLE_NAME.

Wichtige Variablen:

  • OLLAMA_MODELS: Verzeichnis für die Modell-Speicherung (Standard: %USERPROFILE%.ollamamodels). Ändern Sie diesen Wert, falls Ihr Laufwerk C: nur begrenzt Speicherplatz bietet.
  • OLLAMA_HOST: Serveradresse (Standard: 127.0.0.1:11434). Legen Sie diesen Wert auf 0.0.0.0:11434 fest, um Netzwerkverbindungen zu akzeptieren.
  • OLLAMA_NUM_PARALLEL: Anzahl gleichzeitiger Anfragen (Standard: 1). Erhöhen Sie diesen Wert bei der Bedienung mehrerer Clients.
  • OLLAMA_MAX_LOADED_MODELS: Anzahl der Modelle, die im VRAM gehalten werden (Standard: 1). Legen Sie diesen Wert auf 2 oder höher fest, wenn Sie über 24+ GB VRAM verfügen und sofort zwischen Modellen wechseln möchten.

Nach Änderung der Umgebungsvariablen starten Sie den Ollama-Dienst über die Dienste (Win+R, eingeben von services.msc, Ollama finden und mit der rechten Maustaste „Neu starten“ wählen) neu oder führen Sie einen Neustart durch.

Um Modelle auf ein anderes Laufwerk zu verschieben, legen Sie OLLAMA_MODELS fest und starten Sie den Dienst anschließend neu. Vorhandene Modelle müssen erneut heruntergeladen werden – Ollama migriert sie nicht automatisch.

Leistungsoptimierung

Die Inferenzgeschwindigkeit hängt von der VRAM-Kapazität, der Modellgröße und dem Quantisierungsgrad ab. Ein Modell mit 7 Milliarden Parametern bei 4-Bit-Quantisierung generiert etwa 30–60 Token pro Sekunde auf einer RTX 3060, während 70-Milliarden-Parameter-Modelle auf nur 3–8 Token pro Sekunde fallen, es sei denn, Sie verfügen über 48+ GB VRAM verteilt auf mehrere GPUs.

Multi-GPU-Konfigurationen funktionieren automatisch – Ollama verteilt die Modellschichten auf alle erkannten GPUs. Beispielsweise können zwei RTX 3090 (jeweils 24 GB) das Llama-3.3-70B-Modell mit akzeptabler Geschwindigkeit ausführen, während eine einzelne RTX 3090 Teile der Schichten in den Systemspeicher auslagern müsste und dadurch stark verlangsamt würde.

Falls die Leistung langsamer als erwartet ist:

  • Überprüfen Sie den Task-Manager während der Inferenz – eine CPU-Auslastung über 30 % deutet darauf hin, dass das Modell teilweise im Systemspeicher läuft, weil nicht genügend VRAM zur Verfügung steht
  • Versuchen Sie eine geringere Quantisierung (z. B. ollama pull mistral:7b-instruct-q4_K_M anstelle der Standard-Q8-Quantisierung)
  • Schließen Sie andere GPU-intensiv nutzende Anwendungen (Browser mit Hardwarebeschleunigung, Spiele, Videobearbeitungsprogramme)
  • Aktualisieren Sie Ihre GPU-Treiber – neuere NVIDIA-Treiber verbessern die Inferenzgeschwindigkeit um 5–10 % gegenüber Treibern, die sechs Monate alt sind

Für Hardware-Upgrades konsultieren Sie den beste GPUs für lokale LLMs Leitfaden zum Vergleich von Preis-Leistungs-Verhältnissen zwischen NVIDIA- und AMD-Optionen.

Integration in Anwendungen

Ollama stellt eine REST-API unter localhost:11434 zur Verfügung, die mit der OpenAI-API-Struktur kompatibel ist. Anwendungen, die OpenAI-kompatible Endpunkte unterstützen, können problemlos auf Ollama umgestellt werden – dafür sind nur minimale Änderungen erforderlich.

Beispielhafter curl-Befehl zur Textgenerierung:

curl http://localhost:11434/api/generate -d '{
  "model": "mistral",
  "prompt": "Erklären Sie Docker in einem Satz"
}'

Beliebte Integrationen umfassen Open WebUI (Web-Oberfläche), Continue.dev (VS Code-Erweiterung) und LangChain (Python). Der Ollama-Dienst muss für API-Aufrufe ausgeführt werden – standardmäßig startet er beim Systemstart automatisch.

Häufig gestellte Fragen

Benötigt Ollama unter Windows WSL2 oder Docker?

Nein. Der Windows-Installer ist eine native Anwendung, die Ollama als Windows-Dienst ohne Virtualisierung oder Container ausführt. Frühere Versionen erforderten Docker, doch mit der nativen Windows-Version, die Ende 2024 veröffentlicht wurde, entfiel diese Abhängigkeit. Falls Sie Ollama vor November 2024 installiert haben, deinstallieren Sie bitte die Docker-Version und laden Sie den aktuellen nativen Installer herunter.

Kann ich Ollama offline nutzen, nachdem ich Modelle heruntergeladen habe?

Ja. Sobald ein Modell mit ollama pull <Modell>heruntergeladen wurde, wird es lokal gespeichert und läuft ohne Internetzugang. Die einzige Netzwerkverbindung ist für den ersten Download erforderlich – Modelle umfassen dabei 2 GB (kleine 7B-Modelle) bis über 80 GB (große 70B+-Modelle). Nach dem Download können Sie die Netzwerkverbindung trennen; Ollama funktioniert dann weiterhin normal.

Wie hoch sind die Kosten für den Betrieb von Ollama-Modellen im Vergleich zu APIs?

Ollama ist kostenlos – Sie zahlen lediglich für Hardware und Strom. Vergleichen Sie dies mit den Kosten für Cloud-APIs: Claude Sonnet 5 berechnet 2,00 USD pro Million Eingabetoken, sodass 10 Millionen Token (ca. 7,5 Millionen Wörter) 20 USD kosten. Eine selbstgehostete Lösung amortisiert sich rasch, sobald größere Datenmengen verarbeitet werden. Nutzen Sie den Selbsthosting vs. API-Rechner Kostenrechner, um Ihren Break-even-Punkt basierend auf Ihrem erwarteten Nutzungsvolumen abzuschätzen.

Welche Modelle laufen am besten auf Consumer-GPUs?

Für GPUs mit 8–12 GB VRAM (RTX 3060, 4060 Ti) bieten Mistral 7B (~4,5 GB bei 4-Bit), Llama 3.1 8B (~5 GB) und Phi-4 (~9 GB) ein starkes Verhältnis von Qualität zu Leistung. Bei 16–24 GB VRAM (RTX 3090, 4090) werden auch Mistral NeMo 12B (~7,5 GB) und sogar Llama 3.3 70B (~40 GB bei aggressiver Quantisierung oder Offloading) praktikabel. Eine vollständige Liste finden Sie unter VRAM-Anforderungen nach Modell .

Kann Ollama sowohl NVIDIA- als auch AMD-GPUs gleichzeitig nutzen?

Nein. Ollama verwendet entweder CUDA (NVIDIA) oder ROCm (AMD), je nachdem, welche Technologie zuerst erkannt wird; es ist jedoch nicht möglich, verschiedene GPU-Backends innerhalb einer Sitzung zu mischen. Falls Sie sowohl NVIDIA- als auch AMD-GPUs besitzen, priorisiert Ollama NVIDIA-GPUs. Die Multi-GPU-Unterstützung funktioniert nur, wenn alle GPUs denselben Treiberstack verwenden – also entweder zwei NVIDIA-Karten oder zwei AMD-Karten, nicht jeweils eine.

Wie kann ich Ollama unter Windows deinstallieren?

Öffnen Sie Einstellungen → Apps → Installierte Apps, suchen Sie nach Ollama und klicken Sie auf „Deinstallieren“. Dadurch wird die Anwendung und der Dienst entfernt, die Modelle bleiben jedoch im Verzeichnis %USERPROFILE%.ollamaerhalten. Löschen Sie diesen Ordner manuell, um Speicherplatz freizugeben. Falls der Dienst während der Deinstallation nicht beendet wird, öffnen Sie den Task-Manager, suchen Sie unter „Hintergrundprozesse“ nach OllamaService.exe und beenden Sie ihn, bevor Sie den Vorgang erneut versuchen.

Nächste Schritte

Nach der Installation von Ollama unter Windows erkunden Sie die vollständige Modellbibliothek unter Kompletter Ollama-Leitfaden , um zu verstehen, wie Modellauswahl, Quantisierung und Kontextfenster die Qualität beeinflussen. Für Produktionsworkloads berechnen Sie die laufenden API-Kosten im Vergleich zum Self-Hosting mithilfe des API-Kostenrechner Kostenrechners, um zu entscheiden, ob lokale Inferenz oder Cloud-APIs besser zu Ihrem Budget und Ihren Skalierungsanforderungen passen.

Verfasst von Mustafa Ihsan

Mustafa Ihsan ist Gründer und Chefredakteur von Convly.ai. Er entwickelte und pflegt die Live-Datenbank für KI-Modelle der Website, ihren Preis-Leistungs-Index sowie kostenlose Rechner für VRAM-Anforderungen, API-Kosten und Wirtschaftlichkeit des Self-Hostings. Er schreibt über Modellpreise, Benchmark-Ergebnisse und die Hardware, die zum lokalen Betrieb von KI-Modellen erforderlich ist, und bevorzugt stets messbare Zahlen gegenüber Herstellerangaben.

Scroll to Top