Friday, 14 August 2026 | Updating Daily AI insight, written for builders

Ollama nutzt keine GPU: Diagnose und Behebung des CPU-Fallbacks

  • Ausführen ollama ps während ein Modell geladen ist – die SPALTE „PROCESSOR“ zeigt an, ob Ollama die GPU oder die CPU verwendet.
  • Die häufigste Lösung bei NVIDIA besteht darin, den Host-Treiber zu installieren oder zu aktualisieren, damit nvidia-smi die Grafikkarte erkennt, und anschließend den Ollama-Dienst neu zu starten.
  • Wenn das Modell größer ist als Ihr VRAM, entlädt Ollama Teile der Schichten auf die CPU – verwenden Sie dazu die VRAM-Rechner um vor dem Download zu prüfen, ob Ihr Modell in den verfügbaren VRAM passt.
  • AMD-, Docker- und WSL2-Umgebungen erfordern jeweils plattformspezifische Schritte, die im Folgenden beschrieben werden.

Wenn Ollama Ihre GPU nicht nutzt, liegt die häufigste Ursache in einem fehlenden oder inkompatiblen Treiber. Führen Sie ollama ps aus – zeigt die SPALTE „PROCESSOR“ 100 % CPU an, erfolgte ein vollständiger Fallback auf die CPU. Die Lösung hängt von Ihrer Plattform ab: Bei NVIDIA wird die korrekte CUDA-Laufzeitumgebung benötigt, bei AMD die ROCm-Plattform und bei Docker explizite GPU-Passthrough-Flags.

Schritt 1: Überprüfen, ob Ollama die GPU tatsächlich nutzt

Bevor Sie Änderungen vornehmen, überprüfen Sie zunächst, was Ollama tatsächlich tut. Laden Sie ein Modell und öffnen Sie währenddessen ein zweites Terminalfenster:

ollama ps

Beispielausgabe:

NAME              ID              SIZE      PROCESSOR    UNTIL
llama3.2:8b       abc123def456    5,0 GB    100 % GPU    in 4 Minuten

Die SPALTE „PROCESSOR“ ist das entscheidende Indiz:

Wert in der PROCESSOR-SpalteBedeutung
100 % GPUAlle Schichten liegen auf der GPU – erwartetes und korrektes Verhalten
XX % GPU / YY % CPUDas Modell passt nur teilweise in den VRAM; die restlichen Schichten laufen auf der CPU
100 % CPUVollständiger Fallback auf die CPU – die GPU wird überhaupt nicht genutzt

Bei NVIDIA-Systemen führen Sie zur Validierung parallel nvidia-smi aus, während Inferenz läuft. Die Spalte „Memory-Usage“ sollte beim Laden des Modells ansteigen. Bleibt sie konstant, ist die GPU untätig – unabhängig davon, was andere Tools anzeigen.

Schritt 2: NVIDIA – Treiber und CUDA-Laufzeitumgebung

Ein fehlender oder veralteter NVIDIA-Treiber ist die häufigste Ursache für einen vollständigen CPU-Fallback. Ollama enthält zwar eigene CUDA-Bibliotheken, benötigt aber trotzdem einen Host-Treiber, der CUDA 11.3 oder neuer unterstützt.

Überprüfen Sie zuerst den Treiber

nvidia-smi

Falls der Befehl nicht gefunden wird, ist kein Treiber installiert. Falls er ausgeführt wird, notieren Sie sich die Treiberversion und die CUDA-Version aus der Kopfzeile. Die dort angezeigte CUDA-Version gibt die höchste von diesem Treiber unterstützte CUDA-Version an – sie bedeutet nicht, dass ein separates CUDA-Toolkit installiert ist, und Ollama benötigt keines.

PlattformMindesttreiberversion
Linux525.xx (unterstützt CUDA 12.0)
Native Windows-Umgebung527.xx (unterstützt CUDA 12.0)
WSL2 (Windows-Host)525.xx auf der Windows-Seite – installieren Sie den Linux-NVIDIA-Treiber NICHT innerhalb von WSL2

Installieren oder aktualisieren Sie den Treiber

Ubuntu / Debian:

sudo apt install nvidia-driver-550
sudo reboot

Windows: Laden Sie ihn von nvidia.com/Download herunter oder nutzen Sie GeForce Experience und starten Sie anschließend neu. Nach der Installation oder Aktualisierung eines Treibers ist ein vollständiger Neustart – nicht nur ein Dienstneustart – erforderlich.

Bestätigen Sie nach dem Neustart, dass nvidia-smi Ihre Grafikkarte anzeigt, und starten Sie Ollama neu:

# Linux (systemd)
sudo systemctl restart ollama

# macOS
launchctl kickstart -k gui/$(id -u)/com.ollama.ollama

# Windows – starten Sie die Ollama-Symbolleistenanwendung neu oder führen Sie einen Neustart durch

Führen Sie ein Modell aus und überprüfen Sie ollama ps erneut. Zeigt die PROCESSOR-Spalte weiterhin 100 % CPU an, fahren Sie mit den nächsten Schritten fort.

Schritt 3: Modell zu groß für den verfügbaren VRAM

Wenn die Gewichte eines Modells den verfügbaren VRAM überschreiten, verweigert Ollama nicht einfach die Ausführung – stattdessen teilt es die Inferenz auf. So viele Transformer-Schichten wie möglich werden auf die GPU verlagert; der Rest läuft auf der CPU. Dies zeigt sich als Aufteilungsprozentsatz in ollama ps und stellt ein beabsichtigtes Verhalten – keinen Fehler – dar.

Ein 70-Milliarden-Parameter-Modell mit Q4_K_M-Quantisierung benötigt typischerweise etwa 40 GB VRAM, was jede einzelne Consumer-GPU übersteigt. Prüfen Sie vor dem Download eines großen Modells, ob es in Ihren VRAM passt, mithilfe des VRAM-Rechner. Für Modell-spezifische VRAM-Angaben zu den gängigsten LLMs siehe VRAM-Anforderungen für alle wichtigen Sprachmodelle.

Falls das Modell nicht in Ihren VRAM passt, stehen Ihnen folgende Optionen zur Verfügung:

  • Verwenden Sie eine niedrigere Quantisierung (z. B. Q2_K oder Q3_K_S) – reduziert den VRAM-Verbrauch bei geringem Qualitätseinbußen.
  • Wechseln Sie zu einer kleineren Modellvariante (z. B. 8B statt 70B). Auf der beste lokale Modelle für Ollama -Seite finden Sie Informationen dazu, welche Modelle gut auf Consumer-Hardware laufen.
  • Akzeptieren Sie die partielle Entladung – die Durchsatzleistung liegt dann zwischen rein-GPU- und rein-CPU-Geschwindigkeit.
  • Rüsten Sie Ihre GPU auf. Der beste GPUs für lokale LLMs -Leitfaden vergleicht aktuelle Optionen nach VRAM und Preis.

Schritt 4: AMD-GPU und ROCm

Die AMD-Unterstützung in Ollama basiert auf ROCm, der GPU-Berechnungsplattform von AMD. Ollama unterstützt offiziell RDNA-2-Grafikkarten (RX-6000-Serie) und RDNA-3-Grafikkarten (RX-7000-Serie) unter Linux. Die AMD-Unterstützung unter Windows ist eingeschränkt – prüfen Sie vor der Nutzung unter Windows die Versionshinweise Ihrer installierten Ollama-Version.

Überprüfen Sie, ob ROCm die Grafikkarte erkennt

rocm-smi

Falls rocm-smi nicht gefunden wird, ist der ROCm-Stack nicht installiert. Besuchen Sie amd.com/de/developer/rocm für die aktuellen Installationsanweisungen für Ihre Distribution, da sich Paketnamen und Versionsanforderungen zwischen verschiedenen ROCm-Versionen ändern.

die Grafikkarte in der Ausgabe von rocm-smi nach der Installation fehlt:

sudo usermod -aG render,video $USER
# Melden Sie sich ab und wieder an, damit die Gruppenzugehörigkeit wirksam wird

Um bei Vorhandensein mehrerer GPUs eine bestimmte GPU anzusprechen:

HIP_VISIBLE_DEVICES=0 ollama serve

Schritt 5: Docker – Fehlender GPU-Passthrough

Docker-Container haben standardmäßig keinen Zugriff auf GPUs, es sei denn, Sie übergeben das Gerät explizit an den Container. Dies ist der häufigste Grund dafür, dass Ollama in containerisierten Umgebungen auf die CPU zurückfällt – die GPU des Hosts funktioniert einwandfrei, doch der Container kann sie nicht sehen.

NVIDIA in Docker

Installieren Sie das NVIDIA Container Toolkit auf dem Host:

sudo apt install nvidia-container-toolkit
sudo nvidia-ctk runtime configure --runtime=docker
sudo systemctl restart docker

Übergeben Sie anschließend die GPU beim Start des Containers:

docker run -d --gpus all 
  -v ollama:/root/.ollama 
  -p 11434:11434 
  ollama/ollama

Ohne --gpus all (bzw. --gpus device=0 (für eine bestimmte Karte) hat der Container unabhängig von der Host-Konfiguration keinerlei GPU-Zugriff.

AMD in Docker

docker run -d 
  --device /dev/kfd --device /dev/dri 
  -v ollama:/root/.ollama 
  -p 11434:11434 
  ollama/ollama:rocm

Der :rocm ist erforderlich. Das Standard-Image ollama/ollama enthält ROCm nicht und wechselt daher auf AMD-Hardware automatisch zur CPU.

Schritt 6: WSL2 unter Windows

WSL2 kann die NVIDIA-GPU mit dem Windows-Host teilen; eine Regel gilt jedoch absolut: Der NVIDIA-Treiber muss auf WindowsWindows

  • installiert sein – nicht innerhalb von WSL2. Die Installation eines Linux-NVIDIA-Treibers innerhalb der WSL2-Umgebung unterbricht die GPU-Durchleitung vollständig. Installieren oder aktualisieren Sie den NVIDIA-Treiber unter Windows und starten Sie Windows neu.
  • WSL2 erfordert Kernel 5.10.43 oder neuer. Prüfen Sie dies mit uname -r innerhalb von WSL2; aktualisieren Sie mit wsl --update in einer Windows-Eingabeaufforderung.
  • Das CUDA-Toolkit kann innerhalb von WSL2 installiert werden, falls Ihr Workflow dies erfordert – dies ist unabhängig vom Treiber und führt zu keinem Konflikt.

Überprüfen Sie die Sichtbarkeit der GPU innerhalb von WSL2:

nvidia-smi

Falls hier Ihre Grafikkarte angezeigt wird, nutzt Ollama innerhalb von WSL2 diese automatisch. Bei einem Fehlschlag aktualisieren Sie den Treiber auf Windows-Seite und führen wsl --update.

macOS – Metal (Apple Silicon und AMD)

unter macOS nutzt Ollama Apple Metal für GPU-Beschleunigung – es müssen keine Treiber installiert und keine Umgebungsvariablen gesetzt werden. Falls Sie ein Apple-Silicon-Gerät verwenden und Ollama langsam läuft, vergewissern Sie sich, dass Sie die native ARM-Version von ollama.com installiert haben und nicht die x86-Version, die unter Rosetta läuft. Apple-Silicon-Macs nutzen gemeinsamen Arbeitsspeicher (unified memory), sodass der gesamte System-Arbeitsspeicher Modellen zur Verfügung steht – geben Sie bei Verwendung des VRAM-Rechner.

Überprüfung der Korrektur und erwartete Durchsatzleistung

Ihre gesamte RAM-Größe als VRAM-Grenzwert an.

Führen Sie nach Änderungen ein Modell aus und überprüfen Sie gleichzeitig zwei Signale:
# Terminal 1 – Starten Sie eine Generierung
ollama run llama3.2:8b "Was ist die Hauptstadt Frankreichs?"

# Terminal 2 – während der Generierung läuft
ollama ps

# NVIDIA: Überwachen Sie zusätzlich die GPU-Auslastung pro Sekunde
nvidia-smi dmon -s u

Referenz-Durchsatz (ungefähr – variiert je nach Quantisierung, Treiberversion und PCIe-Bandbreite):

HardwareModell~Tok/s
RTX 4090 (24 GB)Llama 3.1 8B Q4120–160
RTX 3080 (10 GB)Llama 3.1 8B Q460–80
Apple M3 Pro (unified memory)Llama 3.1 8B Q440–60
Nur CPU (Ryzen 9 7950X)Llama 3.1 8B Q45–15

Einstellige Token pro Sekunde bei Vorhandensein einer leistungsfähigen GPU sind das deutlichste Zeichen dafür, dass die Korrekturmaßnahme nicht wirksam geworden ist.

Häufig gestellte Fragen

Warum zeigt ollama ps eine Aufteilung zwischen GPU und CPU statt 100 % GPU?

Das Modell ist größer als der verfügbare VRAM. Ollama platziert so viele Schichten wie möglich auf der GPU und führt den Rest auf der CPU aus. Das Ergebnis ist schneller als reine CPU-Nutzung, aber langsamer als volle GPU-Nutzung. Laden Sie ein kleineres Modell oder wechseln Sie zu einer niedrigeren Quantisierung, um mehr Schichten auf die GPU zu verlagern.

Ollama nutzte zuvor die GPU, hat dies aber plötzlich eingestellt – was hat sich geändert?

Ein Treiber-Update, ein Betriebssystem-Update oder eine neue Ollama-Version können die GPU-Erkennung beeinträchtigen. Stellen Sie sicher, dass nvidia-smi die Grafikkarte weiterhin anzeigt, und führen Sie anschließend einen vollständigen Dienstneustart durch. Falls Sie kürzlich den NVIDIA-Treiber aktualisiert haben, ist manchmal ein kompletter Systemneustart erforderlich – ein einfacher Dienstneustart reicht möglicherweise nicht aus.

Kann Ollama mehrere GPUs gleichzeitig nutzen?

Ja. Ollama verteilt Modellschichten automatisch auf alle sichtbaren GPUs, sobald mehr als eine vorhanden ist. Um einzuschränken, welche GPUs Ollama verwendet, setzen Sie CUDA_VISIBLE_DEVICES (für NVIDIA) oder HIP_VISIBLE_DEVICES (AMD) vor dem Start ollama serve.

Funktioniert Ollama mit Consumer-GeForce-Grafikkarten, oder benötige ich eine Data-Center-GPU?

GeForce-GTX-10xx-Karten und neuer werden vollständig unterstützt – eine Data-Center-GPU ist nicht erforderlich. Die praktische Grenze für die meisten Nutzer ist der verfügbare VRAM: Eine 8-GB-Karte kann problemlos 7–8-Milliarden-Parameter-Modelle in Q4-Quantisierung ausführen. Verwenden Sie den VRAM-Rechner um zu überprüfen, ob ein bestimmtes Modell vor dem Download auf Ihre Hardware passt.

Meine GPU verfügt über ausreichend VRAM, doch Ollama nutzt trotzdem die CPU. Warum?

Ein anderer Prozess könnte den VRAM belegen – prüfen Sie nvidia-smi auf andere Verbraucher wie einen Browser mit Hardwarebeschleunigung oder ein anderes laufendes Modell. Möglicherweise wurde das Modell auch geladen, bevor der GPU-Treiber bereit war. Beenden Sie das geladene Modell mit ollama stop <Name>, geben Sie in anderen Anwendungen VRAM frei und laden Sie das Modell neu.

Wo finde ich weitere Informationen zur Konfiguration von Ollama und zur Auswahl geeigneter Modelle?

Der Kompletter Ollama-Leitfaden behandelt Umgebungsvariablen, Modellverwaltung und API-Nutzung ausführlich. Für die Auswahl des passenden Modells für Ihre spezifische Hardware siehe die beste lokale Modelle für Ollama.

Verfasst von Mustafa Ihsan

Mustafa Ihsan ist Gründer und Chefredakteur von Convly.ai. Er entwickelte und pflegt die Live-Datenbank für KI-Modelle der Website, ihren Preis-Leistungs-Index sowie kostenlose Rechner für VRAM-Anforderungen, API-Kosten und Wirtschaftlichkeit des Self-Hostings. Er schreibt über Modellpreise, Benchmark-Ergebnisse und die Hardware, die zum lokalen Betrieb von KI-Modellen erforderlich ist, und bevorzugt stets messbare Zahlen gegenüber Herstellerangaben.

Scroll to Top
Featured on There's An AI For That