{"id":2205,"date":"2026-08-14T20:17:07","date_gmt":"2026-08-14T20:17:07","guid":{"rendered":"https:\/\/convly.ai\/?p=2205"},"modified":"2026-08-14T20:17:07","modified_gmt":"2026-08-14T20:17:07","slug":"ollama-not-using-gpu-fix","status":"publish","type":"post","link":"https:\/\/convly.ai\/de\/ollama-not-using-gpu-fix\/","title":{"rendered":"Ollama nutzt keine GPU: Diagnose und Behebung des CPU-Fallbacks"},"content":{"rendered":"<div class=\"convly-tldr\">\n<ul>\n<li>Ausf\u00fchren <code>ollama ps<\/code> w\u00e4hrend ein Modell geladen ist \u2013 die SPALTE \u201ePROCESSOR\u201c zeigt an, ob Ollama die GPU oder die CPU verwendet.<\/li>\n<li>Die h\u00e4ufigste L\u00f6sung bei NVIDIA besteht darin, den Host-Treiber zu installieren oder zu aktualisieren, damit <code>nvidia-smi<\/code> die Grafikkarte erkennt, und anschlie\u00dfend den Ollama-Dienst neu zu starten.<\/li>\n<li>Wenn das Modell gr\u00f6\u00dfer ist als Ihr VRAM, entl\u00e4dt Ollama Teile der Schichten auf die CPU \u2013 verwenden Sie dazu die <a href=\"https:\/\/convly.ai\/de\/llm-vram-calculator\/\">VRAM-Rechner<\/a> um vor dem Download zu pr\u00fcfen, ob Ihr Modell in den verf\u00fcgbaren VRAM passt.<\/li>\n<li>AMD-, Docker- und WSL2-Umgebungen erfordern jeweils plattformspezifische Schritte, die im Folgenden beschrieben werden.<\/li>\n<\/ul>\n<\/div>\n<p>Wenn Ollama Ihre GPU nicht nutzt, liegt die h\u00e4ufigste Ursache in einem fehlenden oder inkompatiblen Treiber. F\u00fchren Sie <code>ollama ps<\/code> aus \u2013 zeigt die SPALTE \u201ePROCESSOR\u201c 100 % CPU an, erfolgte ein vollst\u00e4ndiger Fallback auf die CPU. Die L\u00f6sung h\u00e4ngt von Ihrer Plattform ab: Bei NVIDIA wird die korrekte CUDA-Laufzeitumgebung ben\u00f6tigt, bei AMD die ROCm-Plattform und bei Docker explizite GPU-Passthrough-Flags.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_86 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a7fb8b616ea3\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Umschalten<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a7fb8b616ea3\"  aria-label=\"Umschalten\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/de\/ollama-not-using-gpu-fix\/#Step_1_Confirm_Whether_Ollama_Is_Using_the_GPU\" >Schritt 1: \u00dcberpr\u00fcfen, ob Ollama die GPU tats\u00e4chlich nutzt<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/de\/ollama-not-using-gpu-fix\/#Step_2_NVIDIA_%E2%80%94_Drivers_and_CUDA_Runtime\" >Schritt 2: NVIDIA \u2013 Treiber und CUDA-Laufzeitumgebung<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/de\/ollama-not-using-gpu-fix\/#Step_3_Model_Too_Large_for_VRAM\" >Schritt 3: Modell zu gro\u00df f\u00fcr den verf\u00fcgbaren VRAM<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/de\/ollama-not-using-gpu-fix\/#Step_4_AMD_GPU_and_ROCm\" >Schritt 4: AMD-GPU und ROCm<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/de\/ollama-not-using-gpu-fix\/#Step_5_Docker_%E2%80%94_Missing_GPU_Passthrough\" >Schritt 5: Docker \u2013 Fehlender GPU-Passthrough<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/de\/ollama-not-using-gpu-fix\/#Step_6_WSL2_on_Windows\" >Schritt 6: WSL2 unter Windows<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/de\/ollama-not-using-gpu-fix\/#macOS_%E2%80%94_Metal_Apple_Silicon_and_AMD\" >macOS \u2013 Metal (Apple Silicon und AMD)<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/de\/ollama-not-using-gpu-fix\/#Verifying_the_Fix_and_Expected_Throughput\" >\u00dcberpr\u00fcfung der Korrektur und erwartete Durchsatzleistung<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-9\" href=\"https:\/\/convly.ai\/de\/ollama-not-using-gpu-fix\/#Frequently_Asked_Questions\" >H\u00e4ufig gestellte Fragen<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"Step_1_Confirm_Whether_Ollama_Is_Using_the_GPU\"><\/span>Schritt 1: \u00dcberpr\u00fcfen, ob Ollama die GPU tats\u00e4chlich nutzt<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Bevor Sie \u00c4nderungen vornehmen, \u00fcberpr\u00fcfen Sie zun\u00e4chst, was Ollama tats\u00e4chlich tut. Laden Sie ein Modell und \u00f6ffnen Sie w\u00e4hrenddessen ein zweites Terminalfenster:<\/p>\n<pre><code>ollama ps<\/code><\/pre>\n<p>Beispielausgabe:<\/p>\n<pre><code>NAME              ID              SIZE      PROCESSOR    UNTIL\nllama3.2:8b       abc123def456    5,0 GB    100 % GPU    in 4 Minuten<\/code><\/pre>\n<p>Die SPALTE \u201ePROCESSOR\u201c ist das entscheidende Indiz:<\/p>\n<table>\n<thead>\n<tr>\n<th>Wert in der PROCESSOR-Spalte<\/th>\n<th>Bedeutung<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>100 % GPU<\/td>\n<td>Alle Schichten liegen auf der GPU \u2013 erwartetes und korrektes Verhalten<\/td>\n<\/tr>\n<tr>\n<td>XX % GPU \/ YY % CPU<\/td>\n<td>Das Modell passt nur teilweise in den VRAM; die restlichen Schichten laufen auf der CPU<\/td>\n<\/tr>\n<tr>\n<td>100 % CPU<\/td>\n<td>Vollst\u00e4ndiger Fallback auf die CPU \u2013 die GPU wird \u00fcberhaupt nicht genutzt<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Bei NVIDIA-Systemen f\u00fchren Sie zur Validierung parallel <code>nvidia-smi<\/code> aus, w\u00e4hrend Inferenz l\u00e4uft. Die Spalte \u201eMemory-Usage\u201c sollte beim Laden des Modells ansteigen. Bleibt sie konstant, ist die GPU unt\u00e4tig \u2013 unabh\u00e4ngig davon, was andere Tools anzeigen.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Step_2_NVIDIA_%E2%80%94_Drivers_and_CUDA_Runtime\"><\/span>Schritt 2: NVIDIA \u2013 Treiber und CUDA-Laufzeitumgebung<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Ein fehlender oder veralteter NVIDIA-Treiber ist die h\u00e4ufigste Ursache f\u00fcr einen vollst\u00e4ndigen CPU-Fallback. Ollama enth\u00e4lt zwar eigene CUDA-Bibliotheken, ben\u00f6tigt aber trotzdem einen Host-Treiber, der CUDA 11.3 oder neuer unterst\u00fctzt.<\/p>\n<h3>\u00dcberpr\u00fcfen Sie zuerst den Treiber<\/h3>\n<pre><code>nvidia-smi<\/code><\/pre>\n<p>Falls der Befehl nicht gefunden wird, ist kein Treiber installiert. Falls er ausgef\u00fchrt wird, notieren Sie sich die Treiberversion und die CUDA-Version aus der Kopfzeile. Die dort angezeigte CUDA-Version gibt die h\u00f6chste von diesem Treiber unterst\u00fctzte CUDA-Version an \u2013 sie bedeutet nicht, dass ein separates CUDA-Toolkit installiert ist, und Ollama ben\u00f6tigt keines.<\/p>\n<table>\n<thead>\n<tr>\n<th>Plattform<\/th>\n<th>Mindesttreiberversion<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Linux<\/td>\n<td>525.xx (unterst\u00fctzt CUDA 12.0)<\/td>\n<\/tr>\n<tr>\n<td>Native Windows-Umgebung<\/td>\n<td>527.xx (unterst\u00fctzt CUDA 12.0)<\/td>\n<\/tr>\n<tr>\n<td>WSL2 (Windows-Host)<\/td>\n<td>525.xx auf der Windows-Seite \u2013 installieren Sie den Linux-NVIDIA-Treiber NICHT innerhalb von WSL2<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<h3>Installieren oder aktualisieren Sie den Treiber<\/h3>\n<p><strong>Ubuntu \/ Debian:<\/strong><\/p>\n<pre><code>sudo apt install nvidia-driver-550\nsudo reboot<\/code><\/pre>\n<p><strong>Windows:<\/strong> Laden Sie ihn von nvidia.com\/Download herunter oder nutzen Sie GeForce Experience und starten Sie anschlie\u00dfend neu. Nach der Installation oder Aktualisierung eines Treibers ist ein vollst\u00e4ndiger Neustart \u2013 nicht nur ein Dienstneustart \u2013 erforderlich.<\/p>\n<p>Best\u00e4tigen Sie nach dem Neustart, dass <code>nvidia-smi<\/code> Ihre Grafikkarte anzeigt, und starten Sie Ollama neu:<\/p>\n<pre><code># Linux (systemd)\nsudo systemctl restart ollama\n\n# macOS\nlaunchctl kickstart -k gui\/$(id -u)\/com.ollama.ollama\n\n# Windows \u2013 starten Sie die Ollama-Symbolleistenanwendung neu oder f\u00fchren Sie einen Neustart durch<\/code><\/pre>\n<p>F\u00fchren Sie ein Modell aus und \u00fcberpr\u00fcfen Sie <code>ollama ps<\/code> erneut. Zeigt die PROCESSOR-Spalte weiterhin 100 % CPU an, fahren Sie mit den n\u00e4chsten Schritten fort.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Step_3_Model_Too_Large_for_VRAM\"><\/span>Schritt 3: Modell zu gro\u00df f\u00fcr den verf\u00fcgbaren VRAM<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Wenn die Gewichte eines Modells den verf\u00fcgbaren VRAM \u00fcberschreiten, verweigert Ollama nicht einfach die Ausf\u00fchrung \u2013 stattdessen teilt es die Inferenz auf. So viele Transformer-Schichten wie m\u00f6glich werden auf die GPU verlagert; der Rest l\u00e4uft auf der CPU. Dies zeigt sich als Aufteilungsprozentsatz in <code>ollama ps<\/code> und stellt ein beabsichtigtes Verhalten \u2013 keinen Fehler \u2013 dar.<\/p>\n<p>Ein 70-Milliarden-Parameter-Modell mit Q4_K_M-Quantisierung ben\u00f6tigt typischerweise etwa 40 GB VRAM, was jede einzelne Consumer-GPU \u00fcbersteigt. Pr\u00fcfen Sie vor dem Download eines gro\u00dfen Modells, ob es in Ihren VRAM passt, mithilfe des <a href=\"https:\/\/convly.ai\/de\/llm-vram-calculator\/\">VRAM-Rechner<\/a>. F\u00fcr Modell-spezifische VRAM-Angaben zu den g\u00e4ngigsten LLMs siehe <a href=\"https:\/\/convly.ai\/de\/vram-requirements-every-major-llm-2026\/\">VRAM-Anforderungen f\u00fcr alle wichtigen Sprachmodelle<\/a>.<\/p>\n<p>Falls das Modell nicht in Ihren VRAM passt, stehen Ihnen folgende Optionen zur Verf\u00fcgung:<\/p>\n<ul>\n<li>Verwenden Sie eine niedrigere Quantisierung (z. B. Q2_K oder Q3_K_S) \u2013 reduziert den VRAM-Verbrauch bei geringem Qualit\u00e4tseinbu\u00dfen.<\/li>\n<li>Wechseln Sie zu einer kleineren Modellvariante (z. B. 8B statt 70B). Auf der <a href=\"https:\/\/convly.ai\/de\/best-local-llms-to-run-on-ollama-2026\/\">beste lokale Modelle f\u00fcr Ollama<\/a> -Seite finden Sie Informationen dazu, welche Modelle gut auf Consumer-Hardware laufen.<\/li>\n<li>Akzeptieren Sie die partielle Entladung \u2013 die Durchsatzleistung liegt dann zwischen rein-GPU- und rein-CPU-Geschwindigkeit.<\/li>\n<li>R\u00fcsten Sie Ihre GPU auf. Der <a href=\"https:\/\/convly.ai\/de\/best-gpus-for-local-llms-2026\/\">beste GPUs f\u00fcr lokale LLMs<\/a> -Leitfaden vergleicht aktuelle Optionen nach VRAM und Preis.<\/li>\n<\/ul>\n<h2><span class=\"ez-toc-section\" id=\"Step_4_AMD_GPU_and_ROCm\"><\/span>Schritt 4: AMD-GPU und ROCm<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Die AMD-Unterst\u00fctzung in Ollama basiert auf ROCm, der GPU-Berechnungsplattform von AMD. Ollama unterst\u00fctzt offiziell RDNA-2-Grafikkarten (RX-6000-Serie) und RDNA-3-Grafikkarten (RX-7000-Serie) unter Linux. Die AMD-Unterst\u00fctzung unter Windows ist eingeschr\u00e4nkt \u2013 pr\u00fcfen Sie vor der Nutzung unter Windows die Versionshinweise Ihrer installierten Ollama-Version.<\/p>\n<h3>\u00dcberpr\u00fcfen Sie, ob ROCm die Grafikkarte erkennt<\/h3>\n<pre><code>rocm-smi<\/code><\/pre>\n<p>Falls <code>rocm-smi<\/code> nicht gefunden wird, ist der ROCm-Stack nicht installiert. Besuchen Sie amd.com\/de\/developer\/rocm f\u00fcr die aktuellen Installationsanweisungen f\u00fcr Ihre Distribution, da sich Paketnamen und Versionsanforderungen zwischen verschiedenen ROCm-Versionen \u00e4ndern.<\/p>\n<p>die Grafikkarte in der Ausgabe von <code>rocm-smi<\/code> nach der Installation fehlt:<\/p>\n<pre><code>sudo usermod -aG render,video $USER\n# Melden Sie sich ab und wieder an, damit die Gruppenzugeh\u00f6rigkeit wirksam wird<\/code><\/pre>\n<p>Um bei Vorhandensein mehrerer GPUs eine bestimmte GPU anzusprechen:<\/p>\n<pre><code>HIP_VISIBLE_DEVICES=0 ollama serve<\/code><\/pre>\n<h2><span class=\"ez-toc-section\" id=\"Step_5_Docker_%E2%80%94_Missing_GPU_Passthrough\"><\/span>Schritt 5: Docker \u2013 Fehlender GPU-Passthrough<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Docker-Container haben standardm\u00e4\u00dfig keinen Zugriff auf GPUs, es sei denn, Sie \u00fcbergeben das Ger\u00e4t explizit an den Container. Dies ist der h\u00e4ufigste Grund daf\u00fcr, dass Ollama in containerisierten Umgebungen auf die CPU zur\u00fcckf\u00e4llt \u2013 die GPU des Hosts funktioniert einwandfrei, doch der Container kann sie nicht sehen.<\/p>\n<h3>NVIDIA in Docker<\/h3>\n<p>Installieren Sie das NVIDIA Container Toolkit auf dem Host:<\/p>\n<pre><code>sudo apt install nvidia-container-toolkit\nsudo nvidia-ctk runtime configure --runtime=docker\nsudo systemctl restart docker<\/code><\/pre>\n<p>\u00dcbergeben Sie anschlie\u00dfend die GPU beim Start des Containers:<\/p>\n<pre><code>docker run -d --gpus all \n  -v ollama:\/root\/.ollama \n  -p 11434:11434 \n  ollama\/ollama<\/code><\/pre>\n<p>Ohne <code>--gpus all<\/code> (bzw. <code>--gpus device=0<\/code> (f\u00fcr eine bestimmte Karte) hat der Container unabh\u00e4ngig von der Host-Konfiguration keinerlei GPU-Zugriff.<\/p>\n<h3>AMD in Docker<\/h3>\n<pre><code>docker run -d \n  --device \/dev\/kfd --device \/dev\/dri \n  -v ollama:\/root\/.ollama \n  -p 11434:11434 \n  ollama\/ollama:rocm<\/code><\/pre>\n<p>Der <code>:rocm<\/code> ist erforderlich. Das Standard-Image <code>ollama\/ollama<\/code> enth\u00e4lt ROCm nicht und wechselt daher auf AMD-Hardware automatisch zur CPU.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Step_6_WSL2_on_Windows\"><\/span>Schritt 6: WSL2 unter Windows<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>WSL2 kann die NVIDIA-GPU mit dem Windows-Host teilen; eine Regel gilt jedoch absolut: Der NVIDIA-Treiber muss auf <strong>Windows<\/strong>Windows<\/p>\n<ul>\n<li>installiert sein \u2013 nicht innerhalb von WSL2. Die Installation eines Linux-NVIDIA-Treibers innerhalb der WSL2-Umgebung unterbricht die GPU-Durchleitung vollst\u00e4ndig.\nInstallieren oder aktualisieren Sie den NVIDIA-Treiber unter Windows und starten Sie Windows neu.<\/li>\n<li>WSL2 erfordert Kernel 5.10.43 oder neuer. Pr\u00fcfen Sie dies mit <code>uname -r<\/code> innerhalb von WSL2; aktualisieren Sie mit <code>wsl --update<\/code> in einer Windows-Eingabeaufforderung.<\/li>\n<li>Das CUDA-Toolkit kann innerhalb von WSL2 installiert werden, falls Ihr Workflow dies erfordert \u2013 dies ist unabh\u00e4ngig vom Treiber und f\u00fchrt zu keinem Konflikt.<\/li>\n<\/ul>\n<p>\u00dcberpr\u00fcfen Sie die Sichtbarkeit der GPU innerhalb von WSL2:<\/p>\n<pre><code>nvidia-smi<\/code><\/pre>\n<p>Falls hier Ihre Grafikkarte angezeigt wird, nutzt Ollama innerhalb von WSL2 diese automatisch. Bei einem Fehlschlag aktualisieren Sie den Treiber auf Windows-Seite und f\u00fchren <code>wsl --update<\/code>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"macOS_%E2%80%94_Metal_Apple_Silicon_and_AMD\"><\/span>macOS \u2013 Metal (Apple Silicon und AMD)<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>unter macOS nutzt Ollama Apple Metal f\u00fcr GPU-Beschleunigung \u2013 es m\u00fcssen keine Treiber installiert und keine Umgebungsvariablen gesetzt werden. Falls Sie ein Apple-Silicon-Ger\u00e4t verwenden und Ollama langsam l\u00e4uft, vergewissern Sie sich, dass Sie die native ARM-Version von ollama.com installiert haben und nicht die x86-Version, die unter Rosetta l\u00e4uft. Apple-Silicon-Macs nutzen gemeinsamen Arbeitsspeicher (unified memory), sodass der gesamte System-Arbeitsspeicher Modellen zur Verf\u00fcgung steht \u2013 geben Sie bei Verwendung des <a href=\"https:\/\/convly.ai\/de\/llm-vram-calculator\/\">VRAM-Rechner<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Verifying_the_Fix_and_Expected_Throughput\"><\/span>\u00dcberpr\u00fcfung der Korrektur und erwartete Durchsatzleistung<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Ihre gesamte RAM-Gr\u00f6\u00dfe als VRAM-Grenzwert an.<\/p>\n<pre><code>F\u00fchren Sie nach \u00c4nderungen ein Modell aus und \u00fcberpr\u00fcfen Sie gleichzeitig zwei Signale:\n# Terminal 1 \u2013 Starten Sie eine Generierung\nollama run llama3.2:8b \"Was ist die Hauptstadt Frankreichs?\"\n\n# Terminal 2 \u2013 w\u00e4hrend der Generierung l\u00e4uft\nollama ps\n\n# NVIDIA: \u00dcberwachen Sie zus\u00e4tzlich die GPU-Auslastung pro Sekunde\nnvidia-smi dmon -s u<\/code><\/pre>\n<p>Referenz-Durchsatz (ungef\u00e4hr \u2013 variiert je nach Quantisierung, Treiberversion und PCIe-Bandbreite):<\/p>\n<table>\n<thead>\n<tr>\n<th>Hardware<\/th>\n<th>Modell<\/th>\n<th>~Tok\/s<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>RTX 4090 (24 GB)<\/td>\n<td>Llama 3.1 8B Q4<\/td>\n<td>120\u2013160<\/td>\n<\/tr>\n<tr>\n<td>RTX 3080 (10 GB)<\/td>\n<td>Llama 3.1 8B Q4<\/td>\n<td>60\u201380<\/td>\n<\/tr>\n<tr>\n<td>Apple M3 Pro (unified memory)<\/td>\n<td>Llama 3.1 8B Q4<\/td>\n<td>40\u201360<\/td>\n<\/tr>\n<tr>\n<td>Nur CPU (Ryzen 9 7950X)<\/td>\n<td>Llama 3.1 8B Q4<\/td>\n<td>5\u201315<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Einstellige Token pro Sekunde bei Vorhandensein einer leistungsf\u00e4higen GPU sind das deutlichste Zeichen daf\u00fcr, dass die Korrekturma\u00dfnahme nicht wirksam geworden ist.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_Asked_Questions\"><\/span>H\u00e4ufig gestellte Fragen<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Warum zeigt <code>ollama ps<\/code> eine Aufteilung zwischen GPU und CPU statt 100 % GPU?<\/h3>\n<p>Das Modell ist gr\u00f6\u00dfer als der verf\u00fcgbare VRAM. Ollama platziert so viele Schichten wie m\u00f6glich auf der GPU und f\u00fchrt den Rest auf der CPU aus. Das Ergebnis ist schneller als reine CPU-Nutzung, aber langsamer als volle GPU-Nutzung. Laden Sie ein kleineres Modell oder wechseln Sie zu einer niedrigeren Quantisierung, um mehr Schichten auf die GPU zu verlagern.<\/p>\n<h3>Ollama nutzte zuvor die GPU, hat dies aber pl\u00f6tzlich eingestellt \u2013 was hat sich ge\u00e4ndert?<\/h3>\n<p>Ein Treiber-Update, ein Betriebssystem-Update oder eine neue Ollama-Version k\u00f6nnen die GPU-Erkennung beeintr\u00e4chtigen. Stellen Sie sicher, dass <code>nvidia-smi<\/code> die Grafikkarte weiterhin anzeigt, und f\u00fchren Sie anschlie\u00dfend einen vollst\u00e4ndigen Dienstneustart durch. Falls Sie k\u00fcrzlich den NVIDIA-Treiber aktualisiert haben, ist manchmal ein kompletter Systemneustart erforderlich \u2013 ein einfacher Dienstneustart reicht m\u00f6glicherweise nicht aus.<\/p>\n<h3>Kann Ollama mehrere GPUs gleichzeitig nutzen?<\/h3>\n<p>Ja. Ollama verteilt Modellschichten automatisch auf alle sichtbaren GPUs, sobald mehr als eine vorhanden ist. Um einzuschr\u00e4nken, welche GPUs Ollama verwendet, setzen Sie <code>CUDA_VISIBLE_DEVICES<\/code> (f\u00fcr NVIDIA) oder <code>HIP_VISIBLE_DEVICES<\/code> (AMD) vor dem Start <code>ollama serve<\/code>.<\/p>\n<h3>Funktioniert Ollama mit Consumer-GeForce-Grafikkarten, oder ben\u00f6tige ich eine Data-Center-GPU?<\/h3>\n<p>GeForce-GTX-10xx-Karten und neuer werden vollst\u00e4ndig unterst\u00fctzt \u2013 eine Data-Center-GPU ist nicht erforderlich. Die praktische Grenze f\u00fcr die meisten Nutzer ist der verf\u00fcgbare VRAM: Eine 8-GB-Karte kann problemlos 7\u20138-Milliarden-Parameter-Modelle in Q4-Quantisierung ausf\u00fchren. Verwenden Sie den <a href=\"https:\/\/convly.ai\/de\/llm-vram-calculator\/\">VRAM-Rechner<\/a> um zu \u00fcberpr\u00fcfen, ob ein bestimmtes Modell vor dem Download auf Ihre Hardware passt.<\/p>\n<h3>Meine GPU verf\u00fcgt \u00fcber ausreichend VRAM, doch Ollama nutzt trotzdem die CPU. Warum?<\/h3>\n<p>Ein anderer Prozess k\u00f6nnte den VRAM belegen \u2013 pr\u00fcfen Sie <code>nvidia-smi<\/code> auf andere Verbraucher wie einen Browser mit Hardwarebeschleunigung oder ein anderes laufendes Modell. M\u00f6glicherweise wurde das Modell auch geladen, bevor der GPU-Treiber bereit war. Beenden Sie das geladene Modell mit <code>ollama stop &lt;Name&gt;<\/code>, geben Sie in anderen Anwendungen VRAM frei und laden Sie das Modell neu.<\/p>\n<h3>Wo finde ich weitere Informationen zur Konfiguration von Ollama und zur Auswahl geeigneter Modelle?<\/h3>\n<p>Der <a href=\"https:\/\/convly.ai\/de\/what-is-ollama-complete-guide-2026\/\">Kompletter Ollama-Leitfaden<\/a> behandelt Umgebungsvariablen, Modellverwaltung und API-Nutzung ausf\u00fchrlich. F\u00fcr die Auswahl des passenden Modells f\u00fcr Ihre spezifische Hardware siehe die <a href=\"https:\/\/convly.ai\/de\/best-local-llms-to-run-on-ollama-2026\/\">beste lokale Modelle f\u00fcr Ollama<\/a>.<\/p>","protected":false},"excerpt":{"rendered":"<p>Run ollama ps while a model is loaded \u2014 the PROCESSOR column tells you whether Ollama is using GPU or [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":2206,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2205","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts\/2205","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/comments?post=2205"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts\/2205\/revisions"}],"predecessor-version":[{"id":2207,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts\/2205\/revisions\/2207"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/media\/2206"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/media?parent=2205"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/categories?post=2205"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/tags?post=2205"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}