{"id":1750,"date":"2026-07-31T03:00:31","date_gmt":"2026-07-31T03:00:31","guid":{"rendered":"https:\/\/convly.ai\/?p=1750"},"modified":"2026-08-01T06:45:53","modified_gmt":"2026-08-01T06:45:53","slug":"ollama-docker","status":"publish","type":"post","link":"https:\/\/convly.ai\/de\/ollama-docker\/","title":{"rendered":"Ollama-Docker-Anleitung (2026): F\u00fchren Sie Ollama in einem Container mit GPU aus"},"content":{"rendered":"<p>Wird ausgef\u00fchrt <strong>Ollama in Docker<\/strong> ist der sauberste Weg, einen lokalen Modellserver reproduzierbar zu halten: Der gleiche Befehl funktioniert auf einem Laptop, einem Heimserver und einer gemieteten GPU-Instanz \u2013 und nichts dringt in das Host-System ein. Die Einrichtung ist kurz, doch zwei Details \u2013 GPU-Passthrough und Volumenpersistenz \u2013 verursachen den gr\u00f6\u00dften Teil der unn\u00f6tig verlorenen Zeit.<\/p>\n<div style=\"background:#faf9ff;border:1px solid #e6e1f5;border-left:4px solid #6d28d9;border-radius:10px;padding:18px 22px;margin:28px 0;\">\n<p style=\"margin:0 0 10px;font-weight:700;color:#4c1d95;font-size:14px;letter-spacing:.5px;text-transform:uppercase;\">Quick answer<\/p>\n<p style=\"margin:0;\">Laden Sie das offizielle Image herunter und f\u00fchren Sie es mit einem benannten Volume aus, damit Modelle \u00fcber Neustarts hinweg erhalten bleiben: <code>docker run -d -v ollama:\/root\/.ollama -p 11434:11434 --name ollama ollama\/ollama<\/code>. F\u00fcr eine NVIDIA-GPU installieren Sie das \u201eNVIDIA Container Toolkit\u201c auf dem Hostsystem, starten Docker neu und f\u00fcgen <code>--gpus=all<\/code>hinzu. Laden Sie dann Modelle innerhalb des Containers mit <code>docker exec -it ollama ollama pull llama3.1<\/code>herunter. Die API ist exakt wie bei einer nativen Installation \u00fcber Port 11434 erreichbar.<\/p>\n<\/div>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_85 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a705a22b8ef9\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Umschalten<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a705a22b8ef9\"  aria-label=\"Umschalten\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/de\/ollama-docker\/#The_three_commands_that_matter\" >Die drei entscheidenden Befehle<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/de\/ollama-docker\/#GPU_passthrough_the_part_that_fails\" >GPU-Passthrough: Der Teil, der h\u00e4ufig scheitert<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/de\/ollama-docker\/#Keep_your_models_between_restarts\" >Behalten Sie Ihre Modelle zwischen Neustarts bei<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/de\/ollama-docker\/#docker_compose_for_a_setup_you_keep\" >docker compose \u2013 f\u00fcr eine dauerhafte Einrichtung<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/de\/ollama-docker\/#Frequently_asked_questions\" >H\u00e4ufig gestellte Fragen<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"The_three_commands_that_matter\"><\/span>Die drei entscheidenden Befehle<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<div style=\"background:#faf9ff;border:1px solid #e6e1f5;border-radius:10px;padding:18px 22px;margin:28px 0;overflow-x:auto;\">\n<table style=\"width:100%;border-collapse:collapse;font-size:15px;\">\n<tr>\n<th style=\"text-align:left;padding:8px 10px;border-bottom:2px solid #e6e1f5;color:#4c1d95;\">Ziel<\/th>\n<th style=\"text-align:left;padding:8px 10px;border-bottom:2px solid #e6e1f5;color:#4c1d95;\">Befehl<\/th>\n<\/tr>\n<tr>\n<td style=\"padding:8px 10px;border-bottom:1px solid #efecf8;\">Nur CPU<\/td>\n<td style=\"padding:8px 10px;border-bottom:1px solid #efecf8;\"><code>docker run -d -v ollama:\/root\/.ollama -p 11434:11434 --name ollama ollama\/ollama<\/code><\/td>\n<\/tr>\n<tr>\n<td style=\"padding:8px 10px;border-bottom:1px solid #efecf8;\">Mit NVIDIA-GPU<\/td>\n<td style=\"padding:8px 10px;border-bottom:1px solid #efecf8;\"><code>docker run -d --gpus=all -v ollama:\/root\/.ollama -p 11434:11434 --name ollama ollama\/ollama<\/code><\/td>\n<\/tr>\n<tr>\n<td style=\"padding:8px 10px;border-bottom:1px solid #efecf8;\">Modell herunterladen<\/td>\n<td style=\"padding:8px 10px;border-bottom:1px solid #efecf8;\"><code>docker exec -it ollama ollama pull llama3.1<\/code><\/td>\n<\/tr>\n<\/table>\n<\/div>\n<h2><span class=\"ez-toc-section\" id=\"GPU_passthrough_the_part_that_fails\"><\/span>GPU-Passthrough: Der Teil, der h\u00e4ufig scheitert<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Ein Container kann standardm\u00e4\u00dfig nicht auf Ihre GPU zugreifen. Unter Linux installieren Sie das <strong>NVIDIA Container Toolkit<\/strong> auf dem Hostsystem, starten Docker neu und f\u00fcgen <code>--gpus=all<\/code>hinzu. \u00dcberpr\u00fcfen Sie die korrekte Funktion innerhalb des Containers mit <code>docker exec -it ollama nvidia-smi<\/code> \u2013 falls dieser Befehl fehlschl\u00e4gt, l\u00e4uft Ollama zwar, aber stillschweigend auf der CPU; Sie k\u00f6nnten dann f\u00e4lschlicherweise zu dem Schluss kommen, Ihre GPU sei langsam, obwohl sie schlicht nicht genutzt wird. Unter Windows ist der empfohlene Weg Docker Desktop mit WSL2-Backend und aktuellen NVIDIA-Treibern. AMD-Nutzer ben\u00f6tigen das ROCm-getaggte Image statt des Standard-Images; Apple-Silicon-GPUs k\u00f6nnen hingegen \u00fcberhaupt nicht an Docker weitergegeben werden \u2013 unter macOS f\u00fchren Sie Ollama daher nativ aus.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Keep_your_models_between_restarts\"><\/span>Behalten Sie Ihre Modelle zwischen Neustarts bei<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Modell-Dateien sind gro\u00df und langsam beim erneuten Herunterladen; ein Container ohne Volume verwirft sie sofort beim Entfernen. Die Option <code>-v ollama:\/root\/.ollama<\/code> in jedem obigen Befehl erstellt ein benanntes Volume, das \u00fcber Neustarts, Upgrades und Image-\u00c4nderungen hinweg bestehen bleibt. Falls Sie die Dateien lieber an einem Ort speichern m\u00f6chten, den Sie direkt einsehen k\u00f6nnen, binden Sie stattdessen ein Host-Verzeichnis ein: <code>-v \/srv\/ollama:\/root\/.ollama<\/code>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"docker_compose_for_a_setup_you_keep\"><\/span>docker compose \u2013 f\u00fcr eine dauerhafte Einrichtung<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>F\u00fcr dauerhafte Einrichtungen ist eine docker-compose-Datei besser als ein langer Ausf\u00fchrungs-Befehl: Sie dokumentiert die GPU-Zuweisung, das Volume und den Port an einer Stelle, startet den Dienst automatisch neu und erm\u00f6glicht sp\u00e4ter die einfache Integration einer Web-Oberfl\u00e4che. Der Container stellt denselben OpenAI-kompatiblen Endpunkt unter <code>http:\/\/localhost:11434<\/code>, bereit, sodass Anwendungen keinen Unterschied zwischen containerisierter und nativer Installation feststellen k\u00f6nnen.<\/p>\n<div style=\"background:#fffdf5;border:1px solid #f0e6c8;border-left:4px solid #b45309;border-radius:10px;padding:18px 22px;margin:28px 0;\">\n<p style=\"margin:0 0 10px;font-weight:700;color:#92400e;font-size:14px;letter-spacing:.5px;text-transform:uppercase;\">Convly&#8217;s take<\/p>\n<p style=\"margin:0;\">Containerisieren Sie Ollama, wenn die Maschine ein Server ist, und verzichten Sie auf Docker, wenn es sich um Ihren Laptop handelt. Auf einem Heimserver oder einer gemieteten GPU-Instanz ist die Kombination aus Volume und docker-compose tats\u00e4chlich \u00fcberlegen: reproduzierbar, aktualisierbar und einfach zu migrieren. Auf einem pers\u00f6nlichen Rechner \u2013 insbesondere einem Mac, bei dem GPU-Passthrough unm\u00f6glich ist \u2013 f\u00fcgt Docker eine Leistungseinbu\u00dfe verursachende Schicht hinzu, die kaum Nutzen bringt. Das h\u00e4ufigste selbstverschuldete Problem, das wir beobachten, ist ein Container, der stillschweigend auf der CPU l\u00e4uft, weil das Toolkit nie installiert wurde; f\u00fchren Sie daher vor jeder Benchmark-Tests \u201envidia-smi\u201c innerhalb des Containers aus.<\/p>\n<\/div>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_asked_questions\"><\/span>H\u00e4ufig gestellte Fragen<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Unterst\u00fctzt Ollama in Docker GPUs?<\/h3>\n<p>Ja \u2013 bei NVIDIA mit dem NVIDIA Container Toolkit und <code>--gpus=all<\/code>, sowie bei AMD mit dem ROCm-Image. Apple-Silicon-GPUs k\u00f6nnen Docker nicht zur Verf\u00fcgung gestellt werden \u2013 f\u00fchren Sie Ollama unter macOS daher nativ aus.<\/p>\n<h3>Wo werden Modelle in der Docker-Einrichtung gespeichert?<\/h3>\n<p>Innerhalb des Containers unter <code>\/root\/.ollama<\/code>. Ordnen Sie diesen Pfad einem benannten Volume oder einem Host-Verzeichnis zu \u2013 andernfalls gehen die Modelle beim Entfernen des Containers verloren.<\/p>\n<h3>Ist Ollama in Docker langsamer?<\/h3>\n<p>Nahezu nicht unter Linux bei ordnungsgem\u00e4\u00dfem GPU-Passthrough. Eine wahrgenommene Langsamkeit bedeutet fast immer, dass der Container auf der CPU l\u00e4uft, weil die GPU nicht korrekt weitergegeben wurde.<\/p>\n<h3>Kann ich mehrere Modelle in einem Container ausf\u00fchren?<\/h3>\n<p>Ja \u2013 laden Sie beliebig viele herunter; Ollama l\u00e4dt sie bei Bedarf nach. Die Grenze ist der Arbeitsspeicher: Nur aktiv geladene Modelle beanspruchen RAM oder VRAM.<\/p>\n<p>Neu bei diesem Tool? Beginnen Sie mit der <a href='\/de\/how-to-install-ollama-2026\/'>Installationsanleitung f\u00fcr Ollama<\/a>, pr\u00fcfen Sie die Hardware-Anforderungen in den <a href='\/de\/ollama-system-requirements-2026\/'>Ollama-Systemvoraussetzungen<\/a>, oder die Gr\u00f6\u00dfe eines Modells mit dem <a href='\/de\/llm-vram-calculator\/'>VRAM-Rechner<\/a>.<\/p>","protected":false},"excerpt":{"rendered":"<p>Running Ollama in Docker keeps models and dependencies contained and makes the setup portable between machines. Here is the working configuration \u2014 including GPU passthrough and persistent storage.<\/p>","protected":false},"author":1,"featured_media":1785,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[5],"tags":[1048,756,256,259,1047],"class_list":["post-1750","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-tools","tag-docker","tag-gpu","tag-local-llm","tag-ollama","tag-self-hosting"],"_links":{"self":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts\/1750","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/comments?post=1750"}],"version-history":[{"count":2,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts\/1750\/revisions"}],"predecessor-version":[{"id":1860,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts\/1750\/revisions\/1860"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/media\/1785"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/media?parent=1750"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/categories?post=1750"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/tags?post=1750"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}