{"id":2535,"date":"2026-09-01T20:12:15","date_gmt":"2026-09-01T20:12:15","guid":{"rendered":"https:\/\/convly.ai\/?p=2535"},"modified":"2026-09-01T20:12:15","modified_gmt":"2026-09-01T20:12:15","slug":"ollama-windows","status":"publish","type":"post","link":"https:\/\/convly.ai\/de\/ollama-windows\/","title":{"rendered":"Ollama f\u00fcr Windows: Installationsanleitung und Einrichtungsanweisungen"},"content":{"rendered":"<div class=\"convly-tldr\"><strong>Zusammenfassung:<\/strong><\/p>\n<ul>\n<li>Laden Sie den offiziellen Installer von <code>ollama.com\/download<\/code>herunter, f\u00fchren Sie ihn aus, und Ollama wird als Hintergrunddienst installiert<\/li>\n<li>Erfordert Windows 10 oder neuer sowie mindestens 8 GB Arbeitsspeicher; NVIDIA- bzw. AMD-GPUs werden automatisch zur Beschleunigung erkannt<\/li>\n<li>F\u00fchren Sie Modelle mit <code>ollama run &lt;modell&gt;<\/code> \u00fcber Eingabeaufforderung oder PowerShell aus \u2013 keine zus\u00e4tzliche Konfiguration erforderlich<\/li>\n<li>Modelle werden standardm\u00e4\u00dfig in <code>%USERPROFILE%.ollamamodels<\/code> installiert; Pfad\u00e4nderung \u00fcber die Umgebungsvariable <code>OLLAMA_MODELS<\/code> m\u00f6glich<\/li>\n<\/ul>\n<\/div>\n<p>Ollama on Windows is a native application that runs large language models locally without Docker or WSL2. The Windows installer sets up Ollama as a system service that starts automatically and provides GPU acceleration through DirectML and CUDA. Installation takes under two minutes, and you can run models like Llama 3.3 70B or Mistral 7B immediately from the command line.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_86 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a9756389e8e7\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Umschalten<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a9756389e8e7\"  aria-label=\"Umschalten\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/de\/ollama-windows\/#System_Requirements_for_Ollama_on_Windows\" >Systemvoraussetzungen f\u00fcr Ollama unter Windows<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/de\/ollama-windows\/#Installing_Ollama_on_Windows\" >Installation von Ollama unter Windows<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/de\/ollama-windows\/#GPU_Support_and_Detection\" >GPU-Unterst\u00fctzung und -Erkennung<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/de\/ollama-windows\/#Running_Your_First_Model\" >Ihr erstes Modell ausf\u00fchren<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/de\/ollama-windows\/#Configuration_and_Environment_Variables\" >Konfiguration und Umgebungsvariablen<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/de\/ollama-windows\/#Performance_Tuning\" >Leistungsoptimierung<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/de\/ollama-windows\/#Integrating_with_Applications\" >Integration in Anwendungen<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/de\/ollama-windows\/#Frequently_Asked_Questions\" >H\u00e4ufig gestellte Fragen<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-9\" href=\"https:\/\/convly.ai\/de\/ollama-windows\/#Next_Steps\" >N\u00e4chste Schritte<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"System_Requirements_for_Ollama_on_Windows\"><\/span>Systemvoraussetzungen f\u00fcr Ollama unter Windows<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Ollama erfordert Windows 10 (Build 1903 oder neuer) oder Windows 11. Die Mindest-Hardwareanforderungen lauten:<\/p>\n<table>\n<thead>\n<tr>\n<th>Komponente<\/th>\n<th>Mindestanforderung<\/th>\n<th>Empfohlen<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Betriebssystem<\/td>\n<td>Windows 10 (1903+)<\/td>\n<td>Windows 11<\/td>\n<\/tr>\n<tr>\n<td>Arbeitsspeicher (RAM)<\/td>\n<td>8 GB<\/td>\n<td>16 GB oder mehr<\/td>\n<\/tr>\n<tr>\n<td>Festplattenspeicher<\/td>\n<td>10 GB freier Speicherplatz<\/td>\n<td>50+ GB f\u00fcr mehrere Modelle<\/td>\n<\/tr>\n<tr>\n<td>GPU (optional)<\/td>\n<td>NVIDIA GTX 1050 oder AMD-\u00c4quivalent<\/td>\n<td>NVIDIA RTX 3060 mit 12 GB VRAM oder besser<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Die GPU-Beschleunigung funktioniert mit NVIDIA-GPUs (CUDA 11.8 oder neuer) und neueren AMD-GPUs (\u00fcber ROCm unter Windows). Der Installer enth\u00e4lt alle erforderlichen GPU-Bibliotheken; eine separate CUDA-Installation ist daher nicht notwendig. Ohne GPU wechselt Ollama automatisch zur CPU-Inferenz, die zwar 5- bis 10-mal langsamer ist, aber f\u00fcr kleinere Modelle durchaus funktionsf\u00e4hig bleibt.<\/p>\n<p>Die tats\u00e4chlichen RAM- oder VRAM-Anforderungen h\u00e4ngen von der Modellgr\u00f6\u00dfe ab. Beispielsweise ben\u00f6tigt <a href=\"https:\/\/convly.ai\/de\/models\/\">Mistral 7B<\/a> bei 4-Bit-Quantisierung etwa 4,5 GB VRAM, w\u00e4hrend Llama 3.3 70B rund 40 GB erfordert. Pr\u00fcfen Sie die <a href=\"https:\/\/convly.ai\/de\/llm-vram-calculator\/\">VRAM-Rechner<\/a> , um die Anforderungen eines beliebigen Modells vor dem Download abzusch\u00e4tzen.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Installing_Ollama_on_Windows\"><\/span>Installation von Ollama unter Windows<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Der offizielle Windows-Installer ist eine einzelne ausf\u00fchrbare Datei, die s\u00e4mtliche Abh\u00e4ngigkeiten enth\u00e4lt:<\/p>\n<ol>\n<li>Herunterladen <code>OllamaSetup.exe<\/code> von <a href=\"https:\/\/ollama.com\/download\" rel=\"noopener\" target=\"_blank\">ollama.com\/download<\/a><\/li>\n<li>F\u00fchren Sie den Installer aus \u2013 Administratorrechte sind erforderlich<\/li>\n<li>Akzeptieren Sie die Lizenzvereinbarung und klicken Sie auf \u201eInstallieren\u201c (Standardzielort ist <code>C:\\Program Files\\Ollama<\/code>)<\/li>\n<li>Der Installer ben\u00f6tigt 30\u201360 Sekunden und startet den Ollama-Dienst automatisch<\/li>\n<\/ol>\n<p>\u00d6ffnen Sie nach der Installation die Eingabeaufforderung oder PowerShell und \u00fcberpr\u00fcfen Sie die Installation mit:<\/p>\n<pre><code>ollama --version<\/code><\/pre>\n<p>Sie sollten eine Ausgabe wie <code>ollama version 0.x.x<\/code>sehen. Der Ollama-Dienst l\u00e4uft im Hintergrund \u2013 sobald er aktiv ist, erscheint ein Ollama-Symbol in der Taskleiste.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"GPU_Support_and_Detection\"><\/span>GPU-Unterst\u00fctzung und -Erkennung<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Ollama erkennt und nutzt unter Windows automatisch verf\u00fcgbare GPUs. Um zu pr\u00fcfen, ob die GPU-Beschleunigung funktioniert, geben Sie ein:<\/p>\n<pre><code>ollama run llama3.3:70b \"test\"<\/code><\/pre>\n<p>W\u00e4hrend das Modell geladen wird, beobachten Sie den Task-Manager (Registerkarte \u201eLeistung\u201c). Wenn eine GPU-Auslastung unter \u201eGPU 0\u201c oder \u201eGPU 1\u201c angezeigt wird, ist die Beschleunigung aktiv. Beim ersten Aufruf wird das Modell (5\u201340 GB je nach Gr\u00f6\u00dfe) nach <code>%USERPROFILE%.ollamamodels<\/code>heruntergeladen \u2013 bei langsamen Internetverbindungen kann dies mehrere Minuten dauern.<\/p>\n<p>NVIDIA-Nutzer mit RTX-3060- oder neueren GPUs erzielen die beste Leistung dank 12+ GB VRAM und Optimierungen f\u00fcr die Ampere-\/Ada-Architektur. Die AMD-GPU-Unterst\u00fctzung unter Windows verbessert sich stetig, liegt aber nach wie vor hinter NVIDIA zur\u00fcck \u2013 erwarten Sie auf vergleichbarer AMD-Hardware eine um 20\u201330 % langsamere Inferenz. Intel Arc-GPUs werden zum Stand September 2026 offiziell nicht unterst\u00fctzt.<\/p>\n<p>Falls Ollama Ihre GPU nicht erkennt, stellen Sie sicher, dass Ihre Grafiktreiber aktuell sind (NVIDIA: 537.13 oder neuer, AMD: Adrenalin 23.11 oder neuer). Ollamas Fehlermeldungen geben in der Regel an, ob die GPU aufgrund unzureichender VRAM oder fehlender Treiber \u00fcbersprungen wurde.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Running_Your_First_Model\"><\/span>Ihr erstes Modell ausf\u00fchren<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Der <code>ollama run<\/code> Der Befehl l\u00e4dt, l\u00e4dt in den Speicher und startet eine interaktive Sitzung mit einem Modell:<\/p>\n<pre><code>ollama run phi4<\/code><\/pre>\n<p>This downloads Microsoft&#8217;s Phi-4 (approximately 9 GB VRAM at 4-bit quantization) and opens a chat prompt. Type your question, press Enter, and the model responds locally. Exit with <code>\/bye<\/code> oder Strg+C.<\/p>\n<p>G\u00e4ngige Modelle f\u00fcr Windows-Hardware zum Ausprobieren:<\/p>\n<table>\n<thead>\n<tr>\n<th>Modell<\/th>\n<th>VRAM (4-Bit)<\/th>\n<th>Am besten geeignet f\u00fcr<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Mistral 7B<\/td>\n<td>~4,5 GB<\/td>\n<td>Allgemeine Aufgaben, schnelle Antworten<\/td>\n<\/tr>\n<tr>\n<td>Llama 3.1 8B<\/td>\n<td>~5 GB<\/td>\n<td>Ausgewogene Qualit\u00e4t und Geschwindigkeit<\/td>\n<\/tr>\n<tr>\n<td>Phi-4<\/td>\n<td>~9 GB<\/td>\n<td>Schlussfolgerungsf\u00e4higkeit, kompakte Gr\u00f6\u00dfe<\/td>\n<\/tr>\n<tr>\n<td>Llama 3.3 70B<\/td>\n<td>~40 GB<\/td>\n<td>High-End-GPUs, beste Qualit\u00e4t<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Durchsuchen Sie die verf\u00fcgbaren Modelle unter <a href=\"https:\/\/convly.ai\/de\/ollama-models-list-2026\/\">Ollama-Modellliste<\/a> oder durchsuchen Sie die Bibliothek mit <code>ollama list<\/code> nach dem Herunterladen mindestens eines Modells.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Configuration_and_Environment_Variables\"><\/span>Konfiguration und Umgebungsvariablen<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Ollama liest die Konfiguration aus Windows-Umgebungsvariablen ein. Legen Sie diese in den Systemeigenschaften \u2192 Umgebungsvariablen oder in PowerShell mit <code>$env:VARIABLE_NAME<\/code>.<\/p>\n<p>Wichtige Variablen:<\/p>\n<ul>\n<li><strong>OLLAMA_MODELS<\/strong>: Verzeichnis f\u00fcr die Modell-Speicherung (Standard: <code>%USERPROFILE%.ollamamodels<\/code>). \u00c4ndern Sie diesen Wert, falls Ihr Laufwerk C: nur begrenzt Speicherplatz bietet.<\/li>\n<li><strong>OLLAMA_HOST<\/strong>: Serveradresse (Standard: <code>127.0.0.1:11434<\/code>). Legen Sie diesen Wert auf <code>0.0.0.0:11434<\/code> fest, um Netzwerkverbindungen zu akzeptieren.<\/li>\n<li><strong>OLLAMA_NUM_PARALLEL<\/strong>: Anzahl gleichzeitiger Anfragen (Standard: 1). Erh\u00f6hen Sie diesen Wert bei der Bedienung mehrerer Clients.<\/li>\n<li><strong>OLLAMA_MAX_LOADED_MODELS<\/strong>: Anzahl der Modelle, die im VRAM gehalten werden (Standard: 1). Legen Sie diesen Wert auf 2 oder h\u00f6her fest, wenn Sie \u00fcber 24+ GB VRAM verf\u00fcgen und sofort zwischen Modellen wechseln m\u00f6chten.<\/li>\n<\/ul>\n<p>Nach \u00c4nderung der Umgebungsvariablen starten Sie den Ollama-Dienst \u00fcber die Dienste (Win+R, eingeben von <code>services.msc<\/code>, Ollama finden und mit der rechten Maustaste \u201eNeu starten\u201c w\u00e4hlen) neu oder f\u00fchren Sie einen Neustart durch.<\/p>\n<p>Um Modelle auf ein anderes Laufwerk zu verschieben, legen Sie OLLAMA_MODELS fest und starten Sie den Dienst anschlie\u00dfend neu. Vorhandene Modelle m\u00fcssen erneut heruntergeladen werden \u2013 Ollama migriert sie nicht automatisch.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Performance_Tuning\"><\/span>Leistungsoptimierung<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Die Inferenzgeschwindigkeit h\u00e4ngt von der VRAM-Kapazit\u00e4t, der Modellgr\u00f6\u00dfe und dem Quantisierungsgrad ab. Ein Modell mit 7 Milliarden Parametern bei 4-Bit-Quantisierung generiert etwa 30\u201360 Token pro Sekunde auf einer RTX 3060, w\u00e4hrend 70-Milliarden-Parameter-Modelle auf nur 3\u20138 Token pro Sekunde fallen, es sei denn, Sie verf\u00fcgen \u00fcber 48+ GB VRAM verteilt auf mehrere GPUs.<\/p>\n<p>Multi-GPU-Konfigurationen funktionieren automatisch \u2013 Ollama verteilt die Modellschichten auf alle erkannten GPUs. Beispielsweise k\u00f6nnen zwei RTX 3090 (jeweils 24 GB) das Llama-3.3-70B-Modell mit akzeptabler Geschwindigkeit ausf\u00fchren, w\u00e4hrend eine einzelne RTX 3090 Teile der Schichten in den Systemspeicher auslagern m\u00fcsste und dadurch stark verlangsamt w\u00fcrde.<\/p>\n<p>Falls die Leistung langsamer als erwartet ist:<\/p>\n<ul>\n<li>\u00dcberpr\u00fcfen Sie den Task-Manager w\u00e4hrend der Inferenz \u2013 eine CPU-Auslastung \u00fcber 30 % deutet darauf hin, dass das Modell teilweise im Systemspeicher l\u00e4uft, weil nicht gen\u00fcgend VRAM zur Verf\u00fcgung steht<\/li>\n<li>Versuchen Sie eine geringere Quantisierung (z. B. <code>ollama pull mistral:7b-instruct-q4_K_M<\/code> anstelle der Standard-Q8-Quantisierung)<\/li>\n<li>Schlie\u00dfen Sie andere GPU-intensiv nutzende Anwendungen (Browser mit Hardwarebeschleunigung, Spiele, Videobearbeitungsprogramme)<\/li>\n<li>Aktualisieren Sie Ihre GPU-Treiber \u2013 neuere NVIDIA-Treiber verbessern die Inferenzgeschwindigkeit um 5\u201310 % gegen\u00fcber Treibern, die sechs Monate alt sind<\/li>\n<\/ul>\n<p>F\u00fcr Hardware-Upgrades konsultieren Sie den <a href=\"https:\/\/convly.ai\/de\/best-gpus-for-local-llms-2026\/\">beste GPUs f\u00fcr lokale LLMs<\/a> Leitfaden zum Vergleich von Preis-Leistungs-Verh\u00e4ltnissen zwischen NVIDIA- und AMD-Optionen.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Integrating_with_Applications\"><\/span>Integration in Anwendungen<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Ollama stellt eine REST-API unter <code>localhost:11434<\/code> zur Verf\u00fcgung, die mit der OpenAI-API-Struktur kompatibel ist. Anwendungen, die OpenAI-kompatible Endpunkte unterst\u00fctzen, k\u00f6nnen problemlos auf Ollama umgestellt werden \u2013 daf\u00fcr sind nur minimale \u00c4nderungen erforderlich.<\/p>\n<p>Beispielhafter curl-Befehl zur Textgenerierung:<\/p>\n<pre><code>curl http:\/\/localhost:11434\/api\/generate -d '{\n  \"model\": \"mistral\",\n  \"prompt\": \"Erkl\u00e4ren Sie Docker in einem Satz\"\n}'<\/code><\/pre>\n<p>Beliebte Integrationen umfassen Open WebUI (Web-Oberfl\u00e4che), Continue.dev (VS Code-Erweiterung) und LangChain (Python). Der Ollama-Dienst muss f\u00fcr API-Aufrufe ausgef\u00fchrt werden \u2013 standardm\u00e4\u00dfig startet er beim Systemstart automatisch.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_Asked_Questions\"><\/span>H\u00e4ufig gestellte Fragen<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Ben\u00f6tigt Ollama unter Windows WSL2 oder Docker?<\/h3>\n<p>Nein. Der Windows-Installer ist eine native Anwendung, die Ollama als Windows-Dienst ohne Virtualisierung oder Container ausf\u00fchrt. Fr\u00fchere Versionen erforderten Docker, doch mit der nativen Windows-Version, die Ende 2024 ver\u00f6ffentlicht wurde, entfiel diese Abh\u00e4ngigkeit. Falls Sie Ollama vor November 2024 installiert haben, deinstallieren Sie bitte die Docker-Version und laden Sie den aktuellen nativen Installer herunter.<\/p>\n<h3>Kann ich Ollama offline nutzen, nachdem ich Modelle heruntergeladen habe?<\/h3>\n<p>Ja. Sobald ein Modell mit <code>ollama pull &lt;Modell&gt;<\/code>heruntergeladen wurde, wird es lokal gespeichert und l\u00e4uft ohne Internetzugang. Die einzige Netzwerkverbindung ist f\u00fcr den ersten Download erforderlich \u2013 Modelle umfassen dabei 2 GB (kleine 7B-Modelle) bis \u00fcber 80 GB (gro\u00dfe 70B+-Modelle). Nach dem Download k\u00f6nnen Sie die Netzwerkverbindung trennen; Ollama funktioniert dann weiterhin normal.<\/p>\n<h3>Wie hoch sind die Kosten f\u00fcr den Betrieb von Ollama-Modellen im Vergleich zu APIs?<\/h3>\n<p>Ollama is free\u2014you pay only for hardware and electricity. Compare this to API costs: Claude Sonnet 5 charges $2.00 per million input tokens, so 10 million tokens (roughly 7.5 million words) costs $20. A self-hosted setup breaks even quickly if you process significant volume. Use the <a href=\"https:\/\/convly.ai\/de\/self-hosting-vs-api-calculator\/\">Selbsthosting vs. API-Rechner<\/a> Kostenrechner, um Ihren Break-even-Punkt basierend auf Ihrem erwarteten Nutzungsvolumen abzusch\u00e4tzen.<\/p>\n<h3>Welche Modelle laufen am besten auf Consumer-GPUs?<\/h3>\n<p>F\u00fcr GPUs mit 8\u201312 GB VRAM (RTX 3060, 4060 Ti) bieten Mistral 7B (~4,5 GB bei 4-Bit), Llama 3.1 8B (~5 GB) und Phi-4 (~9 GB) ein starkes Verh\u00e4ltnis von Qualit\u00e4t zu Leistung. Bei 16\u201324 GB VRAM (RTX 3090, 4090) werden auch Mistral NeMo 12B (~7,5 GB) und sogar Llama 3.3 70B (~40 GB bei aggressiver Quantisierung oder Offloading) praktikabel. Eine vollst\u00e4ndige Liste finden Sie unter <a href=\"https:\/\/convly.ai\/de\/vram-requirements-every-major-llm-2026\/\">VRAM-Anforderungen nach Modell<\/a> .<\/p>\n<h3>Kann Ollama sowohl NVIDIA- als auch AMD-GPUs gleichzeitig nutzen?<\/h3>\n<p>Nein. Ollama verwendet entweder CUDA (NVIDIA) oder ROCm (AMD), je nachdem, welche Technologie zuerst erkannt wird; es ist jedoch nicht m\u00f6glich, verschiedene GPU-Backends innerhalb einer Sitzung zu mischen. Falls Sie sowohl NVIDIA- als auch AMD-GPUs besitzen, priorisiert Ollama NVIDIA-GPUs. Die Multi-GPU-Unterst\u00fctzung funktioniert nur, wenn alle GPUs denselben Treiberstack verwenden \u2013 also entweder zwei NVIDIA-Karten oder zwei AMD-Karten, nicht jeweils eine.<\/p>\n<h3>How do I uninstall Ollama from Windows?<\/h3>\n<p>\u00d6ffnen Sie Einstellungen \u2192 Apps \u2192 Installierte Apps, suchen Sie nach Ollama und klicken Sie auf \u201eDeinstallieren\u201c. Dadurch wird die Anwendung und der Dienst entfernt, die Modelle bleiben jedoch im Verzeichnis <code>%USERPROFILE%.ollama<\/code>erhalten. L\u00f6schen Sie diesen Ordner manuell, um Speicherplatz freizugeben. Falls der Dienst w\u00e4hrend der Deinstallation nicht beendet wird, \u00f6ffnen Sie den Task-Manager, suchen Sie unter \u201eHintergrundprozesse\u201c nach OllamaService.exe und beenden Sie ihn, bevor Sie den Vorgang erneut versuchen.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Next_Steps\"><\/span>N\u00e4chste Schritte<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Nach der Installation von Ollama unter Windows erkunden Sie die vollst\u00e4ndige Modellbibliothek unter <a href=\"https:\/\/convly.ai\/de\/what-is-ollama-complete-guide-2026\/\">Kompletter Ollama-Leitfaden<\/a> , um zu verstehen, wie Modellauswahl, Quantisierung und Kontextfenster die Qualit\u00e4t beeinflussen. F\u00fcr Produktionsworkloads berechnen Sie die laufenden API-Kosten im Vergleich zum Self-Hosting mithilfe des <a href=\"https:\/\/convly.ai\/de\/ai-api-cost-calculator\/\">API-Kostenrechner<\/a> Kostenrechners, um zu entscheiden, ob lokale Inferenz oder Cloud-APIs besser zu Ihrem Budget und Ihren Skalierungsanforderungen passen.<\/p>","protected":false},"excerpt":{"rendered":"<p>TL;DR:Download the official installer from ollama.com\/download, run it, and Ollama installs as a background service Requires Windows 10+ and 8 [\u2026]<\/p>\n","protected":false},"author":1,"featured_media":2536,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2535","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts\/2535","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/comments?post=2535"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts\/2535\/revisions"}],"predecessor-version":[{"id":2537,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts\/2535\/revisions\/2537"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/media\/2536"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/media?parent=2535"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/categories?post=2535"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/tags?post=2535"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}