{"id":790,"date":"2026-06-06T01:59:14","date_gmt":"2026-06-06T01:59:14","guid":{"rendered":"https:\/\/convly.ai\/ollama-system-requirements-2026\/"},"modified":"2026-08-01T06:47:14","modified_gmt":"2026-08-01T06:47:14","slug":"ollama-system-requirements-2026","status":"publish","type":"post","link":"https:\/\/convly.ai\/de\/ollama-system-requirements-2026\/","title":{"rendered":"Systemanforderungen f\u00fcr Ollama im Jahr 2026: Wie viel RAM und VRAM ben\u00f6tigen Sie wirklich?"},"content":{"rendered":"<p>Der h\u00e4ufigste Grund daf\u00fcr, dass ein Modell in Ollama nicht ausgef\u00fchrt wird, ist kein Softwarefehler \u2013 vielmehr ist das Modell schlicht gr\u00f6\u00dfer als Ihr verf\u00fcgbare Speicherkapazit\u00e4t. Ollama selbst ist \u00e4u\u00dferst ressourcenschonend; die Modelle sind es, die hohe Hardwareanforderungen stellen. Dieser Leitfaden liefert Ihnen die realistischen RAM- und VRAM-Werte f\u00fcr jede Modellgr\u00f6\u00dfe im Jahr 2026 sowie eine einfache Formel, anhand derer Sie sofort erkennen k\u00f6nnen, ob ein Modell auf Ihrem System Platz findet. <em>vor<\/em> Sie zehn Minuten damit verbringen, etwas herunterzuladen, das sich anschlie\u00dfend nicht laden l\u00e4sst.<\/p>\n<p>Falls Sie Ollama noch nicht installiert haben, beginnen Sie mit unserem <a href=\"https:\/\/convly.ai\/de\/how-to-install-ollama-2026\/\">Schritt-f\u00fcr-Schritt-Installationsanleitung<\/a>.<\/p>\n<div class=\"convly-tldr\">\n<h3>Wichtigste Erkenntnisse<\/h3>\n<ul>\n<li><strong>Faustregel:<\/strong> Ein quantisiertes (Q4) Modell ben\u00f6tigt etwa <strong>0,6 GB Speicher pro Milliarde Parameter<\/strong>, zuz\u00fcglich Puffer f\u00fcr den Kontext.<\/li>\n<li><strong>Modelle mit 2\u20133 Milliarden Parametern:<\/strong> Laufen auf der CPU mit ca. 2\u20134 GB RAM \u2013 problemlos auf einem einfachen Laptop.<\/li>\n<li><strong>Modelle mit 7\u20138 Milliarden Parametern:<\/strong> Ca. 6\u20138 GB RAM\/VRAM \u2013 der ideale Kompromiss f\u00fcr die meisten Laptops.<\/li>\n<li><strong>Modelle mit 27\u201334 Milliarden Parametern:<\/strong> Ca. 20\u201324 GB VRAM \u2013 erfordern eine High-End-GPU oder Apple Silicon mit gro\u00dfem vereinigtem Arbeitsspeicher.<\/li>\n<li><strong>Modelle mit 70 Milliarden oder mehr Parametern:<\/strong> Mindestens 40 GB \u2013 eine Workstation-GPU, ein Multi-GPU-System oder mindestens 64 GB vereinigter Arbeitsspeicher.<\/li>\n<\/ul>\n<\/div>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_85 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a74663fdd99d\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Umschalten<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a74663fdd99d\"  aria-label=\"Umschalten\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/de\/ollama-system-requirements-2026\/#Why_memory_is_the_whole_story\" >Warum der Speicher die entscheidende Gr\u00f6\u00dfe ist<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/de\/ollama-system-requirements-2026\/#The_simple_formula\" >Die einfache Formel<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/de\/ollama-system-requirements-2026\/#Requirements_by_model_size\" >Anforderungen nach Modellgr\u00f6\u00dfe<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/de\/ollama-system-requirements-2026\/#GPU_vs_CPU_vs_Apple_Silicon\" >GPU vs. CPU vs. Apple Silicon<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/de\/ollama-system-requirements-2026\/#How_to_make_a_big_model_fit\" >Wie Sie ein gro\u00dfes Modell trotzdem zum Laufen bringen<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/de\/ollama-system-requirements-2026\/#Storage_and_software_prerequisites_people_forget\" >Speicher- und Softwarevoraussetzungen, an die man oft nicht denkt<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/de\/ollama-system-requirements-2026\/#FAQ\" >H\u00e4ufig gestellte Fragen (FAQ)<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/de\/ollama-system-requirements-2026\/#Bottom_line\" >Fazit<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-9\" href=\"https:\/\/convly.ai\/de\/ollama-system-requirements-2026\/#Related_articles\" >Verwandte Artikel<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"Why_memory_is_the_whole_story\"><\/span>Warum der Speicher die entscheidende Gr\u00f6\u00dfe ist<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Um Text zu generieren, m\u00fcssen die Gewichte eines Modells im schnellen Speicher residieren \u2013 entweder in der VRAM Ihrer GPU oder im Systemspeicher (RAM), falls Sie auf der CPU ausf\u00fchren. Passt das Modell nicht vollst\u00e4ndig hinein, tritt einer von zwei F\u00e4llen ein: Ollama verschiebt einen Teil des Modells in langsameren Speicher (wodurch die Leistung drastisch einbricht), oder es lehnt das Laden mit einer \u201eOut-of-Memory\u201c-Fehlermeldung ab. Alle anderen Faktoren \u2013 CPU-Taktfrequenz, Festplattengeschwindigkeit, Betriebssystem \u2013 spielen im Vergleich zur Verf\u00fcgbarkeit des richtigen Speichers eine deutlich geringere Rolle.<\/p>\n<p>Zwei Faktoren bestimmen die Speicheranforderung:<\/p>\n<ol>\n<li><strong>Parameteranzahl<\/strong> \u2013 Ein 7B-Modell besitzt 7 Milliarden Gewichte; ein 70B-Modell hat zehnmal so viele.<\/li>\n<li><strong>Quantisierung<\/strong> \u2013 Ollama nutzt komprimierte GGUF-Gewichte. Eine 4-Bit-Quantisierung (Q4) halbiert den Speicherbedarf nahezu gegen\u00fcber einer 8-Bit-Darstellung, ohne nennenswerten Qualit\u00e4tsverlust \u2013 daher stellt Q4 den Standard-\u201eSweet Spot\u201c dar.<\/li>\n<\/ol>\n<h2><span class=\"ez-toc-section\" id=\"The_simple_formula\"><\/span>Die einfache Formel<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>F\u00fcr ein 4-Bit-quantisiertes Modell \u2013 also das Format, das Ollama standardm\u00e4\u00dfig herunterl\u00e4dt \u2013 gilt folgende Absch\u00e4tzung:<\/p>\n<blockquote>\n<p><strong>Ben\u00f6tigter Speicher \u2248 (Parameteranzahl in Milliarden) \u00d7 0,6 GB + Kontext-Puffer<\/strong><\/p>\n<\/blockquote>\n<p>Ein 7B-Modell ben\u00f6tigt demnach etwa 4\u20135 GB, ein 13B-Modell rund 8 GB, ein 27B-Modell ca. 18\u201320 GB und ein 70B-Modell mindestens 40 GB. Hinzu kommt ein gewisser Puffer f\u00fcr den sogenannten KV-Cache, dessen Gr\u00f6\u00dfe mit der L\u00e4nge Ihrer Konversation zunimmt. Behalten Sie stets einige Gigabyte freien Speicher f\u00fcr Ihr Betriebssystem vor.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Requirements_by_model_size\"><\/span>Anforderungen nach Modellgr\u00f6\u00dfe<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<table class=\"convly-vs\">\n<thead>\n<tr>\n<th>Modellgr\u00f6\u00dfe<\/th>\n<th>Speicherbedarf (Q4)<\/th>\n<th>Ausf\u00fchrbar auf<\/th>\n<th>Beispielmodelle<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>2\u20133 Mrd.<\/td>\n<td>ca. 2\u20134 GB<\/td>\n<td>CPU \/ beliebiger Laptop<\/td>\n<td>Gemma2 2B, Phi-4 mini<\/td>\n<\/tr>\n<tr>\n<td>7\u20138 Mrd.<\/td>\n<td>ca. 6\u20138 GB<\/td>\n<td>Einstiegs-GPU \/ Laptop mit 16 GB<\/td>\n<td>DeepSeek-R1 7B, Llama 3.3 8B<\/td>\n<\/tr>\n<tr>\n<td>13\u201314 Mrd.<\/td>\n<td>ca. 10\u201312 GB<\/td>\n<td>Mittlere GPU<\/td>\n<td>Phi-4, mittlere Qwen-Version<\/td>\n<\/tr>\n<tr>\n<td>27\u201334 Mrd.<\/td>\n<td>ca. 18\u201324 GB<\/td>\n<td>High-End-GPU \/ Apple Silicon<\/td>\n<td>Gemma 4 26B, Qwen 3.6 27B<\/td>\n<\/tr>\n<tr>\n<td>70 Mrd.<\/td>\n<td>ca. 40\u201348 GB<\/td>\n<td>Workstation \/ Multi-GPU-System<\/td>\n<td>Llama-70B-Klasse<\/td>\n<\/tr>\n<tr>\n<td>200 Mrd. + (MoE)<\/td>\n<td>100 GB +<\/td>\n<td>Server \/ System mit sehr gro\u00dfem einheitlichem Arbeitsspeicher<\/td>\n<td>Qwen3 235B-A22B<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>F\u00fcr eine detailliertere Aufschl\u00fcsselung nach konkreten Modellen siehe unseren Leitfaden zu <a href=\"https:\/\/convly.ai\/de\/vram-requirements-every-major-llm-2026\/\">VRAM-Anforderungen f\u00fcr alle wichtigen Sprachmodelle<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"GPU_vs_CPU_vs_Apple_Silicon\"><\/span>GPU vs. CPU vs. Apple Silicon<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p><strong>NVIDIA-GPU<\/strong> \u2014 der Goldstandard. Die VRAM-Kapazit\u00e4t ist die harte Grenze: Das Modell muss vollst\u00e4ndig in den Speicher Ihrer Grafikkarte passen, um schnell zu laufen. Eine 24-GB-Karte (RTX 4090\/5090) bew\u00e4ltigt problemlos Modelle mit ca. 27\u201334 Mrd. Parametern.<\/p>\n<p><strong>Nur CPU<\/strong> \u2014 funktioniert f\u00fcr kleine Modelle (2\u20138 Mrd.), ist jedoch deutlich langsamer, da die Bandbreite des Systemspeichers einer GPU nicht vergleichbar ist. F\u00fcr leichte Aufgaben auf einem Laptop ohne dedizierte GPU ist dies durchaus ausreichend.<\/p>\n<p><strong>Apple Silicon<\/strong> \u2014 ein Sonderfall \u2013 und zwar ein sehr guter. Da Macs einen <em>vereinigter Arbeitsspeicher<\/em> zwischen CPU und GPU gemeinsam genutzten Speicher verwenden, kann ein Mac mit 64 GB Modelle laden, f\u00fcr die ansonsten ein teures Multi-GPU-PC erforderlich w\u00e4re. Seit Ollama v0.19 (M\u00e4rz 2026) mit dem MLX-Backend auch deutlich beschleunigt wurde, z\u00e4hlt ein Mac mit viel Arbeitsspeicher heute zu den besten Einzelger\u00e4ten f\u00fcr lokale LLMs am Markt. Wie sich das im Vergleich zu einer dedizierten GPU schl\u00e4gt, erfahren Sie in <a href=\"https:\/\/convly.ai\/de\/amd-strix-halo-vs-apple-m4-pro\/\">Strix Halo vs. Apple M4 Pro<\/a>.<\/p>\n<p><strong>AMD-GPU<\/strong> \u2014 wird \u00fcber ROCm unterst\u00fctzt. F\u00fcr Inferenz-Aufgaben funktioniert sie 2026 gut; aktuelle Informationen finden Sie in unserem <a href=\"https:\/\/convly.ai\/de\/amd-rocm-vs-nvidia-cuda-2026\/\">Vergleich ROCm vs. CUDA<\/a> Ratgeber zu AMD-GPUs.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"How_to_make_a_big_model_fit\"><\/span>Wie Sie ein gro\u00dfes Modell trotzdem zum Laufen bringen<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Falls das gew\u00fcnschte Modell knapp \u00fcber Ihrer verf\u00fcgbaren Speicherkapazit\u00e4t liegt, gibt es noch Alternativen, bevor Sie aufgeben m\u00fcssen:<\/p>\n<ul>\n<li><strong>Verwenden Sie eine st\u00e4rker quantisierte Variante<\/strong> \u2014 laden Sie stattdessen eine <code>q4<\/code> oder sogar <code>q3<\/code> -Variante statt einer <code>q8<\/code>-Version. Dabei opfern Sie geringf\u00fcgig an Qualit\u00e4t, sparen aber erheblich Speicherplatz.<\/li>\n<li><strong>W\u00e4hlen Sie ein kleineres Modell<\/strong> \u2014 ein gut ausgew\u00e4hltes 8-Mrd.-Modell \u00fcbertrifft oft ein kaum lauff\u00e4higes, ausgelagertes 27-Mrd.-Modell.<\/li>\n<li><strong>Verk\u00fcrzen Sie das Kontextfenster<\/strong> \u2014 ein kleineres Kontextfenster ben\u00f6tigt weniger Speicher f\u00fcr den KV-Cache.<\/li>\n<li><strong>Schlie\u00dfen Sie andere Anwendungen<\/strong> \u2014 bei CPU- oder einheitlichem Speichersystem ist freier Arbeitsspeicher Ihr Budget.<\/li>\n<\/ul>\n<p>Um ein Modell passend zu Ihrer Hardware auszuw\u00e4hlen, lesen Sie den Abschnitt <a href=\"https:\/\/convly.ai\/de\/best-local-llms-to-run-on-ollama-2026\/\">Beste lokale gro\u00dfe Sprachmodelle f\u00fcr den Betrieb mit Ollama<\/a>.<\/p>\n<p><!--ai-enriched--><\/p>\n<h2><span class=\"ez-toc-section\" id=\"Storage_and_software_prerequisites_people_forget\"><\/span>Speicher- und Softwarevoraussetzungen, an die man oft nicht denkt<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>RAM und VRAM stehen im Fokus, doch zwei weniger offensichtliche Voraussetzungen f\u00fchren h\u00e4ufiger zu Problemen bei der Erstinstallation als alles andere: ausreichender Festplattenspeicher und der zugrundeliegende Softwarestack. Wer hier Fehler macht, sieht entweder eine fehlgeschlagene Ollama-Installation oder einen Abbruch w\u00e4hrend des Modell-Downloads.<\/p>\n<p><strong>Festplattenspeicher.<\/strong> Die Ollama-Bin\u00e4rdatei selbst ist klein \u2013 rechnen Sie mit etwa <strong>4&nbsp;GB<\/strong> f\u00fcr die Installation. Die Modelle sind es jedoch, die Ihren Speicherplatz verschlingen. Jedes Modell wird einmal heruntergeladen und auf der Festplatte zwischengespeichert, bevor es zur Laufzeit in den Arbeitsspeicher geladen wird. Daher ben\u00f6tigen Sie gen\u00fcgend Platz f\u00fcr die vollst\u00e4ndigen Gewichte zus\u00e4tzlich zu Ihrem verf\u00fcgbaren freien Speicher. Als grobe Orientierung bei \u00fcblicher 4-Bit-Quantisierung gilt:<\/p>\n<ul>\n<li><strong>Ein 8B-Modell<\/strong> (z.\u202fB. Llama 3.1 8B): ca. 5&nbsp;GB auf der Festplatte.<\/li>\n<li><strong>Ein Modell der 20B-Klasse:<\/strong> ca. 12\u201314&nbsp;GB.<\/li>\n<li><strong>Ein 70B-Modell:<\/strong> ca. 40&nbsp;GB.<\/li>\n<li><strong>Ein sehr gro\u00dfes MoE-Modell<\/strong> (Llama-4-Klasse): 65&nbsp;GB oder mehr.<\/li>\n<\/ul>\n<p>Diese Werte summieren sich rasch: Eine lockere Sammlung einiger Modelle liegt bereits bei 30\u201380&nbsp;GB; halten Sie mehrere gro\u00dfe Varianten vorr\u00e4tig, \u00fcberschreiten Sie ohne Weiteres die Marke von 200&nbsp;GB. Eine 512-GB-SSD ist daher eine sinnvolle Mindestanforderung, wenn Sie Modelle sammeln m\u00f6chten.<\/p>\n<p><strong>Verwenden Sie eine SSD, idealerweise NVMe.<\/strong> Da die Gewichte bei jedem ersten Laden eines Modells von der Festplatte in den Arbeitsspeicher oder die VRAM gelesen werden, zeigt sich ein langsamer mechanischer Datentr\u00e4ger unmittelbar als tr\u00e4ge Startphase \u2013 ein 40-GB-Modell l\u00e4dt sich qu\u00e4lend langsam von einer rotierenden Festplatte. Schneller Speicher beeinflusst zwar nicht die Token-Pro-Sekunde nach dem Laden des Modells, sorgt aber daf\u00fcr, dass die erste Anfrage sofort beantwortet wird statt nach einer 30-sek\u00fcndigen Verz\u00f6gerung.<\/p>\n<p><strong>Betriebssystem und Treiber.<\/strong> Ollama l\u00e4uft nativ auf allen drei Plattformen, doch jede hat ihre Mindestanforderungen:<\/p>\n<ul>\n<li><strong>macOS:<\/strong> Version 11 (Big Sur) oder neuer, sowohl auf Apple Silicon als auch auf Intel-Prozessoren.<\/li>\n<li><strong>Windows:<\/strong> Windows 10, Version 22H2 oder neuer (Home oder Pro), auf x86_64 und ARM64 \u2013 Snapdragon-Ger\u00e4te laufen daher nativ, ohne x86-Emulation.<\/li>\n<li><strong>Linux:<\/strong> die meisten g\u00e4ngigen Distributionen (Ubuntu 18.04+, Debian, Fedora, RHEL, Arch).<\/li>\n<\/ul>\n<p>F\u00fcr GPU-Beschleunigung ben\u00f6tigen Sie zudem aktuelle Treiber: einen aktuellen NVIDIA-Treiber \u2013 <strong>Version 531 oder neuer<\/strong> (bzw. 570 oder neuer f\u00fcr \u00e4ltere Maxwell- und Pascal-Grafikkarten) f\u00fcr CUDA oder einen Vulkan-f\u00e4higen bzw. ROCm-v7-Treiberstack f\u00fcr AMD Radeon. Fehlt der passende Treiber, wechselt Ollama stumm zur CPU-Ausf\u00fchrung \u2013 dies ist der h\u00e4ufigste Grund daf\u00fcr, dass ein Rechner mit einer \u201eguten GPU\u201c dennoch langsam l\u00e4uft.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"FAQ\"><\/span>H\u00e4ufig gestellte Fragen (FAQ)<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Wie viel Arbeitsspeicher ben\u00f6tige ich f\u00fcr Ollama?<\/h3>\n<p>Das h\u00e4ngt ausschlie\u00dflich vom jeweiligen Modell ab. Ollama selbst ben\u00f6tigt praktisch keine Ressourcen; das Modell bestimmt den Speicherbedarf. Als Faustregel gilt: Ein 4-Bit-Modell ben\u00f6tigt etwa 0,6 GB pro Milliarde Parameter \u2013 also ca. 4\u20135 GB f\u00fcr ein 7-Mrd.-Modell, ca. 8 GB f\u00fcr ein 13-Mrd.-Modell und 40 GB oder mehr f\u00fcr ein 70-Mrd.-Modell. Behalten Sie stets einige Gigabyte frei f\u00fcr Ihr Betriebssystem.<\/p>\n<h3>Kann ich Ollama ohne GPU betreiben?<\/h3>\n<p>Ja. Kleine Modelle (2\u20138 Mrd.) laufen problemlos auf der CPU, allerdings langsamer als auf einer GPU. Ein Modell wie Gemma2 2B ben\u00f6tigt nur etwa 1,7 GB Arbeitsspeicher und funktioniert auch auf einfachen Laptops. F\u00fcr Modelle \u00fcber ca. 13 Mrd. Parametern macht eine GPU oder Apple Silicon mit einheitlichem Speicher jedoch einen sp\u00fcrbaren Unterschied.<\/p>\n<h3>Wie viel VRAM ben\u00f6tige ich f\u00fcr ein 7-Mrd.-Modell?<\/h3>\n<p>Etwa 6\u20138 GB f\u00fcr ein 4-Bit-quantisiertes 7-Mrd.-Modell inklusive etwas Puffer f\u00fcr den Kontext. Das passt problemlos in die meisten Einstiegs-Grafikkarten sowie in Laptops mit 16 GB einheitlichem oder Systemspeicher.<\/p>\n<h3>Warum l\u00e4uft Ollama so langsam?<\/h3>\n<p>Fast immer deshalb, weil das Modell nicht vollst\u00e4ndig in die VRAM-Kapazit\u00e4t Ihrer GPU passt und Teile daher in den Systemspeicher oder auf die CPU ausgelagert werden m\u00fcssen. Pr\u00fcfen Sie dies mit <code>ollama ps<\/code> \u2014 zeigt die Ausgabe hohe CPU-Auslastung an, wechseln Sie zu einem kleineren Modell oder einer st\u00e4rker quantisierten Version, damit das gesamte Modell im schnellen Speicher Platz findet.<\/p>\n<h3>Ist ein Mac gut geeignet, um Ollama auszuf\u00fchren?<\/h3>\n<p>Ja, oft ausgezeichnet. Der einheitliche <a href=\"https:\/\/convly.ai\/de\/llm-vram-calculator\/\" data-wpil-monitor-id=\"62\">Arbeitsspeicher von Apple Silicon erm\u00f6glicht es einem Mac mit 64 GB RAM, Modelle auszuf\u00fchren, f\u00fcr die sonst ein teurer Multi-GPU-Rechner erforderlich w\u00e4re; zudem sorgt der MLX-Backend (seit v0.19) f\u00fcr hohe Geschwindigkeit. Ein Mac mit gro\u00dfem Arbeitsspeicher geh\u00f6rt 2026 zu den besten Einzelmaschinen-Optionen f\u00fcr lokale LLMs.<\/a> that would otherwise need a costly multi-GPU PC, and the MLX backend (since v0.19) made it fast too. A high-memory Mac is one of the best single-machine options for local LLMs in 2026.<\/p>\n<h3>Wie viel Festplattenspeicher ben\u00f6tige ich f\u00fcr Ollama?<\/h3>\n<p>Planen Sie etwa 4&nbsp;GB f\u00fcr die Ollama-Installation selbst ein und addieren Sie dann die Gr\u00f6\u00dfe jedes heruntergeladenen Modells. Bei 4-Bit-Quantisierung ben\u00f6tigt ein 8B-Modell etwa 5&nbsp;GB, ein 70B-Modell rund 40&nbsp;GB und die gr\u00f6\u00dften Modelle \u00fcber 65&nbsp;GB. Ein typischer Mehrmodell-Setup liegt zwischen 30 und 80&nbsp;GB, weshalb eine 512-GB-SSD einen komfortablen Ausgangspunkt darstellt. Eine SSD (vorzugsweise NVMe) wird dringend empfohlen, da Modelle bei jedem ersten Start von der Festplatte geladen werden.<\/p>\n<h3>Wo speichert Ollama Modelle ab, und kann ich sie auf ein anderes Laufwerk verschieben?<\/h3>\n<p>Standardm\u00e4\u00dfig speichert Ollama heruntergeladene Modelle in einem versteckten Ordner im Home-Verzeichnis \u2013 <strong>~\/.ollama<\/strong> unter macOS und Linux sowie <strong>%HOMEPATH%.ollama<\/strong> unter Windows. Falls Ihre Systemfestplatte zu klein ist, k\u00f6nnen Sie den Speicherort auf eine gr\u00f6\u00dfere oder externe Festplatte umleiten, indem Sie die Umgebungsvariable <strong>OLLAMA_MODELS<\/strong> vor dem Start von Ollama auf einen neuen Pfad setzen. Dies ist die sauberste L\u00f6sung, wenn Ihr Systemlaufwerk keinen freien Speicherplatz mehr bietet.<\/p>\n<h3>Welche Betriebssysteme unterst\u00fctzt Ollama?<\/h3>\n<p>Ollama l\u00e4uft nativ unter macOS 11 (Big Sur) oder neuer, Windows 10, Version 22H2 oder neuer (64-Bit, inklusive ARM64-Ger\u00e4te wie Snapdragon-Laptops) sowie den meisten modernen Linux-Distributionen wie Ubuntu 18.04+, Fedora und Arch. F\u00fcr GPU-Beschleunigung ben\u00f6tigen Sie zudem einen aktuellen Treiber \u2013 einen aktuellen NVIDIA-Treiber f\u00fcr CUDA oder einen ROCm-\/Vulkan-f\u00e4higen Treiber f\u00fcr AMD \u2013 andernfalls erfolgt die Ausf\u00fchrung ausschlie\u00dflich auf der CPU.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Bottom_line\"><\/span>Fazit<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Bevor Sie irgendetwas herunterladen, f\u00fchren Sie kurz die Rechnung durch: Parameteranzahl \u00d7 0,6 GB f\u00fcr ein 4-Bit-Modell plus Reserve. Passen Sie das Ergebnis an Ihre VRAM-Kapazit\u00e4t (NVIDIA\/AMD) oder Ihren einheitlichen Speicher (Apple) an \u2013 dann vermeiden Sie frustrierende \u201eOut-of-Memory\u201c-Fehler f\u00fcr immer. Wenn Sie unsicher sind, beginnen Sie mit einem Modell, das eine Stufe kleiner ist, als Sie denken: Ein Modell, das gut passt und flott l\u00e4uft, ist besser als ein gr\u00f6\u00dferes, das nur m\u00fchsam vorankommt.<\/p>\n<p><!--related-block--><\/p>\n<div class=\"convly-related\">\n<h2><span class=\"ez-toc-section\" id=\"Related_articles\"><\/span>Verwandte Artikel<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<ul>\n<li><a href=\"https:\/\/convly.ai\/de\/deepseek-v4-flash-vs-gemini-3-5-flash\/\">DeepSeek V4-Flash vs Gemini 3.5 Flash: Specs, Pricing &amp; Which to Choose (2026)<\/a><\/li>\n<li><a href=\"https:\/\/convly.ai\/de\/ollama-vs-jan-2026\/\">Ollama vs. Jan: Welche lokale KI-Anwendung gewinnt 2026?<\/a><\/li>\n<li><a href=\"https:\/\/convly.ai\/de\/lm-studio-complete-guide-2026\/\">LM Studio: Der umfassende Leitfaden (2026)<\/a><\/li>\n<li><a href=\"https:\/\/convly.ai\/de\/claude-5-new-ai-models-june-2026\/\">Gibt es einen Claude 5? Claude Fable 5 und alle wichtigen KI-Modelle im Juni 2026<\/a><\/li>\n<li><a href=\"https:\/\/convly.ai\/de\/llm-hallucinations-complete-guide\/\">Halluzinationen bei Sprachmodellen im Jahr 2026: Warum sie auftreten und wie man sie verhindert<\/a><\/li>\n<li><a href=\"https:\/\/convly.ai\/de\/prompt-engineering-techniques\/\">Prompt-Engineering im Jahr 2026: 12 Techniken, die tats\u00e4chlich funktionieren<\/a><\/li>\n<li><a href=\"https:\/\/convly.ai\/de\/what-is-ollama-complete-guide-2026\/\">Was ist Ollama? Der umfassende Leitfaden zum lokalen Ausf\u00fchren von LLMs im Jahr 2026<\/a><\/li>\n<\/ul>\n<\/div>","protected":false},"excerpt":{"rendered":"<p>The number-one reason a model fails to run isn&#8217;t a bug \u2014 it&#8217;s memory. Here&#8217;s exactly how much RAM and VRAM each Ollama model size needs, and a formula to know before you download.<\/p>","protected":false},"author":1,"featured_media":1955,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[3],"tags":[642,643,640,644,641,639],"class_list":["post-790","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-llms","tag-local-llm-vram","tag-ollama-gpu","tag-ollama-hardware-requirements","tag-ollama-ram","tag-ollama-requirements","tag-ollama-system-requirements"],"_links":{"self":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts\/790","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/comments?post=790"}],"version-history":[{"count":5,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts\/790\/revisions"}],"predecessor-version":[{"id":1432,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts\/790\/revisions\/1432"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/media\/1955"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/media?parent=790"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/categories?post=790"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/tags?post=790"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}