{"id":2083,"date":"2026-08-03T02:45:07","date_gmt":"2026-08-03T02:45:07","guid":{"rendered":"https:\/\/convly.ai\/?p=2083"},"modified":"2026-08-03T02:45:07","modified_gmt":"2026-08-03T02:45:07","slug":"how-to-check-vram-2026","status":"publish","type":"post","link":"https:\/\/convly.ai\/de\/how-to-check-vram-2026\/","title":{"rendered":"So pr\u00fcfen Sie den VRAM unter Windows, macOS und Linux"},"content":{"rendered":"<div class=\"convly-tldr\">\n<ul>\n<li><strong>Windows:<\/strong> dr\u00fccken <strong>Strg+Umschalt+Esc<\/strong> \u2192 <strong>Leistung<\/strong> \u2192 <strong>GPU<\/strong> und lesen <em>Dedizierter GPU-Arbeitsspeicher<\/em>. Bei NVIDIA-Grafikkarten f\u00fchren Sie <code>nvidia-smi<\/code> in einem Terminal aus, um den genauen Wert sowie die aktuelle Auslastung zu erhalten.<\/li>\n<li><strong>macOS:<\/strong> Apfelmen\u00fc \u2192 <strong>\u00dcber diesen Mac<\/strong>. Bei Apple Silicon entspricht die Angabe \u201eArbeitsspeicher\u201c dem vereinigten Arbeitsspeicher, der von CPU und GPU gemeinsam genutzt wird \u2013 es gibt keinen separaten VRAM.<\/li>\n<li><strong>Linux:<\/strong> <code>nvidia-smi<\/code> (NVIDIA), <code>rocm-smi --showmeminfo vram<\/code> (AMD) oder <code>glxinfo -B<\/code> bei Mesa-Treibern.<\/li>\n<li>Nur <em>dediziert<\/em> der VRAM bestimmt, welches Modell auf Ihrem System l\u00e4uft. Geben Sie Ihren Wert in den <a href=\"https:\/\/convly.ai\/de\/llm-vram-calculator\/\">VRAM-Rechner<\/a> ein, um zu sehen, welche Modelle f\u00fcr Sie geeignet sind.<\/li>\n<\/ul>\n<\/div>\n<p>So pr\u00fcfen Sie den VRAM \u2013 jeweils in einer Zeile pro Plattform: Unter Windows dr\u00fccken Sie <strong>Strg+Umschalt+Esc<\/strong>, \u00f6ffnen die Registerkarte <strong>Leistung<\/strong> und w\u00e4hlen Ihre GPU aus, um den Wert zu lesen <em>Dedizierter GPU-Arbeitsspeicher<\/em>; unter macOS \u00f6ffnen Sie das Apple-Men\u00fc \u2192 <strong>\u00dcber diesen Mac<\/strong>; unter Linux f\u00fchren Sie aus <code>nvidia-smi<\/code> f\u00fcr NVIDIA oder <code>rocm-smi<\/code> for AMD. Below is each method in detail \u2014 plus what the numbers actually mean when you are deciding whether a local LLM will fit.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_85 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a704da6299b2\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Umschalten<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a704da6299b2\"  aria-label=\"Umschalten\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/de\/how-to-check-vram-2026\/#How_to_Check_VRAM_on_Windows\" >So pr\u00fcfen Sie die VRAM unter Windows<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/de\/how-to-check-vram-2026\/#How_to_Check_VRAM_on_macOS\" >So pr\u00fcfen Sie die VRAM unter macOS<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/de\/how-to-check-vram-2026\/#How_to_Check_VRAM_on_Linux\" >So pr\u00fcfen Sie die VRAM unter Linux<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/de\/how-to-check-vram-2026\/#Total_vs_Free_vs_Shared_What_the_Numbers_Mean\" >Gesamt vs. frei vs. gemeinsam genutzt: Was die Zahlen bedeuten<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/de\/how-to-check-vram-2026\/#How_Much_VRAM_Do_You_Actually_Need\" >Wie viel VRAM ben\u00f6tigen Sie tats\u00e4chlich?<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/de\/how-to-check-vram-2026\/#Frequently_Asked_Questions\" >H\u00e4ufig gestellte Fragen<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"How_to_Check_VRAM_on_Windows\"><\/span>So pr\u00fcfen Sie die VRAM unter Windows<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Task-Manager \u2013 die schnellste Methode<\/h3>\n<ol>\n<li>Dr\u00fccken Sie <strong>Strg+Umschalt+Esc<\/strong> , um den Task-Manager zu \u00f6ffnen.<\/li>\n<li>Wechseln Sie zur Registerkarte <strong>Leistung<\/strong> Leistung <em>Weitere Details<\/em> , falls die kompakte Ansicht angezeigt wird.<\/li>\n<li>Klicken Sie links im Seitenbereich auf <strong>GPU 0<\/strong> . Laptops mit sowohl integrierter als auch diskreter GPU zeigen zudem <strong>GPU 1<\/strong> an \u2013 die diskrete Grafikkarte ist in der Regel GPU 1.<\/li>\n<li>Lesen <strong>Dedizierter GPU-Arbeitsspeicher<\/strong> im unteren rechten Bereich. Dies ist Ihre physische VRAM, angegeben als \u201egenutzt \/ gesamt\u201c (z. B. 2,1 \/ 24,0 GB).<\/li>\n<\/ol>\n<p>Ignorieren Sie die Zeile <em>GPU-Speicher<\/em> , da sie den dedizierten Wert um den <em>gemeinsam genutzten GPU-Speicher<\/em> (Systemspeicher, den die GPU ausleihen darf) erh\u00f6ht \u2013 dadurch erscheint beispielsweise eine 8-GB-Karte wie eine 24-GB-Karte. Weitere Informationen zu diesem Unterschied finden Sie weiter unten.<\/p>\n<h3>dxdiag<\/h3>\n<p>Dr\u00fccken Sie <strong>Win+R<\/strong>, geben Sie <code>dxdiag<\/code>ein, dr\u00fccken Sie Enter und \u00f6ffnen Sie dann die Registerkarte <strong>Anzeige<\/strong> Anzeige <em>Anzeigespeicher (VRAM)<\/em> zeigt an, was DirectX meldet. Eine Einschr\u00e4nkung: Je nach Treiber kann dxdiag den gemeinsam genutzten Systemspeicher gelegentlich in diese Angabe einbeziehen, sodass der Wert h\u00f6her als die tats\u00e4chliche VRAM-Kapazit\u00e4t der Karte ausf\u00e4llt. Verwenden Sie daher die dedizierte Angabe aus dem Task-Manager oder <code>nvidia-smi<\/code> als verl\u00e4ssliche Quelle.<\/p>\n<h3>Einstellungen \u2192 Anzeige \u2192 Erweiterte Anzeige<\/h3>\n<p>\u00d6ffnen <strong>Einstellungen \u2192 System \u2192 Anzeige \u2192 Erweiterte Anzeige<\/strong>, und klicken Sie dann auf <strong>Eigenschaften des Anzeigeadapters f\u00fcr Anzeige 1<\/strong>. Unter der Registerkarte \u201eAdapter\u201c wird die <em>Dedizierter Videospeicher<\/em> in MB angegeben. Die genaue Formulierung unterscheidet sich geringf\u00fcgig zwischen Windows 10 und Windows 11, doch der Pfad ist identisch.<\/p>\n<h3>nvidia-smi \u2013 die exakte Angabe<\/h3>\n<p>Falls Sie eine NVIDIA-GPU besitzen, installiert der Treiber ein Kommandozeilen-Tool, das den Speicher in Mebibyte angibt. \u00d6ffnen Sie PowerShell oder Eingabeaufforderung und f\u00fchren Sie folgenden Befehl aus:<\/p>\n<pre><code>nvidia-smi<\/code><\/pre>\n<p>Die Spalte \u201eSpeicher\u201c zeigt die aktuelle Auslastung im Verh\u00e4ltnis zur tats\u00e4chlichen Gesamtkapazit\u00e4t an \u2013 beispielsweise <code>3216 MiB \/ 24564 MiB<\/code> bei einer RTX 4090 \u2013 und die Prozessliste am unteren Bildschirmrand zeigt an, welche Programme Speicher belegen. F\u00fcr eine \u00fcbersichtliche, maschinenlesbare Ausgabe verwenden Sie:<\/p>\n<pre><code>nvidia-smi --query-gpu=memory.total,memory.used,memory.free --format=csv<\/code><\/pre>\n<p>Falls der Befehl nicht gefunden wird, befindet sich das Tool bei neueren Treibern unter <code>C:\\Windows\\System32\\nvidia-smi.exe<\/code>; \u00e4ltere Treiberversionen verwendeten <code>C:\\Program Files\\NVIDIA Corporation\\NVSMI<\/code>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"How_to_Check_VRAM_on_macOS\"><\/span>So pr\u00fcfen Sie die VRAM unter macOS<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Klicken Sie auf das Apple-Men\u00fc \u2192 <strong>\u00dcber diesen Mac<\/strong>.<\/p>\n<ul>\n<li><strong>Apple Silicon (M1 und neuer):<\/strong> Sie sehen einen Chipnamen sowie eine Angabe wie \u201e16 GB\u201c, \u201e36 GB\u201c oder \u201e128 GB\u201c. Dies ist der <em>Arbeitsspeicher<\/em> unified memory <strong>vereinigter Arbeitsspeicher<\/strong> \u2013 ein gemeinsamer Speicherpool, der von CPU und GPU geteilt wird. Es gibt keine separate VRAM-Angabe, weil es keine separate VRAM gibt.<\/li>\n<li><strong>Intel-Macs:<\/strong> Dedizierte GPUs sind mit einer eigenen VRAM-Angabe aufgef\u00fchrt, z.\u202fB. \u201eRadeon Pro 5500M 8 GB\u201c.<\/li>\n<\/ul>\n<p>F\u00fcr weitere Details \u00f6ffnen Sie <strong>\u00dcber diesen Mac \u2192 Weitere Informationen \u2192 Systembericht<\/strong> und w\u00e4hlen <strong>Grafik\/Displays<\/strong>aus oder f\u00fchren folgenden Befehl im Terminal aus:<\/p>\n<pre><code>system_profiler SPDisplaysDataType<\/code><\/pre>\n<p>Bei Intel-Mac-Rechnern wird dabei eine Zeile mit der Angabe <code>VRAM (Gesamt)<\/code> angezeigt; bei Apple-Silicon-Systemen werden stattdessen Chip-Modell und Anzahl der GPU-Kerne aufgelistet.<\/p>\n<h3>Warum sich die Rechnung durch Unified Memory \u00e4ndert<\/h3>\n<p>Bei Apple Silicon kann die GPU auf den Gro\u00dfteil \u2013 aber nicht auf den gesamten \u2013 Arbeitsspeicher des Systems zugreifen. macOS reserviert einen Teil f\u00fcr sich selbst, und standardm\u00e4\u00dfig liegt die Obergrenze f\u00fcr den Working-Set-Speicher der GPU bei etwa zwei Dritteln bis drei Vierteln des gesamten Arbeitsspeichers; die genaue Obergrenze variiert je nach RAM-Gr\u00f6\u00dfe und macOS-Version. Praktisch bedeutet dies, dass ein MacBook Pro mit 36 GB RAM Modelle laden kann, f\u00fcr die auf einem PC eine dedizierte GPU mit 24 GB VRAM erforderlich w\u00e4re. Lokale LLM-Tools zeigen Ihnen diese nutzbare Obergrenze direkt an \u2013 siehe dazu die <a href=\"https:\/\/convly.ai\/de\/lm-studio-complete-guide-2026\/\">LM Studio-Anleitung<\/a> und die <a href=\"https:\/\/convly.ai\/de\/what-is-ollama-complete-guide-2026\/\">Ollama-Anleitung<\/a> f\u00fcr Details, wie jedes Tool diese angibt. Der Kompromiss besteht in der Speicherbandbreite, die je nach Basis-, Pro-, Max- oder Ultra-Chip stark variiert und sich unmittelbar auf die Anzahl generierter Tokens pro Sekunde auswirkt.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"How_to_Check_VRAM_on_Linux\"><\/span>So pr\u00fcfen Sie die VRAM unter Linux<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>NVIDIA: nvidia-smi<\/h3>\n<p>Wird zusammen mit dem propriet\u00e4ren Treiber installiert. F\u00fchren Sie <code>nvidia-smi<\/code> zur einmaligen Abfrage aus oder aktualisieren Sie alle Sekunden w\u00e4hrend des Modell-Ladens:<\/p>\n<pre><code>nvidia-smi -l 1<\/code><\/pre>\n<h3>AMD: rocm-smi oder sysfs<\/h3>\n<p>Bei installiertem ROCm-Stack:<\/p>\n<pre><code>rocm-smi --showmeminfo vram<\/code><\/pre>\n<p>Ohne ROCm stellt der <code>amdgpu<\/code> -Kerneltreiber die Gesamt-VRAM-Menge direkt zur Verf\u00fcgung (in Byte; Ihre Grafikkarte k\u00f6nnte auch <code>card1<\/code> hei\u00dfen \u2013 pr\u00fcfen Sie mit <code>ls \/sys\/class\/drm\/<\/code>):<\/p>\n<pre><code>cat \/sys\/class\/drm\/card0\/device\/mem_info_vram_total<\/code><\/pre>\n<h3>Jede GPU: glxinfo<\/h3>\n<p>Installieren <code>mesa-utils<\/code> (Debian\/Ubuntu) oder <code>glx-utils<\/code> (Fedora), danach:<\/p>\n<pre><code>glxinfo -B | grep -i memory<\/code><\/pre>\n<p>Mesa-Treiber geben eine Zeile wie <code>Videomemory: 8192 MB<\/code>aus; die genaue Bezeichnung variiert je nach Treiber.<\/p>\n<h3>lspci \u2013 identifiziert die Grafikkarte, nicht deren VRAM<\/h3>\n<pre><code>lspci | grep -iE 'vga|3d'<\/code><\/pre>\n<p><code>sudo lspci -v -s <\/code> zeigt dann die Speicheraperturen der Karte an; achten Sie jedoch darauf: Dabei handelt es sich um PCI-BAR-Gr\u00f6\u00dfen, die nur dann mit der gesamten VRAM-Menge \u00fcbereinstimmen, wenn Resizable BAR aktiviert ist. Verwenden Sie <code>lspci<\/code> zur genauen Identifizierung des GPU-Modells und ermitteln Sie die Speichermenge mithilfe der oben genannten Tools oder der technischen Spezifikationen der Karte.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Total_vs_Free_vs_Shared_What_the_Numbers_Mean\"><\/span>Gesamt vs. frei vs. gemeinsam genutzt: Was die Zahlen bedeuten<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<table>\n<thead>\n<tr>\n<th>Zahl<\/th>\n<th>Wo Sie sie finden<\/th>\n<th>Was sie f\u00fcr LLMs bedeutet<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Dedizierte VRAM (gesamt)<\/td>\n<td>Task-Manager \u201eDedizierter GPU-Speicher\u201c; <code>nvidia-smi<\/code> gesamt<\/td>\n<td>Physischer Speicher auf der Grafikkarte. Dies stellt das feste Budget f\u00fcr Modellgewichte dar.<\/td>\n<\/tr>\n<tr>\n<td>Freie VRAM<\/td>\n<td><code>nvidia-smi<\/code> <code>memory.free<\/code><\/td>\n<td>Was aktuell verf\u00fcgbar ist. Desktop, Browser-Tabs und andere Anwendungen belegen typischerweise 0,5\u20132 GB.<\/td>\n<\/tr>\n<tr>\n<td>gemeinsam genutzten GPU-Speicher<\/td>\n<td>Task-Manager \u201eGeteilter GPU-Speicher\u201c<\/td>\n<td>Systemarbeitsspeicher (bis zu etwa der H\u00e4lfte davon), auf den die GPU \u00fcber PCIe zugreifen kann. Dieser ist deutlich langsamer als VRAM \u2013 ber\u00fccksichtigen Sie ihn nicht beim Modellgr\u00f6\u00dfen-Check.<\/td>\n<\/tr>\n<tr>\n<td>Unified Memory (Apple Silicon)<\/td>\n<td>\u00dcber diesen Mac \u201eArbeitsspeicher\u201c<\/td>\n<td>Ein gemeinsamer CPU+GPU-Speicherpool. Die GPU kann den Gro\u00dfteil davon nutzen, wodurch sich dieser wie ein gro\u00dfer VRAM-Pool mit chipabh\u00e4ngiger Bandbreite verh\u00e4lt.<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Beim Laden eines Modells entscheidend ist <em>freie<\/em> VRAM \u2013 nicht die Gesamtmenge. Eine 12-GB-Karte, bei der bereits 1,5 GB vom Compositor und einem Browser belegt sind, bietet etwa 10,5 GB zur Verf\u00fcgung \u2013 was dazu f\u00fchren kann, dass ein Modell, das \u201etheoretisch passen sollte\u201c, nicht geladen werden kann. Bei NVIDIA verr\u00e4t die Prozessliste am unteren Rand der <code>nvidia-smi<\/code> Ausgabe genau, welche Anwendungen Sie schlie\u00dfen sollten.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"How_Much_VRAM_Do_You_Actually_Need\"><\/span>Wie viel VRAM ben\u00f6tigen Sie tats\u00e4chlich?<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Die Frage hinter der Frage. Bei einer 4-Bit-Quantisierung \u2013 dem Standard f\u00fcr lokale Inferenz \u2013 ben\u00f6tigen Modellgewichte etwa 0,5\u20130,6 GB pro Milliarde Parameter zuz\u00fcglich eines KV-Caches, dessen Gr\u00f6\u00dfe mit der Kontextl\u00e4nge w\u00e4chst. Grobe Orientierung:<\/p>\n<table>\n<thead>\n<tr>\n<th>Modellgr\u00f6\u00dfe<\/th>\n<th>4-Bit-Gewichte (ca.)<\/th>\n<th>VRAM f\u00fcr komfortablen Betrieb<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>7\u20138 Mrd.<\/td>\n<td>4\u20135 GB<\/td>\n<td>6\u20138 GB<\/td>\n<\/tr>\n<tr>\n<td>12\u201314 Mrd.<\/td>\n<td>7\u20139 GB<\/td>\n<td>10\u201312 GB<\/td>\n<\/tr>\n<tr>\n<td>24\u201332 Mrd.<\/td>\n<td>13\u201319 GB<\/td>\n<td>16\u201324 GB<\/td>\n<\/tr>\n<tr>\n<td>70 Mrd.<\/td>\n<td>36\u201342 GB<\/td>\n<td>48 GB oder Aufteilung auf zwei GPUs<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Die Spalte \u201ekomfortabel\u201c geht von einem moderaten Kontext (4k\u20138k Tokens) aus; sehr lange Kontexte f\u00fcgen mehrere Gigabyte KV-Cache hinzu. F\u00fcr Modell-spezifische Angaben siehe die <a href=\"https:\/\/convly.ai\/de\/vram-requirements-every-major-llm-2026\/\">VRAM-Anforderungstabelle f\u00fcr alle wichtigen Sprachmodelle<\/a> oder durchsuchen Sie die <a href=\"https:\/\/convly.ai\/de\/models\/\">Modelldatenbank<\/a>. F\u00fcr Ihre exakte Kombination aus Modell, Quantisierung und Kontextl\u00e4nge nutzen Sie den <a href=\"https:\/\/convly.ai\/de\/llm-vram-calculator\/\">VRAM-Rechner<\/a>. Falls Ihre Grafikkarte nicht ausreicht, bewertet der <a href=\"https:\/\/convly.ai\/de\/best-gpus-for-local-llms-2026\/\">beste GPUs f\u00fcr lokale LLMs<\/a> Leitfaden zur GPU-Aufr\u00fcstung die Optionen nach VRAM pro Dollar \u2013 und falls sich ein neuer GPU-Kauf nicht rechnet, zeigt der <a href=\"https:\/\/convly.ai\/de\/self-hosting-vs-api-calculator\/\">Rechner zum Break-even zwischen Self-Hosting und API-Nutzung<\/a> den Zeitpunkt, ab dem das Bezahlen pro Token g\u00fcnstiger wird.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_Asked_Questions\"><\/span>H\u00e4ufig gestellte Fragen<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Kann ich den VRAM meiner Grafikkarte erh\u00f6hen?<\/h3>\n<p>Nein, bei einer diskreten GPU sind die Speicherchips fest auf der Platine verl\u00f6tet; einzige M\u00f6glichkeit ist ein Austausch gegen eine andere Karte. Integrierte GPUs bilden hier eine Ausnahme: Manche BIOS-\/UEFI-Einstellungen erlauben es, die RAM-Zuweisung zu \u00e4ndern (h\u00e4ufig als \u201eUMA Frame Buffer Size\u201c oder \u00e4hnlich bezeichnet). Der von Windows verwaltete gemeinsame GPU-Speicher stellt keinen zus\u00e4tzlichen VRAM dar und beeinflusst nicht, wie viel Modell bei voller Geschwindigkeit ausgef\u00fchrt werden kann.<\/p>\n<h3>Warum zeigt Windows mehr GPU-Speicher an, als meine Karte physisch besitzt?<\/h3>\n<p>Die Zeile \u201eGPU-Speicher\u201c im Windows-Arbeitsplatz-Manager umfasst sowohl den dedizierten VRAM als auch den geteilten Systemspeicher; dxdiag kann diesen Wert ebenfalls k\u00fcnstlich erh\u00f6hen. Der physikalische VRAM entspricht dem Wert \u201eDedizierter GPU-Speicher\u201c oder der Gesamtmenge, die <code>nvidia-smi<\/code> ausgibt. Eine 8-GB-Karte in einem PC mit 32 GB RAM zeigt h\u00e4ufig 24 GB \u201eGPU-Speicher\u201c an \u2013 davon sind jedoch nur 8 GB echter VRAM.<\/p>\n<h3>Hilft geteilter GPU-Speicher beim Ausf\u00fchren gr\u00f6\u00dferer Sprachmodelle?<\/h3>\n<p>Nicht nennenswert. Laufzeitumgebungen wie llama.cpp und Ollama k\u00f6nnen gezielt einzelne Modellschichten in den Systemspeicher auslagern, sodass ein zu gro\u00dfes Modell \u00fcberhaupt noch l\u00e4uft \u2013 allerdings sinkt die Generierungsgeschwindigkeit typischerweise von mehreren Dutzend Tokens pro Sekunde auf einstellige Werte. Dimensionieren Sie Ihr Modell daher prim\u00e4r nach dem verf\u00fcgbaren dedizierten VRAM und betrachten Sie die Auslagerung in den Arbeitsspeicher lediglich als Notl\u00f6sung, nicht als Plan.<\/p>\n<h3>Wie viel VRAM ben\u00f6tigt ein 7B- oder 8B-Modell?<\/h3>\n<p>Etwa 4\u20135 GB f\u00fcr die Gewichte bei 4-Bit-Quantisierung, sodass eine 6\u20138-GB-Karte ein solches Modell komfortabel mit Platz f\u00fcr den Kontext ausf\u00fchren kann. Eine 8-GB-GPU bew\u00e4ltigt die 7\u20138-Mrd.-Klasse gut; 12 GB erm\u00f6glichen den Einsatz von 12\u201314-Mrd.-Modellen. Der <a href=\"https:\/\/convly.ai\/de\/best-local-llms-to-run-on-ollama-2026\/\">Leitfaden zu den besten lokalen Modellen f\u00fcr Ollama<\/a> ordnet g\u00e4ngige Modelle den jeweiligen VRAM-Klassen zu.<\/p>\n<h3>Ist der Unified Memory auf einem Mac dasselbe wie VRAM?<\/h3>\n<p>F\u00fcr den Betrieb von Sprachmodellen praktisch ja: Die GPU adressiert einen gemeinsamen Speicherpool, dessen Gr\u00f6\u00dfe systemseitig auf etwa zwei Drittel bis drei Viertel des gesamten Arbeitsspeichers begrenzt ist. Das bedeutet, dass ein Mac mit 32 GB RAM Modelle ausf\u00fchren kann, die auf einem PC mit einer 12-GB-GPU nicht laufen w\u00fcrden. Der Unterschied zeigt sich in der Speicherbandbreite, die je nach Basis-, Max- oder Ultra-Chip um mehrere Faktoren variieren kann und Ihre maximale Token-pro-Sekunde-Rate bestimmt.<\/p>\n<h3>Wie \u00fcberwache ich die VRAM-Auslastung w\u00e4hrend der Modellausf\u00fchrung?<\/h3>\n<p>Bei NVIDIA-GPUs (unter jedem Betriebssystem) f\u00fchren Sie <code>nvidia-smi -l 1<\/code> aus, um alle Sekunden eine Aktualisierung zu erhalten. Unter Windows aktualisiert sich der GPU-Bereich im Task-Manager in Echtzeit. Unter AMD Linux verwenden Sie <code>watch -n 1 rocm-smi --showmeminfo vram<\/code>; auf einem Mac erscheinen die Modellgewichte im Activity Monitor unter der Registerkarte \u201eSpeicher\u201c als gew\u00f6hnlicher Prozessspeicher, da der Pool vereinheitlicht ist.<\/p>","protected":false},"excerpt":{"rendered":"<p>Windows: press Ctrl+Shift+Esc \u2192 Performance \u2192 GPU and read Dedicated GPU memory. On NVIDIA cards, run nvidia-smi in a terminal [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":2084,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2083","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts\/2083","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/comments?post=2083"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts\/2083\/revisions"}],"predecessor-version":[{"id":2085,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts\/2083\/revisions\/2085"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/media\/2084"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/media?parent=2083"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/categories?post=2083"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/tags?post=2083"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}