{"id":2151,"date":"2026-08-10T06:29:04","date_gmt":"2026-08-10T06:29:04","guid":{"rendered":"https:\/\/convly.ai\/?p=2151"},"modified":"2026-08-10T06:29:04","modified_gmt":"2026-08-10T06:29:04","slug":"comfyui-gguf-setup","status":"publish","type":"post","link":"https:\/\/convly.ai\/de\/comfyui-gguf-setup\/","title":{"rendered":"ComfyUI GGUF: Gro\u00dfe Diffusionsmodelle auf GPUs mit geringem VRAM ausf\u00fchren"},"content":{"rendered":"<div class=\"convly-tldr\">\n<ul>\n<li>Die GGUF-Quantisierung reduziert gro\u00dfe Diffusionsmodelle wie FLUX.1 von urspr\u00fcnglich ~24 GB auf 5\u201312 GB und erm\u00f6glicht so ihren Betrieb auf Consumer-GPUs mit 6\u201316 GB VRAM.<\/li>\n<li>Installieren Sie den <strong>ComfyUI-GGUF<\/strong> benutzerdefinierten Knoten von city96, platzieren Sie die <code>.gguf<\/code> Dateien in <code>ComfyUI\/models\/unet\/<\/code>, und verwenden Sie stattdessen den <code>UnetLoaderGGUF<\/code> -Knoten anstelle des Standard-UNETLoaders.<\/li>\n<li>Q4_K_S oder Q5_K_S bieten bei den meisten Grafikkarten das beste Verh\u00e4ltnis aus Qualit\u00e4t und VRAM-Verbrauch. Q8_0 ist nahezu verlustfrei, spart aber weniger Speicherplatz. Q2_K richtet sich an GPUs mit 4\u20136 GB VRAM und geht mit sichtbaren Einbu\u00dfen bei der Qualit\u00e4t einher.<\/li>\n<li>Der T5-XXL-Textencoder von FLUX (~9 GB im fp16-Format) kann ebenfalls als GGUF geladen werden \u2013 mithilfe des <code>DualCLIPLoaderGGUF<\/code>-Knotens \u2013 wodurch erheblich mehr VRAM freigegeben wird.<\/li>\n<\/ul>\n<\/div>\n<p>GGUF ist ein Bin\u00e4rformat, das vom llama.cpp-Projekt zur Speicherung quantisierter neuronaler Netzwerk-Gewichte entwickelt wurde. Urspr\u00fcnglich f\u00fcr Sprachmodelle (LLMs) konzipiert, wurde es sp\u00e4ter auch f\u00fcr UNets von Diffusionsmodellen angepasst; der <strong>ComfyUI-GGUF<\/strong> benutzerdefinierte Knoten von city96 integriert diese Funktionalit\u00e4t nun in ComfyUI. Das praktische Ergebnis: FLUX.1-dev, das im vollst\u00e4ndigen BF16-Pr\u00e4zisionsmodus rund 24 GB VRAM ben\u00f6tigt, l\u00e4sst sich bereits bei Q4-Quantisierung auf einer GPU mit 6\u20138 GB VRAM ausf\u00fchren \u2013 bei einer Bildqualit\u00e4t, die dem menschlichen Auge oft nicht vom Originalmodell zu unterscheiden ist.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_86 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a79af6b31d4f\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Umschalten<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a79af6b31d4f\"  aria-label=\"Umschalten\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/de\/comfyui-gguf-setup\/#Why_GGUF_Matters_for_Image_Generation\" >Warum GGUF f\u00fcr die Bildgenerierung wichtig ist<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/de\/comfyui-gguf-setup\/#Installing_the_ComfyUI-GGUF_Custom_Node\" >Installation des ComfyUI-GGUF-Benutzerknotens<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/de\/comfyui-gguf-setup\/#Getting_GGUF_Model_Files\" >Beschaffung der GGUF-Modelldateien<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/de\/comfyui-gguf-setup\/#Where_to_Place_Model_Files\" >Wo die Modelldateien abzulegen sind<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/de\/comfyui-gguf-setup\/#Using_the_GGUF_Loader_Nodes\" >Verwendung der GGUF-Ladeknoten<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/de\/comfyui-gguf-setup\/#Choosing_a_Quantisation_Level\" >Auswahl des Quantisierungsgrads<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/de\/comfyui-gguf-setup\/#Quality_and_Speed_Trade-offs\" >Standard-Diffusions-Checkpoints werden als<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/de\/comfyui-gguf-setup\/#Frequently_Asked_Questions\" >H\u00e4ufig gestellte Fragen<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"Why_GGUF_Matters_for_Image_Generation\"><\/span>Warum GGUF f\u00fcr die Bildgenerierung wichtig ist<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>.safetensors <code>ausgeliefert<\/code> Dateien im FP16- oder BF16-Format. Bei \u00e4lteren Modellgenerationen (SD1.5 mit ca. 2 GB, SDXL mit ca. 7 GB) ist dies auf Hardware mittlerer Leistungsklasse noch handhabbar. Bei FLUX.1 und SD3 hingegen betragen die Dateigr\u00f6\u00dfen in voller Pr\u00e4zision 24 GB bzw. 16 GB \u2013 weit \u00fcber der VRAM-Kapazit\u00e4t jeder einzelnen Consumer-GPU.<\/p>\n<p>Die GGUF-Quantisierung ordnet jedes Gewicht einer kleineren ganzzahligen Darstellung zu. Ein Q8_0-Gewicht nutzt 8 Bit statt 16 und halbiert damit die Modellgr\u00f6\u00dfe nahezu ohne sp\u00fcrbaren Qualit\u00e4tsverlust. Q4-Varianten verwenden 4 Bit pro Gewicht und reduzieren die Gr\u00f6\u00dfe auf etwa ein Viertel der FP16-Version. Diese Einsparungen summieren sich bei Modellen mit Milliarden von Parametern dramatisch. Nutzen Sie den <a href=\"https:\/\/convly.ai\/de\/llm-vram-calculator\/\">VRAM-Rechner<\/a> um vor dem Download abzusch\u00e4tzen, wie viel GPU-Speicher ein bestimmtes Quantisierungsniveau ben\u00f6tigt.<\/p>\n<p>FLUX.1 verf\u00fcgt zudem \u00fcber einen gro\u00dfen T5-XXL-Textencoder (ca. 9,3 GB im FP16-Format). Die Kombination eines GGUF-basierten UNets mit einem GGUF-basierten T5-XXL-Encoder erm\u00f6glicht es, die gesamte FLUX.1-Pipeline auf Grafikkarten auszuf\u00fchren, auf denen sie andernfalls gar nicht lauff\u00e4hig w\u00e4re. Beide Komponenten k\u00f6nnen unabh\u00e4ngig voneinander im GGUF-Format geladen werden.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Installing_the_ComfyUI-GGUF_Custom_Node\"><\/span>Installation des ComfyUI-GGUF-Benutzerknotens<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>\u00dcber ComfyUI Manager (empfohlen)<\/h3>\n<ol>\n<li>\u00d6ffnen Sie ComfyUI und klicken Sie auf <strong>Manager<\/strong> in der Seitenleiste.<\/li>\n<li>Gehe zu <strong>Benutzerdefinierte Knoten installieren<\/strong>.<\/li>\n<li>Suchen Sie nach <code>ComfyUI-GGUF<\/code>.<\/li>\n<li>Klicken <strong>Installieren<\/strong> neben dem Eintrag von city96 und starten Sie ComfyUI danach neu.<\/li>\n<\/ol>\n<h3>Manuelle Installation<\/h3>\n<p>Klonen Sie das Repository in Ihr Verzeichnis <code>custom_nodes<\/code> und installieren Sie die erforderliche Python-Abh\u00e4ngigkeit:<\/p>\n<pre><code>cd ComfyUI\/custom_nodes\ngit clone https:\/\/github.com\/city96\/ComfyUI-GGUF\n<\/code><\/pre>\n<p><strong>Linux \/ macOS (venv):<\/strong><\/p>\n<pre><code>source ComfyUI\/venv\/bin\/activate\npip install -r ComfyUI\/custom_nodes\/ComfyUI-GGUF\/requirements.txt\n<\/code><\/pre>\n<p><strong>Windows (portable ComfyUI):<\/strong><\/p>\n<pre><code>ComfyUIpython_embedspython.exe -m pip install -r ComfyUIcustom_nodesComfyUI-GGUFrequirements.txt\n<\/code><\/pre>\n<p><strong>Windows (venv):<\/strong><\/p>\n<pre><code>ComfyUIvenvScriptsactivate.bat\npip install -r ComfyUIcustom_nodesComfyUI-GGUFrequirements.txt\n<\/code><\/pre>\n<p>Die wichtigste Abh\u00e4ngigkeit ist das Python-Paket <code>gguf<\/code> . Starten Sie ComfyUI nach der Installation neu.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Getting_GGUF_Model_Files\"><\/span>Beschaffung der GGUF-Modelldateien<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>city96 stellt GGUF-Versionen von FLUX.1-dev und FLUX.1-schnell auf Hugging Face unter dem Benutzernamen <code>city96<\/code>bereit. Suchen Sie auf Hugging Face nach <code>city96 FLUX.1-dev-gguf<\/code> , um das entsprechende Repository zu finden. Jedes Repository enth\u00e4lt mehrere <code>.gguf<\/code> Dateien, jeweils eine pro Quantisierungsstufe. Laden Sie lediglich die einzelne Datei herunter, die der gew\u00fcnschten Quantisierungsstufe entspricht \u2013 Sie ben\u00f6tigen nicht alle Dateien.<\/p>\n<p>GGUF-Versionen des T5-XXL-Textencoders sind ebenfalls auf Hugging Face verf\u00fcgbar (suchen Sie nach <code>t5-v1_1-xxl-encoder-gguf<\/code>). Der CLIP-L-Encoder ist mit ca. 240 MB so klein, dass eine Quantisierung in der Regel keinen nennenswerten Aufwand lohnt.<\/p>\n<p>Community-Mitglieder stellen zudem GGUF-Varianten feinabgestimmter FLUX-Modelle auf CivitAI bereit. Die gleiche Knoten- und Verzeichnisstruktur gilt unabh\u00e4ngig davon, von wo Sie die Datei herunterladen.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Where_to_Place_Model_Files\"><\/span>Wo die Modelldateien abzulegen sind<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<table>\n<thead>\n<tr>\n<th>Dateityp<\/th>\n<th>Verzeichnis<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>GGUF-Diffusions-UNet (z. B. <code>flux1-dev-Q4_K_S.gguf<\/code>)<\/td>\n<td><code>ComfyUI\/models\/unet\/<\/code><\/td>\n<\/tr>\n<tr>\n<td>GGUF-Textencoder (z. B. T5-XXL <code>.gguf<\/code>)<\/td>\n<td><code>ComfyUI\/models\/clip\/<\/code><\/td>\n<\/tr>\n<tr>\n<td>VAE (<code>ausgeliefert<\/code>, unver\u00e4ndert)<\/td>\n<td><code>ComfyUI\/models\/vae\/<\/code><\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Der VAE f\u00fcr FLUX wird nicht quantisiert und bleibt an seinem \u00fcblichen Ort. Nur das UNet und der Textencoder profitieren von der GGUF-Ladefunktion.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Using_the_GGUF_Loader_Nodes\"><\/span>Verwendung der GGUF-Ladeknoten<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Nach der Installation von ComfyUI-GGUF und dem Neustart von ComfyUI erscheinen neue Knoten im Knotenbrowser. Diese ersetzen ihre Standardentsprechungen in Ihrem Workflow \u2013 Sie k\u00f6nnen eine <code>.gguf<\/code> Datei nicht mit dem Standardknoten <code>UNETLoader<\/code>.<\/p>\n<table>\n<thead>\n<tr>\n<th>laden.<\/th>\n<th>Ersetzt<\/th>\n<th>Akzeptiert<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td><code>UnetLoaderGGUF<\/code><\/td>\n<td><code>UNETLoader<\/code><\/td>\n<td><code>.gguf<\/code> Diffusionsmodelle<\/td>\n<\/tr>\n<tr>\n<td><code>UnetLoaderGGUFAdvanced<\/code><\/td>\n<td><code>UNETLoader<\/code><\/td>\n<td><code>.gguf<\/code> mit erweiterten Optionen<\/td>\n<\/tr>\n<tr>\n<td><code>DualCLIPLoaderGGUF<\/code><\/td>\n<td><code>DualCLIPLoader<\/code><\/td>\n<td>GGUF- oder <code>ausgeliefert<\/code> CLIP\/T5<\/td>\n<\/tr>\n<tr>\n<td><code>CLIPLoaderGGUF<\/code><\/td>\n<td><code>CLIPLoader<\/code><\/td>\n<td>Einzelner GGUF-CLIP-Encoder<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>F\u00fcr einen Standard-FLUX-Workflow: Tauschen Sie <code>UNETLoader<\/code> f\u00fcr <code>UnetLoaderGGUF<\/code>, und tauschen Sie <code>DualCLIPLoader<\/code> f\u00fcr <code>DualCLIPLoaderGGUF<\/code> aus, falls Sie zudem ein GGUF-basiertes T5-XXL verwenden. Verbinden Sie die Ausgaben mit denselben nachgeschalteten Knoten wie zuvor \u2013 die Tensorformate sind kompatibel.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Choosing_a_Quantisation_Level\"><\/span>Auswahl des Quantisierungsgrads<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Die folgende Tabelle zeigt ungef\u00e4hre Werte ausschlie\u00dflich f\u00fcr die FLUX.1-UNet-Gewichte. Ihr gesamtes VRAM-Budget muss au\u00dferdem den VAE (~350 MB), die Text-Encoder (240 MB f\u00fcr CLIP-L sowie zus\u00e4tzlichen Speicherplatz f\u00fcr T5-XXL) und die w\u00e4hrend der Generierung ben\u00f6tigten Arbeitstensoren abdecken. Nutzen Sie die <a href=\"https:\/\/convly.ai\/de\/vram-requirements-every-major-llm-2026\/\">Referenz zu VRAM-Anforderungen<\/a> zusammen mit dieser Tabelle und konsultieren Sie den <a href=\"https:\/\/convly.ai\/de\/best-gpus-for-local-llms-2026\/\">GPU-Leitfaden<\/a> bei der Entscheidung, welche Grafikkarte Sie kaufen sollen.<\/p>\n<table>\n<thead>\n<tr>\n<th>Quantisierung<\/th>\n<th>Gesch\u00e4tzte Dateigr\u00f6\u00dfe (FLUX.1 UNet)<\/th>\n<th>Typischer VRAM-Bedarf<\/th>\n<th>Qualit\u00e4t im Vergleich zu BF16<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>BF16 (Referenz)<\/td>\n<td>~24 GB<\/td>\n<td>24+ GB<\/td>\n<td>Referenz<\/td>\n<\/tr>\n<tr>\n<td>Q8_0<\/td>\n<td>~12 GB<\/td>\n<td>~13 GB<\/td>\n<td>Nahezu identisch<\/td>\n<\/tr>\n<tr>\n<td>Q5_K_S<\/td>\n<td>~8 GB<\/td>\n<td>~8\u20139 GB<\/td>\n<td>Minimaler Qualit\u00e4tsverlust<\/td>\n<\/tr>\n<tr>\n<td>Q4_K_S<\/td>\n<td>~7 GB<\/td>\n<td>~7\u20138 GB<\/td>\n<td>Leicht, oft nicht wahrnehmbar<\/td>\n<\/tr>\n<tr>\n<td>Q4_0<\/td>\n<td>~6,5 GB<\/td>\n<td>~7 GB<\/td>\n<td>Leicht<\/td>\n<\/tr>\n<tr>\n<td>Q3_K_S<\/td>\n<td>~5,5 GB<\/td>\n<td>~6 GB<\/td>\n<td>Mittel<\/td>\n<\/tr>\n<tr>\n<td>Q2_K<\/td>\n<td>~4,5 GB<\/td>\n<td>~5 GB<\/td>\n<td>Deutlich wahrnehmbar<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p><strong>Praktische Startpunkte:<\/strong> Q5_K_S oder Q4_K_S f\u00fcr Grafikkarten mit 8\u201312 GB VRAM (bestes Verh\u00e4ltnis von Qualit\u00e4t zu VRAM). Q3_K_S oder Q2_K f\u00fcr 6-GB-Karten, falls Sie zudem ein quantisiertes T5-XXL verwenden. Q8_0 f\u00fcr 16-GB-Karten, wenn Sie maximale Genauigkeit w\u00fcnschen und das Modell dennoch vollst\u00e4ndig in den VRAM laden m\u00f6chten.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Quality_and_Speed_Trade-offs\"><\/span>Standard-Diffusions-Checkpoints werden als<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Bei Q8_0 sind Unterschiede gegen\u00fcber BF16 in direkten Seit-an-Seit-Vergleichen praktisch nicht erkennbar. Bei Q4_K_S k\u00f6nnen bei genauer Betrachtung feine Texturen und Textdarstellungen sehr subtil an Qualit\u00e4t verlieren; die Ergebnisse sind jedoch f\u00fcr die meisten Anwendungsf\u00e4lle produktionsreif. Q2_K f\u00fchrt zu sichtbarer Weichzeichnung und gelegentlichen Artefakten, insbesondere bei Gesichtern und feinen Details \u2013 es stellt daher eine letzte Option f\u00fcr extrem speichereingeschr\u00e4nkte Hardware dar.<\/p>\n<p>Die Generierungsgeschwindigkeit mit GGUF kann vergleichbar sein oder sogar schneller als das Laden eines BF16-Modells mit CPU-Offloading, da quantisierte Gewichte den Speicherbandbreitenbedarf reduzieren. Falls Ihre GPU jedoch das vollst\u00e4ndige BF16-Modell ohne Offloading komplett im VRAM halten kann, ist dies in der Regel schneller als die GGUF-Inferenz. Der Geschwindigkeitsvorteil von GGUF f\u00e4llt am deutlichsten aus, wenn die Alternative das Zwischenspeichern von Layern zwischen VRAM und Systemspeicher erfordert.<\/p>\n<p>Auf <strong>Apple Silicon (macOS)<\/strong>, unterst\u00fctzt der MPS-Backend GGUF-Inferenz \u00fcber ComfyUI-GGUF, doch unterscheiden sich die Leistungsmerkmale von NVIDIA CUDA. Die Ergebnisse sind funktionsf\u00e4hig, doch kann die Generierungsgeschwindigkeit langsamer sein als auf einer vergleichbaren NVIDIA-GPU. Aufgrund der einheitlichen Speicherarchitektur von Apple Silicon liegt die praktische VRAM-Obergrenze h\u00f6her als bei diskreten GPUs mit derselben nominellen Kapazit\u00e4t; Sie k\u00f6nnen daher m\u00f6glicherweise h\u00f6here Quantisierungsstufen nutzen, als es die obige Tabelle nahelegt.<\/p>\n<p>Auf <strong>AMD-GPUs (Linux, ROCm)<\/strong>, funktioniert GGUF-Inferenz \u00fcber PyTorchs ROCm-Backend. Installieren Sie vor der Installation von ComfyUI-GGUF zun\u00e4chst die ROCm-kompatible PyTorch-Version f\u00fcr ComfyUI. Leistung und Kompatibilit\u00e4t variieren je nach GPU-Generation; RDNA-3-Karten (RX-7000-Serie) bieten die zuverl\u00e4ssigste Unterst\u00fctzung.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_Asked_Questions\"><\/span>H\u00e4ufig gestellte Fragen<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Kann ich eine .gguf-Datei mit dem Standard-UNETLoader-Knoten laden?<\/h3>\n<p>Nein. Der Standard- <code>UNETLoader<\/code> akzeptiert ausschlie\u00dflich <code>ausgeliefert<\/code> -Dateien. Sie m\u00fcssen den benutzerdefinierten ComfyUI-GGUF-Knoten installieren und <code>UnetLoaderGGUF<\/code> verwenden, um <code>.gguf<\/code> Diffusionsmodelle zu laden.<\/p>\n<h3>Muss ich meine eigenen Modelle selbst quantisieren, oder kann ich vorkuantisierte Dateien herunterladen?<\/h3>\n<p>F\u00fcr FLUX.1-dev und FLUX.1-schnell stellt city96 auf Hugging Face vorkuantisierte GGUF-Dateien f\u00fcr s\u00e4mtliche wichtigen Quantisierungsstufen bereit. Laden Sie die jeweilige <code>.gguf<\/code> -Datei f\u00fcr die gew\u00fcnschte Stufe herunter \u2013 Sie m\u00fcssen keinerlei Quantisierungswerkzeuge selbst ausf\u00fchren.<\/p>\n<h3>Funktioniert GGUF auch f\u00fcr SD1.5- und SDXL-Modelle?<\/h3>\n<p>Technisch ja, doch der Nutzen ist gering. SD1.5 umfasst etwa 2 GB und SDXL etwa 7 GB im fp16-Format \u2013 beide passen problemlos auf Consumer-GPUs mittlerer Klasse. GGUF-Quantisierung ist vor allem bei sehr gro\u00dfen Modellen (FLUX.1, SD3) sinnvoll, deren vollpr\u00e4zise Gewichte die VRAM-Kapazit\u00e4t der meisten Grafikkarten \u00fcberschreiten.<\/p>\n<h3>Ist ein GGUF-basiertes T5-XXL sp\u00fcrbar schlechter als die vollst\u00e4ndige fp16-Version?<\/h3>\n<p>Bei Q8_0 oder Q5_K_S entsprechen Prompt-Following und Text-Encoding-Qualit\u00e4t praktisch exakt der fp16-Version. Bei niedrigeren Quantisierungsstufen (Q2_K, Q3_K_S) kann es gelegentlich zu leicht beeintr\u00e4chtigter Prompt-Adh\u00e4renz bei komplexen Prompts kommen, doch ist dieser Effekt im Vergleich zum Einfluss derselben Quantisierungsstufe auf die UNet-Qualit\u00e4t eher subtil.<\/p>\n<h3>Mein Workflow wurde f\u00fcr ein vollpr\u00e4zises FLUX-Modell erstellt. Muss ich ihn neu aufbauen?<\/h3>\n<p>Nein. Ersetzen Sie <code>UNETLoader<\/code> mit <code>UnetLoaderGGUF<\/code> und (optional) <code>DualCLIPLoader<\/code> mit <code>DualCLIPLoaderGGUF<\/code>. Alle nachgeschalteten Verbindungen \u2013 KSampler, VAE-Dekodierung, Conditioning \u2013 bleiben unver\u00e4ndert. Die Knotenausgaben sind mit den \u00fcbrigen Komponenten eines Standard-FLUX-Workflows tensorkompatibel.<\/p>\n<h3>Warum st\u00f6\u00dft ComfyUI trotz eines quantisierten Modells immer noch an die VRAM-Grenze?<\/h3>\n<p>Der GGUF-UNet-Knoten stellt nur einen Teil des gesamten VRAM-Bedarfs dar. Eine vollst\u00e4ndige FLUX-Pipeline l\u00e4dt zudem CLIP-L (~240 MB), T5-XXL (bis zu ~9,3 GB im fp16-Format) und den VAE (~350 MB) sowie Arbeitsspeicherpuffer w\u00e4hrend der Generierung. Falls Sie weiterhin an die Grenze sto\u00dfen, laden Sie T5-XXL ebenfalls als GGUF \u00fcber <code>DualCLIPLoaderGGUF<\/code>, und aktivieren Sie gegebenenfalls die integrierte VAE-Tiling-Funktion von ComfyUI f\u00fcr den Dekodierungsschritt.<\/p>","protected":false},"excerpt":{"rendered":"<p>GGUF quantisation shrinks large diffusion models like FLUX.1 from ~24 GB to 5\u201312 GB, letting them run on consumer GPUs [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":2152,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2151","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts\/2151","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/comments?post=2151"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts\/2151\/revisions"}],"predecessor-version":[{"id":2153,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts\/2151\/revisions\/2153"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/media\/2152"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/media?parent=2151"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/categories?post=2151"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/tags?post=2151"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}