{"id":2151,"date":"2026-08-10T06:29:04","date_gmt":"2026-08-10T06:29:04","guid":{"rendered":"https:\/\/convly.ai\/?p=2151"},"modified":"2026-08-10T06:29:04","modified_gmt":"2026-08-10T06:29:04","slug":"comfyui-gguf-setup","status":"publish","type":"post","link":"https:\/\/convly.ai\/it\/comfyui-gguf-setup\/","title":{"rendered":"ComfyUI GGUF: esegui grandi modelli di diffusione su GPU con poca VRAM"},"content":{"rendered":"<div class=\"convly-tldr\">\n<ul>\n<li>La quantizzazione GGUF riduce le dimensioni di grandi modelli di diffusione come FLUX.1, passando da ~24 GB a 5\u201312 GB, consentendone l\u2019esecuzione su GPU consumer dotate di 6\u201316 GB di VRAM.<\/li>\n<li>Installa il <strong>nodo personalizzato ComfyUI-GGUF<\/strong> creato da city96, posiziona i <code>.gguf<\/code> file nella cartella <code>ComfyUI\/models\/unet\/<\/code>, ed utilizza il nodo <code>UnetLoaderGGUF<\/code> invece del normale UNETLoader.<\/li>\n<li>Q4_K_S o Q5_K_S offrono il miglior rapporto qualit\u00e0-VRAM per la maggior parte delle schede grafiche. Q8_0 \u00e8 quasi privo di perdite ma consente un risparmio minore di memoria. Q2_K \u00e8 pensato per GPU da 4\u20136 GB, con compromessi visibili sulla qualit\u00e0.<\/li>\n<li>Anche l\u2019encoder testuale T5-XXL di FLUX (~9 GB in fp16) pu\u00f2 essere caricato in formato GGUF tramite il nodo <code>DualCLIPLoaderGGUF<\/code>, liberando ulteriore VRAM.<\/li>\n<\/ul>\n<\/div>\n<p>GGUF \u00e8 un formato binario sviluppato dal progetto llama.cpp per memorizzare pesi di reti neurali quantizzati. Originariamente concepito per i modelli linguistici di grandi dimensioni (LLM), \u00e8 stato adattato anche per gli UNet dei modelli di diffusione; il <strong>nodo personalizzato ComfyUI-GGUF<\/strong> nodo personalizzato di city96 integra tale supporto in ComfyUI. Il risultato pratico: FLUX.1-dev, che richiede circa 24 GB di VRAM in precisione completa BF16, diventa eseguibile su una GPU da 6\u20138 GB con quantizzazione Q4 \u2014 mantenendo una qualit\u00e0 dell\u2019immagine spesso indistinguibile da quella del modello a piena precisione all\u2019occhio umano.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_86 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a79b012b58a0\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Attiva\/Disattiva<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a79b012b58a0\"  aria-label=\"Attiva\/Disattiva\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/it\/comfyui-gguf-setup\/#Why_GGUF_Matters_for_Image_Generation\" >Perch\u00e9 GGUF \u00e8 importante per la generazione di immagini<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/it\/comfyui-gguf-setup\/#Installing_the_ComfyUI-GGUF_Custom_Node\" >Installazione del nodo personalizzato ComfyUI-GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/it\/comfyui-gguf-setup\/#Getting_GGUF_Model_Files\" >Recupero dei file dei modelli GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/it\/comfyui-gguf-setup\/#Where_to_Place_Model_Files\" >Dove posizionare i file dei modelli<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/it\/comfyui-gguf-setup\/#Using_the_GGUF_Loader_Nodes\" >Utilizzo dei nodi loader GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/it\/comfyui-gguf-setup\/#Choosing_a_Quantisation_Level\" >Scelta del livello di quantizzazione<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/it\/comfyui-gguf-setup\/#Quality_and_Speed_Trade-offs\" >I checkpoint standard dei modelli di diffusione sono distribuiti come<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/it\/comfyui-gguf-setup\/#Frequently_Asked_Questions\" >Domande frequenti<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"Why_GGUF_Matters_for_Image_Generation\"><\/span>Perch\u00e9 GGUF \u00e8 importante per la generazione di immagini<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>I checkpoint standard della diffusione vengono distribuiti come <code>.safetensors<\/code> file in FP16 o BF16. Per modelli di generazioni precedenti (SD1.5, circa 2 GB; SDXL, circa 7 GB), ci\u00f2 \u00e8 gestibile su hardware di fascia media. Per FLUX.1 e SD3, i file in precisione completa occupano rispettivamente 24 GB e 16 GB: una dimensione superiore al limite di VRAM disponibile su qualsiasi GPU consumer singola.<\/p>\n<p>La quantizzazione GGUF mappa ciascun peso su una rappresentazione intera pi\u00f9 piccola. Un peso Q8_0 utilizza 8 bit invece di 16, riducendo approssimativamente a met\u00e0 le dimensioni del modello con una perdita di qualit\u00e0 trascurabile. Le varianti Q4 usano 4 bit per peso, portando le dimensioni a circa un quarto di quelle in fp16. I risparmi diventano particolarmente significativi nei modelli con miliardi di parametri. Usa il <a href=\"https:\/\/convly.ai\/it\/llm-vram-calculator\/\">Calcolatore VRAM<\/a> per stimare quanta memoria GPU sar\u00e0 necessaria per un determinato livello di quantizzazione prima ancora di scaricare qualsiasi file.<\/p>\n<p>FLUX.1 include inoltre un grande encoder testuale T5-XXL (circa 9,3 GB in fp16). Combinare un UNet in formato GGUF con un encoder T5-XXL anch\u2019esso in formato GGUF permette di far rientrare l\u2019intera pipeline FLUX.1 su schede grafiche che altrimenti non riuscirebbero affatto ad eseguirla. Entrambi i componenti possono essere caricati indipendentemente nel formato GGUF.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Installing_the_ComfyUI-GGUF_Custom_Node\"><\/span>Installazione del nodo personalizzato ComfyUI-GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Tramite ComfyUI Manager (consigliato)<\/h3>\n<ol>\n<li>Apri ComfyUI e clicca su <strong>Manager<\/strong> nella barra laterale.<\/li>\n<li>Vai a <strong>Installa nodi personalizzati<\/strong>.<\/li>\n<li>Cerca <code>nodo personalizzato ComfyUI-GGUF<\/code>.<\/li>\n<li>Fai clic <strong>Installa<\/strong> accanto alla voce di city96, quindi riavvia ComfyUI.<\/li>\n<\/ol>\n<h3>Installazione manuale<\/h3>\n<p>Clona il repository nella tua cartella <code>custom_nodes<\/code> e installa la dipendenza Python richiesta:<\/p>\n<pre><code>cd ComfyUI\/custom_nodes\ngit clone https:\/\/github.com\/city96\/ComfyUI-GGUF\n<\/code><\/pre>\n<p><strong>Linux \/ macOS (venv):<\/strong><\/p>\n<pre><code>source ComfyUI\/venv\/bin\/activate\npip install -r ComfyUI\/custom_nodes\/ComfyUI-GGUF\/requirements.txt\n<\/code><\/pre>\n<p><strong>Windows (ComfyUI portatile):<\/strong><\/p>\n<pre><code>ComfyUIpython_embedspython.exe -m pip install -r ComfyUIcustom_nodesComfyUI-GGUFrequirements.txt\n<\/code><\/pre>\n<p><strong>Windows (venv):<\/strong><\/p>\n<pre><code>ComfyUIvenvScriptsactivate.bat\npip install -r ComfyUIcustom_nodesComfyUI-GGUFrequirements.txt\n<\/code><\/pre>\n<p>La dipendenza principale \u00e8 il pacchetto Python <code>gguf<\/code> . Riavvia ComfyUI dopo l\u2019installazione.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Getting_GGUF_Model_Files\"><\/span>Recupero dei file dei modelli GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>city96 pubblica su Hugging Face versioni GGUF di FLUX.1-dev e FLUX.1-schnell con l\u2019username <code>city96<\/code>. Cerca su Hugging Face <code>city96 FLUX.1-dev-gguf<\/code> per trovare il repository corrispondente. Ogni repository contiene pi\u00f9 <code>.gguf<\/code> file, uno per ogni livello di quantizzazione. Scarica un solo file, corrispondente al livello di quantizzazione desiderato: non hai bisogno di tutti i file presenti.<\/p>\n<p>Sono inoltre disponibili su Hugging Face versioni GGUF dell\u2019encoder testuale T5-XXL (cerca <code>t5-v1_1-xxl-encoder-gguf<\/code>). L\u2019encoder CLIP-L \u00e8 sufficientemente piccolo (~240 MB) da rendere raramente conveniente la sua quantizzazione.<\/p>\n<p>Membri della community pubblicano anche varianti GGUF di modelli FLUX finetunati su CivitAI. La stessa struttura di nodi e directory si applica indipendentemente dalla fonte da cui scarichi i file.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Where_to_Place_Model_Files\"><\/span>Dove posizionare i file dei modelli<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<table>\n<thead>\n<tr>\n<th>Tipo di file<\/th>\n<th>Cartella<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>UNet di diffusione GGUF (es. <code>flux1-dev-Q4_K_S.gguf<\/code>)<\/td>\n<td><code>ComfyUI\/models\/unet\/<\/code><\/td>\n<\/tr>\n<tr>\n<td>Encoder testuale GGUF (es. T5-XXL <code>.gguf<\/code>)<\/td>\n<td><code>ComfyUI\/models\/clip\/<\/code><\/td>\n<\/tr>\n<tr>\n<td>VAE (<code>.safetensors<\/code>, invariato)<\/td>\n<td><code>ComfyUI\/models\/vae\/<\/code><\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Il VAE per FLUX non viene quantizzato e rimane nella sua posizione standard. Solo l\u2019UNet e l\u2019encoder testuale traggono vantaggio dal caricamento in formato GGUF.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Using_the_GGUF_Loader_Nodes\"><\/span>Utilizzo dei nodi loader GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Dopo aver installato ComfyUI-GGUF e riavviato, nuovi nodi compaiono nel browser dei nodi. Questi sostituiscono le controparti standard nei tuoi flussi di lavoro: non puoi caricare un <code>.gguf<\/code> file con il normale nodo <code>UNETLoader<\/code>.<\/p>\n<table>\n<thead>\n<tr>\n<th>Nodo<\/th>\n<th>Sostituisce<\/th>\n<th>Accetta<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td><code>UnetLoaderGGUF<\/code><\/td>\n<td><code>UNETLoader<\/code><\/td>\n<td><code>.gguf<\/code> modelli di diffusione<\/td>\n<\/tr>\n<tr>\n<td><code>UnetLoaderGGUFAdvanced<\/code><\/td>\n<td><code>UNETLoader<\/code><\/td>\n<td><code>.gguf<\/code> con opzioni aggiuntive<\/td>\n<\/tr>\n<tr>\n<td><code>DualCLIPLoaderGGUF<\/code><\/td>\n<td><code>DualCLIPLoader<\/code><\/td>\n<td>GGUF o <code>.safetensors<\/code> CLIP\/T5<\/td>\n<\/tr>\n<tr>\n<td><code>CLIPLoaderGGUF<\/code><\/td>\n<td><code>CLIPLoader<\/code><\/td>\n<td>Singolo encoder CLIP in formato GGUF<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Per un flusso di lavoro FLUX standard: sostituisci <code>UNETLoader<\/code> per <code>UnetLoaderGGUF<\/code>, e sostituisci <code>DualCLIPLoader<\/code> per <code>DualCLIPLoaderGGUF<\/code> se utilizzi anche un T5-XXL in formato GGUF. Collega le uscite agli stessi nodi downstream di prima \u2014 le forme dei tensori sono compatibili.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Choosing_a_Quantisation_Level\"><\/span>Scelta del livello di quantizzazione<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>La tabella seguente mostra valori approssimativi relativi soltanto ai pesi UNet di FLUX.1. Il tuo budget totale di VRAM deve coprire anche il VAE (~350 MB), gli encoder testuali (240 MB per CLIP-L, pi\u00f9 la quantit\u00e0 che assegni al T5-XXL) e i tensori intermedi generati durante l\u2019inferenza. Usa il <a href=\"https:\/\/convly.ai\/it\/vram-requirements-every-major-llm-2026\/\">Riferimento sui requisiti di VRAM<\/a> insieme a questa tabella e consulta la <a href=\"https:\/\/convly.ai\/it\/best-gpus-for-local-llms-2026\/\">guida alle GPU<\/a> se devi decidere quale scheda acquistare.<\/p>\n<table>\n<thead>\n<tr>\n<th>Quantizzazione<\/th>\n<th>Dimensione approssimativa del file (UNet di FLUX.1)<\/th>\n<th>VRAM tipica necessaria<\/th>\n<th>Qualit\u00e0 rispetto a BF16<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>BF16 (riferimento)<\/td>\n<td>~24 GB<\/td>\n<td>24+ GB<\/td>\n<td>Riferimento<\/td>\n<\/tr>\n<tr>\n<td>Q8_0<\/td>\n<td>~12 GB<\/td>\n<td>~13 GB<\/td>\n<td>Quasi identica<\/td>\n<\/tr>\n<tr>\n<td>Q5_K_S<\/td>\n<td>~8 GB<\/td>\n<td>~8\u20139 GB<\/td>\n<td>Degrado minimo<\/td>\n<\/tr>\n<tr>\n<td>Q4_K_S<\/td>\n<td>~7 GB<\/td>\n<td>~7\u20138 GB<\/td>\n<td>Leggero, spesso impercettibile<\/td>\n<\/tr>\n<tr>\n<td>Q4_0<\/td>\n<td>~6,5 GB<\/td>\n<td>~7 GB<\/td>\n<td>Leggero<\/td>\n<\/tr>\n<tr>\n<td>Q3_K_S<\/td>\n<td>~5,5 GB<\/td>\n<td>~6 GB<\/td>\n<td>Moderato<\/td>\n<\/tr>\n<tr>\n<td>Q2_K<\/td>\n<td>~4,5 GB<\/td>\n<td>~5 GB<\/td>\n<td>Apprezzabile<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p><strong>Punti di partenza pratici:<\/strong> Q5_K_S o Q4_K_S per schede da 8\u201312 GB (miglior rapporto qualit\u00e0\/VRAM). Q3_K_S o Q2_K per schede da 6 GB, se utilizzi anche un T5-XXL quantizzato. Q8_0 per schede da 16 GB, quando desideri la massima fedelt\u00e0 pur mantenendo l\u2019intero modello nella VRAM.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Quality_and_Speed_Trade-offs\"><\/span>I checkpoint standard dei modelli di diffusione sono distribuiti come<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>A livello Q8_0, le differenze rispetto a BF16 sono virtualmente impercettibili in confronti affiancati. A livello Q4_K_S, possono emergere degradazioni molto sottili nei dettagli fini e nella resa del testo, ma i risultati rimangono di qualit\u00e0 produttiva per la maggior parte degli utilizzi. Q2_K introduce una leggera sfocatura e occasionali artefatti, soprattutto sui volti e sui dettagli fini: \u00e8 da considerarsi un\u2019ultima risorsa per hardware fortemente limitato in memoria.<\/p>\n<p>La velocit\u00e0 di generazione con GGUF pu\u00f2 essere comparabile o addirittura superiore a quella ottenuta caricando un modello BF16 con offloading sulla CPU, poich\u00e9 i pesi quantizzati riducono la pressione sulla larghezza di banda della memoria. Tuttavia, se la tua GPU riesce a contenere l\u2019intero modello BF16 nella VRAM senza ricorrere all\u2019offloading, tale configurazione sar\u00e0 generalmente pi\u00f9 veloce dell\u2019inferenza GGUF. Il vantaggio prestazionale di GGUF \u00e8 pi\u00f9 evidente quando l\u2019alternativa prevede lo scambio continuo di layer tra VRAM e RAM di sistema.<\/p>\n<p>Su <strong>Apple Silicon (macOS)<\/strong>, il backend MPS supporta l\u2019inferenza GGUF tramite ComfyUI-GGUF, ma le caratteristiche prestazionali differiscono da quelle di CUDA NVIDIA. I risultati sono funzionali, ma la velocit\u00e0 di generazione potrebbe essere inferiore rispetto a una GPU NVIDIA equivalente. L\u2019architettura di memoria unificata di Apple Silicon comporta un limite pratico di VRAM pi\u00f9 alto rispetto a GPU discrete con capacit\u00e0 nominale identica, quindi potresti riuscire a eseguire livelli di quantizzazione superiori a quelli indicati nella tabella.<\/p>\n<p>Su <strong>GPU AMD (Linux, ROCm)<\/strong>, l\u2019inferenza GGUF funziona tramite il backend ROCm di PyTorch. Installa prima la versione di PyTorch compatibile con ROCm per ComfyUI, quindi procedi con l\u2019installazione di ComfyUI-GGUF. Prestazioni e compatibilit\u00e0 variano in base alla generazione della GPU; le schede RDNA 3 (serie RX 7000) godono del supporto pi\u00f9 affidabile.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_Asked_Questions\"><\/span>Domande frequenti<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Posso caricare un file .gguf con il nodo standard UNETLoader?<\/h3>\n<p>No. Il nodo standard <code>UNETLoader<\/code> accetta soltanto file <code>.safetensors<\/code> . Devi installare il nodo personalizzato ComfyUI-GGUF e utilizzare <code>UnetLoaderGGUF<\/code> per caricare i modelli <code>.gguf<\/code> di diffusione.<\/p>\n<h3>Devo quantizzare io stesso i miei modelli, oppure posso scaricare file gi\u00e0 quantizzati?<\/h3>\n<p>Per FLUX.1-dev e FLUX.1-schnell, city96 fornisce su Hugging Face file GGUF pre-quantizzati per tutti i principali livelli di quantizzazione. Scarica il file <code>.gguf<\/code> specifico corrispondente al livello desiderato: non \u00e8 necessario eseguire alcuno strumento di quantizzazione autonomamente.<\/p>\n<h3>GGUF funziona anche con modelli SD1.5 e SDXL?<\/h3>\n<p>Tecnicamente s\u00ec, ma il vantaggio \u00e8 modesto. SD1.5 occupa circa 2 GB e SDXL circa 7 GB in fp16 \u2014 entrambi rientrano comodamente nella VRAM delle GPU consumer di fascia media. La quantizzazione GGUF risulta particolarmente utile per modelli molto grandi (FLUX.1, SD3), i cui pesi in precisione piena superano la capacit\u00e0 di VRAM della maggior parte delle schede.<\/p>\n<h3>Un T5-XXL in formato GGUF \u00e8 sensibilmente peggiore della versione fp16 completa?<\/h3>\n<p>A livello Q8_0 o Q5_K_S, la capacit\u00e0 di interpretare i prompt e la qualit\u00e0 della codifica testuale sono sostanzialmente identiche a quelle della versione fp16. Livelli di quantizzazione inferiori (Q2_K, Q3_K_S) possono talvolta produrre un leggero peggioramento nell\u2019aderenza ai prompt complessi, ma tale effetto \u00e8 molto pi\u00f9 sottile rispetto all\u2019impatto sulla qualit\u00e0 dell\u2019UNet allo stesso livello di quantizzazione.<\/p>\n<h3>Il mio flusso di lavoro \u00e8 stato creato per un modello FLUX in precisione piena. Devo ricostruirlo completamente?<\/h3>\n<p>No. Sostituisci semplicemente <code>UNETLoader<\/code> con <code>UnetLoaderGGUF<\/code> e (opzionalmente) <code>DualCLIPLoader<\/code> con <code>DualCLIPLoaderGGUF<\/code>. Tutte le connessioni downstream \u2014 KSampler, decodifica VAE, condizionamento \u2014 rimangono invariate. Le uscite di questi nodi sono compatibili dal punto di vista tensoriale con il resto di un flusso di lavoro FLUX standard.<\/p>\n<h3>Perch\u00e9 ComfyUI esaurisce comunque la VRAM anche con un modello quantizzato?<\/h3>\n<p>L\u2019UNet GGUF rappresenta soltanto una parte dell\u2019uso complessivo di VRAM. Una pipeline FLUX completa carica anche CLIP-L (~240 MB), T5-XXL (fino a ~9,3 GB in fp16) e il VAE (~350 MB), oltre ai buffer di lavoro durante la generazione. Se continui a esaurire la VRAM, carica anche il T5-XXL in formato GGUF tramite <code>DualCLIPLoaderGGUF<\/code>e considera l\u2019attivazione della funzione integrata di tiling del VAE in ComfyUI per la fase di decodifica.<\/p>","protected":false},"excerpt":{"rendered":"<p>GGUF quantisation shrinks large diffusion models like FLUX.1 from ~24 GB to 5\u201312 GB, letting them run on consumer GPUs [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":2152,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2151","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts\/2151","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/comments?post=2151"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts\/2151\/revisions"}],"predecessor-version":[{"id":2153,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts\/2151\/revisions\/2153"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/media\/2152"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/media?parent=2151"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/categories?post=2151"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/tags?post=2151"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}