{"id":2151,"date":"2026-08-10T06:29:04","date_gmt":"2026-08-10T06:29:04","guid":{"rendered":"https:\/\/convly.ai\/?p=2151"},"modified":"2026-08-10T06:29:04","modified_gmt":"2026-08-10T06:29:04","slug":"comfyui-gguf-setup","status":"publish","type":"post","link":"https:\/\/convly.ai\/pt\/comfyui-gguf-setup\/","title":{"rendered":"ComfyUI GGUF: execute grandes modelos de difus\u00e3o em GPUs com pouca VRAM"},"content":{"rendered":"<div class=\"convly-tldr\">\n<ul>\n<li>A quantiza\u00e7\u00e3o GGUF reduz modelos grandes de difus\u00e3o, como o FLUX.1, de ~24 GB para 5\u201312 GB, permitindo sua execu\u00e7\u00e3o em GPUs consumidoras com 6\u201316 GB de VRAM.<\/li>\n<li>Instale o <strong>n\u00f3 personalizado ComfyUI-GGUF<\/strong> do desenvolvedor city96, coloque os <code>.gguf<\/code> arquivos em <code>ComfyUI\/models\/unet\/<\/code>, e use o n\u00f3 <code>UnetLoaderGGUF<\/code> em vez do UNETLoader padr\u00e3o.<\/li>\n<li>Q4_K_S ou Q5_K_S oferecem a melhor rela\u00e7\u00e3o qualidade\/VRAM para a maioria das placas. Q8_0 \u00e9 quase sem perdas, mas economiza menos mem\u00f3ria. Q2_K destina-se a GPUs com 4\u20136 GB de VRAM, com compromissos vis\u00edveis na qualidade.<\/li>\n<li>O codificador de texto T5-XXL do FLUX (~9 GB em fp16) tamb\u00e9m pode ser carregado como GGUF por meio do <code>DualCLIPLoaderGGUF<\/code>, liberando significativa quantidade adicional de VRAM.<\/li>\n<\/ul>\n<\/div>\n<p>GGUF \u00e9 um formato bin\u00e1rio desenvolvido pelo projeto llama.cpp para armazenar pesos de redes neurais quantizados. Originalmente criado para LLMs, foi adaptado para UNets de modelos de difus\u00e3o, e o <strong>n\u00f3 personalizado ComfyUI-GGUF<\/strong> n\u00f3 personalizado de city96 traz esse suporte para o ComfyUI. O resultado pr\u00e1tico: o FLUX.1-dev, que exige cerca de 24 GB de VRAM em precis\u00e3o total BF16, torna-se execut\u00e1vel em uma GPU de 6\u20138 GB com quantiza\u00e7\u00e3o Q4 \u2014 com qualidade de imagem muitas vezes indistingu\u00edvel, a olho nu, da vers\u00e3o em precis\u00e3o total.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_86 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a79afa908b8b\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Alternar<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a79afa908b8b\"  aria-label=\"Alternar\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/pt\/comfyui-gguf-setup\/#Why_GGUF_Matters_for_Image_Generation\" >Por que o GGUF \u00e9 importante para gera\u00e7\u00e3o de imagens<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/pt\/comfyui-gguf-setup\/#Installing_the_ComfyUI-GGUF_Custom_Node\" >Instalando o n\u00f3 personalizado ComfyUI-GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/pt\/comfyui-gguf-setup\/#Getting_GGUF_Model_Files\" >Obtendo arquivos de modelo GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/pt\/comfyui-gguf-setup\/#Where_to_Place_Model_Files\" >Onde colocar os arquivos de modelo<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/pt\/comfyui-gguf-setup\/#Using_the_GGUF_Loader_Nodes\" >Usando os n\u00f3s carregadores GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/pt\/comfyui-gguf-setup\/#Choosing_a_Quantisation_Level\" >Escolhendo um n\u00edvel de quantiza\u00e7\u00e3o<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/pt\/comfyui-gguf-setup\/#Quality_and_Speed_Trade-offs\" >Checkpoints de difus\u00e3o padr\u00e3o s\u00e3o distribu\u00eddos como<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/pt\/comfyui-gguf-setup\/#Frequently_Asked_Questions\" >Perguntas frequentes<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"Why_GGUF_Matters_for_Image_Generation\"><\/span>Por que o GGUF \u00e9 importante para gera\u00e7\u00e3o de imagens<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Os checkpoints de difus\u00e3o padr\u00e3o s\u00e3o distribu\u00eddos como <code>.safetensors<\/code> arquivos em FP16 ou BF16. Para modelos de gera\u00e7\u00f5es anteriores (SD1.5, com cerca de 2 GB, e SDXL, com cerca de 7 GB), isso \u00e9 vi\u00e1vel em hardware de faixa intermedi\u00e1ria. J\u00e1 para os modelos FLUX.1 e SD3, os arquivos em precis\u00e3o total t\u00eam 24 GB e 16 GB, respectivamente \u2014 ultrapassando o limite de VRAM de qualquer GPU voltada ao consumidor.<\/p>\n<p>A quantiza\u00e7\u00e3o GGUF mapeia cada peso para uma representa\u00e7\u00e3o inteira menor. Um peso Q8_0 usa 8 bits em vez de 16, reduzindo aproximadamente \u00e0 metade o tamanho do modelo com perda de qualidade praticamente impercept\u00edvel. As variantes Q4 usam 4 bits por peso, cortando o tamanho para cerca de um quarto do valor em fp16. Essas economias se tornam extremamente significativas em modelos com bilh\u00f5es de par\u00e2metros. Use o <a href=\"https:\/\/convly.ai\/pt\/llm-vram-calculator\/\">Calculadora de VRAM<\/a> para estimar quanto de mem\u00f3ria de GPU ser\u00e1 necess\u00e1ria para um determinado n\u00edvel de quantiza\u00e7\u00e3o antes mesmo de baixar qualquer arquivo.<\/p>\n<p>O FLUX.1 tamb\u00e9m possui um grande codificador de texto T5-XXL (~9,3 GB em fp16). Ao combinar um UNet em formato GGUF com um codificador T5-XXL tamb\u00e9m em GGUF, todo o pipeline completo do FLUX.1 passa a caber em placas de v\u00eddeo que, de outra forma, seriam incapazes de execut\u00e1-lo. Ambos os componentes podem ser carregados independentemente no formato GGUF.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Installing_the_ComfyUI-GGUF_Custom_Node\"><\/span>Instalando o n\u00f3 personalizado ComfyUI-GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Via ComfyUI Manager (recomendado)<\/h3>\n<ol>\n<li>Abra o ComfyUI e clique em <strong>Manager<\/strong> na barra lateral.<\/li>\n<li>Ir para <strong>Instalar N\u00f3s Personalizados<\/strong>.<\/li>\n<li>Pesquise por <code>n\u00f3 personalizado ComfyUI-GGUF<\/code>.<\/li>\n<li>Clique <strong>Instalar<\/strong> ao lado da entrada de city96 e reinicie o ComfyUI.<\/li>\n<\/ol>\n<h3>Instala\u00e7\u00e3o Manual<\/h3>\n<p>Clone o reposit\u00f3rio no seu diret\u00f3rio <code>custom_nodes<\/code> e instale sua depend\u00eancia em Python:<\/p>\n<pre><code>cd ComfyUI\/custom_nodes\ngit clone https:\/\/github.com\/city96\/ComfyUI-GGUF\n<\/code><\/pre>\n<p><strong>Linux \/ macOS (venv):<\/strong><\/p>\n<pre><code>source ComfyUI\/venv\/bin\/activate\npip install -r ComfyUI\/custom_nodes\/ComfyUI-GGUF\/requirements.txt\n<\/code><\/pre>\n<p><strong>Windows (vers\u00e3o port\u00e1til do ComfyUI):<\/strong><\/p>\n<pre><code>ComfyUIpython_embedspython.exe -m pip install -r ComfyUIcustom_nodesComfyUI-GGUFrequirements.txt\n<\/code><\/pre>\n<p><strong>Windows (venv):<\/strong><\/p>\n<pre><code>ComfyUIvenvScriptsactivate.bat\npip install -r ComfyUIcustom_nodesComfyUI-GGUFrequirements.txt\n<\/code><\/pre>\n<p>A principal depend\u00eancia \u00e9 o pacote Python <code>gguf<\/code> . Reinicie o ComfyUI ap\u00f3s a instala\u00e7\u00e3o.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Getting_GGUF_Model_Files\"><\/span>Obtendo arquivos de modelo GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>city96 faz o upload de vers\u00f5es GGUF dos modelos FLUX.1-dev e FLUX.1-schnell no Hugging Face, sob o nome de usu\u00e1rio <code>city96<\/code>. Pesquise por <code>city96 FLUX.1-dev-gguf<\/code> no Hugging Face para encontrar o reposit\u00f3rio. Cada reposit\u00f3rio cont\u00e9m v\u00e1rios <code>.gguf<\/code> arquivos, um para cada n\u00edvel de quantiza\u00e7\u00e3o. Baixe apenas o arquivo correspondente ao n\u00edvel de quantiza\u00e7\u00e3o desejado \u2014 n\u00e3o \u00e9 necess\u00e1rio baixar todos eles.<\/p>\n<p>Vers\u00f5es GGUF do codificador de texto T5-XXL tamb\u00e9m est\u00e3o dispon\u00edveis no Hugging Face (pesquise por <code>t5-v1_1-xxl-encoder-gguf<\/code>). O codificador CLIP-L \u00e9 pequeno o suficiente (~240 MB) para que sua quantiza\u00e7\u00e3o raramente valha o esfor\u00e7o.<\/p>\n<p>Membros da comunidade tamb\u00e9m fazem o upload de variantes GGUF de modelos FLUX ajustados (fine-tuned) no CivitAI. A mesma estrutura de n\u00f3s e diret\u00f3rios se aplica, independentemente da origem do arquivo baixado.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Where_to_Place_Model_Files\"><\/span>Onde colocar os arquivos de modelo<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<table>\n<thead>\n<tr>\n<th>Tipo de arquivo<\/th>\n<th>Diret\u00f3rio<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>UNet de difus\u00e3o GGUF (ex.: <code>flux1-dev-Q4_K_S.gguf<\/code>)<\/td>\n<td><code>ComfyUI\/models\/unet\/<\/code><\/td>\n<\/tr>\n<tr>\n<td>Codificador de texto GGUF (ex.: T5-XXL <code>.gguf<\/code>)<\/td>\n<td><code>ComfyUI\/models\/clip\/<\/code><\/td>\n<\/tr>\n<tr>\n<td>VAE (<code>.safetensors<\/code>, inalterado)<\/td>\n<td><code>ComfyUI\/models\/vae\/<\/code><\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>O VAE do FLUX n\u00e3o \u00e9 quantizado e permanece em seu local padr\u00e3o. Apenas o UNet e o codificador de texto se beneficiam do carregamento em formato GGUF.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Using_the_GGUF_Loader_Nodes\"><\/span>Usando os n\u00f3s carregadores GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Ap\u00f3s instalar o ComfyUI-GGUF e reiniciar, novos n\u00f3s aparecem no navegador de n\u00f3s. Esses n\u00f3s substituem suas vers\u00f5es padr\u00e3o no seu fluxo de trabalho \u2014 voc\u00ea n\u00e3o pode carregar um <code>.gguf<\/code> arquivo com o n\u00f3 padr\u00e3o <code>UNETLoader<\/code>.<\/p>\n<table>\n<thead>\n<tr>\n<th>N\u00f3<\/th>\n<th>Substitui<\/th>\n<th>Aceita<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td><code>UnetLoaderGGUF<\/code><\/td>\n<td><code>UNETLoader<\/code><\/td>\n<td><code>.gguf<\/code> modelos de difus\u00e3o<\/td>\n<\/tr>\n<tr>\n<td><code>UnetLoaderGGUFAdvanced<\/code><\/td>\n<td><code>UNETLoader<\/code><\/td>\n<td><code>.gguf<\/code> com op\u00e7\u00f5es adicionais<\/td>\n<\/tr>\n<tr>\n<td><code>DualCLIPLoaderGGUF<\/code><\/td>\n<td><code>DualCLIPLoader<\/code><\/td>\n<td>GGUF ou <code>.safetensors<\/code> CLIP\/T5<\/td>\n<\/tr>\n<tr>\n<td><code>CLIPLoaderGGUF<\/code><\/td>\n<td><code>CLIPLoader<\/code><\/td>\n<td>\u00danico codificador CLIP em GGUF<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Para um fluxo de trabalho FLUX padr\u00e3o: substitua <code>UNETLoader<\/code> para <code>UnetLoaderGGUF<\/code>, e substitua <code>DualCLIPLoader<\/code> para <code>DualCLIPLoaderGGUF<\/code> se voc\u00ea tamb\u00e9m estiver usando um T5-XXL no formato GGUF. Conecte as sa\u00eddas aos mesmos n\u00f3s downstream de antes \u2014 as formas dos tensores s\u00e3o compat\u00edveis.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Choosing_a_Quantisation_Level\"><\/span>Escolhendo um n\u00edvel de quantiza\u00e7\u00e3o<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>A tabela abaixo mostra valores aproximados apenas para os pesos do UNet do FLUX.1. Seu or\u00e7amento total de VRAM deve tamb\u00e9m cobrir o VAE (~350 MB), os codificadores de texto (240 MB para o CLIP-L, al\u00e9m do que voc\u00ea alocar para o T5-XXL) e os tensores intermedi\u00e1rios durante a gera\u00e7\u00e3o. Use o <a href=\"https:\/\/convly.ai\/pt\/vram-requirements-every-major-llm-2026\/\">Refer\u00eancia de requisitos de VRAM<\/a> juntamente com esta tabela e consulte o <a href=\"https:\/\/convly.ai\/pt\/best-gpus-for-local-llms-2026\/\">guia de GPUs<\/a> se estiver decidindo qual placa comprar.<\/p>\n<table>\n<thead>\n<tr>\n<th>Quantiza\u00e7\u00e3o<\/th>\n<th>Tamanho aproximado do arquivo (UNet do FLUX.1)<\/th>\n<th>VRAM t\u00edpica necess\u00e1ria<\/th>\n<th>Qualidade em compara\u00e7\u00e3o com BF16<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>BF16 (refer\u00eancia)<\/td>\n<td>~24 GB<\/td>\n<td>24+ GB<\/td>\n<td>Refer\u00eancia<\/td>\n<\/tr>\n<tr>\n<td>Q8_0<\/td>\n<td>~12 GB<\/td>\n<td>~13 GB<\/td>\n<td>Quase id\u00eantica<\/td>\n<\/tr>\n<tr>\n<td>Q5_K_S<\/td>\n<td>~8 GB<\/td>\n<td>~8\u20139 GB<\/td>\n<td>Degrada\u00e7\u00e3o m\u00ednima<\/td>\n<\/tr>\n<tr>\n<td>Q4_K_S<\/td>\n<td>~7 GB<\/td>\n<td>~7\u20138 GB<\/td>\n<td>Leve, muitas vezes impercept\u00edvel<\/td>\n<\/tr>\n<tr>\n<td>Q4_0<\/td>\n<td>~6,5 GB<\/td>\n<td>~7 GB<\/td>\n<td>Leve<\/td>\n<\/tr>\n<tr>\n<td>Q3_K_S<\/td>\n<td>~5,5 GB<\/td>\n<td>~6 GB<\/td>\n<td>Moderado<\/td>\n<\/tr>\n<tr>\n<td>Q2_K<\/td>\n<td>~4,5 GB<\/td>\n<td>~5 GB<\/td>\n<td>Percept\u00edvel<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p><strong>Pontos pr\u00e1ticos de partida:<\/strong> Q5_K_S ou Q4_K_S para placas com 8\u201312 GB de VRAM (melhor rela\u00e7\u00e3o qualidade\/VRAM). Q3_K_S ou Q2_K para placas com 6 GB de VRAM, caso voc\u00ea tamb\u00e9m esteja usando um T5-XXL quantizado. Q8_0 para placas com 16 GB de VRAM, quando deseja fidelidade m\u00e1xima mantendo todo o modelo na VRAM.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Quality_and_Speed_Trade-offs\"><\/span>Checkpoints de difus\u00e3o padr\u00e3o s\u00e3o distribu\u00eddos como<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>No n\u00edvel Q8_0, as diferen\u00e7as em rela\u00e7\u00e3o ao BF16 s\u00e3o virtualmente indetect\u00e1veis em compara\u00e7\u00f5es lado a lado. No n\u00edvel Q4_K_S, texturas finas e renderiza\u00e7\u00e3o de texto podem apresentar uma degrada\u00e7\u00e3o muito sutil sob inspe\u00e7\u00e3o minuciosa, mas as sa\u00eddas t\u00eam qualidade adequada para produ\u00e7\u00e3o na maioria dos casos de uso. O Q2_K introduz suaviza\u00e7\u00e3o vis\u00edvel e artefatos ocasionais, especialmente em rostos e detalhes finos \u2014 trata-se de uma solu\u00e7\u00e3o de \u00faltimo recurso para hardware extremamente limitado em mem\u00f3ria.<\/p>\n<p>A velocidade de gera\u00e7\u00e3o com GGUF pode ser compar\u00e1vel ou at\u00e9 superior \u00e0 de carregar um modelo BF16 com descarga para CPU, pois os pesos quantizados reduzem a press\u00e3o sobre a largura de banda de mem\u00f3ria. Contudo, se sua GPU puder manter o modelo BF16 completo inteiramente na VRAM sem descarga, isso geralmente ser\u00e1 mais r\u00e1pido do que a infer\u00eancia com GGUF. A vantagem de desempenho do GGUF \u00e9 mais pronunciada quando a alternativa envolve troca (swapping) de camadas entre VRAM e mem\u00f3ria do sistema.<\/p>\n<p>Em <strong>Apple Silicon (macOS)<\/strong>, o backend MPS suporta infer\u00eancia GGUF por meio do ComfyUI-GGUF, mas as caracter\u00edsticas de desempenho diferem das da CUDA da NVIDIA. Os resultados s\u00e3o funcionais, por\u00e9m a velocidade de gera\u00e7\u00e3o pode ser inferior \u00e0 de uma GPU NVIDIA equivalente. A arquitetura de mem\u00f3ria unificada do Apple Silicon implica que o limite pr\u00e1tico de VRAM \u00e9 maior do que o de GPUs discretas com a mesma capacidade nominal; portanto, voc\u00ea talvez consiga executar n\u00edveis de quantiza\u00e7\u00e3o mais altos do que os sugeridos na tabela acima.<\/p>\n<p>Em <strong>GPUs AMD (Linux, ROCm)<\/strong>, a infer\u00eancia GGUF funciona por meio do backend ROCm do PyTorch. Instale primeiro uma vers\u00e3o do PyTorch compat\u00edvel com ROCm para o ComfyUI antes de instalar o ComfyUI-GGUF. Desempenho e compatibilidade variam conforme a gera\u00e7\u00e3o da GPU; as placas RDNA 3 (s\u00e9rie RX 7000) possuem o suporte mais confi\u00e1vel.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_Asked_Questions\"><\/span>Perguntas frequentes<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Posso carregar um arquivo .gguf com o n\u00f3 padr\u00e3o UNETLoader?<\/h3>\n<p>N\u00e3o. O n\u00f3 padr\u00e3o <code>UNETLoader<\/code> aceita apenas arquivos <code>.safetensors<\/code> . Voc\u00ea deve instalar o n\u00f3 personalizado ComfyUI-GGUF e usar o n\u00f3 <code>UnetLoaderGGUF<\/code> para carregar <code>.gguf<\/code> modelos de difus\u00e3o.<\/p>\n<h3>Preciso quantizar meus pr\u00f3prios modelos ou posso baixar arquivos pr\u00e9-quantizados?<\/h3>\n<p>Para o FLUX.1-dev e o FLUX.1-schnell, o usu\u00e1rio city96 fornece arquivos GGUF pr\u00e9-quantizados no Hugging Face, abrangendo todos os principais n\u00edveis de quantiza\u00e7\u00e3o. Baixe o arquivo <code>.gguf<\/code> espec\u00edfico para o n\u00edvel desejado \u2014 n\u00e3o h\u00e1 necessidade de executar ferramentas de quantiza\u00e7\u00e3o por conta pr\u00f3pria.<\/p>\n<h3>O GGUF funciona para modelos SD1.5 e SDXL?<\/h3>\n<p>Tecnicamente sim, mas o benef\u00edcio \u00e9 pequeno. O SD1.5 tem cerca de 2 GB e o SDXL cerca de 7 GB em fp16 \u2014 ambos j\u00e1 cabem confortavelmente em GPUs consumidoras de faixa m\u00e9dia. A quantiza\u00e7\u00e3o GGUF \u00e9 mais valiosa para modelos muito grandes (FLUX.1, SD3), cujos pesos em precis\u00e3o total excedem a capacidade de VRAM da maioria das placas.<\/p>\n<h3>Um T5-XXL em GGUF \u00e9 sensivelmente pior do que a vers\u00e3o completa em fp16?<\/h3>\n<p>Nos n\u00edveis Q8_0 ou Q5_K_S, a fidelidade ao prompt e a qualidade da codifica\u00e7\u00e3o textual s\u00e3o efetivamente id\u00eanticas \u00e0s da vers\u00e3o em fp16. N\u00edveis mais baixos de quantiza\u00e7\u00e3o (Q2_K, Q3_K_S) podem ocasionalmente produzir uma ader\u00eancia ligeiramente reduzida ao prompt em entradas complexas, mas essa degrada\u00e7\u00e3o \u00e9 sutil em compara\u00e7\u00e3o com o impacto sobre a qualidade do UNet no mesmo n\u00edvel de quantiza\u00e7\u00e3o.<\/p>\n<h3>Meu fluxo de trabalho foi criado para um modelo FLUX em precis\u00e3o total. Preciso reconstru\u00ed-lo?<\/h3>\n<p>N\u00e3o. Substitua <code>UNETLoader<\/code> com <code>UnetLoaderGGUF<\/code> e (opcionalmente) <code>DualCLIPLoader<\/code> com <code>DualCLIPLoaderGGUF<\/code>. Todas as conex\u00f5es downstream \u2014 KSampler, decodifica\u00e7\u00e3o pelo VAE, condicionamento \u2014 permanecem inalteradas. As sa\u00eddas desses n\u00f3s s\u00e3o compat\u00edveis em formato tensorial com o restante de um fluxo de trabalho FLUX padr\u00e3o.<\/p>\n<h3>Por que o ComfyUI ainda esgota a VRAM mesmo com um modelo quantizado?<\/h3>\n<p>O UNet em GGUF representa apenas uma parte do consumo total de VRAM. Um pipeline FLUX completo tamb\u00e9m carrega o CLIP-L (~240 MB), o T5-XXL (at\u00e9 ~9,3 GB em fp16) e o VAE (~350 MB), al\u00e9m dos buffers de trabalho durante a gera\u00e7\u00e3o. Se voc\u00ea ainda estiver esgotando a VRAM, carregue tamb\u00e9m o T5-XXL como GGUF por meio de <code>DualCLIPLoaderGGUF<\/code>e considere ativar o mosaico (tiling) interno do VAE do ComfyUI para a etapa de decodifica\u00e7\u00e3o.<\/p>","protected":false},"excerpt":{"rendered":"<p>GGUF quantisation shrinks large diffusion models like FLUX.1 from ~24 GB to 5\u201312 GB, letting them run on consumer GPUs [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":2152,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2151","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/2151","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/comments?post=2151"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/2151\/revisions"}],"predecessor-version":[{"id":2153,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/2151\/revisions\/2153"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/media\/2152"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/media?parent=2151"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/categories?post=2151"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/tags?post=2151"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}