{"id":2151,"date":"2026-08-10T06:29:04","date_gmt":"2026-08-10T06:29:04","guid":{"rendered":"https:\/\/convly.ai\/?p=2151"},"modified":"2026-08-10T06:29:04","modified_gmt":"2026-08-10T06:29:04","slug":"comfyui-gguf-setup","status":"publish","type":"post","link":"https:\/\/convly.ai\/es\/comfyui-gguf-setup\/","title":{"rendered":"ComfyUI GGUF: ejecute grandes modelos de difusi\u00f3n en GPUs con poca VRAM"},"content":{"rendered":"<div class=\"convly-tldr\">\n<ul>\n<li>La cuantizaci\u00f3n GGUF reduce el tama\u00f1o de grandes modelos de difusi\u00f3n como FLUX.1 (de ~24 GB a 5\u201312 GB), permitiendo su ejecuci\u00f3n en GPUs de consumo con 6\u201316 GB de VRAM.<\/li>\n<li>Instale el <strong>nodo personalizado ComfyUI-GGUF<\/strong> del desarrollador city96, coloque los <code>.gguf<\/code> archivos en <code>ComfyUI\/models\/unet\/<\/code>, y use el nodo <code>UnetLoaderGGUF<\/code> en lugar del cargador est\u00e1ndar UNETLoader.<\/li>\n<li>Q4_K_S o Q5_K_S ofrecen la mejor relaci\u00f3n calidad-VRAM para la mayor\u00eda de las tarjetas gr\u00e1ficas. Q8_0 es casi sin p\u00e9rdidas, pero ahorra menos memoria. Q2_K est\u00e1 orientado a GPUs de 4\u20136 GB, con compromisos visibles en la calidad.<\/li>\n<li>El codificador de texto T5-XXL de FLUX (~9 GB en fp16) tambi\u00e9n puede cargarse como GGUF mediante <code>DualCLIPLoaderGGUF<\/code>, liberando as\u00ed una cantidad significativa adicional de VRAM.<\/li>\n<\/ul>\n<\/div>\n<p>GGUF es un formato binario desarrollado por el proyecto llama.cpp para almacenar pesos cuantizados de redes neuronales. Originalmente dise\u00f1ado para LLM, fue adaptado para las UNets de modelos de difusi\u00f3n, y el <strong>nodo personalizado ComfyUI-GGUF<\/strong> nodo personalizado de city96 incorpora ese soporte a ComfyUI. El resultado pr\u00e1ctico: FLUX.1-dev, que requiere aproximadamente 24 GB de VRAM en precisi\u00f3n completa BF16, se vuelve ejecutable en una GPU de 6\u20138 GB con cuantizaci\u00f3n Q4 \u2014con una calidad de imagen que, a menudo, resulta indistinguible a simple vista del modelo en precisi\u00f3n completa.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_86 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a79b115da449\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Alternar<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a79b115da449\"  aria-label=\"Alternar\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/es\/comfyui-gguf-setup\/#Why_GGUF_Matters_for_Image_Generation\" >Por qu\u00e9 GGUF es relevante para la generaci\u00f3n de im\u00e1genes<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/es\/comfyui-gguf-setup\/#Installing_the_ComfyUI-GGUF_Custom_Node\" >Instalaci\u00f3n del nodo personalizado ComfyUI-GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/es\/comfyui-gguf-setup\/#Getting_GGUF_Model_Files\" >Obtenci\u00f3n de archivos de modelos GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/es\/comfyui-gguf-setup\/#Where_to_Place_Model_Files\" >D\u00f3nde colocar los archivos de modelos<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/es\/comfyui-gguf-setup\/#Using_the_GGUF_Loader_Nodes\" >Uso de los nodos cargadores GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/es\/comfyui-gguf-setup\/#Choosing_a_Quantisation_Level\" >Elecci\u00f3n del nivel de cuantizaci\u00f3n<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/es\/comfyui-gguf-setup\/#Quality_and_Speed_Trade-offs\" >Los puntos de control est\u00e1ndar de difusi\u00f3n se distribuyen como<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/es\/comfyui-gguf-setup\/#Frequently_Asked_Questions\" >Preguntas frecuentes<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"Why_GGUF_Matters_for_Image_Generation\"><\/span>Por qu\u00e9 GGUF es relevante para la generaci\u00f3n de im\u00e1genes<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>.safetensors <code>.safetensors<\/code> archivos en FP16 o BF16. Para modelos de generaciones anteriores (SD1.5, unos 2 GB; SDXL, unos 7 GB), esto es manejable en hardware de gama media. En cambio, los archivos de precisi\u00f3n completa de FLUX.1 y SD3 ocupan 24 GB y 16 GB respectivamente, superando el l\u00edmite de VRAM de cualquier GPU consumidora individual.<\/p>\n<p>La cuantizaci\u00f3n GGUF asigna cada peso a una representaci\u00f3n entera m\u00e1s peque\u00f1a. Un peso Q8_0 utiliza 8 bits en lugar de 16, reduciendo aproximadamente a la mitad el tama\u00f1o del modelo con una p\u00e9rdida de calidad pr\u00e1cticamente imperceptible. Las variantes Q4 usan 4 bits por peso, reduciendo el tama\u00f1o a aproximadamente una cuarta parte del formato fp16. Estos ahorros se acumulan de forma espectacular en modelos con miles de millones de par\u00e1metros. Utilice la <a href=\"https:\/\/convly.ai\/es\/llm-vram-calculator\/\">Calculadora de VRAM<\/a> calculadora de memoria GPU<\/p>\n<p>FLUX.1 tambi\u00e9n incluye un codificador de texto T5-XXL de gran tama\u00f1o (~9,3 GB en fp16). Combinar un UNet en formato GGUF con un codificador T5-XXL tambi\u00e9n en GGUF permite que toda la canalizaci\u00f3n FLUX.1 se ejecute en tarjetas gr\u00e1ficas que, de otro modo, ser\u00edan completamente incapaces de ejecutarlo. Ambos componentes pueden cargarse de forma independiente en formato GGUF.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Installing_the_ComfyUI-GGUF_Custom_Node\"><\/span>Instalaci\u00f3n del nodo personalizado ComfyUI-GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Mediante ComfyUI Manager (recomendado)<\/h3>\n<ol>\n<li>Abra ComfyUI y haga clic en <strong>Manager<\/strong> en la barra lateral.<\/li>\n<li>Ir a <strong>Instalar nodos personalizados<\/strong>.<\/li>\n<li>Busque <code>nodo personalizado ComfyUI-GGUF<\/code>.<\/li>\n<li>Haga clic <strong>Instalar<\/strong> junto a la entrada de city96 y reinicie ComfyUI.<\/li>\n<\/ol>\n<h3>Instalaci\u00f3n manual<\/h3>\n<p>Clone el repositorio en su directorio <code>custom_nodes<\/code> y luego instale su dependencia en Python:<\/p>\n<pre><code>cd ComfyUI\/custom_nodes\ngit clone https:\/\/github.com\/city96\/ComfyUI-GGUF\n<\/code><\/pre>\n<p><strong>Linux \/ macOS (entorno virtual):<\/strong><\/p>\n<pre><code>source ComfyUI\/venv\/bin\/activate\npip install -r ComfyUI\/custom_nodes\/ComfyUI-GGUF\/requirements.txt\n<\/code><\/pre>\n<p><strong>Windows (versi\u00f3n port\u00e1til de ComfyUI):<\/strong><\/p>\n<pre><code>ComfyUIpython_embedspython.exe -m pip install -r ComfyUIcustom_nodesComfyUI-GGUFrequirements.txt\n<\/code><\/pre>\n<p><strong>Windows (entorno virtual):<\/strong><\/p>\n<pre><code>ComfyUIvenvScriptsactivate.bat\npip install -r ComfyUIcustom_nodesComfyUI-GGUFrequirements.txt\n<\/code><\/pre>\n<p>La dependencia principal es el paquete Python <code>gguf<\/code> . Reinicie ComfyUI tras la instalaci\u00f3n.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Getting_GGUF_Model_Files\"><\/span>Obtenci\u00f3n de archivos de modelos GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>city96 publica versiones GGUF de FLUX.1-dev y FLUX.1-schnell en Hugging Face bajo el nombre de usuario <code>city96<\/code>. Busque <code>city96 FLUX.1-dev-gguf<\/code> en Hugging Face para encontrar el repositorio. Cada repositorio contiene varios <code>.gguf<\/code> archivos, uno por nivel de cuantizaci\u00f3n. Descargue \u00fanicamente el archivo correspondiente al nivel de cuantizaci\u00f3n deseado; no necesita descargarlos todos.<\/p>\n<p>Tambi\u00e9n est\u00e1n disponibles en Hugging Face versiones GGUF del codificador de texto T5-XXL (busque <code>t5-v1_1-xxl-encoder-gguf<\/code>). El codificador CLIP-L es lo suficientemente peque\u00f1o (~240 MB) como para que rara vez merezca la pena cuantizarlo.<\/p>\n<p>Miembros de la comunidad tambi\u00e9n suben variantes GGUF de modelos FLUX ajustados finamente a CivitAI. La misma estructura de nodos y directorios se aplica independientemente del origen desde donde descargue el archivo.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Where_to_Place_Model_Files\"><\/span>D\u00f3nde colocar los archivos de modelos<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<table>\n<thead>\n<tr>\n<th>Tipo de archivo<\/th>\n<th>Directorio<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>UNet de difusi\u00f3n GGUF (p. ej., <code>flux1-dev-Q4_K_S.gguf<\/code>)<\/td>\n<td><code>ComfyUI\/models\/unet\/<\/code><\/td>\n<\/tr>\n<tr>\n<td>Codificador de texto GGUF (p. ej., T5-XXL) <code>.gguf<\/code>)<\/td>\n<td><code>ComfyUI\/models\/clip\/<\/code><\/td>\n<\/tr>\n<tr>\n<td>VAE (<code>.safetensors<\/code>, sin cambios)<\/td>\n<td><code>ComfyUI\/models\/vae\/<\/code><\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>El VAE para FLUX no est\u00e1 cuantizado y permanece en su ubicaci\u00f3n habitual. \u00danicamente el UNet y el codificador de texto se benefician de la carga en formato GGUF.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Using_the_GGUF_Loader_Nodes\"><\/span>Uso de los nodos cargadores GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Tras instalar ComfyUI-GGUF y reiniciar, aparecen nuevos nodos en el navegador de nodos. Estos reemplazan a sus equivalentes est\u00e1ndar en su flujo de trabajo: no puede cargar un <code>.gguf<\/code> archivo <code>UNETLoader<\/code>.<\/p>\n<table>\n<thead>\n<tr>\n<th>est\u00e1ndar.<\/th>\n<th>Reemplaza<\/th>\n<th>Acepta<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td><code>UnetLoaderGGUF<\/code><\/td>\n<td><code>UNETLoader<\/code><\/td>\n<td><code>.gguf<\/code> modelos de difusi\u00f3n<\/td>\n<\/tr>\n<tr>\n<td><code>UnetLoaderGGUFAdvanced<\/code><\/td>\n<td><code>UNETLoader<\/code><\/td>\n<td><code>.gguf<\/code> con opciones adicionales<\/td>\n<\/tr>\n<tr>\n<td><code>DualCLIPLoaderGGUF<\/code><\/td>\n<td><code>DualCLIPLoader<\/code><\/td>\n<td>GGUF o <code>.safetensors<\/code> CLIP\/T5<\/td>\n<\/tr>\n<tr>\n<td><code>CLIPLoaderGGUF<\/code><\/td>\n<td><code>CLIPLoader<\/code><\/td>\n<td>Codificador CLIP \u00fanico en formato GGUF<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Para un flujo de trabajo FLUX est\u00e1ndar: sustituya <code>UNETLoader<\/code> para <code>UnetLoaderGGUF<\/code>, y sustituya <code>DualCLIPLoader<\/code> para <code>DualCLIPLoaderGGUF<\/code> si tambi\u00e9n est\u00e1 utilizando un T5-XXL en formato GGUF. Conecte las salidas a los mismos nodos descendentes que antes: las formas de los tensores son compatibles.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Choosing_a_Quantisation_Level\"><\/span>Elecci\u00f3n del nivel de cuantizaci\u00f3n<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>La tabla siguiente muestra cifras aproximadas \u00fanicamente para los pesos del UNet de FLUX.1. Su presupuesto total de VRAM debe cubrir adem\u00e1s el VAE (~350 MB), los codificadores de texto (240 MB para CLIP-L, m\u00e1s la memoria asignada al T5-XXL) y los tensores intermedios durante la generaci\u00f3n. Utilice la <a href=\"https:\/\/convly.ai\/es\/vram-requirements-every-major-llm-2026\/\">Referencia de requisitos de VRAM<\/a> junto con esta tabla y consulte la <a href=\"https:\/\/convly.ai\/es\/best-gpus-for-local-llms-2026\/\">gu\u00eda para GPUs<\/a> si est\u00e1 decidiendo qu\u00e9 tarjeta comprar.<\/p>\n<table>\n<thead>\n<tr>\n<th>Cuantizaci\u00f3n<\/th>\n<th>Tama\u00f1o aproximado del archivo (UNet de FLUX.1)<\/th>\n<th>VRAM t\u00edpica necesaria<\/th>\n<th>Calidad frente a BF16<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>BF16 (referencia)<\/td>\n<td>~24 GB<\/td>\n<td>24+ GB<\/td>\n<td>Referencia<\/td>\n<\/tr>\n<tr>\n<td>Q8_0<\/td>\n<td>~12 GB<\/td>\n<td>~13 GB<\/td>\n<td>Casi id\u00e9ntica<\/td>\n<\/tr>\n<tr>\n<td>Q5_K_S<\/td>\n<td>~8 GB<\/td>\n<td>~8\u20139 GB<\/td>\n<td>Degradaci\u00f3n m\u00ednima<\/td>\n<\/tr>\n<tr>\n<td>Q4_K_S<\/td>\n<td>~7 GB<\/td>\n<td>~7\u20138 GB<\/td>\n<td>Ligera, a menudo imperceptible<\/td>\n<\/tr>\n<tr>\n<td>Q4_0<\/td>\n<td>~6,5 GB<\/td>\n<td>~7 GB<\/td>\n<td>Ligera<\/td>\n<\/tr>\n<tr>\n<td>Q3_K_S<\/td>\n<td>~5,5 GB<\/td>\n<td>~6 GB<\/td>\n<td>Moderado<\/td>\n<\/tr>\n<tr>\n<td>Q2_K<\/td>\n<td>~4,5 GB<\/td>\n<td>~5 GB<\/td>\n<td>Notable<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p><strong>Puntos pr\u00e1cticos de partida:<\/strong> Q5_K_S o Q4_K_S para tarjetas de 8\u201312 GB (mejor relaci\u00f3n calidad\/VRAM). Q3_K_S o Q2_K para tarjetas de 6 GB si tambi\u00e9n utiliza un T5-XXL cuantizado. Q8_0 para tarjetas de 16 GB cuando desee m\u00e1xima fidelidad manteniendo el modelo \u00edntegramente en la VRAM.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Quality_and_Speed_Trade-offs\"><\/span>Los puntos de control est\u00e1ndar de difusi\u00f3n se distribuyen como<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>En Q8_0, las diferencias respecto a BF16 son virtualmente imperceptibles en comparaciones lado a lado. En Q4_K_S, pueden observarse degradaciones muy sutiles en texturas finas y renderizado de texto tras una inspecci\u00f3n minuciosa, pero las salidas son de calidad profesional para la mayor\u00eda de los casos de uso. Q2_K introduce una suavidad visible y artefactos ocasionales, especialmente en rostros y detalles finos; se trata de una opci\u00f3n de \u00faltimo recurso para hardware extremadamente limitado en memoria.<\/p>\n<p>La velocidad de generaci\u00f3n con GGUF puede ser comparable o incluso superior a la de cargar un modelo BF16 con descarga a CPU, ya que los pesos cuantizados reducen la presi\u00f3n sobre el ancho de banda de memoria. Sin embargo, si su GPU puede alojar \u00edntegramente el modelo BF16 en la VRAM sin descarga, esto generalmente ser\u00e1 m\u00e1s r\u00e1pido que la inferencia con GGUF. La ventaja de velocidad de GGUF es m\u00e1s pronunciada cuando la alternativa implica intercambiar capas entre la VRAM y la memoria del sistema.<\/p>\n<p>En <strong>Apple Silicon (macOS)<\/strong>, el backend MPS admite la inferencia GGUF mediante ComfyUI-GGUF, aunque las caracter\u00edsticas de rendimiento difieren de las de CUDA de NVIDIA. Los resultados son funcionales, pero la velocidad de generaci\u00f3n puede ser inferior a la de una GPU NVIDIA equivalente. La arquitectura de memoria unificada de Apple Silicon implica que el l\u00edmite pr\u00e1ctico de VRAM es mayor que el de las GPUs discretas con la misma capacidad nominal, por lo que podr\u00eda ejecutar niveles de cuantizaci\u00f3n superiores a los indicados en la tabla anterior.<\/p>\n<p>En <strong>GPUs AMD (Linux, ROCm)<\/strong>, la inferencia GGUF funciona mediante el backend ROCm de PyTorch. Instale previamente la versi\u00f3n de PyTorch compatible con ROCm para ComfyUI antes de instalar ComfyUI-GGUF. El rendimiento y la compatibilidad var\u00edan seg\u00fan la generaci\u00f3n de la GPU; las tarjetas RDNA 3 (serie RX 7000) ofrecen el soporte m\u00e1s fiable.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_Asked_Questions\"><\/span>Preguntas frecuentes<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>\u00bfPuedo cargar un archivo .gguf con el nodo est\u00e1ndar UNETLoader?<\/h3>\n<p>No. El nodo est\u00e1ndar <code>UNETLoader<\/code> solo acepta archivos <code>.safetensors<\/code> . Debe instalar el nodo personalizado ComfyUI-GGUF y utilizar <code>UnetLoaderGGUF<\/code> para cargar modelos de difusi\u00f3n <code>.gguf<\/code> .<\/p>\n<h3>\u00bfNecesito cuantizar yo mismo mis modelos o puedo descargar archivos ya cuantizados?<\/h3>\n<p>Para FLUX.1-dev y FLUX.1-schnell, city96 proporciona en Hugging Face archivos GGUF pre-cuantizados que cubren todos los principales niveles de cuantizaci\u00f3n. Descargue el archivo <code>.gguf<\/code> espec\u00edfico correspondiente al nivel deseado; no necesita ejecutar ninguna herramienta de cuantizaci\u00f3n por su cuenta.<\/p>\n<h3>\u00bfFunciona GGUF con modelos SD1.5 y SDXL?<\/h3>\n<p>T\u00e9cnicamente s\u00ed, pero el beneficio es peque\u00f1o. SD1.5 ocupa ~2 GB y SDXL ~7 GB en fp16, ambos caben c\u00f3modamente en GPUs de gama media para consumidores. La cuantizaci\u00f3n GGUF resulta m\u00e1s valiosa para modelos muy grandes (FLUX.1, SD3), cuyos pesos en precisi\u00f3n completa superan la capacidad de VRAM de la mayor\u00eda de las tarjetas.<\/p>\n<h3>\u00bfUn T5-XXL en GGUF es notablemente peor que la versi\u00f3n fp16 completa?<\/h3>\n<p>En Q8_0 o Q5_K_S, el seguimiento de prompts y la calidad de la codificaci\u00f3n textual son efectivamente id\u00e9nticos a los de fp16. En niveles de cuantizaci\u00f3n inferiores (Q2_K, Q3_K_S) puede producirse ocasionalmente una adherencia ligeramente reducida a prompts complejos, pero este efecto es sutil comparado con el impacto sobre la calidad del UNet al mismo nivel de cuantizaci\u00f3n.<\/p>\n<h3>Mi flujo de trabajo fue creado para un modelo FLUX en precisi\u00f3n completa. \u00bfDebo reconstruirlo?<\/h3>\n<p>No. Sustituya <code>UNETLoader<\/code> con <code>UnetLoaderGGUF<\/code> y (opcionalmente) <code>DualCLIPLoader<\/code> con <code>DualCLIPLoaderGGUF<\/code>. Todas las conexiones descendentes \u2014 KSampler, decodificaci\u00f3n VAE, condicionamiento \u2014 permanecen sin cambios. Las salidas de estos nodos son compatibles en forma de tensor con el resto de un flujo de trabajo FLUX est\u00e1ndar.<\/p>\n<h3>\u00bfPor qu\u00e9 ComfyUI sigue agotando la VRAM incluso con un modelo cuantizado?<\/h3>\n<p>El UNet GGUF constituye solo una parte del consumo total de VRAM. Una canalizaci\u00f3n FLUX completa tambi\u00e9n carga CLIP-L (~240 MB), T5-XXL (hasta ~9,3 GB en fp16) y el VAE (~350 MB), adem\u00e1s de los b\u00faferes de trabajo durante la generaci\u00f3n. Si sigue experimentando agotamiento de VRAM, cargue tambi\u00e9n el T5-XXL en formato GGUF mediante <code>DualCLIPLoaderGGUF<\/code>y considere habilitar el mosaico integrado del VAE en ComfyUI para el paso de decodificaci\u00f3n.<\/p>","protected":false},"excerpt":{"rendered":"<p>GGUF quantisation shrinks large diffusion models like FLUX.1 from ~24 GB to 5\u201312 GB, letting them run on consumer GPUs [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":2152,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2151","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/posts\/2151","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/comments?post=2151"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/posts\/2151\/revisions"}],"predecessor-version":[{"id":2153,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/posts\/2151\/revisions\/2153"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/media\/2152"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/media?parent=2151"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/categories?post=2151"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/tags?post=2151"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}