{"id":2151,"date":"2026-08-10T06:29:04","date_gmt":"2026-08-10T06:29:04","guid":{"rendered":"https:\/\/convly.ai\/?p=2151"},"modified":"2026-08-10T06:29:04","modified_gmt":"2026-08-10T06:29:04","slug":"comfyui-gguf-setup","status":"publish","type":"post","link":"https:\/\/convly.ai\/fr\/comfyui-gguf-setup\/","title":{"rendered":"ComfyUI GGUF : ex\u00e9cutez de grands mod\u00e8les de diffusion sur des GPU \u00e0 faible VRAM"},"content":{"rendered":"<div class=\"convly-tldr\">\n<ul>\n<li>La quantification GGUF r\u00e9duit consid\u00e9rablement la taille des grands mod\u00e8les de diffusion comme FLUX.1 (environ 24 Go en fp16) \u00e0 5\u201312 Go, permettant ainsi leur ex\u00e9cution sur des GPU grand public dot\u00e9s de 6 \u00e0 16 Go de VRAM.<\/li>\n<li>Installez le <strong>n\u0153ud personnalis\u00e9 ComfyUI-GGUF<\/strong> d\u00e9velopp\u00e9 par city96, placez les <code>.gguf<\/code> fichiers dans le dossier <code>ComfyUI\/models\/unet\/<\/code>et utilisez le n\u0153ud <code>UnetLoaderGGUF<\/code> \u00e0 la place du chargeur UNET standard.<\/li>\n<li>Les niveaux Q4_K_S ou Q5_K_S offrent g\u00e9n\u00e9ralement le meilleur rapport qualit\u00e9\/VRAM pour la plupart des cartes graphiques. Q8_0 est quasi sans perte mais permet une \u00e9conomie moindre de m\u00e9moire. Q2_K cible les GPU disposant de 4 \u00e0 6 Go de VRAM, avec des compromis visibles sur la qualit\u00e9.<\/li>\n<li>L\u2019encodeur textuel T5-XXL de FLUX (~9 Go en fp16) peut \u00e9galement \u00eatre charg\u00e9 au format GGUF via le n\u0153ud <code>DualCLIPLoaderGGUF<\/code>ce qui lib\u00e8re une quantit\u00e9 significative de VRAM suppl\u00e9mentaire.<\/li>\n<\/ul>\n<\/div>\n<p>GGUF est un format binaire d\u00e9velopp\u00e9 par le projet llama.cpp pour stocker des poids de r\u00e9seaux neuronaux quantifi\u00e9s. Initialement con\u00e7u pour les LLM, il a \u00e9t\u00e9 adapt\u00e9 aux UNets des mod\u00e8les de diffusion, et le <strong>n\u0153ud personnalis\u00e9 ComfyUI-GGUF<\/strong> n\u0153ud personnalis\u00e9 de city96 int\u00e8gre cette fonctionnalit\u00e9 dans ComfyUI. Le r\u00e9sultat pratique : FLUX.1-dev, qui n\u00e9cessite environ 24 Go de VRAM en pr\u00e9cision BF16 compl\u00e8te, devient ex\u00e9cutable sur un GPU de 6 \u00e0 8 Go avec une quantification Q4 \u2014 tout en conservant une qualit\u00e9 d\u2019image souvent indiscernable, \u00e0 l\u2019\u0153il nu, de celle du mod\u00e8le en pleine pr\u00e9cision.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_86 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a79af0bdf231\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Basculer<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a79af0bdf231\"  aria-label=\"Basculer\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/fr\/comfyui-gguf-setup\/#Why_GGUF_Matters_for_Image_Generation\" >Pourquoi GGUF est essentiel pour la g\u00e9n\u00e9ration d\u2019images<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/fr\/comfyui-gguf-setup\/#Installing_the_ComfyUI-GGUF_Custom_Node\" >Installation du n\u0153ud personnalis\u00e9 ComfyUI-GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/fr\/comfyui-gguf-setup\/#Getting_GGUF_Model_Files\" >Obtention des fichiers mod\u00e8les GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/fr\/comfyui-gguf-setup\/#Where_to_Place_Model_Files\" >Emplacement des fichiers mod\u00e8les<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/fr\/comfyui-gguf-setup\/#Using_the_GGUF_Loader_Nodes\" >Utilisation des n\u0153uds chargeurs GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/fr\/comfyui-gguf-setup\/#Choosing_a_Quantisation_Level\" >Choix du niveau de quantification<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/fr\/comfyui-gguf-setup\/#Quality_and_Speed_Trade-offs\" >Les checkpoints standards de diffusion sont fournis au format<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/fr\/comfyui-gguf-setup\/#Frequently_Asked_Questions\" >Questions fr\u00e9quemment pos\u00e9es<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"Why_GGUF_Matters_for_Image_Generation\"><\/span>Pourquoi GGUF est essentiel pour la g\u00e9n\u00e9ration d\u2019images<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Les points de contr\u00f4le standard de diffusion sont fournis sous la forme de <code>.safetensors<\/code> fichiers en FP16 ou BF16. Pour les mod\u00e8les plus anciens (SD1.5, environ 2 Go ; SDXL, environ 7 Go), cela reste g\u00e9rable sur du mat\u00e9riel milieu de gamme. En revanche, pour FLUX.1 et SD3, les fichiers en pr\u00e9cision compl\u00e8te p\u00e8sent respectivement 24 Go et 16 Go \u2014 d\u00e9passant largement la capacit\u00e9 de VRAM de toute carte graphique grand public.<\/p>\n<p>La quantification GGUF mappe chaque poids vers une repr\u00e9sentation enti\u00e8re plus compacte. Un poids Q8_0 utilise 8 bits au lieu de 16, r\u00e9duisant ainsi d\u2019environ moiti\u00e9 la taille du mod\u00e8le sans perte de qualit\u00e9 notable. Les variantes Q4 utilisent 4 bits par poids, ramenant la taille \u00e0 environ un quart de celle du format fp16. Ces gains s\u2019accumulent de fa\u00e7on spectaculaire sur les mod\u00e8les comptant des milliards de param\u00e8tres. Utilisez le <a href=\"https:\/\/convly.ai\/fr\/llm-vram-calculator\/\">Calculateur de VRAM<\/a> pour estimer la quantit\u00e9 de m\u00e9moire GPU n\u00e9cessaire \u00e0 un niveau de quantification donn\u00e9, avant m\u00eame de t\u00e9l\u00e9charger quoi que ce soit.<\/p>\n<p>FLUX.1 int\u00e8gre \u00e9galement un grand encodeur textuel T5-XXL (environ 9,3 Go en fp16). Associer un UNet GGUF \u00e0 un encodeur T5-XXL \u00e9galement au format GGUF permet de faire tenir l\u2019ensemble du pipeline FLUX.1 sur des cartes graphiques qui, autrement, seraient totalement incapables de l\u2019ex\u00e9cuter. Ces deux composants peuvent \u00eatre charg\u00e9s ind\u00e9pendamment au format GGUF.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Installing_the_ComfyUI-GGUF_Custom_Node\"><\/span>Installation du n\u0153ud personnalis\u00e9 ComfyUI-GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Via ComfyUI Manager (recommand\u00e9)<\/h3>\n<ol>\n<li>Ouvrez ComfyUI, puis cliquez sur <strong>Manager<\/strong> dans la barre lat\u00e9rale.<\/li>\n<li>Aller \u00e0 <strong>Installer des n\u0153uds personnalis\u00e9s<\/strong>.<\/li>\n<li>Recherchez <code>n\u0153ud personnalis\u00e9 ComfyUI-GGUF<\/code>.<\/li>\n<li>Cliquez <strong>Installer<\/strong> \u00e0 c\u00f4t\u00e9 de l\u2019entr\u00e9e publi\u00e9e par city96, puis red\u00e9marrez ComfyUI.<\/li>\n<\/ol>\n<h3>Installation manuelle<\/h3>\n<p>Clonez le d\u00e9p\u00f4t dans votre dossier <code>custom_nodes<\/code> puis installez sa d\u00e9pendance Python :<\/p>\n<pre><code>cd ComfyUI\/custom_nodes\ngit clone https:\/\/github.com\/city96\/ComfyUI-GGUF\n<\/code><\/pre>\n<p><strong>Linux \/ macOS (environnement virtuel) :<\/strong><\/p>\n<pre><code>source ComfyUI\/venv\/bin\/activate\npip install -r ComfyUI\/custom_nodes\/ComfyUI-GGUF\/requirements.txt\n<\/code><\/pre>\n<p><strong>Windows (version portable de ComfyUI) :<\/strong><\/p>\n<pre><code>ComfyUIpython_embedspython.exe -m pip install -r ComfyUIcustom_nodesComfyUI-GGUFrequirements.txt\n<\/code><\/pre>\n<p><strong>Windows (environnement virtuel) :<\/strong><\/p>\n<pre><code>ComfyUIvenvScriptsactivate.bat\npip install -r ComfyUIcustom_nodesComfyUI-GGUFrequirements.txt\n<\/code><\/pre>\n<p>La d\u00e9pendance principale est le paquet Python <code>gguf<\/code> . Red\u00e9marrez ComfyUI apr\u00e8s l\u2019installation.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Getting_GGUF_Model_Files\"><\/span>Obtention des fichiers mod\u00e8les GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>city96 publie sur Hugging Face des versions GGUF de FLUX.1-dev et FLUX.1-schnell sous le nom d\u2019utilisateur <code>city96<\/code>. Recherchez <code>city96 FLUX.1-dev-gguf<\/code> sur Hugging Face pour localiser le d\u00e9p\u00f4t correspondant. Chaque d\u00e9p\u00f4t contient plusieurs fichiers, chacun correspondant \u00e0 un niveau de quantification diff\u00e9rent. T\u00e9l\u00e9chargez uniquement le fichier correspondant au niveau de quantification souhait\u00e9 \u2014 il n\u2019est pas n\u00e9cessaire de t\u00e9l\u00e9charger l\u2019ensemble des fichiers. <code>.gguf<\/code> des fichiers<\/p>\n<p>Des versions GGUF de l\u2019encodeur textuel T5-XXL sont \u00e9galement disponibles sur Hugging Face (recherchez <code>t5-v1_1-xxl-encoder-gguf<\/code>). L\u2019encodeur CLIP-L \u00e9tant suffisamment l\u00e9ger (~240 Mo), sa quantification est rarement justifi\u00e9e.<\/p>\n<p>Des membres de la communaut\u00e9 publient \u00e9galement sur CivitAI des variantes GGUF de mod\u00e8les FLUX affin\u00e9s. La m\u00eame structure de n\u0153uds et de dossiers s\u2019applique, quelle que soit l\u2019origine du fichier t\u00e9l\u00e9charg\u00e9.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Where_to_Place_Model_Files\"><\/span>Emplacement des fichiers mod\u00e8les<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<table>\n<thead>\n<tr>\n<th>Type de fichier<\/th>\n<th>R\u00e9pertoire<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>UNet de diffusion GGUF (ex. : <code>flux1-dev-Q4_K_S.gguf<\/code>)<\/td>\n<td><code>ComfyUI\/models\/unet\/<\/code><\/td>\n<\/tr>\n<tr>\n<td>Encodeur textuel GGUF (ex. : T5-XXL <code>.gguf<\/code>)<\/td>\n<td><code>ComfyUI\/models\/clip\/<\/code><\/td>\n<\/tr>\n<tr>\n<td>VAE (<code>.safetensors<\/code>, inchang\u00e9)<\/td>\n<td><code>ComfyUI\/models\/vae\/<\/code><\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Le VAE utilis\u00e9 par FLUX n\u2019est pas quantifi\u00e9 et reste \u00e0 son emplacement habituel. Seuls l\u2019UNet et l\u2019encodeur textuel b\u00e9n\u00e9ficient du chargement GGUF.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Using_the_GGUF_Loader_Nodes\"><\/span>Utilisation des n\u0153uds chargeurs GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Une fois ComfyUI-GGUF install\u00e9 et ComfyUI red\u00e9marr\u00e9, de nouveaux n\u0153uds apparaissent dans le navigateur de n\u0153uds. Ils remplacent leurs \u00e9quivalents standard dans vos workflows \u2014 vous ne pouvez pas charger un fichier <code>.gguf<\/code> avec le n\u0153ud standard <code>UNETLoader<\/code>.<\/p>\n<table>\n<thead>\n<tr>\n<th>N\u0153ud<\/th>\n<th>Remplace<\/th>\n<th>Accepte<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td><code>UnetLoaderGGUF<\/code><\/td>\n<td><code>UNETLoader<\/code><\/td>\n<td><code>.gguf<\/code> mod\u00e8les de diffusion<\/td>\n<\/tr>\n<tr>\n<td><code>UnetLoaderGGUFAdvanced<\/code><\/td>\n<td><code>UNETLoader<\/code><\/td>\n<td><code>.gguf<\/code> avec options suppl\u00e9mentaires<\/td>\n<\/tr>\n<tr>\n<td><code>DualCLIPLoaderGGUF<\/code><\/td>\n<td><code>DualCLIPLoader<\/code><\/td>\n<td>GGUF ou <code>.safetensors<\/code> CLIP\/T5<\/td>\n<\/tr>\n<tr>\n<td><code>CLIPLoaderGGUF<\/code><\/td>\n<td><code>CLIPLoader<\/code><\/td>\n<td>Encodeur CLIP unique au format GGUF<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Pour un flux de travail FLUX standard : remplacez <code>UNETLoader<\/code> pour <code>UnetLoaderGGUF<\/code>, et remplacez <code>DualCLIPLoader<\/code> pour <code>DualCLIPLoaderGGUF<\/code> si vous utilisez \u00e9galement un T5-XXL au format GGUF. Connectez les sorties aux m\u00eames n\u0153uds aval qu\u2019auparavant \u2014 les formes des tenseurs sont compatibles.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Choosing_a_Quantisation_Level\"><\/span>Choix du niveau de quantification<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Le tableau ci-dessous indique des valeurs approximatives relatives aux poids du r\u00e9seau UNet de FLUX.1 uniquement. Votre budget total de VRAM doit \u00e9galement couvrir le VAE (~350 Mo), les encodeurs de texte (240 Mo pour CLIP-L, plus la m\u00e9moire allou\u00e9e au T5-XXL) ainsi que les tenseurs interm\u00e9diaires utilis\u00e9s pendant la g\u00e9n\u00e9ration. Utilisez le <a href=\"https:\/\/convly.ai\/fr\/vram-requirements-every-major-llm-2026\/\">R\u00e9f\u00e9rence des besoins en VRAM<\/a> en compl\u00e9ment de ce tableau, et consultez le <a href=\"https:\/\/convly.ai\/fr\/best-gpus-for-local-llms-2026\/\">guide GPU<\/a> si vous h\u00e9sitez sur le choix de votre carte graphique.<\/p>\n<table>\n<thead>\n<tr>\n<th>Quantification<\/th>\n<th>Taille approximative du fichier (UNet de FLUX.1)<\/th>\n<th>VRAM typique requise<\/th>\n<th>Qualit\u00e9 par rapport \u00e0 BF16<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>BF16 (r\u00e9f\u00e9rence)<\/td>\n<td>~24 Go<\/td>\n<td>24+ Go<\/td>\n<td>R\u00e9f\u00e9rence<\/td>\n<\/tr>\n<tr>\n<td>Q8_0<\/td>\n<td>~12 Go<\/td>\n<td>~13 Go<\/td>\n<td>Quasiment identique<\/td>\n<\/tr>\n<tr>\n<td>Q5_K_S<\/td>\n<td>~8 Go<\/td>\n<td>~8\u20139 Go<\/td>\n<td>D\u00e9gradation minimale<\/td>\n<\/tr>\n<tr>\n<td>Q4_K_S<\/td>\n<td>~7 Go<\/td>\n<td>~7\u20138 Go<\/td>\n<td>L\u00e9g\u00e8re, souvent imperceptible<\/td>\n<\/tr>\n<tr>\n<td>Q4_0<\/td>\n<td>~6,5 Go<\/td>\n<td>~7 Go<\/td>\n<td>L\u00e9g\u00e8re<\/td>\n<\/tr>\n<tr>\n<td>Q3_K_S<\/td>\n<td>~5,5 Go<\/td>\n<td>~6 Go<\/td>\n<td>Mod\u00e9r\u00e9<\/td>\n<\/tr>\n<tr>\n<td>Q2_K<\/td>\n<td>~4,5 Go<\/td>\n<td>~5 Go<\/td>\n<td>Remarquable<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p><strong>Points de d\u00e9part pratiques :<\/strong> Q5_K_S ou Q4_K_S pour les cartes disposant de 8 \u00e0 12 Go de VRAM (meilleur rapport qualit\u00e9\/VRAM). Q3_K_S ou Q2_K pour les cartes de 6 Go, si vous utilisez \u00e9galement un T5-XXL quantifi\u00e9. Q8_0 pour les cartes de 16 Go lorsque vous souhaitez une fid\u00e9lit\u00e9 maximale tout en conservant l\u2019int\u00e9gralit\u00e9 du mod\u00e8le en VRAM.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Quality_and_Speed_Trade-offs\"><\/span>Les checkpoints standards de diffusion sont fournis au format<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>\u00c0 niveau Q8_0, les diff\u00e9rences par rapport \u00e0 BF16 sont pratiquement ind\u00e9tectables lors de comparaisons c\u00f4te \u00e0 c\u00f4te. \u00c0 niveau Q4_K_S, des d\u00e9gradations tr\u00e8s subtiles peuvent appara\u00eetre sur les textures fines et le rendu du texte lors d\u2019un examen minutieux, mais les r\u00e9sultats restent de qualit\u00e9 professionnelle pour la plupart des cas d\u2019usage. Q2_K introduit une perte de nettet\u00e9 visible et occasionnellement des artefacts, notamment sur les visages et les d\u00e9tails fins \u2014 il ne doit \u00eatre utilis\u00e9 qu\u2019en dernier recours, sur du mat\u00e9riel extr\u00eamement contraint en m\u00e9moire.<\/p>\n<p>La vitesse de g\u00e9n\u00e9ration avec GGUF peut \u00eatre comparable, voire sup\u00e9rieure, \u00e0 celle obtenue en chargeant un mod\u00e8le BF16 avec d\u00e9chargement CPU, car les poids quantifi\u00e9s r\u00e9duisent la pression sur la bande passante m\u00e9moire. Toutefois, si votre GPU peut charger int\u00e9gralement le mod\u00e8le BF16 en VRAM sans d\u00e9chargement, cette m\u00e9thode sera g\u00e9n\u00e9ralement plus rapide que l\u2019inf\u00e9rence GGUF. L\u2019avantage en vitesse de GGUF est surtout marqu\u00e9 lorsque l\u2019alternative implique un transfert continu de couches entre VRAM et m\u00e9moire syst\u00e8me.<\/p>\n<p>Sur <strong>Puces Apple Silicon (macOS)<\/strong>, le backend MPS prend en charge l\u2019inf\u00e9rence GGUF via ComfyUI-GGUF, mais ses caract\u00e9ristiques de performance diff\u00e8rent de celles de CUDA NVIDIA. Les r\u00e9sultats sont fonctionnels, mais la vitesse de g\u00e9n\u00e9ration peut \u00eatre inf\u00e9rieure \u00e0 celle obtenue sur une GPU NVIDIA \u00e9quivalente. L\u2019architecture m\u00e9moire unifi\u00e9e d\u2019Apple Silicon signifie que le plafond pratique de VRAM est sup\u00e9rieur \u00e0 celui des GPU discrets de m\u00eame capacit\u00e9 nominale ; vous pourrez donc potentiellement ex\u00e9cuter des niveaux de quantification plus \u00e9lev\u00e9s que ceux sugg\u00e9r\u00e9s dans le tableau ci-dessus.<\/p>\n<p>Sur <strong>GPU AMD (Linux, ROCm)<\/strong>, l\u2019inf\u00e9rence GGUF fonctionne via le backend ROCm de PyTorch. Installez d\u2019abord la version de PyTorch compatible ROCm destin\u00e9e \u00e0 ComfyUI, avant d\u2019installer ComfyUI-GGUF. Les performances et la compatibilit\u00e9 varient selon la g\u00e9n\u00e9ration du GPU ; les cartes RDNA 3 (s\u00e9rie RX 7000) b\u00e9n\u00e9ficient du support le plus fiable.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_Asked_Questions\"><\/span>Questions fr\u00e9quemment pos\u00e9es<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Puis-je charger un fichier .gguf avec le n\u0153ud standard UNETLoader ?<\/h3>\n<p>Non. Le n\u0153ud standard <code>UNETLoader<\/code> n\u2019accepte que des fichiers <code>.safetensors<\/code> . Vous devez installer le n\u0153ud personnalis\u00e9 ComfyUI-GGUF et utiliser <code>UnetLoaderGGUF<\/code> pour charger les mod\u00e8les <code>.gguf<\/code> de diffusion.<\/p>\n<h3>Dois-je quantifier moi-m\u00eame mes mod\u00e8les, ou puis-je t\u00e9l\u00e9charger des fichiers d\u00e9j\u00e0 quantifi\u00e9s ?<\/h3>\n<p>Pour FLUX.1-dev et FLUX.1-schnell, city96 fournit sur Hugging Face des fichiers GGUF pr\u00e9-quantifi\u00e9s couvrant tous les principaux niveaux de quantification. T\u00e9l\u00e9chargez le fichier <code>.gguf<\/code> sp\u00e9cifique correspondant au niveau souhait\u00e9 \u2014 aucune utilisation d\u2019outils de quantification n\u2019est n\u00e9cessaire.<\/p>\n<h3>GGUF fonctionne-t-il avec les mod\u00e8les SD1.5 et SDXL ?<\/h3>\n<p>Techniquement oui, mais l\u2019avantage est marginal. SD1.5 occupe environ 2 Go et SDXL environ 7 Go en fp16 \u2014 deux tailles qui tiennent ais\u00e9ment sur des GPU grand public milieu de gamme. La quantification GGUF est surtout utile pour les mod\u00e8les tr\u00e8s volumineux (FLUX.1, SD3), dont les poids en pr\u00e9cision pleine d\u00e9passent la capacit\u00e9 de VRAM de la plupart des cartes.<\/p>\n<h3>Un T5-XXL au format GGUF est-il nettement moins performant que sa version fp16 compl\u00e8te ?<\/h3>\n<p>Aux niveaux Q8_0 ou Q5_K_S, la fid\u00e9lit\u00e9 \u00e0 la consigne et la qualit\u00e9 de l\u2019encodage textuel sont effectivement identiques \u00e0 celles de la version fp16. Des niveaux de quantification inf\u00e9rieurs (Q2_K, Q3_K_S) peuvent occasionnellement entra\u00eener une l\u00e9g\u00e8re d\u00e9gradation de la conformit\u00e9 \u00e0 la consigne sur des prompts complexes, mais cet effet reste subtil compar\u00e9 \u00e0 l\u2019impact sur la qualit\u00e9 du UNet au m\u00eame niveau de quantification.<\/p>\n<h3>Mon flux de travail a \u00e9t\u00e9 con\u00e7u pour un mod\u00e8le FLUX en pr\u00e9cision pleine. Dois-je le reconstruire enti\u00e8rement ?<\/h3>\n<p>Non. Remplacez <code>UNETLoader<\/code> avec <code>UnetLoaderGGUF<\/code> et (facultativement) <code>DualCLIPLoader<\/code> avec <code>DualCLIPLoaderGGUF<\/code>. Toutes les connexions aval \u2014 KSampler, d\u00e9codage VAE, conditionnement \u2014 restent inchang\u00e9es. Les sorties de ces n\u0153uds sont compatibles sous forme de tenseurs avec le reste d\u2019un flux de travail FLUX standard.<\/p>\n<h3>Pourquoi ComfyUI \u00e9puise-t-il encore la VRAM m\u00eame avec un mod\u00e8le quantifi\u00e9 ?<\/h3>\n<p>Le UNet GGUF ne repr\u00e9sente qu\u2019une partie de la consommation totale de VRAM. Un pipeline FLUX complet charge \u00e9galement CLIP-L (~240 Mo), T5-XXL (jusqu\u2019\u00e0 ~9,3 Go en fp16) et le VAE (~350 Mo), ainsi que des tampons interm\u00e9diaires pendant la g\u00e9n\u00e9ration. Si vous continuez \u00e0 manquer de VRAM, chargez \u00e9galement T5-XXL au format GGUF via <code>DualCLIPLoaderGGUF<\/code>et envisagez d\u2019activer la d\u00e9coupe (tiling) int\u00e9gr\u00e9e du VAE dans ComfyUI pour l\u2019\u00e9tape de d\u00e9codage.<\/p>","protected":false},"excerpt":{"rendered":"<p>GGUF quantisation shrinks large diffusion models like FLUX.1 from ~24 GB to 5\u201312 GB, letting them run on consumer GPUs [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":2152,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2151","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts\/2151","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/comments?post=2151"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts\/2151\/revisions"}],"predecessor-version":[{"id":2153,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts\/2151\/revisions\/2153"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/media\/2152"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/media?parent=2151"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/categories?post=2151"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/tags?post=2151"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}