{"id":2608,"date":"2026-09-10T20:40:34","date_gmt":"2026-09-10T20:40:34","guid":{"rendered":"https:\/\/convly.ai\/?p=2608"},"modified":"2026-09-10T20:40:34","modified_gmt":"2026-09-10T20:40:34","slug":"gguf-model","status":"publish","type":"post","link":"https:\/\/convly.ai\/fr\/gguf-model\/","title":{"rendered":"Format de mod\u00e8le GGUF : qu\u2019est-ce que c\u2019est et comment en ex\u00e9cuter un"},"content":{"rendered":"<div class=\"convly-tldr\">\n<ul>\n<li><strong>GGUF<\/strong> (GPT-Generated Unified Format) est un format binaire mono-fichier destin\u00e9 aux grands mod\u00e8les de langage quantifi\u00e9s, introduit en ao\u00fbt 2023 par le projet llama.cpp en tant que successeur de GGML.<\/li>\n<li>Il regroupe les poids, le tokenizer, le mod\u00e8le de discussion (chat template) et les m\u00e9tadonn\u00e9es dans un seul <code>.gguf<\/code> fichier ex\u00e9cutable sur CPU, GPU ou une combinaison des deux via <strong>llama.cpp<\/strong>, <strong>Ollama<\/strong>, <strong>LM Studio<\/strong>, <strong>KoboldCpp<\/strong> et <strong>text-generation-webui<\/strong>.<\/li>\n<li>Niveaux de quantification tels que <code>Q4_K_M<\/code>, <code>Q5_K_M<\/code> et <code>Q8_0<\/code> sacrifient la qualit\u00e9 au profit de la taille \u2014 une quantification 4 bits d\u2019un mod\u00e8le de 8 milliards de param\u00e8tres n\u00e9cessite environ 5 Go de RAM ou de VRAM.<\/li>\n<li>T\u00e9l\u00e9chargez les fichiers depuis Hugging Face (recherchez \u00ab GGUF \u00bb), puis chargez-les avec <code>llama-cli -m model.gguf<\/code> ou <code>ollama run<\/code>, et choisissez une quantification adapt\u00e9e \u00e0 votre mat\u00e9riel \u00e0 l\u2019aide du <a href=\"https:\/\/convly.ai\/fr\/llm-vram-calculator\/\">Calculateur de VRAM<\/a>.<\/li>\n<\/ul>\n<\/div>\n<p>A <strong>mod\u00e8le GGUF<\/strong> est un grand mod\u00e8le de langage empaquet\u00e9 selon le format de fichier GGUF \u2014 un conteneur mono-fichier qui int\u00e8gre les poids quantifi\u00e9s, le tokenizer, les hyperparam\u00e8tres et le mod\u00e8le de prompt. Il a \u00e9t\u00e9 cr\u00e9\u00e9 par Georgi Gerganov et le projet <a href=\"https:\/\/github.com\/ggml-org\/llama.cpp\" rel=\"noopener\" target=\"_blank\">llama.cpp<\/a> project in August 2023 to replace the older GGML format. GGUF is what makes it possible to download one file, point a runtime at it, and get a working local LLM on a laptop or workstation.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_87_1 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6aa324072c40f\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Basculer<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6aa324072c40f\"  aria-label=\"Basculer\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/fr\/gguf-model\/#What_GGUF_Actually_Is\" >Ce qu\u2019est r\u00e9ellement GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/fr\/gguf-model\/#Quantization_The_Naming_Scheme\" >Quantification : la convention de nommage<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/fr\/gguf-model\/#Where_to_Get_GGUF_Files\" >O\u00f9 obtenir des fichiers GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/fr\/gguf-model\/#Running_a_GGUF_Model\" >Ex\u00e9cuter un mod\u00e8le GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/fr\/gguf-model\/#GGUF_vs_Safetensors_vs_AWQ_vs_GPTQ\" >GGUF contre Safetensors contre AWQ contre GPTQ<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/fr\/gguf-model\/#When_GGUF_Is_Not_the_Right_Answer\" >Quand GGUF n\u2019est pas la bonne solution<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/fr\/gguf-model\/#Converting_a_Model_to_GGUF\" >Convertir un mod\u00e8le au format GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/fr\/gguf-model\/#Frequently_Asked_Questions\" >Questions fr\u00e9quemment pos\u00e9es<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"What_GGUF_Actually_Is\"><\/span>Ce qu\u2019est r\u00e9ellement GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>GGUF signifie <em>GPT-Generated Unified Format<\/em>. Sur le plan structurel, il s\u2019agit d\u2019un fichier binaire comportant un en-t\u00eate, un bloc de m\u00e9tadonn\u00e9es cl\u00e9-valeur, un index de tenseurs et les donn\u00e9es tensorielles elles-m\u00eames. La <a href=\"https:\/\/github.com\/ggml-org\/ggml\/blob\/master\/docs\/gguf.md\" rel=\"noopener\" target=\"_blank\">sp\u00e9cification officielle GGUF<\/a> dans le d\u00e9p\u00f4t ggml d\u00e9finit pr\u00e9cis\u00e9ment cette structure.<\/p>\n<p>Deux propri\u00e9t\u00e9s sont essentielles pour les utilisateurs :<\/p>\n<ul>\n<li><strong>Autonome.<\/strong> Le fichier embarque le tokenizer, les jetons sp\u00e9ciaux, les identifiants EOS\/BOS, le mod\u00e8le de discussion (chat template) et les m\u00e9tadonn\u00e9es relatives \u00e0 l\u2019architecture. Aucun fichier suppl\u00e9mentaire <code>tokenizer.json<\/code> ou <code>config.json<\/code> n\u2019est requis \u00e0 ses c\u00f4t\u00e9s.<\/li>\n<li><strong>Mappable en m\u00e9moire.<\/strong> Les environnements d\u2019ex\u00e9cution utilisent <code>mmap()<\/code> pour charger le fichier, ce qui permet un d\u00e9marrage quasi instantan\u00e9 et un chargement \u00e0 la demande des poids par le syst\u00e8me d\u2019exploitation. C\u2019est pourquoi un fichier GGUF de 40 Go s\u2019ouvre en quelques secondes, m\u00eame sur un disque SSD lent.<\/li>\n<\/ul>\n<p>GGUF a remplac\u00e9 GGML car ce dernier ne comportait aucune gestion de version, m\u00e9langeait m\u00e9tadonn\u00e9es et poids, et cessait de fonctionner \u00e0 chaque nouvelle architecture. GGUF, lui, est versionn\u00e9 et extensible.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Quantization_The_Naming_Scheme\"><\/span>Quantification : la convention de nommage<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>La plupart des fichiers GGUF que vous t\u00e9l\u00e9chargez sont <em>quantifi\u00e9s<\/em> \u2014 les poids y sont stock\u00e9s sur moins de bits que leur repr\u00e9sentation FP16 d\u2019origine. Le suffixe du nom de fichier indique le sch\u00e9ma utilis\u00e9. Les familles actuelles sont document\u00e9es dans le <a href=\"https:\/\/github.com\/ggml-org\/llama.cpp\/blob\/master\/tools\/quantize\/README.md\" rel=\"noopener\" target=\"_blank\">README de quantification de llama.cpp<\/a>.<\/p>\n<table>\n<thead>\n<tr>\n<th>Quant<\/th>\n<th>Bits\/poids (approx.)<\/th>\n<th>Usage typique<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Q2_K<\/td>\n<td>~2.6<\/td>\n<td>Taille minimale, perte de qualit\u00e9 notable<\/td>\n<\/tr>\n<tr>\n<td>Q3_K_M<\/td>\n<td>~3.9<\/td>\n<td>Compression agressive<\/td>\n<\/tr>\n<tr>\n<td>Q4_K_M<\/td>\n<td>~4.8<\/td>\n<td>Valeur par d\u00e9faut la plus courante \u2014 bon compromis taille\/qualit\u00e9<\/td>\n<\/tr>\n<tr>\n<td>Q5_K_M<\/td>\n<td>~5.7<\/td>\n<td>Qualit\u00e9 sup\u00e9rieure, fichier plus volumineux<\/td>\n<\/tr>\n<tr>\n<td>Q6_K<\/td>\n<td>~6.6<\/td>\n<td>Quasi sans perte compar\u00e9 \u00e0 FP16<\/td>\n<\/tr>\n<tr>\n<td>Q8_0<\/td>\n<td>~8.5<\/td>\n<td>Pratiquement sans perte, environ 2\u00d7 la taille de Q4<\/td>\n<\/tr>\n<tr>\n<td>F16 \/ BF16<\/td>\n<td>16<\/td>\n<td>R\u00e9f\u00e9rence non quantifi\u00e9e<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Le <code>_K<\/code> Les variantes k-quants utilisent une pr\u00e9cision variable par bloc de tenseur. Les suffixes <code>_M<\/code> \/ <code>_S<\/code> \/ <code>_L<\/code> indiquent des pr\u00e9s\u00e9lections moyennes, petites ou grandes pour le m\u00e9lange de blocs. Les variantes plus r\u00e9centes (p. ex. <code>IQ<\/code> IQ4_XS <code>) utilisent une calibration bas\u00e9e sur une matrice d\u2019importance afin d\u2019obtenir une meilleure qualit\u00e9 pour un m\u00eame budget en bits.<\/code>utilise la calibration par matrice d'importance pour une meilleure qualit\u00e9 \u00e0 budget de bits identique.<\/p>\n<p>En r\u00e8gle g\u00e9n\u00e9rale, pour estimer les besoins en VRAM, prenez la taille du fichier sur le disque et ajoutez environ 1 \u00e0 3 Go pour le cache KV dans le cas de contextes courts, davantage pour des contextes longs. \u00c0 partir de la <a href=\"https:\/\/convly.ai\/fr\/models\/\">base de donn\u00e9es des mod\u00e8les Convly<\/a>: Llama 3.1 8B needs around 5&nbsp;GB at 4-bit, Llama 3.3 70B around 40&nbsp;GB, and Mistral 7B around 4.5&nbsp;GB. For anything larger, the <a href=\"https:\/\/convly.ai\/fr\/vram-requirements-every-major-llm-2026\/\">tableau des besoins en VRAM<\/a> est la m\u00e9thode de recherche la plus rapide.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Where_to_Get_GGUF_Files\"><\/span>O\u00f9 obtenir des fichiers GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Presque toutes les distributions GGUF se font sur Hugging Face. Recherchez le nom du mod\u00e8le suivi de \u00ab&nbsp;GGUF&nbsp;\u00bb. Parmi les outils fiables de re-quantification figurent <strong>bartowski<\/strong>, <strong>Qwen<\/strong> (officiel pour Qwen3), <strong>lmstudio-community<\/strong>, <strong>unsloth<\/strong> et <strong>MaziyarPanahi<\/strong>. Meta, Google, Mistral and Microsoft publish some official GGUF builds; for others the community quantizes from the released safetensors.<\/p>\n<p>Un d\u00e9p\u00f4t contient g\u00e9n\u00e9ralement un fichier par niveau de quantification, par exemple <code>Meta-Llama-3.1-8B-Instruct-Q4_K_M.gguf<\/code>. Pour les mod\u00e8les d\u00e9passant environ 50&nbsp;Go, le fichier est d\u00e9coup\u00e9 en fragments (\u00ab&nbsp;shards&nbsp;\u00bb) nomm\u00e9s <code>-00001-of-00003.gguf<\/code>; les moteurs d\u2019ex\u00e9cution les chargent automatiquement \u00e0 partir du premier fragment.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Running_a_GGUF_Model\"><\/span>Ex\u00e9cuter un mod\u00e8le GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Linux<\/h3>\n<p>Compilez llama.cpp depuis les sources ou installez le binaire pr\u00e9compil\u00e9. Avec CUDA :<\/p>\n<pre><code>git clone https:\/\/github.com\/ggml-org\/llama.cpp\ncd llama.cpp\ncmake -B build -DGGML_CUDA=ON\ncmake --build build --config Release -j\n.\/build\/bin\/llama-cli -m ~\/models\/llama-3.1-8b-instruct-Q4_K_M.gguf \n    -p \"Expliquez GGUF en un seul paragraphe.\" -n 256 -ngl 99<\/code><\/pre>\n<p>Le <code>-ngl<\/code> Le param\u00e8tre \u00ab&nbsp;n-gpu-layers&nbsp;\u00bb d\u00e9termine combien de couches du transformeur sont d\u00e9plac\u00e9es vers le GPU. R\u00e9glez-le suffisamment haut pour que l\u2019int\u00e9gralit\u00e9 du mod\u00e8le tienne dans la VRAM ; si vous manquez de m\u00e9moire, r\u00e9duisez-le, et les couches restantes s\u2019ex\u00e9cuteront sur le CPU. Pour exposer une API HTTP compatible OpenAI, utilisez <code>llama-server<\/code> sur le port 8080 par d\u00e9faut.<\/p>\n<h3>macOS<\/h3>\n<p>Sur les puces Apple Silicon, llama.cpp utilise automatiquement le backend Metal. Installez-le via Homebrew :<\/p>\n<pre><code>brew install llama.cpp\nllama-cli -m ~\/models\/qwen3-8b-Q5_K_M.gguf -p \"Bonjour\" -ngl 99<\/code><\/pre>\n<p>La m\u00e9moire unifi\u00e9e signifie que la limite sup\u00e9rieure correspond \u00e0 la RAM totale moins la surcharge syst\u00e8me. Un Mac \u00e9quip\u00e9 d\u2019une puce M et de 32&nbsp;Go de RAM ex\u00e9cute ais\u00e9ment Qwen3 14B ou <code>-ngl<\/code> ceiling is your total RAM minus the OS overhead. A 32&nbsp;GB M-series Mac comfortably runs Qwen3 14B or Gemma 3 12B at Q4_K_M &mdash; the database lists those at ~9&nbsp;GB and ~8&nbsp;GB of VRAM respectively.<\/p>\n<p>Pour une interface graphique (GUI), <a href=\"https:\/\/convly.ai\/fr\/lm-studio-complete-guide-2026\/\">LM Studio<\/a> est le choix habituel sur Mac. Il t\u00e9l\u00e9charge directement les fichiers GGUF depuis Hugging Face et expose un serveur local compatible avec l\u2019API OpenAI.<\/p>\n<h3>Windows<\/h3>\n<p>Trois approches pratiques :<\/p>\n<ul>\n<li><strong>Ollama.<\/strong> Installez-le depuis <a href=\"https:\/\/ollama.com\/download\" rel=\"noopener\" target=\"_blank\">ollama.com\/download<\/a>, puis <code>ollama run llama3.1:8b<\/code>. Ollama r\u00e9cup\u00e8re ses propres versions GGUF soigneusement s\u00e9lectionn\u00e9es. Pour charger un fichier arbitraire, cr\u00e9ez un fichier Modelfile contenant une ligne <code>FROM .\/mymodel.gguf<\/code> et ex\u00e9cutez la commande <code>ollama create mymodel -f Modelfile<\/code>. Consultez notre <a href=\"https:\/\/convly.ai\/fr\/how-to-install-ollama-2026\/\">Guide d\u2019installation d\u2019Ollama<\/a>.<\/li>\n<li><strong>LM Studio.<\/strong> Installation en un clic, navigation et t\u00e9l\u00e9chargement de fichiers GGUF via une interface utilisateur, curseur de d\u00e9chargement GPU.<\/li>\n<li><strong>binaires pr\u00e9compil\u00e9s de llama.cpp.<\/strong> Le projet fournit des archives Windows pr\u00e9compil\u00e9es (CPU, CUDA et Vulkan) sur la page des <a href=\"https:\/\/github.com\/ggml-org\/llama.cpp\/releases\" rel=\"noopener\" target=\"_blank\">versions publi\u00e9es sur GitHub<\/a>. D\u00e9compressez-les puis lancez <code>llama-cli.exe<\/code> de la m\u00eame mani\u00e8re que sous Linux.<\/li>\n<\/ul>\n<p>En ce qui concerne le choix du GPU, le <a href=\"https:\/\/convly.ai\/fr\/best-gpus-for-local-llms-2026\/\">guide GPU local pour LLM<\/a> recense les options actuelles en termes de rapport prix\/VRAM.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"GGUF_vs_Safetensors_vs_AWQ_vs_GPTQ\"><\/span>GGUF contre Safetensors contre AWQ contre GPTQ<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<table>\n<thead>\n<tr>\n<th>Format<\/th>\n<th>Runtime principal<\/th>\n<th>Pr\u00e9cision<\/th>\n<th>Id\u00e9al pour<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>GGUF<\/td>\n<td>llama.cpp, Ollama, LM Studio<\/td>\n<td>2 \u00e0 8 bits + F16<\/td>\n<td>CPU, calcul hybride CPU\/GPU, Apple Silicon, usage individuel<\/td>\n<\/tr>\n<tr>\n<td>Safetensors (FP16\/BF16)<\/td>\n<td>Transformers, vLLM<\/td>\n<td>16 bits<\/td>\n<td>Entra\u00eenement, recherche, inf\u00e9rence en pleine pr\u00e9cision<\/td>\n<\/tr>\n<tr>\n<td>AWQ<\/td>\n<td>vLLM, AutoAWQ<\/td>\n<td>4 bits<\/td>\n<td>Service GPU haute performance<\/td>\n<\/tr>\n<tr>\n<td>GPTQ<\/td>\n<td>vLLM, ExLlamaV2<\/td>\n<td>3 \u00e0 8 bits<\/td>\n<td>Inf\u00e9rence GPU uniquement avec regroupement (batching)<\/td>\n<\/tr>\n<tr>\n<td>MLX<\/td>\n<td>MLX (Apple)<\/td>\n<td>4 \u00e0 16 bits<\/td>\n<td>Apple Silicon uniquement<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Pr\u00e9f\u00e9rez GGUF lorsque la cible est un utilisateur unique sur une configuration mat\u00e9rielle h\u00e9t\u00e9rog\u00e8ne ou lorsque vous souhaitez garantir l\u2019ex\u00e9cution du mod\u00e8le m\u00eame sur CPU. Pr\u00e9f\u00e9rez vLLM avec des safetensors AWQ\/GPTQ lorsque vous servez de nombreux utilisateurs simultan\u00e9s sur un GPU de centre de donn\u00e9es.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"When_GGUF_Is_Not_the_Right_Answer\"><\/span>Quand GGUF n\u2019est pas la bonne solution<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>GGUF suppose une inf\u00e9rence mono-flux (batch-size 1). Son d\u00e9bit est nettement inf\u00e9rieur \u00e0 celui de vLLM ou TensorRT-LLM sous charge concurrente, et il ne prend pas en charge l\u2019attention pagin\u00e9e (\u00ab&nbsp;paged attention&nbsp;\u00bb). Si vous exposez une API destin\u00e9e \u00e0 un trafic r\u00e9el, un d\u00e9ploiement en FP16 ou AWQ sur vLLM surpassera GGUF en nombre de jetons g\u00e9n\u00e9r\u00e9s par seconde et par dollar, sans m\u00eame comptabiliser le temps de d\u00e9veloppement investi.<\/p>\n<p>It also breaks down at the top end of model size. Kimi K3 needs ~1.4&nbsp;TB of VRAM at 4-bit and DeepSeek V4-Pro around 800&nbsp;GB &mdash; those are multi-node deployments, not desktop GGUF workloads. And for frontier hosted models like <a href=\"https:\/\/convly.ai\/fr\/models\/\">Claude Sonnet 4.6<\/a> \u00e0 3 $ en entr\u00e9e \/ 15 $ en sortie par million de jetons, ou Gemini 3.6 Flash \u00e0 1,50 $ en entr\u00e9e \/ 7,50 $ en sortie, aucun poids local n\u2019existe \u00e0 convertir. Faites le calcul sur la <a href=\"https:\/\/convly.ai\/fr\/self-hosting-vs-api-calculator\/\">calculateur auto-h\u00e9bergement vs API<\/a> avant de vous engager dans un achat de GPU.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Converting_a_Model_to_GGUF\"><\/span>Convertir un mod\u00e8le au format GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Si un mod\u00e8le est disponible sur Hugging Face au format safetensors mais qu\u2019aucune quantification n\u2019en a encore \u00e9t\u00e9 faite, le flux de travail est le suivant :<\/p>\n<pre><code># dans le d\u00e9p\u00f4t llama.cpp\npip install -r requirements.txt\npython convert_hf_to_gguf.py \/chemin\/vers\/le-modele-hf --outfile modele-f16.gguf\n.\/build\/bin\/llama-quantize modele-f16.gguf modele-Q4_K_M.gguf Q4_K_M<\/code><\/pre>\n<p>Le script de conversion ne prend en charge que les architectures int\u00e9gr\u00e9es \u00e0 llama.cpp \u2014 llama, mistral, qwen2\/3, gemma, phi, ainsi qu\u2019une liste croissante d\u2019autres architectures. Les nouvelles architectures n\u00e9cessitent d\u2019abord une modification du code. Les noms de fichiers et les indicateurs du script ont \u00e9volu\u00e9 entre les versions de llama.cpp ; v\u00e9rifiez donc <code>python convert_hf_to_gguf.py --help<\/code> par rapport au commit utilis\u00e9 pour votre compilation.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_Asked_Questions\"><\/span>Questions fr\u00e9quemment pos\u00e9es<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>GGUF est-il identique \u00e0 GGML ?<\/h3>\n<p>Non. GGML \u00e9tait le format ant\u00e9rieur utilis\u00e9 par llama.cpp jusqu\u2019au milieu de l\u2019ann\u00e9e 2023. GGUF l\u2019a remplac\u00e9 en ao\u00fbt 2023 avec un en-t\u00eate versionn\u00e9, des m\u00e9tadonn\u00e9es int\u00e9gr\u00e9es et une disposition stable des tenseurs. Les anciens fichiers <code>.bin<\/code> GGML ne sont plus charg\u00e9s par la version actuelle de llama.cpp ; vous devez trouver une version GGUF re-quantifi\u00e9e.<\/p>\n<h3>Quelle quantification dois-je t\u00e9l\u00e9charger ?<\/h3>\n<p>Commencez par <code>Q4_K_M<\/code>. Il convient \u00e0 la plus large gamme de mat\u00e9riels, et la perte de qualit\u00e9 par rapport au format FP16 est faible pour la plupart des mod\u00e8les comportant plus de 7 milliards de param\u00e8tres. Passez \u00e0 <code>Q5_K_M<\/code> ou <code>Q6_K<\/code> si vous disposez de VRAM suppl\u00e9mentaire et que la pr\u00e9cision en codage ou en raisonnement vous importe. R\u00e9duisez plut\u00f4t \u00e0 <code>Q3_K_M<\/code> ou \u00e0 une variante <code>IQ3<\/code> uniquement si le mod\u00e8le ne tient pas autrement dans la m\u00e9moire disponible.<\/p>\n<h3>Can GGUF models use my GPU?<\/h3>\n<p>Oui. llama.cpp prend en charge CUDA (NVIDIA), ROCm (AMD), Metal (Apple), Vulkan (multi-fournisseur) et SYCL (Intel). L\u2019indicateur <code>-ngl<\/code> d\u00e9place certaines couches vers le GPU. Si le mod\u00e8le tient enti\u00e8rement dans la VRAM, le d\u00e9bit est proche de celui des runtimes GPU d\u00e9di\u00e9s ; en cas de d\u00e9chargement partiel, la vitesse d\u00e9pend de la couche la plus lente, quelle que soit la m\u00e9moire concern\u00e9e.<\/p>\n<h3>GGUF fonctionne-t-il avec des mod\u00e8les vision ou audio ?<\/h3>\n<p>Partiellement. llama.cpp prend en charge les mod\u00e8les vision multimodaux de type LLaVA via un fichier <code>mmproj<\/code> GGUF associ\u00e9 contenant le projecteur visuel. Le support de Qwen-VL, de Gemma 3 Vision et de mod\u00e8les similaires s\u2019est progressivement \u00e9tendu, mais reste en retard par rapport aux versions textuelles. Les mod\u00e8les audio comme Whisper utilisent leur propre format connexe, g\u00e9r\u00e9 par <code>whisper.cpp<\/code>, et non par le binaire principal llama.cpp.<\/p>\n<h3>Comment choisir un mod\u00e8le GGUF adapt\u00e9 \u00e0 mon mat\u00e9riel ?<\/h3>\n<p>Consultez la fiche du mod\u00e8le sur le <a href=\"https:\/\/convly.ai\/fr\/models\/\">base de donn\u00e9es des mod\u00e8les Convly<\/a> pour conna\u00eetre sa consommation de VRAM en quantification 4 bits, puis soustrayez 1 \u00e0 3&nbsp;Go de marge pour le contexte et la surcharge syst\u00e8me. Sur une carte de 24&nbsp;Go, Qwen3 32B (~20&nbsp;Go) ou Gemma 3 27B (~16&nbsp;Go) en Q4 constituent des choix confortables. Le <a href=\"https:\/\/convly.ai\/fr\/llm-vram-calculator\/\">Calculateur de VRAM<\/a> g\u00e8re des contextes plus longs, ce qui augmente consid\u00e9rablement la taille du cache KV.<\/p>\n<h3>Les fichiers GGUF sont-ils s\u00fbrs \u00e0 ex\u00e9cuter ?<\/h3>\n<p>The weights themselves are just numbers &mdash; unlike Python pickle-based checkpoints, GGUF does not execute code on load. The risk is a maliciously crafted file triggering a parser bug in the runtime. Stick to known Hugging Face uploaders (bartowski, unsloth, lmstudio-community, official vendor accounts) and keep llama.cpp, Ollama or LM Studio updated.<\/p>","protected":false},"excerpt":{"rendered":"<p>GGUF (GPT-Generated Unified Format) is a single-file binary format for quantized large language models, introduced by the llama.cpp project in [\u2026]<\/p>\n","protected":false},"author":1,"featured_media":2609,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2608","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts\/2608","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/comments?post=2608"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts\/2608\/revisions"}],"predecessor-version":[{"id":2610,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts\/2608\/revisions\/2610"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/media\/2609"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/media?parent=2608"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/categories?post=2608"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/tags?post=2608"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}