{"id":2103,"date":"2026-08-03T20:03:24","date_gmt":"2026-08-03T20:03:24","guid":{"rendered":"https:\/\/convly.ai\/?p=2103"},"modified":"2026-08-03T20:03:24","modified_gmt":"2026-08-03T20:03:24","slug":"what-is-gguf-format-explained","status":"publish","type":"post","link":"https:\/\/convly.ai\/fr\/what-is-gguf-format-explained\/","title":{"rendered":"Qu\u2019est-ce que GGUF ? Le format de fichier LLM derri\u00e8re Ollama et llama.cpp, expliqu\u00e9"},"content":{"rendered":"<div class=\"convly-tldr\">\n<ul>\n<li><strong>GGUF est le format de fichier utilis\u00e9 pour ex\u00e9cuter localement des mod\u00e8les de langage (LLM).<\/strong> It packs a model&#8217;s weights, tokenizer and configuration into a single binary file that llama.cpp, Ollama, LM Studio and most other local-LLM tools load directly.<\/li>\n<li><strong>Il a remplac\u00e9 GGML en ao\u00fbt 2023<\/strong> car les fichiers GGML devenaient inutilisables d\u00e8s que le format \u00e9voluait. GGUF, quant \u00e0 lui, est versionn\u00e9 et extensible, ce qui garantit la compatibilit\u00e9 ascendante des anciens fichiers.<\/li>\n<li><strong>Le suffixe indique le niveau de quantification.<\/strong> Q4_K_M (~4,9 Go pour un mod\u00e8le de 8 milliards de param\u00e8tres) constitue le compromis standard entre qualit\u00e9 et taille ; Q8_0 est quasi sans perte (~8,5 Go) ; F16 est non quantifi\u00e9.<\/li>\n<li><strong>R\u00e8gle empirique :<\/strong> choisissez la quantification la plus \u00e9lev\u00e9e dont la taille du fichier tient dans votre VRAM, en laissant 1 \u00e0 2 Go de m\u00e9moire libre pour le contexte.<\/li>\n<\/ul>\n<\/div>\n<p>GGUF (souvent d\u00e9velopp\u00e9 comme \u00ab GPT-Generated Unified Format \u00bb) est un format binaire permettant de stocker des mod\u00e8les de langage de grande taille : les poids, le tokenizer et toutes les m\u00e9tadonn\u00e9es de configuration dans un seul fichier autonome. Il s\u2019agit du format natif de <strong>llama.cpp<\/strong>, et c\u2019est celui que <strong>Ollama<\/strong>, <strong>LM Studio<\/strong>, KoboldCpp, Jan et la plupart des autres applications locales pour LLM ex\u00e9cutent effectivement. Si vous avez d\u00e9j\u00e0 t\u00e9l\u00e9charg\u00e9 un fichier se terminant par <code>.gguf<\/code>, ou r\u00e9cup\u00e9r\u00e9 un mod\u00e8le avec la commande <code>ollama run<\/code>, vous utilisiez ce format.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_85 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a7127df1a0ff\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Basculer<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a7127df1a0ff\"  aria-label=\"Basculer\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/fr\/what-is-gguf-format-explained\/#What_a_GGUF_file_actually_contains\" >Ce que contient r\u00e9ellement un fichier GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/fr\/what-is-gguf-format-explained\/#Why_GGUF_replaced_GGML\" >Pourquoi GGUF a remplac\u00e9 GGML<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/fr\/what-is-gguf-format-explained\/#How_to_read_the_quantisation_suffixes\" >Comment interpr\u00e9ter les suffixes de quantification<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/fr\/what-is-gguf-format-explained\/#Picking_a_quantisation_for_your_VRAM\" >Choisir une quantification adapt\u00e9e \u00e0 votre VRAM<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/fr\/what-is-gguf-format-explained\/#GGUF_vs_safetensors\" >GGUF contre safetensors<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/fr\/what-is-gguf-format-explained\/#Where_GGUF_files_come_from\" >D\u2019o\u00f9 proviennent les fichiers GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/fr\/what-is-gguf-format-explained\/#Frequently_asked_questions\" >Questions fr\u00e9quemment pos\u00e9es<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"What_a_GGUF_file_actually_contains\"><\/span>Ce que contient r\u00e9ellement un fichier GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Un fichier GGUF commence par les quatre octets ASCII <code>GGUF<\/code>, suivis d\u2019un num\u00e9ro de version, d\u2019une section de m\u00e9tadonn\u00e9es cl\u00e9-valeur, puis des tenseurs eux-m\u00eames. Les m\u00e9tadonn\u00e9es constituent la d\u00e9cision architecturale essentielle : elles stockent l\u2019architecture du mod\u00e8le, la longueur maximale du contexte, le vocabulaire du tokenizer, le mod\u00e8le de dialogue (chat template) et les d\u00e9tails de la quantification sous forme de cl\u00e9s nomm\u00e9es, afin qu\u2019un moteur d\u2019ex\u00e9cution puisse charger n\u2019importe quel fichier GGUF sans avoir besoin d\u2019un fichier s\u00e9par\u00e9 <code>config.json<\/code> ou des fichiers de tokeniseur \u00e0 ses c\u00f4t\u00e9s.<\/p>\n<p>Trois cons\u00e9quences pratiques d\u00e9coulent de cette conception :<\/p>\n<ul>\n<li><strong>Un seul fichier constitue l\u2019int\u00e9gralit\u00e9 du mod\u00e8le.<\/strong> Vous pouvez copier un fichier <code>.gguf<\/code> d\u2019une machine \u00e0 une autre, et il fonctionne imm\u00e9diatement. (Les mod\u00e8les tr\u00e8s volumineux sont parfois divis\u00e9s en parties num\u00e9rot\u00e9es, comme <code>-00001-of-00002.gguf<\/code>, mais il s\u2019agit n\u00e9anmoins d\u2019un seul mod\u00e8le logique.)<\/li>\n<li><strong>Il est mappable en m\u00e9moire.<\/strong> Les environnements d\u2019ex\u00e9cution peuvent utiliser <code>mmap<\/code> le fichier et charger les poids \u00e0 la demande par pages, ce qui acc\u00e9l\u00e8re le chargement et permet de d\u00e9marrer des mod\u00e8les plus volumineux que la m\u00e9moire RAM disponible.<\/li>\n<li><strong>La quantification est int\u00e9gr\u00e9e au format.<\/strong> Un fichier GGUF stocke d\u00e9j\u00e0 les poids compress\u00e9s \u00e0 2\u20138 bits par poids, ce qui explique pourquoi un mod\u00e8le de 8 milliards de param\u00e8tres peut occuper 4,9 Go au lieu de 16 Go.<\/li>\n<\/ul>\n<h2><span class=\"ez-toc-section\" id=\"Why_GGUF_replaced_GGML\"><\/span>Pourquoi GGUF a remplac\u00e9 GGML<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Avant ao\u00fbt 2023, llama.cpp utilisait un format appel\u00e9 GGML (nomm\u00e9 d\u2019apr\u00e8s la biblioth\u00e8que de tenseurs sous-jacente). GGML fonctionnait, mais pr\u00e9sentait un d\u00e9faut structurel : sa disposition dans le fichier \u00e9tait rigide et non versionn\u00e9e. \u00c0 chaque ajout d\u2019une nouvelle fonctionnalit\u00e9 par llama.cpp \u2014 nouvelles architectures, m\u00e9thodes de quantification am\u00e9lior\u00e9es, param\u00e8tres d\u2019\u00e9chelle RoPE \u2014 le format devait \u00eatre modifi\u00e9, rendant ainsi incompatibles tous les fichiers de mod\u00e8les existants sur tous les disques durs. En quelques mois, les utilisateurs ont d\u00fb t\u00e9l\u00e9charger \u00e0 nouveau ou reconvertir l\u2019int\u00e9gralit\u00e9 de leurs collections de mod\u00e8les \u00e0 plusieurs reprises.<\/p>\n<p>GGUF, introduit par le projet llama.cpp en ao\u00fbt 2023, a r\u00e9solu ce probl\u00e8me gr\u00e2ce \u00e0 deux changements :<\/p>\n<ul>\n<li><strong>La gestion des versions.<\/strong> Le fichier d\u00e9clare explicitement sa version de format, afin que les lecteurs sachent pr\u00e9cis\u00e9ment comment l\u2019interpr\u00e9ter.<\/li>\n<li><strong>Des m\u00e9tadonn\u00e9es cl\u00e9-valeur extensibles.<\/strong> Toute information suppl\u00e9mentaire (un nouveau champ d\u2019architecture, un mod\u00e8le de discussion, un hyperparam\u00e8tre suppl\u00e9mentaire) correspond simplement \u00e0 une nouvelle cl\u00e9. Les anciens fichiers, d\u00e9pourvus de cette cl\u00e9, restent compatibles ; les nouveaux fichiers, dot\u00e9s de cette cl\u00e9, fonctionnent avec les environnements d\u2019ex\u00e9cution mis \u00e0 jour. Aucune r\u00e9tro-incompatibilit\u00e9 n\u2019est ainsi introduite.<\/li>\n<\/ul>\n<p>llama.cpp a abandonn\u00e9 le support de GGML peu apr\u00e8s son introduction, et l\u2019\u00e9cosyst\u00e8me l\u2019a suivi. Aujourd\u2019hui, GGML ne subsiste que comme nom de la biblioth\u00e8que de tenseurs sous-jacente ; si vous trouvez un fichier mod\u00e8le <code>.ggml<\/code> ou <code>.bin<\/code> datant de 2023, il ne sera pas charg\u00e9 par aucun outil actuel, et vous devriez plut\u00f4t t\u00e9l\u00e9charger une version au format GGUF.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"How_to_read_the_quantisation_suffixes\"><\/span>Comment interpr\u00e9ter les suffixes de quantification<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Chaque nom de fichier GGUF comporte un suffixe tel que <code>Q4_K_M<\/code> indiquant le degr\u00e9 d\u2019agressivit\u00e9 de la compression appliqu\u00e9e aux poids. Ce suffixe suit la convention suivante :<\/p>\n<ul>\n<li><strong>Le chiffre qui suit \u00ab Q \u00bb<\/strong> correspond approximativement au nombre de bits allou\u00e9s par poids : Q4 \u2248 4 bits, Q8 \u2248 8 bits. Moins de bits signifient un fichier plus petit, mais aussi une qualit\u00e9 moindre.<\/li>\n<li><strong>_K<\/strong> d\u00e9signe les m\u00e9thodes de \u00ab k-quant \u00bb plus r\u00e9centes, qui allouent davantage de bits aux tenseurs les plus critiques pour la qualit\u00e9 des sorties. \u00c0 taille \u00e9gale, une quantification K surpasse la m\u00e9thode ancienne.<\/li>\n<li><strong>_S \/ _M \/ _L<\/strong> (petit\/moyen\/grand) d\u00e9signent des variantes au sein d\u2019une m\u00eame famille K \u2014 <code>_M<\/code> conserve quelques tenseurs particuli\u00e8rement sensibles \u00e0 une pr\u00e9cision sup\u00e9rieure par rapport \u00e0 <code>_S<\/code>.<\/li>\n<li><strong>_0<\/strong> (comme dans <code>Q8_0<\/code>, <code>Q4_0<\/code>) indique la m\u00e9thode ancienne et plus simple de quantification par blocs. <code>Q8_0<\/code> reste largement utilis\u00e9e, car \u00e0 8 bits la m\u00e9thode simple est d\u00e9j\u00e0 quasiment sans perte ; <code>Q4_0<\/code> est aujourd\u2019hui obsol\u00e8te \u2014 privil\u00e9giez plut\u00f4t les pr\u00e9fixes <code>Q4_K_M<\/code>.<\/li>\n<li><strong>IQ<\/strong> (tels que<code>IQ2_M<\/code>, <code>IQ3_XS<\/code>\u2026), qui d\u00e9signent des \u00ab i-quants \u00bb construits \u00e0 l\u2019aide d\u2019une matrice d\u2019importance, permettant de comprimer les mod\u00e8les sous la barre des 4 bits avec moins de d\u00e9gradation que les alternatives.<\/li>\n<li><strong>F16 \/ BF16 \/ F32<\/strong> signifie des poids non quantifi\u00e9s en 16 ou 32 bits \u2014 qualit\u00e9 de r\u00e9f\u00e9rence, mais avec une taille maximale.<\/li>\n<\/ul>\n<p>Voici le co\u00fbt pratique des options courantes, illustr\u00e9 \u00e0 l\u2019aide de mod\u00e8les instruct Llama de classe 8B (les tailles sont approximatives et varient l\u00e9g\u00e8rement selon le mod\u00e8le) :<\/p>\n<table>\n<thead>\n<tr>\n<th>Quant<\/th>\n<th>Taille du fichier (mod\u00e8le 8B)<\/th>\n<th>Qualit\u00e9 par rapport \u00e0 F16<\/th>\n<th>\u00c0 utiliser lorsque<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>F16<\/td>\n<td>~16,1 Go<\/td>\n<td>R\u00e9f\u00e9rence<\/td>\n<td>Pour les tests de performance ou pour effectuer une quantification ult\u00e9rieure ; rarement justifi\u00e9 en production<\/td>\n<\/tr>\n<tr>\n<td>Q8_0<\/td>\n<td>~8,5 Go<\/td>\n<td>Pratiquement indiscernable<\/td>\n<td>Vous disposez de suffisamment de VRAM et recherchez la qualit\u00e9 maximale<\/td>\n<\/tr>\n<tr>\n<td>Q6_K<\/td>\n<td>~6,6 Go<\/td>\n<td>Perte n\u00e9gligeable<\/td>\n<td>Excellente qualit\u00e9 avec une r\u00e9duction de taille significative<\/td>\n<\/tr>\n<tr>\n<td>Q5_K_M<\/td>\n<td>~5,7 Go<\/td>\n<td>Perte tr\u00e8s minime<\/td>\n<td>Bon compromis<\/td>\n<\/tr>\n<tr>\n<td>Q4_K_M<\/td>\n<td>~4,9 Go<\/td>\n<td>Perte faible, g\u00e9n\u00e9ralement acceptable<\/td>\n<td><strong>La valeur par d\u00e9faut standard.<\/strong> Le meilleur rapport qualit\u00e9\/poids en gigaoctets pour la plupart des utilisateurs<\/td>\n<\/tr>\n<tr>\n<td>Q3_K_M<\/td>\n<td>~4,0 Go<\/td>\n<td>D\u00e9gradation notable<\/td>\n<td>Uniquement lorsque Q4 ne tient v\u00e9ritablement pas<\/td>\n<\/tr>\n<tr>\n<td>Q2_K \/ IQ2<\/td>\n<td>~3,2 Go<\/td>\n<td>D\u00e9gradation importante<\/td>\n<td>Dernier recours ; un mod\u00e8le plus petit en Q4 est souvent pr\u00e9f\u00e9rable<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Deux r\u00e8gles utiles : la quantification nuit davantage aux petits mod\u00e8les qu\u2019aux grands (un mod\u00e8le de 70 milliards de param\u00e8tres en Q3 se comporte bien mieux qu\u2019un mod\u00e8le de 8 milliards en Q3), et en dessous de Q4, la courbe de qualit\u00e9 chute fortement. En cas de doute, <code>Q4_K_M<\/code> est la valeur par d\u00e9faut communautaire pour une bonne raison.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Picking_a_quantisation_for_your_VRAM\"><\/span>Choisir une quantification adapt\u00e9e \u00e0 votre VRAM<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>La m\u00e9moire totale requise est approximativement \u00e9gale \u00e0 <em>taille du fichier + cache de contexte + surcharge<\/em>. Pr\u00e9voyez 1 \u00e0 2 Go suppl\u00e9mentaires par rapport \u00e0 la taille du fichier pour quelques milliers de jetons de contexte, voire davantage si vous utilisez des contextes tr\u00e8s longs. Le mod\u00e8le s\u2019ex\u00e9cute le plus rapidement lorsque l\u2019ensemble de ces \u00e9l\u00e9ments tient enti\u00e8rement dans la VRAM du GPU ; les outils bas\u00e9s sur llama.cpp peuvent d\u00e9charger le reste dans la m\u00e9moire syst\u00e8me, ce qui fonctionne encore mais ralentit consid\u00e9rablement \u00e0 mesure que davantage de couches sont d\u00e9plac\u00e9es.<\/p>\n<table>\n<thead>\n<tr>\n<th>VRAM<\/th>\n<th>Ce qui tient confortablement<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>8 Go<\/td>\n<td>des mod\u00e8les de 7 \u00e0 8 milliards de param\u00e8tres en Q4_K_M ou Q5_K_M<\/td>\n<\/tr>\n<tr>\n<td>12 Go<\/td>\n<td>un mod\u00e8le de 8 milliards en Q8_0, ou un mod\u00e8le de 12 \u00e0 14 milliards en Q4_K_M<\/td>\n<\/tr>\n<tr>\n<td>16 Go<\/td>\n<td>un mod\u00e8le de 14 milliards en Q5_K_M\/Q6_K<\/td>\n<\/tr>\n<tr>\n<td>24 Go<\/td>\n<td>environ un mod\u00e8le de 32 milliards en Q4_K_M, ou un mod\u00e8le de 14 milliards en Q8_0 avec un contexte long<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Pour obtenir des chiffres pr\u00e9cis sur un mod\u00e8le et une longueur de contexte donn\u00e9s, <a href=\"https:\/\/convly.ai\/fr\/llm-vram-calculator\/\">Calculateur de VRAM<\/a> effectue automatiquement les calculs, et une analyse d\u00e9taill\u00e9e par mod\u00e8le est disponible dans <a href=\"https:\/\/convly.ai\/fr\/vram-requirements-every-major-llm-2026\/\">Exigences en VRAM pour chaque grand mod\u00e8le de langage (LLM)<\/a>. Si vous choisissez du mat\u00e9riel plut\u00f4t qu\u2019un niveau de quantification, commencez par <a href=\"https:\/\/convly.ai\/fr\/best-gpus-for-local-llms-2026\/\">les meilleurs GPU pour les LLM locaux<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"GGUF_vs_safetensors\"><\/span>GGUF contre safetensors<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Ces deux formats coexistent car ils servent des environnements d\u2019ex\u00e9cution diff\u00e9rents, et non parce que l\u2019un l\u2019emporte sur l\u2019autre.<\/p>\n<table>\n<thead>\n<tr>\n<th><\/th>\n<th>GGUF<\/th>\n<th>safetensors<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Con\u00e7u pour<\/td>\n<td>llama.cpp et son \u00e9cosyst\u00e8me<\/td>\n<td>L\u2019\u00e9cosyst\u00e8me Hugging Face \/ PyTorch<\/td>\n<\/tr>\n<tr>\n<td>Contenu<\/td>\n<td>Poids + tokenizer + configuration dans un seul fichier<\/td>\n<td>Tenseurs uniquement ; la configuration et le tokenizer sont des fichiers JSON s\u00e9par\u00e9s<\/td>\n<\/tr>\n<tr>\n<td>Quantification<\/td>\n<td>Int\u00e9gr\u00e9e au format (Q4_K_M, etc.)<\/td>\n<td>G\u00e9n\u00e9ralement en FP16\/BF16 ; la quantification s\u2019effectue via des m\u00e9thodes distinctes (GPTQ, AWQ)<\/td>\n<\/tr>\n<tr>\n<td>Environnements d\u2019ex\u00e9cution typiques<\/td>\n<td>Ollama, LM Studio, llama.cpp, KoboldCpp, Jan<\/td>\n<td>transformers, vLLM, TGI, SGLang<\/td>\n<\/tr>\n<tr>\n<td>Point optimal<\/td>\n<td>Mat\u00e9riel grand public, hybride CPU+GPU, usage individuel<\/td>\n<td>GPU pour centres de donn\u00e9es, service haute performance, entra\u00eenement<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>La d\u00e9cision d\u00e9pend essentiellement du logiciel que vous utilisez : les outils bureautiques et Ollama privil\u00e9gient GGUF, tandis que les piles de service GPU et tout ce qui implique un affinage n\u00e9cessitent safetensors. Les \u00e9diteurs de mod\u00e8les publient g\u00e9n\u00e9ralement d\u2019abord des versions safetensors, et la communaut\u00e9 les convertit en GGUF en quelques jours.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Where_GGUF_files_come_from\"><\/span>D\u2019o\u00f9 proviennent les fichiers GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Presque tous les fichiers GGUF sont h\u00e9berg\u00e9s sur Hugging Face. Certains laboratoires publient occasionnellement des versions officielles GGUF, mais la plupart proviennent de quantificateurs communautaires \u2014 des comptes tels que <code>bartowski<\/code>, <code>unsloth<\/code>, <code>lmstudio-community<\/code> et <code>ggml-org<\/code> \u2014 qui convertissent chaque nouvelle version dans toute la gamme des niveaux de quantification. Un d\u00e9p\u00f4t nomm\u00e9, par exemple, <code>Meta-Llama-3.1-8B-Instruct-GGUF<\/code> contiendra un fichier par niveau de quantification.<\/p>\n<p>Vous pouvez \u00e9galement convertir vous-m\u00eame un mod\u00e8le \u00e0 l\u2019aide des outils fournis avec llama.cpp : <code>convert_hf_to_gguf.py<\/code> transforme un mod\u00e8le Hugging Face en un GGUF en F16, et le binaire <code>llama-quantize<\/code> (compil\u00e9 lors de la construction de llama.cpp) le compresse selon le niveau de quantification choisi, par exemple. <code>mod\u00e8le llama-quantize model-f16.gguf model-Q4_K_M.gguf Q4_K_M<\/code>.<\/p>\n<h3>Chargement d\u2019un fichier GGUF dans Ollama<\/h3>\n<p>Ollama peut t\u00e9l\u00e9charger directement des d\u00e9p\u00f4ts GGUF depuis Hugging Face ; la m\u00e9thode de quantification est indiqu\u00e9e apr\u00e8s le signe deux-points :<\/p>\n<pre><code>ollama run hf.co\/bartowski\/Meta-Llama-3.1-8B-Instruct-GGUF:Q4_K_M<\/code><\/pre>\n<p>Pour un fichier d\u00e9j\u00e0 pr\u00e9sent sur votre disque, cr\u00e9ez un fichier texte brut nomm\u00e9 <code>Modelfile<\/code> contenant :<\/p>\n<pre><code>FROM .\/my-model.gguf<\/code><\/pre>\n<p>puis enregistrez-le et ex\u00e9cutez-le :<\/p>\n<pre><code>ollama create my-model -f Modelfile\nollama run my-model<\/code><\/pre>\n<p>Les versions actuelles d\u2019Ollama lisent automatiquement le mod\u00e8le de conversation (chat template) int\u00e9gr\u00e9 aux m\u00e9tadonn\u00e9es GGUF ; si un mod\u00e8le import\u00e9 produit une sortie illisible, la solution consiste g\u00e9n\u00e9ralement \u00e0 ajouter explicitement une ligne <code>TEMPLATE<\/code> dans le fichier Modelfile. Le <a href=\"https:\/\/convly.ai\/fr\/what-is-ollama-complete-guide-2026\/\">guide complet d\u2019Ollama<\/a> traite en profondeur les fichiers Modelfile.<\/p>\n<h3>Chargement d\u2019un fichier GGUF dans LM Studio<\/h3>\n<p>La m\u00e9thode habituelle consiste \u00e0 utiliser le t\u00e9l\u00e9chargement int\u00e9gr\u00e9 : ouvrez l\u2019onglet D\u00e9couvrir, recherchez un mod\u00e8le, et LM Studio affiche les versions GGUF quantifi\u00e9es disponibles, en indiquant celles qui sont compatibles avec votre mat\u00e9riel. Pour importer un fichier d\u00e9j\u00e0 pr\u00e9sent sur votre disque, utilisez l\u2019interface en ligne de commande (CLI) (<code>lms import path\/to\/model.gguf<\/code>) ou placez-le directement dans le r\u00e9pertoire des mod\u00e8les de LM Studio \u2014 le chemin par d\u00e9faut exact varie selon la version et le syst\u00e8me d\u2019exploitation, mais l\u2019onglet Mes mod\u00e8les l\u2019affiche et vous permet de le modifier. Les fichiers doivent \u00eatre organis\u00e9s dans une structure de sous-dossiers du type <code>\u00e9diteur\/nom-du-mod\u00e8le\/<\/code> pour \u00eatre reconnus. Consultez le <a href=\"https:\/\/convly.ai\/fr\/lm-studio-complete-guide-2026\/\">guide complet de LM Studio<\/a> pour un tutoriel d\u00e9taill\u00e9.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_asked_questions\"><\/span>Questions fr\u00e9quemment pos\u00e9es<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>GGUF fonctionne-t-il uniquement sur CPU ou exploite-t-il aussi le GPU ?<\/h3>\n<p>Les deux. llama.cpp a \u00e9t\u00e9 initialement con\u00e7u comme un projet d\u2019inf\u00e9rence sur CPU, mais il d\u00e9charge d\u00e9sormais certaines couches du mod\u00e8le vers le GPU (via CUDA, Metal, Vulkan ou ROCm), et peut m\u00eame s\u2019ex\u00e9cuter enti\u00e8rement sur GPU lorsque le mod\u00e8le tient enti\u00e8rement dans la m\u00e9moire vid\u00e9o (VRAM). Ollama et LM Studio g\u00e8rent automatiquement la r\u00e9partition entre CPU et GPU ; avec llama.cpp directement, vous contr\u00f4lez ce comportement \u00e0 l\u2019aide de l\u2019option <code>-ngl<\/code> (nombre de couches transf\u00e9r\u00e9es sur le GPU).<\/p>\n<h3>Quelle est la diff\u00e9rence entre Q4_K_M et Q4_K_S ?<\/h3>\n<p>Ces deux formats sont des quantifications k-quants d\u2019environ 4 bits ; la lettre indique la variante de taille. <code>_M<\/code> (moyenne) conserve davantage de tenseurs sensibles \u00e0 la qualit\u00e9 \u00e0 une pr\u00e9cision sup\u00e9rieure par rapport \u00e0 <code>_S<\/code> (petite), ce qui la rend l\u00e9g\u00e8rement plus volumineuse et l\u00e9g\u00e8rement plus performante. La diff\u00e9rence est minime \u2014 choisissez <code>_M<\/code> sauf si les derniers centaines de m\u00e9gaoctets font la diff\u00e9rence pour que le mod\u00e8le tienne dans votre VRAM.<\/p>\n<h3>Quelle perte de qualit\u00e9 r\u00e9elle subit-on avec la quantification ?<\/h3>\n<p>Avec Q8_0 et Q6_K, la perte est quasiment nulle \u2014 des tests \u00e0 l\u2019aveugle peinent \u00e0 les distinguer des versions en F16. Q4_K_M pr\u00e9sente une l\u00e9g\u00e8re d\u00e9gradation mesurable, g\u00e9n\u00e9ralement imperceptible dans les \u00e9changes conversationnels, bien qu\u2019elle puisse avoir un impact sur des t\u00e2ches exigeantes comme la g\u00e9n\u00e9ration de code ou les calculs math\u00e9matiques. En dessous de Q4, la d\u00e9gradation devient nette, et les petits mod\u00e8les en souffrent davantage que les grands.<\/p>\n<h3>Puis-je utiliser GGUF avec transformers ou vLLM ?<\/h3>\n<p>Un support existe, mais il est limit\u00e9 et non natif : transformers peut d\u00e9quantifier certains fichiers GGUF au chargement, tandis que vLLM propose un support exp\u00e9rimental de GGUF, dont la disponibilit\u00e9 d\u00e9pend de l\u2019architecture. Si vous d\u00e9veloppez sur ces frameworks, privil\u00e9giez plut\u00f4t le format safetensors ; GGUF doit \u00eatre consid\u00e9r\u00e9 comme le format standard pour les environnements d\u2019ex\u00e9cution de la famille llama.cpp.<\/p>\n<h3>Pourquoi mon mod\u00e8le est-il d\u00e9coup\u00e9 en plusieurs fichiers .gguf ?<\/h3>\n<p>Les mod\u00e8les tr\u00e8s volumineux sont fragment\u00e9s en parties nomm\u00e9es, par exemple <code>model-00001-of-00002.gguf<\/code>, principalement pour rester sous les limites de taille impos\u00e9es par les plateformes d\u2019h\u00e9bergement. Conservez tous les fragments dans le m\u00eame dossier et pointez votre environnement d\u2019ex\u00e9cution vers le premier fichier \u2014 llama.cpp et les outils qui s\u2019appuient dessus chargent automatiquement les autres.<\/p>\n<p>Une fois que vous connaissez la quantification adapt\u00e9e \u00e0 votre mat\u00e9riel, la question pratique suivante est de choisir quel mod\u00e8le y charger \u2014 le <a href=\"https:\/\/convly.ai\/fr\/models\/\">base de donn\u00e9es de mod\u00e8les<\/a> r\u00e9pertorie les caract\u00e9ristiques techniques, les besoins en VRAM et les prix de 37 mod\u00e8les actuels, tandis que <a href=\"https:\/\/convly.ai\/fr\/best-local-llms-to-run-on-ollama-2026\/\">les meilleurs mod\u00e8les locaux pour Ollama<\/a> constitue une bonne s\u00e9lection pour commencer.<\/p>","protected":false},"excerpt":{"rendered":"<p>GGUF is the file format for running LLMs locally. It packs a model&#8217;s weights, tokenizer and configuration into a single [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":2104,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2103","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts\/2103","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/comments?post=2103"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts\/2103\/revisions"}],"predecessor-version":[{"id":2105,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts\/2103\/revisions\/2105"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/media\/2104"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/media?parent=2103"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/categories?post=2103"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/tags?post=2103"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}