{"id":2605,"date":"2026-09-09T20:14:45","date_gmt":"2026-09-09T20:14:45","guid":{"rendered":"https:\/\/convly.ai\/?p=2605"},"modified":"2026-09-09T20:14:45","modified_gmt":"2026-09-09T20:14:45","slug":"gguf-models","status":"publish","type":"post","link":"https:\/\/convly.ai\/fr\/gguf-models\/","title":{"rendered":"Mod\u00e8les GGUF : ce qu\u2019ils sont et comment les ex\u00e9cuter"},"content":{"rendered":"<div class=\"convly-tldr\">\n<ul>\n<li><strong>GGUF est un format conteneur mono-fichier pour mod\u00e8les quantifi\u00e9s<\/strong>, cr\u00e9\u00e9 pour <a href=\"https:\/\/github.com\/ggml-org\/llama.cpp\" rel=\"noopener\" target=\"_blank\">llama.cpp<\/a>. Un <code>.gguf<\/code> seul fichier contient les poids, le tokenizer, le mod\u00e8le de discussion (chat template) et les m\u00e9tadonn\u00e9es \u2014 pas de dossier de configuration, pas de fichiers s\u00e9par\u00e9s pour le tokenizer.<\/li>\n<li><strong>GGUF models are what Ollama, LM Studio, KoboldCpp, Jan and llama.cpp actually load.<\/strong> Si vous ex\u00e9cutez un mod\u00e8le localement sur du mat\u00e9riel grand public, il est quasi certain que vous utilisez GGUF.<\/li>\n<li><strong>Choix par d\u00e9faut : <code>Q4_K_M<\/code>.<\/strong> Environ 0,6 Go de taille par milliard de param\u00e8tres \u2014 un mod\u00e8le de 8 milliards de param\u00e8tres p\u00e8se environ 5 Go, ce qui correspond \u00e0 la valeur de ~5 Go en 4 bits indiqu\u00e9e par <a href=\"https:\/\/convly.ai\/fr\/models\/\">base de donn\u00e9es des mod\u00e8les Convly<\/a> pour Llama 3.1 8B.<\/li>\n<li><strong>GGUF est con\u00e7u pour l\u2019inf\u00e9rence locale destin\u00e9e \u00e0 un seul utilisateur.<\/strong> For concurrent serving use safetensors with vLLM or an API instead.<\/li>\n<\/ul>\n<\/div>\n<p>GGUF (GPT-Generated Unified Format) est le format de fichier utilis\u00e9 par l\u2019\u00e9cosyst\u00e8me llama.cpp\/ggml pour stocker un mod\u00e8le pr\u00eat \u00e0 \u00eatre utilis\u00e9 en inf\u00e9rence. Un seul <code>.gguf<\/code> fichier contient les tenseurs quantifi\u00e9s ainsi que tout ce qui est n\u00e9cessaire pour les exploiter : vocabulaire, param\u00e8tres du tokenizer, mod\u00e8le de discussion (chat template) et m\u00e9tadonn\u00e9es relatives \u00e0 l\u2019architecture. Il a remplac\u00e9 l\u2019ancien format GGML en ao\u00fbt 2023 et constitue d\u00e9sormais la norme de facto pour ex\u00e9cuter des mod\u00e8les sur des ordinateurs portables, des postes de travail et des processeurs (CPU).<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_87_1 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6aa1d08d1e6b6\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Basculer<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6aa1d08d1e6b6\"  aria-label=\"Basculer\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/fr\/gguf-models\/#What_is_actually_inside_a_gguf_file\" >Que contient r\u00e9ellement un fichier .gguf<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/fr\/gguf-models\/#How_to_read_a_GGUF_filename\" >Comment interpr\u00e9ter un nom de fichier GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/fr\/gguf-models\/#Sizing_which_GGUF_models_fit_your_GPU\" >Taille : quels mod\u00e8les GGUF conviennent \u00e0 votre GPU<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/fr\/gguf-models\/#Where_to_download_GGUF_models\" >O\u00f9 t\u00e9l\u00e9charger des mod\u00e8les GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/fr\/gguf-models\/#Running_GGUF_models_on_Linux\" >Ex\u00e9cuter des mod\u00e8les GGUF sous Linux<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/fr\/gguf-models\/#Running_GGUF_models_on_macOS\" >Ex\u00e9cuter des mod\u00e8les GGUF sous macOS<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/fr\/gguf-models\/#Running_GGUF_models_on_Windows\" >Ex\u00e9cuter des mod\u00e8les GGUF sous Windows<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/fr\/gguf-models\/#Loading_an_arbitrary_GGUF_into_Ollama\" >Charger un fichier GGUF arbitraire dans Ollama<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-9\" href=\"https:\/\/convly.ai\/fr\/gguf-models\/#When_GGUF_is_the_wrong_answer\" >Quand GGUF n\u2019est pas la bonne solution<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-10\" href=\"https:\/\/convly.ai\/fr\/gguf-models\/#Frequently_asked_questions\" >Questions fr\u00e9quemment pos\u00e9es<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"What_is_actually_inside_a_gguf_file\"><\/span>Que contient r\u00e9ellement un fichier .gguf<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Un fichier GGUF se compose d\u2019un en-t\u00eate, d\u2019un bloc de m\u00e9tadonn\u00e9es cl\u00e9-valeur, puis des donn\u00e9es tensorielles. Ce sont les m\u00e9tadonn\u00e9es qui rev\u00eatent une importance pratique \u2014 c\u2019est pourquoi un mod\u00e8le GGUF ne n\u00e9cessite aucun fichier annexe. La documentation GGUF d\u2019Hugging Face <a href=\"https:\/\/huggingface.co\/docs\/hub\/en\/gguf\" rel=\"noopener\" target=\"_blank\">GGUF documentation<\/a> d\u00e9crit la structure du format ainsi que le visualiseur int\u00e9gr\u00e9 de m\u00e9tadonn\u00e9es GGUF sur le Hub, qui vous permet d\u2019inspecter au pr\u00e9alable le type de quantification, la longueur de contexte et le mod\u00e8le de discussion (chat template) d\u2019un fichier avant de t\u00e9l\u00e9charger plusieurs gigaoctets.<\/p>\n<p>Les cl\u00e9s de m\u00e9tadonn\u00e9es courantes incluent l\u2019architecture (<code>llama<\/code>, <code>qwen3<\/code>, <code>gemma3<\/code>, <code>phi3<\/code>), la longueur de contexte utilis\u00e9e lors de l\u2019entra\u00eenement, les param\u00e8tres RoPE, le vocabulaire complet et le mod\u00e8le de discussion Jinja. Un chargeur lit ce bloc et s\u2019configure automatiquement ; vous n\u2019avez pas besoin de fournir manuellement un tokenizer ou un format de prompt.<\/p>\n<h3>GGUF contre safetensors<\/h3>\n<table>\n<thead>\n<tr>\n<th><\/th>\n<th>GGUF<\/th>\n<th>safetensors<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Runtime principal<\/td>\n<td>llama.cpp, Ollama, LM Studio<\/td>\n<td>PyTorch, vLLM, Transformers, TGI<\/td>\n<\/tr>\n<tr>\n<td>Fichiers par mod\u00e8le<\/td>\n<td>Un seul (ou fragments num\u00e9rot\u00e9s)<\/td>\n<td>Poids plus dossier config\/tokenizer<\/td>\n<\/tr>\n<tr>\n<td>Quantification<\/td>\n<td>Int\u00e9gr\u00e9e (Q4_K_M, Q8_0, IQ\u2026)<\/td>\n<td>G\u00e9n\u00e9ralement FP16\/BF16, ou variantes GPTQ\/AWQ<\/td>\n<\/tr>\n<tr>\n<td>CPU + d\u00e9chargement partiel sur GPU<\/td>\n<td>Oui, objectif fondamental de conception<\/td>\n<td>Limit\u00e9e et lente<\/td>\n<\/tr>\n<tr>\n<td>Serving group\u00e9 simultan\u00e9<\/td>\n<td>Faible<\/td>\n<td>Fort<\/td>\n<\/tr>\n<tr>\n<td>Affinage<\/td>\n<td>Non (conversion pr\u00e9alable requise)<\/td>\n<td>Oui<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<h2><span class=\"ez-toc-section\" id=\"How_to_read_a_GGUF_filename\"><\/span>Comment interpr\u00e9ter un nom de fichier GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Les fichiers portent g\u00e9n\u00e9ralement des noms tels que <code>Model-Name-8B-Instruct-Q4_K_M.gguf<\/code>. Le suffixe indique le type de quantification mixte. Le chiffre correspond \u00e0 la largeur de bit nominale ; <code>_K<\/code> signifie k-quants, qui conservent les tenseurs d\u2019attention et d\u2019embedding \u00e0 une pr\u00e9cision sup\u00e9rieure \u00e0 celle des poids principaux de la couche feed-forward ; <code>S<\/code>\/<code>M<\/code>\/<code>L<\/code> d\u00e9signent respectivement les variantes petite, moyenne et grande de ce type de quantification.<\/p>\n<table>\n<thead>\n<tr>\n<th>Quant<\/th>\n<th>Bits\/poids approximatifs<\/th>\n<th>Taille approximative, mod\u00e8le de 8\u00a0milliards de param\u00e8tres<\/th>\n<th>Quand l'utiliser<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Q8_0<\/td>\n<td>~8.5<\/td>\n<td>~8,5 Go<\/td>\n<td>R\u00e9f\u00e9rence quasi sans perte ; mod\u00e8les petits uniquement<\/td>\n<\/tr>\n<tr>\n<td>Q6_K<\/td>\n<td>~6.6<\/td>\n<td>~6,6 Go<\/td>\n<td>Vous disposez de VRAM en surplus<\/td>\n<\/tr>\n<tr>\n<td>Q5_K_M<\/td>\n<td>~5.7<\/td>\n<td>~5,7 Go<\/td>\n<td>Param\u00e8tre par d\u00e9faut privil\u00e9giant la qualit\u00e9<\/td>\n<\/tr>\n<tr>\n<td>Q4_K_M<\/td>\n<td>~4.9<\/td>\n<td>~4,9 Go<\/td>\n<td><strong>Valeur par d\u00e9faut habituelle<\/strong><\/td>\n<\/tr>\n<tr>\n<td>Q4_0<\/td>\n<td>~4.5<\/td>\n<td>~4,5 Go<\/td>\n<td>H\u00e9ritage ; certains acc\u00e9l\u00e9rateurs le pr\u00e9f\u00e8rent<\/td>\n<\/tr>\n<tr>\n<td>Q3_K_M<\/td>\n<td>~3.9<\/td>\n<td>~4,0 Go<\/td>\n<td>Faire tenir un mod\u00e8le plus volumineux dans une faible quantit\u00e9 de VRAM<\/td>\n<\/tr>\n<tr>\n<td>Q2_K \/ IQ2<\/td>\n<td>~2,5\u20133,4<\/td>\n<td>~2,5\u20133,4\u00a0Go<\/td>\n<td>Dernier recours ; d\u00e9gradation notable<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Consid\u00e9rez la colonne \u00ab bits par poids \u00bb comme approximative. Les tailles r\u00e9elles varient selon l\u2019architecture du mod\u00e8le (un grand vocabulaire gonfle les tenseurs d\u2019embeddings) et selon la version de llama.cpp, car les combinaisons de quantification sont progressivement optimis\u00e9es. La famille <code>IQ<\/code> (IQ2_XXS \u00e0 IQ4_NL) utilise une calibration bas\u00e9e sur une matrice d\u2019importance pour mieux r\u00e9sister \u00e0 des largeurs de bits tr\u00e8s faibles, et des quantificateurs tels que Bartowski ou Unsloth publient des variantes IQ aux c\u00f4t\u00e9s des K-quants standards.<\/p>\n<p>Le consensus communautaire \u2014 et non une mesure effectu\u00e9e par Convly \u2014 est que Q4_K_M repr\u00e9sente le meilleur compromis, et que la qualit\u00e9 chute fortement en dessous d\u2019environ 3 bits par poids : les mod\u00e8les petits se d\u00e9gradent plus rapidement que les grands au m\u00eame niveau de quantification.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Sizing_which_GGUF_models_fit_your_GPU\"><\/span>Taille : quels mod\u00e8les GGUF conviennent \u00e0 votre GPU<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>La taille du fichier constitue un plancher, pas le total. Ajoutez la m\u00e9moire cache KV correspondant \u00e0 votre longueur de contexte, ainsi qu\u2019environ 500\u00a0Mo \u00e0 1\u00a0Go de surcharge. Ces chiffres \u00e0 4 bits proviennent de la <a href=\"https:\/\/convly.ai\/fr\/models\/\">base de donn\u00e9es des mod\u00e8les Convly<\/a>:<\/p>\n<table>\n<thead>\n<tr>\n<th>Mod\u00e8le<\/th>\n<th>VRAM en 4 bits<\/th>\n<th>Contexte<\/th>\n<th>GPU r\u00e9aliste<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Gemma 3 4B<\/td>\n<td>~3 Go<\/td>\n<td>128 K<\/td>\n<td>Toute carte graphique de 6\u00a0Go, GPU int\u00e9gr\u00e9<\/td>\n<\/tr>\n<tr>\n<td>Mistral 7B<\/td>\n<td>~4,5 Go<\/td>\n<td>32 K<\/td>\n<td>Carte graphique de 8\u00a0Go<\/td>\n<\/tr>\n<tr>\n<td>Llama 3.1 8B<\/td>\n<td>~5 Go<\/td>\n<td>128 K<\/td>\n<td>Carte graphique de 8\u00a0Go<\/td>\n<\/tr>\n<tr>\n<td>Qwen3 14B<\/td>\n<td>~9 Go<\/td>\n<td>128 K<\/td>\n<td>Carte graphique de 12\u00a0Go<\/td>\n<\/tr>\n<tr>\n<td>Phi-4<\/td>\n<td>~9 Go<\/td>\n<td>16 K<\/td>\n<td>Carte graphique de 12\u00a0Go<\/td>\n<\/tr>\n<tr>\n<td>Gemma 3 27B<\/td>\n<td>~16 Go<\/td>\n<td>128 K<\/td>\n<td>Carte graphique de 24\u00a0Go<\/td>\n<\/tr>\n<tr>\n<td>Qwen3 32B<\/td>\n<td>~20 Go<\/td>\n<td>128 K<\/td>\n<td>Carte graphique de 24\u00a0Go<\/td>\n<\/tr>\n<tr>\n<td>Llama 3.3 70B<\/td>\n<td>~40 Go<\/td>\n<td>128 K<\/td>\n<td>2 \u00d7 24\u00a0Go ou m\u00e9moire unifi\u00e9e de 48\u00a0Go<\/td>\n<\/tr>\n<tr>\n<td>DeepSeek R1 (int\u00e9gral)<\/td>\n<td>~400 Go<\/td>\n<td>128 K<\/td>\n<td>Serveur multi-GPU uniquement<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Mixture-of-experts models are the trap here. Qwen3 30B-A3B activates only ~3B parameters per token but still needs all ~18 GB resident. At the extreme, the database puts Kimi K3 at ~1.4 TB at 4-bit \u2014 a GGUF exists in principle, but no single machine you own will hold it. For an exact figure at your context length, use the <a href=\"https:\/\/convly.ai\/fr\/llm-vram-calculator\/\">Calculateur de VRAM<\/a> ou la ventilation par mod\u00e8le fournie dans <a href=\"https:\/\/convly.ai\/fr\/vram-requirements-every-major-llm-2026\/\">Exigences en VRAM pour chaque grand mod\u00e8le de langage (LLM)<\/a>. Si vous \u00eates encore en train de choisir votre mat\u00e9riel, <a href=\"https:\/\/convly.ai\/fr\/best-gpus-for-local-llms-2026\/\">meilleures GPU pour les LLM locaux<\/a> traite le compromis VRAM\/prix.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Where_to_download_GGUF_models\"><\/span>O\u00f9 t\u00e9l\u00e9charger des mod\u00e8les GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<ul>\n<li><strong>Hugging Face<\/strong> \u2014 filtrez la liste des mod\u00e8les avec <a href=\"https:\/\/huggingface.co\/models?library=gguf\" rel=\"noopener\" target=\"_blank\">library=gguf<\/a>. La plupart des d\u00e9p\u00f4ts fournissent toutes les quantifications dans un seul d\u00e9p\u00f4t ; t\u00e9l\u00e9chargez uniquement le fichier dont vous avez besoin, pas l\u2019int\u00e9gralit\u00e9 du d\u00e9p\u00f4t.<\/li>\n<li><strong>biblioth\u00e8que Ollama<\/strong> \u2014 <a href=\"https:\/\/ollama.com\/library\" rel=\"noopener\" target=\"_blank\">ollama.com\/library<\/a> propose des fichiers GGUF pr\u00e9-packag\u00e9s avec le mod\u00e8le de discussion d\u00e9j\u00e0 configur\u00e9. Consultez le <a href=\"https:\/\/convly.ai\/fr\/ollama-models-list-2026\/\">Liste des mod\u00e8les Ollama<\/a>.<\/li>\n<li><strong>LM Studio<\/strong> \u2014 l\u2019onglet D\u00e9couvrir int\u00e9gr\u00e9 \u00e0 l\u2019application recherche les d\u00e9p\u00f4ts GGUF sur Hugging Face et signale quelles quantifications conviennent \u00e0 la RAM\/VRAM d\u00e9tect\u00e9e sur votre syst\u00e8me. Tutoriel pas \u00e0 pas : <a href=\"https:\/\/convly.ai\/fr\/lm-studio-complete-guide-2026\/\">Guide complet de LM Studio<\/a>.<\/li>\n<\/ul>\n<p>Les mod\u00e8les volumineux arrivent fragment\u00e9s sous forme de <code>model-00001-of-00003.gguf<\/code> et ainsi de suite. T\u00e9l\u00e9chargez tous les fragments dans le m\u00eame dossier, puis pointez le chargeur vers le fragment 00001 \u2014 il d\u00e9tectera automatiquement les autres.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Running_GGUF_models_on_Linux\"><\/span>Ex\u00e9cuter des mod\u00e8les GGUF sous Linux<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Construisez llama.cpp avec le support CUDA :<\/p>\n<pre><code>git clone https:\/\/github.com\/ggml-org\/llama.cpp\ncd llama.cpp\ncmake -B build -DGGML_CUDA=ON\ncmake --build build --config Release -j<\/code><\/pre>\n<p>Les binaires sont plac\u00e9s dans <code>build\/bin\/<\/code>. Lancez un serveur compatible OpenAI :<\/p>\n<pre><code>.\/build\/bin\/llama-server -m ~\/models\/model-Q4_K_M.gguf -c 8192 -ngl 99 --port 8080<\/code><\/pre>\n<p><code>-ngl<\/code> (<code>--n-gpu-layers<\/code>) est le r\u00e9glage de d\u00e9chargement : <code>99<\/code> signifie \u00ab toutes les couches sur GPU \u00bb <code>0<\/code> signifie \u00ab CPU uniquement \u00bb, et les valeurs interm\u00e9diaires r\u00e9partissent le mod\u00e8le entre GPU et CPU lorsque celui-ci ne tient pas enti\u00e8rement sur GPU. <code>-c<\/code> d\u00e9finit la longueur de contexte ; la laisser \u00e0 la valeur maximale entra\u00een\u00e9e pour le mod\u00e8le peut consommer davantage de VRAM que les poids eux-m\u00eames. Le point de terminaison devient alors <code>http:\/\/localhost:8080\/v1\/chat\/completions<\/code>.<\/p>\n<p>Deux pr\u00e9cisions concernant les versions : le drapeau CMake s\u2019appelait <code>LLAMA_CUBLAS<\/code> dans les anciennes versions, et les binaires ont \u00e9t\u00e9 renomm\u00e9s (<code>main<\/code> \u2192 <code>llama-cli<\/code>, <code>server<\/code> \u2192 <code>llama-server<\/code>) en 2024. Consultez le fichier README du d\u00e9p\u00f4t que vous avez clon\u00e9 pour conna\u00eetre les instructions exactes. Pour les GPU AMD ou Intel, remplacez le drapeau CUDA par celui correspondant au backend ROCm\/Vulkan\/SYCL document\u00e9 dans le d\u00e9p\u00f4t, plut\u00f4t que d\u2019essayer de deviner.<\/p>\n<p>Si vous utilisez Ollama \u00e0 la place, les mod\u00e8les sont stock\u00e9s dans <code>\/usr\/share\/ollama\/.ollama\/models<\/code> lorsqu\u2019il fonctionne en tant que service syst\u00e8me, ou <code>~\/.ollama\/models<\/code> pour une installation utilisateur. Voir <a href=\"https:\/\/convly.ai\/fr\/how-to-install-ollama-2026\/\">comment installer Ollama<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Running_GGUF_models_on_macOS\"><\/span>Ex\u00e9cuter des mod\u00e8les GGUF sous macOS<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Apple Silicon est remarquablement performant avec GGUF, car sa m\u00e9moire unifi\u00e9e permet au GPU d\u2019acc\u00e9der \u00e0 la majeure partie de la RAM syst\u00e8me : un Mac de 64 Go peut charger un mod\u00e8le 70B quantifi\u00e9 en 4 bits d\u2019environ 40 Go, qui n\u00e9cessiterait deux cartes PC de 24 Go.<\/p>\n<pre><code>brew install llama.cpp\nllama-server -m ~\/models\/model-Q4_K_M.gguf -c 8192 --port 8080<\/code><\/pre>\n<p>Le d\u00e9chargement vers Metal est activ\u00e9 dans la version Homebrew, donc vous n\u2019avez g\u00e9n\u00e9ralement pas besoin de <code>-ngl<\/code>. macOS limite la quantit\u00e9 de m\u00e9moire RAM que le GPU peut r\u00e9server (r\u00e9glable via un <code>iogpu<\/code> sysctl, dont la valeur varie selon la version de macOS), aussi laissez une marge pour le syst\u00e8me d\u2019exploitation. Ollama stocke les mod\u00e8les dans <code>~\/.ollama\/models<\/code>; LM Studio utilise <code>~\/.lmstudio\/models<\/code> sur les versions r\u00e9centes et <code>~\/.cache\/lm-studio\/models<\/code> sur les versions plus anciennes \u2014 l\u2019onglet \u00ab Mes mod\u00e8les \u00bb affiche et permet de modifier le chemin r\u00e9el.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Running_GGUF_models_on_Windows\"><\/span>Ex\u00e9cuter des mod\u00e8les GGUF sous Windows<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Trois approches, du plus simple au plus technique :<\/p>\n<ol>\n<li><strong>LM Studio<\/strong> \u2014 Installateur graphique, recherche int\u00e9gr\u00e9e de mod\u00e8les, bascule vers un serveur local. Le meilleur choix par d\u00e9faut pour les non-d\u00e9veloppeurs.<\/li>\n<li><strong>Ollama<\/strong> \u2014 Installateur natif Windows ; les mod\u00e8les sont plac\u00e9s dans <code>C:\\Users&lt;vous&gt;\\.ollama\\models<\/code>. D\u00e9finissez la variable d\u2019environnement <code>OLLAMA_MODELS<\/code> pour les d\u00e9placer hors du disque syst\u00e8me. Contexte : <a href=\"https:\/\/convly.ai\/fr\/what-is-ollama-complete-guide-2026\/\">qu\u2019est-ce qu\u2019Ollama<\/a>.<\/li>\n<li><strong>Binaires pr\u00e9compil\u00e9s de llama.cpp<\/strong> \u2014 La page des versions GitHub publie des archives Windows zipp\u00e9es pour chaque backend (CUDA, Vulkan, CPU). D\u00e9compressez-les puis ex\u00e9cutez <code>llama-server.exe -m model.gguf -ngl 99<\/code> \u00e0 partir de PowerShell. Choisissez la version CUDA pour les cartes NVIDIA ; Vulkan constitue une solution fiable multi-fournisseurs pour AMD et Intel Arc.<\/li>\n<\/ol>\n<p>Pi\u00e8ges sp\u00e9cifiques \u00e0 Windows : l\u2019analyse en temps r\u00e9el de Windows Defender ralentit le premier chargement d\u2019un fichier de plusieurs gigaoctets, et l\u2019ex\u00e9cution de llama.cpp sous WSL2 consomme une part de la m\u00e9moire RAM allou\u00e9e \u00e0 la machine virtuelle. Les versions natives Windows constituent g\u00e9n\u00e9ralement la voie la plus simple.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Loading_an_arbitrary_GGUF_into_Ollama\"><\/span>Charger un fichier GGUF arbitraire dans Ollama<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Les versions r\u00e9centes d\u2019Ollama peuvent t\u00e9l\u00e9charger directement depuis Hugging Face :<\/p>\n<pre><code>ollama run hf.co\/\/:Q4_K_M<\/code><\/pre>\n<p>Pour un fichier local, cr\u00e9ez un fichier Modelfile dans le m\u00eame r\u00e9pertoire :<\/p>\n<pre><code>FROM .\/model-Q4_K_M.gguf<\/code><\/pre>\n<p>puis <code>ollama create my-model -f Modelfile<\/code> et <code>ollama run my-model<\/code>. Si le GGUF ne contient pas de mod\u00e8le de discussion utilisable, ajoutez une ligne <code>TEMPLATE<\/code> et <code>PARAMETER stop<\/code> \u2014 les directives exactes disponibles dans les fichiers Modelfile ont \u00e9volu\u00e9 au fil des versions, v\u00e9rifiez donc <code>ollama help create<\/code> pour votre version. S\u00e9lections recommand\u00e9es : <a href=\"https:\/\/convly.ai\/fr\/best-local-llms-to-run-on-ollama-2026\/\">les meilleurs LLM locaux pour Ollama<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"When_GGUF_is_the_wrong_answer\"><\/span>Quand GGUF n\u2019est pas la bonne solution<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>GGUF optimizes one user at a time. Serving many concurrent requests, or needing tensor parallelism across GPUs, points to safetensors with vLLM or SGLang. And running locally is not automatically cheaper: hosted Llama 3.3 70B is $0.10 in \/ $0.32 out per 1M tokens, while frontier hosted models like Claude Sonnet 5 sit at $2.00 in \/ $10.00 out per 1M tokens for 1M context. Run your own volume through the <a href=\"https:\/\/convly.ai\/fr\/ai-api-cost-calculator\/\">Calculateur de co\u00fbts d\u2019API<\/a> et le <a href=\"https:\/\/convly.ai\/fr\/self-hosting-vs-api-calculator\/\">Calculateur de seuil de rentabilit\u00e9 entre h\u00e9bergement local et utilisation d\u2019une API<\/a> avant d\u2019acheter un GPU.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_asked_questions\"><\/span>Questions fr\u00e9quemment pos\u00e9es<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Que signifie GGUF, et en quoi diff\u00e8re-t-il de GGML ?<\/h3>\n<p>GGUF signifie \u00ab GPT-Generated Unified Format \u00bb. GGML \u00e9tait le format ant\u00e9rieur issu du m\u00eame projet ; il rompait la compatibilit\u00e9 \u00e0 chaque ajout de nouveaux m\u00e9tadonn\u00e9es. GGUF a introduit un bloc de m\u00e9tadonn\u00e9es extensible sous forme de paires cl\u00e9-valeur, permettant d\u2019ajouter de nouvelles architectures et options sans invalider les anciens fichiers. Les fichiers <code>.bin<\/code> GGML ant\u00e9rieurs \u00e0 GGUF ne sont plus charg\u00e9s par la version actuelle de llama.cpp.<\/p>\n<h3>Quelle quantification dois-je t\u00e9l\u00e9charger ?<\/h3>\n<p>Commencez par Q4_K_M. Si le mod\u00e8le laisse encore plusieurs gigaoctets de VRAM libres, passez \u00e0 Q5_K_M ou Q6_K. S\u2019il ne tient pas, pr\u00e9f\u00e9rez un mod\u00e8le plus petit en Q4_K_M plut\u00f4t qu\u2019un mod\u00e8le identique en Q2_K \u2014 un mod\u00e8le de 14 milliards de param\u00e8tres en 4 bits surpasse g\u00e9n\u00e9ralement un mod\u00e8le de 32 milliards de param\u00e8tres d\u00e9grad\u00e9 en 2 bits. V\u00e9rifiez l\u2019ad\u00e9quation avec le <a href=\"https:\/\/convly.ai\/fr\/llm-vram-calculator\/\">Calculateur de VRAM<\/a> \u00e0 la longueur de contexte souhait\u00e9e.<\/p>\n<h3>Puis-je ex\u00e9cuter des mod\u00e8les GGUF sans GPU ?<\/h3>\n<p>Yes \u2014 CPU-only inference is what GGUF was built for. Speed is bound by memory bandwidth, so expect single-digit tokens per second for a 7B\u20138B model at Q4_K_M on typical dual-channel desktop RAM, and slower for anything larger. Small models like Gemma 3 4B (~3 GB at 4-bit) are the practical CPU-only choice.<\/p>\n<h3>Puis-je convertir moi-m\u00eame un mod\u00e8le Hugging Face au format GGUF ?<\/h3>\n<p>Oui. llama.cpp fournit un script de conversion (<code>convert_hf_to_gguf.py<\/code> dans les versions r\u00e9centes ; le nom du fichier utilisait des traits d\u2019union dans les versions ant\u00e9rieures) qui g\u00e9n\u00e8re un GGUF en F16, puis le binaire <code>llama-quantize<\/code> le compresse vers une quantification cible. Consultez l\u2019aide du script via <code>--help<\/code> dans la copie que vous avez clon\u00e9e, et assurez-vous que votre architecture est prise en charge avant de commencer \u2014 les architectures non prises en charge \u00e9chouent lors de la conversion.<\/p>\n<h3>Les mod\u00e8les GGUF prennent-ils en charge la vision ou l\u2019appel d\u2019outils ?<\/h3>\n<p>L\u2019appel d\u2019outils fonctionne l\u00e0 o\u00f9 le mod\u00e8le d\u00e9finit un mod\u00e8le de discussion compatible et o\u00f9 votre chargeur respecte ce mod\u00e8le. Les mod\u00e8les multimodaux n\u00e9cessitent un second fichier \u2014 un GGUF <code>mmproj<\/code> contenant le projecteur visuel, charg\u00e9 en parall\u00e8le des poids textuels. Les outils multimodaux de llama.cpp ont \u00e9t\u00e9 renomm\u00e9s et r\u00e9organis\u00e9s \u00e0 plusieurs reprises, suivez donc la documentation actuelle du d\u00e9p\u00f4t plut\u00f4t qu\u2019un tutoriel obsol\u00e8te.<\/p>\n<h3>La quantification modifie-t-elle la fen\u00eatre de contexte ?<\/h3>\n<p>Non. Le contexte est une propri\u00e9t\u00e9 du mod\u00e8le, pas de la quantification : Llama 3.3 70B dispose de 128 K et Llama 4 Scout de 10 M, que vous l\u2019ex\u00e9cutiez en F16 ou en Q4_K_M. Ce qui change, c\u2019est votre capacit\u00e9 \u00e0 loger le cache KV correspondant \u00e0 ce contexte en m\u00e9moire. Comparez contexte et tarifs entre mod\u00e8les sur le <a href=\"https:\/\/convly.ai\/fr\/llm-leaderboard\/\">Classement des grands mod\u00e8les linguistiques (LLM)<\/a>.<\/p>","protected":false},"excerpt":{"rendered":"<p>GGUF is a single-file container format for quantized models, created for llama.cpp. One .gguf file holds the weights, the tokenizer, [\u2026]<\/p>\n","protected":false},"author":1,"featured_media":2606,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2605","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts\/2605","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/comments?post=2605"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts\/2605\/revisions"}],"predecessor-version":[{"id":2607,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts\/2605\/revisions\/2607"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/media\/2606"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/media?parent=2605"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/categories?post=2605"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/tags?post=2605"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}