{"id":2414,"date":"2026-08-27T20:02:45","date_gmt":"2026-08-27T20:02:45","guid":{"rendered":"https:\/\/convly.ai\/?p=2414"},"modified":"2026-08-27T20:02:45","modified_gmt":"2026-08-27T20:02:45","slug":"local-llm-models","status":"publish","type":"post","link":"https:\/\/convly.ai\/fr\/local-llm-models\/","title":{"rendered":"Mod\u00e8les de LLM locaux : guide complet pour ex\u00e9cuter des mod\u00e8les d\u2019IA sur votre mat\u00e9riel"},"content":{"rendered":"<div class=\"convly-tldr\"><strong>En bref :<\/strong><\/p>\n<ul>\n<li>Local LLM models run on your hardware without API calls. Popular options include Llama 3.1 (8B-405B), Mistral 7B, Phi-3, and Gemma 2.<\/li>\n<li>Utilisez Ollama pour la configuration la plus simple (<code>ollama run llama3.1<\/code>), LM Studio for a GUI, or llama.cpp for maximum control.<\/li>\n<li>Un mod\u00e8le de 8 milliards de param\u00e8tres n\u00e9cessite 6 \u00e0 8 Go de VRAM en quantification 4 bits, ou 16 Go en pr\u00e9cision pleine. Les mod\u00e8les de 70 milliards de param\u00e8tres exigent au moins 40 Go de VRAM, ou recourent au d\u00e9chargement vers la m\u00e9moire syst\u00e8me.<\/li>\n<li>La quantification (GGUF, GPTQ, AWQ) r\u00e9duit la taille des mod\u00e8les de 50 \u00e0 75 % avec une perte minimale de qualit\u00e9, rendant ainsi leur d\u00e9ploiement local pratique sur du mat\u00e9riel grand public.<\/li>\n<\/ul>\n<\/div>\n<p>Les mod\u00e8les de LLM locaux sont des mod\u00e8les de langage IA qui s\u2019ex\u00e9cutent enti\u00e8rement sur votre mat\u00e9riel \u2014 ordinateur de bureau, ordinateur portable ou serveur \u2014 sans envoyer de donn\u00e9es vers des API externes. Vous t\u00e9l\u00e9chargez les poids du mod\u00e8le, les chargez en m\u00e9moire, puis ex\u00e9cutez l\u2019inf\u00e9rence localement. Cela vous garantit une confidentialit\u00e9 totale, l\u2019absence de co\u00fbts par jeton, un fonctionnement hors ligne et un contr\u00f4le int\u00e9gral du comportement du mod\u00e8le. En contrepartie, cela implique un investissement mat\u00e9riel initial et une inf\u00e9rence plus lente compar\u00e9e aux fournisseurs cloud exploitant des infrastructures hautement optimis\u00e9es.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_86 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a90c81bec90b\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Basculer<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a90c81bec90b\"  aria-label=\"Basculer\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/fr\/local-llm-models\/#Popular_Local_LLM_Models\" >Mod\u00e8les de LLM locaux populaires<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/fr\/local-llm-models\/#Hardware_Requirements\" >Exigences mat\u00e9rielles<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/fr\/local-llm-models\/#Running_Local_LLM_Models\" >Ex\u00e9cuter des mod\u00e8les de LLM locaux<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/fr\/local-llm-models\/#Model_Formats_and_Quantization\" >Formats de mod\u00e8les et quantification<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/fr\/local-llm-models\/#Choosing_a_Local_LLM_Model\" >Choisir un mod\u00e8le de LLM local<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/fr\/local-llm-models\/#Frequently_Asked_Questions\" >Questions fr\u00e9quemment pos\u00e9es<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"Popular_Local_LLM_Models\"><\/span>Mod\u00e8les de LLM locaux populaires<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>En 2026, ces mod\u00e8les offrent le meilleur compromis entre qualit\u00e9 et accessibilit\u00e9 mat\u00e9rielle pour un d\u00e9ploiement local :<\/p>\n<table>\n<thead>\n<tr>\n<th>Mod\u00e8le<\/th>\n<th>Param\u00e8tres<\/th>\n<th>VRAM (4 bits)<\/th>\n<th>VRAM (16 bits)<\/th>\n<th>Id\u00e9al pour<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Llama 3.1<\/td>\n<td>8B \/ 70B \/ 405B<\/td>\n<td>6 Go \/ 40 Go \/ 240 Go<\/td>\n<td>16 Go \/ 140 Go \/ 810 Go<\/td>\n<td>Usage g\u00e9n\u00e9ral, programmation, raisonnement<\/td>\n<\/tr>\n<tr>\n<td>Mistral 7B v0.3<\/td>\n<td>7B<\/td>\n<td>5 Go<\/td>\n<td>14 Go<\/td>\n<td>Inf\u00e9rence rapide, bon rapport qualit\u00e9\/taille<\/td>\n<\/tr>\n<tr>\n<td>Phi-3-medium<\/td>\n<td>14B<\/td>\n<td>9 Go<\/td>\n<td>28 Go<\/td>\n<td>Raisonnement efficace, compatible avec les GPU grand public<\/td>\n<\/tr>\n<tr>\n<td>Gemma 2<\/td>\n<td>9B \/ 27B<\/td>\n<td>6 Go \/ 18 Go<\/td>\n<td>18 Go \/ 54 Go<\/td>\n<td>Suivi des instructions, r\u00e9gl\u00e9 pour la s\u00e9curit\u00e9<\/td>\n<\/tr>\n<tr>\n<td>Qwen 2.5<\/td>\n<td>7B \/ 72B<\/td>\n<td>5 Go \/ 42 Go<\/td>\n<td>14 Go \/ 144 Go<\/td>\n<td>Multilingue, performant en math\u00e9matiques et en programmation<\/td>\n<\/tr>\n<tr>\n<td>DeepSeek-Coder-V2<\/td>\n<td>16B \/ 236B<\/td>\n<td>10 Go \/ 140 Go<\/td>\n<td>32 Go \/ 472 Go<\/td>\n<td>G\u00e9n\u00e9ration et compr\u00e9hension de code<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Les estimations de VRAM sont approximatives et varient selon la longueur du contexte et la taille des lots. Utilisez le <a href=\"https:\/\/convly.ai\/fr\/llm-vram-calculator\/\">Calculateur de VRAM<\/a> pour conna\u00eetre les besoins pr\u00e9cis en fonction de votre configuration, ou consultez <a href=\"https:\/\/convly.ai\/fr\/vram-requirements-every-major-llm-2026\/\">Exigences en VRAM selon le mod\u00e8le<\/a> pour des sp\u00e9cifications d\u00e9taill\u00e9es couvrant plus de 37 mod\u00e8les.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Hardware_Requirements\"><\/span>Exigences mat\u00e9rielles<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Les mod\u00e8les de LLM locaux sont enti\u00e8rement charg\u00e9s en m\u00e9moire pendant l\u2019inf\u00e9rence. Vous pouvez les ex\u00e9cuter sur la VRAM du GPU, sur la m\u00e9moire syst\u00e8me ou sur une combinaison des deux :<\/p>\n<h3>GPU (le plus rapide)<\/h3>\n<p>Les GPU NVIDIA compatibles CUDA offrent les meilleures performances. Les GPU AMD fonctionnent via ROCm, mais b\u00e9n\u00e9ficient d\u2019un support logiciel moindre. Les puces Apple Silicon (M1\/M2\/M3) utilisent une m\u00e9moire unifi\u00e9e et ex\u00e9cutent efficacement les mod\u00e8les via Metal.<\/p>\n<ul>\n<li><strong>Niveau entr\u00e9e :<\/strong> RTX 3060 12GB or RTX 4060 Ti 16GB runs 7-8B models at 4-bit quantization<\/li>\n<li><strong>Milieu de gamme :<\/strong> La RTX 4090 24 Go g\u00e8re des mod\u00e8les de 30 milliards de param\u00e8tres quantifi\u00e9s, ou des mod\u00e8les de 13 milliards de param\u00e8tres en pr\u00e9cision pleine<\/li>\n<li><strong>Haut de gamme :<\/strong> L\u2019A6000 48 Go ou deux GPU grand public permettent d\u2019ex\u00e9cuter des mod\u00e8les de 70 milliards de param\u00e8tres en quantification 4 bits<\/li>\n<\/ul>\n<p>Consultez le <a href=\"https:\/\/convly.ai\/fr\/best-gpus-for-local-llms-2026\/\">meilleures GPU pour les LLM locaux<\/a> guide pour les tests de performance et les rapports prix\/performance.<\/p>\n<h3>CPU (plus lent, mais accessible)<\/h3>\n<p>N\u2019importe quel processeur moderne peut ex\u00e9cuter des mod\u00e8les LLM locaux en utilisant la m\u00e9moire vive syst\u00e8me, bien que l\u2019inf\u00e9rence soit 10 \u00e0 50 fois plus lente qu\u2019avec un GPU. Cette approche reste viable pour les petits mod\u00e8les (7 \u00e0 8 milliards de param\u00e8tres) ou lorsque la confidentialit\u00e9 prime sur la vitesse.<\/p>\n<ul>\n<li><strong>Configuration minimale :<\/strong> 16 Go de RAM pour les mod\u00e8les de 7 milliards de param\u00e8tres en quantification 4 bits<\/li>\n<li><strong>Configuration recommand\u00e9e :<\/strong> 32 Go de RAM ou plus pour une utilisation confortable avec des fen\u00eatres de contexte \u00e9tendues<\/li>\n<li><strong>Serveur :<\/strong> 128 Go de RAM ou plus permettent d\u2019ex\u00e9cuter des mod\u00e8les de 70 milliards de param\u00e8tres sur des syst\u00e8mes CPU uniquement<\/li>\n<\/ul>\n<h3>Hybride (GPU + CPU)<\/h3>\n<p>La plupart des frameworks prennent en charge le d\u00e9chargement (offloading) : certaines couches sont charg\u00e9es sur le GPU, les autres d\u00e9bordent dans la RAM. Un mod\u00e8le de 70 milliards de param\u00e8tres pourrait ainsi utiliser 24 Go de VRAM + 32 Go de RAM, offrant une inf\u00e9rence 3 \u00e0 5 fois plus rapide qu\u2019en mode CPU seul.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Running_Local_LLM_Models\"><\/span>Ex\u00e9cuter des mod\u00e8les de LLM locaux<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Ollama (le plus simple)<\/h3>\n<p>Ollama int\u00e8gre llama.cpp dans une interface CLI simplifi\u00e9e et un registre de mod\u00e8les. C\u2019est la m\u00e9thode la plus rapide pour commencer :<\/p>\n<pre><code># Installation sur macOS\/Linux\ncurl -fsSL https:\/\/ollama.ai\/install.sh | sh\n\n# Windows : t\u00e9l\u00e9chargez l\u2019installateur depuis ollama.ai\n\n# Ex\u00e9cutez un mod\u00e8le (t\u00e9l\u00e9chargement automatique)\nollama run llama3.1\n\n# Liste des mod\u00e8les disponibles\nollama list\n\n# T\u00e9l\u00e9chargez un mod\u00e8le sp\u00e9cifique\nollama pull mistral:7b-instruct-q4_0\n<\/code><\/pre>\n<p>Ollama s\u00e9lectionne automatiquement le GPU ou le CPU, g\u00e8re la quantification et les t\u00e9l\u00e9chargements de mod\u00e8les. Pour une configuration d\u00e9taill\u00e9e, consultez la <a href=\"https:\/\/convly.ai\/fr\/what-is-ollama-complete-guide-2026\/\">Guide complet d\u2019Ollama<\/a> documentation officielle <a href=\"https:\/\/convly.ai\/fr\/how-to-install-ollama-2026\/\">comment installer Ollama<\/a> ou passez directement aux<\/p>\n<p>instructions pas \u00e0 pas par plateforme. <a href=\"https:\/\/convly.ai\/fr\/ollama-models-list-2026\/\">Liste des mod\u00e8les Ollama<\/a>liste compl\u00e8te des mod\u00e8les disponibles sur le <a href=\"https:\/\/convly.ai\/fr\/best-local-llms-to-run-on-ollama-2026\/\">Meilleurs mod\u00e8les locaux pour Ollama<\/a>.<\/p>\n<h3>LM Studio (interface graphique)<\/h3>\n<p>LM Studio fournit une application de bureau pour Windows, macOS et Linux, dot\u00e9e d\u2019une interface conversationnelle et d\u2019un navigateur de mod\u00e8les. T\u00e9l\u00e9chargez-la depuis lmstudio.ai, lancez-la, recherchez des mod\u00e8les dans l\u2019onglet \u00ab D\u00e9couvrir \u00bb et cliquez sur \u00ab T\u00e9l\u00e9charger \u00bb. Les mod\u00e8les utilisent le format GGUF et se chargent avec une quantification ajustable.<\/p>\n<p>LM Studio affiche en temps r\u00e9el l\u2019utilisation de la VRAM et la vitesse d\u2019inf\u00e9rence, ce qui facilite le r\u00e9glage des param\u00e8tres. Elle ex\u00e9cute \u00e9galement un serveur API local compatible OpenAI sur <code>http:\/\/localhost:1234\/v1<\/code> http:\/\/localhost:1234 <a href=\"https:\/\/convly.ai\/fr\/lm-studio-complete-guide-2026\/\">Guide complet de LM Studio<\/a> pour les fonctionnalit\u00e9s avanc\u00e9es.<\/p>\n<h3>llama.cpp (avanc\u00e9)<\/h3>\n<p>llama.cpp est le moteur sous-jacent d\u2019Ollama et de LM Studio, offrant un contr\u00f4le maximal aux d\u00e9veloppeurs :<\/p>\n<pre><code># Cloner et compiler\ngit clone https:\/\/github.com\/ggerganov\/llama.cpp\ncd llama.cpp\nmake\n\n# Avec support CUDA\nmake LLAMA_CUDA=1\n\n# Ex\u00e9cuter une inf\u00e9rence\n.\/main -m models\/llama-3.1-8b-instruct-q4_0.gguf -p \"Expliquez l\u2019informatique quantique\" -n 512 --gpu-layers 35\n<\/code><\/pre>\n<p>Le <code>--gpu-layers<\/code> d\u00e9termine combien de couches du transformeur sont charg\u00e9es sur le GPU plut\u00f4t que dans la RAM. Plus cette valeur est \u00e9lev\u00e9e, plus la VRAM est sollicit\u00e9e, mais plus l\u2019inf\u00e9rence est rapide. Commencez avec la moiti\u00e9 du nombre total de couches du mod\u00e8le, puis ajustez.<\/p>\n<h3>Autres outils<\/h3>\n<ul>\n<li><strong>text-generation-webui :<\/strong> Interface web avec extensions et prise en charge de plusieurs backends<\/li>\n<li><strong>vLLM :<\/strong> Serveur d\u2019inf\u00e9rence optimis\u00e9 pour des d\u00e9ploiements de production \u00e0 haut d\u00e9bit<\/li>\n<li><strong>LocalAI :<\/strong> Remplacement direct de l\u2019API OpenAI prenant en charge plusieurs formats de mod\u00e8les<\/li>\n<li><strong>Jan :<\/strong> Application de bureau similaire \u00e0 LM Studio, ax\u00e9e sur la confidentialit\u00e9<\/li>\n<\/ul>\n<h2><span class=\"ez-toc-section\" id=\"Model_Formats_and_Quantization\"><\/span>Formats de mod\u00e8les et quantification<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>La quantification r\u00e9duit la pr\u00e9cision des poids d\u2019un mod\u00e8le, passant de nombres flottants 16 bits ou 32 bits \u00e0 8 bits, 4 bits ou une pr\u00e9cision mixte, r\u00e9duisant ainsi les besoins en m\u00e9moire de 50 \u00e0 75 %, avec une perte de qualit\u00e9 de 2 \u00e0 5 %. Diff\u00e9rents formats sont optimis\u00e9s pour diff\u00e9rents types de mat\u00e9riel :<\/p>\n<h3>GGUF (Ollama, LM Studio, llama.cpp)<\/h3>\n<p>GGUF est le format standard pour le d\u00e9ploiement local. Niveaux courants de quantification :<\/p>\n<ul>\n<li><strong>Q4_0 :<\/strong> 4 bits, taille minimale, perte de qualit\u00e9 de 5 \u00e0 10 %<\/li>\n<li><strong>Q4_K_M :<\/strong> 4 bits avec pr\u00e9cision mixte, bon compromis entre taille et qualit\u00e9<\/li>\n<li><strong>Q5_K_M :<\/strong> 5 bits, meilleure qualit\u00e9 que Q4, tout en restant compact<\/li>\n<li><strong>Q8_0 :<\/strong> 8 bits, perte de qualit\u00e9 minimale, fichiers plus volumineux<\/li>\n<li><strong>F16 :<\/strong> Pr\u00e9cision pleine 16 bits, aucune quantification<\/li>\n<\/ul>\n<p>Pour la plupart des cas d\u2019usage, Q4_K_M ou Q5_K_M offrent le meilleur rapport qualit\u00e9\/taille. Utilisez Q8_0 ou F16 uniquement si vous disposez de VRAM exc\u00e9dentaire et que vous avez besoin d\u2019une pr\u00e9cision maximale.<\/p>\n<h3>GPTQ (inf\u00e9rence Python)<\/h3>\n<p>GPTQ effectue une quantification en 4 bits ou 3 bits, optimis\u00e9e pour l\u2019inf\u00e9rence GPU \u00e0 l\u2019aide de biblioth\u00e8ques telles qu\u2019AutoGPTQ ou ExLlama. Tr\u00e8s r\u00e9pandu dans les workflows Hugging Face Transformers. Les mod\u00e8les GPTQ se chargent plus rapidement que les mod\u00e8les GGUF, mais n\u00e9cessitent un environnement Python.<\/p>\n<h3>AWQ (inf\u00e9rence GPU rapide)<\/h3>\n<p>AWQ (Activation-aware Weight Quantization) pr\u00e9serve davantage de pr\u00e9cision que GPTQ en 4 bits, en prot\u00e9geant les poids les plus importants. N\u00e9cessite des moteurs d\u2019inf\u00e9rence compatibles AWQ, tels que vLLM ou TGI.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Choosing_a_Local_LLM_Model\"><\/span>Choisir un mod\u00e8le de LLM local<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Adaptez la taille du mod\u00e8le \u00e0 votre mat\u00e9riel et \u00e0 votre cas d\u2019usage :<\/p>\n<ul>\n<li><strong>Mod\u00e8les de 7 \u00e0 8 milliards de param\u00e8tres :<\/strong> S\u2019adaptent aux GPU grand public (12 \u00e0 16 Go de VRAM), r\u00e9ponses rapides, id\u00e9aux pour les conversations et les t\u00e2ches simples<\/li>\n<li><strong>Mod\u00e8les de 13 \u00e0 14 milliards de param\u00e8tres :<\/strong> N\u00e9cessitent 20 \u00e0 24 Go de VRAM, am\u00e9lioration notable des capacit\u00e9s de raisonnement et de suivi des instructions<\/li>\n<li><strong>Mod\u00e8les de 30 \u00e0 34 milliards de param\u00e8tres :<\/strong> Requi\u00e8rent 40 Go de VRAM ou plus, ou une configuration hybride GPU+RAM ; leur qualit\u00e9 approche celle de GPT-3.5<\/li>\n<li><strong>Mod\u00e8les de 70 milliards de param\u00e8tres et plus :<\/strong> N\u00e9cessitent du mat\u00e9riel serveur ou une quantification agressive, rivalisant avec GPT-4 sur de nombreuses t\u00e2ches<\/li>\n<\/ul>\n<p>Consultez les sp\u00e9cifications et les scores de r\u00e9f\u00e9rence pour 37 mod\u00e8les dans la <a href=\"https:\/\/convly.ai\/fr\/models\/\">Base de donn\u00e9es des mod\u00e8les IA<\/a>, ou comparez les classements dans la <a href=\"https:\/\/convly.ai\/fr\/llm-leaderboard\/\">Classement des grands mod\u00e8les linguistiques (LLM)<\/a> tri\u00e9e par intelligence, prix et longueur de contexte.<\/p>\n<p>Pour l\u2019analyse des co\u00fbts, utilisez le <a href=\"https:\/\/convly.ai\/fr\/self-hosting-vs-api-calculator\/\">calculateur auto-h\u00e9bergement vs API<\/a> afin de d\u00e9terminer le seuil de rentabilit\u00e9 entre les co\u00fbts mat\u00e9riels locaux et ceux des API cloud. Les mod\u00e8les locaux impliquent un co\u00fbt initial plus \u00e9lev\u00e9, mais aucun co\u00fbt marginal par jeton, ce qui les rend moins chers \u00e0 fort volume.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_Asked_Questions\"><\/span>Questions fr\u00e9quemment pos\u00e9es<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Puis-je ex\u00e9cuter des mod\u00e8les de LLM locaux sur un ordinateur portable ?<\/h3>\n<p>Oui, \u00e0 condition de disposer d\u2019au moins 16 Go de m\u00e9moire unifi\u00e9e (puces Apple Silicon) ou de 16 Go de RAM associ\u00e9s \u00e0 une carte graphique d\u00e9di\u00e9e disposant d\u2019au moins 8 Go de VRAM. Les MacBook Pro \u00e9quip\u00e9s des puces M1 Max\/ Ultra, M2 Pro\/ Max ou M3 Max ex\u00e9cutent efficacement des mod\u00e8les de 7 \u00e0 13 milliards de param\u00e8tres. Sur les ordinateurs portables Windows ou Linux dot\u00e9s de cartes graphiques mobiles RTX 4060 \u00e0 4090, il est possible d\u2019ex\u00e9cuter des mod\u00e8les de 7 \u00e0 30 milliards de param\u00e8tres, selon la quantit\u00e9 de VRAM disponible. L\u2019inf\u00e9rence sur CPU uniquement fonctionne sur n\u2019importe quel ordinateur portable disposant d\u2019au moins 16 Go de RAM, mais elle est 10 \u00e0 50 fois plus lente.<\/p>\n<h3>\u00c0 quel point les mod\u00e8les de LLM locaux sont-ils plus lents que les fournisseurs d\u2019API ?<\/h3>\n<p>Cela d\u00e9pend du mat\u00e9riel utilis\u00e9. Un mod\u00e8le de 7 milliards de param\u00e8tres sur une RTX 4090 g\u00e9n\u00e8re 80 \u00e0 120 jetons par seconde, ce qui est comparable \u00e0 la latence offerte par les API. Le m\u00eame mod\u00e8le ex\u00e9cut\u00e9 sur CPU produit 5 \u00e0 15 jetons par seconde. Quant aux mod\u00e8les plus volumineux (70 milliards de param\u00e8tres et plus), m\u00eame avec acc\u00e9l\u00e9ration GPU sur du mat\u00e9riel grand public, ils ne g\u00e9n\u00e8rent que 2 \u00e0 10 jetons par seconde. Les fournisseurs cloud utilisent des grappes H100 optimis\u00e9es pour le d\u00e9bit, mais les mod\u00e8les locaux \u00e9liminent la latence r\u00e9seau : vous obtenez imm\u00e9diatement la r\u00e9ponse au premier jeton.<\/p>\n<h3>Les mod\u00e8les de LLM locaux n\u00e9cessitent-ils une connexion Internet ?<\/h3>\n<p>Non, une fois t\u00e9l\u00e9charg\u00e9s. Vous t\u00e9l\u00e9chargez une seule fois les poids du mod\u00e8le (1 \u00e0 150 Go selon sa taille), puis l\u2019inf\u00e9rence s\u2019ex\u00e9cute enti\u00e8rement hors ligne. Ollama, LM Studio et llama.cpp mettent en cache les mod\u00e8les localement. Cela rend les LLM locaux adapt\u00e9s aux environnements isol\u00e9s (\u00ab air-gapped \u00bb), aux d\u00e9placements ou aux travaux sensibles en mati\u00e8re de confidentialit\u00e9, o\u00f9 aucune donn\u00e9e ne doit quitter votre r\u00e9seau.<\/p>\n<h3>Quelle est la diff\u00e9rence de qualit\u00e9 entre les mod\u00e8les quantifi\u00e9s et ceux en pr\u00e9cision pleine ?<\/h3>\n<p>La quantification sur 4 bits (Q4_K_M) entra\u00eene une perte de qualit\u00e9 de 2 \u00e0 5 % sur la plupart des benchmarks compar\u00e9e \u00e0 la pr\u00e9cision sur 16 bits, affectant principalement le raisonnement complexe et la restitution factuelle. La quantification sur 8 bits entra\u00eene une perte inf\u00e9rieure \u00e0 1 %. Pour les usages conversationnels, l\u2019assistance \u00e0 la programmation et le traitement de documents, la plupart des utilisateurs ne per\u00e7oivent pas de diff\u00e9rence entre Q4_K_M et F16. Pour les applications critiques exigeant une pr\u00e9cision maximale (m\u00e9dicales, juridiques, scientifiques), privil\u00e9giez Q8_0 ou F16 si vous disposez de suffisamment de VRAM.<\/p>\n<h3>Puis-je affiner (fine-tune) des mod\u00e8les de LLM locaux ?<\/h3>\n<p>Oui, \u00e0 l\u2019aide de biblioth\u00e8ques telles qu\u2019Axolotl, Ludwig ou Hugging Face TRL. L\u2019affinage n\u00e9cessite davantage de VRAM que l\u2019inf\u00e9rence : comptez au moins 24 Go pour un mod\u00e8le de 7 milliards de param\u00e8tres en affinage complet, ou 12 \u00e0 16 Go avec des m\u00e9thodes efficaces en param\u00e8tres comme LoRA. Les poids affin\u00e9s remplacent ou compl\u00e8tent les poids du mod\u00e8le de base, ce qui vous permet de d\u00e9ployer le mod\u00e8le affin\u00e9 \u00e0 l\u2019aide des m\u00eames outils (Ollama, LM Studio, llama.cpp), apr\u00e8s conversion au format GGUF ou \u00e0 tout autre format adapt\u00e9 \u00e0 l\u2019inf\u00e9rence.<\/p>\n<h3>Quel mod\u00e8le de LLM local se rapproche le plus de la qualit\u00e9 de ChatGPT ?<\/h3>\n<p>Llama 3.1 70B approaches GPT-4&#8217;s quality on reasoning and instruction following, while Llama 3.1 405B matches or exceeds it on many benchmarks. For GPT-3.5-level quality, Llama 3.1 8B, Mistral 7B, or Qwen 2.5 14B are sufficient. No local model fully replicates ChatGPT&#8217;s behavior since ChatGPT uses retrieval augmentation, multiple models, and post-processing, but raw model capabilities are now comparable at the 70B+ scale.<\/p>","protected":false},"excerpt":{"rendered":"<p>TL;DR:Local LLM models run on your hardware without API calls. Popular options include Llama 3.1 (8B-405B), Mistral 7B, Phi-3, and [\u2026]<\/p>\n","protected":false},"author":1,"featured_media":2415,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2414","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts\/2414","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/comments?post=2414"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts\/2414\/revisions"}],"predecessor-version":[{"id":2416,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts\/2414\/revisions\/2416"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/media\/2415"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/media?parent=2414"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/categories?post=2414"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/tags?post=2414"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}