{"id":2205,"date":"2026-08-14T20:17:07","date_gmt":"2026-08-14T20:17:07","guid":{"rendered":"https:\/\/convly.ai\/?p=2205"},"modified":"2026-08-14T20:17:07","modified_gmt":"2026-08-14T20:17:07","slug":"ollama-not-using-gpu-fix","status":"publish","type":"post","link":"https:\/\/convly.ai\/fr\/ollama-not-using-gpu-fix\/","title":{"rendered":"Ollama n'utilise pas le GPU : diagnostiquer et r\u00e9soudre le basculement vers le CPU"},"content":{"rendered":"<div class=\"convly-tldr\">\n<ul>\n<li>Ex\u00e9cuter <code>ollama ps<\/code> lorsqu\u2019un mod\u00e8le est charg\u00e9 \u2014 la colonne PROCESSOR indique si Ollama utilise le GPU ou le CPU.<\/li>\n<li>La solution la plus courante sous NVIDIA consiste \u00e0 installer ou mettre \u00e0 jour le pilote h\u00f4te afin que <code>nvidia-smi<\/code> d\u00e9tecte la carte, puis \u00e0 red\u00e9marrer le service Ollama.<\/li>\n<li>Si le mod\u00e8le est plus volumineux que votre VRAM, Ollama d\u00e9charge certaines couches vers le CPU \u2014 utilisez le <a href=\"https:\/\/convly.ai\/fr\/llm-vram-calculator\/\">Calculateur de VRAM<\/a> pour v\u00e9rifier au pr\u00e9alable si votre mod\u00e8le tient dans la m\u00e9moire vid\u00e9o avant de le t\u00e9l\u00e9charger.<\/li>\n<li>Les configurations AMD, Docker et WSL2 n\u00e9cessitent chacune des \u00e9tapes sp\u00e9cifiques d\u00e9crites ci-dessous.<\/li>\n<\/ul>\n<\/div>\n<p>Lorsqu\u2019Ollama n\u2019utilise pas votre GPU, la cause la plus fr\u00e9quente est un pilote manquant ou incompatible. Ex\u00e9cutez <code>ollama ps<\/code> \u2014 si la colonne PROCESSOR affiche 100 % CPU, Ollama a enti\u00e8rement bascul\u00e9 vers le CPU. La solution d\u00e9pend de votre plateforme : NVIDIA requiert le runtime CUDA appropri\u00e9, AMD n\u00e9cessite ROCm, et Docker exige des drapeaux explicites de passage du GPU.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_86 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a7fb92c69bc3\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Basculer<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a7fb92c69bc3\"  aria-label=\"Basculer\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/fr\/ollama-not-using-gpu-fix\/#Step_1_Confirm_Whether_Ollama_Is_Using_the_GPU\" >\u00c9tape 1 : V\u00e9rifier si Ollama utilise bien le GPU<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/fr\/ollama-not-using-gpu-fix\/#Step_2_NVIDIA_%E2%80%94_Drivers_and_CUDA_Runtime\" >\u00c9tape 2 : NVIDIA \u2014 Pilotes et runtime CUDA<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/fr\/ollama-not-using-gpu-fix\/#Step_3_Model_Too_Large_for_VRAM\" >\u00c9tape 3 : Mod\u00e8le trop volumineux pour la VRAM<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/fr\/ollama-not-using-gpu-fix\/#Step_4_AMD_GPU_and_ROCm\" >\u00c9tape 4 : GPU AMD et ROCm<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/fr\/ollama-not-using-gpu-fix\/#Step_5_Docker_%E2%80%94_Missing_GPU_Passthrough\" >\u00c9tape 5 : Docker \u2014 Passage du GPU manquant<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/fr\/ollama-not-using-gpu-fix\/#Step_6_WSL2_on_Windows\" >\u00c9tape 6 : WSL2 sous Windows<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/fr\/ollama-not-using-gpu-fix\/#macOS_%E2%80%94_Metal_Apple_Silicon_and_AMD\" >macOS \u2014 Metal (puces Apple Silicon et AMD)<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/fr\/ollama-not-using-gpu-fix\/#Verifying_the_Fix_and_Expected_Throughput\" >V\u00e9rification de la correction et d\u00e9bit attendu<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-9\" href=\"https:\/\/convly.ai\/fr\/ollama-not-using-gpu-fix\/#Frequently_Asked_Questions\" >Questions fr\u00e9quemment pos\u00e9es<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"Step_1_Confirm_Whether_Ollama_Is_Using_the_GPU\"><\/span>\u00c9tape 1 : V\u00e9rifier si Ollama utilise bien le GPU<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Avant toute modification, v\u00e9rifiez ce qu\u2019Ollama fait r\u00e9ellement. Chargez un mod\u00e8le, puis, pendant son ex\u00e9cution, ouvrez un second terminal :<\/p>\n<pre><code>ollama ps<\/code><\/pre>\n<p>Exemple de sortie :<\/p>\n<pre><code>NOM              ID              TAILLE    PROCESSOR    JUSQU\u2019\u00c0\nllama3.2:8b       abc123def456    5,0 Go    100 % GPU    dans 4 minutes<\/code><\/pre>\n<p>La colonne PROCESSOR constitue l\u2019indicateur d\u00e9terminant :<\/p>\n<table>\n<thead>\n<tr>\n<th>Valeur de PROCESSOR<\/th>\n<th>Signification<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>100 % GPU<\/td>\n<td>Toutes les couches sont sur le GPU \u2014 comportement attendu et correct<\/td>\n<\/tr>\n<tr>\n<td>XX % GPU \/ YY % CPU<\/td>\n<td>Le mod\u00e8le s\u2019ins\u00e8re partiellement dans la VRAM ; les couches restantes s\u2019ex\u00e9cutent sur le CPU<\/td>\n<\/tr>\n<tr>\n<td>100 % CPU<\/td>\n<td>Basculement complet vers le CPU \u2014 le GPU n\u2019est pas utilis\u00e9 du tout<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Sur les syst\u00e8mes NVIDIA, effectuez une v\u00e9rification crois\u00e9e avec <code>nvidia-smi<\/code> pendant l\u2019inf\u00e9rence. La colonne Memory-Usage doit augmenter au fur et \u00e0 mesure du chargement du mod\u00e8le. Si elle reste stable, le GPU est inactif, quelle que soit l\u2019information fournie par d\u2019autres outils.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Step_2_NVIDIA_%E2%80%94_Drivers_and_CUDA_Runtime\"><\/span>\u00c9tape 2 : NVIDIA \u2014 Pilotes et runtime CUDA<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Un pilote NVIDIA manquant ou obsol\u00e8te est la cause la plus fr\u00e9quente d\u2019un basculement complet vers le CPU. Ollama int\u00e8gre ses propres biblioth\u00e8ques CUDA, mais il requiert n\u00e9anmoins un pilote h\u00f4te prenant en charge CUDA 11.3 ou ult\u00e9rieur.<\/p>\n<h3>V\u00e9rifiez d\u2019abord le pilote<\/h3>\n<pre><code>nvidia-smi<\/code><\/pre>\n<p>Si la commande est introuvable, aucun pilote n\u2019est install\u00e9. Si elle s\u2019ex\u00e9cute, notez la version du pilote et celle de CUDA figurant dans l\u2019en-t\u00eate. La version de CUDA indiqu\u00e9e correspond \u00e0 la version maximale prise en charge par le pilote \u2014 cela ne signifie pas qu\u2019un toolkit CUDA s\u00e9par\u00e9 est install\u00e9, et Ollama n\u2019en a pas besoin.<\/p>\n<table>\n<thead>\n<tr>\n<th>Plateforme<\/th>\n<th>Version minimale du pilote<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Linux<\/td>\n<td>525.xx (prend en charge CUDA 12.0)<\/td>\n<\/tr>\n<tr>\n<td>Windows natif<\/td>\n<td>527.xx (prend en charge CUDA 12.0)<\/td>\n<\/tr>\n<tr>\n<td>WSL2 (h\u00f4te Windows)<\/td>\n<td>525.xx c\u00f4t\u00e9 Windows \u2014 n\u2019installez pas le pilote NVIDIA Linux \u00e0 l\u2019int\u00e9rieur de WSL2<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<h3>Installez ou mettez \u00e0 jour le pilote<\/h3>\n<p><strong>Ubuntu \/ Debian :<\/strong><\/p>\n<pre><code>sudo apt install nvidia-driver-550\nsudo reboot<\/code><\/pre>\n<p><strong>Windows :<\/strong> T\u00e9l\u00e9chargez-le depuis nvidia.com\/Download ou utilisez GeForce Experience, puis red\u00e9marrez. Un red\u00e9marrage complet \u2014 et non seulement un red\u00e9marrage du service \u2014 est requis apr\u00e8s l\u2019installation ou la mise \u00e0 jour d\u2019un pilote.<\/p>\n<p>Apr\u00e8s le red\u00e9marrage, confirmez que <code>nvidia-smi<\/code> affiche bien votre carte, puis red\u00e9marrez Ollama :<\/p>\n<pre><code># Linux (systemd)\nsudo systemctl restart ollama\n\n# macOS\nlaunchctl kickstart -k gui\/$(id -u)\/com.ollama.ollama\n\n# Windows \u2014 red\u00e9marrez l\u2019application Ollama dans la zone de notification, ou red\u00e9marrez le syst\u00e8me<\/code><\/pre>\n<p>Ex\u00e9cutez un mod\u00e8le et v\u00e9rifiez \u00e0 nouveau <code>ollama ps<\/code> . Si la colonne PROCESSOR affiche toujours 100 % CPU, passez aux \u00e9tapes suivantes.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Step_3_Model_Too_Large_for_VRAM\"><\/span>\u00c9tape 3 : Mod\u00e8le trop volumineux pour la VRAM<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Lorsque les poids d\u2019un mod\u00e8le d\u00e9passent la VRAM disponible, Ollama ne refuse pas de s\u2019ex\u00e9cuter \u2014 il r\u00e9partit l\u2019inf\u00e9rence. Autant de couches de transformeur que possible sont affect\u00e9es au GPU ; les autres s\u2019ex\u00e9cutent sur le CPU. Cela appara\u00eet sous forme de pourcentage fractionn\u00e9 dans <code>ollama ps<\/code> et rel\u00e8ve d\u2019un comportement intentionnel, non d\u2019un bogue.<\/p>\n<p>Un mod\u00e8le de 70 milliards de param\u00e8tres en quantification Q4_K_M n\u00e9cessite typiquement environ 40 Go de VRAM, ce qui d\u00e9passe la capacit\u00e9 de n\u2019importe quelle carte graphique grand public. Avant de t\u00e9l\u00e9charger un mod\u00e8le volumineux, v\u00e9rifiez s\u2019il tient dans votre VRAM \u00e0 l\u2019aide du <a href=\"https:\/\/convly.ai\/fr\/llm-vram-calculator\/\">Calculateur de VRAM<\/a>. Pour conna\u00eetre les besoins en VRAM des mod\u00e8les LLM les plus populaires, consultez <a href=\"https:\/\/convly.ai\/fr\/vram-requirements-every-major-llm-2026\/\">Exigences en VRAM pour chaque grand mod\u00e8le de langage (LLM)<\/a>.<\/p>\n<p>Si le mod\u00e8le ne tient pas dans votre VRAM, vous avez plusieurs options :<\/p>\n<ul>\n<li>Utiliser une quantification inf\u00e9rieure (par exemple Q2_K ou Q3_K_S) \u2014 r\u00e9duit la consommation de VRAM avec une l\u00e9g\u00e8re perte de qualit\u00e9.<\/li>\n<li>Passer \u00e0 une variante plus petite du mod\u00e8le (par exemple 8B au lieu de 70B). La page <a href=\"https:\/\/convly.ai\/fr\/best-local-llms-to-run-on-ollama-2026\/\">Meilleurs mod\u00e8les locaux pour Ollama<\/a> r\u00e9pertorie les mod\u00e8les compatibles avec le mat\u00e9riel grand public.<\/li>\n<li>Accepter le d\u00e9chargement partiel \u2014 le d\u00e9bit sera compris entre celui obtenu en mode GPU int\u00e9gral et celui obtenu en mode CPU int\u00e9gral.<\/li>\n<li>Mettre \u00e0 niveau votre GPU. Le guide <a href=\"https:\/\/convly.ai\/fr\/best-gpus-for-local-llms-2026\/\">meilleures GPU pour les LLM locaux<\/a> compare les options actuelles selon leur VRAM et leur prix.<\/li>\n<\/ul>\n<h2><span class=\"ez-toc-section\" id=\"Step_4_AMD_GPU_and_ROCm\"><\/span>\u00c9tape 4 : GPU AMD et ROCm<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>La prise en charge d'AMD dans Ollama repose sur ROCm, la plateforme de calcul GPU d'AMD. Ollama prend officiellement en charge les cartes RDNA 2 (s\u00e9rie RX 6000) et RDNA 3 (s\u00e9rie RX 7000) sous Linux. La prise en charge d'AMD sous Windows est limit\u00e9e \u2014 consultez les notes de version de votre installation d'Ollama avant de supposer qu'elle fonctionnera sous Windows.<\/p>\n<h3>V\u00e9rifiez que ROCm d\u00e9tecte la carte<\/h3>\n<pre><code>rocm-smi<\/code><\/pre>\n<p>Si <code>rocm-smi<\/code> n'est pas trouv\u00e9, la pile ROCm n'est pas install\u00e9e. Consultez amd.com\/fr\/developer\/rocm pour les instructions d'installation actuelles adapt\u00e9es \u00e0 votre distribution, car les noms de paquets et les exigences de version changent entre les versions de ROCm.<\/p>\n<p>Si la carte est absente de la sortie de <code>rocm-smi<\/code> apr\u00e8s l'installation :<\/p>\n<pre><code>sudo usermod -aG render,video $USER\n# D\u00e9connectez-vous puis reconnectez-vous pour que la modification des groupes prenne effet<\/code><\/pre>\n<p>Pour cibler un GPU sp\u00e9cifique lorsque plusieurs sont pr\u00e9sents :<\/p>\n<pre><code>HIP_VISIBLE_DEVICES=0 ollama serve<\/code><\/pre>\n<h2><span class=\"ez-toc-section\" id=\"Step_5_Docker_%E2%80%94_Missing_GPU_Passthrough\"><\/span>\u00c9tape 5 : Docker \u2014 Passage du GPU manquant<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Les conteneurs Docker n'ont aucun acc\u00e8s au GPU \u00e0 moins que vous ne transmettiez explicitement le p\u00e9riph\u00e9rique. C'est la raison la plus courante pour laquelle Ollama revient automatiquement au CPU dans les d\u00e9ploiements conteneuris\u00e9s \u2014 le GPU h\u00f4te fonctionne correctement, mais le conteneur ne peut pas y acc\u00e9der.<\/p>\n<h3>NVIDIA dans Docker<\/h3>\n<p>Installez le NVIDIA Container Toolkit sur l'h\u00f4te :<\/p>\n<pre><code>sudo apt install nvidia-container-toolkit\nsudo nvidia-ctk runtime configure --runtime=docker\nsudo systemctl restart docker<\/code><\/pre>\n<p>Puis transmettez le GPU lors du d\u00e9marrage du conteneur :<\/p>\n<pre><code>docker run -d --gpus all \n  -v ollama:\/root\/.ollama \n  -p 11434:11434 \n  ollama\/ollama<\/code><\/pre>\n<p>Sans l'option <code>--gpus all<\/code> (ou <code>--gpus device=0<\/code> (pour une carte sp\u00e9cifique), le conteneur n'a aucun acc\u00e8s au GPU, quelle que soit la configuration de l'h\u00f4te.<\/p>\n<h3>AMD dans Docker<\/h3>\n<pre><code>docker run -d \n  --device \/dev\/kfd --device \/dev\/dri \n  -v ollama:\/root\/.ollama \n  -p 11434:11434 \n  ollama\/ollama:rocm<\/code><\/pre>\n<p>Le <code>:rocm<\/code> est une balise d'image obligatoire. L'image par d\u00e9faut <code>ollama\/ollama<\/code> ne comprend pas ROCm et reviendra automatiquement au CPU sur du mat\u00e9riel AMD.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Step_6_WSL2_on_Windows\"><\/span>\u00c9tape 6 : WSL2 sous Windows<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>WSL2 peut partager le GPU NVIDIA avec l'h\u00f4te Windows, mais une r\u00e8gle est absolue : le pilote NVIDIA doit \u00eatre install\u00e9 sur <strong>Windows<\/strong>Windows<\/p>\n<ul>\n<li>Installez ou mettez \u00e0 jour le pilote NVIDIA sous Windows, puis red\u00e9marrez Windows.<\/li>\n<li>WSL2 n\u00e9cessite un noyau version 5.10.43 ou ult\u00e9rieure. V\u00e9rifiez avec la commande <code>uname -r<\/code> dans WSL2 ; mettez \u00e0 jour avec la commande <code>wsl --update<\/code> dans un terminal Windows.<\/li>\n<li>Le kit d'outils CUDA peut \u00eatre install\u00e9 \u00e0 l'int\u00e9rieur de WSL2 si votre flux de travail en a besoin \u2014 cela est ind\u00e9pendant du pilote et ne cr\u00e9e aucun conflit.<\/li>\n<\/ul>\n<p>V\u00e9rifiez la visibilit\u00e9 du GPU depuis l'int\u00e9rieur de WSL2 :<\/p>\n<pre><code>nvidia-smi<\/code><\/pre>\n<p>Si cette commande affiche votre carte, Ollama s'ex\u00e9cutant dans WSL2 l'utilisera automatiquement. En cas d'\u00e9chec, mettez \u00e0 jour le pilote c\u00f4t\u00e9 Windows et r\u00e9ex\u00e9cutez la commande. <code>wsl --update<\/code>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"macOS_%E2%80%94_Metal_Apple_Silicon_and_AMD\"><\/span>macOS \u2014 Metal (puces Apple Silicon et AMD)<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Sur macOS, Ollama utilise Apple Metal pour l'acc\u00e9l\u00e9ration GPU \u2014 aucun pilote \u00e0 installer ni aucune variable d'environnement \u00e0 configurer. Si vous utilisez un Mac \u00e9quip\u00e9 de puces Apple Silicon et qu'Ollama fonctionne lentement, assurez-vous d'avoir install\u00e9 la version native ARM depuis ollama.com, et non la version x86 ex\u00e9cut\u00e9e sous Rosetta. Les Mac \u00e9quip\u00e9s de puces Apple Silicon utilisent une m\u00e9moire unifi\u00e9e, donc toute la m\u00e9moire syst\u00e8me est disponible aux mod\u00e8les \u2014 indiquez votre m\u00e9moire RAM totale comme limite de VRAM lors de l'utilisation de la <a href=\"https:\/\/convly.ai\/fr\/llm-vram-calculator\/\">Calculateur de VRAM<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Verifying_the_Fix_and_Expected_Throughput\"><\/span>V\u00e9rification de la correction et d\u00e9bit attendu<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Apr\u00e8s avoir apport\u00e9 des modifications, ex\u00e9cutez un mod\u00e8le et v\u00e9rifiez simultan\u00e9ment deux indicateurs :<\/p>\n<pre><code># Terminal 1 \u2014 lancez une g\u00e9n\u00e9ration\nollama run llama3.2:8b \"Quelle est la capitale de la France ?\"\n\n# Terminal 2 \u2014 pendant la g\u00e9n\u00e9ration\nollama ps\n\n# NVIDIA : surveillez \u00e9galement l'utilisation GPU chaque seconde\nnvidia-smi dmon -s u<\/code><\/pre>\n<p>D\u00e9bit de r\u00e9f\u00e9rence (approximatif \u2014 varie selon la quantification, la version du pilote et la bande passante PCIe) :<\/p>\n<table>\n<thead>\n<tr>\n<th>Mat\u00e9riel<\/th>\n<th>Mod\u00e8le<\/th>\n<th>~tok\/s<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>RTX 4090 (24 Go)<\/td>\n<td>Llama 3.1 8B Q4<\/td>\n<td>120\u2013160<\/td>\n<\/tr>\n<tr>\n<td>RTX 3080 (10 Go)<\/td>\n<td>Llama 3.1 8B Q4<\/td>\n<td>60\u201380<\/td>\n<\/tr>\n<tr>\n<td>Apple M3 Pro (m\u00e9moire unifi\u00e9e)<\/td>\n<td>Llama 3.1 8B Q4<\/td>\n<td>40\u201360<\/td>\n<\/tr>\n<tr>\n<td>CPU uniquement (Ryzen 9 7950X)<\/td>\n<td>Llama 3.1 8B Q4<\/td>\n<td>5\u201315<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Un d\u00e9bit inf\u00e9rieur \u00e0 dix jetons par seconde, m\u00eame en pr\u00e9sence d'un GPU performant, est le signe le plus clair que la correction n'a pas pris effet.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_Asked_Questions\"><\/span>Questions fr\u00e9quemment pos\u00e9es<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Pourquoi <code>ollama ps<\/code> affiche-t-il une r\u00e9partition GPU\/CPU au lieu de 100 % GPU ?<\/h3>\n<p>Le mod\u00e8le est plus volumineux que la VRAM disponible. Ollama place autant de couches que possible sur le GPU et ex\u00e9cute le reste sur le CPU. Le r\u00e9sultat est plus rapide qu'une ex\u00e9cution enti\u00e8rement CPU, mais plus lent qu'une ex\u00e9cution enti\u00e8rement GPU. Chargez un mod\u00e8le plus petit ou passez \u00e0 une quantification inf\u00e9rieure afin de transf\u00e9rer davantage de couches vers le GPU.<\/p>\n<h3>Ollama utilisait auparavant le GPU, puis a soudainement cess\u00e9 \u2014 qu'est-ce qui a chang\u00e9 ?<\/h3>\n<p>Une mise \u00e0 jour du pilote, du syst\u00e8me d'exploitation ou d'Ollama peut rompre la d\u00e9tection du GPU. V\u00e9rifiez que <code>nvidia-smi<\/code> affiche toujours la carte, puis red\u00e9marrez enti\u00e8rement le service. Si vous avez r\u00e9cemment mis \u00e0 jour le pilote NVIDIA, un red\u00e9marrage complet du syst\u00e8me est parfois n\u00e9cessaire, plut\u00f4t qu\u2019un simple red\u00e9marrage du service.<\/p>\n<h3>Ollama peut-il utiliser plusieurs GPU simultan\u00e9ment ?<\/h3>\n<p>Oui. Ollama r\u00e9partit automatiquement les couches du mod\u00e8le sur tous les GPU d\u00e9tect\u00e9s d\u00e8s lors qu'ils sont plus d'un. Pour restreindre les GPU utilis\u00e9s par Ollama, d\u00e9finissez la variable d'environnement <code>CUDA_VISIBLE_DEVICES<\/code> (pour NVIDIA) ou <code>HIP_VISIBLE_DEVICES<\/code> (AMD) avant de commencer <code>ollama serve<\/code>.<\/p>\n<h3>Ollama fonctionne-t-il avec les cartes graphiques grand public GeForce, ou ai-je besoin d\u2019une carte GPU destin\u00e9e aux centres de donn\u00e9es ?<\/h3>\n<p>Les cartes GeForce GTX 10xx et ult\u00e9rieures sont enti\u00e8rement prises en charge \u2014 aucune carte GPU pour centre de donn\u00e9es n\u2019est requise. La limite pratique pour la plupart des utilisateurs est la m\u00e9moire vid\u00e9o (VRAM) : une carte de 8 Go ex\u00e9cute confortablement des mod\u00e8les de 7 \u00e0 8 milliards de param\u00e8tres en quantification Q4. Utilisez le <a href=\"https:\/\/convly.ai\/fr\/llm-vram-calculator\/\">Calculateur de VRAM<\/a> pour v\u00e9rifier qu\u2019un mod\u00e8le sp\u00e9cifique tient dans votre VRAM avant de le t\u00e9l\u00e9charger.<\/p>\n<h3>Ma carte graphique dispose de suffisamment de VRAM, mais Ollama utilise tout de m\u00eame le processeur (CPU). Pourquoi ?<\/h3>\n<p>Un autre processus pourrait occuper la VRAM \u2014 v\u00e9rifiez <code>nvidia-smi<\/code> afin d\u2019identifier d\u2019autres consommateurs, tels qu\u2019un navigateur web utilisant l\u2019acc\u00e9l\u00e9ration mat\u00e9rielle ou un autre mod\u00e8le en cours d\u2019ex\u00e9cution. Le mod\u00e8le a peut-\u00eatre \u00e9galement \u00e9t\u00e9 charg\u00e9 avant que le pilote GPU ne soit pr\u00eat. Arr\u00eatez le mod\u00e8le charg\u00e9 \u00e0 l\u2019aide de la commande <code>ollama stop &lt;nom&gt;<\/code>, lib\u00e9rez la VRAM dans les autres applications, puis rechargez le mod\u00e8le.<\/p>\n<h3>O\u00f9 puis-je en apprendre davantage sur la configuration d\u2019Ollama et le choix des mod\u00e8les ?<\/h3>\n<p>Le <a href=\"https:\/\/convly.ai\/fr\/what-is-ollama-complete-guide-2026\/\">Guide complet d\u2019Ollama<\/a> traite en profondeur les variables d\u2019environnement, la gestion des mod\u00e8les et l\u2019utilisation de l\u2019API. Pour choisir le mod\u00e8le adapt\u00e9 \u00e0 votre mat\u00e9riel sp\u00e9cifique, consultez le <a href=\"https:\/\/convly.ai\/fr\/best-local-llms-to-run-on-ollama-2026\/\">Meilleurs mod\u00e8les locaux pour Ollama<\/a>.<\/p>","protected":false},"excerpt":{"rendered":"<p>Run ollama ps while a model is loaded \u2014 the PROCESSOR column tells you whether Ollama is using GPU or [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":2206,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2205","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts\/2205","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/comments?post=2205"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts\/2205\/revisions"}],"predecessor-version":[{"id":2207,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts\/2205\/revisions\/2207"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/media\/2206"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/media?parent=2205"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/categories?post=2205"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/tags?post=2205"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}