Friday, 14 August 2026 | Mise à jour quotidienne L'intelligence artificielle au service des constructeurs

Ollama n'utilise pas le GPU : diagnostiquer et résoudre le basculement vers le CPU

  • Exécuter ollama ps lorsqu’un modèle est chargé — la colonne PROCESSOR indique si Ollama utilise le GPU ou le CPU.
  • La solution la plus courante sous NVIDIA consiste à installer ou mettre à jour le pilote hôte afin que nvidia-smi détecte la carte, puis à redémarrer le service Ollama.
  • Si le modèle est plus volumineux que votre VRAM, Ollama décharge certaines couches vers le CPU — utilisez le Calculateur de VRAM pour vérifier au préalable si votre modèle tient dans la mémoire vidéo avant de le télécharger.
  • Les configurations AMD, Docker et WSL2 nécessitent chacune des étapes spécifiques décrites ci-dessous.

Lorsqu’Ollama n’utilise pas votre GPU, la cause la plus fréquente est un pilote manquant ou incompatible. Exécutez ollama ps — si la colonne PROCESSOR affiche 100 % CPU, Ollama a entièrement basculé vers le CPU. La solution dépend de votre plateforme : NVIDIA requiert le runtime CUDA approprié, AMD nécessite ROCm, et Docker exige des drapeaux explicites de passage du GPU.

Étape 1 : Vérifier si Ollama utilise bien le GPU

Avant toute modification, vérifiez ce qu’Ollama fait réellement. Chargez un modèle, puis, pendant son exécution, ouvrez un second terminal :

ollama ps

Exemple de sortie :

NOM              ID              TAILLE    PROCESSOR    JUSQU’À
llama3.2:8b       abc123def456    5,0 Go    100 % GPU    dans 4 minutes

La colonne PROCESSOR constitue l’indicateur déterminant :

Valeur de PROCESSORSignification
100 % GPUToutes les couches sont sur le GPU — comportement attendu et correct
XX % GPU / YY % CPULe modèle s’insère partiellement dans la VRAM ; les couches restantes s’exécutent sur le CPU
100 % CPUBasculement complet vers le CPU — le GPU n’est pas utilisé du tout

Sur les systèmes NVIDIA, effectuez une vérification croisée avec nvidia-smi pendant l’inférence. La colonne Memory-Usage doit augmenter au fur et à mesure du chargement du modèle. Si elle reste stable, le GPU est inactif, quelle que soit l’information fournie par d’autres outils.

Étape 2 : NVIDIA — Pilotes et runtime CUDA

Un pilote NVIDIA manquant ou obsolète est la cause la plus fréquente d’un basculement complet vers le CPU. Ollama intègre ses propres bibliothèques CUDA, mais il requiert néanmoins un pilote hôte prenant en charge CUDA 11.3 ou ultérieur.

Vérifiez d’abord le pilote

nvidia-smi

Si la commande est introuvable, aucun pilote n’est installé. Si elle s’exécute, notez la version du pilote et celle de CUDA figurant dans l’en-tête. La version de CUDA indiquée correspond à la version maximale prise en charge par le pilote — cela ne signifie pas qu’un toolkit CUDA séparé est installé, et Ollama n’en a pas besoin.

PlateformeVersion minimale du pilote
Linux525.xx (prend en charge CUDA 12.0)
Windows natif527.xx (prend en charge CUDA 12.0)
WSL2 (hôte Windows)525.xx côté Windows — n’installez pas le pilote NVIDIA Linux à l’intérieur de WSL2

Installez ou mettez à jour le pilote

Ubuntu / Debian :

sudo apt install nvidia-driver-550
sudo reboot

Windows : Téléchargez-le depuis nvidia.com/Download ou utilisez GeForce Experience, puis redémarrez. Un redémarrage complet — et non seulement un redémarrage du service — est requis après l’installation ou la mise à jour d’un pilote.

Après le redémarrage, confirmez que nvidia-smi affiche bien votre carte, puis redémarrez Ollama :

# Linux (systemd)
sudo systemctl restart ollama

# macOS
launchctl kickstart -k gui/$(id -u)/com.ollama.ollama

# Windows — redémarrez l’application Ollama dans la zone de notification, ou redémarrez le système

Exécutez un modèle et vérifiez à nouveau ollama ps . Si la colonne PROCESSOR affiche toujours 100 % CPU, passez aux étapes suivantes.

Étape 3 : Modèle trop volumineux pour la VRAM

Lorsque les poids d’un modèle dépassent la VRAM disponible, Ollama ne refuse pas de s’exécuter — il répartit l’inférence. Autant de couches de transformeur que possible sont affectées au GPU ; les autres s’exécutent sur le CPU. Cela apparaît sous forme de pourcentage fractionné dans ollama ps et relève d’un comportement intentionnel, non d’un bogue.

Un modèle de 70 milliards de paramètres en quantification Q4_K_M nécessite typiquement environ 40 Go de VRAM, ce qui dépasse la capacité de n’importe quelle carte graphique grand public. Avant de télécharger un modèle volumineux, vérifiez s’il tient dans votre VRAM à l’aide du Calculateur de VRAM. Pour connaître les besoins en VRAM des modèles LLM les plus populaires, consultez Exigences en VRAM pour chaque grand modèle de langage (LLM).

Si le modèle ne tient pas dans votre VRAM, vous avez plusieurs options :

  • Utiliser une quantification inférieure (par exemple Q2_K ou Q3_K_S) — réduit la consommation de VRAM avec une légère perte de qualité.
  • Passer à une variante plus petite du modèle (par exemple 8B au lieu de 70B). La page Meilleurs modèles locaux pour Ollama répertorie les modèles compatibles avec le matériel grand public.
  • Accepter le déchargement partiel — le débit sera compris entre celui obtenu en mode GPU intégral et celui obtenu en mode CPU intégral.
  • Mettre à niveau votre GPU. Le guide meilleures GPU pour les LLM locaux compare les options actuelles selon leur VRAM et leur prix.

Étape 4 : GPU AMD et ROCm

La prise en charge d'AMD dans Ollama repose sur ROCm, la plateforme de calcul GPU d'AMD. Ollama prend officiellement en charge les cartes RDNA 2 (série RX 6000) et RDNA 3 (série RX 7000) sous Linux. La prise en charge d'AMD sous Windows est limitée — consultez les notes de version de votre installation d'Ollama avant de supposer qu'elle fonctionnera sous Windows.

Vérifiez que ROCm détecte la carte

rocm-smi

Si rocm-smi n'est pas trouvé, la pile ROCm n'est pas installée. Consultez amd.com/fr/developer/rocm pour les instructions d'installation actuelles adaptées à votre distribution, car les noms de paquets et les exigences de version changent entre les versions de ROCm.

Si la carte est absente de la sortie de rocm-smi après l'installation :

sudo usermod -aG render,video $USER
# Déconnectez-vous puis reconnectez-vous pour que la modification des groupes prenne effet

Pour cibler un GPU spécifique lorsque plusieurs sont présents :

HIP_VISIBLE_DEVICES=0 ollama serve

Étape 5 : Docker — Passage du GPU manquant

Les conteneurs Docker n'ont aucun accès au GPU à moins que vous ne transmettiez explicitement le périphérique. C'est la raison la plus courante pour laquelle Ollama revient automatiquement au CPU dans les déploiements conteneurisés — le GPU hôte fonctionne correctement, mais le conteneur ne peut pas y accéder.

NVIDIA dans Docker

Installez le NVIDIA Container Toolkit sur l'hôte :

sudo apt install nvidia-container-toolkit
sudo nvidia-ctk runtime configure --runtime=docker
sudo systemctl restart docker

Puis transmettez le GPU lors du démarrage du conteneur :

docker run -d --gpus all 
  -v ollama:/root/.ollama 
  -p 11434:11434 
  ollama/ollama

Sans l'option --gpus all (ou --gpus device=0 (pour une carte spécifique), le conteneur n'a aucun accès au GPU, quelle que soit la configuration de l'hôte.

AMD dans Docker

docker run -d 
  --device /dev/kfd --device /dev/dri 
  -v ollama:/root/.ollama 
  -p 11434:11434 
  ollama/ollama:rocm

Le :rocm est une balise d'image obligatoire. L'image par défaut ollama/ollama ne comprend pas ROCm et reviendra automatiquement au CPU sur du matériel AMD.

Étape 6 : WSL2 sous Windows

WSL2 peut partager le GPU NVIDIA avec l'hôte Windows, mais une règle est absolue : le pilote NVIDIA doit être installé sur WindowsWindows

  • Installez ou mettez à jour le pilote NVIDIA sous Windows, puis redémarrez Windows.
  • WSL2 nécessite un noyau version 5.10.43 ou ultérieure. Vérifiez avec la commande uname -r dans WSL2 ; mettez à jour avec la commande wsl --update dans un terminal Windows.
  • Le kit d'outils CUDA peut être installé à l'intérieur de WSL2 si votre flux de travail en a besoin — cela est indépendant du pilote et ne crée aucun conflit.

Vérifiez la visibilité du GPU depuis l'intérieur de WSL2 :

nvidia-smi

Si cette commande affiche votre carte, Ollama s'exécutant dans WSL2 l'utilisera automatiquement. En cas d'échec, mettez à jour le pilote côté Windows et réexécutez la commande. wsl --update.

macOS — Metal (puces Apple Silicon et AMD)

Sur macOS, Ollama utilise Apple Metal pour l'accélération GPU — aucun pilote à installer ni aucune variable d'environnement à configurer. Si vous utilisez un Mac équipé de puces Apple Silicon et qu'Ollama fonctionne lentement, assurez-vous d'avoir installé la version native ARM depuis ollama.com, et non la version x86 exécutée sous Rosetta. Les Mac équipés de puces Apple Silicon utilisent une mémoire unifiée, donc toute la mémoire système est disponible aux modèles — indiquez votre mémoire RAM totale comme limite de VRAM lors de l'utilisation de la Calculateur de VRAM.

Vérification de la correction et débit attendu

Après avoir apporté des modifications, exécutez un modèle et vérifiez simultanément deux indicateurs :

# Terminal 1 — lancez une génération
ollama run llama3.2:8b "Quelle est la capitale de la France ?"

# Terminal 2 — pendant la génération
ollama ps

# NVIDIA : surveillez également l'utilisation GPU chaque seconde
nvidia-smi dmon -s u

Débit de référence (approximatif — varie selon la quantification, la version du pilote et la bande passante PCIe) :

MatérielModèle~tok/s
RTX 4090 (24 Go)Llama 3.1 8B Q4120–160
RTX 3080 (10 Go)Llama 3.1 8B Q460–80
Apple M3 Pro (mémoire unifiée)Llama 3.1 8B Q440–60
CPU uniquement (Ryzen 9 7950X)Llama 3.1 8B Q45–15

Un débit inférieur à dix jetons par seconde, même en présence d'un GPU performant, est le signe le plus clair que la correction n'a pas pris effet.

Questions fréquemment posées

Pourquoi ollama ps affiche-t-il une répartition GPU/CPU au lieu de 100 % GPU ?

Le modèle est plus volumineux que la VRAM disponible. Ollama place autant de couches que possible sur le GPU et exécute le reste sur le CPU. Le résultat est plus rapide qu'une exécution entièrement CPU, mais plus lent qu'une exécution entièrement GPU. Chargez un modèle plus petit ou passez à une quantification inférieure afin de transférer davantage de couches vers le GPU.

Ollama utilisait auparavant le GPU, puis a soudainement cessé — qu'est-ce qui a changé ?

Une mise à jour du pilote, du système d'exploitation ou d'Ollama peut rompre la détection du GPU. Vérifiez que nvidia-smi affiche toujours la carte, puis redémarrez entièrement le service. Si vous avez récemment mis à jour le pilote NVIDIA, un redémarrage complet du système est parfois nécessaire, plutôt qu’un simple redémarrage du service.

Ollama peut-il utiliser plusieurs GPU simultanément ?

Oui. Ollama répartit automatiquement les couches du modèle sur tous les GPU détectés dès lors qu'ils sont plus d'un. Pour restreindre les GPU utilisés par Ollama, définissez la variable d'environnement CUDA_VISIBLE_DEVICES (pour NVIDIA) ou HIP_VISIBLE_DEVICES (AMD) avant de commencer ollama serve.

Ollama fonctionne-t-il avec les cartes graphiques grand public GeForce, ou ai-je besoin d’une carte GPU destinée aux centres de données ?

Les cartes GeForce GTX 10xx et ultérieures sont entièrement prises en charge — aucune carte GPU pour centre de données n’est requise. La limite pratique pour la plupart des utilisateurs est la mémoire vidéo (VRAM) : une carte de 8 Go exécute confortablement des modèles de 7 à 8 milliards de paramètres en quantification Q4. Utilisez le Calculateur de VRAM pour vérifier qu’un modèle spécifique tient dans votre VRAM avant de le télécharger.

Ma carte graphique dispose de suffisamment de VRAM, mais Ollama utilise tout de même le processeur (CPU). Pourquoi ?

Un autre processus pourrait occuper la VRAM — vérifiez nvidia-smi afin d’identifier d’autres consommateurs, tels qu’un navigateur web utilisant l’accélération matérielle ou un autre modèle en cours d’exécution. Le modèle a peut-être également été chargé avant que le pilote GPU ne soit prêt. Arrêtez le modèle chargé à l’aide de la commande ollama stop <nom>, libérez la VRAM dans les autres applications, puis rechargez le modèle.

Où puis-je en apprendre davantage sur la configuration d’Ollama et le choix des modèles ?

Le Guide complet d’Ollama traite en profondeur les variables d’environnement, la gestion des modèles et l’utilisation de l’API. Pour choisir le modèle adapté à votre matériel spécifique, consultez le Meilleurs modèles locaux pour Ollama.

Rédigé par Mustafa Ihsan

Mustafa Ihsan est le fondateur et rédacteur en chef de Convly.ai. Il a conçu et maintient la base de données en temps réel des modèles IA du site, son indice de rapport prix/performance, ainsi que ses calculateurs gratuits pour les besoins en VRAM, les coûts d’API et l’économie de l’hébergement local. Il écrit notamment sur la tarification des modèles, les résultats de benchmarks et le matériel requis pour exécuter localement des modèles d’intelligence artificielle, privilégiant systématiquement les données mesurées aux affirmations des éditeurs.

Défiler vers le haut
Featured on There's An AI For That