- Exécuter
ollama pslorsqu’un modèle est chargé — la colonne PROCESSOR indique si Ollama utilise le GPU ou le CPU. - La solution la plus courante sous NVIDIA consiste à installer ou mettre à jour le pilote hôte afin que
nvidia-smidétecte la carte, puis à redémarrer le service Ollama. - Si le modèle est plus volumineux que votre VRAM, Ollama décharge certaines couches vers le CPU — utilisez le Calculateur de VRAM pour vérifier au préalable si votre modèle tient dans la mémoire vidéo avant de le télécharger.
- Les configurations AMD, Docker et WSL2 nécessitent chacune des étapes spécifiques décrites ci-dessous.
Lorsqu’Ollama n’utilise pas votre GPU, la cause la plus fréquente est un pilote manquant ou incompatible. Exécutez ollama ps — si la colonne PROCESSOR affiche 100 % CPU, Ollama a entièrement basculé vers le CPU. La solution dépend de votre plateforme : NVIDIA requiert le runtime CUDA approprié, AMD nécessite ROCm, et Docker exige des drapeaux explicites de passage du GPU.
- Étape 1 : Vérifier si Ollama utilise bien le GPU
- Étape 2 : NVIDIA — Pilotes et runtime CUDA
- Étape 3 : Modèle trop volumineux pour la VRAM
- Étape 4 : GPU AMD et ROCm
- Étape 5 : Docker — Passage du GPU manquant
- Étape 6 : WSL2 sous Windows
- macOS — Metal (puces Apple Silicon et AMD)
- Vérification de la correction et débit attendu
- Questions fréquemment posées
Étape 1 : Vérifier si Ollama utilise bien le GPU
Avant toute modification, vérifiez ce qu’Ollama fait réellement. Chargez un modèle, puis, pendant son exécution, ouvrez un second terminal :
ollama psExemple de sortie :
NOM ID TAILLE PROCESSOR JUSQU’À
llama3.2:8b abc123def456 5,0 Go 100 % GPU dans 4 minutesLa colonne PROCESSOR constitue l’indicateur déterminant :
| Valeur de PROCESSOR | Signification |
|---|---|
| 100 % GPU | Toutes les couches sont sur le GPU — comportement attendu et correct |
| XX % GPU / YY % CPU | Le modèle s’insère partiellement dans la VRAM ; les couches restantes s’exécutent sur le CPU |
| 100 % CPU | Basculement complet vers le CPU — le GPU n’est pas utilisé du tout |
Sur les systèmes NVIDIA, effectuez une vérification croisée avec nvidia-smi pendant l’inférence. La colonne Memory-Usage doit augmenter au fur et à mesure du chargement du modèle. Si elle reste stable, le GPU est inactif, quelle que soit l’information fournie par d’autres outils.
Étape 2 : NVIDIA — Pilotes et runtime CUDA
Un pilote NVIDIA manquant ou obsolète est la cause la plus fréquente d’un basculement complet vers le CPU. Ollama intègre ses propres bibliothèques CUDA, mais il requiert néanmoins un pilote hôte prenant en charge CUDA 11.3 ou ultérieur.
Vérifiez d’abord le pilote
nvidia-smiSi la commande est introuvable, aucun pilote n’est installé. Si elle s’exécute, notez la version du pilote et celle de CUDA figurant dans l’en-tête. La version de CUDA indiquée correspond à la version maximale prise en charge par le pilote — cela ne signifie pas qu’un toolkit CUDA séparé est installé, et Ollama n’en a pas besoin.
| Plateforme | Version minimale du pilote |
|---|---|
| Linux | 525.xx (prend en charge CUDA 12.0) |
| Windows natif | 527.xx (prend en charge CUDA 12.0) |
| WSL2 (hôte Windows) | 525.xx côté Windows — n’installez pas le pilote NVIDIA Linux à l’intérieur de WSL2 |
Installez ou mettez à jour le pilote
Ubuntu / Debian :
sudo apt install nvidia-driver-550
sudo rebootWindows : Téléchargez-le depuis nvidia.com/Download ou utilisez GeForce Experience, puis redémarrez. Un redémarrage complet — et non seulement un redémarrage du service — est requis après l’installation ou la mise à jour d’un pilote.
Après le redémarrage, confirmez que nvidia-smi affiche bien votre carte, puis redémarrez Ollama :
# Linux (systemd)
sudo systemctl restart ollama
# macOS
launchctl kickstart -k gui/$(id -u)/com.ollama.ollama
# Windows — redémarrez l’application Ollama dans la zone de notification, ou redémarrez le systèmeExécutez un modèle et vérifiez à nouveau ollama ps . Si la colonne PROCESSOR affiche toujours 100 % CPU, passez aux étapes suivantes.
Étape 3 : Modèle trop volumineux pour la VRAM
Lorsque les poids d’un modèle dépassent la VRAM disponible, Ollama ne refuse pas de s’exécuter — il répartit l’inférence. Autant de couches de transformeur que possible sont affectées au GPU ; les autres s’exécutent sur le CPU. Cela apparaît sous forme de pourcentage fractionné dans ollama ps et relève d’un comportement intentionnel, non d’un bogue.
Un modèle de 70 milliards de paramètres en quantification Q4_K_M nécessite typiquement environ 40 Go de VRAM, ce qui dépasse la capacité de n’importe quelle carte graphique grand public. Avant de télécharger un modèle volumineux, vérifiez s’il tient dans votre VRAM à l’aide du Calculateur de VRAM. Pour connaître les besoins en VRAM des modèles LLM les plus populaires, consultez Exigences en VRAM pour chaque grand modèle de langage (LLM).
Si le modèle ne tient pas dans votre VRAM, vous avez plusieurs options :
- Utiliser une quantification inférieure (par exemple Q2_K ou Q3_K_S) — réduit la consommation de VRAM avec une légère perte de qualité.
- Passer à une variante plus petite du modèle (par exemple 8B au lieu de 70B). La page Meilleurs modèles locaux pour Ollama répertorie les modèles compatibles avec le matériel grand public.
- Accepter le déchargement partiel — le débit sera compris entre celui obtenu en mode GPU intégral et celui obtenu en mode CPU intégral.
- Mettre à niveau votre GPU. Le guide meilleures GPU pour les LLM locaux compare les options actuelles selon leur VRAM et leur prix.
Étape 4 : GPU AMD et ROCm
La prise en charge d'AMD dans Ollama repose sur ROCm, la plateforme de calcul GPU d'AMD. Ollama prend officiellement en charge les cartes RDNA 2 (série RX 6000) et RDNA 3 (série RX 7000) sous Linux. La prise en charge d'AMD sous Windows est limitée — consultez les notes de version de votre installation d'Ollama avant de supposer qu'elle fonctionnera sous Windows.
Vérifiez que ROCm détecte la carte
rocm-smiSi rocm-smi n'est pas trouvé, la pile ROCm n'est pas installée. Consultez amd.com/fr/developer/rocm pour les instructions d'installation actuelles adaptées à votre distribution, car les noms de paquets et les exigences de version changent entre les versions de ROCm.
Si la carte est absente de la sortie de rocm-smi après l'installation :
sudo usermod -aG render,video $USER
# Déconnectez-vous puis reconnectez-vous pour que la modification des groupes prenne effetPour cibler un GPU spécifique lorsque plusieurs sont présents :
HIP_VISIBLE_DEVICES=0 ollama serveÉtape 5 : Docker — Passage du GPU manquant
Les conteneurs Docker n'ont aucun accès au GPU à moins que vous ne transmettiez explicitement le périphérique. C'est la raison la plus courante pour laquelle Ollama revient automatiquement au CPU dans les déploiements conteneurisés — le GPU hôte fonctionne correctement, mais le conteneur ne peut pas y accéder.
NVIDIA dans Docker
Installez le NVIDIA Container Toolkit sur l'hôte :
sudo apt install nvidia-container-toolkit
sudo nvidia-ctk runtime configure --runtime=docker
sudo systemctl restart dockerPuis transmettez le GPU lors du démarrage du conteneur :
docker run -d --gpus all
-v ollama:/root/.ollama
-p 11434:11434
ollama/ollamaSans l'option --gpus all (ou --gpus device=0 (pour une carte spécifique), le conteneur n'a aucun accès au GPU, quelle que soit la configuration de l'hôte.
AMD dans Docker
docker run -d
--device /dev/kfd --device /dev/dri
-v ollama:/root/.ollama
-p 11434:11434
ollama/ollama:rocmLe :rocm est une balise d'image obligatoire. L'image par défaut ollama/ollama ne comprend pas ROCm et reviendra automatiquement au CPU sur du matériel AMD.
Étape 6 : WSL2 sous Windows
WSL2 peut partager le GPU NVIDIA avec l'hôte Windows, mais une règle est absolue : le pilote NVIDIA doit être installé sur WindowsWindows
- Installez ou mettez à jour le pilote NVIDIA sous Windows, puis redémarrez Windows.
- WSL2 nécessite un noyau version 5.10.43 ou ultérieure. Vérifiez avec la commande
uname -rdans WSL2 ; mettez à jour avec la commandewsl --updatedans un terminal Windows. - Le kit d'outils CUDA peut être installé à l'intérieur de WSL2 si votre flux de travail en a besoin — cela est indépendant du pilote et ne crée aucun conflit.
Vérifiez la visibilité du GPU depuis l'intérieur de WSL2 :
nvidia-smiSi cette commande affiche votre carte, Ollama s'exécutant dans WSL2 l'utilisera automatiquement. En cas d'échec, mettez à jour le pilote côté Windows et réexécutez la commande. wsl --update.
macOS — Metal (puces Apple Silicon et AMD)
Sur macOS, Ollama utilise Apple Metal pour l'accélération GPU — aucun pilote à installer ni aucune variable d'environnement à configurer. Si vous utilisez un Mac équipé de puces Apple Silicon et qu'Ollama fonctionne lentement, assurez-vous d'avoir installé la version native ARM depuis ollama.com, et non la version x86 exécutée sous Rosetta. Les Mac équipés de puces Apple Silicon utilisent une mémoire unifiée, donc toute la mémoire système est disponible aux modèles — indiquez votre mémoire RAM totale comme limite de VRAM lors de l'utilisation de la Calculateur de VRAM.
Vérification de la correction et débit attendu
Après avoir apporté des modifications, exécutez un modèle et vérifiez simultanément deux indicateurs :
# Terminal 1 — lancez une génération
ollama run llama3.2:8b "Quelle est la capitale de la France ?"
# Terminal 2 — pendant la génération
ollama ps
# NVIDIA : surveillez également l'utilisation GPU chaque seconde
nvidia-smi dmon -s uDébit de référence (approximatif — varie selon la quantification, la version du pilote et la bande passante PCIe) :
| Matériel | Modèle | ~tok/s |
|---|---|---|
| RTX 4090 (24 Go) | Llama 3.1 8B Q4 | 120–160 |
| RTX 3080 (10 Go) | Llama 3.1 8B Q4 | 60–80 |
| Apple M3 Pro (mémoire unifiée) | Llama 3.1 8B Q4 | 40–60 |
| CPU uniquement (Ryzen 9 7950X) | Llama 3.1 8B Q4 | 5–15 |
Un débit inférieur à dix jetons par seconde, même en présence d'un GPU performant, est le signe le plus clair que la correction n'a pas pris effet.
Questions fréquemment posées
Pourquoi ollama ps affiche-t-il une répartition GPU/CPU au lieu de 100 % GPU ?
Le modèle est plus volumineux que la VRAM disponible. Ollama place autant de couches que possible sur le GPU et exécute le reste sur le CPU. Le résultat est plus rapide qu'une exécution entièrement CPU, mais plus lent qu'une exécution entièrement GPU. Chargez un modèle plus petit ou passez à une quantification inférieure afin de transférer davantage de couches vers le GPU.
Ollama utilisait auparavant le GPU, puis a soudainement cessé — qu'est-ce qui a changé ?
Une mise à jour du pilote, du système d'exploitation ou d'Ollama peut rompre la détection du GPU. Vérifiez que nvidia-smi affiche toujours la carte, puis redémarrez entièrement le service. Si vous avez récemment mis à jour le pilote NVIDIA, un redémarrage complet du système est parfois nécessaire, plutôt qu’un simple redémarrage du service.
Ollama peut-il utiliser plusieurs GPU simultanément ?
Oui. Ollama répartit automatiquement les couches du modèle sur tous les GPU détectés dès lors qu'ils sont plus d'un. Pour restreindre les GPU utilisés par Ollama, définissez la variable d'environnement CUDA_VISIBLE_DEVICES (pour NVIDIA) ou HIP_VISIBLE_DEVICES (AMD) avant de commencer ollama serve.
Ollama fonctionne-t-il avec les cartes graphiques grand public GeForce, ou ai-je besoin d’une carte GPU destinée aux centres de données ?
Les cartes GeForce GTX 10xx et ultérieures sont entièrement prises en charge — aucune carte GPU pour centre de données n’est requise. La limite pratique pour la plupart des utilisateurs est la mémoire vidéo (VRAM) : une carte de 8 Go exécute confortablement des modèles de 7 à 8 milliards de paramètres en quantification Q4. Utilisez le Calculateur de VRAM pour vérifier qu’un modèle spécifique tient dans votre VRAM avant de le télécharger.
Ma carte graphique dispose de suffisamment de VRAM, mais Ollama utilise tout de même le processeur (CPU). Pourquoi ?
Un autre processus pourrait occuper la VRAM — vérifiez nvidia-smi afin d’identifier d’autres consommateurs, tels qu’un navigateur web utilisant l’accélération matérielle ou un autre modèle en cours d’exécution. Le modèle a peut-être également été chargé avant que le pilote GPU ne soit prêt. Arrêtez le modèle chargé à l’aide de la commande ollama stop <nom>, libérez la VRAM dans les autres applications, puis rechargez le modèle.
Où puis-je en apprendre davantage sur la configuration d’Ollama et le choix des modèles ?
Le Guide complet d’Ollama traite en profondeur les variables d’environnement, la gestion des modèles et l’utilisation de l’API. Pour choisir le modèle adapté à votre matériel spécifique, consultez le Meilleurs modèles locaux pour Ollama.

