Monday, 3 August 2026 | Mise à jour quotidienne L'intelligence artificielle au service des constructeurs

Guide Docker pour Ollama (2026) : exécuter Ollama dans un conteneur avec accélération GPU

En cours d’exécution Ollama dans Docker constitue la méthode la plus propre pour garantir la reproductibilité d’un serveur local de modèles : la même commande fonctionne sur un ordinateur portable, un serveur domestique ou une machine distante équipée d’un GPU, sans qu’aucun composant ne s’installe sur le système hôte. La configuration est simple, mais deux détails — le passage du GPU au conteneur et la persistance des volumes — sont à l’origine de la majeure partie des pertes de temps.

Quick answer

Téléchargez et lancez l’image officielle avec un volume nommé afin que les modèles survivent aux redémarrages : docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama. Pour un GPU NVIDIA, installez le « NVIDIA Container Toolkit » sur la machine hôte, puis ajoutez l’option --gpus=all. Ensuite, téléchargez les modèles depuis l’intérieur du conteneur à l’aide de la commande docker exec -it ollama ollama pull llama3.1. L’API est accessible sur le port 11434 exactement comme dans une installation native.

Les trois commandes essentielles

ObjectifCommande
Uniquement CPUdocker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama
Avec GPU NVIDIAdocker run -d --gpus=all -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama
Télécharger un modèledocker exec -it ollama ollama pull llama3.1

Passage du GPU au conteneur : l’étape qui échoue le plus souvent

Par défaut, un conteneur ne peut pas accéder à votre GPU. Sous Linux, installez le NVIDIA Container Toolkit sur la machine hôte, redémarrez le service Docker, puis ajoutez l’option --gpus=all. Vérifiez que la configuration fonctionne depuis l’intérieur du conteneur avec la commande docker exec -it ollama nvidia-smi — si cette commande échoue, Ollama s’exécutera tout de même, mais silencieusement sur le CPU ; vous conclurez alors à tort que votre GPU est lent, alors qu’il n’est tout simplement pas utilisé. Sous Windows, utilisez Docker Desktop avec le backend WSL2 et des pilotes NVIDIA à jour. Les utilisateurs AMD doivent employer l’image marquée « ROCm » plutôt que l’image par défaut, tandis que les GPU Apple Silicon ne peuvent pas être exposés à Docker du tout : sur Mac, exécutez Ollama nativement.

Conserver vos modèles entre les redémarrages

Les fichiers de modèles sont volumineux et longs à télécharger à nouveau ; un conteneur sans volume les supprime dès sa suppression. L’option -v ollama:/root/.ollama présente dans chacune des commandes ci-dessus crée un volume nommé qui persiste entre les redémarrages, les mises à niveau et les changements d’image. Si vous préférez stocker ces fichiers dans un emplacement accessible directement, montez plutôt un répertoire hôte : -v /srv/ollama:/root/.ollama.

docker compose, pour une configuration durable

Pour toute configuration durable, un fichier docker-compose est préférable à une longue commande docker run : il centralise la réservation du GPU, la gestion du volume et l’exposition du port, redémarre automatiquement le service et permet d’ajouter ultérieurement une interface web. Le conteneur expose le même point de terminaison compatible OpenAI sur http://localhost:11434, de sorte que les applications ne peuvent pas distinguer une installation conteneurisée d’une installation native.

Convly’s take

Conteneurisez Ollama lorsque la machine est un serveur, et évitez Docker si elle est votre ordinateur portable. Sur un serveur domestique ou une machine distante équipée d’un GPU, la combinaison volume + docker-compose est effectivement supérieure : reproductible, évolutif et facile à déplacer. Sur une machine personnelle — notamment un Mac, où le passage du GPU à Docker est impossible — Docker ajoute une surcouche qui nuit aux performances sans apporter de réel avantage. Le problème le plus courant que nous observons est un conteneur tournant silencieusement sur le CPU parce que le « NVIDIA Container Toolkit » n’a jamais été installé ; exécutez donc « nvidia-smi » à l’intérieur du conteneur avant d’effectuer tout test de performance.

Questions fréquemment posées

Ollama dans Docker prend-il en charge les GPU ?

Oui, avec NVIDIA via le « NVIDIA Container Toolkit » et l’option --gpus=all, et avec AMD via l’image ROCm. Les GPU Apple Silicon ne peuvent pas être exposés à Docker : exécutez Ollama nativement sous macOS.

Où sont stockés les modèles dans la configuration Docker ?

À l’intérieur du conteneur, dans le répertoire /root/.ollama. Mappez ce chemin vers un volume nommé ou un répertoire hôte, sinon les modèles disparaissent dès la suppression du conteneur.

Ollama est-il plus lent sous Docker ?

De façon négligeable sous Linux, à condition que le passage du GPU soit correctement configuré. Une lenteur perçue signifie presque toujours que le conteneur tourne sur le CPU, car le GPU n’a pas été correctement exposé.

Puis-je exécuter plusieurs modèles dans un seul conteneur ?

Oui — téléchargez-en autant que vous le souhaitez ; Ollama les charge à la demande. La limite est la mémoire : seuls les modèles effectivement chargés consomment de la RAM ou de la VRAM.

Nouveau sur cet outil ? Commencez par le Guide d’installation d’Ollama, puis vérifiez les besoins matériels dans les exigences système d’Ollama, ou dimensionner un modèle avec le Calculateur de VRAM.

Rédigé par Mustafa Ihsan

Mustafa Ihsan est le fondateur et rédacteur en chef de Convly.ai. Il a conçu et maintient la base de données en temps réel des modèles IA du site, son indice prix-performance, ainsi que ses calculateurs gratuits pour les besoins en VRAM, les coûts des API et l’économie de l’auto-hébergement. Il écrit sur la tarification des modèles, les résultats des benchmarks et le matériel nécessaire pour exécuter localement des modèles IA, privilégiant systématiquement les chiffres mesurés aux allégations des fournisseurs.

Défiler vers le haut
Featured on There's An AI For That