Tuesday, 1 September 2026 | Mise à jour quotidienne L'intelligence artificielle au service des constructeurs

Ollama pour Windows : Guide d’installation et instructions de configuration

En bref :

  • Téléchargez l’installeur officiel depuis ollama.com/download, exécutez-le, et Ollama s’installe en tant que service en arrière-plan
  • Nécessite Windows 10 ou version ultérieure et au moins 8 Go de RAM ; les GPU NVIDIA/AMD sont détectés automatiquement pour l’accélération
  • Exécutez les modèles avec la commande exécuter dans l’invite de commandes ou PowerShell — aucune configuration supplémentaire n’est nécessaire
  • Les modèles sont installés par défaut dans le dossier %USERPROFILE%.ollamamodels ; vous pouvez modifier ce chemin via la variable d’environnement OLLAMA_MODELS (OLLAMA_MODELS)

Ollama sous Windows est une application native qui exécute localement des modèles de langage volumineux sans recourir à Docker ni à WSL2. L’installeur Windows configure Ollama en tant que service système qui démarre automatiquement et fournit une accélération GPU via DirectML et CUDA. L’installation prend moins de deux minutes, et vous pouvez exécuter immédiatement des modèles tels que Llama 3.3 70B ou Mistral 7B directement depuis la ligne de commande.

Configuration requise pour Ollama sous Windows

Ollama nécessite Windows 10 (version 1903 ou ultérieure) ou Windows 11. Les spécifications matérielles minimales sont les suivantes :

Composant Minimum Recommandé
Système d’exploitation Windows 10 (1903+) Windows 11
RAM 8 Go 16 Go ou plus
Espace disque 10 Go libres 50 Go ou plus pour plusieurs modèles
GPU (facultatif) NVIDIA GTX 1050 ou équivalent AMD NVIDIA RTX 3060 12 Go ou supérieur

L’accélération GPU fonctionne avec les GPU NVIDIA (CUDA 11.8 ou ultérieur) et les GPU AMD récents (via ROCm sous Windows). L’installeur inclut toutes les bibliothèques GPU nécessaires ; vous n’avez donc pas besoin d’installer CUDA séparément. En l’absence de GPU, Ollama revient à l’inférence CPU, qui est 5 à 10 fois plus lente, mais reste fonctionnelle pour les modèles plus petits.

La taille du modèle détermine les besoins réels en mémoire vive (RAM) ou en mémoire vidéo (VRAM). Par exemple, Mistral 7B nécessite environ 4,5 Go de VRAM en quantification 4 bits, tandis que Llama 3.3 70B requiert environ 40 Go. Consultez la Calculateur de VRAM fiche technique du modèle

Installation d’Ollama sous Windows

L’installeur Windows officiel est un exécutable unique qui gère toutes les dépendances :

  1. Télécharger OllamaSetup.exe à partir de ollama.com/download
  2. Exécutez l’installeur — des privilèges d’administrateur sont requis
  3. Acceptez la licence et cliquez sur Installer (l’emplacement par défaut est C:\Program Files\Ollama)
  4. L’installation se termine en 30 à 60 secondes et démarre automatiquement le service Ollama

Après l’installation, ouvrez l’invite de commandes ou PowerShell et vérifiez le bon fonctionnement avec la commande :

ollama --version

Vous devriez voir un résultat similaire à ollama version 0.x.x. Le service Ollama s’exécute en arrière-plan — vous verrez une icône Ollama dans la zone de notification dès qu’il est actif.

Prise en charge et détection des GPU

Ollama détecte et utilise automatiquement les GPU disponibles sous Windows. Pour confirmer que l’accélération GPU fonctionne :

ollama run llama3.3:70b "test"

Pendant le chargement du modèle, surveillez le Gestionnaire des tâches (onglet Performances). Si une utilisation GPU apparaît sous « GPU 0 » ou « GPU 1 », l’accélération est active. La première exécution télécharge le modèle (5 à 40 Go selon sa taille) vers %USERPROFILE%.ollamamodelsC:\Users\\AppData\Local\Programs\Ollama\models

Les utilisateurs de GPU NVIDIA équipés d’une RTX 3060 ou d’un modèle plus récent obtiennent les meilleures performances grâce à leurs 12 Go de VRAM ou plus et aux optimisations architecturales Ampere/Ada. La prise en charge des GPU AMD sous Windows progresse, mais reste encore inférieure à celle de NVIDIA — prévoyez une inférence 20 à 30 % plus lente sur du matériel AMD équivalent. Les GPU Intel Arc ne sont pas officiellement pris en charge à ce jour (septembre 2026).

Si Ollama ne détecte pas votre GPU, vérifiez que vos pilotes sont à jour (NVIDIA : 537.13 ou ultérieur ; AMD : Adrenalin 23.11 ou ultérieur). Les messages d’erreur d’Ollama indiquent généralement si le GPU a été ignoré en raison d’un manque de VRAM ou de pilotes absents.

Exécution de votre premier modèle

Le ollama run la commande télécharge, charge et démarre une session interactive avec un modèle :

ollama run phi4

télécharge, charge et lance une session interactive avec un modèle : elle installe ainsi le modèle Phi-4 de Microsoft (environ 9 Go de VRAM en quantification 4 bits) et ouvre une invite de discussion. Tapez votre question, appuyez sur Entrée, et le modèle répond localement. Quittez avec la commande /bye exit

Modèles courants à essayer sur du matériel Windows :

Modèle VRAM (4 bits) Idéal pour
Mistral 7B ~4,5 Go Tâches générales, réponses rapides
Llama 3.1 8B ~5 Go Qualité et vitesse équilibrées
Phi-4 ~9 Go Raisonnement, taille compacte
Llama 3.3 70B ~40 Go GPU haut de gamme, meilleure qualité

Parcourez les modèles disponibles sur Liste des modèles Ollama ou recherchez dans la bibliothèque à l’aide de ollama list après avoir téléchargé au moins un modèle.

Configuration et variables d’environnement

Ollama lit sa configuration depuis les variables d’environnement Windows. Définissez-les dans Propriétés système → Variables d’environnement ou dans PowerShell avec $env:VARIABLE_NAME.

Variables clés :

  • OLLAMA_MODELS: répertoire de stockage des modèles (par défaut : %USERPROFILE%.ollamamodels). Modifiez cette valeur si votre lecteur C : manque d’espace.
  • OLLAMA_HOST: adresse du serveur (par défaut : 127.0.0.1:11434). Définissez-la sur 0.0.0.0:11434 pour autoriser les connexions réseau.
  • OLLAMA_NUM_PARALLEL: nombre de requêtes simultanées (par défaut : 1). Augmentez cette valeur si vous desservez plusieurs clients.
  • OLLAMA_MAX_LOADED_MODELS: nombre de modèles conservés en VRAM (par défaut : 1). Réglez-la à 2 ou plus si vous disposez de 24 Go de VRAM ou plus et souhaitez basculer instantanément entre modèles.

Après avoir modifié les variables d’environnement, redémarrez le service Ollama depuis l’application Services (Win+R, tapez services.msc, localisez Ollama, cliquez avec le bouton droit puis sélectionnez Redémarrer) ou redémarrez l’ordinateur.

Pour déplacer les modèles vers un autre disque, définissez OLLAMA_MODELS, puis redémarrez le service. Les modèles existants doivent être à nouveau téléchargés — Ollama ne les migre pas automatiquement.

Optimisation des performances

La vitesse d’inférence dépend de la quantité de VRAM, de la taille du modèle et du niveau de quantification. Un modèle de 7 milliards de paramètres quantifié en 4 bits génère 30 à 60 jetons par seconde sur une RTX 3060, tandis que les modèles de 70 milliards de paramètres tombent à 3 à 8 jetons par seconde, sauf si vous disposez de 48 Go de VRAM ou plus répartis sur plusieurs GPU.

Les configurations multi-GPU fonctionnent automatiquement — Ollama répartit les couches du modèle sur les GPU détectés. Par exemple, deux RTX 3090 (24 Go chacune) peuvent exécuter Llama 3.3 70B à une vitesse acceptable, alors qu’une seule RTX 3090 serait contrainte de décharger certaines couches en mémoire système, entraînant une forte dégradation des performances.

Si les performances sont inférieures aux attentes :

  • Vérifiez le Gestionnaire des tâches pendant l’inférence — une utilisation du processeur supérieure à 30 % signifie que le modèle est partiellement chargé en mémoire système en raison d’un manque de VRAM
  • Essayez une quantification plus faible (par exemple, ollama pull mistral:7b-instruct-q4_K_M au lieu de la quantification par défaut Q8)
  • Fermez les autres applications utilisant le GPU (navigateurs avec accélération matérielle, jeux vidéo, logiciels de montage vidéo)
  • Mettez à jour les pilotes GPU — les versions récentes des pilotes NVIDIA améliorent la vitesse d’inférence de 5 à 10 % par rapport à des versions âgées de six mois

Pour les mises à niveau matérielles, consultez le meilleures GPU pour les LLM locaux guide comparatif du rapport prix/performance entre les options NVIDIA et AMD.

Intégration avec des applications

Ollama expose une API REST sur localhost:11434 compatible avec la structure d’API OpenAI. Les applications prenant en charge des points de terminaison compatibles OpenAI peuvent facilement être redirigées vers Ollama avec des modifications minimales.

Exemple de commande curl pour générer du texte :

curl http://localhost:11434/api/generate -d '{
  "model": "mistral",
  "prompt": "Expliquez Docker en une phrase"
}'

Parmi les intégrations populaires figurent Open WebUI (interface web), Continue.dev (extension VS Code) et LangChain (Python). Le service Ollama doit être en cours d’exécution pour que les appels API fonctionnent — il démarre automatiquement au démarrage par défaut.

Questions fréquemment posées

Ollama nécessite-t-il WSL2 ou Docker sous Windows ?

Non. L’installeur Windows est une application native qui exécute Ollama en tant que service Windows, sans virtualisation ni conteneur. Les versions antérieures nécessitaient Docker, mais la version native pour Windows, publiée fin 2024, a supprimé cette dépendance. Si vous avez installé Ollama avant novembre 2024, désinstallez la version basée sur Docker et téléchargez l’installeur natif actuel.

Puis-je utiliser Ollama hors ligne après avoir téléchargé des modèles ?

Oui. Une fois qu’un modèle a été téléchargé via ollama pull <modèle>, il est stocké localement et s’exécute sans accès Internet. La seule exigence réseau concerne le téléchargement initial — les modèles varient de 2 Go (petits modèles de 7 milliards de paramètres) à plus de 80 Go (grands modèles de 70 milliards de paramètres ou plus). Une fois téléchargés, vous pouvez vous déconnecter du réseau sans affecter le fonctionnement normal d’Ollama.

Quel est le coût d’exécution des modèles Ollama par rapport aux API ?

Ollama est gratuit — vous ne payez que le matériel et l’électricité. Comparez cela aux coûts des API : Claude Sonnet 5 facture 2,00 $ par million de jetons en entrée, donc 10 millions de jetons (environ 7,5 millions de mots) coûtent 20 $. Une configuration auto-hébergée devient rentable très rapidement si vous traitez un volume important. Utilisez le calculateur auto-hébergement vs API calculateur de seuil de rentabilité

Quels modèles fonctionnent le mieux sur les GPU grand public ?

Pour les GPU disposant de 8 à 12 Go de VRAM (RTX 3060, 4060 Ti), Mistral 7B (~4,5 Go en quantification 4 bits), Llama 3.1 8B (~5 Go) et Phi-4 (~9 Go) offrent d’excellents rapports qualité/performance. Si vous disposez de 16 à 24 Go de VRAM (RTX 3090, 4090), Mistral NeMo 12B (~7,5 Go) et même Llama 3.3 70B (~40 Go avec une quantification agressive ou un déchargement partiel) deviennent viables. Consultez Exigences en VRAM selon le modèle le tableau comparatif complet

Ollama peut-il utiliser simultanément des GPU NVIDIA et AMD ?

Non. Ollama utilise soit CUDA (NVIDIA), soit ROCm (AMD), selon ce qu’il détecte en premier, mais il ne peut pas mélanger plusieurs backends GPU au sein d’une même session. Si vous disposez à la fois de GPU NVIDIA et AMD, Ollama privilégie NVIDIA. La prise en charge multi-GPU ne fonctionne que lorsque tous les GPU utilisent la même pile de pilotes — deux cartes NVIDIA ou deux cartes AMD, mais pas une de chaque.

Comment faire pour désinstaller Ollama sur Windows ?

Ouvrez Paramètres → Applications → Applications installées, trouvez Ollama, puis cliquez sur Désinstaller. Cette opération supprime l’application et le service, mais laisse les modèles dans arrêtez et désactivez le service, supprimez. Supprimez ce dossier manuellement pour libérer de l’espace disque. Si le service ne s’arrête pas lors de la désinstallation, ouvrez le Gestionnaire des tâches, repérez OllamaService.exe sous Processus en arrière-plan, terminez-le, puis réessayez.

Étapes suivantes

Après avoir installé Ollama sur Windows, explorez la bibliothèque complète de modèles sur Guide complet d’Ollama pour comprendre comment le choix du modèle, la quantification et la fenêtre de contexte influencent la qualité. Pour les charges de travail en production, calculez les coûts récurrents des API par rapport à l’auto-hébergement à l’aide du Calculateur de coûts d’API calculateur de seuil de rentabilité

Rédigé par Mustafa Ihsan

Mustafa Ihsan est le fondateur et rédacteur en chef de Convly.ai. Il a conçu et maintient la base de données en temps réel des modèles IA du site, son indice de rapport prix/performance, ainsi que ses calculateurs gratuits pour les besoins en VRAM, les coûts d’API et l’économie de l’hébergement local. Il écrit notamment sur la tarification des modèles, les résultats de benchmarks et le matériel requis pour exécuter localement des modèles d’intelligence artificielle, privilégiant systématiquement les données mesurées aux affirmations des éditeurs.

Défiler vers le haut