- Téléchargez l’installeur officiel depuis
ollama.com/download, exécutez-le, et Ollama s’installe en tant que service en arrière-plan - Nécessite Windows 10 ou version ultérieure et au moins 8 Go de RAM ; les GPU NVIDIA/AMD sont détectés automatiquement pour l’accélération
- Exécutez les modèles avec la commande
exécuterdans l’invite de commandes ou PowerShell — aucune configuration supplémentaire n’est nécessaire - Les modèles sont installés par défaut dans le dossier
%USERPROFILE%.ollamamodels; vous pouvez modifier ce chemin via la variable d’environnementOLLAMA_MODELS(OLLAMA_MODELS)
Ollama sous Windows est une application native qui exécute localement des modèles de langage volumineux sans recourir à Docker ni à WSL2. L’installeur Windows configure Ollama en tant que service système qui démarre automatiquement et fournit une accélération GPU via DirectML et CUDA. L’installation prend moins de deux minutes, et vous pouvez exécuter immédiatement des modèles tels que Llama 3.3 70B ou Mistral 7B directement depuis la ligne de commande.
Configuration requise pour Ollama sous Windows
Ollama nécessite Windows 10 (version 1903 ou ultérieure) ou Windows 11. Les spécifications matérielles minimales sont les suivantes :
| Composant | Minimum | Recommandé |
|---|---|---|
| Système d’exploitation | Windows 10 (1903+) | Windows 11 |
| RAM | 8 Go | 16 Go ou plus |
| Espace disque | 10 Go libres | 50 Go ou plus pour plusieurs modèles |
| GPU (facultatif) | NVIDIA GTX 1050 ou équivalent AMD | NVIDIA RTX 3060 12 Go ou supérieur |
L’accélération GPU fonctionne avec les GPU NVIDIA (CUDA 11.8 ou ultérieur) et les GPU AMD récents (via ROCm sous Windows). L’installeur inclut toutes les bibliothèques GPU nécessaires ; vous n’avez donc pas besoin d’installer CUDA séparément. En l’absence de GPU, Ollama revient à l’inférence CPU, qui est 5 à 10 fois plus lente, mais reste fonctionnelle pour les modèles plus petits.
La taille du modèle détermine les besoins réels en mémoire vive (RAM) ou en mémoire vidéo (VRAM). Par exemple, Mistral 7B nécessite environ 4,5 Go de VRAM en quantification 4 bits, tandis que Llama 3.3 70B requiert environ 40 Go. Consultez la Calculateur de VRAM fiche technique du modèle
Installation d’Ollama sous Windows
L’installeur Windows officiel est un exécutable unique qui gère toutes les dépendances :
- Télécharger
OllamaSetup.exeà partir de ollama.com/download - Exécutez l’installeur — des privilèges d’administrateur sont requis
- Acceptez la licence et cliquez sur Installer (l’emplacement par défaut est
C:\Program Files\Ollama) - L’installation se termine en 30 à 60 secondes et démarre automatiquement le service Ollama
Après l’installation, ouvrez l’invite de commandes ou PowerShell et vérifiez le bon fonctionnement avec la commande :
ollama --version
Vous devriez voir un résultat similaire à ollama version 0.x.x. Le service Ollama s’exécute en arrière-plan — vous verrez une icône Ollama dans la zone de notification dès qu’il est actif.
Prise en charge et détection des GPU
Ollama détecte et utilise automatiquement les GPU disponibles sous Windows. Pour confirmer que l’accélération GPU fonctionne :
ollama run llama3.3:70b "test"
Pendant le chargement du modèle, surveillez le Gestionnaire des tâches (onglet Performances). Si une utilisation GPU apparaît sous « GPU 0 » ou « GPU 1 », l’accélération est active. La première exécution télécharge le modèle (5 à 40 Go selon sa taille) vers %USERPROFILE%.ollamamodelsC:\Users\\AppData\Local\Programs\Ollama\models
Les utilisateurs de GPU NVIDIA équipés d’une RTX 3060 ou d’un modèle plus récent obtiennent les meilleures performances grâce à leurs 12 Go de VRAM ou plus et aux optimisations architecturales Ampere/Ada. La prise en charge des GPU AMD sous Windows progresse, mais reste encore inférieure à celle de NVIDIA — prévoyez une inférence 20 à 30 % plus lente sur du matériel AMD équivalent. Les GPU Intel Arc ne sont pas officiellement pris en charge à ce jour (septembre 2026).
Si Ollama ne détecte pas votre GPU, vérifiez que vos pilotes sont à jour (NVIDIA : 537.13 ou ultérieur ; AMD : Adrenalin 23.11 ou ultérieur). Les messages d’erreur d’Ollama indiquent généralement si le GPU a été ignoré en raison d’un manque de VRAM ou de pilotes absents.
Exécution de votre premier modèle
Le ollama run la commande télécharge, charge et démarre une session interactive avec un modèle :
ollama run phi4
télécharge, charge et lance une session interactive avec un modèle : elle installe ainsi le modèle Phi-4 de Microsoft (environ 9 Go de VRAM en quantification 4 bits) et ouvre une invite de discussion. Tapez votre question, appuyez sur Entrée, et le modèle répond localement. Quittez avec la commande /bye exit
Modèles courants à essayer sur du matériel Windows :
| Modèle | VRAM (4 bits) | Idéal pour |
|---|---|---|
| Mistral 7B | ~4,5 Go | Tâches générales, réponses rapides |
| Llama 3.1 8B | ~5 Go | Qualité et vitesse équilibrées |
| Phi-4 | ~9 Go | Raisonnement, taille compacte |
| Llama 3.3 70B | ~40 Go | GPU haut de gamme, meilleure qualité |
Parcourez les modèles disponibles sur Liste des modèles Ollama ou recherchez dans la bibliothèque à l’aide de ollama list après avoir téléchargé au moins un modèle.
Configuration et variables d’environnement
Ollama lit sa configuration depuis les variables d’environnement Windows. Définissez-les dans Propriétés système → Variables d’environnement ou dans PowerShell avec $env:VARIABLE_NAME.
Variables clés :
- OLLAMA_MODELS: répertoire de stockage des modèles (par défaut :
%USERPROFILE%.ollamamodels). Modifiez cette valeur si votre lecteur C : manque d’espace. - OLLAMA_HOST: adresse du serveur (par défaut :
127.0.0.1:11434). Définissez-la sur0.0.0.0:11434pour autoriser les connexions réseau. - OLLAMA_NUM_PARALLEL: nombre de requêtes simultanées (par défaut : 1). Augmentez cette valeur si vous desservez plusieurs clients.
- OLLAMA_MAX_LOADED_MODELS: nombre de modèles conservés en VRAM (par défaut : 1). Réglez-la à 2 ou plus si vous disposez de 24 Go de VRAM ou plus et souhaitez basculer instantanément entre modèles.
Après avoir modifié les variables d’environnement, redémarrez le service Ollama depuis l’application Services (Win+R, tapez services.msc, localisez Ollama, cliquez avec le bouton droit puis sélectionnez Redémarrer) ou redémarrez l’ordinateur.
Pour déplacer les modèles vers un autre disque, définissez OLLAMA_MODELS, puis redémarrez le service. Les modèles existants doivent être à nouveau téléchargés — Ollama ne les migre pas automatiquement.
Optimisation des performances
La vitesse d’inférence dépend de la quantité de VRAM, de la taille du modèle et du niveau de quantification. Un modèle de 7 milliards de paramètres quantifié en 4 bits génère 30 à 60 jetons par seconde sur une RTX 3060, tandis que les modèles de 70 milliards de paramètres tombent à 3 à 8 jetons par seconde, sauf si vous disposez de 48 Go de VRAM ou plus répartis sur plusieurs GPU.
Les configurations multi-GPU fonctionnent automatiquement — Ollama répartit les couches du modèle sur les GPU détectés. Par exemple, deux RTX 3090 (24 Go chacune) peuvent exécuter Llama 3.3 70B à une vitesse acceptable, alors qu’une seule RTX 3090 serait contrainte de décharger certaines couches en mémoire système, entraînant une forte dégradation des performances.
Si les performances sont inférieures aux attentes :
- Vérifiez le Gestionnaire des tâches pendant l’inférence — une utilisation du processeur supérieure à 30 % signifie que le modèle est partiellement chargé en mémoire système en raison d’un manque de VRAM
- Essayez une quantification plus faible (par exemple,
ollama pull mistral:7b-instruct-q4_K_Mau lieu de la quantification par défaut Q8) - Fermez les autres applications utilisant le GPU (navigateurs avec accélération matérielle, jeux vidéo, logiciels de montage vidéo)
- Mettez à jour les pilotes GPU — les versions récentes des pilotes NVIDIA améliorent la vitesse d’inférence de 5 à 10 % par rapport à des versions âgées de six mois
Pour les mises à niveau matérielles, consultez le meilleures GPU pour les LLM locaux guide comparatif du rapport prix/performance entre les options NVIDIA et AMD.
Intégration avec des applications
Ollama expose une API REST sur localhost:11434 compatible avec la structure d’API OpenAI. Les applications prenant en charge des points de terminaison compatibles OpenAI peuvent facilement être redirigées vers Ollama avec des modifications minimales.
Exemple de commande curl pour générer du texte :
curl http://localhost:11434/api/generate -d '{
"model": "mistral",
"prompt": "Expliquez Docker en une phrase"
}'
Parmi les intégrations populaires figurent Open WebUI (interface web), Continue.dev (extension VS Code) et LangChain (Python). Le service Ollama doit être en cours d’exécution pour que les appels API fonctionnent — il démarre automatiquement au démarrage par défaut.
Questions fréquemment posées
Ollama nécessite-t-il WSL2 ou Docker sous Windows ?
Non. L’installeur Windows est une application native qui exécute Ollama en tant que service Windows, sans virtualisation ni conteneur. Les versions antérieures nécessitaient Docker, mais la version native pour Windows, publiée fin 2024, a supprimé cette dépendance. Si vous avez installé Ollama avant novembre 2024, désinstallez la version basée sur Docker et téléchargez l’installeur natif actuel.
Puis-je utiliser Ollama hors ligne après avoir téléchargé des modèles ?
Oui. Une fois qu’un modèle a été téléchargé via ollama pull <modèle>, il est stocké localement et s’exécute sans accès Internet. La seule exigence réseau concerne le téléchargement initial — les modèles varient de 2 Go (petits modèles de 7 milliards de paramètres) à plus de 80 Go (grands modèles de 70 milliards de paramètres ou plus). Une fois téléchargés, vous pouvez vous déconnecter du réseau sans affecter le fonctionnement normal d’Ollama.
Quel est le coût d’exécution des modèles Ollama par rapport aux API ?
Ollama est gratuit — vous ne payez que le matériel et l’électricité. Comparez cela aux coûts des API : Claude Sonnet 5 facture 2,00 $ par million de jetons en entrée, donc 10 millions de jetons (environ 7,5 millions de mots) coûtent 20 $. Une configuration auto-hébergée devient rentable très rapidement si vous traitez un volume important. Utilisez le calculateur auto-hébergement vs API calculateur de seuil de rentabilité
Quels modèles fonctionnent le mieux sur les GPU grand public ?
Pour les GPU disposant de 8 à 12 Go de VRAM (RTX 3060, 4060 Ti), Mistral 7B (~4,5 Go en quantification 4 bits), Llama 3.1 8B (~5 Go) et Phi-4 (~9 Go) offrent d’excellents rapports qualité/performance. Si vous disposez de 16 à 24 Go de VRAM (RTX 3090, 4090), Mistral NeMo 12B (~7,5 Go) et même Llama 3.3 70B (~40 Go avec une quantification agressive ou un déchargement partiel) deviennent viables. Consultez Exigences en VRAM selon le modèle le tableau comparatif complet
Ollama peut-il utiliser simultanément des GPU NVIDIA et AMD ?
Non. Ollama utilise soit CUDA (NVIDIA), soit ROCm (AMD), selon ce qu’il détecte en premier, mais il ne peut pas mélanger plusieurs backends GPU au sein d’une même session. Si vous disposez à la fois de GPU NVIDIA et AMD, Ollama privilégie NVIDIA. La prise en charge multi-GPU ne fonctionne que lorsque tous les GPU utilisent la même pile de pilotes — deux cartes NVIDIA ou deux cartes AMD, mais pas une de chaque.
Comment faire pour désinstaller Ollama sur Windows ?
Ouvrez Paramètres → Applications → Applications installées, trouvez Ollama, puis cliquez sur Désinstaller. Cette opération supprime l’application et le service, mais laisse les modèles dans arrêtez et désactivez le service, supprimez. Supprimez ce dossier manuellement pour libérer de l’espace disque. Si le service ne s’arrête pas lors de la désinstallation, ouvrez le Gestionnaire des tâches, repérez OllamaService.exe sous Processus en arrière-plan, terminez-le, puis réessayez.
Étapes suivantes
Après avoir installé Ollama sur Windows, explorez la bibliothèque complète de modèles sur Guide complet d’Ollama pour comprendre comment le choix du modèle, la quantification et la fenêtre de contexte influencent la qualité. Pour les charges de travail en production, calculez les coûts récurrents des API par rapport à l’auto-hébergement à l’aide du Calculateur de coûts d’API calculateur de seuil de rentabilité
