- Ollama vous permet d’exécuter localement des modèles d’intelligence artificielle tels que Llama, Mistral et Gemma via un seul outil en ligne de commande
- Installation en quelques secondes :
curl https://ollama.com/install.sh | sh(Linux/macOS) ou téléchargez l’installeur Windows - Les modèles grand public nécessitent 4 à 8 Go de VRAM ; les modèles professionnels de 70B nécessitent environ 40 Go de VRAM en quantification 4 bits
- Seuil de rentabilité par rapport aux API cloud : environ 500 000 jetons/mois pour un modèle de 70B, moins pour des modèles plus petits
Ollama est un outil en ligne de commande qui empaquette des modèles de langage IA sous forme de conteneurs exécutables sur votre propre matériel. Plutôt que d’envoyer vos prompts à OpenAI, Anthropic ou Google et de payer à l’usage, vous téléchargez un modèle une seule fois —Llama 3.3 70B, Mistral 7B, Phi-4, ou n’importe lequel des dizaines de modèles pris en charge— et l’inférence s’exécute entièrement sur votre GPU ou CPU. Vous conservez vos données en local, vous ne payez rien par requête après le coût initial du matériel, et vous gardez un contrôle total sur le comportement du modèle ainsi que sa disponibilité.
L’inconvénient réside dans les ressources matérielles : vous devez disposer de suffisamment de VRAM pour héberger le modèle. Un modèle de 7 milliards de paramètres (7B) quantifié en 4 bits nécessite environ 4 à 5 Go de mémoire GPU, ce qui convient à une carte grand public comme la RTX 4060. Un modèle de 70B nécessite environ 40 Go en quantification 4 bits, ce qui exige une carte haut de gamme comme la RTX 6000 Ada ou une configuration multi-GPU. Le Calculateur de VRAM indique les exigences précises pour toute taille de modèle et tout niveau de quantification.
Installation d’Ollama
Linux
Exécutez le script d’installation officiel, qui détecte automatiquement votre distribution et configure le service ollama :
curl -fsSL https://ollama.com/install.sh | sh
Cette commande installe le binaire dans , puis supprimez et enregistre un service systemd. Ce service démarre automatiquement et persiste après chaque redémarrage. Pour vérifier son bon fonctionnement :
ollama --version
Si vous êtes derrière un proxy d’entreprise ou si vous préférez une installation manuelle, téléchargez directement le binaire depuis les versions publiées sur GitHub et placez-le dans votre dossier PATH.
macOS
Téléchargez l’ .dmg installeur depuis ollama.com/download, ouvrez-le, puis faites glisser Ollama vers le dossier Applications. L’application de la barre de menus démarre automatiquement le serveur local sur localhost:11434. Pour utiliser Ollama depuis le Terminal :
ollama --version
Les utilisateurs macOS équipés de puces Apple Silicon (M1/M2/M3/M4) peuvent exécuter des modèles en tirant parti de la mémoire unifiée plutôt que d’une VRAM dédiée. Un Mac Studio doté de 192 Go de mémoire unifiée peut servir un modèle Llama 4 Maverick (240 Go en quantification 4 bits) en recourant à l’échange sur disque (swap), bien que la vitesse d’inférence diminue fortement dès lors que la mémoire physique est dépassée.
Windows
Téléchargez l’ OllamaSetup.exe installeur depuis ollama.com/download et exécutez-le. L’installeur ajoute ollama.exe à votre variable PATH et démarre le service en arrière-plan. Ouvrez PowerShell ou l’invite de commandes, puis vérifiez le bon fonctionnement avec :
ollama --version
Le Windows Subsystem for Linux (WSL2) avec passage direct du GPU est pris en charge : installez Ollama dans votre distribution WSL2 en suivant les instructions Linux, et assurez-vous d’avoir installé les pilotes NVIDIA CUDA sur l’hôte Windows.
Exécution de votre premier modèle
Téléchargez et exécutez Llama 3.1 8B, un modèle performant capable de suivre des instructions et nécessitant seulement 5 Go de VRAM :
ollama run llama3.1:8b
Ollama télécharge le modèle (environ 4,7 Go) vers ~/.ollama/models (Linux/macOS) ou %USERPROFILE%.ollamamodels (Windows), le charge en mémoire, puis vous place dans une invite interactive. Saisissez un message, appuyez sur Entrée, et le modèle génère une réponse localement. Appuyez sur Ctrl+D ou tapez /bye pour quitter.
Pour exécuter un modèle en arrière-plan et l’interroger via l’API :
ollama serve
Cela démarre un serveur sur http://localhost:11434. Dans un autre terminal :
curl http://localhost:11434/api/generate -d '{
"model": "llama3.1:8b",
"prompt": "Expliquez le contrôle de congestion TCP",
"stream": false
}'
La réponse est renvoyée au format JSON, avec la complétion complète dans le champ response .
Sélection du modèle et exigences en VRAM
Ollama prend en charge les modèles open-weight de Meta, Mistral AI, Microsoft, Google, Alibaba et d’autres éditeurs. Le tableau ci-dessous présente des choix populaires ainsi que leur empreinte mémoire en quantification 4 bits, tirée de la base de données des exigences en VRAM:
| Modèle | Paramètres | Longueur de contexte | VRAM en 4 bits | Cas d’usage |
|---|---|---|---|---|
| Llama 3.1 8B | 8B | 128 K | ~5 Go | Suivi général des instructions, adapté aux GPU grand public |
| Mistral 7B | 7B | 32 K | ~4,5 Go | Inférence rapide, bonne génération de code |
| Phi-4 | 14B | 16 K | ~9 Go | Raisonnement et calculs mathématiques, efficace pour sa taille |
| Mistral NeMo 12B | 12B | 128 K | ~7,5 Go | Tâches à long contexte, multilingue |
| Qwen3 8B | 8B | 128 K | ~5 Go | Fortement multilingue, compétitif face à des modèles plus volumineux |
| Gemma 3 4B | 4 milliards | 128 K | ~3 Go | Modèle le plus petit viable, fonctionne sur des GPU intégrés |
| Llama 3.3 70B | 70B | 128 K | ~40 Go | Raisonnement de niveau production, équivalent à la classe GPT-4 |
| DeepSeek R1 Distill Llama 70B | 70B | 128 K | ~40 Go | Modèle de raisonnement distillé, performances solides en STEM |
Pour lister tous les modèles disponibles sur votre système :
ollama list
Pour supprimer un modèle et libérer de l’espace disque :
ollama rm llama3.1:8b
Les étiquettes des modèles suivent le format nom:taille ou nom:version. Si l’étiquette est omise, elle prend par défaut la valeur :latest. Consultez le catalogue complet à l’adresse les meilleurs LLM locaux pour Ollama.
Commandes courantes et configuration
Exécutez un modèle avec des paramètres personnalisés :
ollama run llama3.1:8b --temperature 0.7 --top-p 0.9
Transmettez directement une instruction sans entrer en mode interactif :
ollama run llama3.1:8b "Écrivez une fonction Python pour analyser les dates au format ISO 8601"
Chargez un modèle en mémoire sans afficher d’invite (utile pour le préchauffage avant de traiter des requêtes) :
ollama pull llama3.1:8b
Vérifiez quels modèles sont actuellement chargés dans la VRAM :
ollama ps
Définissez le nombre de couches GPU à décharger (utile pour un déchargement partiel sur GPU lorsque la VRAM est limitée) :
OLLAMA_NUM_GPU=35 ollama run llama3.3:70b
Par défaut, Ollama décharge toutes les couches sur le GPU. Réduire la valeur de OLLAMA_NUM_GPU conserve certaines couches sur le CPU, au prix d’une baisse de performance en échange d’une consommation moindre de VRAM. Un modèle de 70 milliards de paramètres avec 20 couches sur GPU pourrait nécessiter seulement 20 Go de VRAM, mais s’exécuterait 3 à 5 fois plus lentement.
Pour modifier le répertoire de stockage des modèles, définissez la variable OLLAMA_MODELS avant de lancer la commande :
export OLLAMA_MODELS=/mnt/nvme/ollama_models ollama pull llama3.1:8b
Ollama utilise des fichiers mappés en mémoire, ce qui permet aux modèles de se charger plus rapidement depuis un disque NVMe que depuis un SSD SATA. Comptez environ 10 à 15 secondes pour charger un modèle de 8 milliards de paramètres sur un système moderne, et 60 à 90 secondes pour un modèle de 70 milliards.
Exigences matérielles
Le facteur limitant est la VRAM, pas la puissance de calcul. Un modèle de 70 milliards de paramètres quantifié en 4 bits nécessite 40 Go de mémoire GPU, mais fonctionne correctement sur des architectures précédentes. Une RTX 3090 (24 Go) peut servir deux modèles de 8 milliards ou un modèle de 30 milliards. Une RTX 4090 (24 Go) gère la même charge avec un débit 30 à 40 % supérieur grâce aux cœurs tensoriels améliorés d’Ada Lovelace.
GPU recommandés selon le budget :
- Entrée de gamme (300–500 $) : RTX 4060 Ti 16 Go, capable de faire tourner des modèles de 8 et 12 milliards de paramètres
- Grand public / Prosumer (1 000–1 500 $) : RTX 4090 ou A4000 Ada, exécutent confortablement des modèles de 30 milliards de paramètres
- Poste de travail (4 000–7 000 $) : RTX 6000 Ada (48 Go) ou double RTX 4090 pour les modèles de 70 milliards de paramètres
- Service multi-modèles (à partir de 10 000 $) : A100 80 Go ou H100 80 Go pour exécuter plusieurs instances de modèles de 70 milliards de paramètres
Consultez le Guide d’achat de GPU pour des comparaisons détaillées. Les utilisateurs d’Apple Silicon profitent de la mémoire unifiée : un M2 Ultra doté de 192 Go peut exécuter des modèles qui exigeraient autrement une configuration NVIDIA coûtant 25 000 $, bien que le débit de jetons soit 2 à 3 fois inférieur à celui d’un A100.
Comparaison des coûts : inférence locale contre API
Les API cloud facturent par jeton. Claude Sonnet 5 coûte 2,00 $ par million de jetons d’entrée et 10,00 $ par million de jetons de sortie. Une session typique d’assistant de programmation génère 500 000 jetons par mois (250 000 en entrée, 250 000 en sortie), soit un coût annuel de 3 000 $.
Un modèle Llama 3.3 de 70 milliards de paramètres auto-hébergé sur une station de travail de 6 000 $ (RTX 6000 Ada) n’entraîne aucun coût marginal après l’achat du matériel. Le seuil de rentabilité est d’environ 500 000 jetons par mois. En dessous de ce seuil, les API sont moins coûteuses ; au-dessus, l’inférence locale devient avantageuse. Utilisez le calculatrice d’auto-hébergement pour modéliser précisément votre charge de travail.
Les modèles plus petits atteignent ce seuil plus rapidement. Un modèle de 8 milliards de paramètres sur une RTX 4060 Ti à 500 $ devient rentable en 3 à 4 mois par rapport aux API cloud, pour une utilisation modérée (100 000 jetons/mois). L’avantage supplémentaire est la confidentialité : votre code, vos documents et vos données internes ne quittent jamais votre réseau.
Questions fréquemment posées
Ollama peut-il exécuter des modèles sur CPU uniquement ?
Oui, mais l’inférence est 10 à 50 fois plus lente, selon la taille du modèle. Un modèle de 8 milliards de paramètres génère 1 à 3 jetons par seconde sur un processeur Ryzen ou Intel moderne, contre 40 à 80 jetons/seconde sur une RTX 4090. Définissez OLLAMA_NUM_GPU=0 pour forcer le mode CPU uniquement. Cela convient aux traitements par lots ou aux usages peu sollicités, mais est inutilisable pour les conversations interactives.
Comment la quantification affecte-t-elle la qualité ?
La quantification en 4 bits réduit la taille du modèle de 75 % avec une perte minimale de qualité — les benchmarks montrent une baisse de précision de 1 à 3 % sur MMLU et HumanEval par rapport à la précision FP16. La quantification en 3 bits (Q3) réduit davantage la taille, mais dégrade nettement les capacités de raisonnement et de suivi des instructions. Ollama utilise par défaut Q4_0, qui offre un bon compromis entre qualité et consommation de VRAM. Vous pouvez télécharger des versions en 8 bits ou FP16 en spécifiant des étiquettes telles que llama3.1:8b-q8_0, ce qui double les besoins en VRAM.
Puis-je affiner des modèles avec Ollama ?
Non. Ollama est un moteur d’inférence, pas un cadre d’entraînement. Pour affiner un modèle, utilisez des outils tels que Hugging Face Transformers, Axolotl ou LLaMA Factory, exportez le résultat au format GGUF, puis importez-le dans Ollama via un fichier Modelfile. Ce processus est documenté dans le dépôt GitHub d’Ollama, sous docs/import.md.
Quelle est l’API Ollama et comment l’utiliser ?
Ollama expose une API REST compatible OpenAI sur localhost:11434. Le bloc /api/generate le point de terminaison gère les complétions, et /api/chat prend en charge les conversations multi-tours avec historique des messages. Vous pouvez l’intégrer à vos bases de code existantes en remplaçant simplement l’URL de base : au lieu de https://api.openai.com/v1, point your client to http://localhost:11434, configurez votre client pour qu’il pointe vers
Combien de requêtes par seconde Ollama peut-il traiter ?
Un modèle chargé traite une seule requête à la fois. Le débit dépend de la taille du modèle et des ressources matérielles : une carte RTX 4090 génère 60 à 80 jetons/seconde pour un modèle de 8 milliards de paramètres (8B), et 15 à 25 jetons/seconde pour un modèle de 70 milliards de paramètres (70B). Pour gérer plusieurs utilisateurs simultanément, vous pouvez soit effectuer une montée en puissance horizontale (plusieurs machines), soit implémenter le regroupement (batching) au niveau de l’application. Ollama ne dispose pas de file d’attente intégrée pour les requêtes ; vous devez donc utiliser un proxy inverse tel que NGINX ou un équilibreur de charge.
Puis-je exécuter plusieurs modèles simultanément ?
Oui, à condition de disposer de suffisamment de VRAM. Chargez un deuxième modèle avec la commande ollama run dans un nouveau terminal pendant que le premier est en cours d’exécution. Ollama partage le GPU entre les modèles. Deux modèles de 8 milliards de paramètres (10 Go au total) tournent confortablement sur une RTX 4090 de 24 Go. Le basculement entre modèles est quasi instantané si les deux sont déjà chargés ; sinon, comptez 10 à 90 secondes pour le chargement, selon la taille des modèles.

