Si vous vous êtes un tant soit peu intéressé à l’IA locale ces deux dernières années, vous avez sûrement entendu parler de cet outil. Ollama est l’outil qui a permis de transformer l’opération consistant à “ exécuter un grand modèle linguistique sur sa propre machine ” — qui prenait auparavant un week-end entier à cause des erreurs CUDA — en une simple commande : Exécuter llama3.3.
Ce guide explique en détail ce qu’est Ollama, comment il fonctionne en coulisses, ce qu’il peut et ne peut pas faire, et s’il s’agit de l’outil qui vous convient en 2026.
Quick answer: What is Ollama and how does it work?
Ollama is a free, open-source tool that downloads, manages, and runs open large language models locally on Mac, Windows, or Linux with a single command — no cloud, no API keys, and no data leaving your machine. Under the hood it wraps the llama.cpp engine (plus Apple’s MLX on Mac since v0.19) and handles model downloads, quantization, and GPU allocation, then exposes a REST API on port 11434 that is OpenAI-compatible at /v1. One command like Exécuter llama3.3 pulls a model and gets you from install to a running model in about two minutes.
- Comment cela fonctionne : wraps
llama.cpp(and Apple MLX on Mac since v0.19) and serves models over a local REST API —http://localhost:11434, OpenAI-compatible at/v1. - How to run a model:
Exécuter llama3.3downloads and starts the model in around two minutes — other picks includegemma4etqwen3. - Hardware needed: the sweet spot is around 16 GB of VRAM or unified memory; budget roughly 0.6 GB of memory per billion parameters at Q4_K_M quantization.
- What it can run: over 100 open models, from ~5 GB 7B models up to ~43 GB 70B models.
- Cost and limits: $0 and MIT-licensed, fully private and offline — but not built for high-concurrency serving, where vLLM is roughly 16–20× faster under load.
Points clés
- Qu’est-ce que c’est ? un outil gratuit et open source qui permet de télécharger, de gérer et d'exécuter localement des modèles de langage (LLM) ouverts à l'aide d'une seule commande — sans cloud, sans clés API et sans que vos données ne quittent votre ordinateur.
- Comment cela fonctionne : il englobe le
llama.cppmoteur (ainsi que le MLX d’Apple sur Mac depuis la version 0.19) et gère le téléchargement des modèles, la quantification, l’allocation des GPU et une API REST sur le port11434. - À qui s'adresse-t-il ? : aux développeurs et aux bricoleurs qui recherchent la solution la plus simple pour créer des prototypes à partir de modèles locaux. C’est le point d’entrée “ le moins regrettable ” en 2026.
- À qui ce produit ne s'adresse pas : service de production à forte concurrence — pour cela, vLLM est environ 16 à 20 fois plus rapide en charge.
- Coût : $0. Il est sous licence MIT et fonctionne entièrement sur votre matériel.
Qu'est-ce qu'Ollama, au juste ?
Ollama est un environnement d'exécution open source pour les grands modèles linguistiques qui fonctionne sur votre propre ordinateur — Mac, Windows ou Linux. Considérez-le comme le “ Docker des grands modèles linguistiques ” : au lieu de vous débattre avec les environnements Python, les poids des modèles et les pilotes GPU, il vous suffit de taper une seule commande pour qu'un modèle se lance.
Le principe est simple : Conservez vos données sur votre ordinateur, ne payez rien par jeton et travaillez hors ligne. Lorsque vous exécutez Lancer gemma4, Ollama télécharge le modèle, le charge dans la mémoire de votre carte graphique (ou dans la mémoire vive de votre ordinateur si vous n’avez pas de carte graphique), puis vous amène directement dans une interface de chat. C’est tout.
Derrière cette simplicité, Ollama effectue un travail considérable pour vous :
- Gestion des modèles — récupérer, gérer les versions et stocker des modèles à partir de son registre, à l'instar d'un gestionnaire de paquets pour les logiciels.
- Quantification — en utilisant automatiquement des versions compressées (GGUF) des modèles, de sorte qu’un modèle comportant 27 milliards de paramètres puisse tenir dans la mémoire d’un appareil grand public.
- Allocation de couches GPU — déterminer quelle partie du modèle sera traitée par votre GPU et quelle partie par votre CPU, en fonction de la quantité de VRAM dont vous disposez.
- Contexte et gestion du cache KV — gérer la mémoire qui augmente à mesure que la conversation s'allonge.
- Une API REST — en dévoilant tout sur
http://localhost:11434pour que vos propres applications puissent communiquer avec lui.
Comment ça marche en coulisses
Ollama n'est pas en soi un moteur d'inférence. C'est un couche d'expérience enveloppé autour de l'un d'entre eux. Sous le capot, il utilise llama.cpp, le moteur C++ qui se charge des calculs proprement dits pour exécuter efficacement un modèle quantifié sur les processeurs et les cartes graphiques. Depuis la version 0.19 (mars 2026), Ollama utilise également Le backend MLX d'Apple sur Apple Silicon — une évolution qui a permis d'énormes gains de vitesse (sur un M5 Max exécutant Qwen 3.5, le débit de décodage a presque doublé).
Le déroulement des opérations se présente comme suit :
- Vous exécutez une commande —
ollama run qwen3depuis le terminal, ou via une requête à l'API. - Ollama résout le modèle — s'il n'est pas déjà téléchargé, il récupère les coefficients de pondération GGUF à partir du registre.
- Cela charge le modèle en mémoire — répartition des couches entre le GPU et le CPU en fonction de la mémoire VRAM disponible.
- Il fournit des réponses — soit de manière interactive dans votre terminal, soit au format JSON via l'API REST.
Cette API REST est ce qui intéresse le plus les développeurs. Toute application capable d'effectuer une requête HTTP peut utiliser un modèle local via Ollama — et comme Ollama a ajouté un point de terminaison compatible avec OpenAI, une grande partie du code existant fonctionne simplement en modifiant l'URL de base.
Ce que vous pouvez créer avec cet outil
En 2026, Ollama est le moteur d'une vaste gamme de projets d'IA locale :
- Chatbots privés qui n'envoient jamais aucune donnée vers le cloud.
- Assistants en programmation — le plus récent
ollama launchcommand permet de connecter des outils tels que Claude Code, OpenCode, et Codex vers un modèle local ou dans le cloud, sans fichiers de configuration. - Systèmes RAG en utilisant l'API d'intégration par lots d'Ollama pour indexer vos propres documents.
- Agents et automatisations qui font appel à des modèles locaux pour la classification, l'extraction ou la synthèse, sans aucun coût marginal.
- Pipelines à sortie structurée — Ollama permet désormais de contraindre la sortie d'un modèle à un schéma JSON, ce qui garantit sa fiabilité pour une utilisation programmatique.
La place d'Ollama parmi les autres solutions
Ollama n'est pas la seule solution pour exécuter des modèles en local, et ce n'est pas toujours la meilleure. Voici un aperçu honnête de la situation :
| Outil | Idéal pour | Compromis |
|---|---|---|
| Ollama | Prototypage par un seul développeur sur n'importe quel système d'exploitation | Lente en cas de forte charge simultanée |
| LM Studio | Une interface graphique soignée permettant de parcourir les profils des modèles et de discuter avec elles | Moins adaptable aux scripts ; priorité au bureau |
| vLLM | Service de production multi-utilisateurs sur GPU | Configuration complexe ; pas axée sur le local |
| llama.cpp | Vitesse maximale et matériel embarqué/en périphérie | Niveau le plus bas ; à monter soi-même |
Si vous êtes seul à tester la plateforme, Ollama l'emporte haut la main en termes de praticité. Dès que vous aurez besoin de prendre en charge plusieurs utilisateurs à la fois, vous aurez tout intérêt à consulter notre analyse détaillée de Ollama contre LM Studio contre vLLM contre llama.cpp.
Commencez en deux minutes
La barrière à l'entrée est vraiment minime :
- Installez-le — téléchargez l'application adaptée à votre système d'exploitation (voir notre Guide d’installation pas à pas).
- Télécharger et exécuter un modèle —
Lancer gemma4si vous recherchez un modèle polyvalent et performant, ouollama run qwen3pour la programmation. - Parle-lui — discutez dans le terminal, ou accédez à l'application via
http://localhost:11434.
Avant de choisir un modèle, vérifiez que votre appareil est compatible — consultez notre guide pour Exigences système d’Ollama adapte la taille des modèles à la mémoire vive (RAM) et à la mémoire vidéo (VRAM) dont vous avez réellement besoin.
De quel matériel avez-vous réellement besoin ?
Ollama fonctionnera sur pratiquement n’importe quelle machine dotée d’un processeur et de 8 Go de RAM, mais “ démarrer ” et “ être utilisable ” sont deux choses différentes. Le facteur déterminant pour votre expérience est la quantité de mémoire disponible pour le modèle, car celui-ci doit tenir entièrement dans la RAM (ou, idéalement, dans la VRAM du GPU) pendant son exécution. Une règle empirique fiable est d'environ 0,6 Go de mémoire par milliard de paramètres avec la quantification par défaut Q4_K_M, plus une petite marge pour le contexte.
Ces calculs vous donnent un guide rapide pour choisir la taille adaptée aux catégories de modèles les plus courantes :
| Classe de modèle | Téléchargement approx. (Q4_K_M) | Un souvenir agréable |
|---|---|---|
| 7–8B (Llama 3.x, Mistral) | environ 5 Go | 8 Go ou plus |
| 13–14B (Qwen, Phi) | environ 9 Go | 16 Go et plus |
| 32 milliards | environ 20 Go | 24 Go et plus |
| 70B (Llama 3.3) | environ 43 Go | 64 Go et plus |
Pour la plupart des gens, la solution idéale est une carte graphique ou un Mac doté d'environ 16 Go de VRAM ou de mémoire unifiée — suffisamment pour faire tourner des modèles de 7B à 14B à une vitesse qui semble instantanée. Une carte graphique de type RTX de 16 Go ou un Mac équipé d’Apple Silicon de 16 Go s’inscrivent tous deux parfaitement dans cette catégorie.
Deux aspects architecturaux sont à prendre en compte lors de votre choix. Un GPU NVIDIA discret s’impose sans conteste dès lors que le modèle tient dans sa mémoire vidéo (VRAM), offrant ainsi le débit le plus élevé en tokens par seconde. Quant à l’Apple Silicon, la mémoire unifiée C'est l'inverse : il partage toute la mémoire vive du système avec le GPU. Ainsi, un Mac de 64 Go ou 128 Go peut exécuter des modèles de 32B à 70B qui ne peuvent tout simplement pas être chargés sur une carte graphique grand public — mais avec un débit moindre. Le seuil se situe aux alentours du modèle de 24 Go.
Toi peut Exécuter Ollama sans aucun GPU. Un processeur multicœur moderne traite un modèle de 7 milliards de paramètres à une vitesse acceptable de quelques tokens à une dizaine de tokens par seconde, mais les grands modèles de 70 milliards de paramètres traités sur le processeur descendent en dessous d’un token par seconde — ce qui convient pour les tâches par lots exécutées pendant la nuit, mais s’avère pénible pour le chat. Si la vitesse interactive est importante, l’accélération par GPU ou Apple Silicon est le facteur décisif.
FAQ
Ollama est-il gratuit ?
Oui. Ollama est un logiciel libre sous licence MIT et entièrement gratuit. Le seul “ coût ” correspond au matériel sur lequel vous l'exécutez et à l'électricité qu'il consomme — il n'y a pas de frais par jeton, car aucune donnée n'est transmise à un fournisseur de services cloud.
Ollama transmet-il mes données à des tiers ?
Non. De par sa conception, l'inférence s'effectue entièrement sur votre machine. Le seul trafic réseau concerne le téléchargement d'un modèle lors de sa première utilisation. C'est la principale raison pour laquelle les équipes des secteurs de la santé, du droit et de la finance l'utilisent : les invites sensibles ne quittent jamais les locaux.
Ai-je besoin d'un GPU pour faire fonctionner Ollama ?
Non, mais cela aide beaucoup. Ollama fonctionne uniquement avec le processeur pour les petits modèles (un modèle de 2 à 3 milliards de paramètres fonctionne sans problème sur un ordinateur portable récent) et utilise automatiquement votre carte graphique lorsqu’elle est disponible. Pour les modèles de plus de 13 milliards de paramètres environ, une carte graphique ou un processeur Apple Silicon doté d’une mémoire unifiée fait une grande différence. Consultez notre guide des exigences système pour plus de détails.
Quels modèles Ollama peut-il exécuter ?
Plus de 100 modèles ouverts, dont Llama 3.3 et Llama 4 de Meta, Gemma 4 de Google, la série Qwen 3 d'Alibaba, DeepSeek V3 et R1, Mistral et Phi-4 de Microsoft. Notre sélection parmi les Meilleurs modèles de langage volumineux locaux compatibles avec Ollama indique quelle méthode utiliser pour chaque tâche.
Ollama est-il meilleur que ChatGPT ?
Des outils différents. ChatGPT vous offre un modèle de pointe ne nécessitant aucune configuration, mais envoie vos données dans le cloud et facture un abonnement. Ollama exécute localement des modèles ouverts plus légers, gratuitement et en toute confidentialité, mais même le meilleur modèle local reste à la traîne par rapport aux meilleurs modèles du cloud sur les tâches les plus complexes. En matière de confidentialité, de coût et d’utilisation hors ligne, Ollama l’emporte ; en termes de capacités brutes pour le raisonnement complexe, la technologie de pointe du cloud reste en tête.
Qu'est-ce que le port de l'API Ollama ?
Ollama met à disposition son API REST sur http://localhost:11434 par défaut. Il propose également un point de terminaison compatible avec OpenAI, ce qui permet à une grande partie du code existant du SDK OpenAI de fonctionner simplement en redirigeant l'URL de base vers votre instance locale d'Ollama.
Ollama peut-il remplacer l'API OpenAI dans mon application actuelle ?
Pour la plupart des applications, oui. Ollama met à disposition un point de terminaison compatible avec OpenAI à l'adresse http://localhost:11434/v1, y compris le /v1/chat/completions route que la plupart des outils appellent. Configurez votre client OpenAI pour qu’il pointe vers base_url Pour ce faire, transmettez n'importe quelle clé API de remplacement et définissez le champ « model » sur une balise Ollama installée. Les embeddings, la vision par ordinateur et l'appel d'outils sont également pris en charge ; de nombreux projets peuvent ainsi effectuer la migration en modifiant simplement deux lignes de code. Cette solution couvre certaines parties de l'API OpenAI plutôt que l'ensemble des paramètres ; veillez donc à vérifier les champs peu courants dont dépend votre application.
Puis-je exécuter Ollama sans GPU ?
Oui. Ollama fonctionne entièrement sur le processeur (CPU) lorsqu’aucune carte graphique (GPU) compatible n’est disponible — il suffit simplement de disposer d’une mémoire vive (RAM) suffisante pour stocker le modèle. Un processeur multicœur actuel permet d’exécuter un modèle de 7 milliards de paramètres à des vitesses acceptables, mais le débit chute fortement à mesure que la taille des modèles augmente, et les modèles de l’ordre de 70 milliards de paramètres sont trop lents pour une utilisation interactive sur un processeur. Pour les conversations quotidiennes, un GPU ou un Mac équipé d’Apple Silicon fait toute la différence entre une expérience lente et une expérience fluide.
Combien d'espace disque les modèles Ollama occupent-ils, et où sont-ils stockés ?
Prévoyez suffisamment d'espace pour les tailles de téléchargement indiquées ci-dessus : un modèle de 7B occupe environ 5 Go sur le disque, un modèle de 70B environ 43 Go, et le téléchargement de plusieurs modèles peut rapidement faire grimper l'espace nécessaire. Par défaut, ils se trouvent dans le répertoire ~/.ollama/models (ou C:Utilisateurs.ollamamodels sous Windows). Vous pouvez déplacer ce répertoire à l'aide de la commande OLLAMA_MODELS variable d'environnement, puis supprimez tout ce dont vous n'avez plus besoin à l'aide de ollama rm.
Conclusion
Ollama s’est imposé sur le marché des LLM locaux en 2026 en excellant dans un domaine précis : éliminer les obstacles. Gratuit et confidentiel, il fonctionne sur le matériel dont vous disposez déjà et vous permet de passer de “ Je veux essayer un modèle local ” à un modèle opérationnel en environ deux minutes. Ce n’est pas l’option la plus rapide en cas de charge importante, et un modèle local ne surpassera pas les meilleures solutions cloud sur les problèmes les plus complexes — mais en tant que point d’entrée vers l’IA locale, aucune autre solution ne lui arrive à la cheville. Si vous débutez, commencez par là.

