{"id":2485,"date":"2026-08-30T20:13:51","date_gmt":"2026-08-30T20:13:51","guid":{"rendered":"https:\/\/convly.ai\/?p=2485"},"modified":"2026-08-30T20:13:51","modified_gmt":"2026-08-30T20:13:51","slug":"ollama-local-ai","status":"publish","type":"post","link":"https:\/\/convly.ai\/fr\/ollama-local-ai\/","title":{"rendered":"Ollama Local AI : guide complet d\u2019installation et exigences relatives aux mod\u00e8les"},"content":{"rendered":"<div class=\"convly-tldr\"><strong>En bref<\/strong><\/p>\n<ul>\n<li>Ollama vous permet d\u2019ex\u00e9cuter localement des mod\u00e8les d\u2019intelligence artificielle tels que Llama, Mistral et Gemma via un seul outil en ligne de commande<\/li>\n<li>Installation en quelques secondes : <code>curl https:\/\/ollama.com\/install.sh | sh<\/code> (Linux\/macOS) ou t\u00e9l\u00e9chargez l\u2019installeur Windows<\/li>\n<li>Les mod\u00e8les grand public n\u00e9cessitent 4 \u00e0 8 Go de VRAM ; les mod\u00e8les professionnels de 70B n\u00e9cessitent environ 40 Go de VRAM en quantification 4 bits<\/li>\n<li>Seuil de rentabilit\u00e9 par rapport aux API cloud : environ 500 000 jetons\/mois pour un mod\u00e8le de 70B, moins pour des mod\u00e8les plus petits<\/li>\n<\/ul>\n<\/div>\n<p>Ollama is a command-line tool that packages AI language models into containers you can run on your own hardware. Instead of sending prompts to OpenAI, Anthropic, or Google and paying per token, you download a model once\u2014Llama 3.3 70B, Mistral 7B, Phi-4, or any of <a href=\"https:\/\/convly.ai\/fr\/ollama-models-list-2026\/\">dizaines de mod\u00e8les pris en charge<\/a>\u2014 et l\u2019inf\u00e9rence s\u2019ex\u00e9cute enti\u00e8rement sur votre GPU ou CPU. Vous conservez vos donn\u00e9es en local, vous ne payez rien par requ\u00eate apr\u00e8s le co\u00fbt initial du mat\u00e9riel, et vous gardez un contr\u00f4le total sur le comportement du mod\u00e8le ainsi que sa disponibilit\u00e9.<\/p>\n<p>L\u2019inconv\u00e9nient r\u00e9side dans les ressources mat\u00e9rielles : vous devez disposer de suffisamment de VRAM pour h\u00e9berger le mod\u00e8le. Un mod\u00e8le de 7 milliards de param\u00e8tres (7B) quantifi\u00e9 en 4 bits n\u00e9cessite environ 4 \u00e0 5 Go de m\u00e9moire GPU, ce qui convient \u00e0 une carte grand public comme la RTX 4060. Un mod\u00e8le de 70B n\u00e9cessite environ 40 Go en quantification 4 bits, ce qui exige une carte haut de gamme comme la RTX 6000 Ada ou une configuration multi-GPU. Le <a href=\"https:\/\/convly.ai\/fr\/llm-vram-calculator\/\">Calculateur de VRAM<\/a> indique les exigences pr\u00e9cises pour toute taille de mod\u00e8le et tout niveau de quantification.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_86 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a94c1d8b0b98\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Basculer<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a94c1d8b0b98\"  aria-label=\"Basculer\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/fr\/ollama-local-ai\/#Installing_Ollama\" >Installation d\u2019Ollama<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/fr\/ollama-local-ai\/#Running_Your_First_Model\" >Ex\u00e9cution de votre premier mod\u00e8le<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/fr\/ollama-local-ai\/#Model_Selection_and_VRAM_Requirements\" >S\u00e9lection du mod\u00e8le et exigences en VRAM<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/fr\/ollama-local-ai\/#Common_Commands_and_Configuration\" >Commandes courantes et configuration<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/fr\/ollama-local-ai\/#Hardware_Requirements\" >Exigences mat\u00e9rielles<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/fr\/ollama-local-ai\/#Cost_Comparison_Local_vs_API\" >Comparaison des co\u00fbts : inf\u00e9rence locale contre API<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/fr\/ollama-local-ai\/#Frequently_Asked_Questions\" >Questions fr\u00e9quemment pos\u00e9es<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"Installing_Ollama\"><\/span>Installation d\u2019Ollama<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Linux<\/h3>\n<p>Ex\u00e9cutez le script d\u2019installation officiel, qui d\u00e9tecte automatiquement votre distribution et configure le service <code>ollama<\/code> :<\/p>\n<pre>curl -fsSL https:\/\/ollama.com\/install.sh | sh<\/pre>\n<p>Cette commande installe le binaire dans <code>, puis supprimez<\/code> et enregistre un service systemd. Ce service d\u00e9marre automatiquement et persiste apr\u00e8s chaque red\u00e9marrage. Pour v\u00e9rifier son bon fonctionnement :<\/p>\n<pre>ollama --version<\/pre>\n<p>Si vous \u00eates derri\u00e8re un proxy d\u2019entreprise ou si vous pr\u00e9f\u00e9rez une installation manuelle, t\u00e9l\u00e9chargez directement le binaire depuis les <a href=\"https:\/\/github.com\/ollama\/ollama\/releases\" rel=\"noopener\" target=\"_blank\">versions publi\u00e9es sur GitHub<\/a> et placez-le dans votre dossier <code>PATH<\/code>.<\/p>\n<h3>macOS<\/h3>\n<p>T\u00e9l\u00e9chargez l\u2019 <code>.dmg<\/code> installeur depuis <a href=\"https:\/\/ollama.com\/download\" rel=\"noopener\" target=\"_blank\">ollama.com\/download<\/a>, ouvrez-le, puis faites glisser Ollama vers le dossier Applications. L\u2019application de la barre de menus d\u00e9marre automatiquement le serveur local sur <code>localhost:11434<\/code>. Pour utiliser Ollama depuis le Terminal :<\/p>\n<pre>ollama --version<\/pre>\n<p>macOS users on Apple Silicon (M1\/M2\/M3\/M4) can run models using unified memory instead of discrete VRAM. A Mac Studio with 192 GB unified memory can serve a Llama 4 Maverick (240 GB at 4-bit) by swapping to disk, though inference speed drops significantly when exceeding physical RAM.<\/p>\n<h3>Windows<\/h3>\n<p>T\u00e9l\u00e9chargez l\u2019 <code>OllamaSetup.exe<\/code> installeur depuis <a href=\"https:\/\/ollama.com\/download\" rel=\"noopener\" target=\"_blank\">ollama.com\/download<\/a> et ex\u00e9cutez-le. L\u2019installeur ajoute <code>ollama.exe<\/code> \u00e0 votre variable PATH et d\u00e9marre le service en arri\u00e8re-plan. Ouvrez PowerShell ou l\u2019invite de commandes, puis v\u00e9rifiez le bon fonctionnement avec :<\/p>\n<pre>ollama --version<\/pre>\n<p>Le Windows Subsystem for Linux (WSL2) avec passage direct du GPU est pris en charge : installez Ollama dans votre distribution WSL2 en suivant les instructions Linux, et assurez-vous d\u2019avoir install\u00e9 les pilotes NVIDIA CUDA sur l\u2019h\u00f4te Windows.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Running_Your_First_Model\"><\/span>Ex\u00e9cution de votre premier mod\u00e8le<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>T\u00e9l\u00e9chargez et ex\u00e9cutez Llama 3.1 8B, un mod\u00e8le performant capable de suivre des instructions et n\u00e9cessitant seulement 5 Go de VRAM :<\/p>\n<pre>ollama run llama3.1:8b<\/pre>\n<p>Ollama t\u00e9l\u00e9charge le mod\u00e8le (environ 4,7 Go) vers <code>~\/.ollama\/models<\/code> (Linux\/macOS) ou <code>%USERPROFILE%.ollamamodels<\/code> (Windows), le charge en m\u00e9moire, puis vous place dans une invite interactive. Saisissez un message, appuyez sur Entr\u00e9e, et le mod\u00e8le g\u00e9n\u00e8re une r\u00e9ponse localement. Appuyez sur <code>Ctrl+D<\/code> ou tapez <code>\/bye<\/code> pour quitter.<\/p>\n<p>Pour ex\u00e9cuter un mod\u00e8le en arri\u00e8re-plan et l\u2019interroger via l\u2019API :<\/p>\n<pre>ollama serve<\/pre>\n<p>Cela d\u00e9marre un serveur sur <code>http:\/\/localhost:11434<\/code>. Dans un autre terminal :<\/p>\n<pre>curl http:\/\/localhost:11434\/api\/generate -d '{\n  \"model\": \"llama3.1:8b\",\n  \"prompt\": \"Expliquez le contr\u00f4le de congestion TCP\",\n  \"stream\": false\n}'<\/pre>\n<p>La r\u00e9ponse est renvoy\u00e9e au format JSON, avec la compl\u00e9tion compl\u00e8te dans le champ <code>response<\/code> .<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Model_Selection_and_VRAM_Requirements\"><\/span>S\u00e9lection du mod\u00e8le et exigences en VRAM<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Ollama prend en charge les mod\u00e8les open-weight de Meta, Mistral AI, Microsoft, Google, Alibaba et d\u2019autres \u00e9diteurs. Le tableau ci-dessous pr\u00e9sente des choix populaires ainsi que leur empreinte m\u00e9moire en quantification 4 bits, tir\u00e9e de la base de donn\u00e9es des <a href=\"https:\/\/convly.ai\/fr\/vram-requirements-every-major-llm-2026\/\">exigences en VRAM<\/a>:<\/p>\n<table>\n<thead>\n<tr>\n<th>Mod\u00e8le<\/th>\n<th>Param\u00e8tres<\/th>\n<th>Longueur de contexte<\/th>\n<th>VRAM en 4 bits<\/th>\n<th>Cas d\u2019usage<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Llama 3.1 8B<\/td>\n<td>8B<\/td>\n<td>128 K<\/td>\n<td>~5 Go<\/td>\n<td>Suivi g\u00e9n\u00e9ral des instructions, adapt\u00e9 aux GPU grand public<\/td>\n<\/tr>\n<tr>\n<td>Mistral 7B<\/td>\n<td>7B<\/td>\n<td>32 K<\/td>\n<td>~4,5 Go<\/td>\n<td>Inf\u00e9rence rapide, bonne g\u00e9n\u00e9ration de code<\/td>\n<\/tr>\n<tr>\n<td>Phi-4<\/td>\n<td>14B<\/td>\n<td>16 K<\/td>\n<td>~9 Go<\/td>\n<td>Raisonnement et calculs math\u00e9matiques, efficace pour sa taille<\/td>\n<\/tr>\n<tr>\n<td>Mistral NeMo 12B<\/td>\n<td>12B<\/td>\n<td>128 K<\/td>\n<td>~7,5 Go<\/td>\n<td>T\u00e2ches \u00e0 long contexte, multilingue<\/td>\n<\/tr>\n<tr>\n<td>Qwen3 8B<\/td>\n<td>8B<\/td>\n<td>128 K<\/td>\n<td>~5 Go<\/td>\n<td>Fortement multilingue, comp\u00e9titif face \u00e0 des mod\u00e8les plus volumineux<\/td>\n<\/tr>\n<tr>\n<td>Gemma 3 4B<\/td>\n<td>4 milliards<\/td>\n<td>128 K<\/td>\n<td>~3 Go<\/td>\n<td>Mod\u00e8le le plus petit viable, fonctionne sur des GPU int\u00e9gr\u00e9s<\/td>\n<\/tr>\n<tr>\n<td>Llama 3.3 70B<\/td>\n<td>70B<\/td>\n<td>128 K<\/td>\n<td>~40 Go<\/td>\n<td>Raisonnement de niveau production, \u00e9quivalent \u00e0 la classe GPT-4<\/td>\n<\/tr>\n<tr>\n<td>DeepSeek R1 Distill Llama 70B<\/td>\n<td>70B<\/td>\n<td>128 K<\/td>\n<td>~40 Go<\/td>\n<td>Mod\u00e8le de raisonnement distill\u00e9, performances solides en STEM<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Pour lister tous les mod\u00e8les disponibles sur votre syst\u00e8me :<\/p>\n<pre>ollama list<\/pre>\n<p>Pour supprimer un mod\u00e8le et lib\u00e9rer de l\u2019espace disque :<\/p>\n<pre>ollama rm llama3.1:8b<\/pre>\n<p>Les \u00e9tiquettes des mod\u00e8les suivent le format <code>nom:taille<\/code> ou <code>nom:version<\/code>. Si l\u2019\u00e9tiquette est omise, elle prend par d\u00e9faut la valeur <code>:latest<\/code>. Consultez le catalogue complet \u00e0 l\u2019adresse <a href=\"https:\/\/convly.ai\/fr\/best-local-llms-to-run-on-ollama-2026\/\">les meilleurs LLM locaux pour Ollama<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Common_Commands_and_Configuration\"><\/span>Commandes courantes et configuration<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Ex\u00e9cutez un mod\u00e8le avec des param\u00e8tres personnalis\u00e9s :<\/p>\n<pre>ollama run llama3.1:8b --temperature 0.7 --top-p 0.9<\/pre>\n<p>Transmettez directement une instruction sans entrer en mode interactif :<\/p>\n<pre>ollama run llama3.1:8b \"\u00c9crivez une fonction Python pour analyser les dates au format ISO 8601\"<\/pre>\n<p>Chargez un mod\u00e8le en m\u00e9moire sans afficher d\u2019invite (utile pour le pr\u00e9chauffage avant de traiter des requ\u00eates) :<\/p>\n<pre>ollama pull llama3.1:8b<\/pre>\n<p>V\u00e9rifiez quels mod\u00e8les sont actuellement charg\u00e9s dans la VRAM :<\/p>\n<pre>ollama ps<\/pre>\n<p>D\u00e9finissez le nombre de couches GPU \u00e0 d\u00e9charger (utile pour un d\u00e9chargement partiel sur GPU lorsque la VRAM est limit\u00e9e) :<\/p>\n<pre>OLLAMA_NUM_GPU=35 ollama run llama3.3:70b<\/pre>\n<p>Par d\u00e9faut, Ollama d\u00e9charge toutes les couches sur le GPU. R\u00e9duire la valeur de <code>OLLAMA_NUM_GPU<\/code> conserve certaines couches sur le CPU, au prix d\u2019une baisse de performance en \u00e9change d\u2019une consommation moindre de VRAM. Un mod\u00e8le de 70 milliards de param\u00e8tres avec 20 couches sur GPU pourrait n\u00e9cessiter seulement 20 Go de VRAM, mais s\u2019ex\u00e9cuterait 3 \u00e0 5 fois plus lentement.<\/p>\n<p>Pour modifier le r\u00e9pertoire de stockage des mod\u00e8les, d\u00e9finissez la variable <code>OLLAMA_MODELS<\/code> avant de lancer la commande :<\/p>\n<pre>export OLLAMA_MODELS=\/mnt\/nvme\/ollama_models\nollama pull llama3.1:8b<\/pre>\n<p>Ollama utilise des fichiers mapp\u00e9s en m\u00e9moire, ce qui permet aux mod\u00e8les de se charger plus rapidement depuis un disque NVMe que depuis un SSD SATA. Comptez environ 10 \u00e0 15 secondes pour charger un mod\u00e8le de 8 milliards de param\u00e8tres sur un syst\u00e8me moderne, et 60 \u00e0 90 secondes pour un mod\u00e8le de 70 milliards.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Hardware_Requirements\"><\/span>Exigences mat\u00e9rielles<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Le facteur limitant est la VRAM, pas la puissance de calcul. Un mod\u00e8le de 70 milliards de param\u00e8tres quantifi\u00e9 en 4 bits n\u00e9cessite 40 Go de m\u00e9moire GPU, mais fonctionne correctement sur des architectures pr\u00e9c\u00e9dentes. Une RTX 3090 (24 Go) peut servir deux mod\u00e8les de 8 milliards ou un mod\u00e8le de 30 milliards. Une RTX 4090 (24 Go) g\u00e8re la m\u00eame charge avec un d\u00e9bit 30 \u00e0 40 % sup\u00e9rieur gr\u00e2ce aux c\u0153urs tensoriels am\u00e9lior\u00e9s d\u2019Ada Lovelace.<\/p>\n<p>GPU recommand\u00e9s selon le budget :<\/p>\n<ul>\n<li><strong>Entr\u00e9e de gamme (300\u2013500 $) :<\/strong> RTX 4060 Ti 16 Go, capable de faire tourner des mod\u00e8les de 8 et 12 milliards de param\u00e8tres<\/li>\n<li><strong>Grand public \/ Prosumer (1 000\u20131 500 $) :<\/strong> RTX 4090 ou A4000 Ada, ex\u00e9cutent confortablement des mod\u00e8les de 30 milliards de param\u00e8tres<\/li>\n<li><strong>Poste de travail (4 000\u20137 000 $) :<\/strong> RTX 6000 Ada (48 Go) ou double RTX 4090 pour les mod\u00e8les de 70 milliards de param\u00e8tres<\/li>\n<li><strong>Service multi-mod\u00e8les (\u00e0 partir de 10 000 $) :<\/strong> A100 80 Go ou H100 80 Go pour ex\u00e9cuter plusieurs instances de mod\u00e8les de 70 milliards de param\u00e8tres<\/li>\n<\/ul>\n<p>Consultez le <a href=\"https:\/\/convly.ai\/fr\/best-gpus-for-local-llms-2026\/\">Guide d\u2019achat de GPU<\/a> pour des comparaisons d\u00e9taill\u00e9es. Les utilisateurs d\u2019Apple Silicon profitent de la m\u00e9moire unifi\u00e9e : un M2 Ultra dot\u00e9 de 192 Go peut ex\u00e9cuter des mod\u00e8les qui exigeraient autrement une configuration NVIDIA co\u00fbtant 25 000 $, bien que le d\u00e9bit de jetons soit 2 \u00e0 3 fois inf\u00e9rieur \u00e0 celui d\u2019un A100.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Cost_Comparison_Local_vs_API\"><\/span>Comparaison des co\u00fbts : inf\u00e9rence locale contre API<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Les API cloud facturent par jeton. <a href=\"https:\/\/convly.ai\/fr\/models\/\">Claude Sonnet 5<\/a> co\u00fbte 2,00 $ par million de jetons d\u2019entr\u00e9e et 10,00 $ par million de jetons de sortie. Une session typique d\u2019assistant de programmation g\u00e9n\u00e8re 500 000 jetons par mois (250 000 en entr\u00e9e, 250 000 en sortie), soit un co\u00fbt annuel de 3 000 $.<\/p>\n<p>Un mod\u00e8le Llama 3.3 de 70 milliards de param\u00e8tres auto-h\u00e9berg\u00e9 sur une station de travail de 6 000 $ (RTX 6000 Ada) n\u2019entra\u00eene aucun co\u00fbt marginal apr\u00e8s l\u2019achat du mat\u00e9riel. Le seuil de rentabilit\u00e9 est d\u2019environ 500 000 jetons par mois. En dessous de ce seuil, les API sont moins co\u00fbteuses ; au-dessus, l\u2019inf\u00e9rence locale devient avantageuse. Utilisez le <a href=\"https:\/\/convly.ai\/fr\/self-hosting-vs-api-calculator\/\">calculatrice d\u2019auto-h\u00e9bergement<\/a> pour mod\u00e9liser pr\u00e9cis\u00e9ment votre charge de travail.<\/p>\n<p>Les mod\u00e8les plus petits atteignent ce seuil plus rapidement. Un mod\u00e8le de 8 milliards de param\u00e8tres sur une RTX 4060 Ti \u00e0 500 $ devient rentable en 3 \u00e0 4 mois par rapport aux API cloud, pour une utilisation mod\u00e9r\u00e9e (100 000 jetons\/mois). L\u2019avantage suppl\u00e9mentaire est la confidentialit\u00e9 : votre code, vos documents et vos donn\u00e9es internes ne quittent jamais votre r\u00e9seau.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_Asked_Questions\"><\/span>Questions fr\u00e9quemment pos\u00e9es<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Ollama peut-il ex\u00e9cuter des mod\u00e8les sur CPU uniquement ?<\/h3>\n<p>Oui, mais l\u2019inf\u00e9rence est 10 \u00e0 50 fois plus lente, selon la taille du mod\u00e8le. Un mod\u00e8le de 8 milliards de param\u00e8tres g\u00e9n\u00e8re 1 \u00e0 3 jetons par seconde sur un processeur Ryzen ou Intel moderne, contre 40 \u00e0 80 jetons\/seconde sur une RTX 4090. D\u00e9finissez <code>OLLAMA_NUM_GPU=0<\/code> pour forcer le mode CPU uniquement. Cela convient aux traitements par lots ou aux usages peu sollicit\u00e9s, mais est inutilisable pour les conversations interactives.<\/p>\n<h3>Comment la quantification affecte-t-elle la qualit\u00e9 ?<\/h3>\n<p>La quantification en 4 bits r\u00e9duit la taille du mod\u00e8le de 75 % avec une perte minimale de qualit\u00e9 \u2014 les benchmarks montrent une baisse de pr\u00e9cision de 1 \u00e0 3 % sur MMLU et HumanEval par rapport \u00e0 la pr\u00e9cision FP16. La quantification en 3 bits (Q3) r\u00e9duit davantage la taille, mais d\u00e9grade nettement les capacit\u00e9s de raisonnement et de suivi des instructions. Ollama utilise par d\u00e9faut Q4_0, qui offre un bon compromis entre qualit\u00e9 et consommation de VRAM. Vous pouvez t\u00e9l\u00e9charger des versions en 8 bits ou FP16 en sp\u00e9cifiant des \u00e9tiquettes telles que <code>llama3.1:8b-q8_0<\/code>, ce qui double les besoins en VRAM.<\/p>\n<h3>Puis-je affiner des mod\u00e8les avec Ollama ?<\/h3>\n<p>Non. Ollama est un moteur d\u2019inf\u00e9rence, pas un cadre d\u2019entra\u00eenement. Pour affiner un mod\u00e8le, utilisez des outils tels que Hugging Face Transformers, Axolotl ou LLaMA Factory, exportez le r\u00e9sultat au format GGUF, puis importez-le dans Ollama via un fichier Modelfile. Ce processus est document\u00e9 dans le d\u00e9p\u00f4t GitHub d\u2019Ollama, sous <code>docs\/import.md<\/code>.<\/p>\n<h3>Quelle est l\u2019API Ollama et comment l\u2019utiliser ?<\/h3>\n<p>Ollama expose une API REST compatible OpenAI sur <code>localhost:11434<\/code>. Le bloc <code>\/api\/generate<\/code> le point de terminaison g\u00e8re les compl\u00e9tions, et <code>\/api\/chat<\/code> prend en charge les conversations multi-tours avec historique des messages. Vous pouvez l\u2019int\u00e9grer \u00e0 vos bases de code existantes en rempla\u00e7ant simplement l\u2019URL de base : au lieu de <code>https:\/\/api.openai.com\/v1<\/code>, point your client to <code>http:\/\/localhost:11434<\/code>, configurez votre client pour qu\u2019il pointe vers<\/p>\n<h3>Combien de requ\u00eates par seconde Ollama peut-il traiter ?<\/h3>\n<p>Un mod\u00e8le charg\u00e9 traite une seule requ\u00eate \u00e0 la fois. Le d\u00e9bit d\u00e9pend de la taille du mod\u00e8le et des ressources mat\u00e9rielles : une carte RTX 4090 g\u00e9n\u00e8re 60 \u00e0 80 jetons\/seconde pour un mod\u00e8le de 8 milliards de param\u00e8tres (8B), et 15 \u00e0 25 jetons\/seconde pour un mod\u00e8le de 70 milliards de param\u00e8tres (70B). Pour g\u00e9rer plusieurs utilisateurs simultan\u00e9ment, vous pouvez soit effectuer une mont\u00e9e en puissance horizontale (plusieurs machines), soit impl\u00e9menter le regroupement (batching) au niveau de l\u2019application. Ollama ne dispose pas de file d\u2019attente int\u00e9gr\u00e9e pour les requ\u00eates ; vous devez donc utiliser un proxy inverse tel que NGINX ou un \u00e9quilibreur de charge.<\/p>\n<h3>Puis-je ex\u00e9cuter plusieurs mod\u00e8les simultan\u00e9ment ?<\/h3>\n<p>Oui, \u00e0 condition de disposer de suffisamment de VRAM. Chargez un deuxi\u00e8me mod\u00e8le avec la commande <code>ollama run<\/code> dans un nouveau terminal pendant que le premier est en cours d\u2019ex\u00e9cution. Ollama partage le GPU entre les mod\u00e8les. Deux mod\u00e8les de 8 milliards de param\u00e8tres (10 Go au total) tournent confortablement sur une RTX 4090 de 24 Go. Le basculement entre mod\u00e8les est quasi instantan\u00e9 si les deux sont d\u00e9j\u00e0 charg\u00e9s ; sinon, comptez 10 \u00e0 90 secondes pour le chargement, selon la taille des mod\u00e8les.<\/p>","protected":false},"excerpt":{"rendered":"<p>TL;DROllama lets you run AI models like Llama, Mistral, and Gemma locally via a single command-line tool Install in seconds: [\u2026]<\/p>\n","protected":false},"author":1,"featured_media":2486,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2485","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts\/2485","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/comments?post=2485"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts\/2485\/revisions"}],"predecessor-version":[{"id":2487,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts\/2485\/revisions\/2487"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/media\/2486"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/media?parent=2485"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/categories?post=2485"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/tags?post=2485"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}