{"id":2199,"date":"2026-08-14T06:18:40","date_gmt":"2026-08-14T06:18:40","guid":{"rendered":"https:\/\/convly.ai\/?p=2199"},"modified":"2026-08-14T06:18:40","modified_gmt":"2026-08-14T06:18:40","slug":"ollama-gpt-oss-guide","status":"publish","type":"post","link":"https:\/\/convly.ai\/fr\/ollama-gpt-oss-guide\/","title":{"rendered":"Ollama GPT OSS : ex\u00e9cuter localement des LLM open source (guide)"},"content":{"rendered":"<div class=\"convly-tldr\"><strong>En bref<\/strong><\/p>\n<ul>\n<li>OpenAI n\u2019a pas publi\u00e9 de famille de mod\u00e8les baptis\u00e9e \u00ab GPT-OSS \u00bb. Ce terme de recherche d\u00e9signe tr\u00e8s probablement l\u2019ex\u00e9cution d\u2019alternatives open source (Llama 3, Mistral, Qwen) via Ollama.<\/li>\n<li>Ollama ex\u00e9cute localement des centaines de mod\u00e8les \u00e0 poids ouverts. Voici quelques options populaires : <code>ollama pull llama3.1:8b<\/code>, <code>ollama pull mistral:7b<\/code>, <code>ollama pull qwen2.5:7b<\/code>.<\/li>\n<li>Exigences en VRAM : les mod\u00e8les de 7 milliards de param\u00e8tres n\u00e9cessitent 6 \u00e0 8 Go (quantification Q4), ceux de 13 milliards n\u00e9cessitent 10 \u00e0 14 Go, et ceux de 70 milliards n\u00e9cessitent 40 \u00e0 48 Go. Utilisez le <a href=\"https:\/\/convly.ai\/fr\/llm-vram-calculator\/\">Calculateur de VRAM<\/a> pour estimer ces besoins.<\/li>\n<li>Les mod\u00e8les quantifi\u00e9s (Q4, Q5) s\u2019ex\u00e9cutent sur des GPU grand public avec une perte minimale de qualit\u00e9. Le format FP16 offre la meilleure qualit\u00e9, mais double la consommation de VRAM.<\/li>\n<\/ul>\n<\/div>\n<p>Si vous avez recherch\u00e9 \u00ab ollama gpt oss \u00bb, vous souhaitez probablement ex\u00e9cuter localement des grands mod\u00e8les linguistiques open source \u00e0 l\u2019aide d\u2019Ollama \u2014 or OpenAI n\u2019a pas publi\u00e9 de famille de mod\u00e8les \u00e0 poids ouverts baptis\u00e9e \u00ab GPT-OSS \u00bb. OpenAI a certes rendu GPT-2 \u00e0 poids ouverts en 2019, mais ses mod\u00e8les r\u00e9cents (GPT-4, GPT-4o, GPT-4.1) restent des produits propri\u00e9taires accessibles uniquement via API. En revanche, ce qui <em>ne<\/em> existe bel et bien : des centaines de mod\u00e8les \u00e0 poids ouverts provenant de Meta (Llama), Mistral AI, Alibaba (Qwen) et d\u2019autres \u00e9diteurs, que vous pouvez t\u00e9l\u00e9charger et ex\u00e9cuter via Ollama sur votre propre mat\u00e9riel. Ce guide pr\u00e9sente les mod\u00e8les compatibles, les besoins en VRAM selon leur taille, l\u2019impact de la quantification sur la qualit\u00e9, ainsi que leurs comparatifs respectifs.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_86 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a7eea181191f\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Basculer<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a7eea181191f\"  aria-label=\"Basculer\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/fr\/ollama-gpt-oss-guide\/#What_Ollama_Actually_Runs\" >Ce qu\u2019Ollama ex\u00e9cute r\u00e9ellement<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/fr\/ollama-gpt-oss-guide\/#Open-Source_Model_Families_Available_in_Ollama\" >Familles de mod\u00e8les open source disponibles dans Ollama<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/fr\/ollama-gpt-oss-guide\/#Pulling_and_Running_a_Model\" >T\u00e9l\u00e9chargement et ex\u00e9cution d\u2019un mod\u00e8le<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/fr\/ollama-gpt-oss-guide\/#Parameter_Sizes_and_VRAM_Requirements\" >Taille des param\u00e8tres et besoins en VRAM<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/fr\/ollama-gpt-oss-guide\/#Quantization_Quality_vs_VRAM_Trade-Off\" >Quantification : compromis entre qualit\u00e9 et VRAM<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/fr\/ollama-gpt-oss-guide\/#Performance_Comparison_7B_Class\" >Comparatif de performances pour les mod\u00e8les de classe 7B<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/fr\/ollama-gpt-oss-guide\/#Which_Model_to_Pick\" >Quel mod\u00e8le choisir ?<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/fr\/ollama-gpt-oss-guide\/#When_to_Self-Host_vs_Use_an_API\" >Quand h\u00e9berger soi-m\u00eame plut\u00f4t que recourir \u00e0 une API ?<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-9\" href=\"https:\/\/convly.ai\/fr\/ollama-gpt-oss-guide\/#Platform-Specific_Notes\" >Remarques sp\u00e9cifiques aux plateformes<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-10\" href=\"https:\/\/convly.ai\/fr\/ollama-gpt-oss-guide\/#Frequently_Asked_Questions\" >Questions fr\u00e9quemment pos\u00e9es<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"What_Ollama_Actually_Runs\"><\/span>Ce qu\u2019Ollama ex\u00e9cute r\u00e9ellement<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Ollama est un moteur d\u2019inf\u00e9rence local qui t\u00e9l\u00e9charge, quantifie et ex\u00e9cute des LLM \u00e0 poids ouverts sur macOS, Linux et Windows. Il ne prend pas en charge les mod\u00e8les d\u2019OpenAI. Le <a href=\"https:\/\/convly.ai\/fr\/ollama-models-list-2026\/\">Liste des mod\u00e8les Ollama<\/a> includes Llama 3.1, Mistral 7B, Qwen 2.5, Gemma 2, Phi-3, and dozens more. Each model is available in multiple quantization levels (Q4_K_M, Q5_K_M, FP16) to trade VRAM for quality.<\/p>\n<p>\u00c9tapes compl\u00e8tes d\u2019installation : <a href=\"https:\/\/convly.ai\/fr\/how-to-install-ollama-2026\/\">comment installer Ollama<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Open-Source_Model_Families_Available_in_Ollama\"><\/span>Familles de mod\u00e8les open source disponibles dans Ollama<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<table>\n<thead>\n<tr>\n<th>Famille de mod\u00e8les<\/th>\n<th>D\u00e9veloppeur<\/th>\n<th>Taille des param\u00e8tres<\/th>\n<th>Licence<\/th>\n<th>Points remarquables<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Llama 3.1<\/td>\n<td>Meta<\/td>\n<td>8 milliards, 70 milliards, 405 milliards<\/td>\n<td>Llama 3.1 (licence commerciale autoris\u00e9e)<\/td>\n<td>Meilleure capacit\u00e9 de raisonnement g\u00e9n\u00e9ral \u00e0 chaque niveau de taille<\/td>\n<\/tr>\n<tr>\n<td>Mistral<\/td>\n<td>Mistral AI<\/td>\n<td>7 milliards, 22 milliards (Mixtral 8\u00d77B)<\/td>\n<td>Apache 2.0<\/td>\n<td>Rapide, efficace et performant en programmation<\/td>\n<\/tr>\n<tr>\n<td>Qwen 2.5<\/td>\n<td>Alibaba<\/td>\n<td>0,5 milliard, 1,5 milliard, 3 milliards, 7 milliards, 14 milliards, 32 milliards, 72 milliards<\/td>\n<td>Apache 2.0<\/td>\n<td>Multilingue, contexte long (128 k)<\/td>\n<\/tr>\n<tr>\n<td>Gemma 2<\/td>\n<td>Google<\/td>\n<td>2 milliards, 9 milliards, 27 milliards<\/td>\n<td>Gemma (licence commerciale autoris\u00e9e)<\/td>\n<td>L\u00e9ger et rapide, fonctionne m\u00eame sur processeur (CPU)<\/td>\n<\/tr>\n<tr>\n<td>Phi-3.5<\/td>\n<td>Microsoft<\/td>\n<td>3,8 milliards (mini), 14 milliards (medium)<\/td>\n<td>MIT<\/td>\n<td>Compact et performant sur les benchmarks de raisonnement<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Le <a href=\"https:\/\/convly.ai\/fr\/models\/\">Base de donn\u00e9es des mod\u00e8les IA<\/a> r\u00e9pertorie les caract\u00e9ristiques techniques, les besoins en VRAM et les tarifs de 37 mod\u00e8les, y compris tous ceux cit\u00e9s ci-dessus.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Pulling_and_Running_a_Model\"><\/span>T\u00e9l\u00e9chargement et ex\u00e9cution d\u2019un mod\u00e8le<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Une fois Ollama install\u00e9, t\u00e9l\u00e9chargez un mod\u00e8le \u00e0 l\u2019aide de la commande <code>ollama pull &lt;mod\u00e8le&gt;:&lt;\u00e9tiquette&gt;<\/code>. L\u2019\u00e9tiquette pr\u00e9cise le nombre de param\u00e8tres et le niveau de quantification. Exemples :<\/p>\n<pre><code>ollama pull llama3.1:8b\nollama pull mistral:7b-instruct-q4_K_M\nollama pull qwen2.5:7b\nollama pull gemma2:9b<\/code><\/pre>\n<p>Ex\u00e9cutez ensuite le mod\u00e8le :<\/p>\n<pre><code>ollama run llama3.1:8b<\/code><\/pre>\n<p>Cela ouvre une session de discussion interactive. Saisissez votre demande, appuyez sur Entr\u00e9e, et le mod\u00e8le g\u00e9n\u00e8re une r\u00e9ponse localement. Pour quitter, saisissez <code>\/bye<\/code>.<\/p>\n<p>Pour utiliser le mod\u00e8le par programmation via l\u2019API :<\/p>\n<pre><code>curl http:\/\/localhost:11434\/api\/generate -d '{\n  \"model\": \"llama3.1:8b\",\n  \"prompt\": \"Expliquez la r\u00e9cursion en une phrase.\"\n}'<\/code><\/pre>\n<p>Ollama expose un point de terminaison <code>\/v1\/chat\/completions<\/code> compatible avec l\u2019API OpenAI, ce qui vous permet de rediriger facilement un code existant utilisant les SDK OpenAI vers <code>http:\/\/localhost:11434<\/code> et d\u2019y substituer un mod\u00e8le local.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Parameter_Sizes_and_VRAM_Requirements\"><\/span>Taille des param\u00e8tres et besoins en VRAM<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>La taille du mod\u00e8le (7B, 13B, 70B) d\u00e9termine \u00e0 la fois sa qualit\u00e9 et son empreinte m\u00e9moire en VRAM. Les mod\u00e8les plus volumineux offrent de meilleures capacit\u00e9s de raisonnement, mais exigent davantage de m\u00e9moire GPU. La quantification (Q4, Q5, FP16) compresse les poids afin de r\u00e9duire la consommation de VRAM, avec une l\u00e9g\u00e8re perte de qualit\u00e9.<\/p>\n<table>\n<thead>\n<tr>\n<th>Nombre de param\u00e8tres<\/th>\n<th>Quantification<\/th>\n<th>VRAM (approximative)<\/th>\n<th>Mod\u00e8les d'exemple<\/th>\n<th>Recommandation de GPU<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>7B<\/td>\n<td>Q4_K_M<\/td>\n<td>4,5 Go<\/td>\n<td>Llama 3.1 8B, Mistral 7B<\/td>\n<td>RTX 3060 (12 Go), RTX 4060 Ti (16 Go)<\/td>\n<\/tr>\n<tr>\n<td>7B<\/td>\n<td>Q5_K_M<\/td>\n<td>5,5 Go<\/td>\n<td>Identique ci-dessus<\/td>\n<td>Identique<\/td>\n<\/tr>\n<tr>\n<td>7B<\/td>\n<td>FP16<\/td>\n<td>14 Go<\/td>\n<td>Identique ci-dessus<\/td>\n<td>RTX 4060 Ti (16 Go), RTX 4070<\/td>\n<\/tr>\n<tr>\n<td>13\u00a0milliards de param\u00e8tres<\/td>\n<td>Q4_K_M<\/td>\n<td>8 Go<\/td>\n<td>Qwen 2.5 14B, Phi-3.5 14B<\/td>\n<td>RTX 3060 (12 Go), RTX 4060 Ti (16 Go)<\/td>\n<\/tr>\n<tr>\n<td>13\u00a0milliards de param\u00e8tres<\/td>\n<td>FP16<\/td>\n<td>26 Go<\/td>\n<td>Identique<\/td>\n<td>RTX 4090 (24 Go) ou A5000 (24 Go)<\/td>\n<\/tr>\n<tr>\n<td>70B<\/td>\n<td>Q4_K_M<\/td>\n<td>40 Go<\/td>\n<td>Llama 3.1 70B, Qwen 2.5 72B<\/td>\n<td>A100 (40\/80 Go), deux RTX 3090 (48 Go au total)<\/td>\n<\/tr>\n<tr>\n<td>70B<\/td>\n<td>FP16<\/td>\n<td>140 Go<\/td>\n<td>Identique<\/td>\n<td>Configuration multi-GPU ou A100 80 Go<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Utilisez le <a href=\"https:\/\/convly.ai\/fr\/llm-vram-calculator\/\">Calculateur de VRAM<\/a> pour estimer les besoins en m\u00e9moire pour n'importe quel mod\u00e8le et niveau de quantification. Le <a href=\"https:\/\/convly.ai\/fr\/vram-requirements-every-major-llm-2026\/\">Guide des exigences en VRAM<\/a> r\u00e9pertorie des valeurs pr\u00e9cises pour tous les mod\u00e8les majeurs.<\/p>\n<p>Pour les d\u00e9cisions d'achat de GPU, consultez <a href=\"https:\/\/convly.ai\/fr\/best-gpus-for-local-llms-2026\/\">meilleurs GPU pour ex\u00e9cuter localement des LLM<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Quantization_Quality_vs_VRAM_Trade-Off\"><\/span>Quantification : compromis entre qualit\u00e9 et VRAM<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>La quantification r\u00e9duit la pr\u00e9cision des poids d\u2019un mod\u00e8le, passant des flottants 16 bits (FP16) \u00e0 des entiers 4 ou 5 bits (Q4, Q5). Cela permet de r\u00e9duire la consommation de VRAM de 60 \u00e0 75 %, avec une perte de qualit\u00e9 minimale pour la plupart des t\u00e2ches.<\/p>\n<ul>\n<li><strong>Q4_K_M<\/strong>: Quantification sur 4 bits. Consommation minimale de VRAM, l\u00e9g\u00e8re d\u00e9gradation de la qualit\u00e9 sur les t\u00e2ches complexes de raisonnement. Id\u00e9al pour les chatbots, la synth\u00e8se ou la compl\u00e9tion de code.<\/li>\n<li><strong>Q5_K_M<\/strong>: Quantification sur 5 bits. Environ 20 % de VRAM suppl\u00e9mentaire par rapport \u00e0 Q4, qualit\u00e9 proche de celle de FP16. Meilleur compromis pour la plupart des utilisateurs.<\/li>\n<li><strong>Q8_0<\/strong>: Quantification sur 8 bits. Qualit\u00e9 quasi identique \u00e0 celle de FP16, r\u00e9duction de 50 % de la VRAM. \u00c0 utiliser uniquement si vous disposez d\u2019une marge suffisante de VRAM.<\/li>\n<li><strong>FP16<\/strong>: Pr\u00e9cision int\u00e9grale. Qualit\u00e9 optimale, mais consommation de VRAM doubl\u00e9e par rapport \u00e0 Q4. R\u00e9serv\u00e9 \u00e0 la recherche ou lorsque toute r\u00e9gression de qualit\u00e9 est inacceptable.<\/li>\n<\/ul>\n<p>Example: Llama 3.1 8B at Q4_K_M uses 4.5 GB and scores 67.2 on MMLU. At FP16 it uses 14 GB and scores 68.1 on MMLU. For most tasks the 0.9-point difference is imperceptible.<\/p>\n<p>Pour t\u00e9l\u00e9charger une quantification sp\u00e9cifique :<\/p>\n<pre><code>ollama pull llama3.1:8b-instruct-q4_K_M\nollama pull llama3.1:8b-instruct-fp16<\/code><\/pre>\n<p>Si vous omettez l\u2019indicateur de quantification, Ollama utilise par d\u00e9faut Q4_K_M.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Performance_Comparison_7B_Class\"><\/span>Comparatif de performances pour les mod\u00e8les de classe 7B<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>La classe de taille 7B\u20138B est la plus populaire pour une utilisation locale. Elle s\u2019adapte aux GPU grand public et fournit d\u2019excellents r\u00e9sultats en programmation, raisonnement et conversation.<\/p>\n<table>\n<thead>\n<tr>\n<th>Mod\u00e8le<\/th>\n<th>MMLU (z\u00e9ro tirage)<\/th>\n<th>HumanEval (pass@1)<\/th>\n<th>Longueur de contexte<\/th>\n<th>VRAM (Q4)<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Llama 3.1 8B<\/td>\n<td>67.2<\/td>\n<td>62.2<\/td>\n<td>128 k<\/td>\n<td>4,5 Go<\/td>\n<\/tr>\n<tr>\n<td>Mistral 7B v0.3<\/td>\n<td>62.5<\/td>\n<td>40.2<\/td>\n<td>32 k<\/td>\n<td>4,1 Go<\/td>\n<\/tr>\n<tr>\n<td>Qwen 2.5 7B<\/td>\n<td>70.3<\/td>\n<td>61.6<\/td>\n<td>128 k<\/td>\n<td>4,3 Go<\/td>\n<\/tr>\n<tr>\n<td>Gemma 2 9B<\/td>\n<td>71.3<\/td>\n<td>61.0<\/td>\n<td>8 k<\/td>\n<td>5,2 Go<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Qwen 2.5 7B et Gemma 2 9B obtiennent les meilleurs scores sur MMLU (connaissances g\u00e9n\u00e9rales). Llama 3.1 8B domine sur HumanEval (programmation). Mistral 7B offre les performances d\u2019inf\u00e9rence les plus rapides et la licence la plus permissive (Apache 2.0). Le <a href=\"https:\/\/convly.ai\/fr\/llm-leaderboard\/\">Classement des grands mod\u00e8les linguistiques (LLM)<\/a> classe tous les mod\u00e8les selon leur intelligence, leur co\u00fbt et leur longueur de contexte.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Which_Model_to_Pick\"><\/span>Quel mod\u00e8le choisir ?<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<ul>\n<li><strong>Meilleure qualit\u00e9 globale (classe 7B)<\/strong>: <code>ollama pull qwen2.5:7b<\/code> ou <code>ollama pull llama3.1:8b<\/code><\/li>\n<li><strong>Meilleur pour la programmation<\/strong>: <code>ollama pull llama3.1:8b<\/code> ou <code>ollama pull qwen2.5-coder:7b<\/code><\/li>\n<li><strong>Inf\u00e9rence la plus rapide<\/strong>: <code>ollama pull mistral:7b<\/code> ou <code>ollama pull gemma2:2b<\/code> (pour CPU\/faible VRAM)<\/li>\n<li><strong>Multilingue<\/strong>: <code>ollama pull qwen2.5:7b<\/code> (prend en charge 29 langues)<\/li>\n<li><strong>Documents longs (contexte \u2265 128 k)<\/strong>: <code>ollama pull llama3.1:8b<\/code> ou <code>ollama pull qwen2.5:7b<\/code><\/li>\n<li><strong>Raisonnement le plus puissant (si vous disposez de 40 Go de VRAM ou plus)<\/strong>: <code>ollama pull llama3.1:70b<\/code> ou <code>ollama pull qwen2.5:72b<\/code><\/li>\n<\/ul>\n<p>Le <a href=\"https:\/\/convly.ai\/fr\/best-local-llms-to-run-on-ollama-2026\/\">les meilleurs LLM locaux pour Ollama<\/a> guide \u00e9value syst\u00e9matiquement tous les mod\u00e8les et recommande des indicateurs sp\u00e9cifiques selon les cas d\u2019usage.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"When_to_Self-Host_vs_Use_an_API\"><\/span>Quand h\u00e9berger soi-m\u00eame plut\u00f4t que recourir \u00e0 une API ?<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Ex\u00e9cuter Ollama localement est pertinent si :<\/p>\n<ul>\n<li>Vous poss\u00e9dez d\u00e9j\u00e0 un GPU dot\u00e9 d\u2019au moins 12 Go de VRAM (RTX 3060, 4060 Ti ou sup\u00e9rieur)<\/li>\n<li>Vous traitez des donn\u00e9es sensibles qui ne doivent pas quitter votre r\u00e9seau<\/li>\n<li>Vous g\u00e9n\u00e9rez plus de 5 millions de jetons par mois (les co\u00fbts li\u00e9s aux API d\u00e9passent le co\u00fbt total de possession d\u2019une solution auto-h\u00e9berg\u00e9e)<\/li>\n<li>Vous exigez une disponibilit\u00e9 garantie et aucune limitation de d\u00e9bit<\/li>\n<\/ul>\n<p>Utilisez une API h\u00e9berg\u00e9e (OpenAI, Anthropic, Groq) si :<\/p>\n<ul>\n<li>Vous g\u00e9n\u00e9rez moins de 1 million de jetons par mois (l\u2019amortissement d\u2019un GPU auto-h\u00e9berg\u00e9 prend plusieurs ann\u00e9es)<\/li>\n<li>Vous avez besoin de la qualit\u00e9 absolue (Claude 3.5 Sonnet et GPT-4o surpassent tous les mod\u00e8les open source)<\/li>\n<li>Vous ne souhaitez pas g\u00e9rer l\u2019infrastructure d\u2019inf\u00e9rence<\/li>\n<\/ul>\n<p>Le <a href=\"https:\/\/convly.ai\/fr\/self-hosting-vs-api-calculator\/\">calculateur auto-h\u00e9bergement vs API<\/a> estime le seuil de rentabilit\u00e9 en fonction de votre volume de jetons, du co\u00fbt du GPU et du tarif de l\u2019\u00e9lectricit\u00e9. Le <a href=\"https:\/\/convly.ai\/fr\/ai-api-cost-calculator\/\">Calculateur de co\u00fbts d\u2019API<\/a> projette la d\u00e9pense mensuelle par mod\u00e8le.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Platform-Specific_Notes\"><\/span>Remarques sp\u00e9cifiques aux plateformes<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>macOS<\/h3>\n<p>Ollama utilise Metal pour l\u2019acc\u00e9l\u00e9ration GPU sur les Mac \u00e9quip\u00e9s de puces M1\/M2\/M3. La m\u00e9moire unifi\u00e9e signifie que la VRAM \u00e9quivaut \u00e0 la m\u00e9moire syst\u00e8me. Un Mac M2 Max dot\u00e9 de 64 Go peut ex\u00e9cuter Llama 3.1 70B en quantification Q4 (40 Go) tout en laissant suffisamment de m\u00e9moire pour le syst\u00e8me d\u2019exploitation. Installez-le via Homebrew :<\/p>\n<pre><code>brew install ollama<\/code><\/pre>\n<p>D\u00e9marrez le service :<\/p>\n<pre><code>ollama serve<\/code><\/pre>\n<h3>Linux<\/h3>\n<p>Ollama n\u00e9cessite des GPU NVIDIA compatibles CUDA 11.8+ ou des GPU AMD compatibles ROCm 5.7+. Installez-le avec :<\/p>\n<pre><code>curl -fsSL https:\/\/ollama.com\/install.sh | sh<\/code><\/pre>\n<p>Cette commande installe le binaire dans <code>, puis supprimez<\/code> et cr\u00e9e un service systemd. D\u00e9marrez-le avec :<\/p>\n<pre><code>sudo systemctl start ollama<\/code><\/pre>\n<p>Les mod\u00e8les sont t\u00e9l\u00e9charg\u00e9s dans <code>~\/.ollama\/models<\/code>. Pour modifier cet emplacement, d\u00e9finissez la variable d\u2019environnement <code>OLLAMA_MODELS=\/chemin\/vers\/les\/modeles<\/code> le fichier <code>, puis d\u2019ex\u00e9cuter<\/code>.<\/p>\n<h3>Windows<\/h3>\n<p>La version Windows d\u2019Ollama requiert des GPU NVIDIA compatibles CUDA 11.8+ et un pilote version 520 ou sup\u00e9rieure. T\u00e9l\u00e9chargez l\u2019installateur depuis <code>ollama.com<\/code> et ex\u00e9cutez-le. Le service d\u00e9marre automatiquement. Les mod\u00e8les sont t\u00e9l\u00e9charg\u00e9s dans <code>C:Utilisateurs&lt;VotreNom&gt;.ollamamodels<\/code>.<\/p>\n<p>Pour l\u2019ex\u00e9cuter depuis PowerShell :<\/p>\n<pre><code>ollama run llama3.1:8b<\/code><\/pre>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_Asked_Questions\"><\/span>Questions fr\u00e9quemment pos\u00e9es<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>OpenAI propose-t-il un mod\u00e8le open source que je peux ex\u00e9cuter dans Ollama ?<\/h3>\n<p>Non. OpenAI a publi\u00e9 GPT-2 (2019) en tant que mod\u00e8le \u00e0 poids ouverts, mais tous ses mod\u00e8les r\u00e9cents (GPT-3.5, GPT-4, GPT-4o, o1) sont propri\u00e9taires et accessibles uniquement via leur API. Si vous recherchez une capacit\u00e9 de raisonnement locale comparable \u00e0 celle d\u2019OpenAI, essayez Llama 3.1 70B ou Qwen 2.5 72B \u2014 ces deux mod\u00e8les surpassent GPT-3.5 sur la plupart des benchmarks et s\u2019ex\u00e9cutent dans Ollama avec 40 Go de VRAM en quantification Q4.<\/p>\n<h3>Puis-je ex\u00e9cuter Ollama sur un processeur (CPU) sans GPU ?<\/h3>\n<p>Oui, mais l\u2019inf\u00e9rence est 10 \u00e0 50 fois plus lente. De petits mod\u00e8les (Gemma 2 2B, Qwen 2.5 0.5B, Phi-3.5 mini 3.8B) restent utilisables sur des processeurs modernes (16 c\u0153urs ou plus). Les mod\u00e8les plus volumineux (7 milliards de param\u00e8tres ou plus) g\u00e9n\u00e8rent seulement 1 \u00e0 3 jetons par seconde sur CPU, ce qui est trop lent pour une utilisation interactive. Si vous ne disposez pas de GPU, envisagez plut\u00f4t d\u2019utiliser une API h\u00e9berg\u00e9e \u2014 consultez la section <a href=\"https:\/\/convly.ai\/fr\/self-hosting-vs-api-calculator\/\">calculateur auto-h\u00e9bergement vs API<\/a>.<\/p>\n<h3>Quel est le co\u00fbt d\u2019ex\u00e9cution d\u2019Ollama compar\u00e9 \u00e0 celui de l\u2019API OpenAI ?<\/h3>\n<p>OpenAI facture 0,15 $ par million de jetons d\u2019entr\u00e9e et 0,60 $ par million de jetons de sortie pour GPT-4o mini. Un GPU de 12 Go (RTX 4060 Ti, 400 $) ex\u00e9cutant Llama 3.1 8B co\u00fbte environ 0,05 $\/heure en \u00e9lectricit\u00e9 (avec un tarif de 0,12 $\/kWh et une consommation syst\u00e8me de 400 W). Le seuil de rentabilit\u00e9 se situe autour de 3 \u00e0 5 millions de jetons par mois. La <a href=\"https:\/\/convly.ai\/fr\/ai-api-cost-calculator\/\">Calculateur de co\u00fbts d\u2019API<\/a> et <a href=\"https:\/\/convly.ai\/fr\/self-hosting-vs-api-calculator\/\">calculatrice d\u2019auto-h\u00e9bergement<\/a> affiche le co\u00fbt total de possession (TCO) exact pour votre cas d\u2019usage.<\/p>\n<h3>Quelle est la diff\u00e9rence entre Q4_K_M, Q5_K_M et FP16 ?<\/h3>\n<p>Q4_K_M utilise une quantification 4 bits (consommation minimale de VRAM, l\u00e9g\u00e8re perte de qualit\u00e9). Q5_K_M utilise une quantification 5 bits (20 % de VRAM suppl\u00e9mentaire, qualit\u00e9 proche de la pr\u00e9cision compl\u00e8te). FP16 correspond \u00e0 une pr\u00e9cision pleine sur 16 bits (qualit\u00e9 optimale, mais consommation de VRAM doubl\u00e9e par rapport \u00e0 Q4). Pour la plupart des t\u00e2ches, Q5_K_M offre le meilleur compromis. N\u2019utilisez FP16 que si vous disposez de VRAM exc\u00e9dentaire et que vous avez besoin des derniers 1 \u00e0 2 % de qualit\u00e9, par exemple pour la recherche ou des applications critiques.<\/p>\n<h3>Puis-je affiner (fine-tune) des mod\u00e8les dans Ollama ?<\/h3>\n<p>Non. Ollama est un moteur d\u2019inf\u00e9rence, pas un cadre d\u2019entra\u00eenement. Pour affiner un mod\u00e8le open source, utilisez Hugging Face Transformers avec PEFT\/LoRA, Axolotl ou LLaMA Factory. Exportez ensuite les poids affin\u00e9s au format GGUF et importez-les dans Ollama \u00e0 l\u2019aide de la commande <code>ollama create<\/code>. Le bloc <a href=\"https:\/\/convly.ai\/fr\/what-is-ollama-complete-guide-2026\/\">Guide complet d\u2019Ollama<\/a> d\u00e9taille ce flux de travail.<\/p>\n<h3>Quel GPU devrais-je acheter pour ex\u00e9cuter localement des mod\u00e8les de 7 milliards de param\u00e8tres ?<\/h3>\n<p>Pour une quantification Q4 (4,5 Go de VRAM) : RTX 3060 12 Go (250 $ d\u2019occasion) ou RTX 4060 Ti 16 Go (450 $ neuf). Pour une pr\u00e9cision FP16 (14 Go de VRAM) : RTX 4060 Ti 16 Go ou RTX 4070 (550\u2013600 $). Pour des mod\u00e8les de 70 milliards de param\u00e8tres en Q4 (40 Go) : deux RTX 3090 24 Go (1 800 $ d\u2019occasion) ou une A100 40 Go (6 000 $ ou plus, d\u2019occasion). Le <a href=\"https:\/\/convly.ai\/fr\/best-gpus-for-local-llms-2026\/\">guide des meilleurs GPU<\/a> pr\u00e9sente des benchmarks comparatifs prix\/performance pour chaque cat\u00e9gorie de taille.<\/p>","protected":false},"excerpt":{"rendered":"<p>TL;DR OpenAI has not released a model family called &#8220;GPT-OSS&#8221;. The search term likely refers to running open-source alternatives (Llama [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":2200,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2199","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts\/2199","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/comments?post=2199"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts\/2199\/revisions"}],"predecessor-version":[{"id":2201,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts\/2199\/revisions\/2201"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/media\/2200"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/media?parent=2199"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/categories?post=2199"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/tags?post=2199"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}