{"id":2235,"date":"2026-08-18T20:04:34","date_gmt":"2026-08-18T20:04:34","guid":{"rendered":"https:\/\/convly.ai\/?p=2235"},"modified":"2026-08-23T03:54:48","modified_gmt":"2026-08-23T03:54:48","slug":"ollama-gpt-oss-guide","status":"publish","type":"post","link":"https:\/\/convly.ai\/fr\/ollama-gpt-oss-guide\/","title":{"rendered":"Ollama GPT OSS : Guide complet pour ex\u00e9cuter les mod\u00e8les ouverts d\u2019OpenAI"},"content":{"rendered":"<div class=\"convly-tldr\"><strong>En bref<\/strong><\/p>\n<ul>\n<li><strong>gpt-oss:20b<\/strong> s\u2019ex\u00e9cute avec environ 16 Go de m\u00e9moire (convient \u00e0 la plupart des GPU grand public) <strong>gpt-oss:120b<\/strong> n\u00e9cessite environ 70 Go (un seul GPU de 80 Go ou r\u00e9partition sur plusieurs cartes grand public)<\/li>\n<li>Installez-le avec la commande <code>ollama pull gpt-oss:20b<\/code> ou <code>ollama pull gpt-oss:120b<\/code>, puis ex\u00e9cutez-le avec <code>ollama run gpt-oss:20b<\/code><\/li>\n<li>Les deux variantes utilisent la quantification MXFP4 \u00e0 4,25 bits par param\u00e8tre et prennent en charge des fen\u00eatres de contexte de 128 K tokens<\/li>\n<li>Publi\u00e9s par OpenAI sous forme de mod\u00e8les \u00e0 poids ouverts dans le cadre d\u2019un partenariat avec Ollama, ils offrent une qualit\u00e9 comparable \u00e0 celle de Llama 3.1 et de Qwen 2.5<\/li>\n<\/ul>\n<\/div>\n<p>OpenAI a publi\u00e9 gpt-oss comme mod\u00e8les \u00e0 poids ouverts en ao\u00fbt 2025, distribu\u00e9s exclusivement via Ollama. La famille gpt-oss comprend deux variantes : un mod\u00e8le de 20 milliards de param\u00e8tres, ex\u00e9cutable ais\u00e9ment sur du mat\u00e9riel grand public, et un mod\u00e8le de 120 milliards de param\u00e8tres, offrant des performances proches de l\u2019\u00e9tat de l\u2019art sur un seul GPU haut de gamme. Les deux mod\u00e8les utilisent la quantification MXFP4, compressant les poids \u00e0 4,25 bits par param\u00e8tre tout en conservant une qualit\u00e9 proche de celle de l\u2019inf\u00e9rence en pr\u00e9cision pleine.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_88 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6abaaba91e6a1\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Basculer<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6abaaba91e6a1\"  aria-label=\"Basculer\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/fr\/ollama-gpt-oss-guide\/#What_Are_the_GPT-OSS_Models\" >Quels sont les mod\u00e8les GPT-OSS ?<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/fr\/ollama-gpt-oss-guide\/#Hardware_Requirements\" >Exigences mat\u00e9rielles<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/fr\/ollama-gpt-oss-guide\/#Installation\" >Installation<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/fr\/ollama-gpt-oss-guide\/#Pulling_and_Running_the_Models\" >T\u00e9l\u00e9chargement et ex\u00e9cution des mod\u00e8les<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/fr\/ollama-gpt-oss-guide\/#Performance_and_Model_Comparison\" >Performances et comparaison entre mod\u00e8les<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/fr\/ollama-gpt-oss-guide\/#MXFP4_Quantisation\" >Quantification MXFP4<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/fr\/ollama-gpt-oss-guide\/#Context_Window_and_Memory_Usage\" >Fen\u00eatre de contexte et utilisation m\u00e9moire<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/fr\/ollama-gpt-oss-guide\/#Frequently_Asked_Questions\" >Questions fr\u00e9quemment pos\u00e9es<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"What_Are_the_GPT-OSS_Models\"><\/span>Quels sont les mod\u00e8les GPT-OSS ?<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Les mod\u00e8les gpt-oss constituent la premi\u00e8re publication par OpenAI de mod\u00e8les \u00e0 poids ouverts, suite aux pressions exerc\u00e9es par le secteur en faveur de la transparence et de la reproductibilit\u00e9. Contrairement \u00e0 GPT-4 ou GPT-4o, ces mod\u00e8les sont fournis avec l\u2019int\u00e9gralit\u00e9 de leurs poids, les d\u00e9tails architecturaux complets et des licences permissives autorisant leur usage commercial sans restriction.<\/p>\n<p>Both models support a 128K token context window, handle multi-turn conversations, and perform instruction following comparable to other open models in their parameter class. The 20B variant competes directly with Llama 3.1 8B and Mistral 7B, while the 120B model sits between Llama 3.1 70B and full frontier systems like GPT-4.<\/p>\n<p>OpenAI a conclu un partenariat avec Ollama pour assurer la distribution et l\u2019optimisation de l\u2019inf\u00e9rence. Cela signifie que vous installez et ex\u00e9cutez gpt-oss de la m\u00eame mani\u00e8re que n\u2019importe quel autre <a href=\"https:\/\/convly.ai\/fr\/what-is-ollama-complete-guide-2026\/\">mod\u00e8le Ollama<\/a>, sans \u00e9tape de conversion ou de quantification s\u00e9par\u00e9e.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Hardware_Requirements\"><\/span>Exigences mat\u00e9rielles<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Le tableau ci-dessous indique les configurations mat\u00e9rielles minimales et recommand\u00e9es pour chaque variante gpt-oss. Les valeurs m\u00e9moire tiennent compte des poids du mod\u00e8le ainsi qu\u2019une marge raisonnable pour le contexte et les tampons d\u2019inf\u00e9rence.<\/p>\n<table>\n<thead>\n<tr>\n<th>Mod\u00e8le<\/th>\n<th>Param\u00e8tres<\/th>\n<th>Taille disque<\/th>\n<th>M\u00e9moire minimale<\/th>\n<th>M\u00e9moire recommand\u00e9e<\/th>\n<th>Exemples de mat\u00e9riel<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>gpt-oss:20b<\/td>\n<td>20B<\/td>\n<td>14 Go<\/td>\n<td>16 Go<\/td>\n<td>24 Go<\/td>\n<td>RTX 4090, RTX 3090, A5000<\/td>\n<\/tr>\n<tr>\n<td>gpt-oss:120b<\/td>\n<td>120B<\/td>\n<td>65 Go<\/td>\n<td>70 Go<\/td>\n<td>80 Go<\/td>\n<td>A100 80 Go, H100, 2 \u00d7 RTX 4090<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Le mod\u00e8le de 20 milliards de param\u00e8tres s\u2019ex\u00e9cute ais\u00e9ment sur les GPU grand public sortis depuis 2020. Si vous disposez d\u2019une RTX 3090 ou d\u2019une RTX 4090 dot\u00e9e de 24 Go de VRAM, vous pouvez ex\u00e9cuter gpt-oss:20b avec suffisamment de m\u00e9moire libre pour une fen\u00eatre de contexte de 16 K tokens. Avec 16 Go de VRAM (RTX 4080, RTX 3080 Ti), vous pouvez toujours faire fonctionner le mod\u00e8le, mais vous devrez limiter la longueur du contexte \u00e0 8 K tokens afin d\u2019\u00e9viter un d\u00e9passement de m\u00e9moire.<\/p>\n<p>Le mod\u00e8le de 120 milliards de param\u00e8tres n\u00e9cessite du mat\u00e9riel de centre de donn\u00e9es ou une configuration multi-GPU grand public. Une carte A100 80 Go le prend en charge ais\u00e9ment. Deux RTX 4090 install\u00e9es dans un poste de travail peuvent r\u00e9partir le mod\u00e8le entre les deux cartes, bien que la vitesse d\u2019inf\u00e9rence diminue l\u00e9g\u00e8rement par rapport \u00e0 une configuration mono-GPU. Utilisez le <a href=\"https:\/\/convly.ai\/fr\/llm-vram-calculator\/\">Calculateur de VRAM<\/a> pour estimer les besoins m\u00e9moire selon diff\u00e9rentes longueurs de contexte.<\/p>\n<h3>Processeur (CPU) et m\u00e9moire syst\u00e8me (RAM)<\/h3>\n<p>En cas de VRAM insuffisante, Ollama d\u00e9charge certaines couches vers la m\u00e9moire syst\u00e8me et les ex\u00e9cute sur le CPU. Pour gpt-oss:20b, vous devez disposer d\u2019au moins 32 Go de RAM syst\u00e8me si vous ex\u00e9cutez enti\u00e8rement le mod\u00e8le sur le CPU. Pour gpt-oss:120b, l\u2019inf\u00e9rence sur CPU est impraticable \u2014 attendez-vous \u00e0 plusieurs secondes par token, m\u00eame sur des syst\u00e8mes dot\u00e9s d\u2019un tr\u00e8s grand nombre de c\u0153urs. Consultez le <a href=\"https:\/\/convly.ai\/fr\/best-gpus-for-local-llms-2026\/\">guide des meilleures cartes graphiques pour LLM locaux<\/a> si vous construisez ou mettez \u00e0 niveau du mat\u00e9riel sp\u00e9cifiquement destin\u00e9 \u00e0 l\u2019inf\u00e9rence de mod\u00e8les.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Installation\"><\/span>Installation<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Commencez par installer Ollama si ce n\u2019est pas d\u00e9j\u00e0 fait. Le processus varie selon la plateforme :<\/p>\n<h3>macOS<\/h3>\n<p>T\u00e9l\u00e9chargez l\u2019application Ollama pour macOS depuis <code>ollama.com<\/code> et glissez-la vers <code>\/Applications<\/code>. L\u2019installateur configure automatiquement l\u2019interface en ligne de commande (CLI) <code>ollama<\/code> . Vous pouvez \u00e9galement l\u2019installer via Homebrew :<\/p>\n<pre><code>brew install ollama<\/code><\/pre>\n<h3>Linux<\/h3>\n<p>Ex\u00e9cutez le script d\u2019installation officiel, qui place le binaire \u00e0 l\u2019emplacement <code>, puis supprimez<\/code> et configure un service systemd :<\/p>\n<pre><code>curl -fsSL https:\/\/ollama.com\/install.sh | sh<\/code><\/pre>\n<p>Pour une installation manuelle ou des instructions sp\u00e9cifiques \u00e0 une distribution, consultez la <a href=\"https:\/\/convly.ai\/fr\/how-to-install-ollama-2026\/\">Guide d\u2019installation d\u2019Ollama<\/a>.<\/p>\n<h3>Windows<\/h3>\n<p>T\u00e9l\u00e9chargez le programme d'installation pour Windows \u00e0 partir de <code>ollama.com<\/code> et ex\u00e9cutez-le. L\u2019installateur ajoute automatiquement Ollama \u00e0 votre variable PATH et d\u00e9marre le service en arri\u00e8re-plan. Une fois l\u2019installation termin\u00e9e, ouvrez PowerShell ou l\u2019invite de commandes pour v\u00e9rifier :<\/p>\n<pre><code>ollama --version<\/code><\/pre>\n<h2><span class=\"ez-toc-section\" id=\"Pulling_and_Running_the_Models\"><\/span>T\u00e9l\u00e9chargement et ex\u00e9cution des mod\u00e8les<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Une fois Ollama install\u00e9, t\u00e9l\u00e9chargez le mod\u00e8le souhait\u00e9. Pour la variante de 20 milliards de param\u00e8tres :<\/p>\n<pre><code>ollama pull gpt-oss:20b<\/code><\/pre>\n<p>Pour la variante de 120 milliards de param\u00e8tres :<\/p>\n<pre><code>ollama pull gpt-oss:120b<\/code><\/pre>\n<p>Le t\u00e9l\u00e9chargement copie les poids du mod\u00e8le dans le dossier <code>~\/.ollama\/models<\/code> sur macOS et Linux, ou dans <code>%USERPROFILE%.ollamamodels<\/code> sur Windows. Le t\u00e9l\u00e9chargement est reprendre-\u00e0-partir-de-l\u00e0, donc vous pouvez l\u2019interrompre et le relancer sans perdre les progr\u00e8s r\u00e9alis\u00e9s.<\/p>\n<p>Apr\u00e8s le t\u00e9l\u00e9chargement, lancez une session interactive :<\/p>\n<pre><code>ollama run gpt-oss:20b<\/code><\/pre>\n<p>Ou, pour le mod\u00e8le plus volumineux :<\/p>\n<pre><code>ollama run gpt-oss:120b<\/code><\/pre>\n<p>Cela ouvre une interface de discussion. Saisissez votre demande, appuyez sur Entr\u00e9e, et le mod\u00e8le affiche progressivement sa r\u00e9ponse. Tapez <code>\/bye<\/code> pour quitter.<\/p>\n<h3>Acc\u00e8s \u00e0 l\u2019API<\/h3>\n<p>Ollama ex\u00e9cute un serveur HTTP local \u00e0 l\u2019adresse <code>http:\/\/localhost:11434<\/code>. Vous pouvez envoyer des requ\u00eates \u00e0 l\u2019aide de curl, de Python ou de tout client HTTP :<\/p>\n<pre><code>curl http:\/\/localhost:11434\/api\/generate -d '{\n  \"model\": \"gpt-oss:20b\",\n  \"prompt\": \"Expliquez la quantification MXFP4 en une phrase.\"\n}'<\/code><\/pre>\n<p>Pour les applications structur\u00e9es, utilisez le SDK Python ou JavaScript d\u2019Ollama. Les deux sont disponibles via les gestionnaires de paquets standards (<code>pip install ollama<\/code>, <code>npm install ollama<\/code>) et fournissent des interfaces typ\u00e9es pour la g\u00e9n\u00e9ration de texte, les embeddings et la gestion des mod\u00e8les.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Performance_and_Model_Comparison\"><\/span>Performances et comparaison entre mod\u00e8les<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Le mod\u00e8le de 20 milliards de param\u00e8tres g\u00e9n\u00e8re 15 \u00e0 30 jetons par seconde sur une carte graphique RTX 4090, selon la longueur du contexte et la complexit\u00e9 de la demande. Le mod\u00e8le de 120 milliards de param\u00e8tres produit 8 \u00e0 15 jetons par seconde sur une carte A100 de 80 Go. Ces chiffres supposent des param\u00e8tres par d\u00e9faut, sans optimisations suppl\u00e9mentaires telles que le d\u00e9codage sp\u00e9culatif.<\/p>\n<p>Sur le plan de la qualit\u00e9, gpt-oss:20b obtient des r\u00e9sultats comparables \u00e0 ceux de Llama 3.1 8B et de Mistral 7B sur des benchmarks de raisonnement tels que MMLU et GSM8K. Il les d\u00e9passe tous deux en suivi d\u2019instructions sur plusieurs tours, probablement gr\u00e2ce au r\u00e9glage par apprentissage par renforcement \u00e0 partir de commentaires humains (RLHF) mis en \u0153uvre par OpenAI. La variante 120B atteint une qualit\u00e9 proche de celle de GPT-3.5 Turbo, ce qui en fait, en ao\u00fbt 2026, le mod\u00e8le ouvert le plus performant parmi ceux comptant moins de 200 milliards de param\u00e8tres.<\/p>\n<p>Par rapport aux mod\u00e8les propri\u00e9taires accessibles via API, l\u2019ex\u00e9cution locale de gpt-oss devient rentable \u00e0 partir d\u2019environ 2 millions de jetons par mois pour le mod\u00e8le 20B, ou de 500 000 jetons par mois pour le mod\u00e8le 120B, \u00e0 condition que vous poss\u00e9diez d\u00e9j\u00e0 le mat\u00e9riel requis. Utilisez le <a href=\"https:\/\/convly.ai\/fr\/self-hosting-vs-api-calculator\/\">calculateur auto-h\u00e9bergement vs API<\/a> pour estimer votre seuil de rentabilit\u00e9 en fonction du volume de jetons et des co\u00fbts mat\u00e9riels.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"MXFP4_Quantisation\"><\/span>Quantification MXFP4<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Les deux mod\u00e8les gpt-oss int\u00e8grent nativement la quantification MXFP4. MXFP4 est un format flottant \u00e0 micro-\u00e9chelle qui repr\u00e9sente les poids avec une pr\u00e9cision moyenne de 4,25 bits par param\u00e8tre, contre 16 bits en demi-pr\u00e9cision standard. Contrairement aux anciens sch\u00e9mas de quantification tels que GPTQ ou AWQ, MXFP4 pr\u00e9serve une plage dynamique plus \u00e9tendue, r\u00e9duisant ainsi la perte d\u2019exactitude habituellement associ\u00e9e \u00e0 une compression agressive.<\/p>\n<p>En pratique, les mod\u00e8les quantifi\u00e9s en MXFP4 se comportent presque identiquement \u00e0 leurs homologues en pleine pr\u00e9cision sur la plupart des t\u00e2ches. Cette quantification s\u2019effectue durant l\u2019entra\u00eenement, et non a posteriori, ce qui permet au mod\u00e8le de s\u2019adapter \u00e0 la pr\u00e9cision r\u00e9duite. Cette approche r\u00e9duit la consommation de m\u00e9moire VRAM d\u2019environ 75 % par rapport au format FP16, rendant ainsi l\u2019ex\u00e9cution de mod\u00e8les de 120 milliards de param\u00e8tres possible sur une seule carte graphique grand public.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Context_Window_and_Memory_Usage\"><\/span>Fen\u00eatre de contexte et utilisation m\u00e9moire<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Les deux variantes gpt-oss prennent en charge une fen\u00eatre de contexte de 128 K jetons, soit environ 100 000 mots en anglais. Toutefois, l\u2019utilisation effective de cette fen\u00eatre compl\u00e8te n\u00e9cessite une m\u00e9moire suppl\u00e9mentaire importante, au-del\u00e0 des poids de base du mod\u00e8le.<\/p>\n<p>Pour gpt-oss:20b, une fen\u00eatre de contexte de 128 K entra\u00eene une surcharge m\u00e9moire d\u2019environ 8 Go. Avec 24 Go de VRAM, vous pouvez utiliser confortablement la fen\u00eatre compl\u00e8te. Avec 16 Go de VRAM, il est conseill\u00e9 de limiter le contexte \u00e0 32 K\u201348 K jetons afin d\u2019\u00e9viter une saturation de la m\u00e9moire en cours de g\u00e9n\u00e9ration.<\/p>\n<p>Pour gpt-oss:120b, une fen\u00eatre de contexte de 128 K ajoute environ 20 Go de surcharge m\u00e9moire. Une carte graphique de 80 Go peut la supporter, mais un d\u00e9ploiement sur deux cartes grand public (70 Go au total) devrait limiter la fen\u00eatre de contexte \u00e0 64 K jetons. Consultez <a href=\"https:\/\/convly.ai\/fr\/vram-requirements-every-major-llm-2026\/\">Exigences en VRAM selon le mod\u00e8le<\/a> pour obtenir des courbes d\u00e9taill\u00e9es de l\u2019\u00e9volution de la consommation m\u00e9moire.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_Asked_Questions\"><\/span>Questions fr\u00e9quemment pos\u00e9es<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Puis-je affiner les mod\u00e8les gpt-oss ?<\/h3>\n<p>Oui. OpenAI a publi\u00e9 gpt-oss sous une licence permissive autorisant l\u2019affinage \u00e0 toute fin, y compris commerciale. Vous pouvez utiliser des cadres d\u2019affinage standard tels qu\u2019Axolotl ou Hugging Face TRL. Les poids du mod\u00e8le sont compatibles avec l\u2019architecture Llama, de sorte que la plupart des outils con\u00e7us pour Llama fonctionnent sans modification.<\/p>\n<h3>Comment gpt-oss:120b se compare-t-il \u00e0 Llama 3.1 70B ?<\/h3>\n<p>gpt-oss:120b surpasse Llama 3.1 70B en suivi d\u2019instructions et en conversations multi-tours, notamment dans les t\u00e2ches n\u00e9cessitant le maintien d\u2019un contexte sur de nombreux \u00e9changes. Llama 3.1 70B obtient de meilleurs r\u00e9sultats sur des benchmarks de raisonnement pur tels que MATH et DROP. Les deux mod\u00e8les sont globalement \u00e9quivalents sur les t\u00e2ches de programmation. Le mod\u00e8le 120B n\u00e9cessite davantage de VRAM (70 Go contre 40 Go), mais offre une am\u00e9lioration sensible de la qualit\u00e9 dans les interactions de type assistant.<\/p>\n<h3>Puis-je ex\u00e9cuter gpt-oss:120b sur plusieurs cartes graphiques grand public ?<\/h3>\n<p>Oui. Ollama divise automatiquement le mod\u00e8le entre les GPU disponibles si un seul GPU ne dispose pas de suffisamment de m\u00e9moire. Deux cartes RTX 4090 (48 Go de VRAM au total) peuvent ex\u00e9cuter gpt-oss:120b, bien que la vitesse d\u2019inf\u00e9rence diminue de 20 \u00e0 30 % par rapport \u00e0 celle d\u2019une seule carte de 80 Go, en raison de la surcharge li\u00e9e aux communications inter-GPU. Trois GPU ou plus apportent des gains d\u00e9croissants : si vous avez le budget n\u00e9cessaire, une seule carte A100 ou H100 s\u2019av\u00e8re plus rentable.<\/p>\n<h3>gpt-oss fonctionne-t-il hors ligne ?<\/h3>\n<p>Oui, d\u00e8s lors que vous avez t\u00e9l\u00e9charg\u00e9 le mod\u00e8le \u00e0 l\u2019aide de <code>ollama pull<\/code>. Ollama stocke int\u00e9gralement les poids du mod\u00e8le localement, et l\u2019inf\u00e9rence s\u2019effectue enti\u00e8rement sur votre machine. L\u2019acc\u00e8s r\u00e9seau n\u2019intervient que lors du t\u00e9l\u00e9chargement initial et lors de la v\u00e9rification des mises \u00e0 jour du mod\u00e8le. Vous pouvez d\u00e9sactiver les mises \u00e0 jour automatiques en d\u00e9finissant la variable d\u2019environnement <code>OLLAMA_SKIP_UPGRADE=1<\/code> dans votre environnement.<\/p>\n<h3>Quelle licence s\u2019applique aux sorties g\u00e9n\u00e9r\u00e9es par gpt-oss ?<\/h3>\n<p>La licence gpt-oss d\u2019OpenAI ne revendique aucun droit de propri\u00e9t\u00e9 sur les sorties g\u00e9n\u00e9r\u00e9es. Vous conservez la pleine propri\u00e9t\u00e9 des contenus que vous produisez et pouvez les utiliser \u00e0 toute fin, y compris commerciale, pour des produits ou services. Cela diff\u00e8re des conditions d\u2019utilisation de l\u2019API OpenAI, qui restreignent certains cas d\u2019usage. Veuillez toujours consulter le texte int\u00e9gral de la licence fourni avec le t\u00e9l\u00e9chargement du mod\u00e8le afin de v\u00e9rifier les derniers termes applicables.<\/p>\n<h3>Puis-je utiliser les mod\u00e8les gpt-oss \u00e0 des fins commerciales ?<\/h3>\n<p>Oui. La licence autorise l\u2019usage commercial sans restriction, y compris l\u2019int\u00e9gration du mod\u00e8le dans des produits propri\u00e9taires, sa mise \u00e0 disposition en tant que service ou son utilisation pour g\u00e9n\u00e9rer du contenu destin\u00e9 \u00e0 la vente. Vous n\u2019\u00eates pas tenu de publier sous licence libre vos travaux d\u00e9riv\u00e9s ni de divulguer l\u2019utilisation de gpt-oss dans votre produit, bien que la mention de la source soit encourag\u00e9e.<\/p>","protected":false},"excerpt":{"rendered":"<p>TL;DRgpt-oss:20b runs in ~16GB memory (fits most gaming GPUs), gpt-oss:120b needs ~70GB (single 80GB GPU or split across consumer cards)Install with ollama pull gpt-oss:20b or ollama pull gpt-oss:120b, then run with ollama run gpt-oss:20bBoth variants use MXFP4 quantisation at 4.25 bits per parameter and support 128K context windowsReleased by OpenAI as open-weight models in partnership with Ollama, comparable to Llama 3.1 and Qwen 2.5 in quality OpenAI released gpt-oss as open-weight models in August 2025, distributed exclusively through Ollama.<\/p>","protected":false},"author":1,"featured_media":2236,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[9],"tags":[],"class_list":["post-2235","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-tutorials"],"_links":{"self":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts\/2235","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/comments?post=2235"}],"version-history":[{"count":2,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts\/2235\/revisions"}],"predecessor-version":[{"id":2278,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts\/2235\/revisions\/2278"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/media\/2236"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/media?parent=2235"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/categories?post=2235"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/tags?post=2235"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}